[기획: AI 트렌드] 토큰 단가가 내려간 Claude Haiku 5.5, 같은 시험에 쓴 출력 토큰은 effort 설정에 따라 열 배 가까이 갈렸다
Anthropic이 매긴 가격표
AI 기업 Anthropic은 10월 7일 소형 언어모델 Claude Haiku 5.5를 내놓았습니다. 출시 당일부터 자사 API와 Amazon Bedrock, Google Cloud, Microsoft Foundry에서 쓸 수 있게 했습니다. API는 다른 프로그램이 모델을 불러 쓰는 통로이고, 개발자는 쓴 만큼 요금을 냅니다.
요금을 세는 단위는 토큰입니다. 토큰은 모델이 글을 읽고 쓸 때 잘게 잘라 세는 조각입니다. 모델에 보내는 요청 글(프롬프트)은 입력 토큰으로, 모델이 써 낸 답은 출력 토큰으로 셉니다. 택시 요금이 거리 단가에 달린 거리를 곱해 나오듯, API 청구서도 토큰 단가에 쓴 토큰 수를 곱해 나옵니다. 다만 출력 토큰의 단가가 입력 토큰보다 비쌉니다.
Anthropic은 Haiku 5.5의 단가를 프롬프트 길이에 따라 두 단으로 나눴습니다. 프롬프트가 10만 토큰 이하인 짧은 요청에는 토큰 100만 개당 입력 0.10달러, 출력 0.50달러를 매겼습니다. 전작 Haiku 4.5의 10분의 1입니다. 곱셈의 앞항인 단가는 그만큼 내려갔고, 뒤항인 토큰 수에 걸린 조건은 공지와 문서의 다른 줄에 있습니다.
평균 절감률에 달린 각주
Anthropic은 출시 공지 본문에 Haiku 5.5를 Haiku 4.5보다 평균 약 75% 싸게 돌릴 수 있다고 적었습니다. 근거는 각주에 있습니다. 토큰 단가로 짧은 요청은 90%, 그보다 긴 요청은 50% 낮고, Haiku 4.5로 들어온 요청의 90%가 짧은 요청이었다는 것입니다. 각주는 이 숫자들을 어떤 비중으로 섞어 평균을 냈는지까지는 적지 않았습니다. 다만 이 평균은 Haiku 4.5 사용자들의 요청 길이 분포를 전제로 낸 수치라, 긴 문서를 통째로 넣는 요청이 많으면 절감 폭은 이보다 작습니다.
모델이 한 번에 받아 읽을 수 있는 글의 양을 컨텍스트라고 합니다. Haiku 5.5의 컨텍스트는 100만 토큰입니다. 그런데 프롬프트가 10만 토큰을 넘으면 입력과 출력 단가가 모두 짧은 요청의 5배가 됩니다. Anthropic 가격 문서에 따르면 현행 Claude 모델 가운데 프롬프트 길이로 단가가 갈리는 모델은 Haiku 5.5 하나입니다. 나머지 모델에는 컨텍스트 전체에 한 가지 단가가 붙습니다.
같은 글이 더 많은 토큰으로 세어지기도 합니다. 글을 토큰으로 자르는 규칙을 토크나이저라고 하는데, Claude 4.7 이후 모델이 써 온 토크나이저가 Haiku 5.5에 들어왔습니다. Anthropic 문서에 따르면 같은 텍스트가 Haiku 4.5보다 약 30% 더 많은 토큰으로 세어지고, 늘어나는 폭은 글의 내용에 따라 다릅니다. 택시로 치면 같은 길을 달렸는데 미터기에 찍힌 거리가 늘어난 것과 같습니다. 출시 당일 개발자 Simon Willison이 자기 프롬프트 한 건으로 재 보니 약 1.25배였습니다. 표본은 하나지만 문서와 같은 방향입니다.
Anthropic은 이 변화를 두 곳에서 서로 다른 단위로 적었습니다. 문서의 「약 30%」는 같은 글을 셀 때의 증가이고, 공지 본문의 「과제당 토큰이 조금 더 많다(slightly more tokens per task)」는 과제 하나를 처리할 때의 증가입니다. 모델이 같은 일을 더 짧게 쓰면 두 표현은 함께 맞을 수 있습니다. Anthropic은 앞의 평균 절감률이 이 증가분까지 반영한 수치라고 밝혔습니다. 조건은 모두 적혀 있지만, 그것을 이어 붙여 내 요청에 맞춰 보는 일은 읽는 사람에게 남습니다.
Haiku급에 처음 붙은 effort 설정
Haiku 5.5에는 Haiku급 모델로는 처음으로 effort(노력 수준) 설정이 붙었습니다. effort는 모델이 토큰을 얼마나 들여 일을 처리할지 고르는 설정입니다. 중심은 모델이 답과 별도로 속으로 따져 보는 사고(추론, reasoning)의 양이지만, 답의 길이와 도구 사용 횟수에도 함께 작용합니다. 시험지 앞에서 쓰는 연습장과 비슷합니다. 연습장을 많이 쓸수록 맞히는 문제도 늘지만 드는 종이도 늘어납니다. 이 연습장에 쓴 토큰도 답과 같은 출력 단가로 청구되고, Haiku 5.5의 기본 설정에서는 그 내용이 사용자에게 보이지도 않습니다.
단계는 low·medium·high·xhigh·max로 나뉘고, 기본 설정은 medium입니다. Anthropic은 이 설정을 사용자가 비용과 성능 사이에서 고르는 장치로 설명합니다. 다만 effort는 정확한 토큰 예산이 아니라 방향을 알려 주는 신호이고, 실제로 몇 토큰을 쓸지는 모델이 정합니다. 전작 Haiku 4.5에서는 사용자가 사고에 쓸 토큰 예산을 숫자로 줄 수 있었고 기본값은 사고를 끈 상태였습니다. Haiku 5.5는 사고를 켠 상태가 기본입니다.
Anthropic은 공지에 벤치마크 점수 표를 실었습니다. 벤치마크는 여러 모델에 같은 과제를 풀게 해 점수를 견주는 시험입니다. Haiku 5.5의 대표 수치는 컴퓨터 조작 과제를 모은 OSWorld 2.1(오프라인 부분집합) 72.4%와 명령줄(터미널)에서 에이전트가 수행하는 과제를 모은 Terminal-Bench 4.0 39.2%입니다.
이 표에는 두 점수가 어느 effort 단계에서 나왔는지 적혀 있지 않습니다. 표에서 effort 단계가 표기된 수치는 Sonnet 5.5의 항목 하나뿐입니다. 한편 Anthropic은 같은 공지의 차트에 effort 단계별 점수를 그려, 단계마다 점수가 달라진다는 사실을 스스로 보여 줬습니다.
VentureBeat는 Anthropic의 차트를 인용해 그 Terminal-Bench 점수가 최고 단계 max의 결과라고 전했습니다. 같은 보도에 따르면 기본 설정 medium에서는 약 20%입니다. 이 보도대로라면 기본 설정으로 쓰는 사람에게 공지의 대표 수치는 그대로 들어맞지 않습니다.
Anthropic은 프롬프팅 가이드에 낮은 단계의 부작용도 적어 두었습니다. 대상은 AI가 여러 단계의 일을 스스로 이어 가며 처리하는 에이전트 작업입니다. 긴 에이전트 작업을 low로 돌리면 일을 일찍 끝내는 경향이 있다고 합니다. low와 medium에서는 검증 없이 완료를 보고하는 경우도 있다고 적었습니다. low에서 medium으로 올리면 일찍 끝내는 빈도가 약 절반으로 줄지만, 출력 토큰은 2배 이상 늘어납니다.
연습장을 더 쓰게 하면 답이 나아지고, 그만큼 종이도 더 듭니다. 사용자가 effort를 올리면 성능과 토큰 수가 함께 오릅니다.
Artificial Analysis가 단계마다 잰 과제당 토큰
독립 평가기관 Artificial Analysis(AA)는 출시에 맞춰 Haiku 5.5를 effort 단계마다 따로 잰 결과를 내놓았습니다. AA 지수는 이 기관이 여러 시험 결과를 묶어 매기는 종합 점수입니다. 원 페이지는 열지 못해 매체들이 옮긴 요약으로 확인한 수치입니다. 단계를 low에서 max로 올리는 동안 지수는 단계마다 올랐고, 측정에 쓴 출력 토큰은 열 배 가까이 늘었습니다.
| effort 단계 | AA 지수 | 출력 토큰(보도 수치) |
|---|---|---|
| low | 29 | 약 1만 7천 |
| medium(기본 설정) | 34 | 약 3만 3천 |
| high | 38 | 약 5만 5천 |
| xhigh | 41 | 약 8만 9천 |
| max | 43 | 약 16만 2천(그중 사고 약 12만 9천) |
| 비교: GPT-6 Luna | 38(단계 미표기) | 약 5만(max) |
출처 f11·f12(기본 설정 표기 f7) · Artificial Analysis 독립 측정 · 검색요약 경유(원 페이지 미열람) · 2026-10-07~08 보도 기준 · 보도는 출력 토큰을 과제 하나당으로 옮겼으나 원 페이지를 열지 못해 단위(과제당·지수 전체 환산)는 확인하지 못함 — 단계 사이의 상대 규모로 읽을 것 · Luna 지수의 effort 단계는 보도에 표기되지 않음 · Anthropic 공지의 벤치마크 점수와 다른 지표
max에서는 출력 토큰 대부분이 답과 별도인 사고에 쓰였습니다. 연습장이 답안보다 훨씬 두꺼웠습니다.
OpenAI의 소형 모델 GPT-6 Luna는 토큰 단가가 Haiku 5.5의 짧은 요청 단가와 같습니다. AA가 두 모델을 모두 max로 놓고 잰 비용은 Haiku 5.5가 Luna의 약 3배였습니다. 지수는 Haiku 5.5 max가 보도된 Luna 지수보다 높았지만(Luna 지수가 어느 단계에서 잰 것인지는 보도에 없습니다), 과제 하나에 쓴 출력 토큰도 훨씬 많았습니다. 단가가 같아도 실제 비용은 쓴 토큰 수에서 갈립니다.
이 차이는 양쪽 모두 최고 단계에서 잰 결과입니다. Haiku 5.5의 지수가 보도된 Luna 지수와 같아지는 high 단계에서는 출력 토큰도 Luna max와 비슷한 규모입니다. 다만 Luna의 그 지수가 max에서 잰 것인지는 확인하지 못했습니다. 몇 배 차이가 나는지는 어느 단계끼리 견주느냐에 따라 달라집니다.
AA는 출시 전 평가에서 답해도 되는 요청까지 모델이 거절하는 과잉 거절 버그를 짚었습니다. 버그를 고친 뒤 다시 돌리면 점수가 오를 수 있다고 밝혔으니, 표의 지수도 바뀔 수 있습니다.
우리는 토큰포칼립스는 오는가 — 토큰 단가는 급락하는데 추론비용은 어디로 가나에서 질의 하나의 비용을 「단가 × 질의당 소비량」으로 나눠 보고, 단가가 급락해도 소비량이 늘어나는 작업에서는 비용이 잘 내려오지 않는다고 봤습니다. Haiku 5.5에서는 사용자가 고르는 effort 단계가 그 소비량을 크게 움직이는데, 그 단계 안에서 실제로 몇 토큰을 쓸지는 모델이 정합니다.
비교할 것은 토큰당 가격이 아니라 과제당 비용입니다
Anthropic은 Haiku 5.5를 요약·분류·데이터베이스 질의처럼 같은 일을 대량으로 되풀이하는 작업에 권했습니다. 코딩에서는 Opus 5.5나 Sonnet 5.5가 나눠 준 일을 맡는 하위 에이전트로 쓰라고 했습니다. 복잡한 에이전트 코딩에는 그 두 모델이 낫다고도 적었습니다.
이런 작업 가운데 프롬프트가 짧고 낮은 단계로 충분한 일이라면, 단가 인하 폭이 가장 큰 조건과 토큰이 가장 적게 드는 단계가 겹칩니다. 같은 모델이라도 무엇에 쓰느냐에 따라 드는 비용이 달라집니다.
이 모델의 가격을 볼 때 확인할 것은 이렇습니다.
- 요청 길이. 내 프롬프트가 10만 토큰 안쪽인지 봅니다. 넘으면 그 요청 전체의 단가 구간이 바뀝니다. 길이는 새 토크나이저로 세고, 캐시에서 읽어 온 부분까지 포함합니다. 대화를 쌓아 가며 매번 다시 보내는 에이전트 작업은 도중에 이 문턱을 넘을 수 있습니다.
- 측정 단계. 성능 수치가 어느 effort 단계에서 잰 것인지 봅니다. 공지의 대표 수치에는 단계가 적혀 있지 않습니다.
- 과제당 비용. 같은 과제를 내 설정으로 돌렸을 때 든 토큰과 비용을 봅니다. 토크나이저가 바뀌어 전작의 토큰 수를 그대로 옮겨 쓸 수 없습니다.
이번 출시의 헤드라인은 토큰당 가격이었습니다. 전작의 10분의 1이라는 숫자입니다. 그런데 그 숫자를 설명하는 쪽은 모두 다른 단위를 썼습니다. Anthropic의 평균 절감률은 늘어난 토큰까지 반영한 요청 단위의 수치였고, 공지 본문은 토크나이저 차이를 「과제당 토큰」으로 적었으며, AA는 같은 측정을 돌리는 데 든 비용으로 두 모델을 견줬습니다. 토큰 단가가 같은 두 소형 모델의 차이도 그 비용에서 드러났습니다. 그래서 우리는 이번 출시가 토큰 단가만으로는 소형 모델의 값을 견줄 수 없다는 것을 보여 줬다고 봅니다. 같은 모델 안에서도 effort 단계에 따라 쓰는 토큰이 열 배 가까이 갈리기 때문입니다. Haiku 5.5의 토큰 단가는 Anthropic이 정했습니다. 청구서의 나머지 절반은 사용자가 고른 단계와, 그 단계 안에서 모델이 쓴 토큰이 정합니다.
유의
루틴 3회차 · 원문 직접 열람 = Anthropic 공지·platform.claude.com 문서뿐(f1~f9·f15~f18·f21~f23) · AA 수치(f11~f13·f20) 원 페이지 미열람·검색요약 경유·단위(과제당/지수 전체) 미확정 → 캡션·본문 배수로 처리 · 델타 R2 should-fix S1 미반영(L37 절 제목·L54 「과제당」 단위 잔재 — 경계 사례·바인딩 유지) · nit 4 미반영 · insight·prism 비소환(루틴 로스터) · planner·reviser 메인 수행(스폰 상한 8) · 분량 raw 약 16.5KB(감각 상단 초과 — 판정 축 아님) · 출처 절 「계산법」 잔재(본문은 「근거」) · pm 가장 약한 고리 = 절 제목 「과제당」 단정 vs 캡션 단위 유보출처
- 기준일 = 2026년 10월 9일 오전(한국 시간).
- 이번 정리에서 우리가 직접 연 원문은 Anthropic의 Claude Haiku 5.5 출시 공지와 Claude 개발자 문서(모델 개요·새 기능·가격·프롬프팅 가이드·effort·사고)입니다. Artificial Analysis의 측정 페이지와 각 매체 기사는 원문을 열지 못했고, 검색 결과에 실린 요약을 거쳐 확인했습니다. 여러 매체가 전한 Artificial Analysis 수치는 모두 Artificial Analysis 한 곳의 측정을 옮긴 것이고, 그 단위(과제당인지 측정 전체의 환산인지)는 원 페이지로 확인하지 못했습니다. 벤치마크의 시도 횟수와 실행 환경이 적힌 Anthropic 시스템 카드는 열지 못했습니다.
- 이해관계: Refract는 글을 분석하고 쓰는 엔진으로 Anthropic의 Claude를 씁니다. Anthropic은 이 글이 다루는 모델의 제조사입니다.
- 출시일·제공처·단가·「평균 약 75%」와 각주의 계산법·effort 설정·대표 벤치마크 점수와 effort 표기·권장 용도(2026-10-07) — 직접 열람 Anthropic, Claude Haiku 5.5 공지
- 컨텍스트 100만 토큰 — 직접 열람 Claude Haiku 5.5 모델 개요
- 새 토크나이저(같은 텍스트가 약 30% 더 많은 토큰) — 직접 열람 Claude Haiku 5.5 새 기능
- 프롬프트 길이에 따른 두 단 단가·길이별 단가는 현행 Claude 가운데 Haiku 5.5에만 적용·문턱 판정에 캐시 포함·토크나이저 공통 적용 범위 — 직접 열람 Claude 가격 문서
- effort는 토큰 예산이 아닌 신호·응답 전체 토큰에 작용·Haiku 4.5의 사고 예산과 기본값 — 직접 열람 effort 문서 · 사고 문서
- 사고 토큰의 출력 단가 과금·기본 표시 생략 — 직접 열람 사고 문서
- effort 단계·기본 설정·낮은 단계의 부작용 — 직접 열람 Claude Haiku 5.5 프롬프팅 가이드
- 단계별 AA 지수·출력 토큰·측정 비용·과잉 거절 버그와 재측정 시 상향 가능성(2026-10-07~08) — Artificial Analysis 독립 측정, 원 페이지 미열람, 검색 요약 경유 Artificial Analysis · Neowin · The Decoder
- Terminal-Bench 점수의 effort 단계(max)와 medium 약 20%(2026-10-07) — 보도(단일), Anthropic 차트 인용, 검색 요약 경유 VentureBeat
- 개발자 한 사람이 프롬프트 한 건으로 잰 토큰 증가(표본 1건) — 검색 요약 경유 Simon Willison
- 배경: GPT-6 Luna의 토큰 단가(2026년 9월 하순 출시) — 검색 요약 경유 TechCrunch