Devlery
Blog/Anthropic

Claude Haiku 5.5 출시, 토큰값 90% 인하는 10만 토큰 아래에서만

Anthropic이 10월 7일 Claude Haiku 5.5를 출시했습니다. 입력 100만 토큰 0.10달러로 Haiku 4.5의 10분의 1이지만, 프롬프트가 10만 토큰을 넘으면 0.50달러로 5배가 됩니다.

Claude Haiku 5.5 출시, 토큰값 90% 인하는 10만 토큰 아래에서만
AI 요약
  • Terminal-Bench 4.0에서 39.2%, Haiku 4.5는 0.0%였습니다.
  • 입력 0.10달러인데 프롬프트가 10만 토큰을 넘으면 0.50달러입니다.
  • Haiku 4.5의 수명 보장은 10월 15일에 끝납니다.

Anthropic이 10월 7일 Claude Haiku 5.5(claude-haiku-5-5)를 출시했습니다. Haiku는 Claude 모델 가운데 가장 작고 값이 싼 등급입니다. 긴 글을 짧게 줄이거나 들어온 문서를 종류별로 나누는 것처럼, 깊이 따질 필요는 없지만 양이 많은 일을 맡습니다.

Anthropic이 공식 계정에 올린 문구는 "지금까지 내놓은 소형 모델 중 가장 싸고 빠르고 유능하다"입니다. 입력 100만 토큰 0.10달러, 출력 0.50달러입니다. 전작 Haiku 4.5의 1.00달러와 5.00달러에서 10분의 1로 내려갔습니다. 그런데 이 단가는 프롬프트가 10만 토큰을 넘지 않는 요청에만 붙습니다. 넘으면 각각 0.50달러와 2.50달러로 5배가 됩니다.

Haiku 4.5가 0.0%였던 시험에서 39.2%

값 이야기는 뒤로 미루고, 이 모델이 전작보다 무엇을 더 하는지부터 봅니다. 발표 페이지의 공식 표에서 가장 크게 벌어진 항목은 에이전트 코딩입니다.

Terminal-Bench 4.0은 터미널에서 긴 작업을 스스로 끝까지 밀고 가는지 재는 시험입니다. Haiku 5.5는 39.2%를 받았고, 같은 시험에서 Haiku 4.5는 0.0%였습니다. 0%는 측정 실패가 아니라 한 과제도 끝내지 못했다는 뜻입니다. 그러니까 지금까지 Haiku 등급은 코딩 에이전트의 선택지가 아니었고, 이번에 처음으로 후보에 올랐습니다. OpenAI의 소형 모델 GPT-6 Luna는 같은 시험에서 16.4%입니다.

0.0% → 39.2%
Terminal-Bench 4.0 (에이전트 코딩)
15.7% → 72.4%
OSWorld 2.1 오프라인 부분 (컴퓨터 조작)
735 → 1620
GDPval-AA v2.1 Elo (지식 노동)

컴퓨터를 직접 조작하는 능력에서도 격차가 큽니다. OSWorld 2.1 오프라인 부분에서 72.4%로, Haiku 4.5의 15.7%와 GPT-6 Luna의 48.9%보다 높습니다. 한 등급 위인 Sonnet 5.5는 83.9%이고 Terminal-Bench에서는 70.6%입니다. 발표 페이지도 Terminal-Bench 급 복잡한 에이전트 코딩에는 Sonnet 5.5와 Opus 5.5가 낫다고 적어 뒀습니다. Haiku 5.5가 대신하는 것은 상위 모델이 아니라 Haiku 4.5입니다.

벤치마크Haiku 5.5Haiku 4.5GPT-6 LunaSonnet 5.5
Terminal-Bench 4.039.2%0.0%16.4%70.6%
OSWorld 2.1 (오프라인)72.4%15.7%48.9%83.9%
Humanity's Last Exam (도구 사용)57.4%18.7%미공개64.5%
Chartography (도구 없음)46.4%6.4%29.1%61.6%

Haiku 등급에 처음으로 effort 다이얼이 붙었습니다. effort는 모델이 답을 내놓기 전에 얼마나 오래 따져볼지 정하는 설정으로 low부터 max까지 다섯 단계이고, Haiku 5.5의 기본값은 medium입니다. Sonnet 5.5는 effort를 max로 올리면 작업당 비용이 상위 모델을 넘어서는 구간이 있었는데, 같은 계산을 Haiku에서도 하게 됐습니다.

독립 기관 측정치도 하나 나왔습니다. Artificial Analysis는 high effort 기준으로 지능 지수 38점(182개 모델 중 10위), 출력 속도 초당 136.6토큰(동급 중위값 110.9토큰)을 기록했습니다. 그런데 첫 토큰이 나오기까지는 26.15초가 걸렸고, 동급 추론 모델 중위값은 2.17초입니다. Anthropic이 말한 "가장 빠르다"는 토큰을 뱉는 속도입니다. 생각을 시작해 첫 글자가 나올 때까지는 effort 설정에 따라 늘어납니다. 실시간 고객 응대처럼 체감 지연이 중요한 곳에 넣으려면 effort를 낮춰 다시 재야 합니다.

10만 토큰을 넘으면 단가가 5배

100만 토큰당Haiku 5.5 (10만 이하)Haiku 5.5 (10만 초과)Haiku 4.5
입력0.10달러0.50달러1.00달러
출력0.50달러2.50달러5.00달러
캐시 읽기0.01달러0.05달러0.10달러
배치 입력0.05달러0.25달러0.50달러

프롬프트 길이로 단가를 가르는 모델은 현재 Claude 라인업에서 Haiku 5.5 하나입니다. 가격 문서에는 "Claude 4.6 이후 모델(Claude Haiku 5.5 제외)은 100만 토큰 컨텍스트 전체를 표준 단가로 제공한다"고 적혀 있고, 괄호로 "90만 토큰 요청도 9천 토큰 요청과 같은 단가로 과금된다"는 설명이 붙습니다. Fable 5.1, Opus 5.5, Sonnet 5.5는 프롬프트가 아무리 길어도 단가가 그대로인데, Haiku 5.5만 10만 토큰에서 계단이 생깁니다.

경계선은 숫자로 보이는 것보다 가깝습니다. Haiku 5.5는 Sonnet 5.5와 Opus 5.5가 쓰는 새 토크나이저를 함께 쓰는데, 가격 문서는 이 토크나이저가 같은 글을 약 30% 더 많은 토큰으로 센다고 밝혔습니다. Haiku 4.5는 이전 토크나이저를 씁니다. 그래서 Haiku 4.5에서 7만 7천 토큰으로 세던 분량이 Haiku 5.5에서는 10만 토큰을 넘습니다.

같은 분량의 글 1건

↓
Haiku 4.5 (이전 토크나이저)
77,000 토큰
100만 토큰당 1.00달러
Haiku 5.5 (새 토크나이저)
약 100,000 토큰
경계를 넘으면 0.50달러

같은 글 1건을 처리하는 비용으로 다시 계산하면 인하폭이 달라집니다. 짧은 밴드에서는 1.00달러가 0.13달러(0.10달러에 토큰 1.30배)로 떨어져 87% 인하입니다. 긴 밴드로 가면 0.65달러까지만 내려가 인하폭이 35%에 그칩니다. Anthropic이 홍보에 쓴 90%와 자기 각주의 "평균 약 75%"가 갈리는 것도 이 때문입니다. 각주는 그 수치가 토큰 증가를 반영한 값이라고 못 박았습니다.

그런데 Anthropic이 권하는 용도가 하필 이 경계에 걸칩니다. 발표 페이지가 꼽은 Haiku 5.5의 쓸 자리는 요약, 분류, 데이터베이스 질의, 그리고 컨텍스트 압축입니다. 컨텍스트 압축은 대화가 모델이 담을 수 있는 양을 넘겼을 때 앞부분을 요약해 자리를 비우는 작업이고, Claude API가 요청 시 압축으로 제공하는 기능이 그것입니다. 압축의 입력은 압축해야 할 긴 대화 자체이므로 이 용도는 구조상 긴 밴드에 들어갑니다. 저장소 파일을 여러 개 읽는 서브에이전트도 10만 토큰을 금방 넘깁니다. 10분의 1 단가를 그대로 받는 일감은 티켓 분류나 공시 문서에서 수치 하나를 뽑는 것처럼 프롬프트가 작은 작업입니다.

발표 페이지는 Haiku 4.5 요청의 약 90%가 짧은 밴드에 들어갔다고 밝혔습니다. 자기 워크로드가 그 90% 안에 있는지는 평균이 아니라 토큰 분포를 봐야 알 수 있습니다.

Sonnet 5.5에도 같은 날 변화가 있었습니다. 캐시 읽기 단가가 100만 토큰 0.20달러에서 0.10달러로 반값이 됐습니다. 긴 시스템 프롬프트를 캐시에 올려 쓰는 팀은 모델을 바꾸지 않아도 이 인하를 받습니다.

지금 쓸 수 있나

조건내용
대상API 키를 가진 개발자, Claude Code 사용자
플랫폼Claude API, Amazon Bedrock, Google Cloud, Microsoft Foundry, Claude Platform on AWS
모델 IDclaude-haiku-5-5 (Bedrock은 anthropic.claude-haiku-5-5)
가격100만 토큰 입력 0.10달러부터, 10만 토큰 초과는 0.50달러
필요 조건없음. 대기자 명단, 베타 신청, 관리자 승인, 검증 프로그램 모두 해당 없음
한국 사용가능. 단 Bedrock 지리 프로필에 한국이 없음

한국에서 바로 쓸 수 있습니다. Claude API는 지역을 가리지 않고 열려 있어서 API 키만 있으면 호출됩니다. 컨텍스트 윈도는 100만 토큰, 최대 출력은 12만 8천 토큰, 신뢰 지식 기준일은 2026년 6월입니다.

추론을 특정 지역 안에 묶어야 하는 조건이면 이야기가 달라집니다. AWS 머신러닝 블로그에 따르면 Bedrock에서 Haiku 5.5를 부르는 지리 추론 프로필은 US, EU, AU, JP, 글로벌 다섯 개입니다. 한국 프로필이 없습니다. 서울 리전 밖으로 데이터를 내보내지 않는 조건을 요구하는 금융·의료 업종이라면 Haiku 5.5는 지금 그 선택지에 없습니다. 가장 가까운 것이 일본과 호주입니다. Claude API에서 추론을 미국으로 묶는 inference_geo: "us"를 쓰면 전 과금 항목에 1.1배가 붙습니다.

전작을 그대로 쓰는 팀에는 날짜가 하나 걸려 있습니다. 폐기 문서는 claude-haiku-4-5-20251001을 아직 Active로 두고 있지만, 잠정 종료일을 "2026년 10월 15일보다 이르지 않음"으로 적어 뒀습니다. 이 날짜는 종료일이 아니라 Anthropic이 유지를 약속한 기간의 끝입니다. 8일 뒤부터는 폐기 공지가 언제든 나올 수 있고, 공지가 나오면 최소 60일 뒤 종료됩니다. 직전 사례가 Sonnet 4.5입니다. 9월 30일에 공지가 나가고 종료일은 11월 30일로 정해졌습니다.

지금 Haiku 4.5로 돌리는 파이프라인이 있다면, 모델 ID를 바꾸기 전에 프롬프트가 어느 밴드에 떨어지는지부터 세어 보는 게 순서입니다. 토큰 세기 엔드포인트(POST /v1/messages/count_tokens)는 model로 넘긴 모델의 토크나이저로 세고, 호출 자체는 무료입니다. 실제 프롬프트 표본을 claude-haiku-4-5-20251001과 claude-haiku-5-5로 각각 넣어 input_tokens 두 값을 비교하면 됩니다. Anthropic 문서도 마이그레이션 때 이 방법을 권합니다. 10만 토큰을 넘는 요청의 비율이 나오면 월 청구서가 87% 내려갈지 35% 내려갈지가 정해지고, 그 숫자를 쥐고 옮기면 10월 15일 이후 폐기 공지가 떴을 때 60일을 쪼개 쓰지 않아도 됩니다.