Devlery
Blog/Anthropic

Claude Sonnet 5.5 출시, Opus 5.5보다 값은 절반인데 max에서는 더 비싼 이유

Anthropic이 9월 28일 Claude Sonnet 5.5를 출시했습니다. 가격은 Sonnet 5와 같은 입력 100만 토큰 2달러이고, Terminal-Bench 4.0은 Sonnet 5의 10.3%에서 70.6%로 올라 Opus 5.5의 66.4%를 넘었습니다.

Claude Sonnet 5.5 출시, Opus 5.5보다 값은 절반인데 max에서는 더 비싼 이유
AI 요약
  • Terminal-Bench 4.0에서 70.6%, Opus 5.5의 66.4%보다 높습니다.
  • 가격은 Sonnet 5와 같은 입력 2달러, 출력 10달러입니다.
  • max effort로 돌리면 작업당 비용은 Opus 5.5보다 비쌉니다.

Anthropic이 9월 28일 Claude Sonnet 5.5(claude-sonnet-5-5)를 출시했습니다. 값은 Sonnet 5와 한 푼도 다르지 않습니다. 입력 100만 토큰 2달러, 출력 10달러입니다.

같은 날 Claude Code v2.1.284가 기본 모델을 Sonnet 5.5로 바꿨습니다. 6일 전인 9월 22일 v2.1.280이 기본값을 Opus 5.5로 올린 직후입니다. 이번 주에 Claude Code를 켠 사람은 세션 기본 모델이 두 번 바뀌는 것을 봤습니다.

Sonnet 5가 10.3%였던 시험에서 70.6%

가장 많이 오른 쪽은 에이전트 코딩입니다. Terminal-Bench 4.0은 터미널에서 긴 작업을 스스로 끝까지 밀고 가는지 재는 시험입니다. 여기서 Sonnet 5.5는 70.6%를 받았습니다. 같은 시험에서 Sonnet 5는 10.3%, 값이 두 배인 Opus 5.5는 66.4%였습니다. 값이 절반인 모델이 상위 모델보다 4.2%포인트 높은 점수를 받았습니다.

발표문의 점수는 모두 max effort 기준입니다. effort는 모델이 답을 내놓기 전에 얼마나 오래 따져볼지 정하는 다이얼로, low, medium, high, xhigh, max 다섯 단계가 있습니다.

벤치마크 (max effort)Sonnet 5.5Sonnet 5Opus 5.5
Terminal-Bench 4.0 (에이전트 코딩)70.6%10.3%66.4%
SWE-Bench Pro (버그 수정)81.3%63.2%89.9%
CursorBench 4.0 (편집기 내 장시간 작업)55.5%34.1%57.8%
OSWorld 2.1 (컴퓨터 조작)80.1%57.0%81.8%
AutomationBench (업무 자동화)44.7%10.7%42.5%
GDPval-AA v2.1 (지식 노동, Elo)184414491846
Humanity's Last Exam (도구 사용)64.5%54.9%67.7%
HealthBench Professional69.2%57.8%65.6%

여덟 종 가운데 Sonnet 5.5가 Opus 5.5를 앞선 것은 셋입니다. Terminal-Bench 4.0, AutomationBench, HealthBench Professional. 나머지 다섯 종은 Opus 5.5가 여전히 앞섭니다. 특히 실제 저장소의 버그를 고치는 SWE-Bench Pro는 81.3%와 89.9%로 8.6%포인트가 벌어져 있습니다. 반면 지식 노동 평가 GDPval-AA는 1844와 1846으로 2점 차이입니다.

속도도 올랐습니다. Anthropic은 출력 생성이 Sonnet 5보다 30% 이상 빠르다고 밝혔습니다. 고객사 측정치도 함께 공개했습니다. Box는 2.4배 빨라지고 토큰을 12% 덜 썼다고 했습니다. 코딩 도구 Lovable은 도구 호출이 3분의 1 줄고 셸 실행이 절반 가까이 줄었다고 보고했습니다. Base44가 118건의 빌드에서 잰 평균 반복 횟수는 Opus 5의 7.7회에서 3.6회로 내려갔습니다.

effort를 올리면 값이 뒤집힌다

목록 가격만 보면 Sonnet 5.5는 Opus 5.5의 정확히 절반입니다. 그런데 작업 하나를 끝내는 데 드는 값은 max effort에서 역전됩니다.

벤치마크 측정 기관 Artificial Analysis가 잰 수치를 보면 그렇습니다. max effort에서 Sonnet 5.5는 작업 하나당 출력 토큰 193K를 쓰고 7.60달러가 나왔습니다. 같은 조건에서 Opus 5.5는 119K를 쓰고 5.98달러였습니다. 토큰당 단가는 절반인데 토큰을 1.6배 쓰기 때문에 최종 청구액이 더 큽니다.

Sonnet 5.5 (max effort)
$7.60
작업당 비용

출력 토큰 193K · 단가 100만 토큰당 10달러

Opus 5.5 (max effort)
$5.98
작업당 비용

출력 토큰 119K · 단가 100만 토큰당 20달러

Anthropic 발표 페이지의 다이얼 이미지

Anthropic이 말한 "작업당 최대 30% 절감"이 틀린 것은 아닙니다. 다만 그 수치가 성립하는 구간이 low와 medium입니다. Claude Code와 Claude 앱의 기본 effort가 medium이고, Claude Platform(API)의 기본값이 high인 것도 이 때문으로 보입니다. Claude Code를 기본값 그대로 쓰는 독자는 절감 구간에 있습니다. 반대로 습관처럼 max를 올려 쓰던 독자는 같은 작업에 값을 더 냅니다.

Anthropic도 effort를 고르는 데 아직 정답이 없다고 인정합니다. 독립 검증도 아직입니다. 속도 30%와 절감 30%는 모두 Anthropic이 자체 측정해 발표한 수치이고, 외부 기관이 재현한 것은 위의 작업당 비용뿐입니다.

지금 쓸 수 있나

한국에서 바로 쓸 수 있습니다. 한국은 Anthropic의 상업 API 지원 국가와 Claude.ai 지원 국가 목록에 모두 들어 있습니다. 대기자 명단이나 신청 절차는 없습니다.

항목내용
대상

API 키를 가진 개발자, Claude 유료 요금제, Claude Code, GitHub Copilot Pro·Pro+·Max·Business·Enterprise

가격

입력 100만 토큰 2달러 / 출력 10달러 / 캐시 읽기 0.20달러 / 캐시 쓰기 2.50달러. Batch API는 50% 할인. Sonnet 5와 동일

한국 사용가능
필요 조건

없음. GitHub Copilot만 순차 배포이며, Business와 Enterprise는 관리자가 모델 정책에서 차단할 수 있습니다(기본은 허용)

플랫폼

Claude API, Amazon Bedrock(anthropic.claude-sonnet-5-5), Google Cloud, Microsoft Foundry

컨텍스트는 100만 토큰이고 추가 요금이 붙지 않습니다. 한 번에 내놓는 출력은 최대 128K, Batch API 베타에서는 300K입니다. 학습 데이터 기준일은 2026년 6월입니다. 같은 계열의 소형 모델 Haiku 5.5를 두고는 "앞으로 몇 주 안"이라고만 밝혔습니다.

옮기기 전에 깨지는 것

API를 직접 호출하는 코드는 그대로 두면 에러가 납니다. 마이그레이션 가이드가 짚은 변경점은 네 가지입니다.

가장 많이 걸릴 곳은 사고 과정을 끄는 설정입니다. 기존에 thinking을 disabled로 보내던 요청은 더 이상 동작하지 않습니다. high 이하 effort에서는 between_tools로 바꿔야 합니다.

{
  "model": "claude-sonnet-5-5",
  "thinking": { "type": "between_tools" },
  "effort": "medium"
}

나머지 셋은 범위가 좁습니다. tool_choice를 any나 tool로 지정해 도구 호출을 강제하던 요청은 400 에러를 받습니다. Fable 5.1에서 먼저 사라진 동작이 Sonnet 계열에도 적용됐습니다. Claude API와 Google Cloud에서는 구버전 컴퓨터 조작 도구 computer_20251124를 받지 않습니다. Advisor 도구는 Opus 4.8, Opus 4.7, Sonnet 5를 advisor로 지정하면 거부합니다.

안전 장치도 바뀌었습니다. Sonnet 계열로는 처음으로 Opus 5.5급 사이버보안 보호가 적용됐습니다. 위험도가 높다고 판단된 요청은 Sonnet 5로 넘겨 처리합니다. 증류 공격을 막는 분류기도 추가됐습니다. 증류 공격은 모델의 추론 과정을 빼내 다른 모델을 학습시키는 수법입니다.

Claude Code를 쓴다면 오늘 /model로 지금 어떤 모델과 effort에 있는지부터 확인해 봅니다. 이어서 평소 반복하는 작업 하나를 medium으로 돌려 세션 비용을 지난주 Opus 5.5 때와 비교하면 됩니다. 점수가 아쉽다고 max로 먼저 올리는 것은 이 비교 뒤로 미루는 편이 낫습니다. 작업당 비용이 뒤집히는 지점이 바로 거기이기 때문입니다.