Devlery
Blog/Anthropic

Claude Opus 5.5 출시, Fable 5.1급 성능에 값은 60% 아래인 이유

Anthropic이 9월 22일 Claude Opus 5.5를 공개했습니다. 입력 100만 토큰 4달러로 Fable 5.1의 10달러보다 60% 싸고, Terminal-Bench 4.0은 Opus 5의 52.3%에서 66.4%로 올랐습니다.

Claude Opus 5.5 출시, Fable 5.1급 성능에 값은 60% 아래인 이유
AI 요약
  • Opus 5.5는 입력 100만 토큰 4달러, Fable 5.1의 40%입니다.
  • Terminal-Bench 4.0은 Opus 5의 52.3%에서 66.4%로 올랐습니다.
  • 기본 effort가 high에서 medium으로 내려갔습니다.

Anthropic이 9월 22일 Claude Opus 5.5를 공개했습니다. 모델 ID는 claude-opus-5-5이고, 컨텍스트 100만 토큰과 최대 출력 12만 8천 토큰은 전작 Opus 5와 같습니다. 바뀐 것은 값입니다. 입력 100만 토큰이 5달러에서 4달러로, 출력이 25달러에서 20달러로 내려갔습니다.

발표문은 이 모델이 "대부분의 작업에서 Claude Fable 5.1 수준으로 동작한다"고 썼습니다. 3주 전에 나온 Fable 5.1은 입력 100만 토큰에 10달러, 출력에 50달러를 받습니다. 같은 일을 시키면 청구서가 40%로 줄어듭니다.

Opus 5보다 무엇이 나아졌나

가장 많이 오른 쪽은 에이전트 코딩입니다. 터미널에서 긴 작업을 끝까지 수행하는지 재는 Terminal-Bench 4.0에서 Opus 5.5는 66.4%를 받았습니다. Opus 5는 같은 시험에서 52.3%였습니다. 코드 편집기 안에서 오래 돌아가는 작업을 재는 CursorBench 4.0도 46.6%에서 57.8%로 올랐습니다.

발표문은 Opus 5, Fable 5.1, 그리고 OpenAI의 GPT-6 Astra를 같은 표에 놓았습니다. 여덟 종 가운데 여섯 종에서 Opus 5.5가 가장 높고, AutomationBench와 Terminal-Bench-Science 두 종은 GPT-6 Astra가 앞섭니다.

벤치마크Opus 5.5Opus 5Fable 5.1GPT-6 Astra
Terminal-Bench 4.0 (에이전트 코딩)66.4%52.3%55.8%57.9%
CursorBench 4.0 (편집기 내 장시간 작업)57.8%46.6%51.8%미제공
FrontierCode v1.154.4%48.0%50.3%53.3%
OSWorld 2.0 (컴퓨터 조작)81.8%74.0%80.7%미제공
AutomationBench (업무 자동화)40.0%26.9%31.4%41.4%
Terminal-Bench-Science 0.158.7%29.0%52.6%64.6%

속도도 올랐습니다. 발표문은 출력 생성이 Opus 5보다 30% 이상 빠르다고 밝혔습니다. 여기에 더해 Claude Code와 Claude Platform에서 쓸 수 있는 Fast mode가 최대 2.5배까지 속도를 올리는데, 값은 입력 8달러에 출력 40달러로 두 배입니다.

Anthropic이 직접 붙인 단서도 있습니다. 발표문은 "이 정도 능력 수준에서는 벤치마크 격차가 실제 차이를 가늠하는 지표로서 신뢰도가 떨어진다"고 적었고, 안전성 항목에서는 "Opus 5.5가 자기가 평가받고 있다고 의심하는 정황이 보인다"고 밝혔습니다. 점수표를 실제 성능 차이로 그대로 읽지 말라는 말을, 점수를 낸 쪽이 먼저 꺼냈습니다.

40% 절감은 어느 설정에서 나온 숫자인가

발표문의 비용 문장은 정확히 이렇습니다. "우리 테스트에서는 기본 설정에서 전형적 워크로드 기준 Opus 5보다 40% 적게 듭니다." 토큰 단가만 보면 20% 인하인데 40%가 나오는 이유는 두 가지입니다. 하나는 캐시 읽기 단가로, 100만 토큰당 0.50달러에서 0.20달러로 60% 내려갔습니다. 긴 에이전트 작업에서는 같은 파일과 같은 시스템 프롬프트를 계속 다시 읽기 때문에 캐시 읽기가 청구액의 대부분을 차지합니다. 다른 하나는 같은 일을 끝내는 데 쓰는 토큰 자체가 줄었다는 것입니다.

여기서 확인하고 넘어갈 설정이 하나 있습니다. effort는 Claude가 한 응답에 토큰을 얼마나 쓸지 정하는 값으로, low부터 medium, high, xhigh, max까지 다섯 단계입니다. 생각하는 분량만이 아니라 응답 텍스트 길이와 도구 호출 횟수까지 함께 움직입니다. 낮추면 도구를 덜 부르고 설명도 짧아집니다.

벤치마크 점수를 잰 설정
max effort

발표문 주석: "달리 명시하지 않는 한 모든 Claude Opus 5.5 결과는 max effort의 adaptive thinking을 사용합니다."

40% 절감을 잰 설정
medium effort

Opus 5.5의 기본값. Opus 5와 그 이전 Opus 모델의 기본값은 high였습니다.

기본값이 한 단계 내려간 것은 문서에 그대로 적혀 있습니다. 공식 effort 문서는 "대부분의 Claude 모델은 high가 기본값이고, Claude Opus 5.5는 medium이 기본값"이라고 쓰고, 마이그레이션 가이드는 "effort를 빼고 보내던 요청이 이제 medium으로 돌아간다"며 effort 값을 다시 측정하라고 권합니다. 모델 ID만 바꾸고 넘어가면, 값이 내려간 만큼 응답도 얕아진 상태로 운영에 나갈 수 있다는 뜻입니다.

그래서 두 숫자를 한 문장에 겹쳐 읽으면 안 됩니다. 66.4%는 max로 돌렸을 때 나온 점수이고, 40% 절감은 medium으로 돌렸을 때 나온 비용입니다. 같은 모델이지만 같은 실행이 아닙니다. devlery는 GPT-6 Astra의 ARC-AGI 점수가 측정 방식에 따라 갈린 건을 9월에 정리한 적이 있는데, 이번은 외부 검증자가 아니라 발표문 스스로가 조건을 밝혀 둔 경우입니다.

발표문에는 두 설정을 한 문장에 함께 담은 비교가 하나 있습니다. "기본 effort(medium)에서 Opus 5.5는 max effort의 GPT-6 Astra를 이기고, 과제당 비용은 5분의 1 수준입니다."

옮기기 전에 깨지는 것 네 가지

Opus 5에서 돌던 코드가 Opus 5.5에서 400 에러로 끊기는 경우가 네 가지 있습니다. 마이그레이션 가이드가 직접 열거한 목록입니다. 이 절은 API를 직접 호출하는 개발자에게만 해당하고, Claude 앱이나 Claude Code를 쓰는 독자는 해당하지 않습니다.

  1. thinking을 끌 수 없습니다. thinking: {"type": "disabled"}도, budget_tokens를 직접 지정하던 방식도 모두 400입니다. 토큰을 아끼려고 thinking을 껐던 자리에는 낮은 effort 값을 넣습니다.
  2. 도구 강제 호출이 사라졌습니다. tool_choiceanytool 타입이 400을 돌려줍니다. 토큰 카운팅 엔드포인트도 마찬가지입니다. auto에 strict tool use나 structured outputs를 함께 쓰고, 어느 상황에서 그 도구를 쓰라고 프롬프트에 적는 방식으로 바꿉니다. Fable 5.1에서 먼저 막힌 동작이 Opus 계열로 넘어온 것입니다.
  3. thinking 블록이 모델과 대화에 묶입니다. Opus 5.5가 만든 thinking 블록을 읽는 모델은 Fable 5.1과 Mythos 5.1뿐입니다. 라우터나 폴백이 대화를 다른 모델로 넘기면 그 턴은 thinking 없이 돌아갑니다. 2026년 8월 31일 이후에 만든 API 계정은 대화 중간을 편집한 뒤 thinking 블록을 다시 보내면 기본값이 400입니다. 모델의 추론을 뽑아내는 것을 막는 preserved thinking 장치입니다.
  4. computer use 도구 버전이 바뀝니다. Claude API와 Google Cloud에서 computer_20251124가 400을 돌려주고, computer_toolset_20260801 툴셋으로 바꿔야 합니다. 에이전트 루프도 함께 고쳐야 합니다. Amazon Bedrock에서는 기존 도구가 그대로 동작합니다.

에러는 안 나지만 화면이 달라지는 변화도 하나 있습니다. 도구 호출 사이에 모델이 쓰던 텍스트가 text 블록이 아니라 진행 상황용 thinking 블록으로 돌아오고, 기본 설정에서는 그 필드가 비어 있습니다. 그 텍스트를 "지금 무엇을 하는 중"이라고 사용자에게 보여주던 앱은 도구를 부르는 동안 화면이 조용해집니다. 복구하려면 thinking.display"updates""summarized"로 바꿔야 합니다.

지금 쓸 수 있나

한국에서 바로 씁니다. Anthropic의 지원 지역 정책 문서는 Claude API와 Claude.ai 양쪽 목록에 한국을 올려 두고 있습니다. 대기자 명단이나 별도 신청도 없습니다.

항목내용
대상Pro, Max, Team, 좌석 기반 Enterprise 구독자와 API 키를 가진 개발자
가격입력 100만 토큰 4달러 / 출력 20달러, 캐시 읽기 0.20달러. Fast mode는 8달러 / 40달러. Batch API 50% 할인
한국 사용가능. 지원 지역 목록에 포함
쓸 수 있는 곳Claude 앱, Claude Code, Claude API, AWS, Google Cloud, Microsoft Foundry
필요 조건없음. GitHub Copilot은 Pro+, Max, Business, Enterprise 대상이고 Business와 Enterprise는 관리자가 모델 정책에서 끄지 않았어야 함

GitHub Copilot 모델 선택 화면에서 Claude Opus 5.5가 선택된 모습

구독자 쪽 변화도 있습니다. 발표문은 Pro, Max, Team, 좌석 기반 Enterprise의 5시간 사용 한도를 올리고, 저장했다가 원할 때 쓰는 한도 리셋권을 준다고 밝혔습니다. 다만 인상 폭을 수치로 적지는 않았습니다. 9월 14일부터 Claude Code 주간 한도가 실질 17% 줄어든 지 8일 만에 나온 조정이라, 한도가 얼마나 돌아왔는지는 각자 쓰는 양으로 직접 재는 수밖에 없습니다.

발표문에서 논쟁을 부른 대목은 성능도 값도 아니었습니다. Anthropic은 "Opus 5.5는 프론티어 속도 조절을 주장한 이후 내놓는 첫 모델"이라고 적었는데, Hacker News 발표 스레드(898점, 댓글 667개)의 최상위 댓글은 속도를 늦추자면서 Fable 5.1 발표 21일 만에 상위 모델을 낸 것이 앞뒤가 맞지 않는다고 지적했습니다. 모델은 출시 전에 Frontier Design과 METR을 포함한 외부 평가자에게 검증을 받았습니다.

Opus 5로 돌아가는 코드가 있다면, 모델 ID를 바꾸면서 output_config.efforthigh로 명시한 버전과 기본값 그대로 둔 버전을 같은 작업에 한 번씩 돌려 보면 됩니다. 품질과 청구액이 거의 같으면 기본값으로 두고 40% 절감을 그대로 가져가고, 벌어지면 high를 박아 두는 쪽이 맞습니다. 이 비교를 건너뛰면 값이 내려간 것만 보고 응답이 얕아진 것은 못 보게 됩니다.