Devlery
Blog/Anthropic

Claude Fable 5.1이 바꾼 것, 코딩 42%에서 55.8%로 오르고 도구 강제 호출은 400 에러

Anthropic이 9월 1일 Claude Fable 5.1과 Mythos 5.1을 공개했습니다. 에이전트 코딩은 Fable 5의 42.0%에서 55.8%로 올랐고, 대화 중간 effort 변경이 새로 열렸으며, 캐시 읽기 단가는 4분의 1이 됐습니다.

Claude Fable 5.1이 바꾼 것, 코딩 42%에서 55.8%로 오르고 도구 강제 호출은 400 에러
AI 요약
  • 에이전트 코딩 벤치마크가 Fable 5의 42.0%에서 55.8%로 올랐습니다.
  • 대화 중간 effort 변경이 열렸고, 캐시 읽기 단가는 4분의 1이 됐습니다.
  • 도구 강제 호출은 이제 400 에러라, 옮기기 전 코드를 봐야 합니다.

Anthropic이 2026년 9월 1일 Claude Fable 5.1과 Claude Mythos 5.1을 공개했습니다. Fable 5.1은 Claude API를 쓰는 모든 고객에게 모델 ID claude-fable-5-1로 열렸고, Mythos 5.1은 미국 조직 대상 프로그램인 Project Glasswing 참가자만 씁니다. Hacker News 발표 스레드에는 648점과 댓글 604개가 달렸습니다.

6월에 공개된 Fable 5에서 무엇이 달라졌는지를 순서대로 정리합니다. 크게 네 갈래입니다. 능력이 벤치마크 9종 전부에서 올랐고, API에 다섯 가지가 새로 생겼고, 캐시 읽기 단가가 4분의 1이 됐고, 옮길 때 400 오류로 끊기는 동작이 셋 있습니다. 컨텍스트 창 100만 토큰, 최대 출력 12만 8천 토큰, 토크나이저는 Fable 5와 같습니다.

능력: 벤치마크 9종이 모두 올랐습니다

플랫폼 문서는 향상이 몰린 영역을 여섯 개로 꼽습니다.

  • 긴 세션의 에이전트 코딩. 여러 파일에 걸친 기능 추가, 대규모 리팩터링과 마이그레이션, 디버깅, 몇 시간씩 이어지는 코드 리뷰입니다.
  • 문서·스프레드시트·슬라이드 작업. 첫 질문에서 시작해 완성된 문서, 수식이 살아 있는 스프레드시트, 빈 화면에서 만든 슬라이드까지 끌고 갑니다.
  • 리서치와 검색. 찾은 것을 다시 파고드는 다단계 웹 리서치의 정확도가 올랐습니다.
  • 비전. PDF 안에 겹겹이 들어간 조밀한 차트와 표, 공시 서류를 읽습니다. 차트는 잘라서 확대해 보는 도구까지 씁니다.
  • 롱컨텍스트. 100만 토큰 전체를 오가며 흩어진 사실을 연결합니다.
  • 컴퓨터 사용. 브라우저와 데스크톱 앱을 조작하다 실패한 단계에서 복구합니다.

다국어 성능은 Fable 5와 같은 수준이라고 적혀 있습니다.

문서가 덧붙인 조건이 하나 있습니다. 차이는 effort 값이 높을수록 벌어집니다. 비용을 아끼려고 낮은 effort로만 돌리는 파이프라인이라면 이번 향상이 거의 안 보일 수 있다는 뜻입니다.

수치로는 발표문이 벤치마크 9종에서 Fable 5.1과 전작 Fable 5, 그리고 문서가 기본 시작점으로 권하는 Claude Opus 5를 같은 표에 놓았습니다. 9종 전부에서 Fable 5.1이 두 모델보다 높습니다. 가장 크게 오른 둘은 한 번에 오래 돌아가는 작업입니다. 터미널에서 연구 과제를 끝까지 수행하는 Terminal-Bench-Science 0.1이 24.7%에서 52.6%로 두 배 넘게 올랐고, 업무 워크플로우를 자동화하는 AutomationBench가 17.1%에서 31.4%로 올랐습니다. 개발자에게 가장 익숙한 에이전트 코딩 벤치마크 Terminal-Bench 4.0은 42.0%에서 55.8%가 됐습니다.

벤치마크Fable 5.1Fable 5Opus 5
Terminal-Bench-Science 0.1 (에이전트 연구)52.6%24.7%29.0%
Terminal-Bench 4.0 (에이전트 코딩)55.8%42.0%52.3%
AutomationBench (업무 워크플로우)31.4%17.1%26.9%
CursorBench 3.2.0 (에이전트 코딩)73.4%70.5%70.0%
OSWorld 2.0 strict (컴퓨터 사용)41.7%36.1%39.6%
OSWorld 2.0 partial (컴퓨터 사용)77.9%72.9%75.4%
GDPval-AA v2 (지식 노동)185317231824
Humanity's Last Exam (도구 없음)60.9%57.8%56.6%
Humanity's Last Exam (도구 있음)65.0%63.8%63.6%

안전장치가 더 느슨한 Mythos 5.1은 같은 Terminal-Bench 4.0에서 60.9%입니다. 두 모델은 같은 기반 모델이고, 점수 차이는 사이버 영역 안전 분류기가 개입하는 작업에서 벌어집니다.

속도에도 숫자가 붙었습니다. 발표문은 외부 파트너의 사전 테스트를 인용해 Fable 5.1이 Opus 5보다 약 2배 빠르고 토큰은 절반을 썼다고 밝혔습니다. 여기서 비교 대상은 전작 Fable 5가 아니라 Opus 5입니다. Claude Code에서는 사이버보안 관련 오탐이 약 60% 줄었습니다. 보안 코드를 다루다 거절당하던 작업이 그만큼 통과한다는 뜻입니다. 다만 이 벤치마크와 파트너 인용은 모두 Anthropic이 고른 것이고, 발표 하루가 지난 지금 독립 기관의 재현 평가는 아직 없습니다.

API에 새로 생긴 다섯 가지

문서는 Fable 5에 없던 항목을 다섯 개로 정리했습니다. 셋은 베타 헤더가 필요한 API 기능이고, 하나는 가격, 하나는 출력물 표시입니다.

첫째, 대화 도중에 사고 강도를 바꿀 수 있습니다. effort 값을 대화 중간에 올리거나 내려도 그때까지 쌓은 프롬프트 캐시가 무효가 되지 않습니다. 어려운 단계만 값을 올리고 반복 작업은 내리는 식으로 한 세션 안에서 조절합니다. 베타 헤더 mid-conversation-output-config-2026-07-01이 필요하고, Fable 5.1과 Mythos 5.1, Opus 5가 지원합니다.

둘째, 한 턴만 살아 있는 시스템 메시지가 생겼습니다. role: "system" 메시지에 clear_at: "next_user_message"를 붙이면 그 턴에서는 시스템 프롬프트의 권한으로 작동하고, 다음 사용자 메시지가 들어오면 렌더링에서 빠집니다. 메시지는 messages 배열에 그대로 남겨 계속 보내므로 앞의 기록이 바뀌지 않고, 지워진 메시지에는 입력 토큰이 붙지 않습니다. 도구 반복문에서 "코드를 더 돌리기 전에 받은 결과부터 확인하라" 같은 턴별 리마인더를 넣었다 지우던 코드를 이걸로 대체하라는 것이 문서의 안내입니다. 베타 헤더는 mid-conversation-system-clear-at-2026-08-21입니다.

셋째, 도구 호출 사이의 진행 상황을 텍스트로 받을 수 있습니다. 모델은 도구를 부르기 직전에 무엇을 찾았고 다음에 무엇을 할지를 짧게 씁니다. 기본값 thinking.display: "omitted"에서는 이 블록이 비어서 오기 때문에, 오래 걸리는 에이전트 턴이 사용자 화면에서는 아무 일도 안 하는 것처럼 보입니다. display: "updates"로 두면 사고 과정은 감춘 채 이 진행 상황만 텍스트로 받습니다. 베타 헤더는 thinking-display-updates-2026-08-18입니다.

넷째, 캐시 읽기 단가가 내려갔습니다. 다음 절에서 따로 봅니다.

다섯째, 출력물에 출처 표시가 붙습니다. 텍스트에는 8월 2일 이후 출시 모델에 적용된 통계적 워터마크가 들어가고, 코드 실행 도구 같은 경로로 만든 이미지와 영상을 Files API로 받으면 C2PA Content Credentials 서명이 붙습니다. 문서는 워터마크가 토큰을 늘리거나 숨은 문자를 넣지 않으며 사용자나 조직 정보를 담지 않는다고 밝혔습니다. 그 워터마크를 읽는 탐지 API는 이번에 비공개 프리뷰로 열렸는데 대상이 규제기관, 법 집행기관, 언론, 팩트체커, 독립 연구자, 교육기관, EU 시민사회 단체로 한정돼 일반 개발자는 아직 자기 출력물을 직접 확인할 수 없습니다.

앞의 셋은 모두 messages를 직접 만드는 개발자에게만 해당합니다. Claude Code나 claude.ai를 쓰는 독자가 켤 수 있는 설정이 아닙니다.

값은 캐시 읽기 하나만 내렸습니다

여러 매체가 "최대 45% 저렴"을 헤드라인으로 뽑았습니다. 플랫폼 문서의 가격 표를 열어 보면 기본 입력 100만 토큰 10달러, 출력 50달러로 Fable 5와 숫자가 같습니다. 내려간 항목은 캐시 읽기 하나입니다.

캐시 읽기가 무엇인지부터 짚습니다. 긴 대화나 에이전트 세션은 요청할 때마다 앞부분을 통째로 다시 보냅니다. 시스템 프롬프트, 도구 정의, 지금까지 오간 기록입니다. 프롬프트 캐시는 그 앞부분을 서버에 저장해 두고 다음 요청에서 다시 씁니다. 다시 쓴 토큰에 매기는 값이 캐시 읽기 단가입니다. 다른 Claude 모델은 이 값이 기본 입력의 0.1배인데 Fable 5.1과 Mythos 5.1은 0.025배입니다. 기본 입력이 10달러이므로 100만 토큰에 1달러 하던 것이 0.25달러가 됩니다.

$10
기본 입력 100만 토큰, Fable 5와 동일
$1 → $0.25
캐시 읽기 100만 토큰, 유일하게 바뀐 항목
$50
출력 100만 토큰, Fable 5와 동일

발표문은 절감폭을 두 갈래로 적었습니다. 일반적인 작업은 Fable 5보다 약 25%, 복잡한 코딩과 에이전트 작업은 최대 약 45%입니다. 두 숫자의 차이는 계산해 보면 바로 나옵니다. 절감폭은 전체 입력 토큰 가운데 캐시에서 읽힌 비중에 정비례합니다. 같은 앞부분을 수십 번 다시 읽는 긴 에이전트 세션이 45%에 가까워지고, 매번 새 프롬프트를 보내는 일회성 호출은 절감이 0입니다. 캐시 쓰기 단가는 5분 12.50달러와 1시간 20달러 그대로이고, 캐시에 올릴 수 있는 최소 길이도 512토큰으로 같습니다. 배치 처리는 입력 5달러, 출력 25달러입니다.

코드를 안 고쳐도 결과가 달라지는 일곱 가지

문서가 「Changed from Claude Fable 5」로 묶은 항목입니다. 모델 ID만 바꿔도 결과물의 성격이 달라지는 것들이고, 문서는 각 항목에 프롬프트로 되돌리는 방법을 함께 붙였습니다.

  • 병렬 도구 호출이 줄었습니다. Fable 5가 독립적인 읽기 작업을 여러 개 묶어 부르던 자리에서 턴당 하나씩만 부르는 경우가 있습니다. 답변 품질은 안 떨어지지만 왕복 횟수와 토큰, 걸리는 시간이 늘어납니다. 직접 만든 코딩 에이전트, 명령줄과 편집기를 오가는 구조, 컴퓨터 사용에서 두드러집니다. 문서는 독립 호출을 묶으라는 한 줄을 프롬프트에 넣으라고 안내합니다.
  • 작은 수정에도 파일 전체를 다시 씁니다. 결과는 대체로 같지만 출력 토큰과 시간이 더 듭니다. 출력은 100만 토큰에 50달러입니다.
  • 긴 도구 실행 중 진행 보고가 줄었습니다. effort가 높을수록 더 적어집니다. 앞에서 본 display: "updates"가 이 항목의 대응책입니다.
  • low effort에서 검색을 덜 부릅니다. 최신 정보가 필요한 턴은 effort를 올리라는 것이 문서의 안내입니다.
  • 산문이 조밀해졌습니다. 문장이 길어지고 문단 나눔이 줄었습니다.
  • 채팅에서 볼드와 헤더, 목록을 덜 씁니다. 이전 모델을 기준으로 써 둔 "형식을 쓰지 말라"는 지시가 이제는 필요한 구조까지 눌러 버릴 수 있습니다.
  • 요약할 때 원문 구절을 인용 표시 없이 옮기는 경우가 늘었습니다. 요약본을 그대로 외부에 내보내는 파이프라인이라면 인용 표시를 따로 확인해야 합니다.

이 목록은 문서가 마이그레이션용으로 모은 것이라 나빠진 것만 담고 있습니다. 앞에서 본 벤치마크 상승과 같은 릴리스에서 함께 일어난 일이고, 어느 쪽이 먼저 다가올지는 워크로드가 정합니다. 파일 하나를 조금씩 고치는 반복 작업이 많으면 출력 토큰 증가가 먼저 보이고, 긴 연구나 자동화 작업이 많으면 점수 상승이 먼저 보입니다.

옮길 때 400이 돌아오는 것들

모델 ID만 바꾸면 되는 업데이트가 아닙니다. 문서는 Fable 5에서 넘어올 때 깨지는 동작을 셋으로 명시했습니다.

첫째, 도구를 강제로 부르게 하는 설정이 막혔습니다. tool_choice{"type":"any"}{"type":"tool","name":"..."}로 보내면 400 오류가 돌아옵니다.

tool_choice: type "tool" and "any" are not supported for this model.

토큰 카운팅 엔드포인트에도 같은 검증이 걸립니다. 기본값인 {"type":"auto"}{"type":"none"}은 그대로 동작합니다. 막은 이유는 문서에 적혀 있습니다. 이 모델은 사고 과정이 항상 켜져 있는데 도구 호출을 강제하면 사고를 건너뛰고 그 내용을 도구 인자 안에 써 넣게 되어 인자 품질이 떨어집니다. 대안은 둘입니다. JSON 스키마를 지키게 하려던 용도였다면 strict: true를 쓰는 strict tool use나 structured outputs로 옮깁니다. 도구를 반드시 부르게 하려던 용도였다면 어떤 상황에서 그 도구를 쓰라고 프롬프트에 적습니다.

둘째, 이전 모델은 Fable 5.1이 만든 사고 블록을 읽지 못합니다. 보존은 한 방향입니다. Opus 5나 Fable 5로 시작한 대화를 Fable 5.1로 옮기면 그동안의 사고가 이어지지만, 반대로 Fable 5.1에서 다른 모델로 내려가면 그 턴의 사고는 사라집니다. 라우터나 폴백이 대화 중간에 모델을 바꾸는 구조라면 API가 읽을 수 없는 블록을 조용히 버립니다. 버려진 블록은 input_tokens에 안 잡히고 과금도 안 되지만, thinking-binding-controls-2026-08-01 베타 헤더를 붙이지 않으면 버려졌다는 사실 자체가 응답에 안 나옵니다.

셋째, 이전 턴을 고치면 그 뒤의 사고 블록이 전부 무효가 됩니다. 시스템 프롬프트, tools 배열, 이전 메시지 중 무엇이든 바꾸면 다음 요청이 400으로 거절되고 메시지에 The block is bound to a different conversation이 붙습니다. 이 검사에는 계정별 유예가 걸려 있습니다. 2026년 8월 31일 이후에 만든 신규 계정에만 강제되고, 그 이전 계정은 불일치를 기록만 하며 thinking.block_binding.prefix_mismatch_behavior를 직접 설정해야 동작합니다. Mythos 5.1은 이 검사를 아예 하지 않습니다.

사고 블록이 무효가 되는 패턴유효하게 남는 패턴
이전 턴을 고치거나 순서를 바꾸거나 지우기맨 앞부터 순서대로 사고 블록 걷어내기
요청마다 이전 턴에 넣었다 다음 요청에서 빼는 리마인더서버측 context editing과 compaction으로 기록 줄이기

같은 대화 안에서 시스템 프롬프트나 tools 재구성

cache_control 마커 위치 옮기기

같은 URL이 요청마다 다른 바이트를 주는 이미지·문서

요청 사이 effort 값 바꾸기

Claude Platform Docs의 What's new in Claude Fable 5.1 문서 카드

Fable 5에서 400을 돌려주던 것들은 그대로입니다. 사고를 켜거나 끄는 thinking: {"type":"enabled"}{"type":"disabled"}는 둘 다 오류이고, 어시스턴트 응답을 미리 채워 넣는 prefill과 기본값이 아닌 temperature·top_p·top_k도 오류입니다. 깨지는 셋은 모두 messages 배열을 직접 만드는 코드에만 해당합니다. Claude Code, claude.ai, Claude Managed Agents, Claude Agent SDK는 앞부분을 알아서 그대로 유지합니다. 공식 도구만 쓰는 독자는 손댈 것이 없고, API를 직접 호출하는 개발자만 해당합니다.

지금 쓸 수 있나

Fable 5.1은 한국에서도 쓸 수 있습니다. Claude API와 claude.ai, AWS, Google Cloud, Microsoft Foundry 어디에도 지역 제한이 적혀 있지 않습니다. Mythos 5.1은 미국 조직만 참여하는 Project Glasswing 안에서만 열려 한국에서는 쓸 수 없습니다.

쓰는 곳Fable 5.1 조건
Claude API전 고객. 표준 API 요금
claude.ai Free쓸 수 없음
claude.ai Pro, Team 표준 좌석요금제 사용량에 포함되지 않음. 사용 크레딧을 따로 결제해야 함
claude.ai Max, Team·Enterprise 프리미엄 좌석요금제에 포함. 주간 사용 한도의 최대 50%까지 추가 비용 없음
Mythos 5.1Project Glasswing 참가 미국 조직만. 담당팀 문의 필요

지난 7월 19일 끝난 Fable 5 프로모션 크레딧은 Fable 5.1에 적용되지 않습니다. 지원 문서는 Fable 5.1이 애초에 그 대상이 아니었다고 명시했습니다. 데이터 보존 조건도 확인해야 합니다. 두 모델 모두 데이터를 30일 보관하고, Anthropic이 별도로 승인하지 않는 한 데이터를 남기지 않는 zero data retention 설정으로는 쓸 수 없습니다. 사내 규정상 무보존이 조건인 팀이라면 이 항목이 도입 여부를 먼저 가릅니다.

한 가지 더, 문서는 Fable 5.1을 기본 선택지로 권하지 않습니다. "대부분의 워크로드는 Claude Opus 5에서 시작한다"고 적고, Opus 5를 xhighmax effort로 돌려도 자체 평가가 모자랄 때 Fable 5.1로 올리라고 안내합니다.

이미 Fable 5를 API로 쓰고 있다면 모델 ID를 바꾸기 전에 코드베이스에서 tool_choice를 검색해 anytool부터 걷어내야 첫 요청이 400으로 돌아오지 않습니다. 아직 Fable 계열을 안 쓴다면 문서 권고대로 Opus 5로 자체 평가를 먼저 돌려 보고, 그 결과가 모자라는 작업에만 Fable 5.1을 올려 쓰면 됩니다. 어느 쪽이든 effort는 기본값 high에 그대로 두지 말고 다시 맞추라는 것이 마이그레이션 문서의 3번 항목입니다.