Devlery
Blog/AI

Opus 5 공개, 4.8 가격 그대로 성능은 두 배, 장기 에이전트 겨냥

Anthropic이 7월 24일 Claude Opus 5를 공개했습니다. 가격은 Opus 4.8과 같은 100만 토큰당 $5/$25로 두고, 자사 벤치마크에서 프론티어 Fable 5에 근접하며 장기 실행 에이전트를 겨냥합니다.

Opus 5 공개, 4.8 가격 그대로 성능은 두 배, 장기 에이전트 겨냥
AI 요약
  • 무슨 일: Anthropic이 7월 24일 Claude Opus 5를 공개했습니다. 장기 실행 에이전트를 구동하는 Opus 티어를 코딩과 전문 업무 중심으로 끌어올린 세대 교체입니다.
  • 가격·성능: 가격은 Opus 4.8과 같은 입력 $5 / 출력 $25(100만 토큰당). 자사 코딩 벤치마크에서 Opus 4.8의 두 배 이상, 상위 티어 Fable 5에 근접하는데 비용은 더 낮습니다.
    • Claude Max의 새 기본 모델이자 Claude Pro의 최상위 모델입니다. Fast 모드는 2배 가격에 기본 대비 약 2.5배 빠릅니다.
  • 개발자용 베타: 대화 중 도구 집합을 바꿔도 프롬프트 캐시가 유지됩니다. 안전 분류기에 걸린 요청은 오류 대신 다른 모델로 자동 넘겨줍니다.
  • 주의: 공개된 수치는 전부 Anthropic 자체 측정입니다. 출시 시점 기준 제3자 독립 벤치마크는 없습니다.

Anthropic이 7월 24일 Claude Opus 5를 내놨습니다. 회사는 이 모델을 "장기 실행 에이전트를 구동하는 Opus 티어의 계단식 개선"으로 소개했습니다. 값은 이전 세대 Opus 4.8과 같은 100만 토큰당 입력 $5, 출력 $25로 묶었습니다. 그러면서 자사 코딩 벤치마크에서는 상위 티어인 Fable 5에 근접하거나 일부 항목에서 앞선다고 밝혔습니다. API 모델 ID는 claude-opus-5입니다.

달라진 것은 두 가지입니다. 값을 올리지 않고 성능만 올렸고, 겨냥한 용처가 몇 시간씩 스스로 도는 코딩·업무 에이전트입니다. TechCrunch는 Opus 5를 "작업을 검증하고 성공할 때까지 신중히 반복하는 데 강한" 모델로 요약했습니다.

값은 그대로, 티어 위치는 위로

달라진 부분은 성능과 배치 위치입니다. 가격표는 Opus 4.8과 똑같습니다.

$5 / $25
100만 토큰당 입력 / 출력. Opus 4.8과 동일
약 2.5배
Fast 모드 응답 속도. 가격은 2배
2배 이상
Frontier-Bench에서 Opus 4.8 대비 코딩 점수

배치도 바뀌었습니다. Opus 5는 Claude Max의 새 기본 모델이고, Claude Pro에서 고를 수 있는 가장 강한 모델입니다. Claude.ai, Claude Code, Claude Cowork에서 바로 쓸 수 있고, API로도 열렸습니다. 정리하면 유료 구독자는 추가 비용 없이 기본 대화 상대가 한 단계 올라가고, API 사용자는 같은 단가로 더 높은 성능을 받습니다.

Fast 모드는 응답을 빠르게 받는 대신 값을 더 내는 옵션입니다. 기본보다 약 2.5배 빠르게 응답하고 가격은 2배입니다. 오래 기다리기 어려운 대화형 작업에는 Fast, 비용이 중요한 대량 처리에는 기본 속도를 고르는 식으로 나눠 쓰라는 구성입니다.

벤치마크: 같은 비용에서 더 높이 올라간다

Anthropic이 강조하는 건 절대 점수 자체보다 비용 대비 점수입니다. 아래는 공식 발표에 실린 에이전틱 코딩 벤치마크 Frontier-Bench v0.1 결과입니다. 가로축은 과제 한 건을 푸는 데 든 비용(로그 척도), 세로축은 점수입니다. 같은 세로 위치라면 왼쪽에 있을수록 싸게 그 성능을 낸다는 뜻입니다.

Frontier-Bench v0.1 벤치마크. 비용 대비 점수 곡선에서 Opus 5가 Fable 5와 Opus 4.8, GPT-5.6 Sol을 앞선다

빨간 선이 Opus 5, 노란 선이 상위 티어 Fable 5, 파란 선이 이전 세대 Opus 4.8, 회색이 GPT-5.6 Sol입니다. 최대 노력 설정에서 Opus 5는 약 44%로 곡선 맨 위에 있고, Opus 4.8은 약 19%에 그칩니다. 같은 티어의 직전 모델 점수를 두 배 이상으로 끌어올렸습니다. Fable 5는 약 34%인데 도달 비용은 Opus 5보다 오른쪽, 즉 더 비쌉니다.

다른 벤치마크에서도 비슷한 방향을 제시했습니다. 코딩 도구 평가 CursorBench에서 Opus 5의 최고 점수는 Fable 5의 0.5% 이내인데 비용은 절반 수준입니다. 컴퓨터 사용 평가 OSWorld 2.0에서는 Fable 5의 최고 기록을 3분의 1 비용으로 넘었다고 밝혔습니다. 추론 평가 ARC-AGI 3은 차상위 모델의 약 3배, 자동화 평가 Zapier AutomationBench는 약 1.5배 통과율입니다. 과학 쪽에서는 유기화학 과제가 Opus 4.8보다 10.2%포인트, 단백질 관련 과제가 7.7%포인트 높습니다.

한 가지 짚을 점은 이 수치가 모두 Anthropic 자체 측정이라는 것입니다. Frontier-Bench 차트의 각주는 mini-SWE-agent harness와 자체 백엔드에서 과제당 5회 시도의 평균 보상을 쟀고, 안전 분류기가 요청을 거부하면 Opus 4.8을 fallback으로 썼다고 적고 있습니다. TechCrunch도 출시 당일 보도가 전적으로 Anthropic 발표에 의존하며 제3자 독립 검증은 없다고 명시했습니다. 실제 코딩 세션에서의 체감은 외부 벤치마크가 쌓인 뒤에 판단할 부분입니다.

개발자용 신규 베타 기능 두 가지

이번 출시에는 에이전트를 오래 굴리는 개발자를 겨냥한 API 베타 기능 두 가지가 함께 나왔습니다. 둘 다 "에이전트가 중간에 멈추거나 비싸지는" 상황을 줄이는 쪽입니다.

기능하는 일왜 중요한가
대화 중 도구 변경진행 중인 대화에서 Claude가 쓸 수 있는 도구 집합을 바꿔도 프롬프트 캐시가 무효화되지 않음단계마다 도구를 갈아 끼우는 긴 에이전트에서 캐시를 다시 채우는 비용과 지연을 줄임
자동 fallback안전 분류기에 걸린 요청을 오류로 반환하는 대신 다른 사용 가능한 모델로 자동 라우팅분류기 오탐으로 파이프라인이 통째로 멈추는 상황을 방지

대화 중 도구 변경은 프롬프트 캐시 문제를 겨냥합니다. 보통 도구 목록을 바꾸면 캐시가 깨져 앞 맥락을 다시 계산해야 하고, 그만큼 비용과 시간이 듭니다. 계획 단계와 실행 단계에서 서로 다른 도구를 쓰는 에이전트라면 이 비용이 반복됩니다. Opus 5는 도구를 바꿔도 캐시를 살려 두어 이 반복을 줄입니다.

자동 fallback은 안전 분류기가 요청을 막았을 때의 처리 방식입니다. 기존에는 분류기에 걸리면 오류가 돌아와 에이전트 실행이 그 자리에서 끊겼습니다. 이제는 걸린 요청을 다른 모델로 넘겨 실행을 이어 갈 수 있습니다. 다만 이 라우팅은 더 약한 모델로 넘어가는 경우가 있어, 품질이 필요한 구간에서는 무엇으로 대체됐는지 확인이 필요합니다.

"Fable 5가 있는데 Opus 5는 왜 필요한가"

출시 직후 커뮤니티에서 가장 많이 나온 질문이 이것이었습니다. 가장 강한 모델이 이미 Fable 5인데 그 아래 티어를 새로 낸 이유를 물은 것입니다. 답은 가격과 구독 포함 여부에 있습니다.

항목Opus 5Fable 5Opus 4.8
티어일상용 최상위프론티어이전 세대
가격(입력/출력)$5 / $25Opus의 약 2배$5 / $25
Claude Pro 포함포함(최상위)미포함이전 기본

Fable 5는 값이 약 2배이고 Claude Pro 구독에는 들어 있지 않습니다. 반면 Opus 5는 Fable 5에 가까운 성능을 절반 가격에 내고 Pro에도 포함됩니다. 매일 반복하는 코딩·업무 작업에서는 최상위 프론티어보다 가격 대비 성능이 실제 선택 기준이 되는 경우가 많고, Anthropic은 그 구간을 Opus 5로 채운 것입니다.

반응은 갈렸습니다. X에서는 중간 노력 설정의 품질과 토큰 효율에 호의적인 평이 많았습니다. Reddit과 Hacker News는 사용량 한도, 잦은 모델 교체에 따른 피로, 안전 fallback의 동작을 더 신중하게 봤습니다. 일부 초기 리뷰는 벤치마크 1위이면서도 "정 붙이기 어렵다"는 평을 남겼습니다.

정리

Opus 5는 새 최강 모델이 아니라 가격 대비 성능을 다시 맞춘 모델입니다. 값을 그대로 두고 자사 코딩 벤치마크에서 직전 세대의 두 배를 냈으며, 상위 Fable 5에 근접하는 성능을 절반 비용에 제시했습니다. 대화 중 도구 변경과 자동 fallback은 몇 시간씩 도는 에이전트가 중간에 끊기거나 비싸지는 상황을 줄이려는 기능입니다.

확인이 남은 부분은 분명합니다. 공개된 수치는 전부 Anthropic 자체 측정이고, 제3자 벤치마크와 실제 세션 체감은 아직입니다. 연내 IPO를 준비한다는 보도가 나온 시점에 "프론티어 성능을 절반 값에"라는 메시지를 내건 배경도 함께 볼 부분입니다. 값과 성능만 놓고 보면, 이미 Anthropic을 쓰는 팀에게 Opus 5는 당장 기본값을 바꿔 볼 이유가 충분한 업데이트입니다.