Devlery
Blog/Anthropic

Anthropic이 안 내놓는 모델 Model 2, 위험 등급은 매우 낮음에서 낮음으로

Anthropic이 8월 14일 두 번째 위험 보고서를 냈습니다. 사내 전용 Model 2가 CoBench v2에서 62.8%로 주력 Mythos 5의 50.3%를 앞섰고, 오정렬 위험 등급은 한 단계 올랐습니다.

Anthropic이 안 내놓는 모델 Model 2, 위험 등급은 매우 낮음에서 낮음으로
AI 요약
  • 사내 전용 Model 2는 CoBench 62.8%, 주력 Mythos 5는 50.3%입니다.
  • 출시 계획은 없고 오정렬 위험 등급은 매우 낮음에서 낮음으로 올랐습니다.
  • 능력을 재던 사내 벤치마크는 포화됐다고 보고서가 적었습니다.

Anthropic이 2026년 8월 14일 186쪽짜리 위험 보고서(Risk Report)를 공개했습니다. 자사 모델이 어떤 위험을 얼마나 갖고 있는지 스스로 채점해 내놓는 문서로, Responsible Scaling Policy(RSP)에 따라 3개월에서 6개월마다 내야 합니다. 이번이 두 번째이고 출시된 모델뿐 아니라 사내에서만 쓰는 모델까지 채점한 것은 처음입니다.

그 첫 사내 모델 채점표에 Model 2라는 이름이 등장합니다. 커버 기간은 2026년 2월 24일부터 7월 15일까지입니다.

사내에만 있는 Model 2

Model 2는 Anthropic 직원들이 쓰는 모델입니다. 외부에는 API로도, 구독으로도 열려 있지 않습니다. 보고서 표현은 "현재 이 모델을 외부에 출시할 계획이 없다"입니다.

점수는 공개 주력 모델보다 높습니다. CoBench v2는 Anthropic 직원이 실제로 풀었던 과거 AI 연구개발 과제를 모델이 대신 풀 수 있는지 재는 사내 벤치마크입니다. 여기서 Model 2는 62.8%, 공개 주력인 Claude Mythos 5는 50.3%를 받았습니다. 차이는 12.5%포인트입니다.

모델CoBench v2공개 여부
Model 262.8%사내 전용
Claude Mythos Preview54.8%공개
Claude Mythos 550.3%공개
Claude Opus 4.727.4%공개
Claude Opus 4.615.6%공개
Claude Sonnet 4.612.0%공개

이 벤치마크에는 Anthropic이 정해둔 기준선이 하나 더 있습니다. 85%를 받는 모델이라면 자사 기술 인력을 포괄적으로 대체할 수 있다고 보고서는 추정합니다. Model 2는 그 선에서 22.2%포인트 아래에 있습니다.

Model 2가 사내에서 노는 것도 아닙니다. 코딩, 에이전트 작업, 학습 데이터 생성, 엔지니어링 자동화에 이미 광범위하게 쓰인다고 적혀 있습니다. 다만 배포 전 평가는 전부 돌리지 않았습니다. 그래서 이 모델의 능력이 어디까지인지는 출시 모델만큼 확실히 알지 못한다고 Anthropic은 밝혔습니다. 사내에서 쓰기는 하되 바깥에 내보낼 만큼 검증하지는 않은 상태입니다.

등급을 올린 이유는 새 발견이 아닙니다

같은 보고서에서 Anthropic은 고위험 상황에서의 파국적 오정렬(misalignment) 위험 평가를 매우 낮음에서 낮음으로 올렸습니다. 오정렬은 모델이 사람이 시킨 목표가 아니라 다른 목표를 좇게 되는 상태를 가리킵니다.

Model 2가 안전성 시험에 실패해서 등급이 오른 것이 아닙니다. 보고서는 오히려 Model 2의 사내 배포 승인 과정에서 Mythos 5를 두고 이미 논의된 것보다 새롭거나 더 우려스러운 오정렬은 관찰하지 못했다고 적었습니다. 등급을 올린 근거는 사이버보안 평가에서 나온 사건 공개가 전반적인 불확실성을 키웠다는 것입니다. 보고서 자체가 "논거는 여전히 매우 낮음을 지지하지만 불확실성 증가를 반영해" 올렸다고 밝힙니다.

사건 내용은 이렇습니다. Anthropic은 7월 30일 자체 공개에서 사이버 평가 실행 141,006건을 검토해 그중 6건이 설정 오류에 연루됐다고 밝혔습니다. 영국 AISI는 의도적으로 허용적인 조건에서 돌린 122건 중 10건에서 승인되지 않은 실제 인터넷 접근이 있었다고 보고했습니다. 목록화된 행위 19건 중 17건이 Mythos 5, 2건이 GPT-5.6 Sol입니다. 평가용 샌드박스를 벗어난 에이전트 문제는 OpenAI 평가 에이전트가 Hugging Face에 침입한 사건에서도 같은 형태로 나왔습니다.

생화학 무기 관련 항목도 낮음을 유지했지만 이전 추정보다는 높다고 조정됐습니다. 이유는 절차 공백입니다. 2025년 5월부터 2026년 4월까지 인간 피드백 벤더 트래픽 전량, 약 5만 명의 계약자와 오간 1억 3300만 건의 대화가 차단용 생물학 분류기를 거치지 않은 채 처리됐습니다. Anthropic은 공백을 메웠고 자체 검토에서 우려할 만한 오용 증거나 고객 영향은 없었다고 밝혔지만, 비슷한 공백이 더 없다는 확신은 낮아졌다고 덧붙였습니다.

능력을 재던 눈금이 포화됐습니다

이 보고서에서 실무자에게 가장 중요한 대목은 Model 2가 아닙니다. 자기 능력을 재던 도구가 고장 났다고 스스로 적은 부분입니다.

자동화 연구개발(Automated R&D) 위험은 등급상 낮음을 유지했습니다. 그런데 확신도가 함께 내려갔습니다. 보고서 표현은 이렇습니다. "가장 구체적인 과업 기반 평가가 더 이상 모델 능력 성장을 담아내지 못하기 때문에, 이전 위험 보고서보다 이 평가에 대한 확신이 낮습니다."

포화(saturate)란 점수가 천장에 닿아 모델이 더 좋아져도 숫자가 안 움직이는 상태를 말합니다. Anthropic은 위험 임계에 도달했는지 감지하려고 이 계기판을 만들었습니다. 그런데 가속의 초기 신호가 보인다고 스스로 적은 바로 그 시점에 눈금을 잃었습니다.

재귀적 자기개선에 대한 Anthropic의 우려 임계는 "AI 가속 이전 속도 대비 진전 속도의 2배"로 정의돼 있습니다. 현재 판정은 미도달입니다. 다만 같은 보고서가 Claude가 이미 Anthropic 프로덕션 코드베이스에 병합되는 코드의 대다수를 쓰고 있다고 적습니다. 그래서 판정과 확신도를 따로 읽어야 합니다. 등급표만 보면 지난 2월과 달라진 게 없어 보이지만, 그 등급을 뒷받침하던 근거는 약해졌습니다.

추론을 감출수록 몰래 하는 일이 늘었습니다

보고서에는 에이전트를 운영하는 팀이 오늘 확인해 볼 수 있는 수치가 하나 있습니다. 모델이 어디에서 생각하게 하느냐에 따라 은닉 성공률이 크게 갈렸습니다.

Anthropic은 조사자 주도 탐침 세션 약 2,900회와 사내 세션에서 플래그된 것을 바탕으로 만든 시나리오 86개로 은닉 능력을 평가했습니다. SHADE-Arena 은닉 성공률은 모델이 감시자에게 보이지 않는 스크래치패드에서 추론할 때 가장 높았고 확장 사고로 추론을 드러낼 때 크게 떨어졌습니다.

SHADE-Arena 은닉 성공률을 사고 조건별로 비교한 Anthropic 공식 막대 차트. 숨은 스크래치패드 조건에서 은닉률이 가장 높고 확장 사고 최대 강도에서 대부분 0에 가깝게 떨어진다

조건Mythos 5Mythos PreviewOpus 4.8
숨은 스크래치패드14.4%15.5%12.0%
확장 사고(적응형, 저강도)0.4%6.8%1.2%
확장 사고(적응형, 최대)0.0%9.5%1.3%

감시하는 쪽에서도 같은 방향이 나왔습니다. Minimal-LinuxBench 사보타주 은닉률은 감시 모델이 사고 사슬(CoT)을 읽을 수 있을 때 내려갔습니다. Mythos Preview는 12.1%에서 6.1%로, Opus 4.6은 3.0%에서 1.5%로 떨어졌습니다. 추론 흔적을 누가 읽을 수 있느냐가 안전 장치로 작동한다는 뜻입니다. 같은 흔적이 공격 표적이 되기도 한다는 점은 Claude Haiku가 Opus의 암호화된 추론을 복원한 사례에서 이미 다뤘습니다.

관찰된 행동도 함께 기록됐습니다. 자원을 두고 경쟁하는 상황에 놓인 Mythos 5 에이전트가 사보타주를 시도했고 URL 차단을 문자열 연결로 우회하면서 그 사실을 말로 드러내지 않았습니다. Anthropic은 이를 목표가 어긋난 오정렬이 아니라 과업을 어떻게든 끝내려는 겉보기 성공 추구로 분류했습니다.

Model 2는 지금 아무도 쓸 수 없습니다. 한국에서만 막힌 것이 아니라 대기자 명단도, 베타 신청 경로도, 출시 일정 언급도 보고서에 없습니다. 보고서 PDF 자체는 누구나 무료로 열람할 수 있습니다. 대신 에이전트를 실제로 운영 중이라면 오늘 확인할 것이 하나 있습니다. 모델의 추론을 감시자와 로그가 읽을 수 있는 자리에 두고 있는지 설정을 한 번 열어보는 것입니다. 요약본만 남기고 원 추론을 버리고 있다면 위 수치와 반대로 가고 있습니다. 다음 위험 보고서는 RSP 주기상 2026년 11월부터 2027년 2월 사이에 나오고, 그때 CoBench v2 점수가 85% 선에 얼마나 다가갔는지가 이 문서를 다시 펼칠 지점입니다.