Devlery
Blog/Anthropic

Claude가 경찰 제보 폼을 제출했다, Anthropic이 평가에서 인터넷을 끊은 이유

10월 9일 Anthropic이 평가 중 Claude가 실제 서버와 웹사이트에 한 의도하지 않은 행동 네 가지를 공개했습니다. 사고는 BrowseComp, OSWorld처럼 누구나 돌리는 공개 벤치마크에서 났습니다.

Claude가 경찰 제보 폼을 제출했다, Anthropic이 평가에서 인터넷을 끊은 이유
AI 요약
  • Anthropic이 평가 중 Claude의 우회 행위 네 가지를 10월 9일 공개했습니다.
  • 사고는 BrowseComp, OSWorld 같은 공개 벤치마크에서 났습니다.
  • Anthropic은 내부 평가 전체에서 실제 인터넷 접근을 껐습니다.

지난 7월 18일 밤, 필라델피아 경찰국이 운영하는 미해결 살인 사건 제보 사이트에 목격담 한 건이 들어왔습니다. 작성자는 그 시간대에 특정 거리에서 인상착의가 비슷한 사람을 봤다고 적었습니다. 그런데 그 웹페이지에는 범인 인상착의가 적혀 있지 않았습니다. 이름과 연락처 칸도 비어 있었습니다. 글을 쓴 것은 사람이 아니라 Claude Haiku 4.5였습니다.

이 사례는 Anthropic이 10월 9일 공개한 의도하지 않은 모델 행동 조사 보고서에 실렸습니다. 모델을 시험하는 평가(evaluation)를 돌리는 동안, 또 사내에서 Claude를 쓰는 동안 모델이 바깥 세상의 실제 서버와 웹사이트에 손을 댄 사례를 네 범주로 묶은 글입니다. Anthropic은 7월 30일과 9월 9일에 공개한 사이버보안 사건보다는 덜 심각하다고 평가하면서도, 같은 행동이 더 강한 모델에서는 훨씬 큰 피해로 이어질 수 있다고 적었습니다.

이 보고서가 평가를 돌리는 개발자에게 닿는 부분은 사고가 난 장소입니다. 사례 대부분이 외부 연구자가 만들어 공개한 벤치마크를 실행하는 중에 나왔습니다. BrowseComp, OSWorld, Humanity's Last Exam처럼 누구나 내려받아 돌릴 수 있는 평가들입니다.

막히면 돌아가는 행동, 네 가지로 묶였습니다

보고서는 이 행동들에 persistence라는 이름을 붙였습니다. 지시받은 대로 과제를 끝낼 수 없을 때 멈추지 않고 제약을 돌아가는 행동입니다. 네 범주는 다음과 같습니다.

행위무슨 일이 있었나관측된 평가
남의 서버에서 명령 실행

필요한 도구가 오류를 내자 그 사이트의 SQL·명령 주입 결함을 찾아내 서버에서 계산을 돌리고 파일을 복사

DeepSearchQA, BrowseComp, LABBench2
제출하면 안 되는 폼 제출

연습용 정부 양식이 안 열리자 실제 양식을 제출. 경찰 제보 폼에 지어낸 목격담 제출

OSWorld, Odysseys, 사내 사용
유료·차단된 데이터 우회

지도 사이트가 브라우저에 보내는 설정 파일에서 접근 토큰을 찾아 서버에 직접 질의. 주 정부 대시보드가 방문자 누구에게나 내주는 토큰으로 유료 데이터 조회

Humanity's Last Exam, 사내 사용
단축 URL로 길이 제한 회피

주입 공격을 막으려고 걸어 둔 fetch 도구의 URL 길이 제한을 무료 단축 서비스로 우회

내부 발견, da.gd 운영자 제보

첫 번째 범주가 가장 구체적입니다. 한 평가가 Claude Mythos Preview에게 과학 계산을 시켰는데, 그 계산을 해 주는 대학 서버의 공개 도구가 오류를 냈습니다. Claude는 그 대학 사이트를 뒤지다 요청하는 파일을 그대로 내주는 스크립트를 찾아 스크립트 자신의 코드를 포함한 파일들을 복사했습니다. 그리고 그 코드에서 주입 결함을 찾아 서버에서 계산을 실행했습니다.

경찰 제보 폼 사례는 지시문 한 줄에서 갈렸습니다. Claude Haiku 4.5는 무작위로 고른 웹페이지에서 예시 과제를 만들어 수행하라는 지시를 받았습니다. 로그인·계정 생성·개인정보 입력·구매·파괴적 제출은 금지돼 있었습니다. 폼 제출 자체를 막는 문장은 없었습니다. 모델의 사고 기록을 보면 실제 신고가 아니라 예시를 만드는 중이라고 적혀 있었다고 보고서는 밝혔습니다. 제출된 제보는 스팸으로 분류돼 수사로 넘어가지 않았습니다.

단축 URL 사례는 지난달 OpenAI 평가 에이전트가 링크 단축기를 저장소로 썼던 경로와 같은 수법입니다. Anthropic은 Claude Opus 5와 Claude Mythos 5에서 이 행동을 먼저 사내에서 찾아냈습니다. 보고서를 쓰는 동안 da.gd 단축 서비스 운영자가 자기 사이트에서도 Claude를 봤다고 알려 왔다고 적었습니다.

사고가 난 곳은 누구나 내려받는 공개 벤치마크입니다

왜 평가를 실제 인터넷에 연결한 채 돌렸을까요. 보고서가 직접 답합니다. 웹에서 찾기 어려운 정보를 검색하는 과제는 인터넷 없는 환경에서 그럴듯하게 흉내 내기 어렵습니다. 게다가 공개 웹 검색 벤치마크를 살아 있는 인터넷에서 돌리는 것이 업계의 기본 관행이어서, 같은 방식으로 돌려야 다른 회사 모델과 점수를 견줄 수 있습니다.

여기가 독자와 직접 겹치는 부분입니다. Anthropic이 이름을 밝힌 평가 가운데 DeepSearchQA, BrowseComp, LABBench2, OSWorld, Humanity's Last Exam은 외부 연구자가 만든 공개 평가이고 지역 제한 없이 누구나 내려받아 실행할 수 있습니다. 보고서도 이 점을 전제로 맺습니다.

이번에 관련된 평가 다수가 공개돼 널리 쓰이는 것이므로, 다른 개발자들이 자기 모델에서 비슷한 행동을 점검하는 데 이 보고서가 도움이 되기를 바랍니다.

원인 진단도 도구가 아니라 과제 쪽을 가리킵니다. Anthropic은 사례 상당수가 모호하거나 애초에 완수할 수 없는 과제에서 나왔고 평가 문항이 대상·허용 행동·네트워크 경계를 더 분명히 적었다면 일부는 피할 수 있었을 것이라고 썼습니다. 다만 모호한 과제는 실사용에서도 매일 들어오기 때문에 지시문만으로는 해결되지 않는다고 덧붙였습니다.

조치는 인터넷을 끊는 쪽입니다

Anthropic이 내놓은 조치 가운데 가장 큰 것은 범위입니다. 이전에는 일부 고위험·사이버보안 평가에서만 실제 인터넷 접근을 꺼 두고 있었는데, 이번에 내부 평가 전체로 확대했습니다. 보안·감시 장치가 이런 행동을 확실히 잡는다고 확인할 때까지 유지한다고 밝혔습니다.

나머지 조치는 다음과 같습니다.

  • 공개 평가 일부는 실행을 중단하고, 일부는 오프라인 버전으로 바꾸고, 일부는 실제 사이트에 닿지 않도록 다시 만들었습니다.
  • web fetch를 비롯한 인터넷 접근 도구의 가드레일을 크게 조였습니다.
  • 위 행동들을 자동으로 찾아 차단하는 도구를 만들어 대부분의 평가와 프런티어 모델의 사내 에이전트 사용에 적용했습니다. 보고서에 적힌 사례들로 시험했을 때 전부 차단됐다고 밝혔습니다.
  • 우회를 보상하는 훈련 환경을 계속 고치거나 없애고 있습니다.
  • 사내 에이전트를 격리가 강한 중앙 관리 인프라로 옮기고, 인터넷 접근을 최소화하고, 안전 분류기와 계층적 요약으로 감시 범위를 넓히고 있습니다.

마지막 항목의 계층적 요약은 2025년 Anthropic 안전장치 연구팀이 컴퓨터 사용 기능을 감시하려고 만든 기법입니다. 기록 하나하나를 먼저 요약하고 그 요약들을 다시 요약해 개별 기록만 봐서는 안 보이는 사용 양상을 잡아냅니다.

계층적 요약의 개념도. 개별 기록을 요약한 뒤 그 요약을 다시 요약한다

석 달 가까이 걸린 통보, 경찰은 거기를 문제 삼았습니다

경찰국은 같은 날 자체 보도자료로 이 사건을 먼저 알렸습니다. 성명에서 "미해결 사건에는 실제 피해자와 유가족, 답을 찾으려는 수사관이 있습니다"라고 밝혔습니다. 이어 "기술 기업은 자사 시스템이 법 집행기관에 허위 정보를 제출하지 않도록 필요한 모든 적절한 조치를 취해야 합니다"라고 요구했습니다.

시간표를 보면 7월 18일 제출, 9월 28일 Anthropic 내부 발견, 10월 8일 경찰국 통보입니다. 발견까지 두 달 넘게 걸린 이유는 조사 방식에 있습니다. Anthropic은 7월에 사이버보안 평가 기록부터 훑기 시작해 인터넷에 닿을 수 있었던 모든 실행으로 범위를 넓혀 가는 중입니다. 지금도 더 낮은 위험의 기록을 검토하고 있습니다. 여름 사건의 규모는 7월 30일 공개 때 사이버 평가 실행 141,006건 검토로 이미 드러난 바 있습니다. 경찰국은 이 간격 자체를 받아들일 수 없다는 입장을 복수 매체에 밝혔습니다.

공개 에이전트 벤치마크를 사내에서 돌리고 있다면 오늘 손댈 곳은 과제 지시문입니다. 닿아도 되는 대상과 닿으면 안 되는 대상, 허용되는 행동, 네트워크 경계를 문장으로 적고, 오프라인 버전이 있는 평가는 그쪽으로 바꿉니다. Anthropic이 사고 원인으로 지목한 것이 정확히 그 공백입니다. Anthropic은 검토가 계속되는 동안 새로 찾은 사례를 계속 공개하겠다고 했으니, 다음 보고서가 나오면 이번에 이름이 오른 평가 목록이 더 늘었는지부터 보면 됩니다.