Gemini 4 Argon 발표, 벤치마크 19개 중 13개 1위인데 쓸 수 있는 건 사이버 방어팀뿐
구글이 9월 30일 Gemini 4 Argon을 공개했습니다. 출력 한도는 64K에서 100만 토큰으로, 자체 비교표 19행 중 13행이 단독 1위입니다. 값은 입력 100만 토큰 2달러인데 모델 ID도 출시일도 없습니다.
- 구글이 9월 30일 Gemini 4 Argon을 냈고, 비교표 19행 중 13행이 1위입니다.
- 출력은 64K에서 100만 토큰으로 올랐는데 Terminal-bench 4.0은 꼴찌입니다.
- 값은 입력 2달러인데 모델 ID가 없고 사이버 방어 조직만 씁니다.
구글 딥마인드가 2026년 9월 30일 새 프런티어 모델 Gemini 4 Argon을 공개했습니다. 발표문에는 벤치마크 19행 비교표와 토큰 단가가 모두 실려 있는데, 정작 모델을 호출할 수 있는 곳이 없습니다. API 모델 ID도, 일반 출시일도 공개하지 않았습니다. 지금 Argon을 쓰는 쪽은 구글 내부 팀과 Fairwind Program에 속한 사이버 방어 조직뿐입니다. Fairwind는 구글이 새 모델을 일반 공개 전에 사이버 방어 조직에 먼저 주는 프로그램입니다.
구글이 Argon에 기대하는 일은 셋입니다. 실제 저장소를 고치는 소프트웨어 개발, 금융·법률 같은 기업 지식 노동, 그리고 취약점을 찾아 고치는 사이버 방어입니다. 발표자는 구글 딥마인드 SVP 겸 구글 최고 AI 아키텍트 Koray Kavukcuoglu이고, 발표문은 "프런티어 수준의 능력을 안전하게 공개하려면 단계적 접근이 필요하다"며 미국 정부의 출시 전 모델 접근 자율 절차에 참여 중이라고 밝혔습니다.
전작보다 달라진 것: 출력 한도 64K에서 100만 토큰
가장 크게 바뀐 수치는 한 번의 응답으로 뽑아낼 수 있는 분량입니다. Gemini 모델의 최대 출력은 그동안 6만 4천 토큰이었는데, Argon은 100만 토큰입니다. 15.6배입니다. 모델이 답을 중간에 끊고 다음 턴으로 넘기지 않아도 되는 길이라, 대규모 리팩터링이나 긴 보고서를 한 번에 끝낼 수 있다는 것이 구글의 설명입니다. 비교하면 같은 달에 나온 Claude Opus 5.5와 GPT-6.1 Sol의 최대 출력은 각각 12만 8천 토큰입니다.
반대로 입력 컨텍스트 창 크기는 발표문에 한 줄도 없습니다. 구글이 이번에 공개하지 않았습니다.
벤치마크는 19행짜리 표로 한 번에 나왔습니다. 비교 모델은 GPT-6 Astra, Claude Fable 5.1, Claude Opus 5.5 세 종입니다.

집계하면 단독 1위 13행, 공동 1위 1행, 뒤진 행 5행입니다. 1위 행에서 격차가 큰 쪽은 지식 노동 영역입니다. Zapier의 업무 자동화 벤치마크 AutomationBench에서 51.3%로, 2위 Opus 5.5의 42.5%보다 8.8%포인트 높습니다. 법률 조사·작성을 재는 Harvey's Legal Agent Benchmark는 19.6%인데 Astra가 5.4%, Opus 5.5가 3.8%라 자릿수가 다릅니다. 긴 문맥에서도 25만 6천 토큰부터 100만 토큰 구간의 GraphWalks가 84.2%로, Astra의 71.8%보다 12.4%포인트 앞섭니다.
코딩 에이전트를 쓰는 독자라면 봐야 할 두 행
뒤진 5행이 어디인지가 코딩 작업에는 더 중요합니다. 구글이 새 최고 기록이라고 강조한 DeepSWE v1.1(77.9%)과, Argon이 꼴찌인 두 행이 모두 에이전트 코딩 항목입니다.
| 벤치마크 | Gemini 4 Argon | GPT-6 Astra | Claude Fable 5.1 | Claude Opus 5.5 |
|---|---|---|---|---|
| DeepSWE v1.1 | 77.9% | 74.1% | 67.4% | 74.2% |
| Vibe Code Bench | 91.9% | 89.6% | 90.3% | 90.3% |
| FrontierSWE v2 | 55.0% | 65.5% | 56.3% | 62.3% |
| Terminal-bench 4.0 | 57.4% | 58.2% | 57.9% | 66.4% |
FrontierSWE v2에서 Argon은 55.0%로 4종 중 가장 낮고, 1위 Astra의 65.5%와 10.5%포인트 차이입니다. 터미널에서 명령을 직접 실행해 과제를 끝내는 Terminal-bench 4.0에서는 57.4%로 역시 꼴찌이고, Opus 5.5의 66.4%보다 9%포인트 낮습니다. 과학·수학 쪽 Terminal-Bench Science 0.1도 57.6%로 Astra의 68.1%에 밀립니다.
정리하면 Argon은 문서를 읽고 판단하는 긴 과제에서 앞서고, 셸을 돌려 결과를 확인하는 과제에서 뒤집니다. 코딩 에이전트를 CI나 터미널에 연결해 쓰는 팀이라면 발표문의 "DeepSWE 신기록"을 그대로 받아들이기 어렵습니다. 더구나 이 숫자는 전부 구글이 직접 측정한 값이고, 독립 기관 재현은 아직 없습니다. 방법론 문서 주소만 표 아래에 적혀 있습니다.
CWE-bench 68%는 3자 동률, 리더보드는 도구가 제각각
Argon의 간판 용도는 사이버 방어입니다. 취약점을 스스로 찾고, 진짜인지 확인하고, 패치까지 만드는 것을 목표로 훈련했다고 발표문은 적었습니다. 클라우드 보안 업체 Wiz가 무료 공익 점검 프로그램 Scan for Good에서 Argon을 쓰고 있고, 전 세계 병원이 쓰는 의료 소프트웨어에서 개인정보가 노출되는 핵심 취약점을 찾아냈습니다. 발표문은 이전 프런티어 모델들이 놓친 건이라고 덧붙였습니다.
취약점 수정 능력을 재는 CWE-bench v1 점수는 68%입니다. 발표문은 "공동 1위"라고만 썼는데, 같이 실린 리더보드 차트를 보면 Grok 4.7도 68%, GPT-6 Astra도 68%로 세 모델이 동률입니다. Opus 5.5가 67%로 1%포인트 뒤입니다.

차트 아래 작은 글씨를 보면 모델마다 다른 코딩 도구로 돌렸습니다. 모델을 실제로 구동하는 이 도구를 하네스라고 부르는데, Argon은 Antigravity, Grok 4.7은 opencode, Astra는 Codex, Opus 5.5와 Fable 5.1은 Claude Code로 측정했습니다. 같은 모델도 하네스가 바뀌면 점수가 흔들린다는 것은 GPT-6 Astra의 ARC-AGI-3 점수를 중립 조건에서 다시 쟀을 때 확인된 적이 있습니다. 이 리더보드의 1%포인트 차이가 모델 차이인지 도구 차이인지는 구분되지 않습니다. 간접 프롬프트 인젝션 내성도 Gray Swan의 IPI 벤치마크에서 "선두"라고만 적었고 점수는 공개하지 않았습니다.
지금 쓸 수 있나: 값은 있고 모델 ID는 없습니다
| 항목 | 내용 |
|---|---|
| 대상 | Fairwind Program 소속 사이버 방어 조직과 구글 내부 팀. 개발자·기업·일반 사용자는 "가능한 한 빨리" |
| 가격 | 프로모션 입력 100만 토큰 2달러, 출력 10달러, 캐시 입력은 입력가의 95% 할인(0.10달러). 프로모션이 끝나면 입력 4달러, 출력 20달러 |
| 프로모션 종료일 | 미공개 |
| 한국 사용 | 한국만이 아니라 전 세계 어디서도 아직 불가. 일반 공개 때는 유료 API 고객과 Google AI Ultra 구독자가 먼저 |
| 필요 조건 | Fairwind 신청 포털 접수, 배경 조사, 다중 인증·접근 추적·사내 보안팀 한정 사용 통제. 모델 ID와 출시일 미공개 |
Fairwind Program은 국가 사이버 당국, 의료·통신·에너지·금융 같은 핵심 기반시설 운영사, 수백만 명이 쓰는 기반 소프트웨어를 지키는 플랫폼 기업을 우선 심사합니다. 전 세계 650개 이상 조직이 참여하고 있지만 Argon을 받은 곳은 그중 일부입니다. 지역 제한은 공개 페이지에 적혀 있지 않습니다.
구글은 신뢰할 수 있는 방어 조직과 자사 내부 팀에는 사이버 가드레일을 뺀 Argon을 준다고 발표문에 적었습니다. 취약점을 찾는 일은 공격자가 하는 동작과 겹치기 때문에, 안전장치가 켜져 있으면 작업 자체가 막힙니다. 그래서 가드레일 없는 모델을 외부 조직에 넘기고 대신 그 조직들에 접근 통제를 요구합니다. 일반 공개용 Argon은 유해 요청 거부, 간접 프롬프트 인젝션 방어, 사고 사슬 감시, 밀봉된 샌드박스 네 가지를 더 다듬은 뒤에 나옵니다.
가격표도 그대로 받기는 이릅니다. 프로모션 2달러·10달러는 하루 전인 9월 29일 OpenAI DevDay에서 나온 GPT-6.1 Sol의 2달러·10달러와 정확히 같고, 캐시 입력 0.10달러까지 같습니다. 프로모션이 끝난 뒤의 4달러·20달러는 9월 22일 내려온 Opus 5.5의 4달러·20달러와 같습니다. 차이는 Sol과 Opus 5.5는 모델 ID가 있고 오늘 호출된다는 것입니다. Sol은 gpt-6.1-sol, Opus 5.5는 claude-opus-5-5입니다.
이번 분기 모델 선택을 Argon 때문에 미룰 이유는 없습니다. 같은 2달러에 오늘 돌릴 수 있는 GPT-6.1 Sol로 자기 과제를 먼저 재 보고, Argon은 Vertex AI나 Gemini API 문서에 모델 ID와 컨텍스트 창 크기가 올라오는 시점에 다시 열어 보면 됩니다. 그때 비교할 숫자는 발표문이 앞세운 DeepSWE 77.9%가 아니라, 자기 작업 환경과 가장 가까운 Terminal-bench 4.0의 57.4%와 FrontierSWE v2의 55.0%입니다.