Devlery
Blog/Google

Gemini 3.8 Flash 공개, 코딩은 Opus 5와 나란한데 범용 에이전트는 19.1%

Google이 9월 2일 Gemini 3.8 Flash를 공개했습니다. 단가는 3.7 Flash와 같은 100만 토큰당 0.75달러인데 DeepSWE는 65.3%에서 73.7%로 올랐고, 범용 에이전트 벤치마크는 19.1%로 Claude Opus 5의 51.8%에 못 미칩니다.

Gemini 3.8 Flash 공개, 코딩은 Opus 5와 나란한데 범용 에이전트는 19.1%
AI 요약
  • Gemini 3.8 Flash가 3.7 Flash와 같은 단가로 나왔습니다.
  • DeepSWE는 65.3%에서 73.7%로 올라 Opus 5와 나란합니다.
  • 범용 에이전트는 19.1%, Opus 5의 51.8%에 못 미칩니다.

Google이 2026년 9월 2일 Gemini 3.8 Flash를 공개했습니다. 8월 13일 3.7 Flash가 나온 지 3주 만입니다. Google 표현으로는 6주 사이 세 번째 Flash 릴리스입니다. 가격표는 한 줄도 바뀌지 않았습니다. 100만 토큰당 입력 0.75달러, 출력 3.75달러로 3.7 Flash와 똑같습니다. 도입가 만료일(2026년 12월 31일)과 그 뒤 적용될 정가(1.50달러와 7.50달러)까지 같습니다.

가격이 그대로일 때 남는 질문은 하나입니다. 지금 3.7 Flash나 Claude Sonnet 5로 돌리는 작업을 3.8 Flash로 옮겨도 되느냐입니다. Google이 발표문에 함께 올린 벤치마크 표에서 답은 두 갈래입니다. 정해진 코딩·문서·분석 과제에서는 옮겨도 되고, 컴퓨터를 직접 조작하거나 오래 자율로 도는 에이전트 작업에서는 아직 아닙니다.

3.7 Flash보다 무엇이 올랐나

발표문에 실린 15개 항목 전부에서 3.8 Flash가 3.7 Flash를 앞섭니다. 가장 큰 폭은 코딩입니다. 장기 소프트웨어 공학 벤치마크 DeepSWE v1.1이 65.3%에서 73.7%로 8.4%p 올랐습니다. 같은 표에서 Claude Opus 5는 74.0%, GPT-5.6 Sol은 72.7%입니다. 입력 단가가 Opus 5의 7분의 1인 모델이 사실상 같은 자리에 왔습니다.

주요 항목만 옮기면 아래와 같습니다. Google이 표를 이미지로만 공개해 원본에서 수치를 읽어 다시 조판했습니다.

항목3.8 Flash3.7 FlashClaude Opus 5GPT-5.6 Sol
입력가 (100만 토큰)$0.75$0.75$5.00$4.00
출력가 (100만 토큰)$3.75$3.75$25.00$20.00
DeepSWE v1.1 (장기 코딩)73.7%65.3%74.0%72.7%
Terminal-bench 2.1 (터미널 코딩)89.4%85.8%89.1%88.8%
Vals Finance Agent v261.4%59.0%58.6%53.8%
CharXiv (차트 읽고 추론)86.2%84.5%83.7%85.8%
Terminal-bench 4.0 (범용 에이전트)19.1%11.2%51.8%37.3%
OSWorld-2.0 (컴퓨터 조작)59.0%50.6%75.4%62.6%
GDPVal-AA v2 (지식 노동, Elo)1545148218241710

Vals Finance Agent v2는 재무 분석가가 하는 일을 모델에 시키는 시험이고 Harvey's Legal Agent Benchmark는 법률 실무 절차를 끝까지 밟게 하는 시험입니다. 두 항목에서 3.8 Flash는 각각 61.4%와 10.0%로 Opus 5의 58.6%와 6.7%를 넘었습니다. 정형화된 전문 업무를 자동화하는 쪽에서 Flash급 모델이 프론티어 모델을 앞선 수치는 이번이 처음입니다.

코딩 밖에서도 오른 항목이 있습니다. 여러 분야를 섞은 전문가 추론 시험 HLE-Verified는 53.6%에서 54.9%로 올라 Opus 5의 54.4%와 GPT-5.6 Sol의 54.5%를 근소하게 넘었습니다. 장편 영상 이해 LVBench는 85.4%에서 87.8%로, 실제 생물학 연구 과제를 다루는 LABBench2는 82.1%에서 86.2%로 올랐고 둘 다 표 안에서 1위입니다. 사람에게도 어려운 문제만 모은 BioMysteryBench에서는 43.5%에서 56.5%로 13%p 올라 Opus 5의 49.4%를 앞섭니다.

Google이 함께 올린 아래 산점도는 세로축이 DeepSWE 점수, 가로축이 과제 하나를 푸는 데 든 평균 비용입니다. 오른쪽으로 갈수록 쌉니다.

Gemini 3.8 Flash의 DeepSWE v1.1 점수와 과제당 평균 비용을 다른 모델과 함께 표시한 산점도

차트에서 눈금을 계산해 읽으면 3.8 Flash의 최고점은 과제당 약 2.4달러에 약 74%이고 같은 점수대의 Claude Opus 5는 과제당 약 11.8달러입니다. 대략 5분의 1 비용으로 같은 점수를 냅니다. 3.7 Flash와 견주면 과제당 비용은 약 2.2달러에서 약 2.4달러로 조금 오릅니다. 차트에서 읽은 근사값이라 소수점까지 믿을 값은 아니지만 방향은 분명합니다.

Opus 5를 못 따라간 항목

Terminal-bench 4.0에서 3.8 Flash는 19.1%입니다. Opus 5는 51.8%, GPT-5.6 Sol은 37.3%라서 격차가 배 이상입니다. 같은 Terminal-bench라도 2.1은 터미널에서 코드를 고치는 과제이고 4.0은 도구를 골라 쓰며 오래 자율로 도는 범용 과제입니다. 3.8 Flash는 앞의 시험에서 89.4%로 1위를 하고 뒤의 시험에서 19.1%로 최하위권입니다.

컴퓨터 조작 시험 OSWorld-2.0도 마찬가지입니다. 사람 대신 화면을 보고 클릭·입력해 앱을 조작하게 하는 시험입니다. 3.8 Flash는 3.7 Flash의 50.6%에서 59.0%로 올랐지만 Opus 5의 75.4%에는 한참 못 미칩니다. 지식 노동 종합 지표 GDPVal-AA v2도 Elo 1545로, Opus 5의 1824는 물론 GPT-5.6 Sol의 1710보다 아래입니다.

성능이 오른 대가도 있습니다. Google은 3.8 Flash가 "더 열심히 일한다"고 적으면서 복잡한 과제에서 추론 단계를 더 밟고 도구를 반복 호출하기 때문에 토큰을 더 쓸 수 있다고 밝혔습니다. 모델 카드에도 같은 문장이 있습니다. 발표문은 그다음 문장에서 이렇게 권합니다.

연산 효율이 최우선인 애플리케이션이라면, 개발자는 노력 수준을 낮춰 토큰 부담을 줄이거나 계속 Gemini 3.7 Flash를 쓰면 됩니다. 3.7 Flash는 효율 우선 워크로드용으로 완전히 지원됩니다.

새 모델 발표문이 전작을 계속 쓰라고 명시하는 일은 흔치 않습니다. 토큰 단가가 같아도 한 건을 처리하는 데 드는 토큰 수가 늘면 청구서는 늘어납니다. 배치 작업처럼 건당 단가가 그대로 곱해지는 워크로드라면 옮기기 전에 같은 입력으로 토큰 사용량부터 재 보는 편이 안전합니다.

지금 쓸 수 있나

한국에서 오늘 쓸 수 있습니다. Gemini API와 Google AI Studio의 지원 국가 목록에 South Korea가 들어 있고 Google AI Pro 구독은 한국에서 월 29,000원에 판매됩니다.

항목내용
대상

개발자(Gemini API, AI Studio, Antigravity, Android Studio, Stitch), 기업(Gemini Enterprise), 개인(Google AI Pro·Ultra 구독자는 Gemini 앱, Google 검색 AI 모드, Google Sheets에서)

무료 티어

입력·출력 모두 무상. 대신 입력이 Google 제품 개선에 사용됩니다

유료 티어 단가

100만 토큰당 입력 $0.75, 출력 $3.75, 컨텍스트 캐싱 $0.075.

2027년 1월 1일부터 $1.50, $7.50, $0.15로 각각 2배

한국 사용

가능. 다만 발표문은 Gemini 앱의 국가별 출시 목록을 밝히지 않았습니다

필요 조건

3.8 Flash는 신청 절차 없음. 3.8 Flash Cyber는 Fairwind Program 승인 필요

API를 쓰는 개발자라면 모델 이름만 바꿔서는 안 됩니다. 3.7 Flash까지 쓰던 thinking_budget이 사라지고 thinking_level로 바뀌었습니다. 값은 low, medium(기본값), high 세 단계이고 minimal은 지원하지 않아 넣으면 오류가 납니다. temperaturetop_p 같은 샘플링 파라미터도 제거됐습니다. 모델 ID는 gemini-3.8-flash, 입력은 최대 1,048,576 토큰, 출력은 65,536 토큰입니다. 지식 컷오프는 2026년 3월이고 일부 도메인은 2025년 1월에 머물러 있습니다.

보안 특화 변종은 승인 대상만

같은 날 나온 3.8 Flash Cyber는 코드에서 취약점을 찾고 고치는 패치까지 만들어 주는 변종입니다. 일반 공개가 아니라 Google이 새로 만든 Fairwind Program 승인 대상, 즉 정부 기관과 핵심 기반시설 운영자, 소프트웨어 유지보수자만 씁니다. 방어 벤치마킹을 하는 학술 연구실도 신청할 수 있습니다.

수치는 Google이 공개한 것만 옮깁니다. 취약점 패치 벤치마크 CWE-Bench에서는 pass@1 47.2%로 선두 프론티어 모델의 47.8%에 근접하면서 비용은 훨씬 낮았습니다. 20개 프로그래밍 언어를 섞은 내부 벤치마크에서는 실제 취약점 발견 성공률이 70%를 넘었습니다. Chrome 보안팀은 "훨씬 큰 최고 상용 모델들보다 Chrome 취약점에 대해 2.6배 많은 정확한 패치를 만들어 냈다"고 밝혔습니다. Wiz는 자사 침투 테스트 벤치마크에서 재현율이 7.5%p에서 9.7%p 높으면서 비용은 2.3배에서 5.2배 낮았다고 전했습니다.

같은 주에 Anthropic은 Claude Fable 5.1과 Mythos 5.1을, OpenAI는 Astra를 내면서 보안 특화 모델을 각각 승인 대상에게만 열었습니다. 세 곳 모두 취약점을 찾는 능력이 오르면 공격에도 그대로 쓰인다는 이유로 접근을 좁혔습니다. 일반 개발자가 지금 손에 넣을 수 있는 것은 표준 3.8 Flash뿐입니다.

옮길지 정하는 법

Google AI Studio 무료 티어에서 gemini-3.8-flash를 골라 지금 3.7 Flash나 Claude Sonnet 5로 돌리는 터미널 코딩 작업 하나를 그대로 한 번 돌려 보면 됩니다. 무료 티어는 입력이 Google 제품 개선에 쓰이므로 사내 코드 대신 공개 저장소 과제로 시험합니다. 결과와 함께 소비된 토큰 수를 3.7 Flash와 나란히 적어 두면 12월 31일 도입가가 끝난 뒤의 비용까지 미리 계산됩니다. 반대로 화면을 조작하거나 며칠씩 자율로 도는 에이전트를 운영 중이라면 표의 19.1%와 59.0%가 그대로 답입니다. 그쪽은 아직 Opus 5 자리입니다.