DeepSeek V4 Flash 0731, Codex 공식 연동에 출력 100만 토큰 0.28달러
DeepSeek가 7월 31일 V4-Flash API를 공개 베타로 전환했습니다. Responses API를 네이티브 지원하고, Codex 설정 파일 작성법을 공식 문서로 냈습니다.
- 무슨 일: DeepSeek가 7월 31일
DeepSeek-V4-FlashAPI를 공개 베타로 정식 전환했습니다. 빌드명은V4-Flash-0731입니다.- 아키텍처와 크기는 프리뷰와 같고 사후 학습만 다시 했습니다. 284B 중 13B 활성 MoE, 컨텍스트 100만 토큰.
- 가중치는 MIT 라이선스로 Hugging Face에 공개돼 있습니다. 지난달 다운로드 292만 회.
- 새로운 부분: Responses API 포맷을 네이티브로 지원하고 OpenAI의
Codex에 맞춰 적응을 끝냈습니다.- Codex 설정 파일에
wire_api = "responses"를 적는 방법을 DeepSeek가 공식 문서에 실었습니다. - 현재 Codex에 붙는 모델은
deepseek-v4-flash뿐입니다.deepseek-v4-pro는 8월 초 예정.
- Codex 설정 파일에
- 가격: 입력 100만 토큰 0.14달러, 출력 0.28달러, 캐시 적중 입력 0.0028달러. Artificial Analysis 지수 50점으로 101개 모델 중 3위.
- 하루 전인 7월 30일 OpenAI는 GPT-5.6 Luna 가격을 80% 내렸습니다(출력 6달러에서 1.20달러).
- 유보할 점: 멀티모달을 지원하지 않습니다. 같은 작업에 Gemini Flash 3.6보다 약 3.6배 토큰을 쓴다는 커뮤니티 관측도 있습니다.
경쟁사의 코딩 에이전트에 자기 모델을 꽂는 방법을, 모델 제작사가 직접 문서로 냈습니다. DeepSeek는 7월 31일 API 릴리스 노트로 DeepSeek-V4-Flash API의 공개 베타 정식 전환을 알렸습니다. 같은 날 Codex 연동 문서도 함께 열었습니다. 릴리스 노트의 표현은 이렇습니다. 새 빌드는 "Responses API 포맷을 네이티브로 지원하며 Codex에 맞춰 특별히 적응됐습니다."
모델 자체는 크게 달라지지 않았습니다. DeepSeek는 V4-Flash-0731이 "프리뷰와 동일한 아키텍처와 크기를 유지하며 사후 학습만 다시 수행했다"고 밝혔습니다. 284B 파라미터 중 13B만 활성화되는 MoE, 컨텍스트 100만 토큰, MIT 라이선스는 4월 공개 때와 같습니다. 바뀐 것은 이 모델을 어떤 도구에 바로 꽂을 수 있느냐입니다.

Codex 설정 파일 여덟 줄
Codex는 OpenAI의 코딩 에이전트입니다. CLI와 ChatGPT 데스크톱 앱, VS Code 확장에서 같은 설정을 씁니다. DeepSeek 문서가 안내하는 방식은 이 설정 파일에 제공자를 하나 더 추가하는 것입니다.
model = "deepseek-v4-flash"
model_provider = "deepseek"
preferred_auth_method = "apikey"
forced_login_method = "api"
model_reasoning_effort = "high"
model_catalog_json = "~/.codex/models.json"
[model_providers.deepseek]
name = "deepseek"
base_url = "https://api.deepseek.com/"
wire_api = "responses"
experimental_bearer_token = "<발급받은 DeepSeek API 키>"
여기서 눈여겨볼 줄은 wire_api = "responses"입니다. Responses API는 OpenAI가 만든 요청·응답 규격으로, 도구 호출과 추론 상태를 대화 한 턴 안에서 관리합니다. Chat Completions만 지원하는 제공자를 Codex에 붙이려면 그 사이에 변환 계층을 하나 끼워야 합니다. DeepSeek는 그 계층을 없애고 규격 자체를 맞췄습니다.
모델 메타데이터를 담는 ~/.codex/models.json도 함께 만들어야 합니다. DeepSeek는 두 파일을 자동 생성하는 macOS·Linux·Windows용 설치 스크립트를 문서에 같이 올렸습니다. 현재 Codex에서 쓸 수 있는 모델은 deepseek-v4-flash 하나입니다. 더 큰 deepseek-v4-pro는 8월 초 지원 예정이라고 밝혔습니다.
82.7점과 0.28달러
DeepSeek가 릴리스 노트에 실은 에이전트 벤치마크는 다음과 같습니다. 모두 자체 보고 수치입니다.
| 벤치마크 | 점수 | 측정 대상 |
|---|---|---|
| Terminal Bench 2.1 | 82.7 | 터미널 작업 수행 |
| Cybergym | 76.7 | 보안 과제 |
| Toolathlon verified | 70.3 | 도구 호출 |
| DeepSWE | 54.4 | 소프트웨어 이슈 해결 |
| NL2Repo | 54.2 | 자연어에서 저장소 생성 |
| Agent Last Exam | 25.2 | 고난도 에이전트 과제 |
Terminal Bench 2.1의 82.7점은 1위권과 6점에서 7점 정도 차이입니다. Artificial Analysis가 집계한 같은 벤치마크 리더보드에서 GPT-5.6 Sol(xhigh)이 89.5점, Claude Opus 5가 89.1점입니다. 다만 이 격차는 하네스와 측정 조건을 타는 숫자입니다. Vals AI 집계에서는 같은 두 모델이 각각 85.77점, 84.64점으로 나옵니다.
여러 벤치마크를 묶은 독립 평가에서는 순위가 더 위로 올라갑니다. Artificial Analysis의 Intelligence Index에서 V4-Flash-0731은 50점을 받아 101개 모델 중 3위입니다. 비교군 중앙값은 25점입니다. 전체 평가를 한 번 돌리는 데 든 비용은 72.02달러였습니다.
같은 지수대 모델과 가격을 나란히 놓으면 이렇습니다.
| 모델 | 입력 100만 토큰 | 출력 100만 토큰 | 가중치 |
|---|---|---|---|
| DeepSeek V4-Flash-0731 | 0.14달러 | 0.28달러 | MIT 공개 |
| GPT-5.6 Luna (7월 30일 인하) | 0.20달러 | 1.20달러 | 비공개 |
| Claude Opus 5 | 5달러 | 25달러 | 비공개 |
캐시가 적중한 입력은 100만 토큰에 0.0028달러입니다. 원가 대비 98% 할인으로, Artificial Analysis 집계에서 이 항목 1위입니다. 같은 코드베이스를 반복해서 읽는 코딩 에이전트에는 이 항목이 실제 청구서를 좌우합니다.
두 사건은 24시간 안에 겹쳤습니다. 하루 앞선 7월 30일, OpenAI는 GPT-5.6 Luna 가격을 80% 내렸습니다. 입력은 100만 토큰당 1달러에서 0.20달러로, 출력은 6달러에서 1.20달러로 떨어졌습니다. Terra는 20% 인하에 그쳤고 최상위 Sol은 그대로였습니다. OpenAI는 자동 승인형 대량 작업 비용이 약 10분의 1이 된다고 설명했습니다. 그 인하를 반영해도 출력 기준으로는 DeepSeek가 4분의 1 수준입니다. 저가 구간만 80%를 깎고 상위 모델은 손대지 않았다는 점에서, 압박이 들어온 가격대가 어디인지는 중국 오픈 모델의 토큰 점유율 상승과 겹쳐 읽힙니다.
커뮤니티가 짚은 유보 조건
Hacker News에는 릴리스 노트 스레드가 648점, Artificial Analysis 분석 스레드가 489점을 받으며 두 개가 동시에 올라왔습니다.
비용 후기는 숫자가 붙어 있습니다. 한 사용자는 30일 동안 API 요청 3,467회와 토큰 3억 2,318만 개를 코딩 작업에 쓰고 4.55달러를 냈다고 적었습니다. 다른 사용자는 1만 달러 미만 하드웨어로 집에서 돌릴 수 있다는 점을 들며, 오픈 가중치는 "제공자 변덕으로 사라지지 않는다"고 썼습니다. 개별 사용자 보고라 검증된 수치는 아닙니다.
로컬 실행이 가능한 이유는 배포 형식에 있습니다. Hugging Face 모델 카드를 보면 Instruct 가중치가 MoE 전문가는 FP4로, 나머지 파라미터는 FP8로 배포됩니다. 총 284B이지만 실제로 올려야 하는 용량은 그만큼 크지 않습니다. llama.cpp, Ollama, LM Studio, Jan용 양자화 변형이 117종 올라와 있고, 가장 작은 동작 가능 빌드는 81GB 수준으로 정리됩니다. 모델 카드 기준 지난달 다운로드는 292만 회입니다.
반대편에서 나온 지적은 이렇습니다.
- 멀티모달 미지원. 텍스트 입출력만 됩니다. 스크린샷을 읽거나 UI를 보고 판단하는 작업에는 쓸 수 없습니다.
- 말이 많습니다. Artificial Analysis 평가에서 출력 토큰 2억 1,000만 개를 썼습니다. 비교군 중앙값 1억 개의 두 배가 넘습니다. 같은 작업에 Gemini Flash 3.6보다 약 3.6배 토큰을 쓴다는 커뮤니티 관측도 있습니다. 토큰당 단가가 싸도 지연 시간은 늘어납니다.
- 속도. Artificial Analysis는 출력 속도를 측정하지 못해 N/A로 남겼습니다. OpenRouter 기준 초당 약 93토큰이라는 보고가 있고, Luna가 토큰당 2배에서 5배 빠르다는 반론이 붙었습니다. 최대 추론 노력 기준으로 계산하면 작업당 비용이 약 0.03달러로 Luna와 겹친다는 지적도 나왔습니다.
그래서 갈리는 지점은 단가가 아니라 사람이 기다리느냐입니다. 야간 배치, 대규모 리팩터링, 테스트 생성처럼 결과를 아침에 확인하는 작업이면 토큰을 더 써도 청구서가 이깁니다. 편집기 옆에 붙어 앉아 응답을 기다리는 작업이면 초당 93토큰이 그대로 체감됩니다. model_reasoning_effort를 high로 두라는 DeepSeek 문서의 기본값도 앞쪽 용도를 전제한 설정입니다.
이번 릴리스로 바뀐 실무 조건은 하나입니다. Codex를 쓰는 팀이 모델을 바꾸려고 도구까지 바꿀 이유가 없어졌습니다. 오픈 가중치 모델이 경쟁사 에이전트의 설정 파일 안에서 기본 제공자와 나란히 놓입니다.