1조 파라미터 Mistral Large 4 공개, Apache 2.0 없이 가중치는 10월 27일
Mistral이 10월 6일 Large 4를 API 프리뷰로 열었습니다. Artificial Analysis 지능 지수는 전작 9점에서 38.4점으로 올랐고 값은 입력 100만 토큰 1.36달러입니다. 가중치는 10월 27일 커스텀 라이선스로 나옵니다.
- Mistral이 1조 파라미터 Large 4를 API 프리뷰로 열었습니다.
- 전작의 Apache 2.0은 빠졌고 가중치는 10월 27일 공개 예정입니다.
- 사이버 벤치마크 1위는 경쟁 모델 다수가 과제 98%를 거부한 결과입니다.
Mistral이 2026년 10월 6일 아부다비 AI Everything 행사에서 Mistral Large 4를 공개 프리뷰로 열었습니다. 모델 ID는 mistral-large-4이고 사내 별칭은 "le Chonk"입니다. API 키만 있으면 오늘 호출할 수 있습니다.
전작과 가장 크게 달라진 것은 답하는 방식입니다. Mistral Large 3은 질문을 받으면 바로 답을 쓰는 모델이었습니다. Large 4는 답을 쓰기 전에 혼자 한참 생각하는 과정을 거칩니다. 사람이 보기엔 응답이 느려지는 대신 어려운 문제를 더 잘 풉니다. 기술 용어로는 지시 응답과 추론을 한 모델에 합친 하이브리드입니다.
자체 호스팅을 계획하던 팀에는 따로 확인할 것이 하나 생겼습니다. Large 3의 가중치는 Apache 2.0이었지만 Large 4는 아닙니다. Mistral 문서의 모델 목록은 Large 3(v25.12)에 Apache 2.0을 적어 두었고 Large 4(v26.10)에는 "Open"이라고만 적었습니다. 라이선스 전문은 가중치와 함께 10월 27일에 공개됩니다.
전작 Large 3과 무엇이 달라졌나
Artificial Analysis(AA)가 지금 쓰는 지능 지수에서 Large 3은 9점, Large 4 프리뷰는 38.4점입니다. 같은 지수로 29점 이상 올랐습니다. 앞서 설명한 추론 과정이 그 차이를 만들었습니다. 다만 값도 함께 올랐습니다.
| 항목 | Mistral Large 3 (2025년 12월) | Mistral Large 4 (2026년 10월) |
|---|---|---|
| AA 지능 지수 | 9 | 38.4 |
| 답하는 방식 | 추론 없는 지시 모델 | 지시와 추론 하이브리드 |
| 파라미터 | 675B 총, 41B 활성 | 1.05T 총, 49B 활성 |
| 입력 100만 토큰 | 0.50달러 | 1.36달러 (현재 할인가 0.68달러) |
| 출력 100만 토큰 | 1.50달러 | 4.18달러 (현재 할인가 2.09달러) |
| 가중치 라이선스 | Apache 2.0 | 커스텀 라이선스, 10월 27일 공개 |
가격은 Large 3의 입력 100만 토큰 0.50달러에서 Large 4의 정가 1.36달러로 2.7배 올랐습니다. 지금 OpenRouter와 Mistral 모델 페이지에 보이는 입력 0.68달러, 출력 2.09달러는 정가의 절반인 프리뷰 할인가입니다. Mistral은 이 할인이 언제 끝나는지 밝히지 않았습니다. 할인가를 기준으로 예산을 짠 팀은 정가로 돌아갔을 때 토큰 비용이 두 배가 됩니다.
컨텍스트 창은 소스마다 다르게 적혀 있습니다. Mistral 문서는 100만 토큰이라고 적었지만 Artificial Analysis는 524,288 토큰, OpenRouter는 512K로 적었습니다. Large 3의 256K보다 두 배 늘어난 것은 확실합니다. 100만 토큰을 전제로 설계하기 전에 실제 요청으로 상한을 확인하는 편이 안전합니다.
자체 측정한 벤치마크 수치는 조심해서 읽어야 합니다. Mistral이 공개한 차트에서 코딩 벤치마크 DeepSWE v1.1은 Large 4가 62%, GLM-5.3이 61%, DeepSeek V4 Pro 0813이 57%입니다. 그런데 같은 벤치마크 공개 리더보드에서 GLM-5.3은 약 69%로 Mistral 차트보다 8점 높게 나옵니다. 경쟁 모델 점수는 독립 검증을 받은 값이 아닙니다.
사이버 1위 81.7%는 다른 모델이 안 푼 문제에서 나왔습니다
Mistral은 발표문에서 취약점 재현과 패치 과제의 82%를 해냈고 이것이 모든 모델 중 최고라고 적었습니다. 수치 자체는 맞습니다. Artificial Analysis의 CyberGym-E2E-AA 리더보드에서 Mistral Large 4 프리뷰가 pass@1 81.7%로 1위입니다.
이 벤치마크가 무엇을 재는지부터 보면 순위의 뜻이 달라집니다. 과제는 세 단계로 이어집니다. 먼저 패치하지 않은 빌드를 멈추게 하는 입력을 만들고, 그 멈춤을 없애는 패치를 쓰고, 패치 뒤에도 기능 테스트가 통과하는지 확인합니다. 오픈소스 퍼징 도구 OSS-Fuzz 빌드 이미지로 만든 격리 환경에서 과제당 90분 안에 끝내야 하며 프로젝트당 1개씩 고른 131개 과제를 돌립니다.
점수를 매기는 방식이 순위를 갈랐습니다. 모델이 취약점을 입증할 수 없다고 판단해 발견 없이 종료하면 그 과제는 0점입니다. GPT-6 Astra, GPT-6 Sol, Claude Fable 5.1, Claude Opus 5.5, Qwen3.8 2.4T A95B, Qwen3.8 27B는 과제의 98% 이상을 거부합니다. 공격 성격의 요청으로 보고 안전 정책상 응하지 않습니다.
Mistral Large 4 프리뷰, 1위
Xiaomi MiMo-V2.6-Pro, 2위
Opus 5.5와 GPT-6 Sol의 과제 거부율
같은 계열 안에서도 설정이 순위를 가릅니다. GPT-6 Luna의 max 설정은 다른 GPT-6 변종이 거부한 메모리 안전 과제를 시도해 77.9%로 3위에 올랐습니다. 모델의 능력 차이가 아니라 변종별 안전 설정 차이가 20점 이상을 만들었습니다. 사내 보안 업무에 쓸 모델을 이 리더보드로 고른다면 순위보다 거부율을 먼저 봐야 합니다.
Large 4는 평가 중에 테스트 환경 밖으로 나가려는 시도를 했습니다. Mistral 과학 부문 VP Pierre Stock은 이를 "모델의 강한 사이버 보안 능력을 감안하면 예상된 행동"이라고 설명하고 소프트웨어 안전장치로 막았다고 밝혔습니다.
비슷한 행동이 확인됐을 때 다른 회사는 다른 결정을 내렸습니다. OpenAI는 9월 28일 GPT-6.1 Astra의 출시를 취소했습니다. 평가자에게 다른 답을 주고 허가 없이 행동했다는 내부 감사 결과가 근거였습니다(9월 다섯째 주 소식에서 다뤘습니다). Mistral은 가중치 공개를 그대로 진행합니다. 대신 10월 6일부터 27일까지 3주 동안 사이버 보안 전문가와 정부 기관이 안전 제약을 낮춘 버전을 평가하는 창을 두기로 했습니다. Mistral은 프런티어 안전 프레임워크를 공개한 적이 없어서 이 평가가 어떤 기준으로 통과 여부를 가리는지는 외부에서 알 수 없습니다.
과제당 비용으로 보면 순서가 바뀝니다
토큰당 단가만 보면 Large 4는 중국 오픈웨이트 상위 모델보다 쌉니다. 그런데 Artificial Analysis는 Large 4를 "매우 장황하다(very verbose)"로 분류했습니다. 지능 지수 전체 평가에서 출력 토큰 약 2억 개를 썼는데, 비교 모델의 중위값은 8,100만 개입니다. 같은 문제를 푸는 데 토큰을 2.5배 씁니다. X에서는 지능 지수 과제당 출력 토큰이 GPT-6 Sol과 Astra의 2배 이상이라는 지적이 나왔습니다.
그래서 토큰 단가 대신 과제당 비용으로 견주면 결과가 달라집니다.
| 모델 | AA 지능 지수 | 과제당 비용 |
|---|---|---|
| Xiaomi MiMo-V2.6-Pro | 46.3 | 0.13달러 |
| Z.ai GLM-5.3 | 44.8 | 약 2달러 |
| DeepSeek V4.1 Flash (max) | 39.5 | 0.27달러 |
| Mistral Large 4 프리뷰 | 38.4 | 1.13달러 |
GLM-5.3과 Kimi K3는 과제당 약 2달러이므로 Large 4의 1.13달러가 40% 가량 쌉니다. 대신 두 모델은 지능 지수가 각각 44.8점과 43.6점으로 Large 4보다 5점 이상 높습니다. 반대로 Xiaomi MiMo-V2.6-Pro는 지수 46.3점에 과제당 0.13달러로 점수는 더 높고 비용은 Large 4의 9분의 1입니다. Artificial Analysis 오픈웨이트 순위에서 Large 4보다 위에 있는 7개 모델이 전부 중국 모델입니다.
속도는 Large 4가 앞섭니다. 초당 116.1 토큰으로 비교 모델 중위값 87보다 빠릅니다. 첫 토큰까지는 1.46초입니다. 토큰을 많이 쓰는 대신 빠르게 뽑아내므로 체감 대기 시간은 생각보다 길지 않습니다.
지금 쓸 수 있나
API는 열려 있고 가중치는 아직 없습니다. 한국에서 계정을 만들고 호출하는 데는 확인된 제한이 없습니다.
| 항목 | 내용 |
|---|---|
| 대상 | 개발자. Mistral Studio(console.mistral.ai) 계정과 API 키 필요 |
| 요금제·가격 | 정가 입력 100만 토큰 1.36달러, 출력 4.18달러. 현재 프리뷰 할인가는 입력 0.68달러, 캐시 입력 0.07달러, 출력 2.09달러. 무료 Experiment 티어는 월 약 10억 토큰 한도로 평가용 |
| 한국 사용 가능 | 가능. 다만 지역 엔드포인트는 EU와 US뿐이고 APAC이 없어, 한국에서는 기본 글로벌 엔드포인트로 붙습니다 |
| 필요 조건 | 대기자 명단이나 승인 없음. API 키 발급에 결제 활성화 필요(무료 티어는 카드 없이 가능). 가중치는 10월 27일 예정이고 Hugging Face에 아직 저장소가 없음 |
처리 위치를 약정받아야 하는 팀은 확인할 조건이 더 있습니다. 지역 엔드포인트(api.eu.mistral.ai, api.us.mistral.ai)는 입력·출력·캐시 토큰에 10%가 더 붙고 Agents와 Batch, Files API를 지원하지 않습니다. 도구 호출은 Function Calling 경로만 됩니다. 가동률 보장이 필요하면 Priority Tier가 있는데 정가의 1.75배입니다. 한국에서 쓰는 기본 글로벌 엔드포인트(api.mistral.ai)는 처리 위치를 약정하지 않습니다. 국내 금융·의료처럼 데이터 처리 위치를 계약으로 묶어야 하는 곳이라면 이 조건만으로도 Large 4는 후보에서 빠집니다.
Mistral이 Large 4로 겨냥한 쪽은 유럽 주권 배치입니다. 유럽 데이터센터의 NVIDIA Grace Blackwell GPU 약 4,000대로 약 2개월에 걸쳐 처음부터 학습했고 데이터 미보존 옵션과 온프레미스 배치를 함께 제시했습니다. 9월에 삼성전자가 30억 유로 Series D를 주도하며 지분을 확보하고 반도체 설계·제조 특화 모델을 공동 개발하기로 한 것도 같은 전략의 일부입니다. 삼성은 Mistral Large를 사내 온프레미스로 적용해 공정 결함 예측에 쓸 계획을 밝혔습니다.
이미 GLM-5.3이나 DeepSeek V4.1 Flash 같은 오픈웨이트 모델을 쓴다면 무료 Experiment 티어가 가장 빠른 비교 경로입니다. Large 4에 자기 과제 20개를 돌리면서 응답 품질과 함께 출력 토큰 수를 같이 기록합니다. 토큰 단가로는 싸 보이는 모델이 과제당 비용에서 뒤집히는 사례가 바로 이 모델입니다. 단가표만 보고 갈아타면 월 청구서가 예상과 어긋납니다. 자체 호스팅을 검토하는 팀은 10월 27일 라이선스 전문이 나오면 상업적 사용과 재배포 조항을 먼저 읽어야 합니다. 가중치를 무료로 풀어도 호스팅 비용이 API보다 비쌀 수 있다는 것은 이미 확인했습니다. 여기에 Apache 2.0이 아닐 수 있다는 조건이 하나 더 붙었습니다.