GPT-6 Sol과 Luna 출시, 값은 절반인데 코딩 점수는 72.7%에서 68.8%로
OpenAI가 9월 22일 GPT-6 Sol과 Luna를 공개했습니다. 입력 100만 토큰이 Sol 2달러, Luna 0.10달러로 전작의 절반이고, DeepSWE 최고 점수는 전작 72.7%보다 낮은 68.8%입니다.
- GPT-6 Sol은 입력 100만 토큰 2달러, 전작 GPT-5.6 Sol의 절반입니다.
- DeepSWE 최고 점수는 전작 72.7%에서 68.8%로 내려갔습니다.
- 입력이
272,000토큰을 넘으면 인하분이 사라집니다.
OpenAI가 9월 22일 gpt-6-sol과 gpt-6-luna를 API에 올렸습니다. 3주 전 나온 GPT-6 Astra까지 합쳐 GPT-6 계열이 세 등급으로 채워졌습니다.
발표문이 앞세운 것은 성능이 아니라 값입니다. "캐싱과 추론이 개선돼 더 낮은 비용으로 서비스할 수 있게 됐고, 그 절감분을 그대로 사용자에게 돌려준다"고 썼습니다. GPT-5.6 Sol은 입력 100만 토큰에 4달러, 출력에 20달러를 받았습니다. GPT-6 Sol은 2달러와 10달러입니다. GPT-5.6 Luna는 0.20달러와 1.20달러였고 GPT-6 Luna는 0.10달러와 0.50달러입니다. VentureBeat에 OpenAI 대변인은 이 값이 프로모션이 아니라 영구 요금이라고 확인했습니다. 같은 날 Anthropic이 공개한 Claude Opus 5.5는 입력 100만 토큰에 4달러를 받습니다.
| 모델 (100만 토큰) | 입력 | 캐시 입력 | 출력 |
|---|---|---|---|
| GPT-6 Astra | 10달러 | 1달러 | 50달러 |
| GPT-6 Sol | 2달러 | 0.20달러 | 10달러 |
| GPT-5.6 Sol (전작) | 4달러 | 0.40달러 | 20달러 |
| GPT-6 Luna | 0.10달러 | 0.01달러 | 0.50달러 |
| GPT-5.6 Luna (전작) | 0.20달러 | 0.02달러 | 1.20달러 |
전작보다 나아진 것
발표문이 전작 대비 향상으로 명시한 항목은 넷입니다.
사실성이 가장 큰 폭으로 올랐습니다. OpenAI는 사용자가 오답이라고 표시한 실제 대화를 모아 내부 평가를 만들었습니다. 이 평가에서 GPT-6 Sol이 낸 오류는 전작의 "약 절반"이었습니다. Luna도 노력 설정을 올리면 GPT-5.6 Sol과 같은 수준을 100분의 1 비용에 낸다고 했습니다. 독립 평가 기관 Artificial Analysis가 잰 환각률도 GPT-5.6 Sol 92%에서 GPT-6 Sol 60%로 내려갔습니다.
코드가 그대로 병합될 수준인지 재는 FrontierCode는 전작보다 올랐습니다. 다만 발표문은 "상당히 향상됐다"고만 쓰고 두 모델의 점수를 나란히 싣지 않았습니다.
업무 자동화에서 Luna가 전작보다 5.4%p 높습니다. AutomationBench 1.0.6은 47개 도구를 오가며 영업·마케팅·재무 업무를 끝내는지 봅니다. 이 평가에서 high 노력의 GPT-6 Luna가 GPT-5.6 Luna보다 5.4%p 앞서면서 과제당 비용은 58% 낮았습니다.
캐시 할인이 커졌습니다. 같은 문맥을 반복해서 보내는 에이전트는 이미 처리한 부분을 다시 보낼 때 요금을 덜 냅니다. GPT-6는 이 캐시된 입력에 90% 할인이 붙고 기본 적중률도 올랐습니다. GitHub은 최근 수개월간 새로 처리해야 하는 프롬프트 토큰 비중이 50% 넘게 줄어 Copilot 응답이 빨라졌다고 OpenAI에 보고했습니다.
최고 점수는 전작 아래입니다
발표문은 DeepSWE와 OSWorld에서 전작 점수를 싣지 않았습니다. 비교 대상이 전부 Claude입니다. GPT-6 Sol의 DeepSWE v1.1 68.8%는 "Claude Fable 5의 최고 점수 69.9%에 1.1%p 이내로 접근하면서 과제당 비용은 약 80% 낮다"는 문장에 붙어 있습니다.
전작과 나란히 놓으면 그림이 달라집니다. GPT-5.6 Sol이 공개 당시 받은 DeepSWE v1.1 최고 점수는 72.7%였습니다. OSWorld 2.0도 65.7%에서 60.5%로 내려갔습니다. 이 전작 수치는 OpenAI 발표문이 아니라 두 모델을 같은 표에 놓은 제3자 집계(orcarouter, digitalapplied)에서 왔습니다.
| 평가 | GPT-6 Sol | GPT-5.6 Sol | GPT-6 Luna |
|---|---|---|---|
| DeepSWE v1.1 (실제 저장소 과제) | 68.8% | 72.7% | 66.6% |
| OSWorld 2.0 (컴퓨터 조작) | 60.5% | 65.7% | 58.1% |
| 과제당 비용 (DeepSWE) | 2.74달러 | 6.46달러 | 미제공 |
| 환각률 (Artificial Analysis) | 60% | 92% | 77% |
같은 돈을 쓰면 순서가 뒤집힙니다. GPT-6 Sol을 high 노력으로 돌리면 DeepSWE에서 0.64달러에 65.3%를 받습니다. GPT-5.6 Sol을 medium으로 돌리면 1.42달러에 61.1%입니다. 예산을 고정하고 비교할 때는 새 모델이 더 싸고 더 잘합니다. 최고 노력까지 올려 최고점을 뽑아야 하는 작업에서만 전작이 4%p 정도 앞섭니다.
문서 작업은 오히려 내려갔습니다. Artificial Analysis는 스프레드시트·메모·슬라이드 품질을 재는 GDPval-AA v2.1에서 Sol이 약 100 Elo, Luna가 약 75 Elo 떨어졌다고 집계했고 원인으로 결과물의 완성도와 누락을 들었습니다. Luna는 코딩 에이전트 지표도 43에서 41로 내려갔습니다. 같은 문제를 푸는 데 쓰는 출력 토큰은 4만 1천에서 5만 1천으로 늘었습니다.
지금 쓸 수 있나
두 모델 모두 신청이나 대기자 명단 없이 열려 있습니다. 한국에서도 그대로 씁니다. OpenAI는 한국 법인을 두고 있고 ChatGPT Enterprise·Edu와 API 플랫폼에 한국 데이터 레지던시를 제공합니다.
| 경로 | 대상 | 조건 |
|---|---|---|
| API | 모든 개발자 | API 키만 있으면 됩니다 |
| ChatGPT Work, Codex | Plus, Pro, Business, Enterprise, Edu | 순차 배포. 안 보이면 나중에 다시 시도 |
| 데스크톱 앱 | Free, Go | Luna만 |
| 일반 Chat 화면 | 해당 없음 | 아직 들어가지 않았습니다 |
컨텍스트 105만 토큰, 최대 출력 12만 8천 토큰으로 Astra와 같습니다. 지식 컷오프는 Sol이 2026년 4월 20일, Luna가 5월 18일입니다. 추론 노력은 none부터 max까지 여섯 단계이고 기본값은 medium입니다.
옮기기 전에 확인할 숫자 하나
인하가 모든 요청에 적용되지는 않습니다. 입력이 27만 2천 토큰을 넘으면 장문맥 요금으로 바뀌어 Sol은 입력 4달러, 출력 15달러가 됩니다. 입력 단가가 GPT-5.6 Sol과 같아지므로 절반이라는 계산이 사라집니다. 긴 문서를 통째로 넣는 검색 작업이라면 인하분을 못 받습니다.
속도도 방향이 갈립니다. Artificial Analysis 측정에서 출력 속도는 초당 72.6 토큰에서 104.4 토큰으로 44% 빨라졌지만 첫 토큰이 나오기까지 걸리는 시간은 100초대로 길어졌습니다. 답이 흐르기 시작할 때까지 사람이 화면을 보고 기다리는 제품이라면 체감이 나빠질 수 있습니다.
이번 출시로 새로 열린 것은 능력이 아니라 예산입니다. Artificial Analysis도 "과제당 비용은 절반으로 줄었지만 지능 점수는 GPT-5.6 수준에 머물렀다"고 평가했습니다. 그래도 같은 예산에서는 새 모델이 앞서고 오답률은 눈에 띄게 줄었습니다. OpenAI는 같은 발표문에서 사내 연구자 1인당 하루 토큰 사용액이 API 가격 기준 중앙값 600달러, 90분위 7000달러라고 공개했습니다. 값이 내려가면 시킬 수 있는 일의 양이 달라진다는 근거로 든 수치입니다.
이미 GPT-5.6 Sol을 API로 쓰고 있다면, 지난 한 주 요청 로그에서 입력 토큰의 95분위가 27만 2천 아래인지부터 재보면 됩니다. 아래라면 모델 ID 한 줄만 바꿔도 청구서가 절반이 됩니다. 위라면 장문맥 요금 때문에 옮길 이유가 크게 줄어듭니다. 대화형 화면에 붙여 쓰는 경우에는 첫 응답이 나오는 시간을 같이 재서 비교하면 됩니다.