Devlery
Blog/Open Source

OpenRouter 1위 익명 모델 Ox Alpha, 정체는 MIT로 풀린 GLM-5.3-Flash

8월 20일 무료로 등장해 엿새 만에 OpenRouter 사용량 1위에 오른 익명 모델 ox-alpha의 정체가 GLM-5.3-Flash로 공개됐습니다. Zhipu가 같은 날 320B-A18B 가중치를 MIT로 풀었고 무료 기간은 끝났습니다.

OpenRouter 1위 익명 모델 Ox Alpha, 정체는 MIT로 풀린 GLM-5.3-Flash
AI 요약
  • OpenRouter 1위 익명 모델 ox-alpha의 정체는 GLM-5.3-Flash입니다.
  • 320B 가중치가 MIT로 풀렸지만 FP8만 306GiB입니다.
  • 무료는 끝났고 9월 9일까지 입력 100만 토큰 0.075달러입니다.

2026년 8월 20일 OpenRouter와 OpenCode, Cline에 ox-alpha라는 이름만 붙은 모델이 무료로 올라왔습니다. 누가 만들었는지 밝히지 않은 채였습니다. 엿새 뒤인 8월 26일 중국 Zhipu AI(Z.ai)가 이 모델이 GLM-5.3-Flash라고 확인하고 같은 날 Hugging Face에 MIT 라이선스로 가중치를 공개했습니다.

정체를 숨긴 채 모델을 먼저 풀어 사용 기록을 모으는 방식을 스텔스 출시라고 부릅니다. 이번 건이 눈에 띈 이유는 규모입니다. OpenRouter 집계 기준 ox-alpha는 엿새 동안 약 42조 토큰을 처리했고 한때 DeepSeek 계열 모델 사용량의 두 배를 넘겼습니다. OpenRouter에서 이만한 사용량이 나온 것은 DeepSeek Flash가 56일 동안 1위를 지킨 이후 처음입니다.

엿새 동안 무슨 일이 있었나

무료였기 때문에 몰린 것이 맞습니다. 다만 무료 모델이 늘 1위를 하지는 않습니다. ox-alpha는 컨텍스트 105만 토큰에 최대 출력 13만 토큰, 텍스트와 이미지, 비디오를 모두 입력으로 받는 사양으로 등장했습니다. 이 조합을 무료로 쓸 수 있는 곳이 달리 없었습니다.

8월 20일

OpenRouter·OpenCode·Cline·Nous Research portal+에 ox-alpha 무료 등재. 제작사 비공개

8월 21일부터 25일까지

OpenRouter 사용량 1위 등극. 캐시 적중률 약 77.9%, 지식 컷오프 2025년 11월로 확인

식별 시도

토크나이저 지문 11개 지표가 GLM 계열과 일치. 숫자 프로빙에서 29토큰 소비(GLM과 동일, DeepSeek은 98)

8월 26일

Z.ai가 GLM-5.3-Flash로 확인. 같은 날 Hugging Face에 MIT 가중치 공개, 무료 슬롯 종료

식별 근거가 된 것은 토크나이저입니다. 모델마다 문장을 토큰으로 자르는 사전이 달라서 같은 문자열을 넣었을 때 몇 토큰으로 세는지를 보면 계열을 좁힐 수 있습니다. 커뮤니티가 숫자 문자열을 넣어 본 결과 ox-alpha는 29토큰을 썼습니다. GLM 계열과 같은 값입니다. DeepSeek은 같은 입력에 98토큰을 씁니다. 지표 11개가 모두 GLM을 가리켰습니다.

Z.ai는 공개 발표에서 미리보기 기간 동안 이 모델이 전량 중국산 AI 칩에서 서빙됐다고 밝혔습니다. Zhipu는 앞서 GLM-5.1로 SWE-Bench Pro 1위를 기록했을 때도 Huawei Ascend 기반 학습을 강조했습니다.

320B 중 18B만 켜는 모델

GLM-5.3-Flash는 파라미터가 3200억 개지만 토큰 하나를 만들 때는 그중 180억 개만 씁니다. 전문가 여러 개를 두고 입력에 맞는 것만 골라 켜는 MoE 구조입니다. 계산량이 180억 개짜리 모델 수준이라 값이 싸집니다. 품질은 3200억 개가 나눠 가진 지식에서 나옵니다.

GLM-5 계열에서 처음으로 이미지와 비디오를 그대로 받는 네이티브 멀티모달 모델이기도 합니다. 화면을 캡처해 넣으면 렌더링 결과와 상호작용 반응을 보고 판단하는 용도를 겨냥했습니다. 어텐션은 희소 어텐션과 선형 어텐션을 섞었습니다. Z.ai는 이 조합으로 KV 캐시(대화가 길어질수록 쌓이는 메모리)를 이전 GLM의 4.44분의 1로 줄였다고 밝혔습니다. 긴 대화를 오래 끄는 에이전트에서 서빙 비용이 여기서 갈립니다.

Z.ai가 공개한 공식 비교 차트에는 벤치마크 6개에 모델 6개가 나란히 놓여 있습니다. 여기서 GLM-5.3-Flash가 1위인 항목은 하나뿐입니다.

GLM-5.3-Flash 공식 벤치마크 비교 차트. 6개 항목을 5개 경쟁 모델과 나란히 놓은 막대 그래프

1위는 GDPVal-AA v2 하나입니다. 1773점으로 2위 DeepSeek-V4-Vision-Exp의 1675점을 앞섰습니다. 이 항목은 Artificial Analysis가 대신 평가했습니다.

코딩 항목은 사정이 다릅니다. Terminal Bench 2.1에서 84.3점을 받았는데 GPT-5.6 Terra가 87.4점, Gemini 3.7 Flash가 85.8점, Claude Opus 4.8이 85.0점입니다. 여섯 중 넷째입니다. DeepSWE v1.1도 63.4점으로 GPT-5.6 Terra의 69.6점과 Gemini 3.7 Flash의 65.3점에 밀립니다. Agents' Last Exam은 26.3점으로, 직전 모델 GLM-5.2(20.4점)를 뺀 모든 비교 대상보다 낮습니다.

프런티어 모델을 이긴 것이 아니라 붙었습니다. 모델 카드에 적힌 표현도 "Claude Opus 4.8에 근접"이지 능가가 아닙니다. Claude Opus 4.8과는 항목별로 갈립니다. DeepSWE(63.4 대 58.0)와 AutomationBench(48.8 대 41.0)에서는 앞서고 Terminal Bench(84.3 대 85.0)와 HLE 도구 사용(55.3 대 57.9)에서는 뒤집니다.

점수가 아니라 값을 붙이면 계산이 달라집니다. Claude Opus 4.8은 100만 토큰 기준 입력 5달러, 출력 25달러입니다. GLM-5.3-Flash 정가는 입력 0.15달러, 출력 0.50달러입니다. 출력 기준 50분의 1입니다. 모델 카드에 적힌 "10분의 1 가격"은 Claude가 아니라 직전 모델 GLM-5.2와 견준 값입니다.

직전 모델과 견주면 격차가 큽니다. AutomationBench는 26.2점에서 48.8점으로, DeepSWE는 46.2점에서 63.4점으로 올랐습니다. 두 항목 모두 도구를 여러 번 호출하며 작업을 끝내는 능력을 봅니다.

독립 평가는 다르게 말합니다

Artificial Analysis가 별도로 측정한 결과는 강점과 약점이 갈립니다. Intelligence Index v4.1.1에서 57점을 받아 동급 108개 모델 중 3위에 올랐습니다. 비슷한 규모의 오픈 웨이트 모델 중앙값이 27점이니 두 배가 넘습니다.

57점

Intelligence Index (동급 중앙값 27)

48.7

초당 출력 토큰 (중앙값 67)

1.5억

지수 완주 출력 토큰 (중앙값 1.1억)

문제는 뒤의 두 숫자입니다. 초당 48.7토큰은 같은 급 모델 중앙값 67토큰보다 느립니다. 같은 평가를 완주하는 데 쓴 출력 토큰은 1억 5000만 개, 중앙값은 1억 1000만 개입니다. 답을 길게 쓰는 모델입니다. 출력 토큰으로 요금이 매겨지는 API에서는 단가가 싸도 청구서가 그만큼 덜 내려갑니다. 첫 토큰까지 걸리는 시간은 1.52초로 중앙값 2.14초보다 빨랐습니다.

오래 걸리더라도 정확도가 필요한 백그라운드 작업에는 유리하고 사람이 화면 앞에서 기다리는 대화형 용도에는 불리합니다.

지금 쓰려면 얼마인가

무료 슬롯은 닫혔습니다. ox-alpha는 1주 무료로 안내된 미리보기였고 정체가 공개되면서 정식 등재로 넘어갔습니다. 8월 20일부터 쓰던 설정을 그대로 두면 이제 과금됩니다.

경로대상가격 (100만 토큰)조건
OpenRouter z-ai/glm-5.3-flash계정만 있으면 누구나입력 0.075달러, 출력 0.25달러, 캐시 읽기 0.015달러9월 9일 24:00 UTC+8까지 50% 할인. 이후 2배. 공급자 6곳(Z.ai·NovitaAI·GMICloud·Cloudflare·DeepInfra·io.net)
Z.ai API glm-5.3-flashAPI 키 발급 개발자입력 0.15달러, 출력 0.50달러, 캐시 입력 0.03달러OpenAI 호환 형식. 함수 호출·스트리밍·JSON 구조화 출력 지원
GLM Coding Plan구독자월 18달러부터GLM-5.3의 3배 쿼터, 비혼잡 시간 추가 50% 할인
자체 호스팅가중치 다운로드무료 (MIT)FP8 체크포인트 약 306GiB, BF16은 약 2배. vLLM은 Hopper 이상만 지원

한국에서 쓸 수 있습니다. Z.ai 국제 API와 OpenRouter 모두 지역 제한을 공지하지 않았고 OpenRouter 공급자 목록에 Cloudflare와 DeepInfra 같은 글로벌 사업자가 들어 있습니다. 중국 본토용 open.bigmodel.cn과 국제용 z.ai는 별도 플랫폼이니 계정을 만들 때 후자를 씁니다.

MIT 라이선스로 풀렸다는 말과 내 서버에서 돌릴 수 있다는 말은 다릅니다. 사내 상업 배포와 수정이 법적으로 자유로운 것은 맞습니다. 그러나 FP8 체크포인트만 약 306GiB이고 여기에 KV 캐시가 더 붙습니다. H200 8장 노드급 장비가 필요하고 vLLM 구현은 Hopper 이상 NVIDIA GPU만 지원합니다. llama.cpp에는 아직 glm5_next 지원이 없어 공식 GGUF도 없습니다. 노트북에 올려 보려던 계획이라면 지금은 성립하지 않습니다.

같은 날 Alibaba도 Qwen4 구조를 미리 보이는 Qwen3.8-Flash-Next를 오픈 웨이트로 공개했습니다. 이쪽은 라이선스가 MIT가 아니라 qwen-community-1.0이고 호스팅 API도 아직 열리지 않았습니다. 중국 두 곳이 하루 사이에 오픈 웨이트 두 건을 냈습니다. 라이선스 자유도와 오늘 쓸 수 있는지에서는 GLM 쪽이 앞섭니다.

지난주 ox-alpha를 코딩 에이전트에 연결해 써 봤다면, 모델 문자열을 z-ai/glm-5.3-flash로 바꾸기 전에 확인할 것은 그 일주일치 출력 토큰량입니다. Artificial Analysis 측정대로 이 모델이 같은 일을 하면서 중앙값보다 36% 많은 토큰을 출력한다면, 입력 100만 토큰 0.075달러라는 단가는 실제 청구서에서 그만큼 상쇄됩니다. 9월 9일까지는 할인가라 비교가 왜곡됩니다. 두 배로 오른 정가 기준으로 계산해 두고 그 숫자와 지금 쓰는 모델의 월 청구서를 나란히 놓으면 됩니다.