K2 Horizon 6종 공개, 7B가 SWE-bench 70.6인데 훈련 코드는 README 한 줄
MBZUAI 산하 IFM이 9월 3일 K2 Horizon 6종을 Apache 2.0으로 공개했습니다. 7B가 SWE-bench Verified 70.6%로 Qwen3.5-9B를 앞섰지만 훈련 코드 저장소와 데이터셋 링크는 아직 닫혀 있습니다.
MBZUAI 산하 IFM이 9월 3일 K2 Horizon 6종을 Apache 2.0으로 공개했습니다. 7B가 SWE-bench Verified 70.6%로 Qwen3.5-9B를 앞섰지만 훈련 코드 저장소와 데이터셋 링크는 아직 닫혀 있습니다.
OpenAI가 9월 3일 GPT-6 Astra를 냈습니다. API 단가는 100만 토큰 10달러와 50달러로 GPT-5.6 Sol의 2.5배지만, 코딩에서는 Sol이 쓰던 토큰의 3분의 1만 씁니다. 독립 지수는 Sol과 같은 61점입니다.
Google이 9월 2일 Gemini 3.8 Flash를 공개했습니다. 단가는 3.7 Flash와 같은 100만 토큰당 0.75달러인데 DeepSWE는 65.3%에서 73.7%로 올랐고, 범용 에이전트 벤치마크는 19.1%로 Claude Opus 5의 51.8%에 못 미칩니다.
8월 20일 무료로 등장해 엿새 만에 OpenRouter 사용량 1위에 오른 익명 모델 ox-alpha의 정체가 GLM-5.3-Flash로 공개됐습니다. Zhipu가 같은 날 320B-A18B 가중치를 MIT로 풀었고 무료 기간은 끝났습니다.
Cerebras가 8월 18일 웨이퍼 3장을 한 랙에 넣은 CS-4를 공개했습니다. gpt-oss-120B에서 사용자당 초당 4400토큰, GPU보다 최대 30배를 내걸었지만 비교한 GPU 제품은 밝히지 않았습니다.
Anthropic이 7월 24일 Claude Opus 5를 공개했습니다. 가격은 Opus 4.8과 같은 100만 토큰당 $5/$25로 두고, 자사 벤치마크에서 프론티어 Fable 5에 근접하며 장기 실행 에이전트를 겨냥합니다.
Cisco Foundation AI가 취약점 위치 탐지에 특화한 오픈 웨이트 모델 Antares를 공개했습니다. 1B 모델이 753B GLM-5.2를 벤치마크에서 앞섰고, 500과제 평가를 1달러 미만에 끝냈습니다.
Alibaba가 2.4조 파라미터 Qwen3.8-Max-Preview를 공개했습니다. 벤치마크 표, 모델 카드, 라이선스, 활성 파라미터, 토큰당 요금이 모두 빠진 자리에 90%와 98% 할인 캠페인이 먼저 들어왔습니다.
Berkeley 연구자들이 공개한 Schema가 모델 가중치를 그대로 두고 ARC-AGI-3 공개셋 98.98%를 자체 보고했습니다. 같은 모델 조합의 Claude Code 기준선은 42.83%, ARC Prize가 검증한 공식 최고는 7.78%입니다.
Thinking Machines가 7월 15일 첫 모델 Inkling을 Apache 2.0으로 공개했다. 975B MoE로 미국 오픈웨이트 지능 지수 1위지만 회사는 최강이 아니라고 못 박고, 추론 과금 대신 Tinker fine-tuning으로 돈을 번다.
OpenAI가 7월 9일 GPT-5.6 세 모델(Sol·Terra·Luna)을 GA로 전환하고 기업 에이전트 ChatGPT Work를 함께 열었다. 토큰을 최대 63.5% 아끼지만 SWE-bench Pro는 Claude 계열에 15점 뒤진다.
xAI가 Cursor 세션 데이터로 학습한 Grok 4.5를 공개했다. 입력 100만 토큰당 2달러, 작업당 출력 토큰은 Opus 4.8의 4분의 1이다. 공개 벤치마크 4개 중 2개만 우위였고 CursorBench 학습 오염을 스스로 인정했다.