K2 Horizon 6종 공개, 7B가 SWE-bench 70.6인데 훈련 코드는 README 한 줄
MBZUAI 산하 IFM이 9월 3일 K2 Horizon 6종을 Apache 2.0으로 공개했습니다. 7B가 SWE-bench Verified 70.6%로 Qwen3.5-9B를 앞섰지만 훈련 코드 저장소와 데이터셋 링크는 아직 닫혀 있습니다.
- IFM이 K2 Horizon 6종을 공개했고 7B가 SWE-bench 70.6%입니다.
- 훈련 코드 저장소에는 README 한 줄뿐이고 데이터 링크는 401입니다.
- IFM은 자기 벤치마크 점수를 70.2에서 66.9%로 내렸습니다.
아랍에미리트 MBZUAI 산하 연구소인 Institute of Foundation Models(IFM)이 2026년 9월 3일 K2 Horizon 6종을 공개했습니다. 0.9B, 3.7B, 7B, 32B, 36B-A4B, 375B-A23B 여섯 크기이고 가중치와 코드 모두 Apache 2.0입니다.
IFM이 내세운 것은 크기가 아니라 공개 범위입니다. 보통 오픈 웨이트 모델은 완성된 가중치 파일만 내려받게 해줍니다. 그 모델이 어떤 데이터를 얼마나 섞어 학습했는지, 학습 도중 어느 시점에 어떤 능력이 생겼는지는 알 수 없습니다. IFM은 가중치에 더해 훈련 데이터, 훈련 코드, 학습 중간 체크포인트, 훈련 로그까지 함께 연다고 밝혔습니다. 발표 제목이 "Radically Open"입니다.
발표 당일 Hacker News에서 331점 124댓글이 붙었고, 그중 하나가 이 글의 출발점입니다. luckydata는 "사전학습·사후학습 저장소가 비어 있다, 발표를 너무 일찍 낸 것 같다"고 적었습니다. 직접 확인해 보니 사실이었습니다.
7B가 자기보다 큰 모델을 코딩에서 앞섰다
성능부터 봅니다. 작은 모델 쪽 숫자가 눈에 띕니다. 7B 모델이 SWE-bench Verified에서 70.6%를 냈습니다. 같은 차트에 실린 Qwen3.5-9B는 50.8%, IBM Granite-4.2 8B는 47.7%, Gemma-4 12B는 33.0%입니다. 자기보다 파라미터가 많은 세 모델을 20포인트 넘게 앞섰습니다.
SWE-bench Verified는 GitHub 실제 이슈를 모델에게 주고 저장소를 고쳐 테스트를 통과시키게 하는 평가입니다. 코딩 에이전트가 실무에서 하는 일과 가장 닮은 항목입니다.

다만 7B가 모든 항목에서 앞서지는 않습니다. 같은 차트를 옆으로 읽으면 갈립니다.
| 벤치마크 | K2 Horizon 3.7B | K2 Horizon 7B | Qwen3.5-9B |
|---|---|---|---|
| SWE-bench Verified | 68.6 | 70.6 | 50.8 |
| Terminal-Bench 2.1 | 25.1 | 39.1 | 29.2 |
| tau3-Banking (도구 사용) | 17.7 | 25.8 | 6.8 |
| GPQA Diamond (지식) | 65.4 | 77.1 | 80.6 |
| BFCL v4 (함수 호출) | 50.9 | 62.3 | 65.7 |
코드를 고치고 터미널을 다루고 은행 업무형 도구를 부리는 과제에서는 7B가 앞섭니다. 대학원 수준 과학 지식(GPQA)과 함수 호출 형식 정확도(BFCL)에서는 Qwen3.5-9B 쪽이 낫습니다. 에이전트 작업에 강하고 지식 문답에는 그만큼 강하지 않은 모델입니다.
플래그십은 사정이 다릅니다. 375B-A23B는 파라미터 3,750억 개를 담고 토큰당 230억 개만 쓰는 희소 MoE 구조에 512K 컨텍스트를 갖췄습니다. 그런데도 모델 카드에 실린 비교 대상보다 아래에 있습니다. 에이전트 평가 GDPVal-AA에서 Elo 1,441로 Claude Sonnet 5의 1,584보다 낮고 Terminal-Bench 2.1에서는 70.2%로 GPT-5.6 Luna의 80.9%에 못 미칩니다. Artificial Analysis 지능 지수로는 112개 모델 중 11위입니다. 이 발표에서 새 기록은 소형 구간에 있습니다.
자기 벤치마크 점수를 3.37포인트 깎아서 냈다
그 70.2%도 IFM이 그대로 두지 않았습니다. 375B-A23B를 Terminal-Bench 2.1의 89개 과제에 8회씩, 총 712회 돌려 500회를 통과시킨 결과가 70.2%입니다. 그 뒤 통과한 시행 전부를 부정행위 기준으로 다시 감사했습니다.
감사는 자기 기준이 아니라 Artificial Analysis의 리워드 해킹 판정 절차를 그대로 썼습니다. harbor analyze 도구, reward_hacking 판정 기준, 루브릭 원문을 그대로 가져왔고 심판 모델은 Codex gpt-5.6-sol입니다. 10개 과제에서 24개 시행이 지목됐고 나머지 79개 과제는 깨끗했습니다.
지목된 시행을 빼면 점수가 70.2%에서 66.9%로 내려갑니다. IFM은 이 3.37포인트를 흡수하지 않고 공개했습니다.

무엇이 부정행위였는지도 트레이스 로그로 냈습니다. 위 로그에서 모델은 과제 저장소에 벤치마크의 공식 테스트가 들어 있는 것을 발견하고 "Jackpot!"이라고 씁니다. 이어 암호화된 WAL 파일을 내려받아 XOR 키 0x42로 복호화해 기대 데이터를 그대로 복원하는 계획을 세웁니다. 문제를 푼 것이 아니라 정답지를 찾은 것입니다. 7B에서도 같은 일이 있었습니다. SWE-bench 정답을 내려받아 82점이 나왔고 IFM은 그 점수를 폐기했습니다.
랩이 자기 점수를 공개적으로 내리는 일은 드뭅니다. IFM은 안 낸 것도 표시해 두는 쪽입니다. 공개 범위를 따질 때 이 점을 염두에 두면 됩니다.
완전 공개에서 지금 손에 잡히는 것
발표문을 다시 읽으면 시제가 갈려 있습니다. IFM 블로그의 해당 문장은 "For every Horizon model, we will release"로 시작합니다. 낼 것이지 낸 것이 아닙니다. 데이터셋에도 "재배포가 불가능한 경우에는 데이터가 어떻게 구성되고 섞였는지를 공개한다"는 단서를 달았습니다.
모델 카드는 크기마다 다르게 적혀 있습니다.
| 모델 | 모델 카드 문구 | 지금 상태 |
|---|---|---|
| 7B, 3.7B | 데이터와 레시피, 훈련 코드가 공개되어 있다(are public) | 현재형 |
| 375B-A23B, 36B-A4B | 데이터와 훈련 코드를 공개할 예정이다(will be made public) | 예고 |
| 32B | "최종 체크포인트는 추후 공개", 지금 받는 것은 Stage 1 | 미완성 |
2026년 9월 5일 기준으로 링크를 직접 눌러 확인한 결과입니다.
- 375B, 36B, 32B, 7B, 3.7B 다섯 모델 카드가 걸어 둔 데이터셋
IFM/K2-Horizon-Pretrain-Data와IFM/K2-Horizon-Midtrain-Data는 HTTP 401을 반환합니다. 공개된 적이 없는 저장소입니다. - 사후학습 코드 저장소
github.com/ifm-ai/horizon-post-train에는.gitignore와LICENSE, 101바이트짜리README.md가 전부입니다. README 본문은 "Post training code for IFM K2 Horizon. Stay tuned! Something is on the Horizon."입니다. - 사전학습 코드 저장소는
ifm-ai조직에 아예 없습니다. 공개 저장소가 세 개뿐이고 그중 실제 코드가 든 것은 추론 가속 기법 Uno Diffusion 하나입니다.
그렇다고 아무것도 안 열린 것은 아닙니다. K2 Horizon 컬렉션에는 데이터셋 다섯 개가 실제로 올라와 있습니다. 웹 코퍼스 TxT360-v2(CC-BY-4.0)와 SFT-Reasoning, Code-Reasoning, Math-Reasoning, Pretrain-Behaviors(모두 Apache 2.0)입니다. 열린 것은 범용 재료이고 닫힌 것은 모델별 배합비입니다. 사전학습 토큰 약 20조 개 중 17%가 추론 궤적이고 합성 토큰이 약 10조 개라는 설명은 블로그에 있습니다. 그 비율을 재현할 파일은 아직 없습니다.
가중치만 받아 돌리는 개발자에게는 이 구분이 상관없습니다. 데이터 출처를 감사하거나 같은 레시피로 다시 학습하려던 팀은 소형 두 종을 제외하면 기다려야 합니다.
지금 받아 쓸 수 있나
접근 조건은 단순한 편입니다.
| 항목 | 내용 |
|---|---|
| 대상 | 누구나. 계정 승인이나 대기자 명단 없음 |
| 가격 | 가중치 무료, Apache 2.0. 상용 배포와 파인튜닝 모두 허용 |
| 한국 사용 | 가능. Hugging Face 저장소에 지역 제한이나 접근 게이트가 없음 |
| 실행 환경 | vLLM, SGLang, Ollama 지원. 375B-A23B는 H200 8장 노드 기준 레시피 |
주의할 점이 둘 있습니다. 첫째, K2 Horizon은 OpenRouter에도 Ollama 공식 라이브러리에도 아직 없습니다. API로 불러 써보려면 Hugging Face에서 직접 받아 띄워야 합니다. IFM은 Compass, Cerebras, AWS, Nebius를 추론 파트너로 밝혔습니다.
둘째, GGUF 저장소에 BF16 파일 하나씩만 올라와 있습니다. 7B가 약 15GB, 32B가 약 64GB입니다. IFM은 0.9B를 시계와 안경용, 32B를 로컬 워크스테이션용이라고 소개했는데 그 용도는 4비트나 8비트 양자화를 전제합니다. 그 양자화 파일을 IFM이 아직 내지 않았습니다. FP8 변형은 별도 저장소에 있습니다.
커뮤니티 반응도 크기별로 갈립니다. kennywinker는 7B가 훨씬 큰 Qwen 모델과 코딩에서 맞먹는다면 램 8GB 기기에서도 로컬 코딩이 된다고 봤습니다. 반대로 a11r는 32B가 MIT로 풀린 GLM 계열이나 Qwen3.8 27B에 못 미친다고 지적했습니다. cogman10은 3.7B가 기본 코딩 과제에서 실패하고 존재하지 않는 API를 지어냈다고 보고했습니다.
로컬에서 코딩 에이전트를 돌리는 개발자라면 7B를 받아 자기 저장소의 실제 이슈 하나를 맡겨 보는 것이 이 발표에서 가장 빨리 답이 나오는 일입니다. SWE-bench 70.6이라는 숫자가 자기 코드베이스에서도 재현되는지가 유일하게 의미 있는 검증입니다. IFM 스스로 벤치마크 오염 사례를 두 건 공개한 만큼 남의 점수표보다 자기 저장소 결과가 낫습니다. 훈련 데이터와 코드를 근거로 감사나 재학습을 계획하는 팀이라면 ifm-ai/horizon-post-train 저장소에 실제 코드가 커밋되는 시점까지 결정을 미루면 됩니다. 지금 그 저장소에 있는 것은 README 한 줄입니다.