Devlery
Blog/Nvidia

IOI 2026 인간 1위 넘은 Nvidia 550B, 점수를 올린 건 모델보다 재시도 200번

Nvidia Nemotron-3-Ultra-CC가 IOI 2026에서 535.4점을 받아 인간 최고 득점 498.27점을 넘었습니다. 논문 수치를 보면 점수의 대부분은 사후학습이 아니라 후보를 200개씩 다시 뽑는 테스트타임 루프에서 나왔습니다.

IOI 2026 인간 1위 넘은 Nvidia 550B, 점수를 올린 건 모델보다 재시도 200번
AI 요약
  • IOI 2026에서 Nvidia 550B가 535.4점, 인간 1위는 498.27점입니다.
  • 점수를 올린 건 학습보다 후보 200개를 다시 뽑는 5라운드 루프입니다.
  • 체크포인트는 아직 없고, 실행에 GB300 760장이 들어갔습니다.

Nvidia 연구팀이 만든 550B 모델이 국제정보올림피아드(IOI) 2026 문제 세트에서 600점 만점에 535.40점을 받았습니다. 같은 문제를 푼 참가자 368명 중 1위인 중국의 Qiwen Xu가 498.27점, 금메달 커트라인이 361.12점입니다. 논문은 "AI 시스템이 IOI 문제 세트에서 최고 득점 인간 참가자를 넘어선 첫 사례"라고 적었습니다.

근거 문서는 9월 2일 arXiv에 올라온 Post-Training Language Models for Gold-Medal Performance in Coding Competitions입니다. CC BY 4.0으로 공개됐고 저자는 Nvidia의 Aleksander Ficek 외 4명입니다. 대회는 8월 9일부터 16일까지 우즈베키스탄 타슈켄트에서 열렸습니다. 이 시스템은 대회가 진행되는 동안 문제가 공개되기 전에 실시간으로 돌았습니다. 다만 논문이 함께 밝힌 대로 공식 참가자는 아니었고 실행도 IOI 감독을 받지 않았습니다.

기반 모델보다 얼마나 올랐나

경쟁 프로그래밍용으로 특화한 두 모델을 새로 만들었습니다. 30B 크기 Nemotron-3-Nano-CC와 550B 크기 Nemotron-3-Ultra-CC입니다. 둘 다 6월 4일 Hugging Face에 공개된 기존 Nemotron 3 모델에서 출발해 경쟁 프로그래밍 문제 22,000건으로 다시 학습했습니다.

한 문제를 한 번만 풀게 했을 때(Score@1) IOI 2025 점수 기준으로 보면 이렇습니다.

모델기반 모델특화 후
30B (Nano)21.7%48.5%
550B (Ultra)45.5%50.7%

특화 학습은 큰 모델에 별로 듣지 않았습니다. 작은 모델은 21.7%에서 48.5%로 두 배 넘게 올랐습니다. 550B는 45.5%에서 50.7%로 5.2%p 오르는 데 그쳤습니다. IOI 2026의 535.40점은 여기서 나온 숫자가 아닙니다.

점수의 대부분은 재시도에서 나왔다

논문이 GenCorrect라고 부르는 절차가 있습니다. 한 문제를 한 번 풀고 끝내는 대신, 여러 개 풀어 채점받고 그 결과를 보고 다시 푸는 루프입니다.

30B 모델 Nano-CC를 지도학습(SFT)과 강화학습(RL), 그리고 GenCorrect까지 차례로 거치게 하면서 잰 IOI 2025 점수입니다.

단계점수증가
기반 모델130
SFT 3에포크280+150
RL 1에포크291+11
GenCorrect 5라운드468+177

루프가 가장 크게 올렸습니다. 모델을 고친 두 단계가 합쳐서 161점, 모델을 그대로 두고 여러 번 시도한 단계가 177점입니다. 468점은 IOI 2025 금메달 커트라인 438.3점을 넘습니다. 그 선을 넘긴 것은 학습이 아니라 마지막 루프였습니다.

GenCorrect 한 라운드: 후보 200개 생성에서 제출 10개, 예시 3개까지

한 라운드는 이렇게 돕니다.

  1. 문제 하나에 후보 해법을 최대 200개 생성합니다(IOI 2026 마지막 라운드는 1,000개).
  2. 점수를 보지 않은 채로 코드를 토큰 단위로 군집화해 서로 다른 대표 10개를 고릅니다.
  3. 대회 공식 채점 서버에 10개를 제출하고 서브태스크별 점수를 받습니다.
  4. 서브태스크마다 가장 높았던 결과를 누적하고 상위 3개를 다음 라운드의 예시로 넣습니다.
  5. 5라운드를 반복해 총 50회를 제출합니다. IOI가 인간에게 허용하는 제출 한도와 같은 수치입니다.

여기서 채점 신호는 모델이 스스로 만든 테스트가 아닙니다. IOI 공식 채점기가 돌려주는 서브태스크별 점수입니다. ICPC에서는 통과와 실패의 이진 신호를 씁니다. 실행해서 나온 결과가 다음 생성을 이끕니다.

한 번에 풀게 하면 순위가 뒤집힌다

Ultra-CC가 경쟁 프로그래밍 모델 중 가장 잘하는 것은 아닙니다. 논문 Table 1의 IOI 2025 Score@1을 보면 특화하지 않은 다른 모델들이 위에 있습니다.

모델Score@1ICPC Pass@1
GLM-5.266.0%65.7%
DeepSeek-V4-Pro56.8%69.6%
DeepSeek-V4-Flash55.3%65.8%
Ultra-CC50.7%57.4%
Nano-CC48.5%51.0%
gpt-oss-120b40.7%45.8%

순서는 후보를 200개 뽑았을 때(Score@200)도 그대로입니다. 원점수로 Ultra-CC가 505점, MIT 라이선스로 풀린 GLM 계열의 GLM-5.2가 564점입니다.

대회용 시스템은 GLM-5.2가 생성한 추론 트레이스로 지도학습했습니다. 교사가 66.0%, 그 데이터로 배운 학생이 59.4%입니다. 논문이 이 교환을 정당화하는 근거는 출력 길이입니다. GLM-5.2의 평균 생성 길이가 85,927토큰인데 일반 파이프라인이 쓴 DeepSeek-V4-Flash는 120,456토큰입니다. 같은 추론 시간 안에 후보를 더 많이 만들 수 있는 쪽이 유리하다는 계산입니다.

같은 계산이 양자화 결정에도 적용됐습니다. NVFP4로 정밀도를 낮추면 Score@1이 BF16의 59.4%에서 52.8%로 6.6%p 내려가지만 처리량은 GPU당 초당 199.1토큰에서 736.8토큰으로 3.7배 오릅니다. 대회용 시스템은 정확도를 깎고 처리량을 샀습니다.

이 방법이 성립하려면 채점기가 있어야 한다

GenCorrect는 채점해주는 서버가 있어야 돌아갑니다. IOI에는 서브태스크별 부분 점수를 즉시 돌려주는 공식 채점기가 있습니다. 논문의 루프는 그 신호에 전적으로 의존합니다. 저자들도 "우리 결과는 경쟁 프로그래밍 밖으로 일반화되지 않을 수 있다"고 적었습니다.

비용도 대회 규격입니다. 라이브 추론 배포에 NVIDIA GB300을 피크 기준 최대 760장 할당했습니다. 논문은 이를 두고 "동일 시간·제출 한도 아래의 시스템 수준 비교로 해석해야 하며, 인간 참가자와의 동등 자원 비교가 아니다"라고 밝혔습니다.

두 해 점수를 나란히 놓는 것도 조심해야 합니다. 2025년에는 OpenAI 내부 추론 모델이 IOI 2025에서 533.29점으로 330명 중 6위였습니다. 숫자만 보면 535.40점과 비슷하지만 문제 세트가 다릅니다. IOI 2025의 금메달 커트라인은 438.30점이었고 IOI 2026은 361.12점입니다. 2026년 문제가 더 어려워 인간 점수대가 통째로 내려앉았습니다. 인간 1위 점수 498.27점도 그 아래에서 나온 값입니다.

지금 이 모델을 내려받을 수는 없습니다.

항목내용
대상개발자. Ultra-CC·Nano-CC 체크포인트는 미공개
가격논문과 방법은 CC BY 4.0으로 무료. 기반 모델 Nemotron-3-Ultra-550B-A55B는 OpenRouter에서 입력 100만 토큰 0.625달러, 출력 3.125달러이고 무료 티어도 있음
한국 사용가능. Hugging Face와 OpenRouter 모두 지역 제한 없음
필요 조건대회용 체크포인트는 NeMo-Skills 저장소에 공개 예정. 학습 코퍼스 전체는 제3자 재배포 제한으로 비공개

9월 7일 기준 Hugging Face에 Nemotron-3-Ultra-CCNemotron-3-Nano-CC는 없습니다. 6월에 공개된 기반 모델 두 종만 있습니다.

체크포인트를 기다리지 않고 옮겨볼 수 있는 것은 루프 쪽입니다. 조건은 하나입니다. 후보 해법을 자동으로 채점해 부분 점수를 돌려주는 장치가 있어야 합니다. 테스트가 항목별로 쪼개져 있는 저장소를 다루고 있다면 두세 라운드짜리 루프를 걸어볼 수 있습니다. 지금 쓰는 모델에 한 이슈의 후보를 여러 개 뽑게 한 다음 통과한 테스트별 최고 결과를 다음 시도의 예시로 넣습니다. 한 번에 한 개만 뽑았을 때와 통과율을 비교해 보면 됩니다. 채점기가 없는 작업이라면 이 논문의 결과는 옮겨지지 않습니다.