Blog
AI 뉴스와 코딩 에이전트, LLM, AI 인프라의 변화를 기록합니다.
Claude Code 주간 한도 9월 14일부터 17% 감소, '25% 인상' 발표의 계산법
Claude Code 주간 한도 50% 임시 증량이 9월 13일(PT) 끝나고, 9월 14일부터 5월 이전보다 25% 많은 수준으로 고정됩니다. 지난 넉 달과 비교하면 17% 감소이며 5시간 한도와 요금은 그대로입니다.
Codex 에이전트 실행 엔진이 API로 열렸다, 데이터는 미국에만 두고 ZDR 불가
OpenAI가 9월 10일 Codex 하네스를 Agents API 공개 베타로 열었습니다. API 요금은 없고 호스팅 샌드박스는 4GB 기준 20분에 0.12달러입니다. 베타 동안 데이터는 미국에만 저장되고 ZDR은 적용되지 않습니다.
OpenRouter 같은 모델도 호스트 따라 도구 호출 30점 차, 기본 라우팅은 69.9%
OpenRouter 자체 32일 벤치마크에서 DeepSeek V4 Flash 0731의 TAU-Bench 점수가 호스트별로 76.8%부터 46.4%까지 갈렸습니다. 운영자 실측 글이 HN 1위에 오르자 OpenRouter는 QoS 등급 도입을 예고했습니다.
DeepSeek V4 Pro가 9월 14일 Flash로 바뀐다, 코딩 점수는 오르고 지식 점수는 하락
DeepSeek가 9월 10일 552B 오픈 웨이트 모델 V4.1 Flash를 공개하고 9월 14일 오후 1시(한국)부터 V4 Pro 요청을 이 모델로 넘깁니다. 에이전트 코딩 점수는 Pro보다 높고 출력값은 70% 싸지만 사실 지식 점수는 55.2에서 42.3으로 내려갑니다.
중국 AI 6곳 지목한 미국 합동 권고, 대응책은 '알리지 않는 응답 품질 저하'
NSA·CISA·FBI가 9월 8일 권고 AA26-251A로 DeepSeek과 Alibaba 등 6곳을 지목했습니다. 제공사에 권한 대응은 계정 차단이 아니라 알리지 않는 응답 품질 저하이고, 탐지 지표는 24시간 도는 프로덕션 에이전트와 구분되지 않습니다.
GPT-6 Astra의 99.9%는 OpenAI 방식으로 잰 점수, 중립 조건에서는 62.7%
ARC Prize가 ARC-AGI-3에서 GPT-6 Astra를 두 조건으로 측정해 62.7%와 99.9%를 얻었습니다. 모델은 같고, 추론 상태를 다음 호출로 넘겼는지만 달랐습니다. 리더보드는 앞으로 두 점수를 함께 싣습니다.
IOI 2026 인간 1위 넘은 Nvidia 550B, 점수를 올린 건 모델보다 재시도 200번
Nvidia Nemotron-3-Ultra-CC가 IOI 2026에서 535.4점을 받아 인간 최고 득점 498.27점을 넘었습니다. 논문 수치를 보면 점수의 대부분은 사후학습이 아니라 후보를 200개씩 다시 뽑는 테스트타임 루프에서 나왔습니다.
코딩 에이전트 3종에 도구를 고르게 했더니 42%만 일치, LangChain은 194번 언급에 4번 선택
Armature가 Claude Code, Codex, Cursor에 실제 저장소 16,893회로 서드파티 서비스를 고르고 설치하게 했습니다. 세 에이전트가 같은 도구를 고른 비율은 42%였고, 저장소 언어가 바뀌면 이메일 제공자 승자도 바뀌었습니다.
9월 첫 주 AI 소식: GPT-6 Astra API 개방, Nvidia의 Hugging Face 인수
9월 3일 OpenAI가 GPT-6 Astra를 API와 ChatGPT 상위 요금제에 열었고, 하루 전 Nvidia는 Hugging Face를 129억 3천만 달러에 인수하는 계약에 서명했습니다. Meta는 학습을 허용하면 100만 토큰 0.10달러인 요금제를 냈습니다.
한 번 읽은 파일이 470턴 동안 다시 청구된다, PR 하나에 41달러 쓴 코딩 에이전트
Sonar가 코딩 에이전트 세션 트레이스를 계측해 공개했습니다. 800줄 PR 한 건에 모델 왕복 512회, 캐시 읽기 1억 5,280만 토큰, 약 41달러였고 새로 읽은 코드는 10만 6천 토큰뿐이었습니다.
K2 Horizon 6종 공개, 7B가 SWE-bench 70.6인데 훈련 코드는 README 한 줄
MBZUAI 산하 IFM이 9월 3일 K2 Horizon 6종을 Apache 2.0으로 공개했습니다. 7B가 SWE-bench Verified 70.6%로 Qwen3.5-9B를 앞섰지만 훈련 코드 저장소와 데이터셋 링크는 아직 닫혀 있습니다.
GPT-6 Astra 출시, 값은 2.5배인데 코딩 작업당 비용은 내려가는 이유
OpenAI가 9월 3일 GPT-6 Astra를 냈습니다. API 단가는 100만 토큰 10달러와 50달러로 GPT-5.6 Sol의 2.5배지만, 코딩에서는 Sol이 쓰던 토큰의 3분의 1만 씁니다. 독립 지수는 Sol과 같은 61점입니다.