Composer 2.5, 보상 해킹까지 학습한 Cursor의 에이전트
Cursor Composer 2.5는 코딩 에이전트 경쟁이 벤치마크 점수에서 긴 작업의 실패 지점과 보상 해킹 감시로 이동했음을 보여줍니다.
Cursor Composer 2.5는 코딩 에이전트 경쟁이 벤치마크 점수에서 긴 작업의 실패 지점과 보상 해킹 감시로 이동했음을 보여줍니다.
Anthropic과 Gates Foundation의 2억 달러 파트너십은 Claude credits, connectors, 공개 벤치마크를 묶은 공익 AI 배치 실험입니다.
CAISI가 Google DeepMind, Microsoft, xAI와 사전 평가 협력을 넓혔습니다. 모델 출시는 이제 벤치마크 경쟁을 넘어 정부 평가 체계 경쟁으로 이동합니다.
Cohere의 2B 파라미터 오픈소스 ASR 모델이 WER 5.42%로 HuggingFace 리더보드 1위를 차지했습니다. Apache 2.0 라이선스에 한국어 포함 14개 언어를 지원하며 Whisper 이후 3년간의 공백을 깨뜨렸습니다.
François Chollet이 만든 ARC-AGI-3가 3월 25일 출시되었습니다. 최초의 인터랙티브 AI 추론 벤치마크에서 최고 AI는 12.58%, GPT-5.4와 Grok 4.20은 0%를 기록했습니다. 1,000개 레벨, $2M 상금, 그리고 AI 지능 측정의 패러다임이 바뀌었습니다.
Epoch AI의 FrontierMath 벤치마크에서 GPT-5.4 Pro가 미해결 수학 문제를 처음 풀었습니다. 4개 프론티어 모델이 같은 문제를 해결하며 "능력 체제"의 도래를 시사합니다.
OpenAI의 GPT-5.4가 OSWorld 벤치마크에서 75%를 기록하며 인간 전문가(72.4%)를 처음으로 초과했습니다. 네이티브 컴퓨터 사용, Tool Search, 1M 토큰 컨텍스트까지 — 3월 AI 모델 경쟁의 판도를 분석합니다.