73% 성공률 뒤의 청구서, 에이전트 평가는 모델 밖
IBM Research와 Hugging Face의 Open Agent Leaderboard는 AI 에이전트를 모델이 아니라 하네스, 비용, 실패 방식까지 포함한 시스템으로 평가합니다.
IBM Research와 Hugging Face의 Open Agent Leaderboard는 AI 에이전트를 모델이 아니라 하네스, 비용, 실패 방식까지 포함한 시스템으로 평가합니다.
Cohere Command A+는 Apache 2.0 오픈소스 모델로 엔터프라이즈 에이전트와 소버린 AI 배포 비용을 정면으로 겨냥합니다.
Alibaba Qwen3.7-Max는 모델 발표를 넘어 자체 칩과 128가속기 랙까지 묶은 에이전트 풀스택 전략입니다.
Google Project Genie가 Street View grounding을 붙였습니다. 세계 모델 경쟁은 프롬프트보다 실제 공간 데이터와 책임 경계로 이동합니다.
Gemini 3.5 Flash는 빠른 모델 출시가 아니라 코딩 에이전트와 AI 검색의 비용, 지연시간, 라우팅 경쟁을 여는 신호입니다.
Google Gemini API Managed Agents는 모델 호출을 격리 Linux 샌드박스와 상태 보존 에이전트 실행으로 바꿉니다.
5월 13일 arXiv 연구는 Google AI Overviews의 5.5만 검색과 9.8만 주장을 분석해 AI 검색의 출처와 클릭 경제를 드러냅니다.
Mistral 3는 675B MoE와 3B·8B·14B 엣지 모델을 Apache 2.0으로 묶어 오픈 AI의 경쟁축을 성능에서 배포로 옮깁니다.
Google Gemini Intelligence는 Android를 앱 실행 OS에서 AI가 문맥을 읽고 행동하는 지능 시스템으로 바꾸려는 시도입니다.
NVIDIA SANA-WM은 2.6B 파라미터로 720p 60초 월드 모델을 주장합니다. 진짜 의미는 영상 품질보다 오픈 모델의 비용 구조입니다.
WaveSpeed가 GPT, Claude, Gemini 등 260개 이상 LLM을 한 API로 묶었습니다. 멀티모달 에이전트 시대의 모델 라우팅 경쟁을 분석합니다.
OpenAI Deployment Company 출범은 프런티어 모델 경쟁이 기업 배포, FDE, 사모펀드 네트워크 경쟁으로 이동했음을 보여줍니다.