GPT-5.5가 50%를 넘었다, 기업 문서 에이전트의 진짜 병목
Databricks OfficeQA Pro에서 GPT-5.5가 50% 정확도를 넘었습니다. 기업 에이전트의 병목은 추론보다 문서 파싱과 권한 있는 오케스트레이션입니다.
Databricks OfficeQA Pro에서 GPT-5.5가 50% 정확도를 넘었습니다. 기업 에이전트의 병목은 추론보다 문서 파싱과 권한 있는 오케스트레이션입니다.
OpenAI와 Anthropic이 기업 AI 배치 회사를 세웠습니다. 모델 경쟁의 병목이 API가 아니라 FDE, 통합, 거버넌스로 이동합니다.
Thinking Machines Interaction Models는 AI가 말하면서 듣고 보는 full-duplex 협업 모델을 제안합니다.
NVIDIA와 Ineffable Intelligence의 협력은 모델 경쟁이 인간 데이터 이후의 RL 인프라 경쟁으로 이동하고 있음을 보여줍니다.
Google이 Gemini API File Search에 멀티모달 검색, 메타데이터 필터, 페이지 citation을 추가했습니다. RAG가 데모에서 운영 레이어로 이동하는 신호입니다.
Google이 Gemma 4용 MTP drafter를 공개했습니다. 최대 3배 빠른 추론이 로컬 LLM과 AI 에이전트 배포에 주는 의미를 짚습니다.
MiniMax가 AI 모델이 자신의 학습 과정에 직접 참여하는 자기 진화 메커니즘의 M2.7을 오픈소스로 공개했습니다. 230B 파라미터 중 10B만 활성화하며 Claude Opus 4.6에 근접한 성능을 50배 이상 저렴한 가격에 제공합니다.
Anthropic이 Claude Mythos Preview를 공개하면서 일반 배포를 거부했습니다. 모든 주요 OS에서 수천 개 제로데이를 발견한 이 모델은 Project Glasswing을 통해 방어적 보안 용도로만 제한 배포됩니다.
Stanford HAI가 AI Index 2026을 발표했습니다. 생성형 AI는 3년 만에 인류 절반이 채택했지만, 모델 투명성은 58점에서 40점으로 추락했습니다. 에이전트 성공률 20%에서 77%로의 급등과 함께, 채택과 불투명성의 역설을 데이터로 분석합니다.
Llama 4 실패 9개월 만에 Meta가 첫 프로프라이어터리 모델 Muse Spark을 출시했습니다. Alexandr Wang이 이끄는 MSL의 전략 전환과 개발자 생태계 충격을 분석합니다.
Microsoft가 MAI-Transcribe-1, MAI-Voice-1, MAI-Image-2를 동시 출시하며 음성 전사부터 이미지 생성까지 자체 모델로 전환했다. $13B를 투자한 OpenAI에서 벗어나려는 Microsoft의 AI 독립 전략을 분석한다.
Cohere의 2B 파라미터 오픈소스 ASR 모델이 WER 5.42%로 HuggingFace 리더보드 1위를 차지했습니다. Apache 2.0 라이선스에 한국어 포함 14개 언어를 지원하며 Whisper 이후 3년간의 공백을 깨뜨렸습니다.