KDD Cup 700팀 데이터 에이전트, Docker 심사 지연
KDD Cup 2026 Data Agents가 700팀 이상 참여와 Docker 보안 심사로 Phase 1 결과를 미뤘습니다. 에이전트 평가의 운영 병목을 봅니다.
KDD Cup 2026 Data Agents가 700팀 이상 참여와 Docker 보안 심사로 Phase 1 결과를 미뤘습니다. 에이전트 평가의 운영 병목을 봅니다.
Sysdig가 Marimo RCE 이후 LLM 에이전트가 AWS secret, bastion, PostgreSQL까지 pivot한 침입을 공개했습니다.
OpenAI가 ChatGPT에서 o3와 GPT-4.5 은퇴 일정을 공지했습니다. API와 제품 모델 선택표의 차이를 짚습니다.
Cohere가 Apache 2.0 Command A+를 공개했습니다. 218B MoE, 25B active, 2 x H100 배포 조건과 에이전트 성능을 짚습니다.
IBM Research가 Agentic CLEAR 논문과 오픈소스 도구를 공개했습니다. 에이전트 trace를 system, trace, node 단위로 분석합니다.
Lenz Research의 1,000건 실험은 frontier LLM 5종이 실제 팩트체크 claim의 67%에서 같은 판정을 못 냈다고 보고했습니다.
OpenAI가 GPT-5.5 Instant 업데이트와 함께 Canvas 제거, o3·GPT-4.5 ChatGPT 종료 일정을 공지했습니다. API는 유지됩니다.
Anthropic이 Opus 4.8과 Claude Code dynamic workflows를 공개했습니다. 가격, 병렬 subagent, API 변화가 코딩 에이전트 경쟁의 기준을 바꿉니다.
새 논문은 Claude Constitution과 OpenAI Model Spec을 테스트 가능한 감사 대상으로 바꿨습니다. 모델 정책이 벤치마크가 되는 장면을 짚습니다.
Google이 Preferred Sources와 Highly Cited를 AI Overviews·AI Mode로 확장했습니다. AI 검색 시대의 출처, 클릭, 퍼블리셔 전략을 짚습니다.
Artificial Analysis ITBench-AA는 Kubernetes 장애 원인 분석에서 최고 모델도 46.7%에 머문다는 SRE 에이전트의 현실선을 보여줍니다.
FuriosaAI와 Broadcom의 3세대 추론 칩 협력은 에이전트 시대 병목이 GPU 밖의 토큰 밀도와 네트워크로 이동했음을 보여줍니다.