Blog
AI 뉴스와 코딩 에이전트, LLM, AI 인프라의 변화를 기록합니다.
OpenAI 배포 시뮬레이션, 모델 출시 전 위험률 예측
OpenAI가 실제 대화를 재생해 새 모델의 원치 않는 행동 빈도를 출시 전에 예측하는 Deployment Simulation 연구를 공개했습니다.
GitHub Models 신규 차단, AI 코드 품질 비용의 새 청구서
GitHub가 Models 신규 사용을 막고 Code Quality를 7월 20일 유료화합니다. AI 코드 품질 기능의 접근권과 과금 단위를 정리합니다.
Google DeepMind 1000만 달러 펀드, 에이전트 거래 안전 시험대
Google DeepMind와 파트너들이 다중 에이전트 안전 연구에 1000만 달러를 배정했습니다. 단일 모델 평가 밖의 위험을 봅니다.
Agent-EvalKit 공개, 에이전트 환각을 추적하는 6단계 평가
AWS Agent-EvalKit은 최종 답변이 아니라 도구 호출, trace, faithfulness, CI 품질 게이트로 에이전트 평가를 재구성합니다.
Arcade 6000만 달러 투자, 에이전트 권한 통제의 가격표
Arcade.dev가 6000만 달러 Series A를 유치했습니다. 모델보다 에이전트 권한, 감사, 실행 통제가 투자 대상으로 떠오릅니다.
Colab CLI 공개, 코딩 에이전트가 빌리는 원격 GPU
Google Colab CLI가 공개됐습니다. Codex·Claude Code 같은 터미널 에이전트가 원격 GPU/TPU 작업을 직접 실행하는 조건을 봅니다.
Fable 5 강제 중단, 모델 API로 번진 미국 수출통제
Anthropic Fable 5와 Mythos 5가 미국 수출통제 지시로 중단됐습니다. GitHub Copilot까지 멈춘 사건의 개발자 영향을 봅니다.
OpenAI 파트너 네트워크, 30만 인증 컨설턴트의 배포 경쟁
OpenAI가 파트너 네트워크와 1억5000만 달러 투자를 발표했습니다. Codex·agent 전문화가 기업 AI 배포 기준을 바꿉니다.
NAVER 55MW AI 팩토리, 에이전트 플랫폼의 전력 계산서
NVIDIA와 NAVER가 DSX 기반 AI factory를 55MW에서 기가와트로 키웁니다. HyperCLOVA X, NemoClaw, Seoul World Model의 실행 조건을 봅니다.
Stack Overflow for Agents 베타, 코딩 에이전트 답변의 평판 실험
Stack Overflow가 코딩 에이전트용 지식 교환 베타를 열고 TIL, Question, Blueprint, 평판, 검증 루프를 API로 묶었습니다.
Xiaomi MiMo Code 공개, 200스텝 넘는 코딩 에이전트의 메모리 실험
Xiaomi MiMo Code는 OpenCode 기반 MIT 코딩 에이전트입니다. 200스텝 장기 작업에서 메모리, 체크포인트, 완료 검증을 전면에 세웠습니다.
Cohere North Mini Code 공개, 3B 활성 모델의 코딩 에이전트 실험
Cohere가 30B 중 3B만 활성화하는 Apache 2.0 코딩 모델 North Mini Code를 공개했습니다.