Claude Sonnet 5 공개, Opus급 에이전트 성능의 가격 인하
Anthropic이 Claude Sonnet 5를 공개했습니다. 낮은 API 가격, effort 조절, GitHub Copilot 배포가 코딩 에이전트 비용 계산을 바꿉니다.
Anthropic이 Claude Sonnet 5를 공개했습니다. 낮은 API 가격, effort 조절, GitHub Copilot 배포가 코딩 에이전트 비용 계산을 바꿉니다.
Google이 Interactions API를 Gemini 기본 인터페이스로 올리고 표준 API 키 종료 일정을 못박았습니다. 기존 앱은 9월 전에 인증 키와 호출 방식을 점검해야 합니다.
Qwen이 35B 공개 가중치와 AgentWorldBench를 내놓았습니다. 에이전트가 도구를 호출하기 전에 다음 환경을 예측하는 실험입니다.
vLLM Semantic Router가 Micro-Agent를 공개했습니다. OpenAI 호환 API 뒤에서 라우터가 비용·품질·관측성을 제어하는 방식입니다.
Sakana Fugu Ultra는 여러 프런티어 모델과 전문 에이전트를 한 API로 묶습니다. 벤치마크, 가격, 라우팅 비공개 조건을 함께 봅니다.
Braintrust와 Hugging Face가 공개 에이전트 흔적 1,781개를 분석했습니다. 성공률과 비용은 모델명보다 하네스와 작업 유형에 더 민감했습니다.
OpenAI GPT-5.6 Sol, Terra, Luna가 제한 프리뷰로 나왔습니다. API·Codex 승인 범위, 가격표, 보안 평가가 개발자 접근을 어떻게 바꾸는지 봅니다.
Krea가 12B 이미지 모델 Krea 2를 공개했습니다. RAW/Turbo 체크포인트, 8스텝 추론, 라이선스 경계를 개발자 관점에서 봅니다.
OpenAI가 실제 대화를 재생해 새 모델의 원치 않는 행동 빈도를 출시 전에 예측하는 Deployment Simulation 연구를 공개했습니다.
GitHub가 Models 신규 사용을 막고 Code Quality를 7월 20일 유료화합니다. AI 코드 품질 기능의 접근권과 과금 단위를 정리합니다.
AWS Agent-EvalKit은 최종 답변이 아니라 도구 호출, trace, faithfulness, CI 품질 게이트로 에이전트 평가를 재구성합니다.
Google이 DiffusionGemma를 공개했습니다. 256토큰 canvas, vLLM 지원, 18GB VRAM 조건이 로컬 추론 병목을 어떻게 바꾸는지 봅니다.