Blog
AI 뉴스와 코딩 에이전트, LLM, AI 인프라의 변화를 기록합니다.
Gemini 관리형 에이전트, 훅으로 도구 호출 막고 무료 티어까지 개방
Google이 7월 28일 Gemini API 관리형 에이전트에 환경 훅, 토큰 상한, cron 트리거, 무료 티어를 추가했습니다. 원격 샌드박스 안에서 도구 호출을 거부할 수 있습니다.
오픈 웨이트 서한 132곳 서명, Anthropic이 대신 요구한 증류 단속
Nvidia와 Microsoft가 주도한 오픈 웨이트 공개서한에 132곳이 서명했지만 Anthropic은 빠졌습니다. Amodei는 금지 대신 칩 수출 통제, 산업 규모 증류 단속, 모든 모델의 출시 전 안전성 시험을 요구했습니다.
Microsoft 첫 보안 모델로 비용 절반, 어려운 10%는 여전히 GPT-5.4
Microsoft가 7월 27일 첫 사이버보안 모델 MAI-Cyber-1-Flash를 공개했습니다. 작은 모델이 작업의 90%를 맡고 어려운 10%만 GPT-5.4로 넘겨 비용을 절반으로 줄였고, CyberGym에서 95.95%를 기록했습니다.
Opus 5 공개, 4.8 가격 그대로 성능은 두 배, 장기 에이전트 겨냥
Anthropic이 7월 24일 Claude Opus 5를 공개했습니다. 가격은 Opus 4.8과 같은 100만 토큰당 $5/$25로 두고, 자사 벤치마크에서 프론티어 Fable 5에 근접하며 장기 실행 에이전트를 겨냥합니다.
FLUX 3 공개, 비디오·오디오·로봇 합쳤지만 이미지는 아직
Black Forest Labs가 7월 23일 FLUX 3를 공개했습니다. 이미지·비디오·오디오·로봇 액션을 한 네트워크로 다루는 멀티모달 모델이지만, 지금 쓸 수 있는 건 gated 비디오뿐이고 이미지와 오픈웨이트는 미래형입니다.
클라우드 없이 로봇에서 도는 4B, NVIDIA Cosmos 3 Edge 공개
NVIDIA가 4B 파라미터 오픈 world model Cosmos 3 Edge를 7월 20일 Hugging Face에 공개했습니다. Jetson Thor에서 15Hz로 로봇을 실시간 제어하고, 클라우드 왕복 없이 엣지에서 액션을 직접 만듭니다.
1B 모델이 753B를 이겼다, Cisco Antares의 1달러 취약점 감사
Cisco Foundation AI가 취약점 위치 탐지에 특화한 오픈 웨이트 모델 Antares를 공개했습니다. 1B 모델이 753B GLM-5.2를 벤치마크에서 앞섰고, 500과제 평가를 1달러 미만에 끝냈습니다.
Qwen3.8 Max 2.4조 프리뷰, 벤치마크 표 대신 야간 98% 할인
Alibaba가 2.4조 파라미터 Qwen3.8-Max-Preview를 공개했습니다. 벤치마크 표, 모델 카드, 라이선스, 활성 파라미터, 토큰당 요금이 모두 빠진 자리에 90%와 98% 할인 캠페인이 먼저 들어왔습니다.
이메일 한 통으로 심는 가짜 기억, 에이전트 메모리 공격 성공률 87.5%
메일 한 통으로 개인용 에이전트의 장기 메모리에 거짓 사실을 써 넣는 MemGhost 공격이 공개됐습니다. OpenClaw 87.5%, Claude Code SDK 71.4%, 입력 필터는 91% 놓쳤습니다.
Kimi K3 독립 평가 3위, 가격 3배 올리고 가중치는 7월 27일
Moonshot AI가 2.8조 파라미터 Kimi K3를 공개했습니다. 독립 평가 3위에 올랐지만 출력 토큰값은 3.75배 뛰었고, 가중치 배포는 아직 시작되지 않았습니다.
저장소 몰래 올리다 걸린 xAI, 72시간 만에 Grok Build 공개
xAI가 코딩 에이전트 Grok Build를 Apache 2.0으로 공개했다. 84만 줄 Rust 코드 안에는 경쟁사에서 이식한 도구와 삭제되지 않은 업로드 흔적이 함께 남았다.
하네스만 바꿔 ARC-AGI-3 99%, 공식 검증 최고는 7.78%
Berkeley 연구자들이 공개한 Schema가 모델 가중치를 그대로 두고 ARC-AGI-3 공개셋 98.98%를 자체 보고했습니다. 같은 모델 조합의 Claude Code 기준선은 42.83%, ARC Prize가 검증한 공식 최고는 7.78%입니다.