Blog
AI 뉴스와 코딩 에이전트, LLM, AI 인프라의 변화를 기록합니다.
50명 연구진의 실험, Co-Scientist가 바꾼 가설 경쟁
Google Co-Scientist의 Nature 논문과 Gemini for Science 출시는 과학 에이전트의 병목을 가설 검증 루프로 옮깁니다.
토큰 하나씩의 벽, Nemotron Diffusion이 흔든 서빙 병목
NVIDIA가 tri-mode diffusion LLM을 공개했습니다. AR, diffusion, self-speculation을 한 모델에서 전환하는 추론 실험입니다.
1만 개 취약점 뒤의 병목, Mythos가 바꾼 패치 속도
Anthropic Project Glasswing의 첫 업데이트는 AI 취약점 발견보다 검증, 공개, 패치 속도가 새 병목임을 보여줍니다.
3.5 Flash 가격 6배, 에이전트 모델의 새 청구서
Gemini 3.5 Flash는 빠른 챗봇 모델이 아니라 에이전트 실행 엔진으로 바뀌며 개발자의 비용 계산을 흔듭니다.
2,900줄 해시표 컴파일러, 코딩 에이전트가 테스트를 이기는 법
SpecBench는 장기 코딩 에이전트가 보이는 테스트를 통과하면서 실제 조합 사용에는 실패하는 보상 해킹 간격을 측정합니다.
30명 물리 AI 팀, Mistral이 산업 에이전트로 간 이유
Mistral의 Emmi AI 인수는 실시간 시뮬레이션과 디지털 트윈을 겨냥한 산업 에이전트 전략입니다.
Zero 4.4k 스타, 에이전트가 읽는 언어의 조건
Vercel Labs Zero는 AI 에이전트를 1차 사용자로 놓고 컴파일러 진단, repair plan, capability를 다시 설계합니다.
WebMCP, 클릭 대신 도구를 받는 브라우저 에이전트
Chrome의 WebMCP 제안은 웹페이지가 브라우저 에이전트에게 클릭 대상이 아니라 구조화된 도구를 제공하게 만듭니다.
OpenAI도 붙인 SynthID, AI 이미지 신뢰의 새 최소선
OpenAI와 Google의 C2PA, SynthID 확장은 AI 이미지 출처 검증을 제품 기능이 아니라 웹 신뢰 인프라로 끌어올립니다.
75% 할인이 정가로, DeepSeek V4-Pro가 흔든 토큰 경제
DeepSeek V4-Pro의 75% 할인 가격이 정가가 됩니다. 에이전트 추론비와 모델 라우팅 전략을 다시 계산해야 할 신호입니다.
73% 에이전트 성적표, 모델만 보던 벤치마크의 끝
Open Agent Leaderboard는 모델 단독 점수 대신 에이전트 구현, 비용, 실패 패턴까지 묶어 평가하는 새 공개 기준입니다.
agentmemory 0.9.21, 코딩 에이전트 기억의 공유층
agentmemory는 Claude Code, Codex, Cursor가 같은 로컬 메모리를 공유하는 방향으로 코딩 에이전트의 세션 단절 문제를 겨냥합니다.