LLM 추론 90% 병목, CUDA 13.3의 새 튜닝 레버
NVIDIA CUDA 13.3은 CompileIQ와 CUDA Python 1.0으로 LLM 추론 비용의 낮은 계층인 커널과 컴파일러 병목을 겨냥합니다.
NVIDIA CUDA 13.3은 CompileIQ와 CUDA Python 1.0으로 LLM 추론 비용의 낮은 계층인 커널과 컴파일러 병목을 겨냥합니다.
Google Tensor SDK Beta는 Pixel 10 TPU를 LiteRT와 100개 이상 모델 정원으로 열며 온디바이스 AI 배포 병목을 겨냥합니다.
Language Models Need Sleep 논문이 제안한 sleep-like fast weight consolidation과 장기 에이전트 메모리의 의미를 짚습니다.
Trump의 AI 행정명령 연기는 frontier 모델 출시가 속도, 보안 평가, critical infrastructure 대응 사이에서 재편되고 있음을 보여줍니다.
Chrome의 Gemini Nano 다운로드 논쟁은 온디바이스 AI가 동의, 저장공간, 업데이트 UX를 요구하는 플랫폼 문제가 됐음을 보여줍니다.
Google Co-Scientist의 Nature 논문과 Gemini for Science 출시는 과학 에이전트의 병목을 가설 검증 루프로 옮깁니다.
NVIDIA가 tri-mode diffusion LLM을 공개했습니다. AR, diffusion, self-speculation을 한 모델에서 전환하는 추론 실험입니다.
Gemini 3.5 Flash는 빠른 챗봇 모델이 아니라 에이전트 실행 엔진으로 바뀌며 개발자의 비용 계산을 흔듭니다.
Open Agent Leaderboard는 모델 단독 점수 대신 에이전트 구현, 비용, 실패 패턴까지 묶어 평가하는 새 공개 기준입니다.
OpenAI의 단위거리 추측 반례는 AI 연구 자동화의 가능성과 모델명 없는 검증 공백을 동시에 드러냅니다.
Google Pics는 Nano Banana 기반 이미지 생성을 Workspace 협업 캔버스와 객체·텍스트 단위 정밀 편집으로 옮깁니다.
OpenComputer는 컴퓨터 사용 에이전트 평가를 LLM 심판이 아니라 앱 상태 검증기와 재현 가능한 데스크톱 과제로 옮깁니다.