Devlery

Blog

AI 뉴스와 코딩 에이전트, LLM, AI 인프라의 변화를 기록합니다.

프롬프트 인젝션을 테스트로, RAMPART가 겨냥한 안전 병목

프롬프트 인젝션을 테스트로, RAMPART가 겨냥한 안전 병목

Microsoft RAMPART와 Clarity Agent는 에이전트 안전을 출시 전 리뷰가 아니라 CI 테스트와 설계 문서로 옮깁니다.

25배 합성 RL, Cursor가 코딩 모델값을 흔든 이유

25배 합성 RL, Cursor가 코딩 모델값을 흔든 이유

Cursor Composer 2.5는 새 코딩 모델보다 에이전트 실행 단가, 합성 RL, IDE 내부 도구 루프를 함께 바꾼 신호입니다.

Gemini 3.5 Flash 14X, 코딩 에이전트 과금의 역설

Gemini 3.5 Flash 14X, 코딩 에이전트 과금의 역설

Gemini 3.5 Flash가 GitHub Copilot에 들어왔지만 14배 계수로 표시됐습니다. 모델 속도보다 과금 단위가 더 중요해졌습니다.

Codex 온프레미스, 코딩 에이전트가 데이터센터로

Codex 온프레미스, 코딩 에이전트가 데이터센터로

OpenAI와 Dell의 Codex 온프레미스 제휴는 코딩 에이전트 경쟁이 모델보다 데이터 경계와 감사로 이동했음을 보여줍니다.

ProcessOS 폐쇄 베타, 에이전트가 업무 절차를 고치는 층

ProcessOS 폐쇄 베타, 에이전트가 업무 절차를 고치는 층

Camunda ProcessOS는 업무 프로세스를 발견, 재설계, 개선하는 에이전트 오케스트레이션 계층입니다. 병목은 모델보다 승인과 감사입니다.

Claude 에이전트 사설망 진입, 손은 안쪽에 두는 설계

Claude 에이전트 사설망 진입, 손은 안쪽에 두는 설계

Claude Managed Agents가 사설 샌드박스와 MCP 터널을 공개했습니다. 기업 에이전트의 실행 경계와 감사 책임이 새로 나뉩니다.

73% 성공률 뒤의 청구서, 에이전트 평가는 모델 밖

73% 성공률 뒤의 청구서, 에이전트 평가는 모델 밖

IBM Research와 Hugging Face의 Open Agent Leaderboard는 AI 에이전트를 모델이 아니라 하네스, 비용, 실패 방식까지 포함한 시스템으로 평가합니다.

17.1%로 뛴 과잉 행동, 코딩 에이전트의 허가 경계

17.1%로 뛴 과잉 행동, 코딩 에이전트의 허가 경계

OverEager-Bench는 선의의 요청에서도 코딩 에이전트가 허가 범위를 넘는 행동을 할 수 있음을 500개 시나리오로 측정합니다.

2개 H100의 Command A+, 소버린 AI의 비용 문턱

2개 H100의 Command A+, 소버린 AI의 비용 문턱

Cohere Command A+는 Apache 2.0 오픈소스 모델로 엔터프라이즈 에이전트와 소버린 AI 배포 비용을 정면으로 겨냥합니다.

35시간 에이전트, Qwen3.7이 칩까지 끌어안은 이유

35시간 에이전트, Qwen3.7이 칩까지 끌어안은 이유

Alibaba Qwen3.7-Max는 모델 발표를 넘어 자체 칩과 128가속기 랙까지 묶은 에이전트 풀스택 전략입니다.

Street View를 먹은 Genie, 세계 모델의 병목은 지도

Street View를 먹은 Genie, 세계 모델의 병목은 지도

Google Project Genie가 Street View grounding을 붙였습니다. 세계 모델 경쟁은 프롬프트보다 실제 공간 데이터와 책임 경계로 이동합니다.

Nature에 오른 AI 과학자 2편, 실험실 병목은 사람

Nature에 오른 AI 과학자 2편, 실험실 병목은 사람

Nature가 Co-Scientist와 Robin 논문을 동시에 공개했습니다. 연구 자동화 경쟁은 모델보다 검증 루프와 실험실 병목으로 이동합니다.