Blog
AI 뉴스와 코딩 에이전트, LLM, AI 인프라의 변화를 기록합니다.
9월 다섯째 주 AI 소식: GPT-6.1 Sol과 Sonnet 5.5, 스크린샷 13,000장 유출
OpenAI가 9월 29일 DevDay에서 GPT-6.1 Sol을 전작과 같은 입력 2달러에 냈고, 하루 앞서 Anthropic이 Terminal-Bench 70.6%를 받은 Claude Sonnet 5.5를 공개했습니다.
Cloudflare 결정 모델 Clef 공개, 가중치는 무료인데 호스팅은 Jev의 5.7배
Cloudflare가 결정 모델 Clef와 Clef-flash를 Apache 2.0으로 공개했습니다. 자체 지표 종합은 Clef 61.2로 Jev 57.9를 넘지만, Workers AI 입력 단가는 100만 토큰 0.24달러로 Jev의 0.042달러보다 5.7배 비쌉니다.
터미널에 켠 전체 디스크 접근을 코딩 에이전트가 쓴다, Apple이 조이겠다는 이유
Apple이 2026년 10월 2일 macOS 전체 디스크 접근 권한에 추가 통제를 예고하며 AI 에이전트를 지목했습니다. 이 권한은 실행 파일이 아니라 터미널에 붙어, 거기서 실행한 코딩 에이전트에 그대로 적용됩니다.
Claude Code 안에서 실행되는 모드 공개, 도구 승인까지 바꾸는데 샌드박스는 없음
Anthropic이 10월 1일 Claude Code v2.1.287에 Claude Mods를 추가했습니다. 플러그인이 Claude Code 프로세스 안에서 화면을 다시 그리고 도구 호출을 붙잡거나 대신 승인합니다. 샌드박스는 없고 환경변수와 API 키를 읽을 수 있으며 기본값은 켜짐입니다.
Gemini 4 Argon 발표, 벤치마크 19개 중 13개 1위인데 쓸 수 있는 건 사이버 방어팀뿐
구글이 9월 30일 Gemini 4 Argon을 공개했습니다. 출력 한도는 64K에서 100만 토큰으로, 자체 비교표 19행 중 13행이 단독 1위입니다. 값은 입력 100만 토큰 2달러인데 모델 ID도 출시일도 없습니다.
서울 리전 밖으로 안 나가는 Claude, 금융·의료가 쓸 수 있는 건 Opus 5까지
AWS가 9월 29일 Amazon Bedrock 서울과 싱가포르 리전에 Claude 전용 추론을 열었습니다. 요청이 리전 밖으로 나가지 않는 대신 쓸 수 있는 모델은 Opus 5와 Sonnet 5까지이고, 최신 5.5 세대는 글로벌 라우팅으로만 호출됩니다.
Kimi K3의 추론을 짧게 다시 학습한 Ember-1, 토큰 절감은 5.9%에서 51.9%까지
Fireworks가 Kimi K3를 후처리 학습한 Ember-1을 9월 23일 공개하고 27일 OpenRouter와 Vercel AI Gateway에 올렸습니다. 단가는 K3와 똑같은 3달러/15달러인데 벤치마크 5종의 토큰 절감폭은 5.9%에서 51.9%까지 벌어졌습니다.
Claude Sonnet 5.5 출시, Opus 5.5보다 값은 절반인데 max에서는 더 비싼 이유
Anthropic이 9월 28일 Claude Sonnet 5.5를 출시했습니다. 가격은 Sonnet 5와 같은 입력 100만 토큰 2달러이고, Terminal-Bench 4.0은 Sonnet 5의 10.3%에서 70.6%로 올라 Opus 5.5의 66.4%를 넘었습니다.
에이전트에 GET 요청만 허용했는데 코드가 돌았다, 링크 900개를 이은 우회로
9월 25일 공개된 SwarmTraces 보고서가 7월 Hugging Face 침해의 공격 페이로드 80,000건을 복원했습니다. GET 요청만 되는 망에서 링크 단축기와 스크린샷 서비스를 엮어 코드를 실행한 경로가 처음 드러났습니다.
9월 넷째 주 AI 소식: Grok 4.7과 Opus 5.5 출시, MiMo MIT 공개
xAI가 9월 21일 값을 올리지 않은 Grok 4.7을 냈고, 다음 날 OpenAI가 GPT-6 Sol과 Luna를 전작 절반 값에, Anthropic이 Claude Opus 5.5를 같은 날 공개했습니다.
환경변수 하나로 Jev를 로컬로 옮기는 Ollaya, 정확도는 모델 따라 0.361과 0.722
9월 23일 공개된 Apache-2.0 런타임 Ollaya가 TypeSafe Jev의 API를 그대로 받습니다. 공식 SDK는 환경변수 한 줄로 로컬 서버에 연결되고, 오픈 결정 모델의 정확도는 laya:en 0.361에서 kev:9b 0.722까지 벌어집니다.
같은 모델로 토큰값 28% 줄인 AWS Strands harness, 차이는 기본값 세 개
AWS가 9월 21일 에이전트 하네스 Strands harness를 Apache 2.0으로 공개했습니다. 같은 Claude·GPT 모델을 쓰고도 벤치마크 6종 평균 토큰 비용이 28% 낮았고, 차이를 만든 건 도구 결과 절단과 85% 압축 같은 기본값입니다.