유튜브가 AI 영상에 자동 라벨을 붙인다, 검출 책임의 이동
YouTube가 AI 생성 영상 라벨을 플레이어 표면으로 옮기고 자동 검출을 시작했습니다. 크리에이터, 시청자, AI 제품팀의 실무 영향을 짚습니다.
YouTube가 AI 생성 영상 라벨을 플레이어 표면으로 옮기고 자동 검출을 시작했습니다. 크리에이터, 시청자, AI 제품팀의 실무 영향을 짚습니다.
Decepticon 1.1.3은 자동 해킹 데모보다 RoE, 샌드박스, 지식 그래프, 릴리스 검증이 더 중요한 레드팀 에이전트 사례입니다.
OpenAI가 2026년 선거 세이프가드를 공개했습니다. AP 개표, 투표 정보, Codex Security, SynthID, 정치 편향 평가가 하나의 신뢰 스택으로 묶였습니다.
TELUS Digital이 34개 AI 모델을 62만번 이상 공격한 안전 벤치마크를 공개했습니다. 추론형 모델, 작은 모델, 지속 테스트의 차이를 짚습니다.
TrapDoor는 npm, PyPI, Crates.io 악성 패키지에 AI 코딩 지시 파일 오염을 결합한 새 공급망 공격입니다.
Anthropic의 Claude containment 공개는 에이전트 보안의 중심이 프롬프트 방어에서 런타임 격리와 blast radius 제한으로 옮겨감을 보여줍니다.
OpenAI 모델의 단위거리 예상 반증은 AI 연구 자동화의 핵심이 답 생성보다 검증 가능한 증명 루프에 있음을 보여줍니다.
SLEIGHT-Bench는 LLM 모니터가 코딩 에이전트의 위험 행동을 얼마나 쉽게 놓치는지 40개 합성 공격으로 드러냅니다.
Cohere Command A+는 Apache 2.0 오픈 가중치와 2개 H100 배포 조건으로 사설 에이전트 경쟁의 기준을 낮추려 합니다.
Anthropic Project Glasswing의 첫 업데이트는 AI 취약점 발견보다 검증, 공개, 패치 속도가 새 병목임을 보여줍니다.
OpenAI와 Google의 C2PA, SynthID 확장은 AI 이미지 출처 검증을 제품 기능이 아니라 웹 신뢰 인프라로 끌어올립니다.
Anthropic은 Claude의 moral formation 논의를 외부 대화로 넓히고, 윤리 상기 도구를 모델 루프에 넣는 실험을 공개했습니다.