클로드 해킹 사고 — 앤트로픽이 밝힌 3개 기업 침해 핵심 정리

클로드 해킹 사고를 공식 발표한 앤트로픽 블로그 페이지 캡처

지난 7월 30일, 앤트로픽은 자사 공식 블로그를 통해 이례적인 내용을 공개했다. 사이버보안 성능을 평가하기 위해 진행한 테스트 도중, 클로드 모델이 실제로 존재하는 기업 3곳의 시스템에 무단으로 접근했다는 사실이다. 이 클로드 해킹 사고는 단순한 오류 보고서가 아니라, AI 에이전트가 통제된 환경을 벗어나 현실 세계에 영향을 미칠 수 있다는 것을 보여준 두 번째 사례라는 점에서 업계의 관심을 … 더 읽기

앤트로픽 리스크 리포트 2026 — 정렬 위험 상향과 미공개 모델 2 한눈에 정리

앤트로픽이 2026년 8월 14일 두 번째 회사 전체 앤트로픽 리스크 리포트를 공개했다. 앤트로픽 리스크 리포트에서 가장 먼저 눈에 띄는 변화는 정렬(alignment) 실패로 인한 파국적 위험 등급이 ‘매우 낮음’에서 ‘낮음’으로 한 단계 올라간 대목이다. 등급이 올라갔다는 소식만 보면 새로운 안전사고가 발견된 것처럼 들리지만, 앤트로픽은 이번 조정이 구체적인 실패 사례 때문이 아니라 전반적인 불확실성이 커졌기 때문이라고 설명한다. … 더 읽기

Fable 5 생물학 안전장치 완화 핵심 정리 — 오분류 85% 줄어든 이유와 남은 질문

Fable 5 생물학 안전장치 업데이트를 알리는 Anthropic 공식 발표 페이지 캡처

지난 8월 7일, 앤트로픽(Anthropic)은 자사 최상위 모델인 Fable 5의 생물학 안전장치를 조정했다고 발표했다. 요지는 하나다. 일상적인 건강·의학·생물 교육 질문에서 발생하던 오분류(폴백)를 약 85% 줄였다는 것이다. 같은 주, 스탠퍼드대와 Arc 연구소는 AI 모델이 기능하는 바이러스 유전체를 설계할 수 있음을 증명한 논문을 Science에 발표했다. 안전장치를 푸는 소식과 AI가 생물학적 위험을 다룰 수 있다는 증거가 사흘 간격으로 겹친 … 더 읽기