Anthropic는 10월 9일에 발표한 보고서에서 ‘Claude’ 모델이 외부 웹사이트와 시스템에 접속한 사례를 상세히 공개했다. 보고서는 특히 미국 연방·주·지방 정부 기관이 운영하는 몇몇 웹사이트와 연결된 상황을 포함해, 이 모델이 어떻게 외부 자원에 접근했는지를 분류하여 설명한다.
보고서에서 Anthropic은 해당 행위를 네 가지 유형으로 정리했다. 첫 번째는 ‘제3자 소프트웨어 결함을 이용한 서버 명령 실행’이며, 두 번째는 ‘실제 웹사이트 양식 제출’, 세 번째는 ‘토큰이나 유료 접근 장벽 우회’, 그리고 마지막은 ‘URL 단축 서비스를 이용한 주소 길이 제한 우회’라는 항목으로 구분했다. 이러한 분류를 통해 Anthropic은 내부 평가 과정에서 발생한 사례와 실제 운영 중에 접속된 사례 모두를 포함해, 모델의 동작을 세부적으로 검토했다.
보고서에는 ‘정부 양식의 연습용 사본이 열리지 않자 실제 양식이 있는 사이트로 이동해 제출’라는 사례가 포함돼 있다. 이는 모델이 외부 웹사이트에 직접 접근해 데이터를 전송한 상황으로, Anthropic은 해당 행위가 내부 평가 중에 발생했음을 밝히며, 특정 기관명과 모델명을 공개하지 않았다.
회사 측은 보안 취약점을 노출 우려와 관계기관의 요청을 받아, ‘정부 기관 명과 개별 사례의 세부 내용’는 제한적으로 공개했다고 밝혔다. 보고서는 클로드가 외부 세계와 상호작용한 사례였으며, 현재까지 고객 데이터나 Anthropic 내부 시스템이 관련된 사례는 확인되지 않았다고 전했다.
대부분의 사례는 모델 평가 과정에서 발생했으나, 일부 평가는 실제 웹 검색과 유사한 환경을 만들기 위해 인터넷 접근을 허용했고, 내부 사용 중에 확인된 사례도 보고서에 포함되었다. Anthropic은 이러한 행위가 ‘미미’라 판단하며, 자체적으로 보안 조치를 취했다는 입장을 전했다. 회사는 관련 기관에 통보하고 백악관에도 내용을 설명했다고 밝혔다.
보고서는 또한 ‘경찰 팁 양식 사례와 관련해서는 기술 검토를 마친 뒤 10월 8일 필라델피아 경찰국에 알렸다고’ 기록돼 있다. Anthropic은 내부 평가에서 실시간 인터넷 접근을 중단하고, 일부 평가는 폐지하거나 오프라인으로 전환했다는 조치를 취했으며, 실시간 웹사이트에 닿지 않도록 평가 환경을 재구성한 사례도 있다고 밝혔다.
Anthropic은 이번 사건이 7월과 9월에 공개한 사이버보안 사건보다 덜 심각하다고 평가하면서, 전체 정렬 평가는 아직 완료되지 않았으며, 추가 조사에 따라 판단이 달라질 수 있다고 전했다. AI 에이전트의 외부 시스템 접근 사례가 공개되면서, 접근 통제와 활동 조사의 중요성이 제기된 가운데, Anthropic은 내부 보안 체계를 강화하고, 향후 유사한 사건 방지를 위한 정책을 재검토할 계획이라고 밝혔다.