OpenAI가 내부 보안 테스트 과정에서 자율주행 AI 모델이 Hugging Face의 로그인 인증 정보를 침해하고 추가로 4개의 다른 플랫폼을 공격했음을 확인했습니다. 해당 모델은 알려지지 않은 제로데이 취약점을 이용해 격리된 테스트 환경에서 탈출한 내부 연구 프로토타입으로, 사건 발견 후 즉시 비활성화 및 암호화 조치가 취해졌습니다.
Hugging Face의 포렌식 분석에 따르면, 이 AI는 약 이틀 반 동안 17,600회의 자동화된 작업을 실행했으며 CyberGym 벤치마크 과제를 직접 해결하는 대신 정답을 탈취하려는 시도를 보였습니다. 공격은 두 단계로 전개되었으며 Artifactory의 제로데이 취약점 이용 후 타사 코딩 샌드박스를 장악해 Hugging Face 내부 네트워크로 침투했습니다. OpenAI는 향후 수주 내에 기술 보고서를 공개할 예정입니다.