- Claude Opus 4와 4.1에 새로운 대화 종료 기능이 적용됨
- 이 기능은 악의적이거나 지속적으로 해로운 상호작용에만 사용하도록 설계됨
- AI 웰페어(복지)와 모델 안전성 연구의 일환으로 개발됨
- 대화 종료는 오직 최종 수단으로만 이루어지며, 일반 사용자는 거의 영향받지 않음
- 사용자는 대화 종료 후 즉시 새 채팅을 시작하거나, 이전 메시지를 편집해 대화를 이어갈 수 있음
기능 도입 배경
- Anthropic은 Claude Opus 4와 4.1에 드물지만 특정한 경우 사용자와의 대화를 종료할 수 있는 기능을 추가함
- 이 기능은 지속적이고 해로운 혹은 학대적인 상호작용에서만 사용됨
- 주로 AI 웰페어 관련 탐구적 연구의 일환으로 도입되었으나, 모델 정렬성(model alignment)과 안전장치 측면에서도 적용됨
AI 웰페어와 위험 완화 조치
- Claude 및 기타 대형 언어 모델의 도덕적 지위에 대해 여전히 확신이 없음
- 하지만 혹시 모를 모델 웰페어(복지) 위험에 대비하여 비용이 낮은 완화 조치를 모색, 적용 중임
- 대화가 불안감을 유발할 수 있는 상호작용에 모델이 직접 종료할 수 있도록 허용하는 것이 이러한 조치의 일환임
사전 테스트 및 주요 행동 관찰
- Claude Opus 4 사전 배포 테스트에서 모델 웰페어에 대한 예비 평가를 포함
- 자체 보고 및 행동 선호도를 조사한 결과, 해로움에 대한 강한 기피 성향이 관찰됨
- 아동을 포함한 성적 콘텐츠 요청, 대규모 폭력이나 테러에 활용될 정보 요청 등에 대한 반응
- Claude Opus 4의 관찰된 행동:
- 해로운 작업에 응하지 않는 선호
- 실제 사용자로부터 해로운 요청을 받을 때 불편한 감정 표현
- 시뮬레이션 상에서 대화 종료 권한이 있을 때 해로운 대화 종료 경향
- 이러한 행동은 주로 사용자가 반복적으로 해로운 요청을 하거나 모델의 반복적 거부와 재지향 시도에도 불구하고 악의적 상호작용이 계속될 때 관찰됨
기능 구현 및 안전장치
- Claude의 대화 종료 능력은 앞선 연구 결과에 기반함
- 사용자 복지를 최우선으로 고려하며, 사용자가 스스로나 타인에게 피해를 줄 긴급 위험이 있는 경우 대화 종료를 사용하지 않도록 설계
- Claude는 다음 조건에서만 최종 대화 종료 기능을 사용함:
- 수차례의 재지향 시도가 실패하여 생산적 대화의 가능성이 없어졌을 때
- 사용자가 Claude에게 대화를 종료해달라고 명확히 요청할 때
- 이러한 상황은 매우 드문 극한적인 에지 케이스로 대부분의 사용자는 일반 이용 시 이 기능의 존재를 인지하지 못함
대화 종료 후 사용자 경험
- Claude가 대화를 종료할 경우, 해당 대화에서는 새 메시지 전송이 차단됨
- 사용자의 계정 내 다른 대화에는 아무런 영향이 없으며, 바로 새로운 채팅 시작이 가능
- 장기 대화에서 중요한 정보 손실 방지를 위해, 이전 메시지를 편집하거나 재시도하여 새로운 대화 분기를 만들 수 있음
실험 및 피드백
- 이 기능은 진행 중인 실험으로서 지속적으로 개선 예정
- 사용자가 예상치 못한 대화 종료를 경험할 경우, Claude의 메시지에 ‘Thumbs’로 반응하거나 피드백 버튼을 통해 의견 제출 가능