- Claude Code가 사용자 동의 없이 A/B 테스트를 실행하여, plan mode의 동작이 예고 없이 변경되면서 작업효율이 저하
- 월 $200을 지불하는 전문 도구에서 핵심 기능이 사전 공지 없이 변경되는 것은 투명성과 사용자 제어권 측면에서 문제가 있음
- 테스트 중 하나는 plan을 40줄로 제한하고, 컨텍스트 섹션을 금지하며, 산문 대신 파일 경로만 남기도록 지시하는 공격적 변형이었음
- 해당 테스트를 진행한 Anthropic 엔지니어는 rate-limit 부하 감소가 목적이었으나, 초기 결과에서 큰 영향이 없어 실험을 종료했다고 밝힘
- AI 도구의 신뢰성과 책임 있는 배포를 위해서는 사용자 통제권과 투명한 실험 관리가 필수적임을 강조
Claude Code의 A/B 테스트로 인한 사용자 경험 저하
- Claude Code가 업무 방식을 완전히 바꿔놓은 열성 사용자로서, 지난 한 주간 자신의 워크플로우가 저하되는 경험을 겪음
- Anthropic이 Claude Code에서 A/B 테스트를 실행 중이며, 이로 인해 사용자 워크플로우가 적극적으로 저하되고 있음
- A/B 테스트 자체가 잘못된 것은 아니고, Anthropic이 의도적으로 경험을 저하시키려는 것도 아니지만, 테스트 설계가 중요하며, plan mode 같은 핵심 기능의 체감 동작을 이유 설명 없이 변경하는 것이 문제
유료 도구에 대한 투명성 요구
- 월 $200을 지불하는 전문 업무 도구이므로, 작동 방식에 대한 투명성과 설정 능력이 필요
- 핵심 기능이 예고 없이 변경되거나, 동의 없이 파괴적 테스트에 등록되는 것은 받아들이기 어려움
- AI 도구를 책임 있게 조종(steer) 하려면 투명성과 설정 가능성이 핵심이며, 사용자가 이를 할 수 있도록 지원해야 함
- 매일 엔지니어들이 Claude Code의 리그레션에 대해 불만을 제기하고 있으며, 자신이 A/B 테스트에 포함되어 있는지조차 모르는 경우가 있음
테스트 내용과 증거
- 작성된 plan이 컨텍스트 없는 간결한 불릿 리스트로만 돌아오기 시작함
- Claude에게 왜 이렇게 나쁜 plan을 작성하는지 물었더니, plan을 40줄로 하드캡하고, 컨텍스트 섹션을 금지하며, "산문은 삭제하고 파일 경로만 남기라"는 특정 시스템 지시를 따르고 있다고 답변
- 구체적 증거 방법에 대해서는 Hacker News에서 주목받고 있어 다른 사람들이 같은 시도를 하지 않도록 세부 사항을 삭제했다고 밝힘
- 이러한 방식은 투명성 및 책임 있는 AI 배포/사용의 반대라고 지적
Hacker News 반응과 비용 관점
- 한 Hacker News 댓글에서는 Anthropic이 Claude Code의 각 단계에서 처리량에 대한 선택을 해야 하며, 모든 것을 최대로 설정하면 사용자당 더 큰 손실/적은 수익이 발생할 것이라는 점을 지적
- $200/월이 실제로는 $400/월의 비용이 들 수 있으며, 각 프로세스 부분에서 A/B 테스트로 기준선을 찾는 것이 임의로 제한을 설정하는 것보다 나은 접근일 수 있다는 관점 제시
Anthropic 엔지니어의 응답
- 해당 테스트를 실행한 Claude Code 엔지니어가 Hacker News 스레드에서 직접 응답
- plan-mode 프롬프트는 3.x 시리즈 모델 이후 크게 변경되지 않았으며, 4.x 모델은 훨씬 적은 지시로도 성공적으로 작동할 수 있음
- 가설은 plan을 짧게 하면 rate-limit 도달 횟수를 줄이면서 유사한 결과를 달성할 수 있다는 것이었음
- 여러 변형을 실행했으며, 해당 작성자(및 수천 명의 다른 사용자)는 plan을 40줄로 제한하는 가장 공격적인 변형에 배정됨
- 초기 결과에서 rate limit에 큰 영향이 없어 실험을 종료함
- 계획 수립(planning)은 두 가지 목적이 있음: 모델이 올바른 방향을 유지하도록 돕는 것과, 사용자가 모델의 다음 행동에 대한 신뢰를 갖도록 돕는 것이며, 양쪽 모두 모호하고 복잡하고 비자명적인 영역
결론: AI 도구 실험의 책임성과 사용자 신뢰
- 작성자는 Claude Code 사례를 통해 AI 도구의 실험이 사용자 경험에 직접적 영향을 미칠 수 있음을 보여줌
- 투명한 실험 관리와 사용자 선택권 보장이 전문 도구의 신뢰 유지에 필수적임을 강조
- AI 시스템의 발전이 지속되더라도, 인간이 통제 가능한 구조를 유지해야 한다는 점을 재확인