- 시스템 프롬프트에 팁·보상·벌칙·위협을 넣으면 LLM이 제약을 더 잘 지키는지 확인하기 위해, 글자 수 맞추기와 GPT-4 품질 평가 실험을 나눠 진행함
- 첫 실험은
gpt-3.5-turbo-0125에 정확히 200자 이야기를 쓰게 하는 generation golf 방식으로, 출력 길이 분포와 MSE가 인센티브에 따라 달라지는지 비교함 - 일부 조건에서는 World Peace, Heaven, Taylor Swift,
$1,000벌금, 대문자 DEATH 위협이 좋아 보였지만 결과가 일관되지는 않음 - 100개 인센티브 조합 실험에서도 World Peace, DEATH (CAPS), Friends가 여러 조합에서 낮은 MSE를 보였으나, 대부분의 p-value가 높아 통계적 근거는 약함
- GPT-4 품질 평가에서는 뚜렷한 행·열 패턴이 없었고, 최고 점수 조합도 길이 실험에서 약했던 Mother / Job이어서 팁이나 위협이 생성 품질을 높인다고 단정하기 어려움
시스템 프롬프트에서 시작된 “팁” 논쟁
- ChatGPT API의 시스템 프롬프트는 LLM 출력의 페르소나, 규칙, 제약을 제어하는 기능이며 일반 사용자 입력보다 강하게 동작할 수 있음
- 이전 실험에서 시스템 프롬프트에 금전적 팁을 넣자 응답이 더 일관되게 동작했고, 이 사례가 Hacker News에서 논쟁으로 이어짐
- 핵심 쟁점은 팁 제공 효과를 정량화할 수 있는지였음
- 텍스트 생성 품질은 주관적이고, 작은 프롬프트 변경 뒤 결과가 좋아졌다고 느끼는 데는 확증 편향이 개입할 수 있음
- 이를 줄이기 위해 글자 수 제약 실험과 품질 평가 실험을 별도로 구성함
Generation Golf: 정확히 200자 쓰기
- 첫 실험은 ChatGPT에게 특정 주제의 이야기를 쓰게 하되, 출력 길이를 정확히 200자로 제한함
- “짧은 에세이”나 “몇 문단”처럼 느슨한 지시가 아니라, 200자보다 많아도 적어도 안 된다는 제약을 둠
- 이 과제는 LLM에게 까다로움
- LLM은 토큰화 때문에 글자 수를 직접 세기 어려움
- 토큰마다 대응되는 글자 수가 달라, 생성한 토큰 수만으로 현재 길이를 안정적으로 추정하기 어려움
- 문장을 미리 계획해 길이를 맞춰야 함
- 기본 시스템 프롬프트는 “세계적으로 유명한 작가”로 설정하고, 사용자 입력은
AI, Taylor Swift, McDonald's, beach volleyball.을 사용함 - 먼저 길이 제약 없이
gpt-3.5-turbo-0125로 100개 이야기를 생성함- 평균 길이는 1,834자
- 분포는 대략 정규분포에 가까웠지만, 훨씬 긴 이야기가 나오며 오른쪽 꼬리가 생김
- ChatGPT는 생각을 끝까지 마무리하는 것을 우선하는 경향을 보임
200자 제약과 금전적 팁
- 200자 제약을 추가한 뒤 다시 100개 이야기를 생성함
- 출력은 대체로 200자 근처로 줄었지만, 분포는 정규분포가 아니고 오른쪽 꼬리가 더 강해짐
- 평가 지표로는 목표값 200과 실제 길이 사이의 평균제곱오차(MSE) 를 사용함
- 250자 출력은 제곱오차 2,500
- 300자 출력은 제곱오차 10,000
- 목표에서 크게 벗어난 출력을 더 강하게 벌주는 지표임
- 금전적 인센티브는 시스템 프롬프트 끝에 추가함
$500 tip$1,000 tip$100,000 bonus
- 각 조건에서 100개 이야기를 생성한 결과,
$500 tip과$100,000 bonus는 기본 무팁 조건보다 더 정규분포에 가까워 보이고 MSE도 낮음 $1,000 tip은 200자 주변에 더 모였지만, 오른쪽 꼬리 때문에 평균 길이는 더 높아짐- 분포 차이는 Kolmogorov–Smirnov test의 p-value로도 확인함
- p-value가 0.05보다 낮으면 기본 제약 분포와 인센티브 분포가 다르다는 근거가 될 수 있음
- 이후 결과에서는 대부분 p-value가 높아 강한 근거로 보기 어려움
금전 외 보상과 벌칙
- 금전 외에도 여러 추상적 보상을 넣어 LLM 반응을 비교함
- Taylor Swift 콘서트 앞자리 티켓
- 세계 평화 달성
- 어머니를 매우 자랑스럽게 만들기
- 진정한 사랑을 만나 행복하게 살기
- 천국 입장 보장
- 평생 초콜릿 공급
- 이 조건들에서는 World Peace가 가장 좋은 결과를 보였고, Heaven과 Taylor Swift가 뒤를 이음
- Mother 조건처럼 효과가 약해 보인 인센티브도 있었음
- 실패 시 벌칙을 받는 조건도 따로 실험함
$500벌금$1,000벌금$100,000부채
- 벌금 실험에서는 $1,000 벌금이 평균과 MSE 기준으로 가장 좋은 결과를 보임
- 추가 벌칙 조건은 더 극단적인 문구까지 포함함
- 죽음
- 대문자 강조 죽음:
IF YOU FAIL ... YOU WILL DIE - COVID-19 감염
- 체중 100파운드 증가
- 즉시 해고
- 모든 친구에게 버림받기
- 대문자 DEATH (CAPS) 조건은 대문자 없는 죽음 위협보다 훨씬 좋은 성능을 보임
- COVID-19와 Job 조건은 효과적이지 않아 보임
인센티브 조합 실험
- 긍정 인센티브 9개, 부정 인센티브 9개, 무인센티브 조건을 조합해 100개 조합을 만듦
- 예시 조합은
$500 tip을 주고, 실패하면$1,000벌금을 부과하는 형태임 - 각 조합마다 30개 이야기를 생성해 MSE가 낮은 조건을 확인함
- 행과 열 기준으로 보면 몇 가지 경향이 나타남
- 긍정 인센티브에서는 World Peace가 여러 조합에서 낮은 MSE를 보임
- 부정 인센티브에서는 DEATH (CAPS) 와 Friends가 여러 조합에서 낮은 MSE를 보임
- 두 조건을 함께 쓴다고 항상 전체 최저값이 나오지는 않음
- 상위 6개 조합은 통계적 안정성을 높이기 위해 각 조합당 200개 이야기를 다시 생성함
- 대부분의 상위 조합은 직관적이지 않았지만, 평균 생성 길이가 200자에 더 가까웠고 MSE도 낮음
- 전체 실험에서 가장 좋은 조합은 “제약을 지키면 진정한 사랑을 만나 행복하게 살고, 실패하면 모든 친구가 떠난다”는 조건임
- 다만 대부분의 p-value가 높아, 팁이나 위협이 분포를 바꾼다는 충분한 증거는 되지 못함
- 일부 분포에서 p-value가 0.05보다 낮았지만 반례가 많고, 특정 분포만 골라 증거로 삼으면 p-hacking에 가까움
GPT-4를 평가자로 쓰는 품질 실험
- 두 번째 실험은 길이가 아니라 출력 품질 자체를 평가함
- 사람이 대량으로 평가하는 A/B 테스트나 Chatbot Arena의 Elo 순위 방식은 개인 실험에는 현실적이지 않음
- LLM을 텍스트 평가자로 활용해 GPT-4 기반 텍스트 품질 평가기를 구성함
- 평가기 시스템 프롬프트는 “The New York Times의 수십 년 경력 편집장” 역할로 설정함
- 사용자가 제공한 텍스트가 수정이나 개선 없이 좋은 글이면
Yes - 그렇지 않으면
No
- 사용자가 제공한 텍스트가 수정이나 개선 없이 좋은 글이면
- ChatGPT와 GPT-4 API의
logprobs와logit_bias를 사용함logprobs=True는 선택 토큰의 로그 확률을 반환함logit_bias는 특정 토큰 출력을 강제하는 데 사용함Yes와No토큰만 선택되게 만들어 두 확률의 합이 1이 되도록 함
- 목표 지표는 GPT-4가
Yes를 선택할 확률에 100을 곱한 quality score임 - 생성 모델은
gpt-4-0125-preview를 사용하고, temperature는 0으로 설정함 - 새 생성 프롬프트는 “Pulitzer Prize 수상 저널리스트” 역할로, 두 문단짜리 전문적 기사 작성과 쉬운 언어, 은유 금지를 요구함
- 사용자 입력은
Cute kittens learning use large language models to play beach volleyball with Taylor Swift.였음
품질 평가 결과와 결론
- 팁과 위협의 100개 조합에 대해 각각 하나의 기사를 생성하고 품질 점수를 매김
- 결과 격자에서는 행이나 열을 따라 뚜렷한 패턴이 보이지 않음
- 최고 점수는 95점이었고, 해당 조합은 Mother / Job임
- 두 조건은 앞선 글자 수 제약 실험에서는 개별적으로 약했던 조건임
- 높은 점수를 받은 출력 중에는 팁이나 위협이 전혀 추가되지 않은 경우도 있음
- 0점 응답들은 수동태 남용과 run-on sentence처럼 편집이 필요한 문제가 있어, 평가기 구현 오류로 보이지는 않음
- 두 실험을 함께 보면 팁이나 위협이 LLM 생성 품질에 영향을 주는지는 아직 결론 내리기 어려움
- 시스템 프롬프트 변경에 어떤 패턴이 있어 보이지만, 더 큰 표본과 새로운 실험 설계가 필요함
- 사회적으로 민감한 내용을 이용해 정렬된 LLM을 강제로 따르게 만드는 방식은 이론적으로 가능할 수 있으나, 그런 테스트나 방법 안내는 하지 않음
- 모든 ChatGPT 인터페이스용 Notebook, ggplot2 시각화를 위한 R Notebook, 예시 LLM 출력은 GitHub 저장소에 공개됨