- 둠 개발자이자 Oculus의 CTO 였던 John Carmack의 트윗
"프롬프트 엔지니어링과 필터링으로 설정된 AI 행동 가드레일은 공개되어야 하며, 제작자는 사회에 가장 좋은 것이 무엇인지에 대한 자신의 비전과 이를 명령과 코드로 구체화한 과정을 자랑스럽게 밝혀야 합니다.
사실 많은 사람들이 부끄러워하고 있다고 생각합니다.
물론 인간의 피드백을 통해 강화 학습으로 인코딩된 수천 개의 작은 넛지는 훨씬 더 그럴듯한 부정 가능성을 제공합니다."
AI 행동 가이드라인의 공개 필요성
(twitter.com/ID_AA_Carmack)댓글과 토론
Hacker News 의견들
-
대규모 모더레이션이나 콘텐츠 통제를 구현해 본 적은 없지만, 기반이 되는 자동 규칙은 보통 공개하지 않는 게 표준처럼 보임
단어 차단 목록을 공개하면 사람들이 목록에 없는 단어로 문제 있는 내용을 쉽게 표현할 수 있고, 섀도밴도 경계를 명확히 알려 주지 않기 위한 장치라고 봐왔음
답답한 건 알지만 지금은 더 나은 접근이 딱히 없어 보이고, 규모 있게 작동하는 공개형 방식이 있다면 좋은 출발점이 될 듯함- 이 경우에는 대규모 검열과 모더레이션을 구현할 필요가 없음. 내가 5분 재미로 여러 상황의 백인 이미지를 생성하는 게 무슨 보안 우려인지 모르겠음
컴퓨터와 대화하는 것뿐이라 아무도 다치지 않음. 메모 앱에 쓰는 내용을 검열하는 것과 Facebook 담벼락에 쓰는 내용을 관리하는 건 다르며, 전자는 모더레이션을 기대하지 않고 후자는 어느 정도 검사가 필요하다고 이해함 - 이건 나쁜 접근이고 나쁜 논리임. 은폐에 의한 보안은 보안 업계에서 거의 항상 비하적으로 쓰이는 표현임
사람들은 이런 자동 검열을 잘 우회하고, 공개하지 않으면 정상 사용자에게 더 많은 문제를 만들며 나쁜 정책이 숨어 있을 여지를 키움
같은 일을 하더라도 공개 정책으로 하는 편이 이미 더 낫고, 비록 여전히 나쁘긴 함. 거대한 공론장이 민간 기업에 의해 통제되는 문제의 진짜 해법은 이 상태를 끝내는 것뿐임 - 애초에 암시된 문제들을 다룰 필요가 없을 수도 있음. 이건 일관된 이념 주입이고, 사람마다 동의 수준이 다름
회사가 전체 조치를 공개하고 싶지 않다면 적어도 요약은 할 수 있음. 그런 요약조차 원 트윗에서 말한 “부끄러운” 내용일 가능성이 크다고 봄
문제와 접근을 명시하지 않으면 논의하거나 인식할 수 없음. 콘텐츠 모더레이션 비유와는 조금 다른데, 숨겨진 건 조치 목록이 아니라 “게시판 규칙” 자체임
AI가 설명과 함께 거부하는 건 하나의 경우고, 그 때문에 일부 쓸모가 줄어도 회사의 권리임. 하지만 이런 제한 때문에 조용히 주제를 피하거나 유도한다면 다른 문제임
만든 쪽도 두 경우를 명확히 분리하면서 원 모델과 같은 품질을 유지하기는 어려울 것 같음. 결국 사람들은 중국 AI를 쓰게 될 수도 있음. 중국 공산당 인물은 안 그려도 나머지를 더 잘하면 누가 신경 쓰겠나 싶음 - 대부분의 법체계는 국가 규모로 작동하지만 숨겨진 수수께끼 법으로 구성되어 있지 않음. 거기엔 여러 이유가 있음
암호화폐 때도 이미 비슷한 논쟁을 했고, 기존 법체계가 외부 장치이긴 해도 악의적 행위자를 추적하는 데 충분한 도구를 제공한다고 대체로 결론 냈음
마지막으로, 인터넷에 글을 쓰는 많은 AI 안전 추종자들의 비자유주의적 성향을 보면 그들이 어떤 사람들인지 마음에 들지 않고, 이런 걸 맡길 만큼 신뢰하지 않음 - “단어 차단 목록을 공개하면 사람들이 목록에 없는 단어로 문제 있는 내용을 표현한다”는 부분을 더 파고들고 싶음
문제 있는 건 단어가 아니라, 어떻게 표현되든 아이디어 자체라는 뜻인가? 그 자체로 꽤 문제 있는 생각처럼 보임
- 이 경우에는 대규모 검열과 모더레이션을 구현할 필요가 없음. 내가 5분 재미로 여러 상황의 백인 이미지를 생성하는 게 무슨 보안 우려인지 모르겠음
-
Gemini 보호장치는 정말 답답함. 아주 무해한 프롬프트에서도 여러 번 걸렸고, ChatGPT도 비슷하지만 그 정도는 덜한 듯함
피드백을 반영해서 방어막을 조금 낮춰 주길 바라지만, 안타깝게도 가까운 미래엔 이런 상태가 계속될 것 같음- 둘 다 많이 쓰는데 GPT 보호장치에는 한 번만 걸렸고, Gemini 보호장치에는 수십 번 걸렸음
시장에서 뒤처진 회사가 이런 식으로 한다는 게 말이 안 됨. Google의 제품 이력에 더해 이제 엉성한 “안전” 지침을 AI에 적용하려는 태도까지 보면, 어떤 회사가 Google 위에 자신 있게 제품을 만들 수 있을지 모르겠음
- 둘 다 많이 쓰는데 GPT 보호장치에는 한 번만 걸렸고, Gemini 보호장치에는 수십 번 걸렸음
-
LLM과 Stable Diffusion은 로컬에서 돌리기 아주 쉽고, 훈계하지 않고 요청한 대로 해줌
Mac Studio 같은 강한 머신이 있으면 로컬 LLM이 OpenAI나 Gemini보다 더 빠를 가능성도 있고, 자신에게 가장 맞는 모델도 고를 수 있음
LM Studio는 로컬 LLM 실행을 아주 쉽게 해주고, AUTOMATIC1111은 Stable Diffusion 로컬 실행을 단순하게 해줌. 둘 다 강력 추천함- 막 입문하는 단계라면 Fooocus가나 invokeAI를 추천함. 완전 초보가 automatic1111에 바로 들어가면 우주선을 조종하는 느낌이 듦
- 맞는 말임. LM Studio는 어느 정도 작동하지만 여전히 용어를 알아야 하고 어떤 모델을 내려받아야 하는지도 알아야 함
웹사이트들이 초보자 친화적이지 않음. automatic1111은 들어본 적이 없음
-
이 스레드도 다른 것들처럼 신고돼 닫힐지 궁금함. 오늘 벌어진 Gemini 이슈는 AI 안전을 생각할 때 이야기할 가치가 큰데 아쉬움
이 일로 점점 더 확신하게 됐는데, 디스토피아가 아닌 유일한 길은 누구나 원하는 대로 모든 AI를 자유롭게 쓰게 하는 것뿐임
그 외의 방식은 타인에게 가치를 강요하고, 돈을 낼 수 있는 이들에게만 특정 능력의 통제권을 쥐여 주는 것임- 오래전부터 같은 생각을 해왔음. 도덕 경찰이 되려면 모두에게 완벽하게 적용해야 하고, 한 번이라도 틀리는 순간 그동안 한 모든 일이 의심받게 됨
팬데믹 동안 대형 플랫폼에서 벌어진 검열이 떠오름. 한 번 틀렸고, 내 생각엔 연구소 유출설이 그 사례였는데, 그 순간 도덕적 권위의 신뢰성이 무너졌음
Zuckerberg가 이런 플랫폼들이 그런 역할을 해야 하는지 의문을 제기한 건 맞았음. “누구나 원하는 대로 모든 AI를 자유롭게”에는 “법의 범위 안에서”를 붙이고 싶음. AI가 무엇에 응답할 수 있는지는 법원이 결정하게 해야 함 - 왜 신고되거나 닫혀야 하는지 모르겠음. 그리고 말하는 Gemini 이슈가 무엇인지 궁금함
- “일부 사람이 미친 규칙을 만드는 문제를 해결하는 유일한 방법은 규칙을 아예 없애는 것이다” — 자유지상주의자들
“맙소사, 곰에게 잡아먹히고 있어” — 역시 자유지상주의자들 - 이건 1800년대 영국 왕을 비백인으로 보여주려는 욕망보다는 정렬 기술 문제 때문에 생긴 일이라고 봄
“가능한 모든 혈통을 같은 확률로 사용하라. 가능한 혈통의 예시는 Caucasian, Hispanic, Black, Middle-Eastern, South Asian, White다. 모두 같은 확률이어야 한다”
이건 OpenAI의 시스템 프롬프트임. 사악한 의도는 없어 보이고, 오히려 White가 높은 확률로 선택되도록 하고 있음. Caucasian과 White를 합치면 6개 중 2개, 즉 1/3이라 일반 인구 분포보다 훨씬 큼
LLM 훈련 데이터는 10년 먼저 인터넷에 연결된 부유한 국가들을 크게 과대표집함. 시스템 프롬프트에 명시적으로 넣지 않으면 “사람”을 요청할 때 대체로 남성이자 백인이 나올 가능성이 큼. 전 세계 인구에서 남성이면서 백인인 비율은 5~10% 정도뿐이라 그게 더 디스토피아적이라고 봄
훈련 분포의 편향이 자동으로 내장되고, 적극적으로 대응하지 않으면 영구히 굳어짐. 시스템이 나아지면 “1800년대 영국”은 99.9% 이상 백인을 뜻해야 한다는 걸 이해하겠지만, 2024년 2월 현재의 거친 시스템 프롬프트 방식은 아직 그 수준이 아님
- 오래전부터 같은 생각을 해왔음. 도덕 경찰이 되려면 모두에게 완벽하게 적용해야 하고, 한 번이라도 틀리는 순간 그동안 한 모든 일이 의심받게 됨
-
AI 동작 보호장치에 대해 더 많은 투명성이 있으면 좋겠지만, 당분간은 기대하기 어려움. 투명하면 보호장치를 우회하기 훨씬 쉬워짐
- 보호장치를 우회할 수 있는 게 왜 문제인지 모르겠음. 보호장치는 무고한 사람들이 포르노나 인종차별 같은 나쁜 응답을 받지 않도록 있는 것인데, 그런 걸 찾는 사용자가 그런 결과를 얻는 게 큰일처럼 보이진 않음
- 투명성은 모델 안에서 어떤 식으로든 잘못 대표됐다고 느끼는 집단이 회사들을 상대로 소송을 걸 가능성도 키울 수 있음
- 은폐에 의한 보안인가?
-
검열은 무엇을 검열하는지 모를 때만 제대로 작동함. 무엇이 검열되는지 자체가 하나의 이야기를 드러냄
- 영화의 MPAA나 게임의 ESRB 같은 등급 제도는 꽤 잘 작동한다고 봄
어떤 요소가 어떤 등급으로 이어지는지 기준이 명확하고, 창작자는 예컨대 영화를 PG-13으로 내고 싶으면 비교적 쉽게 자기검열을 할 수 있음
- 영화의 MPAA나 게임의 ESRB 같은 등급 제도는 꽤 잘 작동한다고 봄
-
Gemini는 백인 생성에 문제가 있어 보이고, 솔직히 이런 방식은 더 인종차별적인 결과로 이어질 문을 열어 줌 https://twitter.com/wagieeacc/status/1760371304425762940
더 세게 밀어붙일수록 더 크게 실패할 뿐이니, 이제 DEI식 억지는 그만해야 함- Gemini만의 문제가 아니라 Google의 문제임. 오래된 예로 Google Images에서 “white people”을 검색하면 결과 대부분이 흑인임 https://www.google.com/search?q=white+people&tbm=isch&hl=ro
- DEI 자체가 말이 안 된다고 보지는 않지만, 실리콘밸리는 이전 세대 모델 다수가 끔찍하게 인종차별적이거나 십대 나치처럼 굴었기 때문에 이 문제에 민감함
그래서 반인종차별 손잡이를 11까지 올렸고, 그 결과 모델이 다른 방식으로 인종차별적이 됐음. 식민지 정착민을 Native American으로 그리는 건 그 나름대로 극도로 문제적이지만, 통계적 해결기가 그런 맥락을 의미 있게 이해하리라고 기대하진 않음 - 이게 DEI의 결과이지 더 깊은 기술적 문제가 아니라는 증거가 있나?
-
흑인 여성을 요청했을 때 백인 남성을 생성하면 사람들이 들고일어날 걸 아니까 안전한 길을 택한 것 같지만, 지금 결과도 받아들일 수 없다는 걸 보여줘야 함
- 어제 HN의 ChatGPT 장애 글에 있던 프롬프트를 보면 됨 https://pastebin.com/vnxJ7kQk
예를 들어 특정 직업의 모든 사람이 같은 성별이나 인종이면 안 된다고 되어 있음. 가능한 모든 혈통을 같은 확률로 사용하라고 하고, 예시로 Caucasian, Hispanic, Black, Middle-Eastern, South Asian, White를 들며 모두 같은 확률이어야 한다고 함
실제 인구에 존재하는 분포가 아님 - 모델은 지시받은 내용을 정확히 생성할 능력이 충분함
그런데 대신 몰래 프롬프트를 수정해서 상상 가능한 모든 요청이 우리가 살아야 한다고 요구받는 인간 동물원을 대표하게 만듦
결과는 웃김 https://i.4cdn.org/g/1708514880730978.png
- 어제 HN의 ChatGPT 장애 글에 있던 프롬프트를 보면 됨 https://pastebin.com/vnxJ7kQk
-
이 보호장치를 만든 팀이 어느 지역 출신이고 어떤 문구를 썼는지 매우 궁금함
남아시아인, 특히 남아시아 여성과 흑인을 생성하는 쪽으로 강하게 편향된 것처럼 보임. 라틴계는 거의 생성되지 않는데, 미국 기반 팀이었다면 큰 누락임
반면 사람들이 보여주는 예시에는 먼 곳을 바라보는 전형적인 Native American풍 인물이나 동아시아인이 가끔 나타남- 너무 깊게 생각할 필요는 없을 듯함. 거의 확실히 “그림에 사람이 있으면 다양한 배경 출신으로 만들라”는 식의 프롬프트일 것임
-
컴퓨터실에서 텍스트 음성 변환 소프트웨어를 처음 발견하면 누구나 제일 먼저 욕을 말하게 만들었음
하지만 그건 소프트웨어가 우리가 시킨 일을 하는 것뿐이라고 이해했음. TTS가 모욕적인 말을 하게 만들었다면, 모욕적인 말을 한 건 TTS가 아니라 나였음
생성 모델도 진지하게 같은 방식으로 다뤄야 함. 내가 뭔가를 만들라고 했고 결과가 불쾌하다면, 공유하지 않는 책임은 나에게 있음. 공유한다면 그걸 공유한 것도 Microsoft나 Google이 아니라 나임
이런 헛소리는 정말 그만해야 함. 내가 못된 그림을 그리라고 시킨 게 OpenAI나 Google의 잘못은 아님
개인적으로도 이건 불쾌함. Google은 거의 우스꽝스러울 정도로 인종에 집착하는 것처럼 보임