1P by GN⁺ | ★ favorite | 댓글 1개
  • OpenAI의 DALL·E 3는 ChatGPT 사용자와 API 개발자를 위한 텍스트-이미지 생성 모델로, 입력한 문장을 더 충실히 반영하는 이미지 생성을 목표로 함
  • 기존 시스템은 단어나 설명을 놓치는 일이 많아 사용자가 프롬프트 엔지니어링에 의존해야 했지만, DALL·E 3는 같은 프롬프트에서도 DALL·E 2보다 개선된 결과를 내도록 설계됨
  • ChatGPT 통합으로 사용자는 간단한 문장이나 자세한 문단만 입력해도, ChatGPT가 DALL·E 3용 상세 프롬프트를 자동으로 만들어줌
  • 결과 이미지가 마음에 들지만 세부가 맞지 않으면 몇 단어로 수정 요청을 할 수 있으며, 생성 이미지는 재인쇄·판매·상품화에 별도 허가가 필요 없음
  • 안전 장치로 실존 공인 이름 요청과 생존 작가 스타일 요청을 거부하며, 창작자는 향후 이미지 생성 모델 학습에서 자신의 이미지를 옵트아웃할 수 있음

텍스트를 더 정확히 따르는 이미지 생성

  • DALL·E 3는 ChatGPT 사용자와 API를 통한 개발자에게 제공됨
  • 텍스트-이미지 시스템은 단어나 설명을 무시하는 경향이 있어, 원하는 결과를 얻으려면 프롬프트 엔지니어링을 배워야 하는 경우가 많음
  • DALL·E 3는 사용자가 제공한 텍스트를 더 정확히 따르는 이미지 생성을 목표로 함
  • 같은 프롬프트에서도 DALL·E 2보다 눈에 띄는 개선을 제공하도록 설계됨

ChatGPT로 프롬프트 생성과 수정까지 연결

  • DALL·E 3는 ChatGPT에 네이티브로 통합되어, 아이디어 발상과 프롬프트 다듬기를 ChatGPT 안에서 처리할 수 있음
  • 사용자는 보고 싶은 장면을 간단한 문장부터 자세한 문단까지 자연어로 요청할 수 있음
  • ChatGPT는 사용자의 아이디어를 바탕으로 DALL·E 3용 맞춤형 상세 프롬프트를 자동 생성함
  • 특정 이미지가 마음에 들지만 정확히 원하는 결과가 아닐 때는 몇 단어만으로 수정을 요청할 수 있음

생성 이미지 사용 권리

  • DALL·E 3로 만든 이미지는 사용자가 사용할 수 있음
  • DALL·E 2와 마찬가지로 생성 이미지를 재인쇄, 판매, 상품화하는 데 OpenAI의 별도 허가가 필요 없음

공인 생성과 유해 편향을 줄이기 위한 안전 장치

  • DALL·E 3는 공인 이름을 직접 요청하는 이미지 생성을 거부하는 완화 장치를 갖춤
  • OpenAI는 레드팀과 협력해 공인 생성, 시각적 과다·과소 표현과 관련된 유해 편향 등 위험 영역의 안전 성능을 개선함
    • 레드팀은 모델을 스트레스 테스트하는 도메인 전문가임
    • 이 작업은 선전과 허위정보 같은 영역의 위험 평가와 완화 노력에 활용됨
  • OpenAI는 이미지가 AI로 생성됐는지 식별하는 더 나은 방법도 연구 중임
  • 내부 도구인 provenance classifier를 실험하고 있으며, 이 도구는 이미지가 DALL·E 3로 생성됐는지 식별하는 데 도움을 줄 수 있음
  • OpenAI는 이 도구를 통해 생성 이미지가 어떻게 사용될 수 있는지 더 잘 이해하고, 추가 내용을 공유할 계획임

창작자 제어와 참고 자료

  • DALL·E 3는 생존 작가 스타일로 이미지를 요청하는 경우 거부하도록 설계됨
  • 창작자는 향후 이미지 생성 모델 학습에서 자신의 이미지를 제외하도록 옵트아웃할 수 있음
  • 관련 자료로 연구 논문이미지 옵트아웃 양식이 제공됨

댓글과 토론

Hacker News 의견들
  • 아직 공개된 게 아니면 발표의 발표 범주에 들어감 (https://hn.algolia.com/?dateRange=all&page=0&prefix=true&sor...)
    실제로 논의할 대상이 생기면 그때 스레드를 열면 되고, 기다려도 손해는 없음 (https://hn.algolia.com/?dateRange=all&page=0&prefix=false&so...)

    • 이렇게 강하게 노출이 낮아진 글은 처음 봤지만, 이 “발표”가 워낙 김빠지는 내용이라 환영함
  • 관심 있는 분들을 위해: 작년에 DALL·E 2로 약 7,000장의 이미지를 생성해서 https://generrated.com/에 올렸음
    DALL·E 2가 무엇을 만들 수 있는지 실험하고, 다른 사람에게 영감이나 출발점으로 공유하고 싶었음
    API가 나오기 전이라 전부 수동으로 생성하고 저장해야 했고, 비용도 꽤 들었지만 재미있었음
    DALL·E 3 접근 권한을 받으면 전부 업데이트해야 할 듯함

    • 그렇게 한다면 v2와 v3 이미지 비교를 볼 수 있으면 멋질 듯함
    • 이제 프롬프트에 작가 이름을 못 쓰니 DALL·E 3로는 저 사이트를 유지하기 어려울 것 같음
      수정: 실제로는 생존 작가만 프롬프트에 못 쓰는 듯하고, 적어도 글에는 그렇게 나와 있음
    • 단어를 그렇게 못 그리는 구체적인 기술적 이유를 아는 사람이 있는지 궁금함
      합리적인 가설을 수없이 세울 만한 패턴은 보이는데, 호기심상 실제 원인이 무엇인지 알고 싶음
      이미지들을 보면 텍스트를 한 번도 정확히 맞히지 못하고 늘 조금씩 빗나간다는 점이 특히 흥미로움. 가끔은 크게 틀리지만 대체로는 꽤 가까움
    • 이런 플랫폼들이 이미지 관리, 다운로드, 전체 프롬프트 확보를 왜 이렇게 어렵게 만드는지 정말 이상함
      Midjourney용 Discord 봇을 만들었는데, 간단한 설정으로 버전 등 최대한 가져올 수 있는 정보를 포함해 이미지를 다운로드하고 주석을 달 수 있음: https://github.com/ernop/social-ai/tree/main/SocialAI
      그래도 완벽하진 않음. 보낸 명령에서 정보를 가져오는데, 당시 기본값에 기대고 있었을 수 있어서 지금 해석하면 과거의 버전·시드 등을 프롬프트에 포함하지 않은 한 재구성하기 어렵기 때문임
      그래도 최소한 프롬프트가 붙은 3만 장짜리 폴더를 영구히 보관해 두고, 나중에 다시 실행해서 시간에 따른 비교를 할 수 있다는 점이 좋음
    • 꽤 좋았음. 처음엔 이미지 5장뿐이라 조금 밋밋하다고 생각했지만, 다양한 스타일과 개념이 잔뜩 예시로 들어 있어 훌륭한 영감원이 됨
  • 생각나는 점들: ChatGPT 통합은 엄청 큼. ChatGPT Plus와 기업용 통합이 10월에 온다면 Midjourney와 여러 텍스트-이미지 SaaS 회사를 크게 견제하고, 그들을 NSFW 용도에 집중하게 만들 수 있음
    품질은 Midjourney와 비슷해 보이지만, Midjourney에는 업스케일링이나 여러 변형 생성 같은 유용한 기능도 있음. DALL·E 3가 사용자 경험 측면에서 따라갈 수 있을지 궁금함
    UI로는 Discord보다 ChatGPT를 훨씬 선호하므로 이쪽이 더 좋음

    • ChatGPT 통합에서 정말 놀라울 수 있는 건, 텍스트를 ChatGPT로 다듬듯이 이미지를 반복 수정해서 원하는 결과까지 갈 수 있는 능력임
      지금 Midjourney나 Stable Diffusion은 가끔 엄청난 이미지가 나오고 가끔은 안 나오는데, 카지노처럼 느껴짐. Stable Diffusion은 마스크를 씌우고 다시 시도할 수 있지만 번거롭고 시간이 많이 듦
      “이 이미지는 좋은데 원숭이는 한 마리만 있었으면 하고, 하늘을 초록색으로 바꿔줘”라고 말하면 원본 이미지를 받아 수정해 준다면 완전한 판도 변화가 됨
      아마 실제로는 이렇게 동작하지 않을 가능성이 크지만, 그러길 바람
    • DALL·E 2에는 Midjourney보다 훨씬 전부터 변형 생성과 인페인팅 등이 있었음
      그래도 이 경쟁에서 누가, 무엇이 이길지 보는 건 정말 흥미로울 듯함
    • ChatGPT 통합이 그렇게 클 것 같지는 않음
      Bing Chat은 이미 내부적으로 GPT-4를 쓰고, Bing Image Creator도 통합돼 있으며 내부적으로 DALL·E 2.5쯤을 쓰지만 좋지 않음
      그냥 이미지 프롬프트를 대신 써주는 수준이고, 직접 쓰면 되는 일을 한 번 더 전달하는 쓸모없는 전화놀이에 가까움
    • 공정하게 말하면 NSFW 시장은 상당히 크고, 그 자체만으로도 많은 회사를 먹여 살릴 만큼 충분함
      Literotica로 훈련한 대규모 언어 모델 같은 것도 가능하지 않을까
    • 잘 모르겠음. 이미 ChatGPT로 Midjourney용 프롬프트를 만들고 있고 클릭 몇 번이면 됨
      엄청난 차이를 못 느끼겠고, 특히 Midjourney가 DALL·E보다 훨씬 더 좋음
  • “DALL·E 3는 생존 작가의 스타일로 이미지를 요청하는 경우 거절하도록 설계됐다”, “창작자는 이제 향후 이미지 생성 모델 훈련에서 자신의 이미지를 제외할 수 있다”고 되어 있음
    그렇다면 이번 버전도 저작권 있는 작업물을 허락 없이 훈련에 쓴 것임
    게다가 수동으로 제외 신청하라는 부담을 작가에게 떠넘기고 있음
    언젠가 법원이 생성 이미지마다 각 작가에게 비용을 지급하라고 강제할까 봐 두렵지 않은 걸까

    • 나도 그렇게 훈련됐음
    • 그런 일이 생길 즈음에는 이미 말이 도망간 뒤일 거라고 베팅하는 듯함
      즉 법원이 수천 개의 매우 크고 강력한 회사에게 수백만 명에게 돈을 내라고 강제해야 하는데, 사실상 감당하기 어려운 법적 노력이 됨
    • “저작권 있는 작업물로 다시 훈련했다”는 데에는 아직 확실한 증거가 없음
      출처나 방법론을 공개하지 않았고, “훈련”과 “저작권”을 제외한 나머지는 의문임. 그렇지 않았다면 이미 로열티를 내고 있었을 것임
      이전 버전 2의 출력물을 GPT가 만든 프롬프트와 함께 사용하고, 생성 이미지에 맞춰 사람이 보정했을 수도 있음
      또 컴퓨터 비전으로 새 이미지와 기존 이미지를 분석해 이미지에 새 특징이 있으면 프롬프트에 추가하고 다시 훈련했을 수도 있음
    • 생존 작가는 자기 자신의 스타일로 된 이미지를 요청할 수 있어야 함
    • 일반적인 저작권 체계에서 이런 일이 “허용”되고, 이제 대중용 상업 제품으로 들어가는 건 완전히 미친 일임
      법원 상태를 보면 되돌려질 거라는 기대도 없음
      Disney 같은 대형 지식재산권 보유자와는 곰을 건드리지 않도록 뒷거래를 하면서, 작은 주체들은 방어할 수 없게, 정확히는 이미 가난한데 더 돈이 없게 남겨두고 있을 가능성이 큼
  • Midjourney에는 실제 위협이 될 수 있어 보이지만, Stable Diffusion을 밀어내진 못할 것 같음
    프롬프트 준수는 뛰어날 것으로 보이지만, 맞춤화 부족과 예술 스타일 제한이 활용도를 크게 줄일 것임
    사람들은 DALL·E 3로 구도용 기본 이미지를 만들고, 스타일·업스케일링·세부 묘사는 Stable Diffusion으로 돌릴 듯함

    • 왜 Stable Diffusion에는 위협이 아니라고 보는지 궁금함
      생성물인지 구분하기 어려운 초고품질 이미지는 Stable Diffusion보다 Midjourney에서 훨씬 더 많이 봄
    • 예술 스타일 제한은 솔직히 눈살이 찌푸려짐. 별로 관심 없음
      Midjourney의 필터링도 충분히 짜증났고, ChatGPT가 단순한 요청을 오해될 수 있다는 이유로 의미 없이 거절하는 것도 끝없이 짜증났음
      그 둘을 합치고 작가 스타일 필터링까지 명시적으로 더한다면 그냥 건너뛰겠음
      덧붙이자면 Midjourney로 NSFW를 만들고 있는 게 아님. “카운터 위에서 치즈를 자르는 사람의 스톡 사진”을 원했는데, “cutting”이나 “slicing” 같은 단어가 고어 이미지를 만드는 데 쓰일 수 있다는 이유로 못 쓰는 상황을 말하는 것임
  • “창작자는 이제 향후 이미지 생성 모델 훈련에서 자신의 이미지를 제외할 수 있다”고 해놓고, 링크가 이미지 한 장씩 제출하는 폼이라는 게 웃김
    사이트에서 GPTBot을 막을 수 있다고는 하지만, 이미 봇이 이미지를 긁어갔다면 어떻게 되는지도 문제임
    어차피 다른 사람이 GPTBot을 막지 않는 다른 웹사이트에 내 사진을 올릴 수도 있음

  • 최근 프로젝트 때문에 Midjourney 이미지를 많이 만들고 있는데, AI 아트 종말론자들이 이해하지 못하는 것 같은 걸 다시 깨달음: 큐레이션의 중요성
    /r/Midjourney나 위 DALL·E 링크의 추천 이미지만 훑어봐도, 생성기의 “기본 결과”가 얼마나 지루한지 보임
    이미지를 만드는 일은 쉬워질 수 있지만, 어떤 이미지가 매력적인지 골라내려면 여전히 예술적 감각과 기술이 필요함
    큰 그림에서는 일러스트형 예술이 더 큐레이션 활동에 가까워지고, 대량의 이미지 속에서 걸러내는 능력이 핵심 기술이 될 것 같음

    • 사진과 비슷한 걸까
    • 텍스트-이미지 도구를 잘 알진 않지만, 기준 이미지를 입력으로 줄 수 있지 않나
      입력으로 넣을 기준 이미지를 만들 수 있다면 결과가 더 좋아질 거라고 봄. 입력이 좋을수록 출력도 좋아짐
      상업 분야에서는 AI를 잘 활용하는 예술가들이 앞서 나갈 상황처럼 느껴짐
    • 그런 단계가 얼마나 오래갈지 모르겠고, 누구도 거기에 기대서는 안 된다고 봄
    • 사람의 선호를 기준으로 걸러내는 AI도 훈련할 수 있을 것 같음
      그래도 취향과 기술적 재능이 있는 예술가가 이미지를 큐레이션된 이상에 더 가깝게 조작할 여지는 남아 있음
      지금의 Stable Diffusion 기반 Photoshop 작업 흐름처럼 생성물이 바탕을 만들고, 작업 흐름이 성숙하면 다시 수동 입력이 늘어날 것 같음
      예컨대 ControlNet으로 특정 자세나 배치를 잡아 구도를 막아두고, AI가 90%를 채운 뒤, 사람이 취향으로 마지막 10%를 다듬고 반복하는 방식임
  • “DALL·E 3는 ChatGPT 위에 네이티브로 구축됐다”는 항목과 ChatGPT·이미지 생성 간의 긴밀한 통합, 그리고 발표와 함께 연구 논문이 나오지 않은 점을 보면, GPT-4 멀티모달 능력의 시험 운영이고 비슷한 인프라에서 돌아갈 가능성이 크다고 강하게 의심됨

    • GPT-4는 텍스트-텍스트와 이미지-텍스트만 할 수 있고, 이미지를 직접 생성할 수 없음
      그래서 그냥 API 호출을 쓸 것임. 특별할 게 없고 Bing도 같은 일을 함
    • 지금까지 GPT-4가 만든 그림은 이 수준이 아니었지만, 더 새 버전일 수는 있음
      참고: https://arxiv.org/pdf/2303.12712.pdf
  • 저작권 있는 “훈련” 자료를 제거한 건가, 아니면 여전히 동의 없이 사람들의 노고에서 “배웠다”고 하면서 허락 없이 팔고 있는 건가

    • 발표 끝부분을 보면 아주 조심스럽게 표현돼 있음: “DALL·E 3는 생존 작가의 스타일로 이미지를 요청하는 경우 거절하도록 설계됐다. 창작자는 이제 향후 이미지 생성 모델 훈련에서 자신의 이미지를 제외할 수 있다”
      그러니까 여전히 사람들의 노고에 기대고 있지만, 좋은 점이라면 자기 작업물이 DALL·E 4의 먹이가 되지 않도록 제외 신청은 할 수 있다는 뜻임
    • 법적으로는 아마 큰 문제가 아닐 가능성이 큼
      핵심은 AI가 인간처럼 학습하므로 기존 작품의 직접 복제가 아닌 출력은 새 창작물이라는 주장을 성공적으로 펼칠 수 있느냐에 달려 있음
      AI가 어떤 작가의 예술 스타일을 복제해도 비슷하게 적용됨. 인간이 주말 동안 한 작가의 작품을 보고 같은 스타일로 의뢰작을 그리는 것과 유사하며, 예술 스타일은 저작권으로 보호할 수 없기 때문에 완전히 합법임
      물론 Adobe는 그러길 원하겠지만[0]
      0: https://twitter.com/UltraTerm/status/1679294173793628161
    • 제거하지 않았음. 장기적으로 Adobe의 AI가 이길 이유 중 하나일 수 있음
      또 한 가지 계속 생각나는 건, 이런 AI 생성물이 게임 산업식 붕괴를 일으킬 수 있지 않을까 하는 점임
      광고는 많이 되지만 의미 없고 가치 낮은 AI 콘텐츠가 과잉 공급되면 소비자가 흥미를 잃고 책, 게임, 영화, 디지털 아트, 음악 같은 각 산업에서 지출을 멈추고 무너질 수도 있음
    • OpenAI는 Shutterstock에서 이미지 데이터를 라이선스하므로, 전부 라이선스 이미지로 훈련했을 가능성도 있음
      https://investor.shutterstock.com/news-releases/news-release...
      늘 그렇듯 훈련 데이터에 대한 더 많은 투명성이 있으면 좋겠음
    • 인간 예술가들이 허락 없이 다른 사람의 작품을 보며 “훈련”하고, 그것을 허락 없이 고기 두뇌에 다운로드한 뒤, 유기 신경망을 그 예술로 훈련해 온 게 늘 싫었음
      그렇게 하면 안 됨. 저작권 극대주의 관점에서는 저작권 침해임
  • 또 한 번의 경쟁이 시작됨
    어떤 사람들은 OpenAI에 강한 반감을 가진 듯하지만, 적어도 OpenAI는 특정 분야에서 스스로를 넘어서야 할 기준점으로 만드는 일을 정말 매우 잘함
    그리고 그렇게 하면서 분야 전체를 꽤 멀리 밀어붙이는 것 같음

    • OpenAI가 싫은 이유는 AI 안전을 위해 설립됐는데, 안전에 가장 반하는 일이 AI 능력 경쟁을 부추기는 것이고, OpenAI가 바로 그 일을 반복해서 하고 있기 때문임
    • OpenAI는 곧 Microsoft라는 걸 잊으면 안 됨
      나 같은 오래된 사람은 90년대 Microsoft가 벌인 짓들을 기억함. 지금도 어떤 분야에서 앞서 있다면 똑같이 했을 것이고, 뒤에서는 가끔 아직도 그렇게 함
      FB나 Zuckerberg를 좋아하진 않지만, LLAMA를 무료로 푼 건 좋은 움직임
      OpenAI 내부에서 또 다른 유출이 나와서 모든 것에 접근할 수 있게 되길 바람