Hacker News 의견들
-
어제 이걸 Groq와 함께 써서 Neal Agrawal의 무한 재미 게임을 Chrome 확장으로 보강해 봤고, 이모지만이 아니라 실제 이미지를 생성하게 만들었음
거의 실시간에 가까운 이미지 생성과 LLM 생성이 미래처럼 느껴짐. 프롬프트 작성에는 Groq의 Mixtral을 쓰고, 실시간 생성에는 Fal API를 사용함
https://x.com/altryne/status/1760561501096575401?s=20- 이걸 횡스크롤 게임으로 바꿔서, 진행하면서 배경이 다루는 단어들의 렌더링으로 점진적이고 자연스럽게 전환되면 좋겠음
데모 초반의 푸른 풍경이 후반 이미지의 건조한 산악 지형으로 천천히 바뀌고, 전경에는 새 캐릭터가 등장하는 모습을 상상함 - 카드 기반 게임으로 바꿀 수 있을지도 궁금함
- 정말 좋아 보임. Chrome 확장을 공유할 가능성이 있는지 궁금함
- 이걸 횡스크롤 게임으로 바꿔서, 진행하면서 배경이 다루는 단어들의 렌더링으로 점진적이고 자연스럽게 전환되면 좋겠음
-
기록용으로 남기면, SDXL Lightning은 Hugging Face에 비교적 관대한 라이선스로 공개된 오픈소스임: https://huggingface.co/ByteDance/SDXL-Lightning
다른 UI도 몇 가지 있음. 예: https://replicate.com/lucataco/sdxl-lightning-4step- 맞음. 내부적으로는 ByteDance가 Stable Diffusion XL 위에서 학습해 오픈소스로 공개한 SDXL Lightning을 사용함
여기에 자체 추론 엔진과 실시간 인프라를 더해서 다른 UI보다 매끄러운 경험을 제공함. 속도 기준으로는 비교가 거의 안 된다고 보며, 여기서는 4단계가 약 370ms인 반면 링크한 replicate 예시는 약 2~3초 수준임 - Gradio로도 데모를 만들었지만 fal.ai보다 2배 느림. 단일 A10G에서 stable-fast 컴파일을 사용함
https://huggingface.co/spaces/radames/Real-Time-Text-to-Imag...
GPU/CUDA/Docker가 있으면 로컬에서도 실행해 볼 수 있음
docker run -it -p 7860:7860 --platform=linux/amd64 --gpus all -e SFAST_COMPILE="1" -e USE_TAESD="0" registry.hf.space/radames-real-time-text-to-image-sdxl-lightning:latest python app.py - 로컬 추론에서는 메모리 사용량과 속도가 어느 정도인지 궁금함
- 맞음. 내부적으로는 ByteDance가 Stable Diffusion XL 위에서 학습해 오픈소스로 공개한 SDXL Lightning을 사용함
-
속도는 훌륭함
품질은 오늘 사람들이 Stable Diffusion 3와 다른 모델을 테스트하는 데 쓴 프롬프트를 빌려 봤음: "Photo of a red sphere on top of a blue cube. Behind them is a green triangle, on the right is a dog, on the left is a cat"
내가 얻은 결과는 이렇다: https://imgur.com/a/XrAuqCB
Stable Diffusion 3와 비교하면: https://pbs.twimg.com/media/GG8mm5va4AA_5PJ?format=jpg&name=...- 공간적 프롬프트 준수는 SDXL이나 이전 Stable Diffusion 계열에서 전반적으로 부족한 부분임. Stable Diffusion이 예시처럼 이 부분을 잘 다듬어 주길 기대함
최신 공개 가중치 Stability 모델인 Stable Cascade에서도 같은 예시를 테스트해 봤는데, 역시 그리 좋지는 않음: https://fal.ai/models/stable-cascade?share=eab44060-690b-497... - 내가 얻은 결과는 꽤 정확함: https://imgur.com/a/vH0zq5b
시드: 3919562 - 시드를 바꿔가며 돌리면 결과가 아주 달라짐
- 공간적 프롬프트 준수는 SDXL이나 이전 Stable Diffusion 계열에서 전반적으로 부족한 부분임. Stable Diffusion이 예시처럼 이 부분을 잘 다듬어 주길 기대함
-
데모는 정말 인상적이지만, 더 부드러웠다면 훨씬 더 놀라웠을 것 같음. 지금은 예를 들어 단어를 지우거나 공백을 추가하면 짧은 시간에 추론이 4번 일어나서 덜컥거리는 느낌이 남
의도적으로 단계별 결과를 보여주는 것일 수도 있음. 참고로 이건 fal.ai의 데모이고, Stable Cascade가 공개된 날 아침 그들이 데모를 올렸을 때 처음 알게 됨
OpenAI 바깥에서 추론을 돌린다면 fal.ai를 강하게 추천함. AI 업계에 거의 3년 있었고, 작년부터는 거의 24시간 붙어 있었는데 Fal은 논문 속 수치가 아니라 실제 사용에서 이 정도로 빠르게 만들기 위해 세부를 챙기는 첫 서비스처럼 보임
예를 들면 WebSocket 연결, API 키로 요청 서명을 하려고 엣지 함수를 거치지 않아도 되게 하는 짧은 수명의 JWT 같은 부분임- 이 정도로 빠르다면 목표 이미지로 바로 점프하기보다 잠재 공간 안에서 부드러운 경로를 따라 중간 이미지를 생성하는 편이 나을 수도 있음
-
이 데모가 정말 마음에 듦. 접근하기 쉽고 빠르며 직관적임. 이 정도 품질을 이렇게 쉽게 얻을 수 있다는 게 놀라움
- 이 데모와 Groq는 정말 놀라웠음. 얼마 전만 해도 계정을 만들면 무료 생성 20번쯤 주는 사이트에서 망가진 이미지를 하나 받으려고 오래 기다리던 기억이 남
이제는 회원가입이나 CAPTCHA 없이 웹사이트에 들어가 번개처럼 빠른 텍스트와 이미지 생성을 할 수 있다는 게 대단함. 특히 Groq와 fal.ai가 데모를 완전히 열어 둘 수 있을 정도라는 점까지 포함하면, 2024년 초에 이런 성능 향상을 예상하지 못했음
빠른 생성은 이미지 품질의 단점도 많이 상쇄한다고 봄. 실패하더라도 좋은 결과는 보통 시드 하나나 작은 프롬프트 수정 하나 거리인 경우가 많음
- 이 데모와 Groq는 정말 놀라웠음. 얼마 전만 해도 계정을 만들면 무료 생성 20번쯤 주는 사이트에서 망가진 이미지를 하나 받으려고 오래 기다리던 기억이 남
-
어떻게 이렇게 빠를 수 있는지 궁금함. 그리고
blob:[https://blbahblah](<https://blbahblah>)이미지는 뭔지 모르겠음
덧붙여 프롬프트를 조금 바꾸면 너구리가 꼬리 두 개를 갖기 쉬움- 두 번째 질문에 답하면, 그건 객체 URL임
https://developer.mozilla.org/en-US/docs/Web/API/URL/createO...
파일이나 Blob을 이미지 요소 등에서 쓸 수 있는 URL로 바꾸는 방식임 - JavaScript의 버퍼를 나타내는 임시 URL임: https://developer.mozilla.org/en-US/docs/Web/API/URL/createO...
- 두 번째 질문에 답하면, 그건 객체 URL임
-
정말 놀라움. 지연 시간 감소가 이런 도구와 상호작용하는 방식에 큰 영향을 줌
여기서의 속도 이점은 단순히 더 많은 이미지를 생성하는 수준을 넘어서, 여러 시도를 해보는 동안 같은 사고 흐름을 끊기지 않고 이어가게 해줌 -
정말 인상적인데, Stable Diffusion으로 일관된 캐릭터를 생성하는 방법을 아는 사람이 있는지 궁금함
첫 프롬프트가 고양이와 말하는 소녀이고, 두 번째 프롬프트가 그 고양이와 노는 소녀라면, 두 그림에서 소녀와 고양이가 같아 보이길 원함
가능하다면 관련 링크나 튜토리얼이 큰 도움이 될 듯함- 기억하기로 Dashtoon Studio는 Stable Diffusion으로 일관된 캐릭터가 나오는 만화를 만들 수 있게 해줌: https://dashtoon.com/create
- Dashtoon Studio에서 가능함. 이미지 한 장만 올려도 일관된 캐릭터 LoRA를 학습시켜 줌. AI 만화 제작용 소프트웨어이고, YouTube에서 이 영상을 찾았음: https://www.youtube.com/watch?v=EEQwEvKQGvE
LoRA가 가장 다재다능한 편임. 원하는 포즈와 카메라 각도에서 캐릭터를 일관되게 얻을 수 있기 때문임. IP-Adapter는 입력 이미지의 특징을 너무 많이 복제하고, 포즈처럼 복제하지 않을 요소를 고르기 어려움. 그래서 초상화 입력의 캐릭터가 다른 행동을 하게 만들기가 어려워질 수 있음
Reactor는 얼굴을 바꿔 넣을 생성 이미지가 필요함. 사실적인 이미지에서는 잘 작동하지만, 스타일화된 이미지에서는 스타일이 유지되지 않고 머리 모양도 복사되지 않음
지금까지 찾은 것 중에는 Dashtoon이 가장 안정적이고 쉬웠음. 새 캐릭터 이미지 20장을 모으는 것도 어렵고, LoRA 학습 세트에서는 클로즈업 수나 표정 수 같은 이미지 속성이 꽤 중요하기 때문임 - https://scenario.gg를 확인해 볼 만함. 캐릭터의 맞춤 이미지로 직접 LoRA를 학습시킬 수 있고, 좋은 일관성을 얻으려면 여러 각도의 이미지가 대략 20장 정도 필요함
더 단순하지만 여전히 꽤 괜찮은 방법으로 IP-Adapter도 있으며, 이 서비스도 지원함. 고양이를 일관되게 유지하는 건 맞춤 LoRA 없이는 어려울 것 같음. 참고 자료: https://help.scenario.com/training-a-character-lora - 보통 이름을 쓰는 것만으로도 충분함. 좋은 SD 모델에서는 Maria Smith가 거의 항상 Maria Smith처럼 보임
- Mickey는 꽤 일관적으로 보임: https://fastsdxl.ai/share/4us7hrp3jm20
-
단일 글자를 넣었을 때 동작이 흥미로움. 내 경우에는 작고 꽤 세부적인 건물로 자주 수렴하는 듯함
같은 글자를 더 많이 반복할수록, 예를 들어111보다11111111이 되면 건물이 더 이상해짐. 지금 보니 시드에 꽤 민감한 것 같음- 알 수 없는 단어나 개념은 출력에 사실상 영향을 주지 않음. 프롬프트에서
baby raccoon을maxolhx로 바꿔 보면 그 단어를 무시하고 이탈리아 신부를 렌더링함
엄밀히 말하면 여전히 영향은 있지만, 우리가 쉽게 설명할 수 있는 방식은 아님. 거의 시드를 가지고 노는 셈임
- 알 수 없는 단어나 개념은 출력에 사실상 영향을 주지 않음. 프롬프트에서
-
정말 마음에 듦. URL 공유가 가능했으면 좋겠음
late 90s movie poster, 24 hour clock movie "2: Electric Boogaloo" dan aykroyd1
이 프롬프트 결과가 훌륭했음- 평범한 사람이 이렇게 보임: https://fastsdxl.ai/share/1mb3d5lo5ic9
영웅은 이렇게 보임: https://fastsdxl.ai/share/x9jxax4pnljd
테러리스트는 이렇게 보임: https://fastsdxl.ai/share/ejtyvv9ahpfs
내가 되고 싶은 사람은 이렇게 보임: https://fastsdxl.ai/share/8ekkecm5rqsr
빠른 속도 덕분에 시드만 바꿔가며 내재된 편향을 빠르게 평가할 수 있어서 매우 흥미로움 - 방금 공유 기능을 추가했음. 무엇을 만드는지 알려주면 좋겠음
- 시드를 제공했으면 공유가 가능했을 것 같음
- 평범한 사람이 이렇게 보임: https://fastsdxl.ai/share/1mb3d5lo5ic9