# Show GN: 환각을 통제하는 로컬 AI 영상 파이프라인, shelter-puppy

> Clean Markdown view of GeekNews topic #31841. Use the original source for factual precision when an external source URL is present.

## Metadata

- GeekNews HTML: [https://news.hada.io/topic?id=31841](https://news.hada.io/topic?id=31841)
- GeekNews Markdown: [https://news.hada.io/topic/31841.md](https://news.hada.io/topic/31841.md)
- Type: show
- Author: [chessire](https://news.hada.io/@chessire)
- Published: 2026-07-27T07:24:39+09:00
- Updated: 2026-07-27T07:24:39+09:00
- Original source: [github.com/chessire](https://github.com/chessire/shelter-puppy)
- Points: 3
- Comments: 0

## Topic Body

강아지의 소개 숏폼을 폰 촬영본만으로 만드는 파이프라인입니다. raw 폰 영상 여러 개와 자연어 요청 한 문단을 넣으면 약 4분 뒤 자막과 내레이션이 붙은 세로 9:16 영상이 나옵니다. 검출부터 TTS까지 전 과정이 맥북 한 대에서 로컬로 동작하게 설계하였습니다.  
  
[데모 영상](https://youtu.be/HNWxP_chQY4)  
  
LLM에 영상을 던져 그럴듯한 데모를 뽑는 건 어렵지 않습니다. 대신 두 질문에 답하는 걸 목표로 잡았습니다. 내일 똑같이 다시 뽑을 수 있는가와 AI가 지어낸 것과 사람이 설정한 것이 섞이지 않는가 입니다.  
  
**구조**  
- LLM은 해석만, 실행은 결정론. Gemma(로컬)는 동작 이름, 편집 요청 분해, 장면 관찰 같은 의미 판단만 하고, 픽셀과 프레임과 타이밍은 전부 Python/OpenCV/ffmpeg가 만집니다. 같은 입력이면 같은 출력이 나옵니다.  
- 검출과 추적은 YOLO11 + ByteTrack, 다견 재식별은 DINOv2 임베딩 + 보호자 사진 앵커, 동/정적 판단은 카메라 모션을 보상한 ROI 잔차 측정이 전담합니다. 스틸 한 장의 모션처럼 LLM이 구조적으로 못 보는 축은 LLM에 안 맡깁니다.  
- TTS는 Qwen3-TTS(mlx-audio)로 로컬 합성하고 Whisper 왕복 CER 게이트로 검수합니다.  
- LLM이 지어낸 자막은 사실 주장을 분해해 영상 관찰 기록과 대조하고, 근거 없으면 재작성합니다. 유저가 직접 쓴 자막은 검수하지 않습니다.  
  
**결정 방식**  
- 모델과 파라미터 변경은 전부 손라벨 골든셋 채점으로 결정했습니다.  
- 당연히 좋아질 거라 믿었던 개선안이 골든셋 채점에서 두 번이나 기각됐습니다.  
  
**숫자**  
- 단위 테스트 148개, M4 동작 군판정 정확도 1.00  
- 풀 라이프사이클 8분에서 4분으로 생성 시간 감축.  
  
**한계**  
골든셋은 영상 5~9개, 도메인 하나, 1인 개발입니다. 방법론의 엄밀함이지 규모의 검증은 아닙니다.  
  
[개발 과정은 블로그에 연재 했습니다.](https://chessire.tistory.com)  
MIT 라이선스입니다. 이 방법론을 다른 도메인에 옮기는 이야기나 각 결정에 대한 질문 환영합니다.

## Comments



_No public comments on this page._
