2P by chessire | ★ favorite | 댓글과 토론

강아지의 소개 숏폼을 폰 촬영본만으로 만드는 파이프라인입니다. raw 폰 영상 여러 개와 자연어 요청 한 문단을 넣으면 약 4분 뒤 자막과 내레이션이 붙은 세로 9:16 영상이 나옵니다. 검출부터 TTS까지 전 과정이 맥북 한 대에서 로컬로 동작하게 설계하였습니다.

데모 영상

LLM에 영상을 던져 그럴듯한 데모를 뽑는 건 어렵지 않습니다. 대신 두 질문에 답하는 걸 목표로 잡았습니다. 내일 똑같이 다시 뽑을 수 있는가와 AI가 지어낸 것과 사람이 설정한 것이 섞이지 않는가 입니다.

구조

  • LLM은 해석만, 실행은 결정론. Gemma(로컬)는 동작 이름, 편집 요청 분해, 장면 관찰 같은 의미 판단만 하고, 픽셀과 프레임과 타이밍은 전부 Python/OpenCV/ffmpeg가 만집니다. 같은 입력이면 같은 출력이 나옵니다.
  • 검출과 추적은 YOLO11 + ByteTrack, 다견 재식별은 DINOv2 임베딩 + 보호자 사진 앵커, 동/정적 판단은 카메라 모션을 보상한 ROI 잔차 측정이 전담합니다. 스틸 한 장의 모션처럼 LLM이 구조적으로 못 보는 축은 LLM에 안 맡깁니다.
  • TTS는 Qwen3-TTS(mlx-audio)로 로컬 합성하고 Whisper 왕복 CER 게이트로 검수합니다.
  • LLM이 지어낸 자막은 사실 주장을 분해해 영상 관찰 기록과 대조하고, 근거 없으면 재작성합니다. 유저가 직접 쓴 자막은 검수하지 않습니다.

결정 방식

  • 모델과 파라미터 변경은 전부 손라벨 골든셋 채점으로 결정했습니다.
  • 당연히 좋아질 거라 믿었던 개선안이 골든셋 채점에서 두 번이나 기각됐습니다.

숫자

  • 단위 테스트 148개, M4 동작 군판정 정확도 1.00
  • 풀 라이프사이클 8분에서 4분으로 생성 시간 감축.

한계
골든셋은 영상 5~9개, 도메인 하나, 1인 개발입니다. 방법론의 엄밀함이지 규모의 검증은 아닙니다.

개발 과정은 블로그에 연재 했습니다.
MIT 라이선스입니다. 이 방법론을 다른 도메인에 옮기는 이야기나 각 결정에 대한 질문 환영합니다.

댓글과 토론