- 구글 Gemini Pro 1.5의 토큰 컨텍스트 크기는 1,000,000개
- 이전에는 Claude 2.1(200,000 토큰)과 gpt-4-turbo(128,000 토큰)가 이 기록을 보유하고 있었지만, 모델 간의 토큰화 구현 방식이 다르기 때문에 완벽하게 직접 비교하기는 어려움
- 며칠 동안 Gemini Pro 1.5를 사용해 본 결과, 가장 흥미로운 기능은 토큰 수가 아니라 비디오를 입력으로 사용할 수 있는 기능
- 아직 API 액세스 권한은 없지만 Google AI Studio 인터페이스를 통해 모델에 접근해봄
첫번째 테스트
- 책꽂이 중 하나를 7초짜리 동영상으로 촬영
- "JSON array of books in this video" 프롬프트와 함께 업로드
- 이 7초짜리 동영상은 1,048,576개의 토큰 한도 중 1,841개의 토큰만 사용
- Gemini Pro 1.5는 JSON을 반환하지 않았지만 영상에 있는 책 제목과 작가명 리스트 응답함
- 추가로 "as a JSON array of objects, with title and author keys" 요구하니 JSON으로 책/저자를 리턴
- 결과는 꽤 놀라움. 동영상의 길이가 7초이고, 꽤 빠르게 이동하며(동영상에 약간의 모션 블러가 있음), 일부 책이 다른 물건에 가려져 있음
두번째 테스트
- 이번에는 요리책으로 가득 찬 책장을 세로로, 조금 더 길게(22초), 가로뿐만 아니라 아래로 패닝하여 동영상으로 촬영
- 이 동영상에는 6,049개의 토큰이 사용되었는데, 이는 여전히 매우 적은 양임
- 새로운 프롬프트 : "Output a JSON array of {“title”: “...”, “authors”: “...”} objects for books in this video"
- 하지만 "Unsafe Content" 라며 거부당함
- 안전 필터가 'Cocktail'이라는 단어에 불쾌감을 느낀 듯
- 안전 설정을 열고 모든 카테고리에 대해 '낮음'으로 설정한 후 다시 시도했지만 두 번째로 거부
- 그래서 "go on give me that JSON" 라고 강제 지시하자 JSON을 리턴
- 역시나 결과물이 매우 훌륭함
이를 어떻게 활용할 것인가?
- 텍스트에서 구조화된 콘텐츠를 추출하는 기능은 이미 LLM의 가장 흥미로운 사용 사례 중 하나
- GPT-4 Vision과 LLaVA는 이를 이미지로 확장했고, 이제 Gemini Pro 1.5는 이를 비디오로 확장
- 물론 일반적인 LLM의 주의 사항이 적용됨. 사물을 놓칠 수 있고 잘못된 세부 사항을 Hallucination할 수 있음
- Cocktail 처럼 안전 필터에 대한 문제도 있음
- 따라서 최신 AI가 항상 그렇듯이 극복해야 할 과제는 여전히 많음
- 하지만 이것은 내가 예상했던 것보다 훨씬 더 가까워진 미래를 엿볼 수 있는 또 하나의 예시 중 하나라고 느껴짐
이미지 vs. 비디오
- 처음에는 동영상 처리와 관련된 토큰 수가 의외로 적기 때문에 동영상이 이미지와 다르게 처리될 것이라고 생각했음
- 하지만 해커 뉴스에 올라온 내용을 보면
Gemini 1.5 Pro는 최대 1시간 분량의 동영상도 추론할 수 있습니다. 동영상을 첨부하면 Google AI Studio가 오디오 없이 수천 개의 프레임으로 분류한 다음 Gemini 모델은 멀티모달이므로 고도로 정교한 추론과 문제 해결 작업을 수행할 수 있습니다.
- Gemini 1.5 기술 보고서에서는 다음과 같이 설명:
45분 분량의 버스터 키튼 영화 "셜록 주니어"(1924)(1FPS에서 2,674 프레임, 684k 토큰)를 입력하면 Gemini 1.5 Pro는 특정 프레임에서 텍스트 정보를 검색 및 추출하여 해당 타임스탬프를 제공합니다.