- GPT 기반 대형 언어 모델 nano-gpt의 작동 과정을 간략히 소개함
- 이 모델은 6개의 문자 시퀀스를 받아 알파벳 순서로 정렬하는 것이 목표임
- 각 문자는 토큰으로 간주되며, 모든 토큰은 고유의 토큰 인덱스를 가짐
- 각 토큰 인덱스는 48차원 임베딩 벡터로 변환되어 일련의 트랜스포머 레이어를 통과함
- 모델은 다음에 올 토큰을 예측하며, 결과는 반복하여 입력 시퀀스를 발전시킬 수 있음
GPT 언어 모델 소개
- 본 문서는 GPT 대형 언어 모델의 작동 과정을 시각적으로 설명하는 자료임
- 여기서는 nano-gpt라는 매우 소형 모델(파라미터 약 85,000개)을 활용함
- 모델의 목표는 6개의 문자로 이루어진 시퀀스를 받아 이를 알파벳 순서로 정렬(예: "ABBBCC")하는 것임
토큰과 어휘
- 각 문자는 토큰(token) 으로 정의되며, 모델이 인식하는 모든 토큰 집합을 어휘(vocabulary) 라고 부름
- 테이블에서 각 토큰에는 고유의 번호(token index) 가 부여됨
- 이 토큰 인덱스의 숫자 시퀀스를 모델의 입력으로 사용함
입력 변환과 임베딩
- 3D 시각화에서 초록색 셀은 처리 중인 숫자를, 파란색 셀은 모델의 가중치(weight) 를 나타냄
- 각 입력 숫자는 48차원의 임베딩 벡터로 변환됨
- 이 임베딩은 모델 구조 내 여러 트랜스포머 레이어를 연속적으로 통과함
출력과 예측 과정
- 모델의 출력은 해당 시퀀스에서 예측되는 다음 토큰의 확률로 나타남
- 6번째 입력 위치에서는 다음 토큰이 'A', 'B', 'C'일 확률 분포를 예측함
- 예시에서는 모델이 'A'일 확률이 가장 높다고 예측함
- 이 예측 결과를 다시 입력에 넣어 과정을 반복하면서 전체 시퀀스를 만들어냄