- 2017년 Google 연구자 8명의 “Attention Is All You Need”는 언어 처리를 순차 모델 중심에서 transformer 구조로 옮기며 생성형 AI의 기반이 됨
- Jakob Uszkoreit은 LSTM이 긴 텍스트의 뒤쪽 문맥 단서를 놓치기 쉽다고 보고, 문장 전체를 함께 참조하는 self-attention을 대안으로 밀어붙임
- Illia Polosukhin, Ashish Vaswani, Niki Parmar, Llion Jones, Łukasz Kaiser, Aidan Gomez, Noam Shazeer가 합류하면서 번역 실험이 커졌고, Shazeer의 구현 뒤 Big 모델이 English-to-German 번역 기록을 깸
- 논문은 2017년 5월 19일 NeurIPS 마감 직전 제출됐고, 엇갈린 리뷰 뒤 12월 포스터 세션에서 큰 관심을 받았으며 Google은 방어적 목적의 임시 특허를 출원함
- 저자 8명은 모두 Google을 떠났고, Near를 제외한 Character AI, Sakana AI, Essential AI, Cohere, Inceptive 등은 transformer 기술을 기반으로 성장함
“Attention Is All You Need”가 만든 전환
- “Attention Is All You Need”는 2017년 봄 Google 연구자들이 작성한 논문임
- 저자 8명은 기여 순서를 정하지 않기 위해 각 이름에 별표를 붙이고 “Equal contributor”, “Listing order is random”이라는 각주를 달았음
- 이 논문은 neural network 기반 AI를 transformer 구조로 확장했고, transformer는 ChatGPT와 Dall-E, Midjourney 같은 생성형 AI 제품의 핵심 구조가 됨
- Geoffrey Hinton은 transformer가 없었다면 지금의 상황에 도달하지 못했을 것이라고 평가함
- OpenAI와 다른 회사들이 인간의 산출물에 맞서거나 일부 경우 이를 넘어서는 시스템을 만드는 흐름을 가리킨 말임
- 논문 저자 8명은 모두 Google을 떠났고, 각자 2017년에 만든 구조로 구동되는 시스템과 관련된 일을 하고 있음
self-attention 아이디어의 출발
- transformer의 출발점은 Jakob Uszkoreit의 self-attention 구상임
- 그는 Google 번역 그룹에서 일하다가 2012년 Google 검색 페이지에서 사용자의 질문에 직접 답하는 시스템을 만드는 팀에 합류함
- 당시 Google은 Apple Siri가 검색 트래픽을 위협할 수 있다고 보고 이 분야에 더 많은 관심을 기울임
- 당시 언어 모델은 recurrent neural network와 LSTM에 의존했지만, 긴 텍스트 처리에는 한계가 있었음
- 예시 문장
Joe is a baseball player... got two hits에서 “two hits”를 이해하려면 앞의 baseball 정보를 기억해야 함 - LSTM은 더 크고 복잡한 텍스트 시퀀스를 처리하게 했지만, 여전히 단어를 순차적으로 처리해 뒤쪽 문맥 단서를 놓칠 수 있었음
- 예시 문장
- Uszkoreit은 2014년경 self-attention을 구상함
- self-attention은 단어를 번역할 때 문장 안의 다른 모든 위치를 참조할 수 있음
- 순차적으로 단어를 보는 방식이 아니라 여러 입력을 함께 보는 병렬적 방식이라, 머신러닝 붐 속에서 대량 생산되던 병렬 처리 칩과 잘 맞았음
- 기존 neural architecture를 버리는 접근이라 반응은 회의적이었음
- Uszkoreit의 아버지 Hans Uszkoreit도 저녁 식탁 대화에서 같은 생각을 공유하지 않았음
- Uszkoreit은 동료들과 작은 텍스트 실험을 진행했고 2016년 논문을 냈지만, 기존 공동 작업자들은 이를 Google 검색과 광고 등에 적용하는 데 더 관심을 보임
우연한 합류와 “transformer” 팀의 형성
- 2016년 Uszkoreit은 Google 카페에서 Illia Polosukhin과 점심을 먹다 self-attention을 제안함
- Polosukhin은 Google.com에서 직접 답변하려면 밀리초 단위로 응답하는 저렴하고 고성능인 시스템이 필요하다고 봄
- 그는 Ashish Vaswani와 협업했고, Vaswani는 Google Brain에서 큰 프로젝트를 찾던 중 self-attention 아이디어에 합류함
- 세 사람은 “Transformers: Iterative Self-Attention and Processing for Various Tasks”라는 설계 문서를 만듦
- “transformers”라는 이름은 처음부터 사용됐고, 입력 정보를 변환해 사람이 이해하는 것만큼의 이해를 추출하거나 그런 인상을 주는 메커니즘이라는 의미를 담았음
- Uszkoreit은 어린 시절 Hasbro Transformer 장난감을 갖고 놀았던 기억도 이름과 연결함
- 이후 Niki Parmar와 Llion Jones가 합류함
- Parmar는 USC에서 석사 학위를 받은 뒤 Google에 들어와 Uszkoreit과 함께 Google 검색 개선을 위한 모델 변형을 작업함
- Jones는 Google Research에서 Polosukhin의 매니저 아래 있었고, 동료 Mat Kelcey에게 self-attention 개념을 들은 뒤 transformer 팀에 합류함
- Google Brain의 Łukasz Kaiser와 인턴 Aidan Gomez도 함께함
- Gomez는 University of Toronto에서 Geoffrey Hinton의 연구실이 있는 머신러닝 그룹에 참여했고, Kaiser에게 관련 논문 확장 아이디어를 보내 인턴십 기회를 얻음
- Kaiser와 Gomez는 자신들의 프로젝트와 self-attention 프로젝트를 합치는 문제를 논의한 뒤 합치기로 결정함
기록을 깬 실험과 마감 직전 제출
- 팀은 self-attention 모델로 기계 번역을 수행하고 BLEU 벤치마크로 성능을 측정함
- 초기 모델은 LSTM 대안들과 비슷한 수준이었지만 더 낫지는 않았음
- Noam Shazeer가 우연히 프로젝트를 듣고 합류하면서 구현 품질이 크게 올라감
- Shazeer는 transformer 팀의 코드를 직접 다시 구현함
- 그는 기존 recurrent neural network를 불편하게 여겼고 이를 대체하자는 생각으로 참여함
- 팀원들은 그의 구현을 “magic”, “alchemy”, “bells and whistles” 같은 말로 표현했으며, Uszkoreit은 self-attention 같은 직관적 메커니즘이 살아 움직이려면 경험 많은 소수 구현자가 필요하다고 봄
- 2017년 NeurIPS 제출 마감일인 5월 19일을 앞두고 실험 속도가 빨라짐
- 팀은 12시간 학습한 기본 transformer 모델과 3일 반 학습한 더 강력한 Big 모델을 테스트함
- English-to-German 번역에서 기본 모델은 모든 경쟁 모델을 앞섰고, Big은 기존 기록을 확실히 깨는 BLEU 점수를 내면서 계산 효율도 더 좋았음
- 마감 직전 2주 동안 팀은 Building 1965에서 집중적으로 작업함
- ablation으로 어떤 모듈과 기법이 실제로 필요한지 제거·교체하며 확인함
- masking을 제대로 하지 않아 생긴 문제 같은 버그를 고치며 transformer의 현재 구성 요소가 빠른 반복 실험 속에서 정리됨
- 제목은 Llion Jones가 Beatles의 “All You Need Is Love”를 떠올려 “Attention Is All You Need”로 제안함
- English-French 결과는 제출 5분 전에 나왔고, 논문은 마감 2분을 남기고 제출됨
- Google은 방어적 목적의 특허 포트폴리오를 위해 임시 특허를 빠르게 출원함
Google, OpenAI, 그리고 8명의 이후 행보
- NeurIPS 리뷰는 긍정적 1개, 매우 긍정적 1개, “괜찮다” 수준 1개로 엇갈렸고, 논문은 저녁 포스터 세션에 채택됨
- 2017년 12월 6일 4시간짜리 세션은 더 알고 싶어 하는 과학자들로 붐볐음
- 세션 종료 시각인 밤 10시 30분에도 사람들이 남아 있어 보안 요원이 나가라고 해야 했음
- LSTM 공동 발명자인 Sepp Hochreiter가 찾아와 작업을 칭찬한 점은 Uszkoreit에게 만족스러운 순간이었음
- transformer는 Google 내부와 세계를 즉시 지배하지는 않았음
- Shazeer는 논문 출간 무렵 Google 경영진에게 검색 인덱스 전체를 버리고 transformer 기반 거대 네트워크를 학습하자고 제안함
- Kaiser조차 당시에는 그 제안을 터무니없다고 봄
- OpenAI는 더 빠르게 움직였고, Ilya Sutskever가 Alec Radford에게 이 아이디어를 작업해보라고 제안한 뒤 첫 GPT 제품이 나옴
- Google은 2018년부터 제품에 transformer를 통합하기 시작함
- 첫 적용은 번역 도구였음
- 같은 해 transformer 기반 언어 모델 BERT를 내놓았고, 이듬해 검색에 적용하기 시작함
- Sundar Pichai는 ChatGPT 같은 대규모 언어 모델을 먼저 내놓지 않은 이유에 대해, 다른 사람들이 작동 방식을 보여준 뒤 Google이 더 많은 일을 할 수 있었다고 말함
- 논문 저자 8명은 모두 Google을 떠났음
- Noam Shazeer는 Character AI를 공동 창업했고, 추정 가치는 50억 달러임
- Llion Jones는 Tokyo 기반 Sakana AI를 공동 창업했고, 가치는 2억 달러임
- Jakob Uszkoreit의 Inceptive는 3억 달러 가치의 바이오테크 회사임
- Illia Polosukhin의 Near는 약 40억 달러 시가총액의 토큰을 가진 블록체인을 만듦
- Niki Parmar와 Ashish Vaswani는 2021년 Adept를 시작했고, 이후 Essential AI를 창업했으며 Essential AI는 800만 달러 투자를 받음
- Aidan Gomez는 2019년 Toronto에서 Cohere를 공동 창업했고, 추정 가치는 22억 달러임
- Łukasz Kaiser는 회사를 창업하지 않고 OpenAI에 합류했으며, Q*라는 새 기술의 발명자 중 한 명임
- Near를 제외한 이들의 회사는 transformer 기술을 기반으로 함
- Google은 비전통적 아이디어를 추구할 수 있는 환경을 만들었고, 모든 저자는 같은 사무실에서 일했음
- 복도에서의 만남과 점심 대화가 중요한 계기가 됨
- 8명 중 6명은 미국 밖에서 태어났고, 나머지 2명도 각각 독일인 부모가 캘리포니아에 잠시 머물 때 태어난 경우와 박해를 피해 온 가족을 둔 1세대 미국인임
- Uszkoreit은 혁신이 올바른 조건, 적절한 시점의 사람들, 재미, 올바른 문제, 운이 맞을 때 생긴다고 봄