- ACM은 강화학습의 개념적·알고리듬적 기반을 세운 Andrew G. Barto와 Richard S. Sutton을 2024 ACM A.M. Turing Award 수상자로 선정함
- 두 사람은 1980년대부터 보상 기반 학습을 일반 문제 프레임워크로 정식화하고, 환경과 보상이 알려지지 않은 상황에서도 작동하는 접근을 발전시킴
- 핵심 기여는 시간차 학습, 정책 경사 방법, 신경망 기반 함수 표현, 학습과 계획을 결합한 에이전트 설계로 이어짐
- 1998년 교재 Reinforcement Learning: An Introduction은 75,000회 이상 인용됐고, AlphaGo·ChatGPT의 RLHF·로봇 조작·네트워크 혼잡 제어·칩 설계 등에 영향을 줌
- 튜링상은 Google 지원으로 상금 100만 달러가 수여되며, ACM은 강화학습이 AI 발전과 뇌 작동 이해 모두에 기여했다고 봄
수상자와 선정 이유
- ACM은 Andrew G. Barto와 Richard S. Sutton을 2024 ACM A.M. Turing Award 수상자로 선정함
- 선정 사유는 강화학습의 개념적·알고리듬적 기반을 개발한 공로임
- 두 사람은 1980년대부터 논문을 통해 강화학습의 핵심 아이디어를 도입하고, 수학적 기반과 주요 알고리듬을 구축함
- Barto는 University of Massachusetts, Amherst의 Information and Computer Sciences 명예교수임
- Sutton은 University of Alberta 컴퓨터과학 교수, Keen Technologies 연구 과학자, Amii(Alberta Machine Intelligence Institute) 펠로우임
- ACM A.M. Turing Award는 “컴퓨팅의 노벨상”으로 불리며, Google, Inc.의 재정 지원으로 100만 달러 상금이 수여됨
강화학습이 푸는 문제
- 인공지능은 일반적으로 환경을 지각하고 행동하는 에이전트를 만드는 분야임
- 더 지능적인 에이전트는 더 나은 행동 경로를 선택해야 하며, 어떤 행동이 다른 행동보다 낫다는 판단이 AI의 중심에 있음
- 보상(reward) 은 심리학과 신경과학에서 온 용어로, 에이전트 행동의 품질과 관련해 제공되는 신호를 뜻함
- 강화학습은 이 보상 신호를 바탕으로 더 성공적으로 행동하는 방법을 배우는 과정임
- Alan Turing은 1950년 논문 “Computing Machinery and Intelligence”에서 “기계가 생각할 수 있는가?”를 다루며 보상과 처벌에 기반한 기계학습 접근을 제안함
- Arthur Samuel은 1950년대 후반 자기 대국으로 학습하는 체커 프로그램을 개발했지만, 이후 수십 년 동안 이 계열의 AI에서는 큰 진전이 거의 없었음
Barto와 Sutton의 기술적 기여
- 1980년대 초 Barto와 당시 박사과정 학생이던 Sutton은 심리학 관찰에서 동기를 얻어 강화학습을 일반 문제 프레임워크로 정식화하기 시작함
- 두 사람은 마르코프 결정 과정(MDP) 의 수학적 기반을 활용함
- MDP에서는 에이전트가 확률적 환경에서 결정을 내림
- 각 전이 뒤 보상 신호를 받고, 장기 누적 보상을 최대화하는 것을 목표로 함
- 표준 MDP 이론은 모든 정보가 에이전트에게 알려져 있다고 가정하지만, 강화학습 프레임워크는 환경과 보상이 알려지지 않은 상황도 다룸
- 정보 요구량이 작고 MDP 프레임워크가 일반적이어서 강화학습은 다양한 문제에 적용 가능함
- Barto와 Sutton은 공동 연구와 후속 협업을 통해 여러 기본 강화학습 알고리듬 접근을 개발함
- 가장 중요한 기여는 보상 예측 문제 해결에서 큰 진전을 만든 시간차 학습(temporal difference learning) 임
- 정책 경사 방법(policy-gradient methods) 도 주요 접근에 포함됨
- 학습된 함수를 표현하는 도구로 신경망을 사용하는 접근을 발전시킴
- 환경 지식을 획득해 계획의 기반으로 삼는 학습·계획 결합 에이전트 설계도 제안함
교재와 딥 강화학습으로 이어진 영향
- 1998년 교재 Reinforcement Learning: An Introduction은 여전히 분야의 표준 참고문헌이며 75,000회 이상 인용됨
- 이 교재는 수천 명의 연구자가 신흥 분야였던 강화학습을 이해하고 기여하는 데 도움을 줬고, 오늘날 컴퓨터과학 연구 활동에도 영향을 주고 있음
- Barto와 Sutton의 알고리듬은 수십 년 전에 개발됐지만, 최근 15년 동안 강화학습과 딥러닝 알고리듬이 결합되며 실제 응용에서 큰 진전이 나타남
- 이 결합은 딥 강화학습(deep reinforcement learning) 기법으로 이어짐
- 딥러닝 알고리듬은 2018년 튜링상 수상자인 Bengio, Hinton, LeCun이 개척한 것으로 소개됨
적용 사례와 연구 확장
- 강화학습의 대표 사례로 2016년과 2017년 AlphaGo가 최고 인간 바둑 기사들을 이긴 일이 꼽힘
- ChatGPT도 주요 성과에 포함됨
- ChatGPT는 두 단계로 학습된 대형 언어 모델임
- 두 번째 단계에서 인간 기대를 포착하기 위해 인간 피드백 기반 강화학습(RLHF) 을 사용함
- 로봇 분야에서는 손 안 로봇 조작과 물리적 Rubik’s Cube 풀이 사례가 있음
- 강화학습을 시뮬레이션에서 수행하고도, 상당히 다른 실제 세계에서 성공할 수 있음을 보임
- 다른 적용 영역에는 네트워크 혼잡 제어, 칩 설계, 인터넷 광고, 최적화, 글로벌 공급망 최적화, 챗봇의 행동과 추론 능력 개선, 행렬 곱셈 알고리듬 개선이 포함됨
- 신경과학에서 영감을 받은 기술은 다시 신경과학에도 영향을 줌
- Barto의 연구를 포함한 최근 연구는 AI에서 개발된 특정 강화학습 알고리듬이 인간 뇌의 도파민 시스템 관련 여러 발견을 가장 잘 설명한다고 봄
ACM과 Google의 평가
- ACM President Yannis Ioannidis는 Barto와 Sutton의 연구가 컴퓨팅의 오래된 과제에 다학제 접근을 적용할 잠재력을 보여준다고 평가함
- 인지과학, 심리학, 신경과학은 강화학습 발전에 영감을 줬고, 강화학습은 AI의 중요한 발전 기반과 뇌 작동에 대한 더 큰 통찰을 제공함
- Ioannidis는 강화학습이 지나간 발판이 아니라 계속 성장 중이며, 컴퓨팅과 여러 분야의 추가 발전 잠재력을 제공한다고 밝힘
- Google Senior Vice President Jeff Dean은 Alan Turing이 1947년 강연에서 “우리가 원하는 것은 경험에서 배울 수 있는 기계”라고 말한 점을 인용함
- Dean은 Barto와 Sutton이 개척한 강화학습이 Turing의 과제에 직접 답하며, 지난 수십 년간 AI 진전의 핵심축이었고 AI 붐의 중심 기둥으로 남아 있다고 평가함
수상자 약력
- Andrew Barto는 University of Massachusetts, Amherst의 Information and Computer Sciences 학과 명예교수임
- 1977년 UMass Amherst에서 박사후 연구원으로 경력을 시작함
- 이후 Associate Professor, Professor, Department Chair 등을 역임함
- University of Michigan에서 수학 학사, Computer and Communication Sciences 석사와 박사를 받음
- UMass Neurosciences Lifetime Achievement Award, IJCAI Award for Research Excellence, IEEE Neural Network Society Pioneer Award를 받음
- IEEE Fellow, AAAS Fellow임
- Richard Sutton은 University of Alberta 컴퓨팅과학 교수, Dallas 기반 인공일반지능 회사 Keen Technologies 연구 과학자, Amii 최고과학고문임
- 2017년부터 2023년까지 DeepMind Distinguished Research Scientist였음
- 1998년부터 2002년까지 AT&T Shannon Laboratory AI 부서 Principal Technical Staff Member로 일함
- Barto와의 협업은 1978년 University of Massachusetts at Amherst에서 시작됐으며, Barto는 Sutton의 박사 및 박사후 지도교수였음
- Stanford University에서 심리학 학사, University of Massachusetts at Amherst에서 Computer and Information Science 석사와 박사를 받음
- IJCAI Research Excellence Award, Canadian Artificial Intelligence Association Lifetime Achievement Award, University of Massachusetts at Amherst Outstanding Achievement in Research Award를 받음
- Royal Society of London, Association for the Advancement of Artificial Intelligence, Royal Society of Canada의 펠로우임