- 2024년 4월 공개된 Kolmogorov-Arnold network(KAN) 는 기존 MLP 기반 신경망보다 내부 동작을 더 읽기 쉬운 대안으로 제안됐고, 특정 문제군에서는 일반 신경망이 하는 거의 모든 작업을 수행할 수 있음
- KAN은 간선에 숫자 가중치 대신 학습 가능한 비선형 함수를 배치해 출력을 맞추며, 이 구조는 1957년 Kolmogorov-Arnold 정리에 뿌리를 둠
- MIT의 Ziming Liu와 Max Tegmark 연구팀은 2층 KAN의 한계를 겪은 뒤 3층 이상 구조를 시도했고, 3층 KAN이 2층으로는 정확히 표현할 수 없는 함수를 표현할 수 있음을 보임
- 매듭 이론과 Anderson localization 문제에서 KAN은 답만 내지 않고 관련 수식이나 관계까지 보여줬으며, 물리처럼 변수가 적은 과학 문제에서 특히 유용할 가능성이 있음
- 후속 연구에서는 해석 가능성 과제와 편미분방정식 풀이에서 강점이 확인됐지만, 컴퓨터 비전과 오디오 처리에서는 MLP가 더 나았고 KAN 2.0은 사용성을 높인 형태로 공개됨
MLP 블랙박스와 KAN의 등장
- 현대 신경망의 대표적 기본 구성은 multilayer perceptron(MLP) 이며, 대규모 데이터셋으로 확장했을 때 강력한 성능을 냄
- MLP 기반 네트워크는 성공에도 불구하고 사람이 결론 도출 과정을 이해하기 어렵고, 결과를 설명하는 근본 원리가 있는지도 파악하기 쉽지 않음
- 2024년 4월 KAN 논문은 더 투명하면서도 특정 문제군에서 일반 신경망이 하는 거의 모든 일을 할 수 있는 Kolmogorov-Arnold network(KAN) 를 제안함
- Johns Hopkins University의 Alan Yuille은 KAN이 해석 가능성이 더 높고, 데이터에서 과학적 규칙을 추출해야 하는 과학 응용에 특히 유용할 수 있다고 봄
KAN이 함수를 맞추는 방식
- 일반적인 신경망은 인공 뉴런 또는 노드의 층을 간선으로 연결하고, 각 간선의 가중치를 학습 과정에서 조정해 출력이 정답에 가까워지도록 만듦
- 신경망의 흔한 목표는 데이터 포인트를 가장 잘 잇는 수학적 함수나 곡선을 찾는 것임
- 물리 과정을 모델링한다면 출력 함수가 물리를 설명하는 방정식, 즉 물리 법칙에 해당하는 형태가 되기를 기대함
- MLP에는 가능한 최적 함수에 얼마나 가까워질 수 있는지 알려주는 수학 정리가 있으며, 그 결과 MLP는 해당 함수를 완벽히 표현할 수 없음
- KAN은 간선에 단순 숫자 가중치를 두지 않고, 학습 가능한 비선형 함수를 둠
- 이 간선 함수는 더 복잡한 곡선을 표현할 수 있음
- MLP의 숫자 가중치보다 더 세밀하게 조정될 수 있음
1957년 정리와 35년간의 회의론
- KAN의 핵심에는 1957년 Andrey Kolmogorov와 Vladimir Arnold가 각각 발표한 수학적 결과가 있음
- 여러 변수를 갖는 하나의 수학 함수를 단일 변수 함수들의 조합으로 바꿀 수 있다는 내용임
- 중요한 제약은 정리가 만들어내는 단일 변수 함수가 매끄럽지 않을 수 있다는 점임
- V자 꼭짓점처럼 날카로운 부분을 가질 수 있음
- 네트워크가 학습 중 목표값에 맞춰 휘어지려면 단순한 단일 변수 조각이 매끄러워야 함
- 1989년 MIT의 Tomaso Poggio 등이 쓴 논문은 KAN의 핵심 수학 아이디어가 “학습을 위한 네트워크 맥락에서는 무관하다”고 명시함
- Ziming Liu와 Max Tegmark는 단일 변수 함수가 매끄럽지 않더라도 네트워크가 매끄러운 함수로 이를 근사할 수 있고, 과학에서 접하는 대부분의 함수는 매끄럽다는 점에 주목함
- 1989년 이후 소프트웨어와 하드웨어가 크게 발전했기 때문에, Liu는 과거에 주목받지 못한 아이디어를 다시 시도함
2층에서 다층 KAN으로 전환
- Liu는 약 1주일 동안 가장 단순한 형태인 2층 KAN 프로토타입을 만들었지만, 목표로 삼은 과학 관련 작업에서 좋은 성능을 얻지 못함
- 2층 KAN은 Kolmogorov-Arnold 정리가 다변수 함수를 내부 함수와 외부 함수 집합으로 나누는 구조와 자연스럽게 맞아 보였음
- Tegmark는 2층보다 많은 층을 가진 KAN을 시도하자고 제안했고, 이 접근이 성과로 이어짐
- 연구팀은 MIT, California Institute of Technology, Northeastern University의 동료들과 함께 수학자와 응용 분야 전문가가 포함된 협업을 구성함
- 2024년 4월 논문에서 연구팀은 3층 KAN 이 가능함을 보였고, 2층 KAN으로는 정확히 표현할 수 없는 함수를 3층 KAN이 정확히 표현하는 사례를 제시함
- 이후 최대 6층까지 실험했으며, 층이 늘어날수록 더 복잡한 출력 함수에 맞출 수 있음을 확인함
실제 문제에서 드러난 해석 가능성
-
매듭 이론
- 2021년 DeepMind 팀은 특정 매듭의 여러 속성을 입력받아 해당 매듭의 위상적 속성을 예측하는 MLP를 만들었음
- 새 KAN은 그 성과를 재현했고, 예측된 속성이 다른 속성들과 어떻게 관련되는지도 보여줌
- Liu는 이 부분을 MLP가 전혀 할 수 없는 일이라고 평가함
-
Anderson localization
- 두 번째 문제는 응집물질물리의 Anderson localization 현상과 관련됨
- 목표는 특정 상전이가 일어나는 경계를 예측하고, 그 과정을 설명하는 수학 공식을 찾는 것이었음
- MLP는 이 작업을 해낸 적이 없고, 연구팀의 KAN은 이를 수행함
- Tegmark는 KAN의 가장 큰 장점과 최근 개발의 주된 동기가 해석 가능성에 있다고 봄
- 데이터가 주어졌을 때 티셔츠에 적을 수 있는 공식을 내놓는 것이 해석 가능성의 한 형태라고 표현함
- Johns Hopkins의 Brice Ménard는 문제가 실제로 단순한 방정식으로 설명된다면 KAN이 이를 찾는 데 꽤 좋다고 평가함
- 다만 KAN이 가장 잘 작동하는 영역은 물리처럼 방정식의 변수가 매우 적은 문제로 제한될 가능성이 있음
후속 연구와 KAN 2.0
- Liu와 Tegmark의 KAN 논문은 약 3개월 만에 75회 인용됐고, 다른 연구 그룹들도 자체 KAN 연구를 시작함
- Tsinghua University의 Yizheng Wang 등이 2024년 6월 온라인에 공개한 논문은 Kolmogorov-Arnold 기반 신경망(KINN)이 편미분방정식(PDE) 풀이에서 MLP를 크게 앞섰다고 밝힘
- Wang은 PDE가 과학 전반에 존재한다고 말함
- National University of Singapore 연구진의 2024년 7월 논문은 더 혼합된 결과를 냄
- KAN은 해석 가능성 관련 과제에서 MLP보다 나았음
- 컴퓨터 비전과 오디오 처리에서는 MLP가 더 좋은 결과를 냄
- 자연어 처리와 다른 머신러닝 과제에서는 두 네트워크가 대체로 비슷했음
- Liu는 이런 결과가 놀랍지 않다고 봄
- 원래 KAN 연구의 초점은 해석 가능성이 최우선인 과학 관련 작업에 있었음
- 2024년 8월 Liu와 협력자들은 KAN 2.0 논문을 공개함
- Liu는 이를 전통적인 논문보다 사용자 매뉴얼에 가깝다고 표현함
- KAN 2.0은 더 사용하기 쉽고, 원래 모델에 없던 곱셈 도구 등을 제공함
응용 중심에서 이해 중심으로
- Liu와 공동저자들은 KAN이 단순한 목적 달성 수단을 넘어 호기심 중심 과학을 촉진한다고 봄
- 머신러닝에서 오래 지배적이었던 접근은 응용 중심 과학임
- 예를 들어 천체 운동을 관측할 때 응용 중심 연구자는 미래 상태 예측에 집중함
- 호기심 중심 연구자는 그 운동 뒤의 물리를 밝히려 함
- KAN을 통해 연구자는 어려운 계산 문제를 해결하는 도움을 얻는 데 그치지 않고, 이해 자체를 목표로 신경망을 활용할 수 있음