- Anthropic은 작은 Transformer 언어 모델에서 개별 뉴런보다 해석하기 쉬운 특징(feature) 을 찾아, 신경망 내부를 이해 가능한 단위로 나누는 방법을 다룸
- 뉴런 하나는 학술 인용, 영어 대화, HTTP 요청, 한국어 텍스트처럼 무관한 맥락에서 함께 활성화될 수 있어 모델 행동과 안정적으로 대응하기 어려움
- 연구는 512개 뉴런으로 된 한 층을 4,000개 이상의 특징으로 분해해, DNA 시퀀스·법률 문체·HTTP 요청·히브리어 텍스트·영양 성분표 같은 속성을 따로 드러냄
- 맹검 인간 평가와 LLM 기반 자동 해석성 평가에서 특징은 뉴런보다 더 해석하기 쉬웠고, 특정 특징을 인위적으로 활성화하면 모델 행동도 예측 가능하게 바뀜
- 서로 다른 모델에서도 학습된 특징이 대체로 보편적이라면, 이 접근을 더 큰 프런티어 모델로 확장하는 과제는 과학보다 엔지니어링에 가까워짐
신경망 해석이 어려운 이유
- 신경망은 사람이 규칙을 직접 프로그래밍하지 않고 데이터로 학습되며, 학습 과정에서 수백만~수십억 개 매개변수가 갱신됨
- 학습된 네트워크의 수학적 계산은 추적할 수 있음
- 각 뉴런은 단순한 산술 연산을 수행함
- 다만 그 연산이 관찰되는 행동으로 이어지는 이유는 명확하지 않음
- 이런 불투명성은 실패 모드 진단, 수정 방법 파악, 모델 안전성 인증을 어렵게 만듦
개별 뉴런은 안정적인 해석 단위가 아님
- 뇌과학도 인간 행동의 생물학적 기반을 이해하는 비슷한 문제를 다루지만, 인공 신경망에서는 실험을 훨씬 쉽게 수행할 수 있음
- 모든 뉴런의 활성화를 동시에 기록할 수 있음
- 뉴런을 침묵시키거나 자극하는 개입이 가능함
- 가능한 입력에 대해 네트워크 반응을 테스트할 수 있음
- 그러나 개별 뉴런은 네트워크 행동과 일관된 관계를 갖지 않음
- 같은 뉴런 활성화라도 맥락에 따라 다른 의미를 가질 수 있음
특징(feature)으로 모델을 분해하는 접근
- 논문 Towards Monosemanticity: Decomposing Language Models With Dictionary Learning은 개별 뉴런보다 나은 분석 단위가 있음을 다룸
- 이 단위인 특징(feature) 은 뉴런 활성화의 패턴, 즉 선형 결합에 해당함
- Anthropic은 작은 Transformer 모델에서 이런 특징을 찾는 장치를 구축함
- 이 접근은 복잡한 신경망을 이해 가능한 부분으로 나누는 경로이며, 신경과학·머신러닝·통계학에서 고차원 시스템을 해석하려던 기존 작업 위에 놓여 있음
512개 뉴런을 4,000개 이상 특징으로 분해
- 한 Transformer 언어 모델에서 512개 뉴런을 가진 층을 4,000개 이상 특징으로 분해함
- 분해된 특징은 서로 다른 속성을 별도로 나타냄
- DNA 시퀀스
- 법률 언어
- HTTP 요청
- 히브리어 텍스트
- 영양 성분표
- 이런 모델 속성 대부분은 개별 뉴런 활성화만 따로 보면 드러나지 않음
해석 가능성 검증
- 맹검 인간 평가자가 특징과 뉴런의 해석 가능성을 점수화함
- 특징은 뉴런보다 훨씬 높은 점수를 받음
- LLM을 이용한 자동 해석성 평가도 함께 사용됨
- 큰 언어 모델이 작은 모델의 특징에 대해 짧은 설명을 생성함
- 다른 모델이 그 설명만으로 특징 활성화를 얼마나 잘 예측하는지 점수화함
- 이 평가에서도 특징은 뉴런보다 높은 점수를 받음
- 결과적으로 특징의 활성화와 모델 행동의 하류 효과가 일관되게 해석될 수 있다는 근거가 늘어남
특징을 이용한 모델 조향
- 특징은 모델을 표적 방식으로 조향하는 수단도 제공함
- 특정 특징을 인위적으로 활성화하면 모델 행동이 예측 가능한 방식으로 바뀜
- 따라서 특징은 단순한 관찰 단위가 아니라, 모델 행동에 영향을 주는 내부 구성요소로 다룰 수 있음
보편성과 해상도 조절
- 학습된 특징은 서로 다른 모델 사이에서 대체로 보편적임
- 한 모델의 특징을 연구해 얻은 내용이 다른 모델에도 일반화될 수 있음
- 학습할 특징 수를 조절하면 모델을 보는 해상도를 바꿀 수 있음
- 작은 특징 집합으로 분해하면 이해하기 쉬운 거친 관점을 얻음
- 큰 특징 집합으로 분해하면 더 미세한 관점에서 미묘한 모델 속성이 드러남
- 관련 설명은 해상도 변화 실험으로 연결됨
AI 안전성과 다음 과제
- 이 작업은 Anthropic의 기계적 해석 가능성 연구 투자 결과이며, AI 안전을 위한 장기 연구 방향 중 하나임
- 개별 뉴런이 해석 불가능하다는 점은 언어 모델을 기계적으로 이해하는 데 큰 장애물이었음
- 뉴런 그룹을 해석 가능한 특징으로 분해하면 이 장애물을 넘어설 가능성이 있음
- 장기적으로는 모델 행동을 내부에서 모니터링하고 조향해, 기업과 사회적 채택에 필요한 안전성과 신뢰성을 높이는 데 연결될 수 있음
- 다음 과제는 작은 모델에서 성공한 방식을 훨씬 크고 복잡한 프런티어 모델로 확장하는 것임
- 대형 언어 모델 해석의 다음 주요 장애물은 처음으로 과학보다 엔지니어링에 가깝다고 봄
- 자세한 내용은 Towards Monosemanticity: Decomposing Language Models With Dictionary Learning에서 확인할 수 있음