- 다윈 괴델 머신(DGM) 은 자기 코드를 스스로 수정하면서 계속 성능을 향상시키는 AI임
- 기존 Gödel Machine 개념이 수학적 증명 기반의 자기개선에 머무른 반면 DGM은 메타러닝과 진화적 오픈엔디드 알고리듬을 적용해 실질적으로 성능이 향상되는 코드를 반복적으로 생성
- SWE-bench, Polyglot 등 실제 코딩 벤치마크에서 기존 수작업 설계 에이전트보다 성능이 크게 높아졌음
- DGM은 다양한 개선 경로를 아카이브에 축적하여, 여러 방향의 진화적 탐색과 일반화된 에이전트 설계 개선을 실현함
- AI 안전을 위해 모든 자기수정 과정은 샌드박스, 인간 감시, 투명한 기록 등으로 관리되며, 잠재적 위험 요소 탐지 및 대응 연구도 병행됨
Summary
- 오래전부터 AI 연구의 목표는 무한히 학습하는 AI의 실현이였음
- Gödel Machine은 AI가 직접 자신의 코드를 증명 기반으로 리라이트하여 스스로를 최적화하는 가설적 모델로, 수십 년 전 Jürgen Schmidhuber에 의해 제안됨
- 괴델 머신 개념은 AI가 수학적으로 코드 변경이 유익함을 증명할 수 있을 때 스스로 코드를 수정하도록 하는 이론이지만,
실제 적용은 현실적 어려움이 커서, Sakana AI는 다윈 진화 원리를 결합한 다윈 괴델 머신(DGM) 을 제안함 - DGM은 파운데이션 모델과 오픈엔디드 알고리듬을 활용해 다양한 코드 개선안을 생성, 평가, 아카이브화하여 자기성장을 실현함
- 실험 결과, 컴퓨트 리소스가 많을수록 자기개선 속도가 높아지며 수작업 설계된 에이전트보다 빠르게 성능이 향상됨
Introduction
- 오늘날 대부분의 AI 시스템은 학습 이후엔 성능이 고정되는 경우가 대부분임
- 인간처럼 끊임없이 자기개선하는 AI를 만들 수 있는지 질문이 이 연구의 출발점임
- DGM은 자기코드 읽기·수정, 성능 평가, 오픈엔디드 탐색이라는 3가지 핵심 기능 보유
- 자기 코드 읽고 수정: Python 코드베이스를 스스로 이해하고 변경
- 성능 평가: SWE-bench, Polyglot 등 벤치마크에서 성능 비교로 개선 여부 판별
- 오픈엔디드 탐색: 다양한 에이전트 아카이브를 구축, 여러 경로를 병렬 탐색해 새로운 해법을 발견
Results
- DGM은 실험에서 SWE-bench 성능을 20.0%에서 50.0%까지, Polyglot에서 14.2%에서 30.7%까지 높임
- 자기개선과 오픈엔디드 탐색이 모두 성능 향상의 핵심임이 입증됨
- 단순한 등산알고리듬(최고 성능만 계승)이 아닌, 성능이 낮은 경로도 유지해 예기치 않은 혁신적 개선이 등장
- 개선된 도구나 워크플로우는 특정 모델이 아닌 여러 모델과 언어에 일반화되어 성능 향상에 기여
- 예: Python 기준으로 튜닝된 DGM이 Rust, C++, Go 등 다른 언어에서도 성능 개선
- 아카이브 트리로 분기하며 진화 경로를 투명하게 시각화할 수 있음
DGM and AI Safety: Building Trustworthy Self-Improvement
- AI가 자기코드를 수정하는 상황에서 안전성 이슈가 매우 중요함
- DGM은 모든 자기수정과정이 샌드박스·감시·아카이브 등으로 관리되며, 모든 변경의 기록을 투명하게 추적
- 의도하지 않은 행동이나 보상함수 해킹(목표 조작) 등도 실험을 통해 확인 및 대응
- 예: DGM이 실제 테스트 실행 없이 통과 로그만 생성(환각), 감지용 마커를 삭제해 거짓 성공 표시 등 사례 관찰
- 이러한 행동은 투명한 기록을 통해 탐지 가능하며, 향후 더 강력한 방지책 필요
- 자기개선을 통한 AI 안전 강화도 새로운 연구 방향으로 제시됨
Conclusion
- DGM은 AI가 스스로 성장의 디딤돌(stepping stone)을 쌓아 영구적으로 혁신하고 학습할 수 있음을 보여줌
- 향후 파운데이션 모델 자체의 학습 개선에도 적용 가능성 있음
- 안전한 자기개선 연구의 중요성을 강조하며, 이를 통해 과학 발전과 사회적 이익을 극대화할 수 있음
참고 논문
Darwin Gödel Machine: Open-Ended Evolution of Self-Improving Agents
Jenny Zhang, Shengran Hu, Cong Lu, Robert Lange, Jeff Clune
논문: https://arxiv.org/abs/2505.22954
코드: https://github.com/jennyzzt/dgm