- drlzh.ai는 딥 강화학습을 읽기만 하는 대신 알고리듬을 직접 구현하는 실습형 과정이며, MDP와 표 형식 RL부터 RLHF, Decision Transformers, Dreamer, 메타러닝까지 다룸
- 루트 노트북은 코드 일부가 안내형 TODO로 대체된 실습 트랙이고,
solution/ 노트북에는 막혔을 때 확인할 수 있는 완전 실행 버전이 들어 있음
- 커리큘럼은
00-18 노트북으로 구성되며, 기초 트랙은 순서대로 진행하도록 설계되고 고급 노트북은 자체 완결형이지만 번호가 기본 학습 경로를 제공함
- Docker 워크스페이스는 code-server, 노트북, Python
>=3.13,<3.14, Jupyter 커널, 의존성, DRL-ZH AI Companion VS Code 확장을 한 번에 제공함
- 학습자는 Python, PyTorch 기초, 확률·통계·선형대수·미분 등 ML 수학에 익숙해야 하며, 노트북은 실제 학습 코드를 읽고 수정할 수 있다는 전제를 둠
프로젝트 개요
- drlzh.ai는 실습 중심 딥 강화학습 과정으로, 알고리듬을 직접 만들도록 구성됨
- 학습 범위는 MDP와 표 형식 RL에서 시작해 다음 주제로 확장됨
- Atari 에이전트 기반 알고리듬
- 연속 제어 로봇
- AlphaZero 스타일 계획
- 언어 모델을 위한 RLHF
- Decision Transformers
- VLA 스타일 정책
- 월드 모델
- Dreamer
- 메타러닝
- 루트 노트북은 연습 트랙이며, 코드가 안내형
TODO 섹션으로 의도적으로 대체돼 있음
solution/ 노트북은 완전하고 실행 가능한 버전을 제공해, 학습자가 과정 밖으로 나가지 않고 막힌 부분을 풀 수 있음
커리큘럼 구성
- 과정은
00부터 18까지의 노트북으로 구성됨
00-07 Foundations
- MDPs, tabular RL, DQN, REINFORCE, actor-critic methods, DDPG, TD3, SAC, PPO를 구현함
08-10 Breaking assumptions
- RND curiosity, multi-agent RL, BC와 IQL을 사용한 offline RL을 다룸
11 Planning
- Monte Carlo Tree Search, self-play, AlphaZero 스타일 policy/value 학습을 다룸
12-13 Modern AI stack
- PPO 기반 RLHF, DPO, GRPO, Decision Transformers, NanoVLA(
DTVLA)를 다룸
14 Production
- TensorBoard, 체크포인트, 디버깅, multiple seeds, Ray, Optuna를 다룸
15-16 World models
- SAC 기반 MBPO와 RSSM latent imagination을 사용하는
DR3AM/Dreamer를 다룸
17-18 Meta + wrap-up
- MAML, FOMAML, fast adaptation, 과정 마무리로 구성됨
- 기초 노트북은 순서대로 진행하는 것을 전제로 함
- 고급 노트북은 자체 완결형이지만, 번호가 탐색부터 과정 캡스톤까지의 기본 경로를 제공함
DRL-ZH AI Companion
- Docker 워크스페이스에는 이 과정용 VS Code 확장인 DRL-ZH AI Companion이 포함됨
- 확장은 사용자가 작업 중인 노트북과
TODO를 인식함
- 정답을 바로 주는 대신 소크라테스식 힌트를 제공함
- 텍스트 모드와 음성 모드를 지원함
- LLM 키는 사용자가 직접 가져와야 함
- Gemini가 기본값임
- OpenAI, Anthropic, Groq도 지원됨
실행 환경과 시작 방법
- 권장 설정은 Docker임
- Docker는 다음 요소를 하나의 재현 가능한 워크스페이스로 제공함
- code-server
- 노트북
- Python
>=3.13,<3.14
- Jupyter 커널
- 의존성
- AI Companion
- 기본 시작 절차
- Docker와 Git을 설치하고 저장소를 클론한 뒤 해당 디렉터리로 이동함
- Linux/macOS에서는
printf "UID=$(id -u)\nGID=$(id -g)\n" > .env를 실행해 파일 소유권을 사용자에게 맞춤
- 기본 환경을 시작함
docker compose up --build -d
- Chromium 기반 브라우저에서
http://localhost:8080을 열고 Python (drl-zh) 커널을 선택함
00_Intro.ipynb를 열고 TODO를 채우기 시작함
- NVIDIA GPU 접근이 필요하면 다음 명령을 사용함
docker compose -f docker-compose.yml -f docker-compose.gpu.yml up --build -d
- 더 작은 CPU 전용 이미지는 다음 명령을 사용함
docker compose -f docker-compose.yml -f docker-compose.cpu.yml up --build -d
- 네이티브 설정을 선호하면 MANUAL.md에서 Python, Poetry, VS Code, Companion 지침을 확인할 수 있음
요구 지식과 라이선스
- 학습자는 다음에 익숙해야 함
- Python
- PyTorch 기초
- ML에 필요한 확률, 통계, 선형대수, 미분
- 노트북은 RL 자체를 가르치지만, 실제 훈련 코드를 읽고 수정할 수 있다는 전제를 둠
- 라이선스는 MIT이며 자세한 내용은 LICENSE에 있음