Knowledge note
强化学习知识树:从概念到可运行实验
把 Sutton & Barto、AlphaStar、环境设计和量化实验组织成可以持续复习的知识地图。
--阅读0点赞
查看公开来源 强化学习知识很容易变成一串算法名。知识树的目标是把概念、实现和实验结果放到同一条学习路径中。
组织方式
- 用 Sutton & Barto 建立状态、回报、价值函数和策略优化的基础语言。
- 用小型环境验证更新公式和探索策略。
- 阅读 AlphaStar 等复杂系统时,区分环境、分布式采样、策略网络、联赛和评估。
- 进入量化场景前,先明确动作空间、交易成本、时间泄漏和奖励函数。
- 每个阶段保留实验记录、失败假设和下一步问题。
知识产物不只是一篇总结,而是能回到代码和实验的索引。