Knowledge

Knowledge note

强化学习知识树:从概念到可运行实验

把 Sutton & Barto、AlphaStar、环境设计和量化实验组织成可以持续复习的知识地图。

--阅读0点赞
查看公开来源

强化学习知识很容易变成一串算法名。知识树的目标是把概念、实现和实验结果放到同一条学习路径中。

组织方式

  1. 用 Sutton & Barto 建立状态、回报、价值函数和策略优化的基础语言。
  2. 用小型环境验证更新公式和探索策略。
  3. 阅读 AlphaStar 等复杂系统时,区分环境、分布式采样、策略网络、联赛和评估。
  4. 进入量化场景前,先明确动作空间、交易成本、时间泄漏和奖励函数。
  5. 每个阶段保留实验记录、失败假设和下一步问题。

知识产物不只是一篇总结,而是能回到代码和实验的索引。