强化学习
Reinforcement Learning
通过与环境交互学习策略,研究奖励、决策与泛化。
- 价值学习与策略优化
- 奖励设计与环境交互
- RLHF 与多智能体
技术笔记
深度强化学习中的时序信用分配:问题定义与典型方法
收录于 · Haoran Qian
围绕深度强化学习中的时序信用分配,整理问题定义、MDP 的三类困难以及时间邻近性与回报分解方法。
阅读全文 →强化学习入门
· Jiajie Shen
从环境、状态、动作与奖励出发,理解强化学习的基本概念。
阅读全文 →RL:from value to policy
· Zhihao Wang
梳理价值方法、策略梯度与 Actor-Critic 等强化学习算法。
阅读全文 →
通用基础笔记
各方向共用的机器学习基础知识。
代码与研究资料
world-model-research-notes
Arison591 · GitHub 仓库
World Model 中文论文阅读与研究笔记,涵盖 Dreamer、LingBot、基于模型的强化学习、交互式生成与具身智能。
访问仓库 ↗