跳到正文
原文
Berkeley AI Research·· 2025-11-01AI 评分37

RL without TD learning:Berkeley AI Research 提出基于分治的强化学习算法

RL without TD learning

AI 导读

Berkeley AI Research 提出一种基于“分治”而非时序差分(TD)学习的强化学习算法,用于 off-policy RL。传统 TD 学习通过 bootstrapping 使误差沿整个轨迹累积,难以扩展到长时序任务;n-step TD 也只能线性减少 Bellman 递归次数。

来源:Berkeley AI Research · bair.berkeley.edu