跳转到内容
← AI 人物志
对齐与评测

Richard Sutton

理查德·萨顿

强化学习 · 时间差分

Richard Sutton 是强化学习的主要奠基者之一。强化学习研究智能体怎样通过行动及其获得的奖励改善决策,特别适合结果需要经过多步才显现的任务。

他的时间差分学习工作把从经验学习与对未来回报的预测结合起来。与 Andrew Barto 合著的《Reinforcement Learning: An Introduction》系统整理了价值函数、策略、探索和规划等核心概念,成为这一领域的重要教材。两人共同获得 2024 年图灵奖。

他在 2019 年的 The Bitter Lesson 中总结了一种研究判断:能够持续利用更多计算的通用方法,往往比大量依赖人工设计知识的方法更有长期潜力。这是对 AI 发展经验的观点归纳,不意味着具体任务可以忽略数据、约束和工程设计。