跳转到内容
← AI 人物志
对齐与评测

Andrew Barto

安德鲁·巴托

强化学习 · 学习与控制

Andrew Barto 是强化学习的重要研究者,长期研究系统怎样根据与环境的交互学习行为。他的工作连接了自适应控制、神经网络与奖励驱动学习。

他与 Richard Sutton 及其他合作者在强化学习的早期发展中建立了重要概念与算法。强化学习不要求为每个输入给出标准答案,而是通过行动产生的结果逐步学习如何获得更好的长期回报。相关思想影响了游戏智能体、机器人及后来的语言模型训练。

他与 Sutton 合著《Reinforcement Learning: An Introduction》,并共同获得 2024 年图灵奖。理解他的贡献,重点在于学习和决策之间的联系;语言模型中的偏好训练只是强化学习广泛应用中的一部分。