跳转到内容
← AI 人物志
对齐与评测

David Silver

戴维·西尔弗

AlphaGo · AlphaZero

David Silver 是强化学习研究者,参与领导了 AlphaGo 和 AlphaZero 等研究。他的工作关注如何把学习与搜索结合起来,在复杂决策问题中改进策略。

AlphaGo 将神经网络的策略与价值评估用于围棋搜索;后续 AlphaGo Zero 和 AlphaZero 更强调从自我对弈中学习,减少对人类棋谱的依赖。系统通过不断与自身交互,积累用于改善决策的数据。

这些成果展示了强化学习在明确规则、可重复模拟的环境中的潜力。它们并不意味着同样的方法可以不加调整地解决开放世界问题:真实场景往往缺少清晰奖励、安全试错空间和准确模拟器。Silver 的研究提供了理解学习、规划和反馈之间关系的重要实例。