Agent 与工具
Pieter Abbeel
彼得·阿比尔
机器人学习 · MAML
Pieter Abbeel 是机器人与机器学习研究者,参与了强化学习、快速适应和生成模型等多个方向的重要工作。他的研究关注机器如何从示范或交互经验中获得行为,而不必为每个动作编写完整规则。
他与合作者在 TRPO 中研究如何限制策略每次更新的幅度,使强化学习训练更稳定;在 MAML 中,则研究怎样训练一个容易适应新任务的模型。这些方法分别改善学习过程的稳定性和跨任务适应能力。
他也是 DDPM 的共同作者,与 Jonathan Ho、Ajay Jain 合作研究通过逐步去噪生成图像。机器人决策与图像生成属于不同任务,但都涉及如何从数据学习复杂分布,以及怎样把学习方法落实为能够执行的计算过程。