跳转到内容
← AI 人物志
对齐与评测

Chris Olah

克里斯·奥拉

机制可解释性 · 特征电路

Chris Olah 是机器学习可解释性研究者,长期尝试理解神经网络内部究竟计算了什么。他也以清晰的技术文章、可视化和 Distill 的研究传播工作受到关注。

他的研究从视觉网络中的特征可视化,延伸到由多个神经元和连接组成的计算电路。与只观察模型输入输出不同,机制可解释性尝试找到内部表示及其对行为的因果作用,解释模型为什么产生某种结果。

他与合作者进一步研究语言模型的叠加表示和可解释特征。发现某个特征与一个概念相关,并不自动意味着已经完整解释模型;特征的识别、干预和跨输入验证都很重要。这些工作为分析模型行为和潜在风险提供了工具。