对齐与评测
Chris Olah
克里斯·奥拉
机制可解释性 · 特征电路
Chris Olah 是机器学习可解释性研究者,长期尝试理解神经网络内部究竟计算了什么。他也以清晰的技术文章、可视化和 Distill 的研究传播工作受到关注。
他的研究从视觉网络中的特征可视化,延伸到由多个神经元和连接组成的计算电路。与只观察模型输入输出不同,机制可解释性尝试找到内部表示及其对行为的因果作用,解释模型为什么产生某种结果。
他与合作者进一步研究语言模型的叠加表示和可解释特征。发现某个特征与一个概念相关,并不自动意味着已经完整解释模型;特征的识别、干预和跨输入验证都很重要。这些工作为分析模型行为和潜在风险提供了工具。