跳转到内容
← AI 人物志
对齐与评测

Percy Liang

梁鹏

HELM · 模型透明评测

Percy Liang 是斯坦福大学计算机科学研究者,工作涉及机器学习、语言理解与基础模型。他是 HELM 论文的第一作者,也参与建设可公开检查的模型评价资源。

HELM 尝试从多个场景和指标评价语言模型,包括准确性、校准、鲁棒性、公平性及效率。它强调在统一条件下保留足够多的结果,使人能够看到模型之间的取舍,而不只比较一个总分。

他的研究还涉及数据效率、可靠性与开放研究。对于开发者,HELM 的价值不仅是看榜单,更是理解自己的应用究竟需要哪些指标、公开基准漏掉了什么,以及模型表现是否能够被他人复核。