对齐与评测
Percy Liang
梁鹏
HELM · 模型透明评测
Percy Liang 是斯坦福大学计算机科学研究者,工作涉及机器学习、语言理解与基础模型。他是 HELM 论文的第一作者,也参与建设可公开检查的模型评价资源。
HELM 尝试从多个场景和指标评价语言模型,包括准确性、校准、鲁棒性、公平性及效率。它强调在统一条件下保留足够多的结果,使人能够看到模型之间的取舍,而不只比较一个总分。
他的研究还涉及数据效率、可靠性与开放研究。对于开发者,HELM 的价值不仅是看榜单,更是理解自己的应用究竟需要哪些指标、公开基准漏掉了什么,以及模型表现是否能够被他人复核。