为AI评估建立统一语言:EveryEvalEver项目解析

网易专栏2周前发布 nxnqh
41 0 0

🤖 AI总结

主题

AI基准测试的碎片化问题及EveryEvalEver项目的解决方案

摘要

AI基准测试因格式混乱、结果难复现而备受质疑,EveryEvalEver项目通过统一JSON报告语言和众包数据库,提升评测科学性和透明度。

关键信息

  • 1 AI基准测试存在格式混乱、结果难复现、数据分散等问题
  • 2 EveryEvalEver项目建立统一JSON报告语言和众包数据库
  • 3 数据库已收录2200+基准测试、22000+模型评测结果

为AI评估建立统一语言:EveryEvalEver项目解析

AI模型基准测试(Benchmark)可能是这个行业衡量模型能力的最重要工具,无论是代码编写、语音识别还是指令执行,都离不开它。然而,基准测试的分数究竟有多可信,至今仍是个问题。

与SAT或GRE等标准化考试不同,针对AI模型的评测通常缺乏监督,且每年使用一套固定题目,导致模型在测试时可能已经”见过”这些题目。此外,评测过程本身也问题重重——报告格式混乱、运行配置参差不齐,使得模型之间的横向对比、结果复现以及数据复用几乎无法实现。

种种因素叠加,让依据基准分数挑选模型这件事变得相当不可靠。”人们在做评估决策时,几乎全凭直觉。”IBM人工智能评测研究员莱舍姆·乔申表示,”我们不会凭感觉评估模型,但评估评测方法时却是如此,因为相关数据实在太零散。”

EveryEvalEver项目的目标,正是提升这一领域的科学水准。该项目由IBM、Hugging Face、慕尼黑工业大学等机构的研究人员联合主导,推出了一套统一的基准分数报告语言,并建立了一个可供全球共享成果的众包数据库。数据库托管于Hugging Face平台,目前已收录来自2200个基准测试(其中许多是对主流基准的变体)的逾22000条模型评测结果,数据来源涵盖31种评测格式。

在AI这一竞争激烈的领域,模型的声誉往往随测试分数的高低而起伏。然而,在那些整齐排列的数字背后,是一个高度碎片化的过程。目前,用于评测AI模型的”测评框架”(harness,即运行模型或智能体并对表现打分的代码)超过二十余种,不同框架之间的计分方式各异,评测结果则散落在排行榜、学术论文或博客文章等各种地方。

即便是名义上完全相同的评测,分数相差20个百分点的情况也并不罕见。Hugging Face的研究人员曾发现同一LlaMA模型在MMLU(大规模多任务语言理解)基准测试上出现了相互矛盾的结果,经过深入调查后,他们得出结论:不同的评测框架是导致差异的根源。

将这些不一致性放大到数千个基准测试、数万个模型的量级,就不难理解为何业界对AI基准测试的质疑声越来越高。在一篇题为《基准测试已经崩坏》的近期论文中,研究人员写道:”为什么我们对机器的评估标准,比对人类在高风险环境中的要求还要低?”

尽管存在种种缺陷,基准测试仍是目前追踪进展、定义进步方向最有力的工具。”无论在工业界还是学术界,评测就是一切。”项目联合负责人、慕尼黑工业大学博士生扬·巴茨纳表示,”我们要思考的问题是:如何以更加严谨的方式记录评测过程?”

统一基准测试语言的探索

这一探索始于2024年的NeurIPS会议,彼时乔申等人主持了一场名为”评估评估者”(Evaluating Evaluations)的工作坊,会议确立了一套开放、迭代的设计流程,参照的是开源数据集文档标准Croissant的构建模式。

团队最终确定了一种JSON评测格式,与Croissant类似,将元数据整合到单一记录中。他们收集了数十位基准测试、评测框架与排行榜领域专家的反馈,并通过GitHub和Slack上的讨论进一步迭代完善。

最终形成的是一种模块化格式,包含四个元数据区块:来源元数据(谁产出了结果、如何产出)、模型信息(测试的是哪个模型、通过托管API还是本地推理引擎访问)、配置(使用了哪些生成参数)以及结果与指标语义(如何解读分数)。模型逐条prompt的输出等实例级数据也可以附加进来。

完整记录并非强制要求。EveryEvalEver允许字段留空,以便将有价值的数据保留在系统内。为了降低贡献门槛,团队开发了一款工具,可自动将HELM、lm-eval-harness和Inspect AI三种主流评测框架的结果转换为JSON格式,并针对AlpacaEval、RewardBench、SWE-bench等热门排行榜开发了类似的转换工具。每份提交在发布到Hugging Face的EveryEvalEver仓库之前,还会经过专门的验证工具审核。

“一旦所有数据汇聚一处,差异便会自然浮现。”项目高级负责人之一乔申表示。

为进一步改善基准测试文档的可访问性,团队还创建了EvaluationCards,它以IBM与圣母大学去年联合发起的BenchmarkCards项目为基础构建。迄今已收录633个基准测试中近5800个模型的评测结果。

统一语言无法解决基准测试的所有问题,但它能推动行业走向更透明的报告实践。”一旦社区确立了新标准,报告方式就会随之改变,”巴茨纳说,”更多元数据对每个人都有利,尤其是小型模型提供商。”

数据揭示的规律

EveryEvalEver目前已汇聚约23万条评测结果,虽还未完全名副其实,但已足够全面,能够揭示出更广泛的趋势。

分析数据后,团队发现的一个关键问题是:当前的文档记录普遍十分单薄。模型提供商仅在2%的情况下注明了模型运行所用的平台,披露”温度”等重要生成参数(即大语言模型输出随机程度)的比例不足25%。数据还揭示出明显的美国商业模型偏重倾向——仅5家公司就占据了评测频次最高的24个AI系统中的23席。

其他趋势同样引人关注。AI模型常通过压缩或量化来降低计算成本,通常用”困惑度”(perplexity)分数衡量压缩对性能的影响。但研究人员在EveryEvalEver中发现,困惑度分数存在三种不同的报告方式——按Token、按词、按字节计算——这给模型间的横向对比带来了困难。

随着大语言模型的应用场景从聊天机器人向智能体迁移,运行和评测的成本正在急剧攀升。研究人员将EveryEvalEver视为衡量智能体及其运行所用软件”脚手架”(scaffold)之间成本与性能权衡的有效工具。当团队在不同脚手架上运行模型时发现,脚手架的选择会显著影响成本,但未必能带来性能提升。

为检验可复现性,团队在HELM排行榜任务上重新运行了模型,以验证结果是否与官方记录一致。他们将两组分数都转换为EveryEvalEver的JSON格式以确保比较的公平性。总体而言,结果高度吻合;出现分歧之处,团队也成功定位了导致偏差的程序性缺陷。

从长远来看,EveryEvalEver数据集或将为改进基准测试提供洞见。例如,如果能识别出最具预测力的问题,是否可以将测试压缩得更小、运行成本更低?这一领域的盲区又在哪里?”它能帮你深入基准测试的细枝末节,发现那些被遗漏的东西。”乔申说。

其中一个值得关注的细节,正是前文提及的美国商业模型偏重问题。在另一项名为”下一个十亿AI指数”(Next Billion AI Index)的独立项目中,IBM研究人员正在尝试将讨论焦点从”模型能做什么”转向”模型多容易被采用”,尤其关注在监管严格或资源受限的环境中的可用性。”我们希望拓宽评估视角,将可负担性、可部署性、开放性以及用户社区利益相关者的验证纳入其中,”IBM高级研究科学家、该项目联合负责人安布里什·拉瓦特表示。

开放协作与未来展望

与维基百科类似,EveryEvalEver建立了一套机制,防止众包贡献陷入混乱。每条提交记录都会获得唯一标识符,不可删除或私自覆盖。当模型评测结果出现冲突(如LlaMA案例),两个结果都会保留在元数据中可见。

目前,该项目对文本类、单模型评测的覆盖最为完善;多模态评测、人类偏好判断(如ChatbotArena的两两对比竞赛)以及多智能体场景目前仅获得部分支持。其最终价值将取决于能否得到更广泛的采纳。模型提供商和排行榜运营者仍可对重要元数据(如专有系统的生成参数)保密,但至少现在可以明确标注为”缺失”。

随着AI系统持续演进,评测成本只会越来越高。EveryEvalEver有望通过让既有结果更易复用来降低这一成本。团队估算,假设重新运行数据库中所有汇总结果(不含智能体评测、推理模型及重复运行等计算量更大的部分),理论上最高需花费37万美元。

“如果我们能建立一个可复用、可信赖的系统,人们就不必一遍遍地重复昂贵的评测工作。”Hugging Face负责监督该项目的AI技术政策研究员阿维吉特·戈什表示,”EveryEvalEver让这些结果向所有人开放。”

Q&A

Q1:EveryEvalEver是什么?它解决了什么问题?

A:EveryEvalEver是由IBM、Hugging Face、慕尼黑工业大学等机构联合主导的社区项目,旨在为AI基准测试建立统一的报告语言,并提供一个众包数据库集中存储评测结果。它主要解决当前基准测试格式混乱、结果难以对比和复现、数据极度分散等问题。数据库目前已托管于Hugging Face,收录了超过2200个基准测试的逾22000条模型评测结果。

Q2:为什么同一个模型在不同地方的基准测试分数会不一样?

A:主要原因是不同评测框架(harness)的计分方式不同。目前市面上存在二十余种评测框架,各自的运行配置和评分逻辑不尽相同,导致同一模型在”名义上相同”的评测中,分数可能相差高达20个百分点。Hugging Face研究人员就曾发现LlaMA模型在MMLU基准上出现矛盾结果,调查后确认正是由于使用了不同的评测框架所致。

Q3:EveryEvalEver用什么格式存储评测数据?普通用户能参与贡献吗?

A:EveryEvalEver采用JSON格式存储评测数据,包含来源元数据、模型信息、生成配置和结果语义四个模块,字段可以留空以降低贡献门槛。团队还开发了自动转换工具,支持将HELM、lm-eval-harness、Inspect AI等主流评测框架的结果一键转换为统一格式,也支持从AlpacaEval、RewardBench等排行榜导入数据,并通过验证工具审核后发布到Hugging Face仓库。

© 版权声明

相关文章