HarnessEval:新的评测时代,用 Harness 开启

网易专栏6天前发布 nxnqh
19 0 0

🤖 AI总结

主题

介绍HarnessEval-W,一种基于智能体工作流的世界模型评测框架。

摘要

HarnessEval-W通过智能体工作流实现动态、可解释的世界模型评测,从观测质量、状态转移和世界持续性三个维度出发,生成证据链,并支持技能库扩展与自我改进,推动benchmark范式进化。

关键信息

  • 1 将LLM生态中的Harness概念引入评测,实现动态、可解释的agentic benchmark。
  • 2 从观测质量、状态转移正确性、世界持续性三个维度评测世界模型。
  • 3 通过规划、拆解、验证等流程生成证据树,支持测试时扩展和技能库扩展。

评测,定义技术的品味。

一项技术能走多远,往往取决于我们用什么尺子衡量它。评测从来不只是检验实验结果,更是在为前沿探索设定坐标。然而,在面向物理世界的 RSI(Recursive Self-Improvement)进程中,世界模型始终缺少一把可靠的尺子。尤其面对物理因果、几何一致性与观测真实感,现有评测方式仍难给出稳定、可信的自动判断。与之相比,人类对于生成内容中的异常往往极为敏感:物体是否凭空消失?碰撞后的运动是否合理?场景是否突然发生变化?这些判断对人而言近乎本能,却始终难以被AI自动化实现。现有的 benchmark 也很难让人看清模型到底错在哪里、又为什么错。

在 MirroS,我们首次将 LLM 生态中的重要概念,Harness,引入评测领域。

Harness 并非简单的代码封装,而是一套可靠的执行框架。它将复杂的人类工作流程,例如问题分解、工具调用与推理验证,组织成清晰、可执行的步骤,并由此支撑完整的智能体工作流。人类评测,本质上也是一套工作流。当我们评估一个生成的世界时,我们并非简单地扫一眼图像,而是在不自觉中完成一系列复杂流程:定位物体、追踪其在时间中的存在与变化,判断动作是否合理,再核验其中的因果关系、几何约束和物理规律。我们将这一过程通过Harness自动化为一个agentic benchmark:由一个 agent 统筹全局,根据具体案例动态派生多个专业 subagent,并为它们提供相应的上下文和诊断工具,从不同角度审视模型输出。这套 evaluation harness 就像一位福尔摩斯:它不会依据单一现象仓促下结论,而是不断寻找线索、交叉验证证据,并将分散的信息组织成一条完整的推理链,最终形成判断。

评测由此从一套静态问答规则演化为一个能够主动寻找证据、完成判断的智能系统。其核心不是一条固定的评测流水线,而是一组可以被按需调用、组合与递归展开的评测能力:

规划路径:根据案例确定需要的评测方式;

  • 拆解问题:调度多个 subagent 逐层分解问题;

  • 理解意图:识别待执行动作及其预期的变化;

  • 搜寻证据:定位与判断相关的线索;

  • 调用工具:按需使用测量与推理工具;

  • 形成结论:组织完整的证据与推理链。

    HarnessEval:新的评测时代,用 Harness 开启

    HarnessEval-W: 将HarnessEval应用于World Model

    今天,我们将 World Model 当作 HarnessEval 试验田,并正式开源 HarnessEval-W,也希望邀请社区共同参与构建这一新的agentic benchmark 工作流。我们首先将世界模型的核心能力拆解为三个评测维度:观测质量、状态转移正确性与世界持续性,并围绕这三个维度构建我们的整体评测体系。

    评测的角度

    参考已有研究中的常见定义,我们将物理世界模型描述为:

    根据历史观测与用户动作,预测世界未来的状态。

    凡是具备这一能力的模型,无论采用何种生成架构,都可以纳入 HarnessEval-W 的评测范围,包括双向视频扩散模型(bidirectional video diffusion models)、自回归视频模型(autoregressive video models)等。这一形式化描述也给出了 HarnessEval-W 的基本评测逻辑:世界是否被正确呈现,动作是否引发了正确的状态转移,以及这个世界能否在时间中保持持续而一致。由此,自然得到以下三个核心评测维度。

    1. 观测质量

    衡量模型输出的视觉观测是否可信。它关注生成视频本身在感知层面的质量,包括:视觉连续性、结构合理性与真实感。

    2. 状态转移正确性

    关注模型是否能够在正确的时间,以正确的方式响应给定的动作,并使世界状态随之发生符合预期的变化。我们进一步考虑三种类型的状态转移:探索式转移(Exploratory Transition)主要对应观察者在世界中的移动,例如改变相机位置、视角或观察区域。意图式转移(Intentional Transition)指用户主动要求改变某个实体、关系或事件。例如移动一个物体、打开一扇门,或者要求某个角色执行特定动作。物理转移(Physical Transition)关注施加物理控制之后,世界是否按照合理的物理规律演化,例如碰撞、推动、掉落、弹跳或其他动力学过程。

    3. 世界持续性

    关注随着世界不断演化,模型是否维持了一个持续存在、内部一致的世界。我们重点关注三类典型场景。抗漂移能力(Drift Resistance):测试在长时间生成中,世界的整体布局、风格和对象外观是否保持稳定,而不会随着生成时间增加逐渐发生无意义漂移。重访一致性(Revisit Consistency):当观察者暂时离开某个地点或物体,随后再次返回时,其状态与属性是否仍与此前保持一致。画外演化(Offscreen Evolution):当一个动态过程暂时离开视野后,是否仍能按照时间与物理规律继续演化,而不是在不可见时被冻结、重置或任意改变。世界持续性并不意味着世界中的所有内容都必须保持不变。它要求稳定属性保持一致,同时动态状态也必须沿着连续、合理的轨迹演化。

    基于Harness的评测系统

    世界模型的评测天然高度依赖具体情境上下文。不同案例可能对应完全不同的环境、动作类型、时间结构与观测状态,因此,很难依靠一组固定问题或静态指标覆盖所有情况。

    HarnessEval-W 的核心是一个能够动态制定评测策略的智能体。对于每一个案例,它首先理解当前世界与评测目标,随后规划评测路径;调度具有不同专业能力的子智能体,并结合它们搜集到的证据,逐步形成可验证的评分判断。整个评测过程都会根据当前具体世界调整。换言之,HarnessEval-W 并不预设一条固定的评测流程,而是让评测路径随案例本身动态生成。它不仅需要回答“这个结果是否正确”,还要进一步判断:我们收集的证据,是否真的足以回答当前的评测问题?由此,HarnessEval-W 能够为每一个案例提供一种可解释、复现且按需定制的评测过程。

    Skill 选择

    评测的第一步,不是立即开展问答打分,而是先确定:这个案例究竟应该问什么问题?HarnessEval-W 首先理解当前评测案例的上下文与目标,再调用有资格、有能力评估这个案例的 skill。例如,在机器人操作场景中,动作是否正确执行、是否遵循合理物理规律,往往比画面是否具有“电影感”更重要。HarnessEval-W 不会机械地对所有案例套用完全相同的评测指标,而会根据场景选择真正相关的评测能力。

    HarnessEval:新的评测时代,用 Harness 开启

    Skill 拆解

    选定评测 skill 后,系统会把它继续拆成更小、更明确、更易测量的子问题,再分别交给合适的子智能体或工具。例如,要判断一次碰撞是否合理,HarnessEval-W 会继续追问:目标物体在哪里?它们是否在正确的时间发生接触?碰撞前后的速度如何变化?目标追踪、时序验证和速度计算等工具将分别寻找答案。各个子智能体返回的证据最终由主智能体统一汇总、验证,并形成最终结论。如果问题仍然过于复杂,子智能体还可以继续调度新的子智能体,层层拆解,直到每项任务都足够明确,可以直接通过工具或视觉证据完成验证。

    HarnessEval:新的评测时代,用 Harness 开启

    从单一分数走向可追溯的证据链

    HarnessEval-W 的最终目标并不仅仅是输出一个数字得分。我们希望 benchmark 最终形成一棵层级式的证据树(evidence tree),完整记录到底测了什么、哪个具体工具提供了视觉证据、以及支撑最终分数的完整逻辑链。有了这条可执行、可追溯、可验证的证据链,研究者不仅能准确定位错误来源,也能据此改进下一阶段的模型设计与训练。

    评测数据集的构建

    HarnessEval:新的评测时代,用 Harness 开启

    一个真正有效的 benchmark,必须覆盖足够复杂、足够多样的环境,才能持续探索世界模型的能力边界。为此,我们同样采用一套 agentic pipeline 来构建评测案例,让 benchmark 能够规模化扩展。

    整个流程从预定义的场景分类体系(scene taxonomy)开始。我们首先采样世界的初始配置,确定环境、物体、空间结构、视觉风格与观察视角等属性;随后再为案例选定评测维度,尤其是前文定义的状态转移与世界持续性指标。

    根据这些条件,一个图像生成 agent生成世界的初始帧;动作规划 agent随后理解画面内容,并围绕目标评测维度设计具体动作。例如,如果我们需要测试重访一致性,规划 agent 就可以设计一条“先离开当前区域,再绕行返回原位置”的相机轨迹。最后,我们引入一个独立的验证 agent进行质量控制。它会同时检查初始图像与动作设计,确认环境、前景、背景和动作是否彼此协调。未通过验证的候选案例会被自动退回并重新生成,直至满足评测要求。

    通过这一闭环流程,benchmark 得以持续扩展,同时保持必要的复杂性与可验证性。

    What’s Next:让 Agentic Benchmark 持续进化

    世界在进化,评测也应随之进化。

    评测从不该是一套静态评测标准。随着世界模型不断进入更复杂的场景、展现更强的能力,评测体系本身也必须同步拓展自己的边界。HarnessEval-W 只是我们探索通过 Harness 实现 agentic benchmark 这一新范式的起点。作为一个开源项目,我们也诚挚邀请社区中的研究者与开发者一起参与进来,让 agentic benchmark 在真实的协作与迭代中不断成长。

    接下来,我们将重点关注三个方向:

    测试时扩展(Test-Time Scaling)

    LLM 在推理时会生成复杂的推理轨迹,并借助 MCP 等外部工具完成长时程任务,评测过程本身也必须获得相应的 scaling 能力。传统 benchmark 往往默认每个样本的评测成本固定,而 agentic benchmark 则允许我们在test time 投入更多计算资源:评测时可以执行更深的搜索、多步验证与工具调用。随着被测试模型越来越强,评测系统也需要通过更多推理和验证计算同步提升自身能力,使评测模型的能力始终足以追上前沿生成模型。

    技能库的扩展(Scaling Skill Libraries)

    未来的世界模型将覆盖更广泛的应用场景,并生成包含更复杂物理过程和更细粒度物理细节的环境。因此,agentic benchmark 模型同样需要拥有不断扩展的能力集合。我们将持续搭建丰富的技能库(skill library):当模型模拟更精细的物理与更多样的场景时,评测智能体可以从这个不断增长的库中动态检索并组合专门技能,准确评估生成世界中的物理理解能力。benchmark 的能力不再被写死在一套固定代码中,而能够随着技能库的增长持续扩展。

    自回归改进(RSI)

    更进一步,我们希望 benchmark 本身具备自我改进能力。当 HarnessEval-W 在评测前沿世界模型时遇到一个分布外(OOD)场景,它不应该只是简单地给出一个低置信度分数。相反,系统首先应该:

    Evaluate the Evaluator ,先评估自身。

    它需要判断:当前的不确定性究竟来自被评测模型,还是因为自身缺少相应的 skill?如果发现内部能力缺口,系统就可以通过引入外部的新 skill、学习新的工具使用方式、甚至通过自主探索构建新的评测能力,进一步扩展自己的技能库。新的能力随后重新进入评测 Harness,支持未来更加复杂的评测任务。

    我们希望 HarnessEval-W 所开启的,不只是一套新的世界模型 benchmark,而是以 Harness 重新定义 benchmark 范式:能够推理、能够验证,也能够与被评测对象一同进化

    让 benchmark 成为技术的驱动者

    让 harness 成为认知的引擎

    完成 RSI 的智能飞轮

    项目主页:https://mirros-lab.github.io/HarnessEval-W

    论文:https://arxiv.org/abs/2608.16859

    代码:https://github.com/mirros-lab/harnesseval-w

    全文 Blog : https://mirros.ai/blog/harnesseval

    HarnessEval:新的评测时代,用 Harness 开启

    Join us: talent@mirros.ai

    Business Contact: business@mirros.ai

    © 版权声明

    相关文章