(来源:机器学习算法那些事)
华为云联手北大发布 OmniaBench
给 AI 智能体做一次真正的"全身体检"
华为 OmniaBench 通用 AI Agent 基准测试

2026 年 7 月 25 日
项目主页:scuuy.github.io/OmniaBench|论文:arXiv:2607.14989
一、当 AI 学会"干活",谁来打分?
2026 年,大模型正从"会聊天"全面进化到"会干活"。GPT-5.6、Claude-Sonnet-5、DeepSeek-V4 等前沿模型已经能够理解复杂指令、调用外部工具、维护任务状态,在真实工作中充当"数字员工"。
但一个核心问题随之而来:我们如何系统性地评价一个 AI Agent 好不好用?
传统的 Agent 基准测试存在三大局限:场景单一(只测编程或只测网页操作)、工具生态狭窄(仅支持特定 API)、评估粗糙(只给一个"通过 / 失败")。这种评测方式,就像体检只量身高体重,却告诉你"身体非常健康"。
2026 年 7 月 16 日,华为云后训练团队联合北京大学 DCAI 团队,携手中国人民大学、北京理工大学、清华大学等多家机构,在 arXiv 上发布了 OmniaBench —— 一个面向通用 AI Agent 的"全身体检"基准,配有完整的论文、代码和开源数据集。
▲ 图 1:OmniaBench 整体架构——从真实应用知识到可执行轨迹与可验证结果OmniaBench 不只是一个"排行榜生成器"。它在回答"哪个模型分数更高"的同时,还能进一步解释:模型强在哪里、在哪些场景更可靠、完成任务付出了多少行动成本,以及它为什么失败。
二、不止是"分数":OmniaBench 的深度诊断哲学
OmniaBench 的设计理念可以用一句话概括:评测不是终点,诊断才是目的。传统 Agent 评测往往只给一个 Pass@1 分数,但分数相同的两个模型,能力画像可能完全不同。
2.1 三大应用场景全覆盖
OmniaBench 构建了一套层次化场景分类体系,覆盖当今 AI Agent 落地的三大主战场:
ToC(消费者场景):22 个一级领域、101 个细分场景,源自真实应用生态和日常用户需求。比如帮用户规划旅行、管理日程、跨 App 协同操作等。
ToB(商业场景):38 个一级领域、186 个细分场景,涵盖专业服务、产业流程、企业运营。涉及供应链管理、财务分析、客户服务等复杂企业任务。
ToE(员工场景):30 个一级领域、67 个细分场景,基于通用知识工作和职场任务。包括文档处理、数据分析、会议协作等。
总计 90 个一级领域、354 个二级领域,这是目前覆盖面最广的 Agent 评测分类体系之一。
▲ 图 2:OmniaBench 三大场景(ToC / ToB / ToE)覆盖 90 个一级领域2.2 十维能力诊断 + 八项难度因子
OmniaBench 独创性地引入了"十维能力分类法",将 Agent 表现拆解为十个可量化维度:
① 任务理解 ② 信息收集 ③ 规划与决策 ④ 状态管理 ⑤ 工具使用
⑥ 代码与编程 ⑦ 数据分析 ⑧ 办公与文档 ⑨ 互动协作 ⑩ 可靠性与安全
同时,还引入了"八项原子难度因子"(如模糊目标、长上下文证据、状态演进等),对每个任务轨迹进行细粒度归因。这让研究者不仅能知道"模型得了多少分",还能知道"分扣在哪里"以及"为什么扣分"。
▲ 图 3:OmniaBench 十维能力诊断雷达图——分数相同的模型可能拥有完全不同的能力画像三、四管齐下:1,431 个任务的生成之道
OmniaBench 的数据并非简单的人工标注,而是从应用商店、产品文档、行业白皮书、网络检索中系统性地抽取场景知识,构建可执行的 Python 仿真环境,再通过四种互补路径合成任务。完整数据集包含 1,431 个任务,其中精选 644 个高难度任务作为排行榜挑战子集。
四种任务构造路线
每一种路线针对不同类型的 Agent 能力:
DAG(有向无环图)—— 354 个任务:多轮有状态交互和工具链执行,模拟复杂工作流。这是 OmniaBench 的核心路线,最接近真实 Agent 使用场景。
DAG-S(单轮派生)—— 200 个任务:通过对 DAG 任务进行查询细化得到的单轮任务,侧重意图理解和快速响应。
Solver(求解器驱动)—— 60 个任务:选择、调度、分配、优化类场景,测试 Agent 在运筹规划方面的能力。
Program(程序化推理)—— 30 个任务:涉及分支、循环和调试的程序化推理任务,考察 Agent 的编程思维。
▲ 图 4:OmniaBench 多路线任务构建管线——从分类种子和可执行环境到任务策展
▲ 图 5:OmniaBench 数据集统计概览——涵盖四个路线、多种语言的任务分布四、排行榜揭晓:最强模型也仅过半
OmniaBench 基于 644 个挑战子集任务,使用 Pass@1(一次通过率)进行微平均计算,共评测了 22 个主流模型。结果令人警醒——当前最强模型也远未达到可商用的可靠性水平。
Top 8 模型排行榜(Pass@1)
▲ 图 6:OmniaBench 排行榜——Claude-Sonnet-5 以 58.54% 的综合通过率位居榜首排行榜要点解读:
1. Claude-Sonnet-5 以 58.54% 的综合得分排名第一,GPT-5.6-Sol 以 57.14% 紧随其后,差距仅 1.4 个百分点。
2. 开源阵营中,GLM-5.2 以 56.83% 位列第三,DeepSeek-V4-Pro 以 54.50% 排名第五,展现了国产开源模型的强劲实力。
3. 所有头部模型的成绩都在 50%-60% 区间,说明当前 AI Agent 在真实复杂任务中还有近一半的任务无法可靠完成。
4. 不同路线上的表现差异显著:比如 GPT-5.6-Sol 在 Solver 任务上得分最高(65.00%),但在 Program 任务上仅 50.00%,显示了"偏科"现象。
核心洞察:即使是最强的 AI Agent,在真实世界的复杂任务中仍有超过 40% 的失败率。Agent 革命刚刚开始,可靠性仍是最大瓶颈。
五、模型为什么失败?——53.8% 的失败源自推理而非工具
OmniaBench 最亮眼的特点之一,是它能深入分析 Agent 失败的根本原因。研究团队对所有失败案例进行了系统性归因,得出了几条振聋发聩的结论:
5.1 瓶颈是"大脑"而非"双手"
在全部失败案例中,规划失误、任务分解错误、约束维持失败、反思不足和自适应校正不力等推理层面的问题占比高达 53.8%,远超工具调用本身的语法或接口错误。
这意味着:当前模型已经基本学会了"如何使用工具",但还不擅长"思考和规划如何使用工具"。就像一个会用扳手但不懂如何修车的人。
5.2 步数更多不一定代表更努力
研究发现了一个反直觉的现象:更强的模型反而用更少的工具步骤完成任务。步数更长的轨迹往往反映的不是更彻底的执行,而是冗余的探索、反复的重规划,甚至是"兜圈子"。
这揭示了一个重要的评估维度——行动效率。一个真正优秀的 Agent 应该在保证正确性的前提下,以最少的步骤达成目标。
5.3 综合排名掩盖了场景特化优势
不同模型在 ToB、ToC、ToE 三大场景下表现差异明显,甚至在同一场景的不同细分领域中也有不同表现。一个综合排名第五的模型,可能在财务分析场景中排名第一。
▲ 图 7:OmniaBench 失败归因与能力差异分析——推理层短板(53.8%)是最主要的失败原因5.4 三大系统性短板
任务规划断层:多步任务中,Agent 容易出现步骤跳跃、逻辑死循环或子目标丢失。这在大规模企业级工作流中尤为突出。
长程约束漂移:在长上下文交互中,Agent 难以持续遵守初始条件和边界限制,往往"聊着聊着就忘了最初的要求"。
动态自适应弱:面对环境状态突变或工具返回错误时,Agent 缺乏有效的自我修正策略,容易"一条路走到黑"。
六、OmniaBench 的产业价值与开源生态
OmniaBench 不只是一个学术项目,更具有强烈的产业落地导向:
对于 AI 研发团队
提供一个统一的"体检平台",快速验证不同模型架构与工程优化策略下的真实落地能力,大幅降低迭代测试成本。十维能力诊断直接定位模型短板,让优化有据可依。
对于企业用户
结合自身业务场景定制分层评测方案,筛选真正适配的 AI Agent 产品,规避"实验室效果好、实际落地差"的选型陷阱。
对于学术研究
提供可复现的标准化横评基准,推动通用 AI Agent 能力边界的研究,为后续方向(如长程规划算法、约束强化学习、动态环境自适应等)指明攻关重点。
完全开源
OmniaBench 的代码、数据集、评估工具均已开源:
论文地址:https://arxiv.org/abs/2607.14989
项目主页:https://scuuy.github.io/OmniaBench/
GitHub 仓库:https://github.com/scuuy/OmniaBench
数据集:https://huggingface.co/datasets/scuuy666/OmniaBench
代码采用 Apache 2.0 许可证,支持 OpenAI 兼容和 Anthropic 原生 API,只需一条命令即可启动评测。研究团队来自华为云后训练团队与北京大学 DCAI 团队,中国人民大学、北京理工大学、清华大学也参与了本研究。
七、结语:评测决定方向
在 AI Agent 从实验室走向产业化的关键节点,"如何评测"本身就决定了"谁将被选中"。OmniaBench 的价值不仅在于提供了一个全面的排行榜,更在于建立了一套"能解释、可诊断、重效率"的评估范式。
好的评测不只是打分,而是告诉开发者:你的模型差在哪里、为什么差、以及下一步应该从哪里改进。
当 AI Agent 开始真正进入我们的工作和生活,我们需要的不是一个"全能冠军",而是一个能清楚了解其能力边界和适用场景的 AI 伙伴。OmniaBench 正是为这个目标而生——帮助整个行业更好地理解 AI Agent,让每一次优化都有方向,让每一次落地都有依据。