长程任务基准揭示大模型Agent真实能力:通过率仅6.4%
最近不少团队在评估新一代大模型时,都开始从“单轮问答准确率”转向“多步骤任务完成率”。其中一个长程任务基准的测试结果很能说明问题:即便是公认的前沿模型,在真实的长程任务场景中平均通过率也只有 6.4% 左右。这个数字和我们在常规榜单上看到的惊艳分数形成了强烈反差。本文围绕“长程任务基准”展开,拆解它到底测了什么、为什么通过率这么低、对普通开发者在设计 Agent 应用和模型选型时有什么参考价值。
1. 长程任务基准是什么,为什么突然被关注
1.1 从传统评测基准的局限说起
以前我们评测一个大模型好不好,习惯用 MMLU、GSM8K、HumanEval 这样的基准。它们的特点是:单轮、短文本、目标单一。比如问一个物理问题,模型答对了,就算过了;给一道算法题,模型生成代码通过测试用例,就算过了。
但真实业务场景往往不是单轮问答,而是由多个环节组成的完整任务链。举个例子:让模型帮你做一份“竞品分析报告”,它需要先理解需求,再搜索资料,然后阅读多篇文档,提炼关键信息,最后按格式输出报告。整个过程可能持续几十分钟甚至几个小时,涉及几十次推理、多次工具调用、大量中间结果的记忆和取舍。这种任务,传统评测基准基本覆盖不到。
长程任务基准就是为这类场景设计的。它把评估重心从“回答是否正确”转向“任务是否最终完成”,通过率直接反映模型在复杂、多步骤、真实业务场景中的可用程度。
1.2 长程任务的核心特征
要理解为什么通过率只有 6.4%,先要弄清楚长程任务具备哪些让模型“头疼”的特征:
- 多步骤:完成任务需要拆解出多个子任务,每个子任务的结果都会影响后续步骤。
- 长上下文:模型需要在较长的上下文窗口中保持对关键信息的定位能力,不能“读到后面忘了前面”。
- 工具调用:不是纯文本生成,而是需要调用搜索、代码执行、数据库查询等外部工具。
- 记忆保持:中间过程会产生大量中间结论,模型需要正确保留和更新这些信息。
- 错误累积:早期一个小错误,可能在后续步骤中被不断放大,最终导致整个任务失败。
- 规划与回溯:遇到阻塞时,模型需要调整计划,而不是一条路走到黑。
1.3 为什么 6.4% 这个数字值得关注
如果一个模型在常识问答、代码生成、数学推理等单点能力上都能拿到不错分数,但在长程任务上平均通过率只有 6.4%,说明什么?说明模型的“单点能力”和“系统能力”之间存在巨大鸿沟。
对开发者来说,这个现象其实很常见:单个 API 调用效果不错,一旦把多个调用串成工作流,成功率就会急剧下降。这不是某个模型独有的问题,而是当前大模型在长程任务上的共性短板。理解这一点,有助于我们理性看待模型能力,设计更稳健的 Agent 应用。
2. 长程任务基准的评测思路与核心指标
2.1 评测对象与任务设计
长程任务基准通常会选取一组贴近真实业务的任务,例如:
- 从一堆文档中找出指定信息,并按照固定模板生成摘要;
- 通过多轮搜索和筛选,最终输出一份带数据来源的分析报告;
- 按照需求拆解功能点,生成代码并运行测试,持续修复报错;
- 在限定条件下完成一次复杂的配置变更,并输出变更记录。
这些任务的特点是:没有唯一标准答案,只有“完成”与“未完成”的判定。评测时需要使用统一的评分规则,既考察最终结果,也考察过程质量。
2.2 关键评测指标
长程任务基准不只是输出一个“通过率”数字,它往往会从多个维度量化模型表现:
| 指标 | 含义 | 说明 |
|---|---|---|
| 任务通过率 | 完整完成任务的比例 | 反映整体可用性 |
| 子任务完成率 | 各个步骤单独完成的比例 | 定位失败发生在哪一环 |
| 错误累积率 | 从首次出错到任务失败的比例 | 反映模型纠错能力 |
| 工具调用成功率 | 外部工具调用是否顺畅 | 影响真实系统集成 |
| 无效步骤比例 | 重复操作、无用操作占比 | 反映规划效率 |
| 平均步骤数 | 完成任务所需步骤 | 与最优路径对比可衡量规划能力 |
2.3 评测过程中需要控制变量
评测长程任务比评测单轮问答更难,因为同一个任务让模型跑两次,结果可能完全不同。为了保证评测结果可信,需要尽量控制变量:
- 固定初始 prompt,避免随机性影响任务理解;
- 设置相同的工具环境,确保调用的搜索结果、代码运行结果一致;
- 明确失败判定标准,比如“结果格式错误”和“结果内容错误”是否需要区分;
- 多次运行取平均值,降低采样温度带来的波动。
如果你打算自己搭建一个简易的长程任务评测,下面这个最小化脚本可以帮你快速跑通流程: