长程任务基准揭示大模型Agent真实能力:通过率仅6.4%

长程任务基准Agent多步骤任务
于 2026-08-31 04:09:13 修改
·本内容遵循CC 4.0 BY-SA版权协议

最近不少团队在评估新一代大模型时,都开始从“单轮问答准确率”转向“多步骤任务完成率”。其中一个长程任务基准的测试结果很能说明问题:即便是公认的前沿模型,在真实的长程任务场景中平均通过率也只有 6.4% 左右。这个数字和我们在常规榜单上看到的惊艳分数形成了强烈反差。本文围绕“长程任务基准”展开,拆解它到底测了什么、为什么通过率这么低、对普通开发者在设计 Agent 应用和模型选型时有什么参考价值。

1. 长程任务基准是什么,为什么突然被关注

1.1 从传统评测基准的局限说起

以前我们评测一个大模型好不好,习惯用 MMLU、GSM8K、HumanEval 这样的基准。它们的特点是:单轮、短文本、目标单一。比如问一个物理问题,模型答对了,就算过了;给一道算法题,模型生成代码通过测试用例,就算过了。

但真实业务场景往往不是单轮问答,而是由多个环节组成的完整任务链。举个例子:让模型帮你做一份“竞品分析报告”,它需要先理解需求,再搜索资料,然后阅读多篇文档,提炼关键信息,最后按格式输出报告。整个过程可能持续几十分钟甚至几个小时,涉及几十次推理、多次工具调用、大量中间结果的记忆和取舍。这种任务,传统评测基准基本覆盖不到。

长程任务基准就是为这类场景设计的。它把评估重心从“回答是否正确”转向“任务是否最终完成”,通过率直接反映模型在复杂、多步骤、真实业务场景中的可用程度。

1.2 长程任务的核心特征

要理解为什么通过率只有 6.4%,先要弄清楚长程任务具备哪些让模型“头疼”的特征:

  • 多步骤:完成任务需要拆解出多个子任务,每个子任务的结果都会影响后续步骤。
  • 长上下文:模型需要在较长的上下文窗口中保持对关键信息的定位能力,不能“读到后面忘了前面”。
  • 工具调用:不是纯文本生成,而是需要调用搜索、代码执行、数据库查询等外部工具。
  • 记忆保持:中间过程会产生大量中间结论,模型需要正确保留和更新这些信息。
  • 错误累积:早期一个小错误,可能在后续步骤中被不断放大,最终导致整个任务失败。
  • 规划与回溯:遇到阻塞时,模型需要调整计划,而不是一条路走到黑。

1.3 为什么 6.4% 这个数字值得关注

如果一个模型在常识问答、代码生成、数学推理等单点能力上都能拿到不错分数,但在长程任务上平均通过率只有 6.4%,说明什么?说明模型的“单点能力”和“系统能力”之间存在巨大鸿沟。

对开发者来说,这个现象其实很常见:单个 API 调用效果不错,一旦把多个调用串成工作流,成功率就会急剧下降。这不是某个模型独有的问题,而是当前大模型在长程任务上的共性短板。理解这一点,有助于我们理性看待模型能力,设计更稳健的 Agent 应用。

2. 长程任务基准的评测思路与核心指标

2.1 评测对象与任务设计

长程任务基准通常会选取一组贴近真实业务的任务,例如:

  • 从一堆文档中找出指定信息,并按照固定模板生成摘要;
  • 通过多轮搜索和筛选,最终输出一份带数据来源的分析报告;
  • 按照需求拆解功能点,生成代码并运行测试,持续修复报错;
  • 在限定条件下完成一次复杂的配置变更,并输出变更记录。

这些任务的特点是:没有唯一标准答案,只有“完成”与“未完成”的判定。评测时需要使用统一的评分规则,既考察最终结果,也考察过程质量。

2.2 关键评测指标

长程任务基准不只是输出一个“通过率”数字,它往往会从多个维度量化模型表现:

指标 含义 说明
任务通过率 完整完成任务的比例 反映整体可用性
子任务完成率 各个步骤单独完成的比例 定位失败发生在哪一环
错误累积率 从首次出错到任务失败的比例 反映模型纠错能力
工具调用成功率 外部工具调用是否顺畅 影响真实系统集成
无效步骤比例 重复操作、无用操作占比 反映规划效率
平均步骤数 完成任务所需步骤 与最优路径对比可衡量规划能力

2.3 评测过程中需要控制变量

评测长程任务比评测单轮问答更难,因为同一个任务让模型跑两次,结果可能完全不同。为了保证评测结果可信,需要尽量控制变量:

  • 固定初始 prompt,避免随机性影响任务理解;
  • 设置相同的工具环境,确保调用的搜索结果、代码运行结果一致;
  • 明确失败判定标准,比如“结果格式错误”和“结果内容错误”是否需要区分;
  • 多次运行取平均值,降低采样温度带来的波动。

如果你打算自己搭建一个简易的长程任务评测,下面这个最小化脚本可以帮你快速跑通流程:

PYTHON
# 文件路径:scripts/evaluate_long_task.py
"""
简易长程任务
最低 0.47元/天 开通会员,解锁全文
left
成为会员后, 你将解锁
right
benefits 下载资源随意下
benefits 优质VIP博文免费学
benefits 优质文库回答免费看
benefits 付费资源9折优惠
国金证券-量化漫谈系列之二十一GLM-5.2,Agent工具最优模型,长程任务能力登顶-260624.pdf
在三项国际公认的长程任务基准测试——LongBench、AgentBench与CodeStory中,GLM-5.2在开源模型类别中综合得分排名第一,整体推理能力水平稳定介于Claude Opus 4.7
wh3933
2
量化漫谈系列之二十一GLM-5.2,Agent工具最优模型,长程任务能力登顶.docx
编程能力方面,GLM-5.2在HumanEval-CN中文编程基准测试中取得86.4%通过率,较GLM-5.1提升9.2个百分点;在Codeforces算法竞赛题库中,针对动态规划类中高难度题目(rating
wh3933
7
量化漫谈系列之二十一GLM-5.2,Agent工具最优模型,长程任务能力登顶.pdf
长程任务评测中,GLM-5.2在多个权威开源基准上取得第一,涵盖跨文档推理、多跳问答、长链逻辑验证、时序事件建模等典型场景,尤其在需回溯百页以上文档并执行复杂条件判断的任务中表现稳定可靠。
wh3933
2
模拟一个agent大模型针对一个任务对话的具体过程
本文通过一个旅行规划的示例,详细描述了Agent大模型协作完成任务的具体过程。从用户请求开始,经过Agent任务解析、工具调用决策、大模型生成结果,到最终结果的验证与反馈输出,每个步骤都包含了技术实现的关键环节。同时,文章还对比了简单任务与复杂任务的处理方式,并提出了通过强化学习模块进行流程优化的方案。
weixin_43697882
大模型-大模型Agent应用基础认知视频
**应用案例分析**通过具体的案例,如智能客服、虚拟助手等,展示大模型Agent的实际应用效果和价值。6.
152
大模型agent
本文介绍了大模型Agent技术的核心实现机制,包括其核心组件、关键技术以及应用场景。大模型Agent利用大规模预训练语言模型的能力,结合记忆模块和工具调用接口,实现自主决策与执行任务。关键技术如思维链、自我反思和任务规划分解,增强了Agent的透明性、鲁棒性和适应性。文章还通过智能家居助手应用的伪代码示例,展示了大模型Agent在实际中的应用。
大橙子
AI Agent大模型区别[项目源码]
它们通常依赖于大量的训练数据来提升模型的泛化能力,且在特定任务上能够展现出色的性能。然而,大模型大多数时候是被动地回应输入,缺乏自主意识和主动规划能力
16
有关大模型都有哪些概念和专业术语,比如 agent
本文系统梳理了大模型领域的核心概念和专业术语,包括基础概念、架构与技术、训练方法、关键应用概念、评估与安全以及扩展概念。详细解释了每个术语的定义、作用和应用场景,如大模型、涌现能力、Transformer架构、预训练、微调、Agent、提示工程、多模态、基准测试、对齐、幻觉等,并通过术语关系图谱展示了它们之间的联系。
朽木自雕……
大模型Agent智能体设计与复杂任务调度开发.md
大模型加载模块负责处理不同硬件上的模型加载和适配;智能体核心模块定义了不同类型的Agent,如负责任务规划、执行和校验的Agent任务调度模块则提供了核心调度器和任务队列,支持任务的拆分、调度和校验;
码狸_CodeTanuki
4
大模型(LLMs)agent.pdf
只有这样,大模型agent才能真正实现其潜力,为人类社会的发展做出更大的贡献。此外,大模型agent在学习和处理任务时,其自主学习能力也得到了显著增强。
石去皿
12
长程任务基准揭示AI真实短板前沿模型平均通过率仅6.4%
本文剖析长程任务基准评测中前沿AI模型仅6.4%平均通过率的核心原因,指出其本质是规划能力、状态管理、错误恢复与工具链路稳定性等工程能力的系统性缺失。文章阐释长程任务定义、严格判定逻辑,并提供可复现的评测环境搭建方法及完整示例。最后提出面向落地的五大工程建议:任务拆解、外部状态管理、关键节点验证、失败恢复路径设计及评测嵌入开发流程,强调AI需从‘回答者’向可靠‘执行者’演进。
weixin_34146805
418
大模型长程任务平均通过率仅6.4%:Agent开发如何破局
当前大模型长程任务基准中平均通过率仅6.4%,暴露其在多步协同、状态维护、误差累积与目标一致性上的系统性短板。本文从评测设计、失败归因(误差累积、目标漂移、错误恢复弱、自我评估失准)出发,提出工程侧关键对策:任务拆解、外部状态管理、过程校验点、工具化封装及人机协同兜底。强调以长程任务真实标尺构建评估体系,并推动Agent开发从依赖模型能力转向强化工程约束。
weixin_34121282
293
长程任务基准揭示:前沿模型平均通过率仅6.4%Agent落地需系统工程思维
本文解析长程任务基准的核心逻辑它评测的是模型完整执行多步骤任务的闭环能力,而非单步准确率;前沿模型平均通过率仅6.4%,暴露了目标漂移、错误累积、工具链断裂与缺乏自我纠正等系统性短板。文章强调需以系统工程思维构建检查点、状态管理、失败恢复与断点续跑机制,并指出任务闭环率比单点能力更关键。
方圆的学习QQ
247
大模型真实能力边界2026年企业级AI落地六大维度实测图谱
本文基于17个企业级AI落地项目,实测2026年5月主流大模型(GPT-4o、Claude-3.5-Sonnet、Qwen2.5等)在文档理解、逻辑推理、工具调用、多步规划、长程记忆和跨模态协同六大维度的真实能力边界。重点揭示各维度的分层表现(基础/进阶/攻坚)、失败根因(如状态缺失、模态对齐不足、幻觉机制)及工程解法(RAG优化、状态机外置、业务流压测)。强调能力评估必须回归可交付的业务指标,而非学术分数。
MOVING
685
Opus 4.7深度解析:长程推理、多模态与指令遵循的工程化跃迁
本文系统剖析Opus 4.7在长程推理、多模态理解与指令遵循三大核心技术上的突破实现任务自治闭环、像素级视觉工程能力及字面级指令执行;详述API迁移中的努力值机制、企业级混合部署架构、token精炼与成本控制策略;并揭示中文衰减、工具语义降级、采购合同雷区等真实落地陷阱,提出记忆持久化、输出自验证、韧性降级等生产环境稳定性加固方案。
weixin_33730836
363
智能体框架选型指南DataSpace基准揭示15.36%性能差异
本文基于DataSpace基准测试,揭示不同智能体框架在准确率上存在最高15.36%的性能差异,强调框架选型是影响AI智能体任务成功率的关键工程决策。重点分析架构哲学(Monolithic vs. Modular)、规划与推理能力、工具调用与状态管理、记忆与上下文管理四大核心技术维度,并提供可复现的基准测试流程、LangChain与LlamaIndex实战对比及工程最佳实践。
1092
AI动态简报之技术前沿篇(2026.06.14)
智源大会发布Physis-v0.1等四大前沿模型,标志AI从预测词元迈向物理世界建模;MiniMax MSA稀疏注意力实现百万token上下文推理加速28倍,显著降低长文本Agent成本;ALE基准揭示智能体在真实工业任务通过率仅2.6%,暴露能力鸿沟;豆包任务模式与Cursor Auto-review推动Agent全链路执行与安全可控双轨落地;6月成超级发布月,150万Token上下文、推理时计算、Agent生产化三浪叠加。
英辰朗迪AI获客
1890
SaaS-Bench实战:Agent全军覆没,暴露长程任务短板,软件或需为其重做
IT界那些事儿
38
GLM-5.1长程思维代码重构与跨文档推理的工程化突破
本文深入剖析GLM-5.1模型的长程推理能力,聚焦其三大核心技术机制动态上下文压缩(DCC)、工具调用韧性(TCR)和自我验证循环(SVL)。通过真实代码重构、跨文档法律审查、多传感器故障诊断等场景实测,验证其在跨文件、跨阶段、多工具协同任务中的状态维持与逻辑连贯性。同时揭示Claude Code接入时的七类配置陷阱及五大典型逻辑断点,强调长程能力本质是通用问题分解与状态管理能力,适用于编码与非编码复杂任务
weixin_30411239
403
多模态Agent从入门到精通AgentVista全解析,收藏这篇就够了!
香港科技大学提出AgentVista多模态Agent评测基准,涵盖209个真实视觉任务、308张图片及25个子领域,聚焦长序列工具调用能力。评估显示顶级模型Gemini-3-Pro准确率27.3%,暴露视觉基础薄弱、工具协同不足与长程推理缺陷三大瓶颈。核心工具包括网页搜索、图像搜索、页面导航和代码解释器,失败主因是视觉误识别。
Python_金钱豹
196
清华、智谱团队提出Vision2Web基于Agent验证评估视觉网站开发
清华与智谱团队推出Vision2Web,首个面向视觉驱动网站开发的三层分级评测基准,涵盖静态网页、交互前端与全栈网站任务。它采用基于工作流的Agent验证范式,融合GUI Agent功能验证与VLM视觉保真度评估,在193个真实任务上系统揭示当前多模态编码Agent在复杂度跃升时的能力断崖。实验表明模型在状态管理、跨设备适配及全栈集成等工程环节存在显著瓶颈。
超正经学术君
501
大模型能力评估新框架用足球位置逻辑选型AI模型
本文提出一种基于足球位置逻辑的大模型能力评估新框架,将后防、中场、锋线等角色与模型技术特性精准映射后防线对应鲁棒性与长程注意力(如DeepSeek、GLM-5.1),中场体现系统协同与多模态理解(如混元2.0、文心5.0),锋线强调单点穿透力与确定性执行(如千问、豆包2.0)。框架摒弃单纯排行榜依赖,聚焦覆盖面积、响应延迟、容错边界、战术适配性等工程硬指标,并通过真实业务沙盒验证与组合阵型实践,支撑AI系统级治理。
adgnfega11455
399
AGI门票之争代码能力是试金石还是认知陷阱?
本文深入探讨代码能力在通向通用人工智能(AGI)进程中的真实定位,指出其作为逻辑推理、符号操作与可验证性代理指标的价值,同时批判将其视为唯一准入标准的认知陷阱。文章系统剖析‘能力涌现’(如DeepSeek-V3)与‘系统集成’(如GPT-4o Agent架构)两条技术路线的本质分歧,拆解代码能力背后的三层技术栈——基础模型精度、推理执行框架、工程化落地规范,并通过实操验证揭示二者在原子语法、逻辑推理与系统集成维度的差异化表现。核心结论强调AGI需多维能力护照,而非单维代码门票。
chenshixi3325
366
Claude Opus 4.6 实测:1M上下文与自适应推理的工程落地
本文基于72小时连续实操,深度验证Claude Opus 4.61M Token上下文能力、effort参数驱动的自适应推理、Agent Teams协作架构及128K长输出稳定性。通过Linux内核源码与财报混合输入等真实场景,证实其有效上下文达940K+,并揭示CAPE位置编码、推理预算调度、单模型多角色隔离等关键技术机制。对比GPT-5.2与Gemini 3 Pro,突出Opus在严谨性、长程一致性与企业级工作流集成上的工程优势。
weixin_30642869
329
M2.7自我进化范式:大模型作为研发团队的工程实践
本文深入剖析MiniMax M2.7大模型提出的自我进化范式,强调其核心并非参数规模提升,而是将大模型转变为具备自主调试、实验设计与决策能力的‘研发团队’。关键技术包括Agent Harness三层隔离科研操作系统、MM-Claw动态压力测试场、基于‘错误压缩比’的可量化进化机制,以及在MLE Bench Lite上实现66.6%银牌级解决方案的真实验证。同时指出审计日志可信度、对抗性过拟合、能力漂移等五大工程风险及应对策略。
coolmsn8786
365
Claude Opus 4.7与Qwen3.6-A3B本地可编程智能体实战指南
本文聚焦Claude Opus 4.7的Design Mode可编程能力与Qwen3.6-35B-A3B的本地化部署实践,详解其作为可编程智能体的核心机制Opus 4.7通过schema严格遵循实现可靠API契约,支持可审计推理;Qwen3.6-A3B采用自适应3-bit量化,在RTX 4090上实现4K上下文稳定推理,显著降低KV Cache内存占用。文章提供双模智能体工作流构建指南,涵盖本地Agent启动、模型部署及协同编排,推动大模型从云端服务向本地可编程组件演进。
weixin_33834075
479
Mythos因果推理引擎带闸门的大模型能力跃迁
Mythos是Anthropic推出的因果推理增强型大模型模块,通过符号-神经混合推理引擎(SNHRE)实现内生性长程因果建模,支持跨时间、跨实体、跨模态的复合推演。其核心创新在于三层闸门系统意图认证、运行时沙盒与结果可信度校验,确保推理可控、可追溯、可验证。该设计将大模型能力发布范式从功能交付转向责任共担,适用于工业诊断、金融风控、医疗溯源等强因果依赖场景。
weixin_30606461
461
不是替代,是增强Kimi K3在5个真实企业场景中的落地效果与风险管控
本文基于金融投研、法律合同审查、软件开发、医疗知识库和办公自动化五大真实场景,实测分析Kimi K3的落地效果,涵盖信息整合、初稿生成、长程编程等能力;同时系统揭示6.2%幻觉率、鲁棒性边界薄弱(36分)、过度主动及思考历史依赖四大核心风险,并提出输入校验、双模型校验、意图确认、会话状态管理等关键技术管控措施。
进哥AI研习社
469
GLM-4.7开源代码模型的工程化分水岭
GLM-4.7作为开源代码大模型的分水岭,首次系统性实现工程化生成能力,涵盖交付包式编码、可编程推理控制与工具原生集成三层进化。实测在SWE-bench-Verified(73.8%)和LiveCodeBench V6(84.9)达开源SOTA,支持端到端服务交付、Agent编排及企业级零代码开发。部署需适配vLLM-Ascend/DeepSeek-V4-Flash,注意长上下文临界点(24576 tokens)与reasoning模块稳定性。其核心价值在于将软件开发生命周期深度建模为可配置、可验证、可复现的工程能力
weixin_33895475
518
招聘筛选与入职流程自动化简历初筛、背调提醒与入离职办理的Agent应用
本文探讨AI Agent在招聘全流程中的落地应用,聚焦简历初筛、背调提醒与入离职办理三大核心场景。分析实在Agent的API+GUI双轨架构如何解决新旧系统混杂难题,介绍长程任务稳定性、多Agent协同、权限边界治理等工程化挑战,并结合长安汽车、腾讯WorkBuddy、华为永续会话等案例,揭示Agent从单点工具迈向全流程整合的关键路径。
企业架构师老王
136