作者 | 林潜
编辑 | 头头
刚刚看到一条新闻,百度文心助手任务 Agent以94.6%的综合成功率、94.4%的平均得分,在全球工程向AI智能体评测榜单 PinchBench v2 中荣登榜首。
这个成绩超过了Claude Opus 4.8-fast、阿里千问 Qwen3.7-max、英伟达 Nemotron-3 Ultra、OpenAI GPT-5.6-luna 等一众海内外主流大模型。
很多人看到这个结果,第一反应可能是:竟然是它?
1、文心助手赢了 Claude、GPT
首先,这个榜单确实是业内权威。测评的逻辑也很直接:147项真实自动化任务,比如合同法律分析、Excel 数据处理、PPT 生成、旅游攻略规划、股价监控报告等,最后算出来最佳得分和平均得分。没有主观打分,没有人工干预,就是纯比拼任务完成质量。
文心助手任务 Agent:最高成功率 94.6%,平均得分 94.4%。排名第一。
第二名是 Claude Opus 4.8-fast,分别是 94.5% 和 93.5%。
虽然差距不是很大,但第一名就是第一名,这件事本身带来的信号意义,跟数字本身一样重要,甚至更重要。
百度AI 搜索团队自己公布了评测的全流程,还在 GitHub 上开了源,地址如下,感兴趣的也可以自己了解:https://github.com/Baidu-AI-Search/PinchBench-Evaluation
比如在测试中有一个合同法律分析的 case,任务是读取一份软件服务协议,提取关键日期、梳理双方义务、识别风险点、生成财务摘要。这种任务过去需要律师助理花几个小时。文心助手任务 Agent 的输出结果,识别了客户方 12 项风险、供应商 10 项风险、5 项共享风险,付款结构六期分期的现金流前置问题、IP 转让条件的产权间隙,全部做到了——最终评分四个维度都是满分 1.0。
这不是精心设计的 demo,而是直接跑出来的结果。
2、搜索引擎,是最早的 Agent
很多人可能会好奇,为什么是百度的文心助手任务 Agent?
答案其实很简单:百度是一家在意图理解上花了 20 多年的公司。
把 Agent 拆开来看,它做的事情是什么?用户给出一个目标,Agent 理解目标背后的意图,把它拆解成可以执行的步骤,调用必要的工具,验证中间结果,最后交付。
然后再把搜索引擎的工作链路看一遍:用户输入一串 query,系统解析意图,拆解成多个检索方向,调用索引、爬虫、知识图谱,综合排序,返回结果。
链路上,二者是差不多的。
区别在于:以前的「工具」是索引和爬虫,现在的「工具」在大模型的驱动下,用 MCP、工具调用、文件处理器,以及接入了各种 API,完成各类任务。以前的「结果」是一页蓝链,现在是一份可以直接用的文档、一个可以运行的代码、一张你想要的图表。
文心助手任务 Agent 把这条链路做了升级,但底层逻辑没变。这么多年积累的,是怎么读懂一个人想要什么,然后把这件事做出来。这件事放在搜索时代叫「检索」,放在 Agent 时代叫「任务执行」。
这也解释了 PinchBench v2 的考察重点为什么对百度来说是主场:工具调用和多步骤任务规划,恰好是百度系统长期打磨的核心能力。
3、不是每个 AI 都办得了「事」
有一个区分是重要的,但行业里说得还不够多:AI「能回答」和「能办事」,是两件完全不同的事。
前者考的是知识和语言,后者考的是规划和执行。一个模型可以把旅游攻略讲得头头是道,让它真的去查北京到青岛的高铁、筛选有口碑的民宿、排出合理的时段、生成可以直接截图出发的计划,失败率会高得多。
PinchBench 这类「工程向」评测的价值就在这里。它测的是第二种能力,这种能力在过去两年的评测体系里一直是被低估的。当大家都在比谁的语言更流畅、推理更深刻的时候,文心助手在做的是:你给我一个任务,我把它办完。
比如说你是个股民。需要实时监控某个公司的股价涨幅,如果涨跌幅超过 1% 就提醒你,并通过交互式报告来汇报股价变化以及可能原因。
比如你如果是个搞学术的,想设置一个定时任务,每周一晚上十点,想让文心助手汇总下近一周的高质量 AI 领域论文,然后用精美的形式发送给你。
这些任务有一个共同特征:用户不需要实时在场。没有人在旁边纠偏,没有 prompt 可以反复迭代,系统得自己判断什么时候该干什么、干到什么程度算完成。
这种「无人值守执行」的能力,意味着 AI 不再是一个需要人盯着的工具,而是可以托付的协作方。
4、百度 App,被低估的天然 Agent试验场
PinchBench 的结果,不仅说明文心助手任务 Agent 能做什么,而且做得好,做到了第一。为什么能做到第一呢?
答案在于规模和场景密度。百度 App 及其旗下的文心助手不是某个垂直赛道的应用,而是面向普通用户的综合入口,是每天上亿人使用的国民级 App。每天有海量形态各异的真实任务流入:有人要做汇报 PPT,有人要帮孩子备课,有人要给旅行做计划,有人要分析股票。
这种杂乱、高频、来自真实生活的任务流,是任何实验室数据集都模拟不了的训练场。Agent 在这里面被迫学会的,不是怎么回答精心构造的 benchmark,是怎么在模糊的、不完整的、带着人类惯用语的真实需求里找到那个「用户真正想要的是什么」。
这就是为什么 PinchBench 考察的那些任务对文心助手来说不陌生:它们本来就是这个系统每天在做的事情。
值得注意的是,这不是一次性的冲刺。文心助手任务 Agent 的得分曲线,在工具调用、多步骤规划和长程执行上都表现稳定,这更接近一个系统性能力的体现,而不是某几道题刚好押对了。
AI 智能体的竞赛刚刚进入第二阶段:从「谁能说得更好」,到「谁能干得更稳」。这是一场需要深厚工程积累的比赛,不是靠参数规模就能赢的。
说到底,「意想不到的第一」,放在这个背景下,倒也没那么意想不到。