百度“搭子”追WorkBuddy,不能只拼“干活”
创始人
2026-08-21 02:00:19
0

来源:界面新闻

文|新立场

2026年,硅谷正在把办公从“人操作软件”,改成“人交代任务,Agent操作软件”。

微软继续围绕Microsoft 365做Agent,把Copilot Cowork、Office里的Agent能力以及Agent 365逐渐连起来;Google让Workspace Studio把企业SOP变成可复用的Agent流程;OpenAI 7 月发布 ChatGPT Work,让它跨文件和连接的应用持续工作数小时。

产品形态不同,但方向逐渐靠拢:Agent 不重新做一套办公软件,而是争夺现有软件之上的任务执行层。国内的情况则稍微反常,第一轮真正跑出规模的,是 WorkBuddy、百度搭子这类更接近 Claude Code 的独立 Agent。

7月23日,腾讯发布了 WorkBuddy Bench,把七个头部模型装进 CodeBuddy Code 和 Claude Code 两套 Agent Harness,完成代码、网页、办公和安全四类共 260 项任务。其中,办公恰好是模型与 Harness 变化后表现最稳定的一类。在 CodeBuddy Code 环境里,七个模型得分落在77.47—82.37之间;换一套 Harness,七个模型里有五个得分变化不到2分,中位绝对变化只有0.86分。

这至少说明,在这组标准化办公任务里,模型和 Harness 暂时没有拉出像代码、安全任务那样明显的差距。“能把事情做出来”,正在接近一项越来越普遍的基础能力。

Agent 提高了任务完成速度,人的工作却没有按同样比例消失。一个研究员可以把五家公司的三年财务数据交给 Agent,让它找异常、查原因,再做成一页 PPT,过去最耗时间的步骤可以被大幅压缩。可如果研究员拿到结果后,还得重新打开财报、逐个检查数字、确认日期和来源,AI 省下来的制作时间,又有一部分变成了核对时间。

这是办公Agent接下来一道更难的题:会干活之后,怎么让人敢直接用。

百度恰好在这个时间点追了上来,它手里的牌与腾讯并不一样。昨日发布的Q2财报显示,百度 AI 应用季度收入为25亿元,同比增长3%;6 月,搭子企业版上线;同期百度文库和网盘的AI DAU 渗透率同比增长27.4%。这些收入和用户并不全部来自办公 Agent,但意味着百度不是从一个空白的桌面产品开始竞争——它身后还有搜索、文库、网盘等已经运行多年的信息和文件体系。

当“把事情做出来”越来越接近基础能力,办公 Agent 的竞争开始向两头移动:一头是用户为什么愿意把第一项真实任务交给它;另一头是任务做完以后,为什么敢不再重新检查一遍。

腾讯和百度手里的旧资产,恰好分别对应这两个问题。

01 第一项任务,比一次下载更重要

Agent 比 Chatbot 更需要别人教你怎么用。

ChatGPT 刚出现时,用户几乎不需要产品教育,打开一个对话框,问一句“北京明天天气怎么样”,用户就能理解它是什么。Agent 复杂得多,它能读本地文件、改 Excel、操作浏览器、调用 Skill、执行几十分钟的任务,还可以定时运行、连接外部软件。能力越多,用户反而会面临一个更具体的问题:我现在到底应该把哪件事交给它?

对Agent来说,最有效的产品说明,往往是别人已经做出来的东西。7月1日,微软三名研究人员公布了一项关于公司内部 Claude Code 和 GitHub Copilot CLI 采用情况的研究。他们分析了微软数万名工程师在 2026 年初的真实使用数据。研究把“第一次使用”和“之后持续使用”分开,结果显示,两者由不同因素驱动:工程师之后会不会留下来使用,更多与自身编程活动相关;但一开始会不会试,明显受到周围同事影响。

论文对此的概括很直接:first use spread primarily through social networks,即第一次使用主要沿着社交网络传播。并建议企业在推广 Agent 时,把“visible peer use”,也就是让人看到身边的同事正在实际使用,纳入推广策略。

研究对象是微软工程师,产品是Coding Agent,不能直接推导所有办公用户都会重复同样的路径。但它解释了一个 Agent 产品很特殊的传播机制:功能介绍没有任务演示有效。

腾讯正好有一张适合承载这种传播的关系网。WorkBuddy 已经支持用户从微信、企业微信、QQ、钉钉、飞书等通信入口远程给电脑下发任务并接收结果,腾讯至少拥有一张更容易让 Agent 使用方式在同事、朋友和群聊中被看见的关系网。

传统互联网经常衡量获客成本 CAC,Agent 时代可能需要多看一个传统互联网不太关注的指标:获得第一项真实任务的成本,广告可以购买安装量,免费 Token 可以换来注册量,但两者都不能保证用户知道第二天该拿它做什么,同时做出来的结果还可以。

这也是为什么 WorkBuddy 目前超过 1100 万的 PC 月活值得观察,但还不能简单解释成“腾讯流量大,所以腾讯赢了”。产品能力、补贴、上线时间和市场投放都会影响数字,现阶段没有证据可以证明微信关系链与 WorkBuddy 的增长存在单一因果关系。更准确的说法应该是:腾讯拥有一项恰好适配 Agent 冷启动问题的资产。

百度搭子的增长速度则说明,市场还远没有定型。百度 3 月正式推出 DuMate,官方资料显示,它从一开始就定位为桌面级办公 Agent,之后保持了非常高的迭代频率。截至8月7日个人版已推进至v1.0.67,期间陆续增加网页发布、内嵌浏览器、远程任务和自动化模板等能力。8月12日,百度披露,搭子上线以来日均提问次数已经增长60倍,近一个月又增长两倍。

但如果竞争一直停留在“谁能更快让用户知道 Agent 能干活”,百度面对的是一道不那么有利的题。腾讯可以利用人与人的关系,让一个任务沿着同事、朋友和群聊继续传播。搜索可以带来需求,文库和网盘可以带来内容,地图可以带来位置,云可以连接企业,但它很难短期再造一张微信式的人际关系网。

所以它需要换一道题,不是继续证明自己的 Agent 也会干活,去证明当 Agent 干完活以后,用户可以少检查一遍。这才是搜索、专业内容和知识体系真正可能重新变得值钱的地方。

02 搜索的“旧”资产,只有变成证据链才值钱

Agent 做得越多,人验证它的成本就越重要,这是办公 Agent 与 Chatbot 最大的区别之一。

让模型写一篇文案,里面有一句错误,修改一句就可以。让 Agent 完成一次行业研究,它会自己搜索、筛选材料、提取数据、计算、形成判断,再制作文件。链条越长、任务执行得越完整,一个早期错误被放大的空间反而越大。

接入搜索也没有彻底解决这个问题。ACL 2026 的多项工作仍在专门研究 RAG 场景中的幻觉检测,其中一项方法直接将生成内容与检索证据对齐;另一项构建长上下文 RAG 基准的研究发现,现有幻觉检测器距离性能上限仍有明显空间。换句话说,检索到了材料,并不等于最后生成的每一句话都得到了材料支持。

所以,“有搜索”和“可信”中间仍然隔着一层东西——证据。

模型不忠实于证据是一层问题;更麻烦的是,证据本身也正在变得越来越难选。这个问题还因为 GEO 变得更复杂,过去 SEO 优化的对象是搜索排名。GEO 出现以后,内容生产者开始研究怎样让自己的页面更容易被 ChatGPT、Gemini、Perplexity 等生成式搜索选择、引用和写进最后答案。

7月15日,一篇汇总2023年至2026年45项 GEO 研究的预印本综述进一步收紧了结论。作者认为,目前能够较稳定证明的是,当一个页面已经进入检索上下文以后,对内容进行调整可能改变它被引用或者采用的概率;但尚没有哪套方法证明自己可以长期、跨平台稳定控制自然曝光。不同引擎之间还存在来源重合度低、相同问题反复运行时结果波动等情况。

换句话说,未来办公 Agent 要面对的互联网,不只是信息越来越多,越来越多的信息,还在主动研究怎样被 Agent 看见。

这会让一个过去很“旧”的互联网能力重新变得重要,即哪些网站可信,哪一条是原始信源,哪些内容只是转载,哪一个数字更新得更晚,两条来源冲突时应该信谁。搜索引擎过去二十多年一直在解决其中一部分问题,这也是百度进入这场竞争时真正特殊的地方。

3月发布搭子时,百度就把自己的搜索能力直接做成了内置 Skill。4 月 27 日,百度千帆又将百度搜索、百度百科、深度研究、智能PPT生成等能力封装成标准 Skills,允许 Agent 调用。其中百度搜索负责实时网页与资讯检索,百度百科提供结构化百科信息。百度文库又补上了另一类信息,其专业文档资源搭配网盘之后,百度可以同时覆盖公开网页、专业材料和用户自己的私人文件。

当然,百度也不是从零开始铺设这条证据链,此前在搜索侧已经把多源比对、信源身份核验、“先筛后用”和多源交叉验证做进信息筛选流程,千帆的深度研究 Agent 也可以直接调用搜索组件识别权威信源;百科也有多轮审核和结构化知识体系,可以为 Agent 提供另一层经过筛选的知识底座。

不过,做过二十年搜索,不代表今天的 Agent 天然可信。百度搜索同样处在一个GEO、营销内容、网页更新和低质信息共同构成的互联网里;百科和文库也有各自的数据边界。更重要的是,前面的 ACL 研究已经证明即使找到了正确材料,模型也可能在最后生成时偏离材料。

所以百度面对的第一道难题,无关于信息,而是能不能证明最终那句话和信息之间是什么关系。

这要求产品向前走一步,比如,一份由搭子生成的行业研究里,一个市场规模数字不应单显示“来源:某媒体”,而可以直接回到原始报告中的具体位置;一个上市公司的毛利率,尽量回到年报而不是财经网站转载;一条监管政策直接连接政府文件,并显示发布日期和当前是否有效。

当两个来源的数据不一致时,Agent 不应静默选择其中一个继续做 PPT,而应该把差异暴露出来。真正有用的证据链,也不是给整篇报告末尾挂十几个链接,其应是让每一个关键判断都能回到支持它的具体证据。

第二道则来自百度自己的资产,搜索、百科、文库、网盘分属不同类型的数据。一份 Agent 报告里,公开网页、百科词条、第三方研究报告和用户自己的公司文件,可信范围并不一样,如果最后全部被模型揉成一段没有区别的自然语言,用户根本感受不到百度多年的数据积累。

这要求搭子把来源类型产品化,哪些是公司内部文件,哪些来自公开互联网;哪些是企业公告,哪些是媒体报道;哪些只有一个来源,哪些已经被多个独立来源确认,都应该能在任务结果中区分,毕竟资产只有被用户看见,才能转化为产品优势。

真正可用的“可信”不会是所有任务一律重验证,而可能像安全权限一样分层:普通创作追求速度,行业研究增加引用,金融、法律和重要决策任务再进入更严格的证据模式。搜索时代,百度解决的是:资料在哪里,Agent 时代,它有机会继续回答一个更迫切的问题:机器为什么相信这份资料,以及人为什么可以相信机器。

03 写在最后

现在判断办公 Agent 的胜负为时尚早,7月,中国 PC 端 AI 办公产品的月活刚刚超过 3000 万。WorkBuddy 超过 1100 万,百度搭子约 670 万,TraeWork 等产品还在后面快速迭代。和传统办公软件的用户规模相比,这更像第一批用户开始选择工具,而不是市场格局已经形成。

但第一阶段已经让不同公司的优势开始显形,腾讯最容易兑现的是关系,百度的优势,则源于搜索、百科、文库、网盘,都不是为 Agent 时代设计的产品。

过去几年,它们甚至常常被视为上一轮互联网留下来的资产,但 Agent 开始真正干活以后,问题发生了变化。模型生成文字已经足够便宜,检索信息也越来越容易。真正没有同步消失的,是最后那一步:有人必须判断结果究竟对不对。

百度因此有机会把一项旧能力重新做一遍,只是这一次,它不能停留在“我能搜到更多东西”,它需要把搜索排序变成信源选择,把百科和文库变成不同等级的证据,把网盘里的私人上下文和互联网材料区分开,再把所有证据明确连接回 Agent 最终交出来的每一个重要判断。

如果这件事最终成为专业办公真正愿意付钱的能力,那么搜索时代给百度留下来的最重要东西,可能不再只是一个流量入口,还有二十多年来一直被藏在搜索框后面的那项能力——决定一个答案,究竟应该从哪里来。

上一篇:在天津,他们为节能请了位“AI管家”

下一篇:没有了

相关内容

热门资讯

百度“搭子”追WorkBudd... 来源:界面新闻 文|新立场 2026年,硅谷正在把办公从“人操作软件”,改成“人交代任务,Ag...
在天津,他们为节能请了位“AI... (来源:天津日报) 转自:天津日报 一双紧盯节能的“慧眼”、一套优中选优的降耗“算法”、一份降本增效...
中移申请信息管理方法专利,可提... 国家知识产权局信息显示,中移(上海)信息通信科技有限公司、中移智行网络科技有限公司、中国移动通信集团...
为什么一次火箭落地,牵动整个中... (来源:大象新闻) 中国的民营火箭,自己腿儿着回来了! 8月19号早上7点多,一枚叫“朱雀三号”的火...
科技智能如何重塑我们的世界 引言:智能时代的到来 我们此刻所处的位置, 是一个在过往历史进程中从未有过的节点。科技智能, 特别是...
中国首次实现火箭陆地回收,马斯... 8月19日,蓝箭航天研制的朱雀三号遥二运载火箭发射升空并成功完成陆地回收。此次任务是继7月10日长征...
中国工信部批复浙江一民企开展卫... 北京8月20日电 中国工信部20日公布,其近日批复浙江时空道宇科技有限公司(以下简称时空道宇)开展卫...
西部首个!移动云(西部)Tok... 8月19日,西部Token创新发展论坛在甘肃庆阳成功举办。中国移动云公司副总经理刘军卫发表题为《中国...
高新区看点(2026年8月20... 高质量发展 无锡高新区:江苏省首个AI自研多模态3D视频大模型总部项目签约 8月19...
“第二现场”沉浸式数字演播项目... 北京8月20日电 (记者 应妮)8月19日晚,“第二现场”沉浸式数字演播项目迎来首场演出。当晚,黄梅...