资讯详情

资讯详情

7 分钟、16 分钟、41 分钟:腾讯阿里字节的办公 Agent,藏着三种时间观

2026 年 8 月 27 日阿里发布了全新 Qoder。有意思的不是发布会本身而是它的定位「以编码能力为核心、面向所有人的智能体工作空间」。一个写代码的 IDE把口号改成了面向所有人。如果你把三家今年的动作排成一排会发现一件挺反常识的事2026 年国内 AI 打得最凶的战场不是大模型不是 Chatbot是每个人的办公桌面。但冲在最前面的三支部队番号全都姓代码。腾讯的WorkBuddy底座是 CodeBuddy——一个 2024 年就存在、差点被砍掉的 AI 编程工具。阿里的千问办公前身 QoderWork出自 Qoder而 Qoder 的前身是通义灵码一个 IDE 插件。字节的TRAE Work是 TRAE SOLO 的直接升级而 Trae 从 2025 年 1 月发布那天起就是一个 AI 原生 IDE。三家最像未来办公室的产品没有一个是办公软件长出来的。这就奇了。做文档的有 WPS做协同的有飞书和钉钉做表格的更是一大把。按常理办公 Agent 该从这些地方长出来才对。结果是写代码的赢了。一、母舰为什么写代码的最先跑通写代码这件事可能是训练 Agent 最理想的靶场。理由有四个一个比一个硬。第一代码世界有最诚实的结果反馈。你写的这段逻辑对不对编译器说了算测试说了算。跑得通就是跑得通跑不通就是跑不通不存在大概齐。而办公任务最大的麻烦恰恰在这里——一份周报写得好不好没有编译器给你判分。一个能在有明确对错的环境里练出来的系统迁移到模糊环境时至少知道什么叫检查。第二任务拆解是写代码的基本功。任何一个像样的编程任务天然要被拆成读代码、改几处、跑测试、看报错、再改。这个规划—执行—验证—修正的循环是 Coding Agent 每天跑几百遍的肌肉记忆。而写一份行业分析报告本质上也是同一件事找资料、搭框架、填内容、核对事实、改排版。第三工具调用最早在编程场景跑通闭环。MCP、命令行、文件系统、沙箱——这些让 Agent 真正能动手的基建全是在开发者工具里先成熟的。没有这层Agent 只能陪你聊天。第四长程执行的工程难题最先在这里被逼出来。上下文管理、跨会话记忆、权限控制、出错回滚。一个跑三小时的任务怎么不跑偏这是写代码的人最先撞上的墙也是他们最先修好的路。腾讯今年 7 月做了一件挺狠的事顺手把这件事给证实了。他们搞了一套 Agent 基准叫 WorkBuddy Bench260 道题全部来自腾讯内部真实的代码提交、合并请求和业务场景然后改写成口语化的角色扮演请求让模型没法靠搜索引擎反查答案。分成代码、网页、办公、安全四个域7 个模型用两套 Harness 各跑一遍。Harness 是模型外面那层执行层负责上下文、工具调用和任务编排。腾讯拿自家 CodeBuddy Code 跟 Anthropic 的 Claude Code 正面对打。结果有点尴尬28 组同模型对比Claude Code 赢了 17 组CodeBuddy 只赢 11 组。代码域更干脆7:0七个模型换成 Claude Code 之后全部涨分。但这份榜单真正的价值不在输赢。它证明了另一件事同一个模型只换一套 Harness成绩能差出十几分。安全域的平均绝对变动是 8.6 个百分点。这个结论的分量很重。它意味着 Agent 的强弱已经不能只看底层模型了——怎么让模型干活比用哪个模型干活更关键。而 Coding Agent恰恰是最早把 Harness 磨利的地方。所以当我们看到三家把写代码的能力平移到办公场景时那不叫跨界那叫降维。他们手里已经有了一套能规划、能执行、能验证、能回滚的工程系统现在只是把操作对象从代码仓库换成了文件夹、表格和浏览器。Coding Agent 是练兵场。办公 Agent 才是主战场。二、牌面三家摆上了什么先摆事实再谈判断。腾讯 WorkBuddy阿里 千问办公字节 TRAE Work上线时间2026.3.92026.8.32026.6.9出身CodeBuddy2024通义灵码 → Qoder → QoderWorkTrae2025.1→ TRAE SOLO产品形态桌面 独立 App桌面 网页 钉钉内置桌面 网页 移动端模型策略混元、DeepSeek、GLM、Kimi、MiniMax 五家可切Qwen3.8 自研为主 基础/高级/前沿三档 开放第三方豆包 2.1 系列偏内部闭环生态锚点企微、微信、腾讯文档、QQ 邮箱、腾讯会议钉钉 2600 万企业组织打通 25 项企业能力飞书文档、多维表格、豆包 2 亿日活个人版定价99 / 199 / 999 元每月免费 / 98 / 198 元每月Lite 45 元起豆包专业版 68 元6 月桌面端月访问量2097 万QoderWork 788 万TRAE IDE国内版1279 万数据来自易观对 2026 年 6 月国内 17 款桌面端 AI 原生办公智能体的统计当月合计月访问量超过 6000 万次。腾讯系把 WorkBuddy、CodeBuddy、QClaw、Marvis 加在一起是 3262 万。这个数字要打个折看访问量不等于付费用户更不等于健康的生意。腾讯自己也没披露 WorkBuddy 的绝对付费人数、续费率和单次任务成本。访问量领先只说明产品被用起来了不说明它已经跑通了。但另一组数字更能说明问题。IDC《2025 年中国 AI 编程市场份额》按营收口径统计Qoder 排第一份额约 47.6%CodeBuddy 约 6.9%排第四。易观口径下 WorkBuddy 在办公桌面端一骑绝尘IDC 口径下 CodeBuddy 在编程市场连前三都进不去。同一家公司同一个技术底座在两个战场上的位置完全颠倒。这件事本身就是这篇文章最好的注脚。还有三个组织动作比产品本身更值得记一笔7 月腾讯把 QClaw 并入 WorkBuddy 部门腾讯文档团队也调整进 CSIG直接把文档编辑、人机双写、资料库这几块补齐。7 月 30 日字节把飞书产品团队并入豆包由赵祺统管。8 月 3 日阿里把 QoderWork、MuleRun、悟空三款产品整合成千问办公隶属 ATH 部门交给钉钉 CEO 陈宇森负责。半年之内三家不约而同从赛马转向收兵。这不是巧合是大家都看明白了这条赛道已经过了试错期到了集中兵力的阶段。三、三条路线三种时间观产品哲学这种东西讲概念没意思看数字最直观。有评测拿同一个任务——生成一份行业周报——分别交给三家跑。WorkBuddy 用了 7 分钟TRAE Work 用了 16 分钟千问办公用了 41 分钟。41 分钟对 7 分钟差了近六倍。这背后是三家公司对什么叫把活干好的三种回答。腾讯 WorkBuddy先完成再优化7 分钟交出来的东西最接近一份可以直接改的工作初稿——结构完整、格式规整你打开就能在上面动笔。这套打法是腾讯被逼出来的。WorkBuddy 上线三个月迭代了 40 多个版本代码基本由 AI 生成人只负责判断、调试和把关。汤道生说以前做产品是先写文档、评审、排期、再开发WorkBuddy 团队是先让 AI 把东西做出来大家围着能跑的原型提意见。用 AI 造 AI这件事本身就把迭代速度拉到了别人跟不上的档位。速度一旦成为肌肉记忆产品哲学就会本能地偏向先给你东西。它的护城河是穿透力。微信、企业微信、QQ 这套 C 端触达加上 B 端执行的组合是全网独一份获客成本极低。腾讯还在推企业微信、腾讯文档、ima、腾讯会议跟 WorkBuddy 打通加上手机远程遥控电脑、内置 140 多个行业顾问和 2.2 万个技能插件——对非技术岗、对混用多套办公软件的人来说门槛低到几乎没有。它的软肋在天花板。混元相对另外两家不算强WorkBuddy 能切五个模型某种程度上是因为自家模型撑不住所有场景。开放反而是优势但代价是复杂推理任务的上限受制于人。更要命的是企业级复杂审批流、私有化部署、大型政企的定制化流程理解腾讯明显弱于阿里。行业顾问多是多但偏通用法务财务这类垂直领域的专业交付力还谈不上。字节 TRAE Work搜得全汇得快16 分钟这条路流程更像一个熟练的助理搜关键词、抓信息、汇总整理、生成报告。信息量大信源偏内容聚合平台强调覆盖而非深度判断。它真正的杀手锏是沉淀。TRAE Work 能把 AI 的产出直接落进飞书文档和多维表格变成团队可以继续协作的工作对象而不是一份需要复制粘贴的死文件。生成的 HTML 可交互产物能形成可点、可筛的可视化看板团队打开就能用。加上中文语境的理解准确率和豆包 2 亿日活的底座字节在信息获取 内容生产这条链上的体验确实丝滑。它的问题在 B 端的纵深。飞书的企业基数远小于企业微信和钉钉很难触达传统行业和下沉市场。字节也缺大型集团的数字化落地经验私有化部署和复杂定制服务能力都不如阿里。更让人担心的是模型策略——倾向内部闭环对外部模型和 API 的开放程度时有争议这在企业客户那里会直接换算成成本和风险。C 端到 B 端的转化字节还在验证。阿里 千问办公宁可慢不能错41 分钟最慢但慢得有道理。它在任务执行里加了更多判断步骤对信息的核验和筛选更审慎看重判断链条而不是信息罗列。7 分钟生成 12 页财报 PPT 是一回事41 分钟交出一份经得起老板追问的报告是另一回事。它押的是组织。深度嵌入钉钉的组织架构能直接调用审批、日程、待办等 25 项企业能力实现从生成到执行的全链路自动化——AI 不只是写份材料而是能把流程走完。加上 Qwen3.8 自研可控、覆盖十余类岗位的专家套件、组织级 Skill 共享有律所把自己的方法论打包成团队资产的实际案例这条路是三家里唯一明确冲着组织提效去的。阿里的教训也在这里。据说钉钉 ONE 曾经 7 日留存不足 10%证明了在 IM 里硬塞一个AI 员工是行不通的。千问办公这次独立出来公测就是换了个思路独立品牌建认知钉钉入口承关系。它的短板是起步太晚。C 端渗透率低产品逻辑整体偏 B 端管理个人用户上手门槛明显更高轻量化体验不如另外两家。跨生态兼容性也弱非钉钉企业的迁移成本不低。前期的多线作战让品牌认知一度模糊——QoderWork、悟空、MuleRun 三个名字整合后能不能真正捏合还需要时间验证。一句话总结快的赌够用慢的赌可信。这不是能力差距是时间偏好。你下午三点要开会两点五十才想起来要材料——7 分钟那个救命。你要给董事会交一份行业判断41 分钟那个才敢署名。四、真正的分水岭在哪热闹看完了说三个我认为会决定终局的东西。第一胜负手从模型转向 Harness。WorkBuddy Bench 那个结论值得再强调一遍同一个模型换套框架成绩差十几分。这意味着基础模型的能力会越来越普惠靠模型拉开差距的窗口正在关闭。真正能形成差异化的是怎么把模型能力和行业知识、专业方法论、企业流程结合起来。三家里阿里在这一层的积累最扎实——Gartner 2026 年企业级 AI Coding Agents 魔力象限Qoder 是唯一进入挑战者象限的中国公司。腾讯则在补WorkBuddy Bench 本身就是在给自己造尺子。第二付费逻辑从卖功能转向卖结果。AI 办公的好处是用户真的愿意掏钱这在 To B 里是稀缺的。但定价锚点还没定下来。现在是按席位收腾讯 99/199/999 三档订阅字节 68 元起按调用深度分层阿里订阅加私有化两条线企业版普遍锚在 198 元每席每月。但艾媒的数据很说明问题59.1% 的企业愿意付费其中 51.5% 的预算只有每月 300 到 599 元。也就是说大部分企业愿意为 AI 办公付的钱撑死两个席位。按人头算账从一开始就不符合这个场景的经济学。Agent 替代的是任务不是人。未来的定价大概率会锚在任务交付的质量上——一份能直接用的报告值多少钱而不是一个坐在这里的人值多少钱。谁先把这个账算清楚谁先跑出正向循环。第三从个人工具长到组织能力。个人办公 Agent 的能力正在快速趋同。PPT、表格、周报三家都能做做得还都不差。真正拉开差距的会是三件苦活真实业务数据的打通、权限与审计体系、行业 Know-how 的封装。这三件全是 B 端的脏活累活也全是需要时间和客户陪跑才能攒出来的东西。腾讯有 C 端流量字节有体验口碑阿里有企业服务的方法论和组织关系——三条路上的护城河挖到深处形状完全不同。政企和央国企市场是客单价最高、迁移成本也最高的赛道。信创适配、合规、服务能力这些门槛字节目前够不着腾讯够得着一部分阿里最熟。五、所以到底该选哪个没有完美选手只有场景适配。尾声过去十年办公软件竞争的核心变量是协作。现在这个坐标系正在塌缩。传统办公软件的原子单位是文件——你创建一个文档编辑它发出去。AI 办公的原子单位正在变成任务——你说一句需求Agent 拆开、执行、交付文件只是它沿途留下的痕迹。这次单位换算才是三家真正在争的东西。腾讯占了先发和入口字节占了体验和流量阿里占了组织和纵深。三条路都还不算稳也都还没到摊牌的时候。但有一件事已经很清楚了这场仗的胜负不会在发布会现场决定也不会在模型跑分榜上决定。它会在某个普通工作日的下午决定——当你对着电脑说帮我整理一下这季度的材料的时候你下意识点开的是哪一个图标。BAT 的新三国战场不在云端。在你桌面上。资料展示下面是我整理的AI大模型 学习资料和工具包 预览适合收藏后按主题逐步学习
觉得有用,分享给同行:

为您的企业打造数字门面

稳重轻奢商务风格,端正雅致视觉,长效耐看不易过时。

立即咨询 →