最近在柒幻 AI 导航站里淘工具,本来只是想找一款能顺手处理 Excel 的小助手,结果翻到 QwenWork 这个办公 Agent 的时候,我停了一下。倒不是因为它产品上新,而是因为它被放在导航站"效率办公"分类的第一屏,简介里写着"一站式办公 Agent,支持文档问答、表格分析、会议纪要、日程管理",下面的用户点评里有人赞它"长文档检索比想象中稳",也有人骂"表格公式偶尔犯抽"。这两种声音同时出现,反而让我来了兴趣。作为一个既给团队做 AI 工具选型、也自己天天用 AI 处理杂事的人,我决定把它和现在主流的几款办公 Agent 拉到同一批任务里跑一遍,看看所谓"能力差异"到底差在哪,哪些是真差距,哪些只是宣传话术。
1. 柒幻导航站里的意外收获:QwenWork 是怎么被我翻出来的
1.1 导航站的价值不在"链接多",而在"筛选密度"
先说一个很多人忽略的事实:AI 工具现在多到根本刷不完,但你真正缺的不是链接,而是有人帮你把"值得试的"和"凑数的"分开。柒幻这类导航站的价值就在这里——它每个分类下都有编辑筛选、更新时间和用户反馈,比搜索引擎直接给结果要省力得多。我自己的习惯是每周花二十分钟刷一遍导航站的更新列表,重点看"效率办公"和"Agent"两个分类,因为这两个方向的产品迭代最快,今天还能用的方案,下周可能就有更优解。
这次发现 QwenWork 就是这么来的。它在导航站里的标签是"办公 Agent + 通义系产品",分类归属明确,点进去能看到产品定位、支持平台和收费模式。我顺手看了下它旁边的同类目产品,发现这个位置竞争很激烈,能排在第一屏的,要么是背靠大厂有稳定算力,要么是某个垂直场景做得特别深。这个筛选逻辑我比较认可,也直接决定了后面的评测样本怎么选。
1.2 QwenWork 的初印象:定位、门槛与上手成本
说实话,刚点进去时我对 QwenWork 的预期并不高,因为"办公 Agent"这个概念被太多产品玩坏了,有的只是套了个对话壳子的文档问答工具,有的连表格都解析不好。试用下来,我对它的初步判断是:它属于"整合型办公 Agent",核心思路是把文档、表格、邮件、日程这些办公高频动作收进一个对话工作台里,而不是像某些产品那样只做一个单点功能。
上手门槛方面,QwenWork 不需要本地部署,网页端登录就能用,对个人用户比较友好。它支持直接上传 PDF、Word、Excel、PPT,也支持从链接导入内容。我特别关注的是它对中文长文本的处理,因为很多海外产品在中文场景下表现会打折扣,而 QwenWork 作为通义系产品,理论上在这方面有先天优势。这个点在后面测试里也确实反映出来了,但结果和我想象的不太一样——优势没那么绝对,短板倒是很典型。
1.3 为什么我想拿它和主流办公 Agent 对比
选型最怕的是"只看单一产品"而产生的幸存者偏差。你说 QwenWork 好用,那到底是它真的好,还是因为你没试过更好的?反过来也一样,你说 ChatGPT 强,但它在中文办公场景里可能连个小表格都搞不定。所以我决定做一次横向对比,把 QwenWork、ChatGPT、Claude、扣子 Coze 这四类主流的办公 Agent 放在同一批任务里跑,统一输入、统一评判标准。
这里先说清楚:我对比的不是"谁的大模型聪明",而是"谁更适合办公场景落地"。大模型聪明是基础,但办公 Agent 的价值在于把聪明转化成可交付的结果——文档结论、处理好的表格、排好的日程、能直接用的周报。这之间的转化效率,才是能力差异的真相。
2. 评测设计:我用 5 个真实办公任务代替"跑分"
2.1 参测选手:QwenWork、ChatGPT、Claude、扣子
为了让对比有参考意义,我选了四款定位和用户群体差异明显的办公 Agent。先列个表格,说明它们的背景、产品形态和这次测试用的版本。
| 参测产品 | 产品背景 | 办公形态 | 本次测试版本 |
|---|---|---|---|
| QwenWork | 通义系办公 Agent | 对话工作台,整合文档/表格/会议/日程 | 网页版最新版 |
| ChatGPT | OpenAI 旗下,通用对话 + 自定义 GPT | 对话 + 插件 + 部分任务编排 | 网页版付费档 |
| Claude | Anthropic 旗下,主打长上下文与推理 | 对话 + Computer Use 实验能力 | 网页版最新版 |
| 扣子 Coze | 字节系 Agent 搭建平台 | 可视化 Agent 工作流编排 | 网页版免费版 |
选这四款的理由:QwenWork 代表"大厂垂直办公整合"路线,ChatGPT 代表"通用对话 + 生态扩展"路线,Claude 代表"长文本推理优先"路线,扣子代表"用户自定义工作流"路线。这四种路线基本覆盖了当前办公 Agent 的主流玩法。
2.2 五项评测任务与打分口径
我设计了五个任务,覆盖办公场景的高频动作。每个任务都用一个真实场景来考察,而不是抽象地问"你能做什么"。
| 任务编号 | 评测任务 | 考察点 | 满分标准 |
|---|---|---|---|
| T1 | 长文档理解 | 从一份约 80 页的行业研报中抽取核心结论、数据、风险点并整理成结构化摘要 | 结论准确、数据无误、结构可复用 |
| T2 | 表格数据处理 | 给一份含脏数据的 Excel(合并单元格、空行、单位混乱),要求完成数据清洗并按类别汇总 | 清洗规则合理、汇总结果正确 |
| T3 | 公式生成 | 给定一个跨表数据场景,要求生成可执行的 Excel 公式或脚本 | 公式语法正确、逻辑与需求一致 |
| T4 | 多步任务编排 | 要求"根据拜访记录生成周报,并提取未完成事项" | 能自动拆解并连续执行多个步骤 |
| T5 | 对话记忆与管理 | 连续对话中修改需求,确认产品能否记住前文约束并保持输出一致 | 关键约束不丢失、输出风格稳定 |
打分口径统一为:完全达标 5 分,部分达标 3 分,不达标 1 分。我会给出每个产品的得分和典型翻车案例,避免只给分数不给证据。
2.3 评测环境的统一控制
横向对比最怕环境不一致导致的误判,所以我做了几个硬性要求:同一份测试文件在每个产品里都上传一次,用完全相同的提问词,每个任务都新建一个会话,避免上下文串味。为了保证公平,我没有使用任何产品的"自定义指令"功能,全部采用默认设置。
另外我要强调一点:这次测试的样本量不大,每个任务我只测了 3 到 5 轮,结论反映的是"这批产品在典型场景下的常见表现",不是严格的统计学结论。但即便如此,测试中暴露出的差异已经足够说明问题了——如果一个差异在多次尝试中反复出现,那它大概率是产品设计层面的,而非偶然波动。
3. 文档和表格场景实测:差距最大的两个"硬骨头"
3.1 长文档理解:从 80 页研报里抽关键结论
长文档理解是我最看重的办公能力,因为日常工作中太多信息藏在长文本里——研报、合同、招股书、技术文档。这次测试的文件是一份中文行业研报,约 80 页,包含行业趋势、市场规模、竞争格局、风险提示几个部分。我要求每个 Agent"提取前三大市场趋势,对应数据来源,并总结风险提示"。
结果很有意思。QwenWork 在中文长文本上的表现确实不错,它能够快速定位到研报的核心章节,给出有数据支撑的结论,结构化的输出格式也很清晰。Claude 的长上下文能力在纯文本理解上有优势,但面对中文学术化表述时偶尔会有过度概括的问题。ChatGPT 在同样的任务上也能完成,但输出偏向模板化,有时会把研报里的次要信息当重点。
最让我意外的是风险提示部分。QwenWork 能把研报里散落在不同章节的风险描述汇总到一起,这是其他三款产品没有做到的。我查了下,这应该跟它对文档结构的解析能力有关——它不是简单地把全文塞进上下文,而是对文档做了分块和索引。这种处理方式在长文档场景里更稳,代价是它对文档中极细节的信息(比如某个表格角落的备注)可能抓取不到。
3.2 表格数据处理:数据清洗与汇总实测
表格处理是办公场景的另一个高频刚需,也是这次测试中差异最大的环节。我构造了一份典型的"脏数据"表格:包含合并单元格、空行、数值格式不统一(有文本数字、有千分位、有百分比)、分类名称写法不一致("销售额"和"销售金额"混用)。要求是完成清洗并按季度汇总。
QwenWork 在这项任务上的表现中规中矩,它能识别出主要的脏数据问题,清洗思路正确,但在处理"分类名称归一化"时不够彻底——有一处"销售金额"没有被合并到"销售额"分类里。Claude 对表格结构的理解更细腻,它能把合并单元格的逻辑关系读出来,清洗方案直接可复用。ChatGPT 面对复杂表格时稳定性稍差,有一轮甚至漏掉了两个空行导致汇总数据整体错位。扣子则因为需要用户先配置工作流,在这个单次任务上反而显得笨重。
这里有个关键观察:表格处理的成败往往不取决于模型"读得懂不懂",而取决于产品"有没有把表格解析成模型友好结构"。同样是 Excel 文件,有的产品会先转成结构化数据再交给模型,有的直接把二进制或乱序文本丢进去,效果自然天差地别。
3.3 结果汇总:谁在文档场景更稳
为了直观展示,我把两项任务的得分整理成表格。
| 任务 | QwenWork | ChatGPT | Claude | 扣子 |
|---|---|---|---|---|
| T1 长文档理解 | 5 | 3 | 4 | 2 |
| T2 表格数据处理 | 3 | 3 | 5 | 3 |
| T3 公式生成 | 3 | 4 | 4 | 2 |
从这个结果可以得出两个结论。第一,没有全能选手:长文档场景 QwenWork 占优,复杂表格场景 Claude 占优,通用对话 ChatGPT 更均衡。第二,办公 Agent 的真实差距不在"能不能干",而在"稳定不稳定"——一个任务跑五次,五次都对,才是真正能用的产品。基于这个标准,QwenWork 在长文档上做到了,在表格上还有明显进步空间。
4. 日程、邮件与多步执行:办公 Agent 的"含金量"在工具调用
4.1 多步任务编排:从"给方案"到"干完活"
单轮对话能力只是基础,办公 Agent 真正的分水岭是"多步任务执行"。我设计了一个典型任务:给一段客户拜访记录,要求"整理成周报,按客户重要程度排序,提取下周待办事项并写入表格"。
这个任务看起来简单,实际包含四步:解析拜访记录、分类汇总、生成周报、提取待办并格式化。QwenWork 的表现让我有点惊喜,它能把四步串起来执行,中间不需要我二次干预,最后输出的周报结构完整,待办事项也准确地按优先级排好了。这背后依赖的是它对任务流程的拆解能力——它会把大任务拆成子步骤,然后逐步完成,而不是试图一步到位。
ChatGPT 在这个任务上也能完成,但它的多步执行更多依赖外部插件的配合,如果插件没装全,链路就会断。Claude 更擅长"告诉我怎么做",而不是"我直接帮你做完",在多步执行上偏保守。扣子在这项任务上因为支持可视化流程编排,理论上最强,但实际使用中发现它更适合"预设场景的重复执行",遇到一次性的灵活任务时,配置成本反而高。
4.2 工具调用的边界与权限设计
多步执行的背后是工具调用能力。办公 Agent 要真正"干活",必须能调用搜索、日历、邮件、网盘、表格等外部工具。这次对比中,我发现工具调用的边界设计直接决定了产品的可用性。
QwenWork 将工具调用整合进了工作台,文档上传、表格处理、日程查看都在同一界面上,用户感知不到"工具切换"的过程,体验比较顺滑。但它目前的外部系统接入深度有限,比如日历只能读不能写,邮件能生成草稿但不能直接发送。ChatGPT 的工具生态最丰富,但需要用户自己挑选和配置,对小白用户有门槛。Claude 的工具调用更克制,它宁可保守也不越界,这在企业场景里是优点,但在效率场景里反而是短板。
权限设计上,各家思路也不同。QwenWork 对文档的读取范围有明确提示,这让我放心不少。ChatGPT 的工具权限依赖用户授权,灵活但容易误操作。我的建议是:如果你是个人使用,选授权灵活的;如果是企业环境,选权限边界清晰的。
4.3 对话记忆与上下文管理差异
办公场景中,对话往往不是一次性问答,而是"今天聊了一版需求,明天要继续迭代"。这种情况下,Agent 的记忆能力直接决定工作连续性。我做了个测试:在前一轮对话中确定了周报的格式模板,然后新开话题问别的,再绕回来要求按照之前的模板生成周报。
QwenWork 的会话内记忆表现稳定,同一会话内它能记住前文的格式约束。但跨会话记忆我就没有测到明显效果——它不会自动记住你上次用过的模板。ChatGPT 的自定义指令功能可以一定程度弥补这个问题,但需要用户主动配置。Claude 的记忆策略比较谨慎,它更依赖当前对话的上下文,不太会主动"回忆"。扣子则把记忆做成了可配置的知识库,适合有固定规范的团队。
我的体会是:现阶段别太指望 Agent 能像人一样记住你的所有偏好,最好的做法是把常用格式、常用术语整理成模板,在上传文件时一并告诉 Agent,而不是指望它自己"记住"。
5. 真实踩坑:一次 Excel 公式生成事故的完整排查链路
5.1 现象:QwenWork 生成了错误的 VLOOKUP
再稳的产品也会翻车,关键是翻车后能不能快速定位原因。我在测试 T3 公式生成时遇到一个典型问题:我给 QwenWork 一份销售明细表,要求它在汇总表中用 VLOOKUP 关联出每个客户的销售额。它生成的公式长这样:
=VLOOKUP(A2, '销售明细表'!A:B, 2, FALSE)表面上没问题,但放到 Excel 里一执行就报错。我反复检查了表名和单元格引用,都没错,后来才发现问题出在明细表里客户列存在重复项——同一个客户有多条销售记录,VLOOKUP 只能返回第一条,导致汇总结果严重偏低。这是 VLOOKUP 的天然缺陷,但 QwenWork 在生成公式时没有提醒我这个前提。
5.2 排查过程:从上下文截断到模型幻觉
这个问题的排查过程值得复盘。第一次报错后,我还原了提问场景:原始文件是一个 2 万行的明细表,QwenWork 在解析时只读取了前几千行。这个叫上下文截断,很多长表格工具都有这个问题。由于模型只看到了部分数据,它无法发现"客户列有重复"这个全局特征,自然也就不会建议用 SUMIF 或数据透视表来代替 VLOOKUP。
进一步排查后,我确认这属于典型的"模型幻觉"变种——不是无中生有地编造信息,而是基于不完整的输入做出了看似合理的推理。这类问题的隐蔽性在于:公式语法完全正确,但逻辑与数据特征不匹配,放到真实数据上才暴露。
我把同样的需求给了其他三款产品。Claude 在公式生成前会先追问"客户列是否唯一",说明它对数据假设更谨慎。ChatGPT 给出了公式的同时附上了一条警告。扣子则因为需要先配置数据源,反而天然规避了这个坑。对比下来,QwenWork 需要在"数据特征感知"上补课。
5.3 修复方案与预防策略
针对这个问题,我总结了一套操作流程,现在分享出来,大家可以照着用。
第一,涉及长表格时,先让 Agent 数据概览。我会先问"这个表有多少行、客户列有没有重复值、有没有空值",确认全局特征后再让它生成公式。第二,让 Agent 给出多种方案。我会要求"分别用 VLOOKUP 和 SUMIFS 各写一个公式,说明适用场景",这样能避免单一方案的盲区。第三,生成公式后主动验证。我会把公式回贴给 Agent,附上实际执行结果,让它二次检查。
=SUMIFS('销售明细表'!B:B, '销售明细表'!A:A, A2)上面这个 SUMIFS 公式就是对 VLOOKUP 的修正,它会把同一客户的所有销售额累加,逻辑上更适合明细表场景。现在我遇到公式类需求时,默认要求 Agent 先解释数据特征,再选择公式类型,把"人肉验证"变成"人和 Agent 协作验证",出错率大幅下降。
6. 选型建议:不同角色的办公 Agent 选择逻辑
6.1 个人知识工作者:按任务类型选
如果你是个人使用,选型逻辑其实很简单:看你最常处理什么内容。我的实测结论是,如果日常工作以中文文档为主,经常要看长报告、写纪要、整理资料,QwenWork 是性价比很高的选择,它的中文长文档理解能力在这次的对照组里排第一。如果你的工作涉及大量表格分析和复杂数据处理,Claude 的表格理解能力更值得依赖。
如果两种场景都存在,我的建议是用主备组合而不是指望一个产品通吃。日常文档处理用 QwenWork,遇到棘手的表格问题再切到 Claude,两个产品互补,比任何单一产品都稳。ChatGPT 更适合作为通用兜底——它的均衡性决定了它什么都能干,什么都到不了顶尖。扣子则适合有固定流程、愿意投入时间搭建工作流的用户,一旦搭好,重复劳动的效率提升非常明显。
6.2 团队与企业管理场景:数据安全优先
团队场景的选型逻辑和个人完全不一样。个人可以为了效率容忍一些数据风险,团队不行。在这次对比中,最让我顾虑的是各产品的数据存储位置和权限管理。企业选办公 Agent,首先应该确认数据和权限边界,再谈能力。
QwenWork 这类国内产品在企业合规性上更省心,数据本地化存储,权限管理清晰,适合对数据出境敏感的单位。Claude 和 ChatGPT 在数据保护政策上有企业版协议,但产品落地在中国的使用体验和合规路径仍需谨慎评估。扣子支持私有化部署方案,对于有技术团队的机构是可选方向,但运维成本不低。我的建议是:第一步先做数据合规评估,第二步做任务场景摸底,第三步才是功能评测。
6.3 我的最终结论与使用组合
跑了这一圈测试,我对办公 Agent 的认知有了明显变化。以前我觉得"模型能力决定一切",现在我更倾向于认为"产品设计决定体验"。同样一个模型底座,有的产品能把它变成顺手的办公工具,有的产品只能让它停留在聊天阶段。QwenWork 让我印象深刻的地方,不是它的模型多强,而是它把文档、表格、日程这些办公场景的集成做得足够细致。
我的最终使用组合是:个人日常文档处理和工作流搭建用 QwenWork 作为主力,因为它的中文文档能力和工作台集成确实顺,复杂表格和公式验证时切到 Claude 做交叉检查,ChatGPT 留着做通用问答和创意发散。这个组合不是拍脑袋定的,是这轮测试里反复验证出来的结果。
最后说一个实操心得:不管选哪款产品,一定要建立自己的验证习惯。每季度把典型任务拿出来重新跑一遍,因为办公 Agent 的迭代速度太快,上季度不好用的产品,这季度可能已经脱胎换骨,反之亦然。工具的差异始终存在,但真正拉开效率差距的,从来都是使用工具的人有没有一套自己的方法和流程。