华尔街实测8款全球主流Agent:千问办公综合排名第一,超Claude Cowork、Codex
8月19日消息,华尔合排华尔街投行杰富瑞分析师近日对八款全球主流AI Agent 进行了真实办公任务实测,街实结果显示,测款超通过模型和Harness的全球t千协同,阿里千问办公综合得分排名第一,主流超过美国的问办Claude Cowork和Codex等Agent工具。
此次测试共设置5项真实办公任务,公综包括基于多份文件完成公司年报摘要、名第联网查找并比较公司经营数据、华尔合排操作真实桌面浏览器完成信息检索和文档生成、街实根据数据制作英文PPT,测款超以及基于参考图片生成营销海报。全球t千测试结果显示,主流千问办公整体表现较为均衡,问办尤其在复杂办公任务、公综网页浏览器控制以及多模态内容生成等场景中表现突出,是唯一一个在所有测评维度中均获得90分以上的Agent产品。
报告进一步将Agent能力拆分为模型与Harness两部分进行分析。所谓Harness,是围绕模型运行的一整套工程机制,包括指令、上下文、工具调用、边界控制、反馈纠错和治理等。按照杰富瑞的测算,千问办公的“隐含Harness分”位居此次测试产品首位,高于Claude Cowork和Codex等七款国内外主流Agent产品。这也意味着,在底层模型之外,如何通过工程和产品能力将模型智能稳定转化为实际任务结果,正在成为Agent竞争的重要维度。
除任务表现外,成本也正成为Agent商业化需要考虑的重要因素。报告显示,千问办公底层Qwen 3.8 Max的API价格明显低于部分海外头部模型。由于Agent通常需要进行多轮推理、持续调用工具和执行长链路任务,企业未来衡量Agent价值时,除了模型和产品能力,也可能进一步关注“Cost per Task”,即完成一项真实任务所需的执行成本。阿里Qwen模型和千问办公Agent的组合体现出较好的性能与成本优势。
过去几个月,Agent的竞争正在从个人办公转向企业级场景。报告认为,对于企业级Agent而言,工作流和生态协同是核心竞争壁垒。随着Agent持续连接企业数据、业务系统、协作工具和权限体系,用户的历史任务、工作习惯、连接器、Skills和自动化流程会逐渐沉淀在产品中,形成更高的使用粘性和迁移成本。
据介绍,“千问办公”不仅可以帮助个人提效,为企业的AI需求设计,也是“千问办公”的鲜明特色。目前“千问办公”已初步打通钉钉IM工具,企业员工通过“千问办公”,即可完成群聊总结、文档表格创建、消息邮件收发等操作。未来,企业客户还可以将“千问办公”接入到真实繁杂的工作流中,全面连接企业真实的数据库和工作流,帮助企业提升办公与组织效率。
相关文章
台湾东部海域突然发生7.3级大地震。据中国地震台网测定,地震发生时间为2024年4月3日7时58分,地点在台湾花莲县海域,震源深度12千米。地震发生瞬间,台湾知名媒体人黎建南目睹高速行驶的摩托车在眼前2026-10-06
天下晨間新聞 iPhone新機上市,但消費欲望正低迷|天下雜誌
疫情蔓延時,蘋果推出第二代iPhone SE。而就在同一天,美國公佈三月零售業報告,訊息很明顯:除了食物等生活必需品,消費者沒想買東西了。2026-10-06
11月28日,华为MateBook Fold 非凡大师 瑞红与华为MateBook Pro 拂晓粉两款鸿蒙电脑新配色正式开售,不仅带来了更具个性表达的设计语言,还支持升级至HarmonyOS 6,鸿蒙2026-10-06
最近,由沈月主演的《流星花园》开播,引起了网友的讨论!大S版的杉菜 内田有纪 井上真央 具惠善 郑爽 沈月版的杉菜你看过几个呢?最喜欢哪个?本文来源:【ChuLuo】版权归原作者所有2026-10-06
召唤系统首次实装!《碧蓝幻想:Relink 无尽黄昏》4月24日公开测试
Cygames及其大阪开发工作室宣布,《碧蓝幻想:Relink 无尽黄昏》将于4月24日至27日举行公开测试。本次测试将首次让玩家体验全新的召唤机制,覆盖PS5、Switch2、PS4及PC(Stea2026-10-06
托马斯32分独木难支 格里芬26+8快船胜凯尔特人发布时间:2019-10-12 10:21 来源:豫都网 我要投稿[摘要]数据 投篮点 实录 北京时间3月7日,在今天进行的NBA常规赛中,洛杉矶快船2026-10-06

最新评论