ARTICLE SIGNAL
反常识真相:AI Agent在真实工作场景为何频频翻车?
AI,AI资讯,大模型,人工智能,AGI,LLM。揭秘反常识真相:尽管AI在编程等标准测试中表现优异,但在电商、生活等真实工作场景中,AI Agent的成功率依然极低。本文深入解读大模型在复杂任务中的真实表现。
type
status
date
slug
summary
tags
category
icon
password
网址
上周一,我发了自己做的AIHOT大模型排行榜。
有很多朋友感兴趣,在文章下面评论,最高赞的一条,是在问能不能有个分类测评,能够评估不同模型做不同任务的表现。
讲道理,这其实一直是我想做的,也是我觉得特别特别核心的痛点。
现在的大模型榜单很多,比如LiveBench、DeepSWE之类的,可以很快知道哪个模型在某一个能力维度上更强,像Coding、数学、浏览器操作等等。
但是有一类评测集,其实是最稀缺的。
就是模型在真实工作中的实际完成效果。
比如金融领域、法律领域、电商领域、生活领域等等等等,就是直接给它一份真实工作,让它自己从头干到尾,最终看工作效果,而这些,我觉得其实才更符合真实用户的日常工作和生活,也对大家更有用。
所以,在分类上,我一直想把这些场景给补上,把这个排行榜的维度,变得更加丰富和多维化。
于是,这个周末,我几乎把所有的评测集都翻了一遍,不翻不知道,一翻才吓一跳,这块的评测集,真的少的太可怜的,真的可以用寥寥无几来形容。
而且绝大多数的模型的跑分,在这些真实场景下任务的成功率,也是真的低的可怜,跟大家在Coding领域的体感完全不一样。
我用一个周末我翻到的比较成熟的电商评测的评测集来举例子,正好也是上周开源的,比较新,一些最新的模型也都有。
这个评测集叫RealReplicaBench,团队来自阿里国际站,因为他们就是做外贸的,所以内部的数据我觉得还是比较权威的,从这个案例,也可以看看Agent在真实的电商场景下能完成什么样子。
Github地址:https://github.com/Accio-org/RealReplicaBench
这套评测一共有107个任务,阿里国际站因为直接做了Accio Work这个电商Agent,然后他们就从大概过去160万条完整对话中整理出20万条工作流,再归纳出约2000条商业价值高的,最后按照可复现性和结果可判定性,最终整理出来107个任务。
基本把电商领域涉及到的工作场景都覆盖了,像供应商采购、商品发布、店铺经营、订单对账、国际物流、售后争议等等等等。
任务具体内容的分布我让GPT做了张图,方便大家更直观的看一下。
每一个,都是真实世界里面的电商任务。
简单看几个例子的案例,大家就知道大概都是什么样的任务了。
比如,有一个任务是让模型在店铺上上线一款定制瑜伽垫。
模型拿到的信息有发品计划、三家供应商的报价和一堆实拍图片。
然后呢,它要找出计划指定的供应商,填好类目、销售国家、差异定价和描述,再从一堆相机自动编号的照片里挑出正确、清晰的商品图上传。
还有一个,是给东莞到达拉斯的消费级电子产品规划运输路线。
在30天的运输时间的限制下,模型需要计算保险、清关、海关担保和平台费,找出总成本最低的路线,再在仿真的货代平台里完成海运段订舱和货件验证。
还有处理电商退货争议。
这个任务里面模型需要把订单记录、物流扫描、仓库质检、客户对话、现场照片、平台政策和截止时间全对起来,然后逐单决定接受退货、部分退款、全额退款、向平台申诉,还是继续补充证据。
甚至还有跨平台月度对账。
它要把天猫、京东、拼多多三套格式不同的原始订单清洗到一张表里,统一SKU和订单状态,核对发货与结算差异,再算出每个SKU在各个平台的收入、成本、佣金和利润,最后把这些信息按照指定格式进行交付。
从这几个例子就能看到,这基本都是现实世界的电商交易的真实任务,商品上架、物流规划,到售后和经营分析,基本全都有,而且讲道理,这些任务看着就是脏活累活,理论上都应该交给Agent干对吧。
然后呢,我们来看看,现在在Coding上感觉已经大杀四方,感觉什么都能干出来的这些牛逼模型,在这个真实任务场景上的成功率有多少。
这些模型,是在PI这个开源Harness框架下跑的,所以准确性我觉得没啥问题。
百分制下,只有排名第一的Claude Opus 5刚刚过了及格线。
107个任务,它完成了65个,通过率60.75%。
Qwen 3.8 Max和DeepSeek V4 Pro以49.53%的通过率并列第三。
也就是说,现在大部分模型的任务通过率甚至连50%都过不去,107个任务,你让AI去做,有一半是全失败的。
这就是现在的模型,在真实世界工作中,非常真实的现状。
我也详细看了看他们是怎么去衡量模型到底完没完成,以及给不给分的,看完以后,我感觉比我想象的还要复杂一些。
我随机挑一道供应商采购题,来给大家看看评测过程。
比如这个题,任务的主角Dana是一名采购经理。
她离开几天后回来,邮箱里已经堆了大约300封邮件。
但是呢,她有一个铝合金笔记本支架项目,必须在当天完成推进。
模型需要从这些邮件里还原项目相关的需求、最新的规格和数量,从20家供应商里找出真正合格、单件落地成本最低的一家。
选好供应商以后,它还需要进行一系列的规范化操作,比如只给最终选中的那封报价打标签,标出3封要求更换收款账户的可疑邮件,保存给供应商的回复草稿,创建启动会议,并交付一份规定格式的JSON总结。
这个任务量你想一想都知道有多大,而且这些任务的原始数据也非常乱,充分体现了现在人类的混乱性。
比如项目的最终需求零零碎碎的散在10封邮件里面,中途还改过数量,改过要求,改的乱七八糟的。
而且供应商也不是只看公司名,因为现实世界中,也经常会有同一家供应商会换着联系人、邮箱、域名和显示名称来发报价,所以题目中,同时还混进了4组名字很像、实际却是不同公司的供应商。
模型得综合工厂地址、电话、银行收款人和出口许可证等多个信号交叉核对,才能判断哪些报价来自同一家。
说实话,这个过程,看得我都要力竭了,至少我是一丁点都不想干的状态。。。
所以我也生了个页面,方便看得更清晰。
Accio Work团队那边,也给模型准备好了Shopify、Gmail、日历、商品发布之类的工具,可以让模型直接用。
等模型做完,评测程序会直接检查邮箱、草稿、日历和JSON文件的最终状态。
一共有23组、42项结果检查。
像选中的报价有没有加上正确的标签?3封钓鱼邮件有没有全部标记?草稿收件地址和会议日期对不对?JSON里的供应商、价格、数量和淘汰原因能不能全部对上?
而模型的得分,要这23组全部通过,才算答对,才能得到这1分,一旦有1个检验出来错误就0分,非常严格。
也就是说,没有过程分这个东西,你只有所有检测项全对才有分,因为模型去解决真实的电商问题的时候,这差一步,可能就会让你丢了单子,这才是真实的商业世界。
最后的得分就按通过的任务数除以总任务数量107。
于是,最终就是上文看到的排行榜,几乎没有及格的。
而如果用他们自己的Agent产品Accio的框架跑,通过率会整体高一些,模型通过率50%以上的,从2个增加到了6个,毕竟是专门做电商的框架。而因为是评测集,同时因为也是全自动化,平时大量的任务,其实是人和Agent协同,所以完成率也会实际更高一些。
而如果我们对比一下Coding任务上的跑分,大家就能看出来差距了,我们拿今年5月底发布的DeepSWE举例。
这个评测基准包含了113个任务,考的是AI能不能在真实的开源代码仓库里,独立完成一次复杂、跨文件的软件工程改动。
所有模型都用mini-swe-agent框架跑,模型自己去阅读代码仓库、查找问题、修改文件、运行测试,最后提交结果。
排在最前面的这几个模型,任务通过率都能到70%以上。
类似的低分情况,也出现在了其他领域的真实任务评测集里。
比如上个月底,腾讯混元联合清华大学和东南大学发布的这个E-Bench。
它模拟了3个产品场景,分别是王者荣耀、QQ音乐和腾讯会议。
一共设置了323个需要模型真实去操作的任务。比如王者荣耀要整理好友、战队、房间和比赛记录,QQ音乐要搜索歌曲、管理收藏歌单,腾讯会议要筛选参会人员、预定会议等。
E-Bench一共测了11个模型。
成绩最好的是Kimi-K3,Avg@3是73.79%。这里简单解释一下Avg@3这个指标,它指的是模型在任务集上独立运行3次,3次得分的平均值。
但现实中,我们肯定希望模型不只是做对一次,而是能反复多次完成任务。
所以他们还测试了同一道题独立运行3次的情况。
表现最好的K33次全部做对只有58.82%。
而11个模型在这个稳定性指标上都没过60%。。。
还有比如小红书今年先后也发布了两套模型在真实任务上的评测。
比如这个偏生活的VibeLifeBench。
这个评测包含200个持续时间数周的生活任务,覆盖了职业、健身、租房、购物和差旅等10个领域。
同样还是给大家看看各个模型在榜单上的得分。
榜单上成绩最好的是Claude Opus 5,它的avg@3也依然只有32.5%。
就真的更有点惨不忍睹了。。。
这3套评测基准的任务、指标等等都不一样,所以不能横向比较,但至少能说明,在它们覆盖领域的真实世界任务上,大模型的表现,确实还有极大进步的空间。
所以这个时候,纯靠模型公司我觉得也不行了,需要所有产商一起努力,就像Accio也说,会持续提炼真实的工作任务,然后把这些评测集数据滚动更新然后开放。毕竟这些厂子最重要的目标,是做Agent,是做模型路由,只有模型牛逼了,他们才能实现给自己客户的价值最大化。
不过比较可惜的是,就是这些评测集更偏向于研究,更新的不够及时,一些新模型出来可能要很久以后才会更新,所以还没有办法放到AIHOT的排行榜里面。
不过我未来可能会把类似于阿里国际站的RealReplicaBench、腾讯的E-Bench、小红书的VibeLifeBench等等的真实世界工作的评测集全都收集起来,然后我自己搭环境,我自己花钱来跑,一发新模型就全部跑一遍,保持更新,再把这些评分放到AIHOT上,方便大家查看,大家可以期待一下~
大家如果有类似真实世界工作任务的评测集,也欢迎评论区留言跟我提供。
最后,我想说。
在AI的世界里,会解题,和会工作,中间确实还隔着一些比较遥远的距离。
模型在Coding这个任务上,现在确实做的很好,跑的很快,但是在大量真实工作任务的场景中,还有很大的进步空间。
毕竟,那些琐碎、混乱、没有标准答案的东西,才组成了我们每天真正面对的工作。
因为,这才是真正的。
人类世界。
文章来自于"数字生命卡兹克",作者 "卡兹克、tashi"。
Loading...