ARTICLE SIGNAL

斯坦福实验解读:魔改DeepSeek低成本反超Fable 5的秘密

斯坦福大学最新AI实验,DeepSeek V4 Flash,Fable 5,大模型评测,test-time scaling,LLM-as-a-Verifier,AI Agent,人工智能,AI资讯,大模型推理优化,低成本AI,AI门户,AGI发展趋势,探索AI变现与应用落地。

type
status
date
slug
summary
tags
category
icon
password
网址
同样的模型,同样的任务,让它执行五遍,再让他自己挑一遍最稳的,效果能有多大提升?
斯坦福把这套玩法用在了AI身上,DeepSeek V4 Flash在Terminal-Bench 2.1的成绩从79%一路涨到88%,反超了尖子生Fable 5。而且连做五遍加挑选这一通折腾,价格依然比Fable 5便宜了4-11倍。
· · ·
Terminal-Bench 2.1是平时我们在大模型评测里面经常见到的一个数据,它测的是一个AI Agent在真实的沙盒环境里,能不能完成真实终端任务。
测试一共有89个任务,评价方式就看最后任务能不能通过验证,榜单里常见的指标叫Pass@1。可以把它理解成:一次完整Agent尝试的成功率。
但我们平时让AI做复杂任务时,经常会发现一个现象:同一个模型,同一个问题,第一次可能做错,第二次可能做对;换一种思路可能失败,再换一种实现方式反而成功。
大模型生成机制本来就有随机性,尤其是Agent做终端任务时,路径很多,任何一个小决策都可能影响最后结果。
如果我们只看一次尝试,就会低估模型真实潜力。那怎么办呢?让模型多试几次吧。
可问题又来了,多试几次不难,模型能不能判断哪一次更好呢?所以实验设计了一个LLM-as-a-Verifier,让大模型当验证者。
同一个任务,先让DeepSeek V4 Flash生成5个候选方案;再让DeepSeek V4 Flash像阅卷老师一样,给这5个方案排序;选出它认为最靠谱的一个提交,最后根据这个模型认为最靠谱的任务完成情况评估模型的分数。
· · ·
DeepSeek V4 Flash一跳升天
DeepSeek V4 Flash单次尝试的原始成绩是78.7%,这个成绩本身已经不错,但还没有超过Fable 5的83.8% ±1.2%。
加上自验证选优之后,DeepSeek V4 Flash的成绩跟坐了火箭一样,直接飙到了88.0% ±0.6%,超了Fable 5接近5分,而且折腾了这么多,价格依然比Fable 5便宜了4-11倍。
也就是说,准确结论不是“DeepSeek V4 Flash裸模型比Fable 5 更强”。
准确结论是:一个本来打不过旗舰模型的低成本模型,通过多次尝试和自我验证,把Agent能力推到了超过Fable 5公开榜单成绩的位置。
这有点像考试。一个学生第一次解题可能不稳定,但如果允许他列几种解法,再自己检查、比较、选一个最稳的答案,最终成绩可能会明显提高。
· · ·
为什么这招管用
这里就引出一个词:test-time scaling,中文可以理解成“做题时扩展能力”。
过去我们讲模型变强,主要讲训练时扩展:模型做得更大,数据喂得更多,训练时间拉得更长,让模型在出厂时就更聪明。这当然重要,过去几年大模型能力的提升,很大程度就是靠这个。
但test-time scaling讲的是另一件事:模型在做题的时候,多花一点时间,多打几版草稿,多检查几遍,多比较几个方案。
尤其对Agent来说,做题时扩展可能更关键。因为Agent任务往往不是一次回答,而是一个过程:观察环境、制定计划、执行命令、读错误信息、修改方案、再验证。在这个过程中,多一次尝试、多一次检查、多一个验证者,都会显著改变最终成功率。
这次DeepSeek V4 Flash的结果,本质上就是一个很典型的test-time scaling案例。
它没有证明模型本体突然变成世界第一,而是说明:当模型可以多次尝试,并且有能力自我验证时,系统能力会被明显放大。
· · ·
魔改的魅力
你可能会问,这个机制这么好用,能不能给Fable 5也加上?
当然能。闭源模型一样可以多跑几遍,再用LLM-as-a-Verifier挑出最好的结果。
但开放权重模型的优势,是这套玩法可以做得更深。不仅能在外面让模型跑5遍,还能直接控制推理过程,在关键节点分叉、提前淘汰差的路线、复用前面已经算过的结果,把算力集中到更有希望的路径上。
再加上DeepSeek V4 Flash模型本身更便宜,同样一笔钱,可以买更多次尝试,也可以把每次尝试做得更精细。模型越便宜、推理过程越可控,test-time scaling就越有性价比。
所以这个实验不是"便宜模型裸跑赢过最强闭源"的爽文。它是一个信号:一个低成本、可控、能改造的模型,只要配上更聪明的运行时机制,就有机会把系统能力推到顶级闭源模型之上。
这也正是开源最让人兴奋的地方:它把系统创新的空间打开了。开发者可以围着模型,搭出自己的一套运行时机制,让它在真实任务里,能力不断翻倍。
· · ·
关键在于用起来
最后想说一句,机制再好,关键还是需要人去用。你不动手,AI再强也跟你没关系,不管是对个人开发者还是对企业来说都是这样。
过去几年,很多公司想做AI Native转型,但最大的问题不是“不想做”,而是“不敢大规模做”,担心太贵不划算,担心数据泄露不安全,担心模型跟生产环境水土不服。
但现在这个拐点来了。
当然,AI变得便宜又好用,不代表企业自动会用好。真正难的是怎么用它重塑整个组织。
文章来自于微信公众号 “傅盛”,作者 “傅盛”
Loading...

没有找到文章