ARTICLE SIGNAL
揭秘DeepSeek发错模型乌龙:大模型API与Infra的极限考验
深度解读DeepSeek发错模型乌龙事件,探讨Hugging Face配置失误与API后台热切换真相,涵盖AI资讯,AI新闻,大模型,LLM,AGI,人工智能,chatGPT,claude等核心话题,为您带来最新AI日报与深度技术剖析。
type
status
date
slug
summary
tags
category
icon
password
网址
DeepSeek-v4-pro-0813 正式上线,两极分化的口碑却让人摸不着头脑。
一边,是疯狂刷屏的评测夯爆了:多项 Agent 测试逼近 Fable 5,被认为是又一次前沿模型的“核弹级”更新;另一边,却是不少深夜忠实开发者直摇头:吐槽涨价、模型能力不及预期,实测体感甚至不如之前的小模型……
一天之内,梁文锋的口碑从“梁神”跌落至“牢梁”,成了“薛定谔的梁”。
更蹊跷的是,有开发者发现,同一项任务前后相隔几个小时测试,V4 Pro 的表现便出现了明显变化。到了下午,DeepSeek 官网一度撤下 V4 Pro 正式版横幅和开放平台公告,大家都怀疑新模型经历了一次线上回滚。
上线不到 24 小时,v4 pro 从官测惊艳到实测争议, 再到发布即撤回的快速反转,到底是夸大宣传的性能滑铁卢,还是工程部署上出了什么乌龙?
顺着 Hugging Face 仓库提交记录 和 API 后台返回,或许能找到答案。
火速撤回的公告
把时钟拨回 8 月 13 日凌晨。
DeepSeek 依旧延续了他们“不上发布会、不发海报”的极简风格,悄悄更新了 API 文档,将背后的模型切到了等待近四个月的DeepSeek-V4-Pro-0813正式版。
起初,全网一片欢腾。看官方跑分,Terminal-Bench 2.1 砍下 87.9 分,距离顶级闭源模型 Claude Fable 5(88.0 分)仅差 0.1 分!加上依旧降维打击的极低价格,海外开发者和科技投资人纷纷直呼“性价比之王又戴稳了皇冠”。
然而狂欢没过半天,实测党们接入真实业务流后,画风彻底变了。
大家发现,这个拥有 1.6 万亿参数、单次激活 490 亿参数的旗舰庞然大物,实际体验极不稳定。更离谱的是,Artificial Analysis 测出的综合得分仅有 53 分,只比参数量小得多的 V4 Flash 高出了区区 1 分!在网络安全扫描等真实场景中,误报率更是频频遭到吐槽。
“大模型变笨”、“莫非挂错模型了?”的质疑声充斥着社区。到了 13 日下午,DeepSeek 官网便火速撤下了相关公告,将全网体验强行带回了“原点”。
后台记录曝光紧急抢修
好好的旗舰模型,怎么说撤就撤?难道真的是“性能打回原形”?
扒开 DeepSeek 在 Hugging Face 上的官方代码仓库(deepseek-ai/DeepSeek-V4-Pro-0813),就会发现官方后台早已进入了“生死时速”的连夜抢修模式。
小弟装大哥?
最初上传的 V4-Pro-0813 配置中,hidden_size为 4096、路由专家数为 256、隐藏层数为 43、Attention Head 数为 64;这些数值与 V4-Flash-0731 完全一致。
社区很快在 Hugging Face Discussion 中提出质疑,而 DeepSeek 官方组织成员msr2000随后回复“已处理”。
修正后的 V4-Pro-0813 配置已经变成:hidden_size=7168、384 个路由专家、61 层、128 个 Attention Head,与此前 V4 Pro 的架构配置重新对齐。
除此之外,MoE 中间层大小、Q-LoRA Rank、路由系数、DSpark 相关参数等一整串配置也随之发生变化。
二进制权重被替换
更关键的是,DeepSeek 还同时修改了普通config.json和inference/config.json两套推理配置。
在Release DeepSeek-V4-Pro-0813之后,官方先提交了一次Update config.json,紧接着又通过upload-large-folder tool连续进行了两次大文件重新上传。
翻开关键的权重分片(model-00035至model-00039.safetensors)对比记录,其 SHA256 校验码全部发生改变,文件体积也出现了微妙的变化!
这说明,DeepSeek 替换的远不止是配置文件 config.json(用来向推理框架定义模型结构),至少部分真正的模型二进制文件也被重新处理过。
推理栈切换
如果说 Hugging Face 的权重重传只是静态文件的修正,那么 API 后端的指纹突变,则揭示了 DeepSeek 后端集群正在经历的“云端抢修”。
有网友分享,在测试 DeepSeek 官方 API 时发现,模型的system_fingerprint(系统指纹)发生了罕见的剧烈变动:
此前,开发者可以通过 API 返回的明文指纹直接读出构建日期(20260812)、生产环境、FP8 量化以及 KV Cache 等工程细节。
但在实测过程中,不到半小时,Pro 和 Flash 的系统指纹几乎在同一时间全部切成了无法解读的纯 32 位 Hash。
系统指纹的同步改变,直接对应着线上推理后端(Inference Backend)、部署版本、算力调度策略或指纹生成规则的彻底重构。这也印证了一个事实:DeepSeek 的线上推理栈刚刚经历了一场非常决绝的热切换。
结 语
上述几条线索串联起来看,有理由相信,昨天的发版混乱并非简单的“模型翻车”,极有可能是因为 DeepSeek 的前端接口、后端推理栈与权重配置三者出现了严重的错位,导致不同时间、不同入口的开发者拿到的体验完全不在同一个频道上。
至于能否定性为一次发布流程事故,相信团队内外自有评判。
这也给当前参数不断扩增、规模持续摸高的模型行业竞争敲响了警钟。当模型体量迈入万亿参数级别,任何微小的配置错位——哪怕只是一个 config 文件的参数写错——都可能在 Infra 层被无限放大,最终在前端体验上砸出巨大的“坑”。
从 Hugging Face 的数据来看,V4 Pro 的 FP8 量化版本权重高达893 GB,由 66 个分片文件组成。这不仅是参数的堆叠,更是对算力调度、高并发吞吐等基础设施(Infra)的极限考验。底层配置或算子调度上的微小瑕疵,反映到高并发的前端,就会瞬间放大为显著的体验下滑。
文章来自于微信公众号 “InfoQ”,作者 “InfoQ”
Loading...