ARTICLE SIGNAL
1300张卡叫板10万卡!前OpenAI副总裁硬核AI颠覆材料科学
深入解读Periodic Neon如何以1300张H200击败10万卡GPT-6 Astra,前OpenAI研究副总裁打造实验室真实数据飞轮,破解互联网数据耗尽难题,引领大模型与材料科学AGI突破。最新AI资讯,AI新闻,大模型,AGI前沿,人工智能。
type
status
date
slug
summary
tags
category
icon
password
网址
在人工智能发展的浪潮中,算力规模一度被视为衡量模型能力的终极标准。然而,前OpenAI研究副总裁Liam Fedus携新创立的Periodic Labs交出的一份成绩单,打破了这一固有认知:仅仅使用1300张H200显卡,结合实体实验室的实验数据训练出的Periodic Neon模型,在一项极具挑战性的材料科学基准测试中,成功超越了拥有10万张Grace Blackwell算力支持的GPT-6 Astra以及Claude Fable 5.1。
这一突破不仅展现了专业化大模型在垂直领域的巨大潜力,更揭示了AGI探索路径上的一个全新转折点——当互联网公网文本数据逐渐见顶,AI的进化动力必须转向真实世界的物理反馈。关注最新AI资讯与技术前沿的开发者可以通过 AI门户平台 获取更多深度行业洞察与AI日报资讯。
算力逆袭的奇迹:1300张H200为何能叫板10万张Blackwell
在业界普遍追求数万亿参数和超大规模算力集群的背景下,Neon的参数量仅约为1T。在对比基准中,据传GPT-6 Astra背后依托超过10万张Grace Blackwell芯片,总参数达数万亿量级,而Neon最终训练时的峰值算力仅仅动用了1300张H200。
这场“以弱胜强”的对决发生在一套名为FrontierXRD的高难度X射线衍射分析基准测试上。Neon取得了55.3%的准确率,遥遥领先于GPT-6 Astra和Claude Fable 5.1(后者准确率约40%)。
除了准确率的优势,Neon在推理成本和工程效能上也展现出惊人的性价比:
- 单题成本大幅降低:在最高精度档位下,Neon解决一道复杂科学难题的成本约为4美元多,而GPT-6 Astra的单题成本高达7美元以上,且表现更逊色。
- 专属科学工具链加持:所有测试模型均运行于自研的Periodic Harness科学环境中,相比基于通用代码框架搭配标准分析工具的传统方案,成功率提升了3.8倍。
- 杜绝模型“背题”:为了验证模型的真实泛化推理能力,团队额外构建了198道全新体系的测试题,将相关化学数据从训练集中完全剔除,Neon依然保持了显著的领先优势。
这场对决向整个人工智能行业证明:在深度科学任务中,盲目堆砌通用算力并不能直接转化为专业领域的推理优势,精准的数据飞轮和专门优化的计算架构才是制胜关键。
互联网数据枯竭,物理实验室成为永不干涸的“数据水井”
过去几年里,LLM的性能飞跃主要依赖于对互联网海量文本的吞吐与预训练。但一个不争的事实是,全球互联网上高质量的公网文本数据总计约为10T token,前沿基础模型几乎已经将其完全消化。
作为曾经在OpenAI负责后训练与数据飞轮的核心缔造者之一,Liam Fedus敏锐地意识到,要推动chatGPT及下一代AI系统继续突破,必须开拓互联网之外的全新数据来源。
Periodic Labs给出的答案是:建立物理实验室,自己制造高质量物理世界数据。
在门洛帕克的高磁场材料实验室中,机械臂与X射线衍射仪24小时不停运转,构建了一个严密的材料发现闭环:
- 假设提出:基于材料稳定性和物理化学性质进行前瞻性预测。
- 合成预测:推导最佳实验路径并在实验室内进行实体合成。
- 结构验证:通过X射线衍射(XRD)获取样品的真实“指纹”图谱,分析合成产物。
- 数据回流:将物理反馈数据反哺给模型,修正假设,开启下一轮迭代。
实验室中产生的每一次物理测量与实验反馈,都转化为私有、高质、带着真实世界法则的新鲜数据。这些数据与学术文献、计算代码混合,构成了Neon的中训练(Mid-training)语料库,并保持每月翻倍的增长速度。相比于已接近开采极限的互联网数据矿山,自主运转的实验室宛如一口永不干涸的数据水井。
破解物理世界RL困境:用AI裁判与极致算力架构赋能科研
将强化学习(RL)应用于代码生成或纯数学推理时,系统可以快速部署海量智能体并依托明确的规则自动判分。但在真实的材料科学领域,强化学习面临着三大现实阻碍:实验周期长、物理成本高昂,以及最关键的——实验结果往往缺乏廉价且客观的评判标准。
材料合成往往产生极不纯净的多相混合物,XRD图谱重叠杂乱,“科学可以被证伪,却不容易被快速验证”。为了给强化学习提供可靠的奖励信号(Reward),团队设计了一套高度校准的“AI裁判组”:
- 首先由顶尖人类材料专家对数千个复杂的XRD图谱进行深度标注。
- 利用这些高质量标签,校准由前沿大模型构成的LLM裁判委员会。
- 实测数据显示,人类专家之间的一致率为77.2%,而AI裁判与专家共识的一致率达到了惊人的84%,成功将原本模糊的物理实验分析转化为可用于RL训练的高精度奖励信号。
在算力调度层面,Periodic团队同样将工程优化发挥到了极致。针对科学RL任务中“推理思考耗时长、梯度更新耗时短”的异步特性,他们自研了隔离沙箱pbox,利用计算节点上闲置的CPU资源直接运行科学分析工具,实现数据不出集群、任务零等待。这种精细化管理使得整个GPU集群的利用率常年保持在95%以上,真正做到了让每一个GPU小时都换取最大的科学产出。
从文字飞轮到物理飞轮:AI与科学发现的范式转移
回顾大语言模型的发展史,从Prompt提示词工程到后训练强化学习,数据飞轮一直是技术突破的核心引擎。如今,这一飞轮的运转介质正在发生根本性变革:从人类在数字世界留下的文本,转向自然界在物理世界给出的真实反馈。
目前,Neon已经深度部署在实验室中,协助科研人员攻克超导体、强磁体和先进半导体材料的鉴定难题。尽管现阶段AI主要承担的是“看懂实验结果”的角色,尚未完全实现自主规划与端到端实验合成,但这套体系已经验证了科学发现自动化的可行路径。
未来,随着基础大模型能力的持续演进与物理实验室自动化的进一步普及,下一阶段的模型扩展竞争,比拼的将不仅是谁拥有十万张显卡的机房,更在于谁能建立起源源不断向模型输送物理现实数据的实体闭环。关注全球AI新闻动态与前沿大模型落地进展,欢迎持续访问 AIGC资讯门户 掌握一手行业情报。
Loading...