ARTICLE SIGNAL

FUMO Lab发布Fusion Model:智能分配如何刷新大模型能力上限 | AI资讯

AI,AI资讯,大模型,AGI,FUMO Lab正式发布Fusion Model,通过动态智能分配打破单模型能力瓶颈,降低算力成本,刷新前沿大模型能力上限,推动人工智能发展。

type
status
date
slug
summary
tags
category
icon
password
网址
One fusion, the strengths of many.
融合模型,尽揽众长。
在推理、行业、编程、科学四项顶尖公开测试集上,Fusion Max 与 Fusion Code 全部拿到第一,分别超过 GPT 5.6、Fable 5 与 Kimi K3。
今天,新加坡的前沿模型实验室FUMO Lab,也是小宿科技的兄弟公司,发布Fusion Model。
你不需要研究不同模型各自擅长什么,也不需要在多个答案之间来回比较。只需告诉 Fusion Model 你想完成什么,它会在后台根据任务进展,选择合适的模型参与:谁负责解决问题,谁负责补充信息,谁负责检查结果。
如果现有信息还不够,Fusion Model 会继续寻找和验证;如果已经足以得出可靠结论,它会及时停止。最终呈现给你的,是一个完整、清晰、前后一致的答案,或一项可以直接执行的操作。
更完整的技术原理,请参阅同期白皮书 Fusion: Allocating Intelligence Across Heterogeneous Models。下文将用更直观的方式介绍:我们为什么开发 Fusion、它如何工作、在科学任务中的实际表现,以及它接下来会走向哪里。
智能的基本单位正在改变
主流语言模型接口把一次"请求—回答"视为智能的基本单元:问题输入,模型给出答案,交互随即结束。这个框架决定了系统如何选择模型、衡量能力和分配算力。
Agent 的出现改写了这一模式。它们不只是生成更长的答案,而是推动一项工作经历连续的观察、决策、行动、失败与校验。问题也因此从"某个模型能不能回答"转变为:当工作本身不断演化时,智能能否持续发挥作用。
对于边界清晰的请求,任务从一开始就已定义明确,模型能力通常可以通过一次回答的对错来评估。但在一条 Agent 执行轨迹中,每一步都会改变任务状态:检索结果可能消除原有的不确定性;一次行动失败可能暴露出更深层的约束;用户补充的信息也可能推翻整套计划。下一步应调用哪种智能,取决于此前已经发生的一切。
需求不是预先写死的难度分数,而是在执行过程中逐步显现的。
供给侧也在变化。模型不再只是排行榜上的一列名次,而是由异构能力构成的生态。训练数据、规模、架构、后训练方式、工具接口、专业领域和部署形态各不相同,使它们在推理、代码、科学、检索、批判、工具使用、时延、可靠性、隐私和成本等方面呈现出因场景而异的优势。
最强的独立答题者未必是最好的批评者;较小的模型在探索另一条路径、提供专业知识或执行边界明确的校验时,可能具有更高的边际价值。即使两个前沿模型都很强,也可能因为错误高度相关而彼此冗余。
对于边界清晰的请求,路由依然有用:先刻画请求,再选择一个模型,必要时升级。但它无法独自覆盖一条需求只有在工作展开后才逐渐显现的执行轨迹。知道"这一步很难",并不能告诉系统此刻需要的是另一个求解者、领域专家、外部观测、独立批评、更强的综合能力,还是根本无需继续计算。
两个变化交汇成一个系统问题:
持续将只能被部分观测、且不断演化的智能需求,与异构的能力供给相匹配。
我们称之为Intelligence Allocation Problem(智能分配问题)。决策单元不是"谁该拥有最初那条请求",而是"当前状态下最有价值的下一次计算"。
FUMO Lab 正在为此构建 Fusion Model。
Fusion Model如何工作
Fusion Model无需在任务开始前预测整条执行轨迹的需求,而是把推理转化为一个闭环的证据获取过程。每一步都会提出四个问题:
❶还剩哪些对决策有影响的不确定性?
❷ 什么证据会实质改变下一个答案或行动?
❸现有能力中,谁最适合获取这些证据?
❹这次计算的期望价值,是否高于成本、时延与风险?
每获得一次新观测,系统都会更新任务状态,并重新回答这四个问题。这分配不是贯穿执行全程的前奏,它本身就是执行。
路由把请求指派给一个模型;Fusion Model 则根据不断演化的任务状态,分配下一次能够产生证据的计算。它可以更换算力来源,调整向该来源披露的信息和分配的算力,也可以选择停止。对于边界足够清晰的请求,路由仍可作为 Fusion 内部的一种动作,但不再是统摄整个系统的核心抽象。由此得到两条设计原则:
Read State读取状态Buy Evidence获取证据Update更新状态Submit or Stop提交或停止
Fusion Model闭环:Read state → Buy evidence → Update → Submit or stop
原则一:围绕不确定性组织计算,而不是围绕模型。
原则二:一份状态,多种视角,一次提交。
前一条原则决定为什么需要继续计算,后一条则决定多种计算如何共同作出贡献,而不让任务状态彼此割裂。多个模型可以共同探索,但不能各自维护一套分叉的世界状态。工具调用可以作为建议,只有权威路径能够执行对外行动。证据必须保留适用范围和来源归属,而最终决策权始终保持单一。
用户侧的体验不变:仍然只有统一接口。真正的变化发生在系统内部——读取状态、获取证据、交叉校验,再决定继续计算还是提交结果。
一种新的模型能力提升维度
Fusion Model 将智能分配视为一种贯穿整条执行轨迹、并能随经验持续改进的系统能力。它维护统一的任务状态,识别真正影响决策的不确定性,再分配最适合消除这些不确定性的能力来源或观测手段。各项产出以带有来源归属的证据形式进入系统,权威路径只提交一份一致的答案或行动。任务状态一旦更新,循环便重新开始。
这并不是把许多模型装进同一个外壳。组合(composition)描述系统由哪些部分构成;复利(compounding)描述系统能力如何持续增长。仅仅加入更多模型只是组合;只有学会如何让模型各自的场景化优势与真实任务相互作用,能力才可能产生复利。
Fusion 沿着两条相互耦合的回路演进:
轨迹之内不确定性获取证据更新状态再次分配轨迹之间任务理解分配策略停止判断复利改进
左:轨迹之内的闭环 · 右:轨迹之间的复利
模型进步会扩大可供调用的智能供给,分配能力的进步则决定其中有多少能够转化为真正有用的系统能力。两者无需彼此等待,结合起来便可能产生复利。这构成了一种新的规模化维度:系统能力的增长速度可以超过单纯增加前沿算力投入所带来的增长速度。
这并不是另一个"更便宜的 AI"命题。重复调用前沿模型,说明系统无法区分已有证据与缺失证据;过早启用较弱的能力来源,则说明系统没有识别出哪些环节真正需要更强的判断。智能分配必须同时提升系统能力与算力利用效率。一句话收束:
Fusion Model会随着模型能力的提升而变强,也会因更懂得如何使用这些模型而进一步变强。
不只是按比例堆算力
智能分配的价值必须能够从系统外部被感知和衡量。Fusion Model 不应迫使客户在"前沿能力"与"可部署的效率"之间二选一,而应推动这条能力—效率前沿向外扩展。
对于边界清晰的问题,目标是在性能—算力曲线上实现 Pareto 改进:达到相同质量时减少前沿计算,投入相同算力时提高任务质量。对于 Agent 执行轨迹,目标则是让这种改进在任务状态不断变化时依然成立:提高端到端完成率,减少不一致的状态转换,并降低每次成功任务所需的算力。
白皮书内的测试结果结果表明:在保持较高任务表现的同时,与直接调用权威综合模型相比,Fusion Model可将任务成本降低约 30%–40%。这并不是用弱模型替代强模型,而是把更强的判断能力留给真正承重的环节,同时打破“每一步中间推理都必须使用同一能力层级”的假设。
非对称组合本身并不会自动带来更优结果。一个只会提供误导性或冗余证据的弱能力来源,再便宜也谈不上高效。只有当系统理解不同能力的特点、并能感知任务状态、选择性地利用这种非对称性时,优势才会出现。
真正推动能力—效率前沿的,是分配层,而不是"系统里有一个更小的模型"。
AI for Science:当多个正确事实相互矛盾
科学问题很少只考"知不知道"。更常见的失败是:相关事实明明都记得,却越过了适用范围,停留在过时的定义,或在推演中遗漏了因果链上的某一环。
这正是智能分配所要解决的一类问题。材料科学、表观遗传学、发育生物学和物理化学中的难题,往往不是少记了一条公式,而是此刻究竟该让哪条知识主导判断。单模型容易被"正确但并非决定性"的事实带偏;Fusion 更稳健的做法是先识别约束,再决定向哪种能力获取证据,并在交付前收敛为一个一致的答案。
下面四个案例来自 Fusion Model评测中带有明确干扰项的科学题。它们不证明 Fusion Model 在每一道题上都超过所有单模型;它们说明的是,当题目里同时存在"正确但非决定性"的知识时,Fusion Model更稳定地抓住真正决定答案的那一层。
材料科学 · 约束识别
杂质会散射电子。为什么这仍不是答案?
金属导电是科学教材中最基础的知识之一。但当问题限定为纯金属,并追问通常温度范围内影响最显著的因素时,它考查的就不再是"电阻从何而来",而是"哪些正确知识不应进入答案"。
杂质确实会散射电子;但对于通常温度范围内的纯金属,真正随条件显著变化、因而起主导作用的,是由温度引起的晶格热振动。8 个前沿单模型中,有 5 个被"杂质 + 温度"这一组合带偏;Fusion Model 在 3 次运行中都先锁定限定条件,只保留题目真正询问的那一层。
这并不意味着 Fusion Model"知道更多材料学知识",而是它会先识别约束,再判断哪些知识应该进入答案。
表观遗传 / 生物医学研究 · 知识覆盖
蛋白质的旧身份,会掩盖它的新功能吗?
组蛋白乳酸化就像把细胞的代谢状态写成一张贴在组蛋白上的化学便签:写入酶添加标记,擦除酶移除标记。HBO1 长期以来主要被认为是一种乙酰化酶,较新的研究才发现它也能写入乳酸化标记。
答错的单模型并非不知道乳酸化,而是让 HBO1 的经典身份遮蔽了它的新功能。Fusion 在 10 次运行中都给出了完整的"写入—擦除"框架,没有停留在最早受到广泛关注的 p300。
科研辅助系统几乎每天都会遇到这类失败:回答听起来十分权威,依据却仍停留在蛋白质最初被定义的年代。这里体现的是生物医学研究问答能力,请勿将结论延伸为临床诊断或用药建议。
发育生物学 · 因果判断
细胞死了,邻居还会改命运吗?
旁侧抑制使率先分化的细胞能够向邻近细胞发出"不要与我分化成同一类型"的信号。真正困难的不是记住 Notch 这个名词,而是继续追踪抑制信号消失后的因果链:
分化细胞死亡 → 抑制消失 → 邻近细胞解除抑制 → 细胞命运仍可能改变。
答错的单模型把动态系统简化成了静态标签,因此错误地选择了"细胞凋亡后,邻近细胞的命运不会改变"。Fusion 在 3 次运行中都完整走通了这条因果链。
物理化学 · 概念边界
定律会背,边界才是考题
拉乌尔定律本身并不是冷门知识。真正拉开系统差距的,是能否判断它在何处严格成立、在何处只是近似成立。
在理想溶液中,各挥发性组分会在整个组成范围内严格服从拉乌尔定律;在理想稀薄溶液中,溶剂通常也可近似服从。后一句在科学上可以成立,却扩大了题目所规定的适用范围。
Fusion 在 3 次运行中都停留在题目明确规定的严格边界之内。在企业场景中,"多说一句正确的话"往往显得更专业,却可能让结论越出既定的验收边界。合同条款、实验条件和产品规格都属于这类边界问题。
Fusion Model 并不是在每道题上都优于所有单模型。但在这些带有明确干扰项的代表性案例中,它在识别约束、覆盖知识和判断因果关系方面表现得更为稳定。
FusionModel将如何改变 AI 系统
如今,应用常常需要围绕某一个模型的上下文上限、工具行为、时延和失败模式重新设计。Fusion Model 则在这些波动之上提供一个更稳定的智能层。
新模型可以作为能力来源接入;现有模型也能随着相对优势变化而调整角色;供应商差异和部署约束可以被系统吸收,无需重写任务本身。这并不会让模型沦为同质化商品,而是让模型之间的差异转化为可用能力。
随着任务不断延伸,在开始时固定下来的分配方案很难始终保持最优。代码开始运行、用户进一步澄清意图、工具返回意外数据、测试推翻当前计划——Fusion Model 的闭环机制允许能力组合随任务进展动态调整:先广泛探索,再逐步收窄;把前沿模型的判断力用在影响重大的环节;当某项主张可以被检验时,引入验证;失败后恢复,同时保留仍然有效的状态;证据充分时及时停止。
对外,它始终表现为一个连贯一致的智能系统;对内,能力组合则随执行进程不断调整。
短期来看,Fusion Model 能在系统能力与算力投入之间实现更好的平衡。长期来看,能力前沿可以由两条彼此独立的因素持续推动:一是底层模型生态不断进步,二是分配层从日益丰富的任务与结果中学习。
更好的分配器能让新模型的能力更快产生价值,识别哪些环节真正需要昂贵的智能,并揭示下一轮训练或专业化最值得补足的能力缺口。系统既是模型进步的消费者,也是判断下一轮能力提升应投向何处的观测工具。
重要的转变不是从"一个模型"到"许多模型",而是从静态消费智能到自适应分配智能。
排行榜描述的是模型在预设任务上的平均表现。FusionModel还需要另一种视角:一张条件能力图谱——在特定任务和工作流中,结合当前已有的证据,某个模型有多大概率提供真正有用的新证据。显性的系统架构可以被模块化复制;对模型条件性贡献的经验认识则会逐步沉淀为专有能力,并持续产生复利。
这一学习过程必须保持有界:策略应当版本化、可评估、受约束且可回滚,而不是不受限制地自我改写。
免费试用
FUMO · Fusion Model 现已开放邀请制试用,如需申请试用或阅读白皮书,请通过官网(fumolab.ai)、扫描下方二维码
欢迎用你最难的问题、最长的工作流来检验我们。
融合模型,尽揽众长One fusion, the strengths of many.
文章来自于微信公众号 “AI异类弗兰克”,作者 “AI异类弗兰克”
Loading...

没有找到文章