ARTICLE SIGNAL

AI资讯:3B小模型如何碾压英伟达?解读Om AI端侧原生VLX

AI资讯,AI新闻,Om AI,端侧原生模型,VLX-Seek 1.5,物理AI,小参数大模型,具身智能。本文深入解读Om AI如何以3B小模型在物理世界精准感知上超越英伟达,探讨端侧原生架构如何重塑AI行业标准,为您提供最前沿的AI日报与大模型发展趋势分析。

type
status
date
slug
summary
tags
category
icon
password
网址
具身智能圈,又传来两条重磅消息。
刚刚,Om AI联汇完成数亿元融资,前海母基金领投。
同一天,该公司旗下全球首款端侧原生模型VLX-Seek 1.5宣布正式开源。
表面看,这是融资、开源两件事。
资本在下注一种新路线,开发者正在获得一个新入口。
但放在一起看,很难不让人想起20年前亚马逊AWS开启云计算时代的那一刻。
当年,AWS一边全面开放API吸引海量开发者接入,一边获得资本投入验证路线价值。
最终,云计算没有成为简单的服务器租赁生意,而是演变成一套新的基础设施范式。
如今的物理AI,也在寻找自己的「原生时刻」。
Om AI联汇定义了一种怎样的范式?在物理AI的全局坐标轴中,它处于什么位置?
全球物理AI,图谱更新
过去几年,AI行业的竞争经常围绕更大的模型、更多的数据、更强的云端算力展开。
从大语言模型到多模态模型,参数规模一度成为衡量能力的重要指标。
但当AI走向真实世界,机器人面对的不是一张张静态图片,也不是一次次文本问答。
它需要在工厂、仓库、家庭、户外等复杂环境中持续运行。
这时,竞争规则也发生了变化。
决定模型价值的不再只是参数量,而是几个更加现实的问题:
响应延迟够不够低?端侧算力能不能承受?部署成本能不能规模化?设备能不能脱离云端独立运行?
因为在物理世界里,每增加一台机器人、无人机或智能终端,都意味着真实的硬件成本、能源成本和维护成本。
如果我们把今天全球物理AI模型的路线放在一张地图上会发现,围绕「如何让AI理解并行动于物理世界」这一大命题,全球玩家正在形成几条不同方向。
NVIDIA Cosmos选择的是「云端世界模型」路线。
它的核心目标,是帮助AI理解物理环境,通过世界模型能力构建更加丰富的空间认知基础。
Physical Intelligence的π系列,则探索「云端通用机器人策略模型」,希望通过大规模训练让机器人具备跨任务泛化能力。
Google Gemini Robotics则沿着「云端VLA」方向推进,将语言理解、视觉感知和机器人动作连接起来,让机器人能够根据自然语言完成任务。
而另辟蹊径的Tesla Optimus,更强调模型与机器人本体之间的闭环,通过自有硬件平台推动机器人能力迭代。
这些路线并没有谁绝对领先。
它们分别回答了不同问题:如何让AI理解世界?如何让机器人获得通用能力?如何让模型与硬件协同?
但在这张图谱里,有一个关键坐标此前并未有过专门的回答,那就是:
如何让一个AI模型从诞生开始,就适应端侧环境?
这是Om AI联汇想填补的位置。
其自研的VLX端侧流式多模态模型系列强调「端侧原生」路线,它不依赖云端大算力,也不绑定单一硬件平台。
模型也并非先在云端训练完成,再被压缩部署到设备。
而是在模型设计阶段,就把端侧算力、延迟、功耗和部署成本作为约束条件。
这两者看似只是部署方式的不同,本质上却是两种不同的技术哲学。
前者是在问:如何让一个强大的AI模型跑到设备上?
后者是在问:如果AI生来就在设备上,它应该长成什么样?
这也是「端侧部署」和「端侧原生」最大的区别。
毕竟机器人真正进入千家万户、进入大量工业场景,不可能永远依赖远端的云端大脑。
当前,在全球物理AI模型竞争版图中,端侧原生正在成为一个新的关键方向。
而Om AI联汇最先看到图谱上的缺口,用VLX补上了。
拆解“端侧原生第一家”
对于「端侧」的探索,不少AI模型很早就展开了。
大家都清楚,云端大模型虽然强大,但也有天然限制。
机器人如果每一次感知都需要上传云端,再等待结果返回,就像让一个人在运动时,每个动作都要先打电话询问远方的大脑。
网络延迟存在,数据传输成本存在,隐私问题也存在。
但工厂里的机器人,需要全天候工作;巡检无人机,需要在没有稳定网络环境的地方执行任务;家庭机器人,需要保护用户隐私。
这些场景决定了,物理AI不能永远依赖云端大脑。
业内之前的解决方案通常是:先训练一个大模型,再通过压缩、蒸馏、量化等方式,让它适配端侧。
这种「迁移式部署」的方式,模型本身仍离不开云端,只是努力让自己「变得更轻」。
Om AI联汇想彻底打破限制。
VLX从模型架构层就开始考虑端侧环境,把延迟、功耗、算力、部署成本作为设计前提,而非优化目标。
也就是说,模型不是一个被迫「减肥」的大模型,而是一个天生适合端侧环境的AI。
这个区别决定了物理AI能不能大规模、快速地走出实验室。
端侧原生带来的价值是直接的:更快响应、更低成本、更强自主性,以及让物理AI进入工厂、家庭、无人机巡检、智能终端。
而这种大规模落地要求模型具备本地理解能力、持续交互能力和低成本部署能力。
这也是为什么端侧原生并非一个营销概念。
它实际上代表了一条新的架构路线,决定着未来物理AI如何进入千千万万个真实设备。
不过,路线判断最终需要技术验证。
一个面向端侧设计的模型,是否真的能挑战更大的模型?
VLX-Seek 1.5:我能!
3B模型碾压英伟达、谷歌
VLX-Seek 1.5有3B、10B两个版本,参数规模都不大。
如果说端侧原生架构是其战略选择,那么流式多模态就是其以小搏大的战术优势。
传统VLM的工作流是这样的:摄像头拍一张照片,上传到云端,等待模型推理,返回结果。
这是典型的批处理模式,英伟达、Google等巨头的路线本质上都是这个逻辑。
由此带来的问题则是延迟高、带宽依赖大、隐私不可控。并且,它把物理世界的连续感知切割成了一帧帧的静态快照。
VLX-Seek 1.5的流式多模态架构完全不同。
它接收的是视频流持续输入,在端侧实时理解,动态输出决策。三层心智链路构成了完整闭环:
• Flow=持续注意力,让模型从看不见到看得清; • Seek=精细推理,让模型从看不准到看得准; • Go=执行控制,让模型从动不了到自主行动。
从「拍照识别」到「视频流理解」的范式变化,反向验证了同参数级别能赢巨头的关键,不在参数,而在架构。
在VLX-Seek 1.5公开的评测中,Om AI联汇测试了3B和10B两个版本,覆盖通用目标检测、指代表达理解、无人机视角感知、具身空间推理以及目标幻觉等多个方向。
同场比较的模型,不仅包括自家上一版的VLX-Seek,还有英伟达的LocateAnything等检测增强型VLM,以及多个更大的开源或闭源模型。
结果显示,VLX-Seek 1.5不仅提升了细粒度视觉理解能力,同时在无人机定位、具身设备空间推理等场景中展现出竞争力。
其中,最具代表性的,是3B参数版本与同规模模型(LocateAnything-3B)的比较。
在通用检测任务中,VLX-Seek 1.5-3B在LVIS Mean指标(衡量开放集定位模型对上千种物体,包含大量稀有物体的框选能力)达到57.5,相比LocateAnything-3B(50.7),提升13.4%。
这意味着,在复杂长尾目标识别中,小参数模型并没有因为规模限制而退化。
在更接近真实交互的指代表达理解任务中,VLX-Seek 1.5-3B在RefCOCOg test Mean(语言描述定位目标物体)达到80.2,相比LocateAnything-3B,提升3.4%。
简单来说,人类说一句:找到那个靠近桌角的小盒子。
模型不仅要识别盒子,还要理解空间关系。这考验的不是单纯视觉能力,而是视觉和语言之间的深层关联。
真正拉开差距的是无人机视角场景。
对于无人机来说,目标往往非常小、距离远、视角高、环境复杂。传统模型很容易出现漏检或者误判。
而在RefDrone测试中,VLX-Seek 1.5-3B的F1指标达到73.2,相比LocateAnything-3B的52.3,提升40%。
实例准确率Acc达到58,相比LocateAnything-3B(35.6)提升62.9%。
这些结果说明,在极端视角和小目标场景下,端侧原生架构正在展现不同于传统路线的效率优势。
VLX-Seek 1.5验证了一件事:巨头路线依靠更大规模解决问题,但端侧原生路线通过更适合物理世界的架构,也能提高单位参数价值。
不过,在实际部署时,仅有强识别能力还不够。
模型最大的风险是「过于自信」。
对于聊天机器人,有时候过于自信的结果,就是给出一次错误的回复。
但对于机器人、无人机和安防系统,模型的一次错误判断可能直接触发错误动作,对真实世界安全造成不可挽回的影响。
为了解决这个问题,VLX-Seek 1.5引入目标幻觉指标,用于衡量模型是否会产生不存在目标的误报。
该指标定义为:Object Hallucination = FP/Number of GT Objects。
其中,FP代表针对实际不存在请求目标产生的假阳性检测,数值越低,说明模型产生的目标幻觉越少。
在RefDrone目标幻觉评测中,VLX-Seek 1.5的FP/GT为18,而LocateAnything-3B为71.3。
这意味着,在同等条件下,VLX-Seek 1.5能够显著减少错误目标判断。
它选择了一条不同的智能路线:不强行给答案,且在信息不足时,敢说「我不知道」。
拒绝识别,并不是模型变弱。恰恰相反,知道什么时候说不知道,反而才是智能走进真实物理世界的重要标志。
在安防机器人、无人机巡检等高可靠场景中,乱报警可比漏报危险得多。
融资、开源与商业化
资本对范式投票,往往比技术社区的判断更早。
Om AI联汇此次完成数亿元的融资,释放的信号很明确:资本市场开始为端侧原生范式定价。
类比云原生早期,投资人押注的,也不是某一款PaaS产品,而是范式迁移本身。
而Om AI联汇要做「定义标准」的那个。
这与Kubernetes的逻辑一致:不靠售卖标准赚钱,靠免费把标准做成行业共识。
当全行业都遵循这套标准,定义方的云基础设施、托管服务就获得巨大商业增益。
目前,VLX-Seek 1.5的这套能力已向开发者开放。
当越来越多的开发者接入VLX-Seek 1.5,这套模型在更多真实场景被验证,数据反馈、持续迭代。
飞轮一旦转起来,生态位就稳了。
VLX-Seek 1.5开源,本质上是在争夺未来物理AI的基础能力标准的定义权。
除了模型本身,OmAI联汇也在基于VLX模型基座构建更大的端侧智能生态。
其「一脑多形」智能体平台OmAgent,试图推动AI走进物理世界。
在具身场景的商业化验证上,OttoPlex御行已经落地。
消费端,OttoBox携手联想、苹果推出AI PC「OttoBox AI Studio」。
同时,其自研可穿戴AI视觉中枢Homer AI,已经服务全国近10万视障用户,平台月均AI调用达到千万次。
这些探索,表明Om AI联汇并不只是想成为一家模型公司,更希望成为端侧原生智能时代的基础设施提供者。
从云计算到云原生,产业真正的跃迁从来不是简单堆算力,而是找到更适合新世界的架构。
如今,物理AI也走到了类似节点。
融资,是资本对新路线的投票。开源,是生态对新范式的第一次接入。
当模型开始离开云端,进入千千万万个真实设备,端侧原生或许会成为物理AI走向规模化的关键答案。
下一场竞争,不只是大模型之争。
未来真正拥有最大价值的,也未必是参数最多的模型,而是那个让机器人、无人机和智能终端真正规模化运行的基础设施。
文章来自于"量子位",作者 "田晏林"。
Loading...

没有找到文章