ARTICLE SIGNAL

韶音押注端侧Infra:清华博士打造AI Native硬件与边缘算力底座

万象智维获韶音领投数千万元融资,聚焦端侧SoC芯片AI基础设施与推理引擎,推出OmniInfer与独立AI硬件Taste,探索端侧大模型长期记忆与AI落地,AI资讯与大模型前沿

type
status
date
slug
summary
tags
category
icon
password
网址
随着以大语言模型(LLM)为核心的生成式人工智能浪潮席卷全球,AI行业正在经历一场从“云端算力竞赛”向“端侧落地应用”的深刻范式转移。在云侧大模型不断刷新智能上限的同时,如何在低算力、低功耗、异构化的终端设备上高效运行模型,成为推动AGI(通用人工智能)走进现实生活的最关键一环。
根据业内最新AI资讯报道,由清华大学计算机系在读博士生王拓为及长江学者特聘教授任炬团队创立的端侧AI基础设施公司“万象智维(Omnimind)”,近日完成了数千万元的天使+轮融资,由知名声学与智能穿戴品牌韶音领投,瀚晖投资、知行资本、宝尔爱迪跟投。万象智维通过打造面向端侧SoC芯片的推理引擎OmniInfer、端云协同框架OmniClaw,以及即将推出的独立端侧智算硬件设备Taste,正系统性重构端侧AI生态的软硬件底层技术栈。
本文将从端侧算力痛点、推理基础设施创新、端侧微调与长期记忆机制,以及AI Native硬件的未来演进等维度,深入解读万象智维的技术布局与产业价值。

算力下沉与破局:为什么端侧Infra是AI下半场的核心战场?

在AI的上半场,行业聚光灯大多打在以OpenAI的ChatGPT、Anthropic的Claude等云端前沿大模型上。云侧AI的核心使命是持续探索智能的理论极限,依靠成千上万张高性能GPU构建超级算力集群。然而,当大模型进入规模化落地与商业化探索阶段时,纯云端架构的局限性迅速暴露:
  1. 高昂的Token与算力成本:频繁调用云端大模型接口给企业和个人带来了沉重的推理开销,严重制约了高频交互类AI应用的普及与AI变现
  1. 数据隐私与合规壁垒:用户的个人对话、敏感文件、生理健康数据及行为轨迹持续上传云端,带来了难以忽视的数据安全隐患。
  1. 网络延迟与弱网限制:在工业现场、车载场景、智能穿戴及弱网/离线环境下,云端依赖型Agent无法保证实时响应与服务连续性。
正因如此,“端侧AI”被公认为AI落地的下半场核心。端侧智能的目标并非盲目追求参数规模的无限膨胀,而是让模型在各种资源受限的边缘设备上跑得更持久、更稳定、更高效。然而,市面上现有的主流推理框架(如针对云端GPU或高性能桌面架构设计的方案)难以直接复用到手机、耳机、手表、智能眼镜等搭载SoC(System on Chip)的终端上。异构计算核心多、内存带宽紧张、功耗散热限制严格,构成了端侧AI落地的天然技术鸿沟。

异构加速与内存重构:OmniInfer与OmniClaw的技术突破

为了填补端侧SoC芯片推理引擎的行业空白,万象智维构建了一套专为端侧异构芯片量身定制的基础设施矩阵,核心由推理引擎OmniInfer和执行框架OmniClaw组成。

OmniInfer:极致压榨端侧SoC的算力与存储

在终端设备上运行百亿级大模型,主要面临计算资源匮乏与内存空间受限两大瓶颈。OmniInfer通过底层算法与系统级优化,给出了针对性解法:
  • 动态参数稀疏激活与算力协同:大模型在执行特定推理任务时,并不需要全量参数同时参与。OmniInfer能够根据输入请求动态挑选最关键的参数进行计算,并将精简后的工作负载智能分配给SoC内部的CPU、GPU和NPU进行协同处理,最大化硬件利用率。
  • 分层存储与计算隐藏机制:端侧设备的运行内存速度极快但容量有限,外存容量大但读取慢。OmniInfer通过将非即时数据卸载到外存,并在推理计算的同时重叠进行数据预取,结合外存数据排布优化,大幅缩减了内存等待时间。
在实际测试中,搭载OmniInfer的终端设备展现出了显著的性能跃迁:原本只能跑10B以下模型的设备上限被拓宽至30B级别;模型预填充(Prefill)速度最高提升近15倍,解码(Decode)性能提升2.49倍,内存开销减少近半。例如运行主流开源大模型Qwen系列9B版本时,其推理内存占用被成功压缩至3GB以下,为消费级硬件部署优质语言模型扫清了障碍。

OmniClaw:专为端侧小模型定制的协同框架

传统的智能体框架与执行Harness往往围绕云端千亿级大模型构建,高度依赖模型复杂的指令理解与泛化推理能力。若直接将其套用在端侧参数较小的大模型上,容易出现工具调用失效、死循环等问题。
万象智维推出的OmniClaw为端侧小模型重新设计了工具接口调用逻辑、推理引导机制与智能重试策略。同时,OmniClaw内置了端云协同智能路由:对于本地上下文整理、轻量任务执行,直接在端侧完成;当遇到超出端侧模型能力范围的复杂逻辑时,系统自动无缝调用云端顶尖大模型。这种架构在保证任务完成上限与纯云端方案对齐的前提下,大幅降低了整体Token消耗与响应延迟。

告别伪持续学习:OmniTune赋予端侧真正的“长期记忆”

当前许多所谓的个性化AI助手,本质上依然是通过在提示词(Prompt)中拼接历史对话记录,或者利用云端向量数据库检索(RAG)来实现短期上下文维持。这种方式不仅受限于端侧模型有限的上下文窗口,且数据频繁出端,无法称之为真正意义上的持续学习。
万象智维提出了基于端侧微调算法OmniTune的全新路径:
  • 极低开销的微参数演进:利用用户白天的日常交互数据,系统在夜间设备闲置、充电状态下调用空闲算力进行前向推理与参数微调。
  • LoRA参数动态更新:每次仅微调约1%至2%的极小LoRA参数模块,将单次微调成本压低至常规推理级别。
  • 数据完全不出端:整个学习和参数更新过程100%在本地硬件闭环运行,确保个人隐私零外泄。
通过这种“白天陪伴交互,夜间自省学习”的机制,设备能够在不依赖云端算力重训的前提下,逐步将用户的语言偏好、行为习惯、专业知识内化到专属模型权重中。随着使用时间的推移,每个用户手上的设备都将蜕变为具备独特权重的专属数字分身。

从软件Infra到AI Native硬件“Taste”:形态演进与商业闭环

在商业探索初期,万象智维曾开源了本地运行的Android Agent项目“OmniBot(小万App)”,在移动端验证了跨应用自动化调用的可行性。但团队很快意识到,手机操作系统的底层权限壁垒高、换机周期带来的上下文割裂,限制了纯手机软件作为终极AI助手的潜力。
为此,万象智维选择双轮驱动战略,在B端输出标准化能力的同时,向C端探索全新的AI Native硬件形态——“Taste”。

硬件终端Taste:磁吸卡片式的个人Memory中心

Taste是一款形态类似于磁吸录音卡的独立端侧硬件:
  • 独立算力与传感模块:内置独立SoC芯片、麦克风阵列、扬声器、独立电源以及小型交互屏,摆脱了对手机系统算力与权限的依赖。
  • 全天候上下文捕获:磁吸在手机背板或随身携带,随时随地作为用户的个人记忆(Memory)存储器,记录多模态交互信息。
  • 硬件独立性与跨生态流动:无论用户更换何种品牌手机或电脑,个人的核心上下文与微调权重均沉淀在Taste设备本身,实现了个人数字资产的真正自主可控。

B端与C端协同的商业化路径

在商业化落地上,万象智维已经率先在B端实现了百万级订单交付,采用“NRE(非重复性工程研发费)+ License(授权许可费)”的标准化模式,赋能PC、智能家居、AI玩具、工业穿戴等各类终端厂商,并通过面向B端的一站式端侧部署平台OmniStudio降低集成门槛。
随着C端量产硬件Taste的推进,公司将进一步开启“硬件销售+高阶AI订阅服务”的C端变现模式,形成软件基础设施与自研硬件闭环互促的发展格局。

结语与行业展望

端侧AI的发展绝非简单地把云端大模型做量化压缩后塞进手机,而是一场涵盖芯片算力分配、异构编译器、轻量化微调算法与新型交互硬件的系统级工程重塑。韶音等产业资本对万象智维的加码,印证了硬件制造产业对底层端侧Infra能力的迫切渴求。
在未来,AI的价值不仅体现在云端大模型所展现的通用智慧,更体现在数十亿边缘智能终端与用户共同沉淀的“时间价值”。掌握端侧基础设施与个性化记忆核心技术的企业,有望在下一代智能终端的浪潮中占据不可替代的生态位。想要获取更多全球前沿大模型动态、端侧AI技术演进与行业AI新闻,敬请持续关注专业行业资讯更新。
Loading...

没有找到文章