#多模态大模型
聚合与「多模态大模型」相关的文章、观点与实践记录。
跨越创造力的鸿沟:全新C4框架评估多模态大模型的跨概念理解能力
最新研究推出C4(基于成语的跨概念创造力)评估框架,旨在测试多模态大语言模型(MLLMs)的跨概念理解与创造力解码能力。测试显示顶级闭源模型准确率仅过半,揭示了AI在深层认知和创造性关联上仍面临巨大挑战。
提升多模态大模型推理效率:MAP技术实现视觉Token高效前置剪枝
最新研究提出MAP(中间层注意力预测)技术,通过在多模态大模型的第一层前预测视觉Token重要性进行剪枝,以5.56%的视觉Token保留97.5%的性能,实现3倍以上的端到端推理加速。
ChronoVision:通过潜在状态重建突破多模态大模型的时序推理瓶颈
研究人员提出全新多模态框架 ChronoVision,通过潜在状态重建与强化学习,大幅提升多模态大模型在复杂视觉认知和时序推理任务中的准确率,并发布 Vbvr-VQA 评估数据集。
RIG-RoPE:解决多模态大模型交错上下文时空编码干扰的新方案
深入解析最新技术报告 RIG-RoPE。该研究提出了一种关系与实例门控的旋转位置编码机制,通过持续时间感知的时间坐标和实例隔离,有效解决多模态大语言模型中跨模态空间干扰与时间步长不匹配的痛点。
突破多模态大模型位置编码瓶颈:RIG-RoPE 引入时长感知与实例门控机制
最新AI研究提出 RIG-RoPE(关系与实例门控旋转位置编码),通过引入时长感知的时序坐标和视觉实例标识,解决多模态大模型中跨模态空间干扰与时间步长不一致的问题,无需增加额外参数即可优化注意力机制。
赋予AI复杂规则理解力:PRISM框架突破多模态指令遵循瓶颈
最新研究提出的PRISM数据合成框架,通过将多模态大模型转化为“规则执行者”,大幅提升了模型在复杂多规则、具有优先级排序指令下的遵循能力。
AI大模型前沿:SemVID解决视频高压缩碎片化
深入解读ECCV26前沿论文SemVID,探讨多模态大模型如何通过三类视觉Token分配策略,解决长视频时序定位(VTG)中的高压缩碎片化问题,涵盖AI资讯,大模型,人工智能,AI新闻等前沿技术解析。
深度解读 WAIC:AI 大模型赋能“一脑多形”,具身智能走向实用主义
在今年的 WAIC 上,具身智能展现出从“才艺表演”向“解决实际问题”转变的趋势。本文深度解读 AI 大模型驱动的“一脑多形”理念,以及通用具身大脑如何应对复杂的工业与商业场景挑战。
Thinking Machines 发布 Inkling:1T 参数开源多模态模型登陆 Hugging Face
Thinking Machines 开源万亿参数多模态模型 Inkling,原生支持图像、文本、音频输入,1M 上下文,MoE 架构 41B 激活参数,transformers、SGLang、vLLM、llama.cpp 零日支持。
中科闻歌发布科学大模型 S1-Omni:重塑学术研究全流程的智能助手
中科院自动化所与中科闻歌联合推出科学多模态统一推理大模型 S1-Omni 及科研智能服务平台 ScienceOne,提供从课题调研、机制配图到论文预审的全生命周期 AI 辅助,旨在加速科研工作流。
阿里Qwen3.7-Plus发布:多模态AI智能体走向动手实操
阿里通义千问,Qwen3.7-Plus,多模态智能体,AI资讯,大模型,人工智能,AI新闻,AI门户,AGI,LLM,openai,chatGPT,claude,AI日报,Prompt,AI变现,深入解读阿里最新发布的Qwen3.7-Plus模型,看AI如何从视觉理解走向代码生成与任务交付。
深入解析:从多模态大模型“拆”出高效音频向量模型 | AI资讯
探讨如何从多模态大模型中提取音频向量模型,Jina AI的模块化组合方案超越CLAP,实现全模态向量检索,AI资讯,大模型,人工智能,LLM,Omni Embedding,跨模态对齐。
AI视觉新范式:Rex-Omni如何终结目标检测旧时代?
深入解读3B参数多模态大模型Rex-Omni,其通过GRPO强化学习与“下一点预测”框架,在零样本目标检测上首度超越Grounding DINO,统一10+视觉任务,引领AI视觉感知新浪潮。
AI视觉革命:360 FG-CLIP2凭何登顶全球,实现像素级理解 | AI新闻
深入解析360 FG-CLIP2模型,凭借像素级理解与中英双语优势,在29项测试中超越谷歌与Meta,成为全球最强图文跨模态大模型,引领AI视觉新纪元。
HumanSense:AI共情新纪元,打造会察言观色的智能伙伴
HumanSense项目详解,探索多模态大模型推理边界,构建从感知到反馈的四层认知阶梯,打造会察言观色、能共情的全模态AI交互伙伴,推动人工智能交互体验革新。
AI资讯:UniPixel开启像素级推理,3B模型超越72B
UniPixel模型实现像素级推理,统一指代、分割与推理三大任务,其对象记忆机制是关键创新,3B参数模型性能超越传统大模型,引领多模态AI进入细粒度理解新时代,最新AI资讯。
PaDT模型革命:让AI大模型告别「猜坐标」时代
颜水成团队发布PaDT多模态大模型,彻底告别文本坐标输出的弊端。通过创新的视觉参考令牌(VRTs),实现精准的空间定位与多模态表征,引领AI视觉理解新范式。
华为ViSpec引爆AI革命:多模态大模型推理飙升3.2倍,入选NeurIPS顶会
深入解读华为诺亚ViSpec算法,该技术通过创新的视觉感知投机推理,无损提升多模态大模型(VLM)推理速度达3.2倍,有效解决图像信息冗余难题,开启高效AI交互新时代。
苹果AI王炸:旧iPhone秒变AI神器,MobileCLIP2深度解析
苹果发布高效多模态大模型MobileCLIP2,专为端侧设备优化,实现低延迟高精度,让旧款iPhone也能运行先进AI。了解最新AI资讯,探索模型细节与开源价值。
SLED:通过知识蒸馏实现可扩展的位置编码,大幅降低地理空间大模型算力成本
地球观测数据处理迎来新突破。最新研究提出SLED(通过蒸馏实现的可扩展位置编码)框架,通过将地理位置作为绑定模态,在极小批次下实现高效多模态数据训练,显著降低计算成本,并在19项人类中心基准测试中表现卓越。