小红书HELMSMAN重塑向量检索:闪存降本90%的AI硬核技术
type
status
date
slug
summary
tags
category
icon
password
网址
在人工智能(AI)与大模型(LLM)技术爆发的时代,海量向量检索(ANNS)已成为搜索、推荐、广告及RAG(检索增强生成)系统的底层核心支柱。然而,随着数据规模的指数级增长,传统的纯内存(DRAM)索引方案正面临高昂的成本瓶颈。
近日,小红书引擎架构团队在系统结构顶级会议 OSDI 2026 上发表了最新研究成果——HELMSMAN,成功攻克了这一业界难题。作为专业的AI门户,
https://aigc.bar 持续为您带来最深度的AI新闻与技术解析。本文将深入解读 HELMSMAN 如何通过软硬件协同,重塑大规模向量检索基础设施。痛点剖析:为什么纯内存(DRAM)路线难以为继
在小红书等大型互联网平台中,多模态大模型和用户行为数据的爆发式增长,使得线上需要维护数百亿规模的高维向量索引。为了在 5-10 毫秒的极低延迟约束(SLA)下完成海量召回,业界过去高度依赖基于 DRAM 的图索引(如 HNSW)。
然而,DRAM 的单位容量成本极其昂贵。随着向量规模每年翻倍,纯内存部署已达到 PB 级,带来了数百万美元的硬件支出。虽然现代 NVMe SSD 提供了廉价的存储选择,但传统的图索引在 SSD 上表现极差。这是因为图搜索存在强依赖的串行 I/O——每一步的搜索方向都取决于上一步从 SSD 读取出的邻居节点,这种“边读边决定”的模式无法利用 SSD 的高带宽,还会导致长尾延迟失控。
聚类式ANNS与SPDK定制化存储栈的结合
针对 SSD 的物理特性,HELMSMAN 团队指出,真正适合高带宽 SSD 阵列的是聚类式索引,而非图式索引。聚类索引在查询时,先在内存中定位近邻质心,再批量读取对应的聚类列表(Cluster List)。这种模式天然支持批量 I/O,能够打满 SSD 的带宽。
然而,传统的 Linux I/O 软件栈(包括系统调用、文件系统、设备映射等)开销巨大,甚至占到端到端延迟的 58%。为此,HELMSMAN 自研了 ANNS 定制化存储栈:
- 基于 SPDK 构建用户态存储栈,直接绕过内核,管理 NVMe 队列。
- 将聚类列表直接物化在 Raw NVMe 逻辑块中,通过统一的 Chunk Allocator 进行管理。
- 将聚类大小固定,使得每次在线读取都转化为一次高效的固定大小 I/O。
通过这种底层存储路径的重构,HELMSMAN 将 SSD 的吞吐能力释放到了极致。
智能决策:分层学习式搜索剪枝(LLSP)
在聚类索引中,如何确定搜索范围(即读取多少个聚类,nprobe)是影响性能与召回率的关键。传统的固定阈值策略无法应对真实线上请求中多变的 Query 难度。
为了解决这一问题,HELMSMAN 引入了分层学习式搜索剪枝(LLSP)机制。该机制的核心在于,剪枝决策必须在真正读取 SSD 之前完成,以保持批量 I/O 的优势。
在线查询时,系统首先通过 Router 模型根据 Query 和目标 Top-K 预测搜索范围等级。接着,在相应等级内结合近邻质心距离、相对比例等特征,利用 GBDT 剪枝模型动态预测需要读取的 nprobe。这一设计实现了“简单查询少扫,困难查询多扫”,在保证高召回率的同时,大幅减少了不必要的 SSD 读取和 CPU 计算。
异构加速:GPU与弹性CPU协同的分布式构建流水线
在实际的工业生产环境中,AI 模型的迭代和向量数据的更新非常频繁。如果索引构建速度跟不上,在线系统就无法实现闭环。
HELMSMAN 设计了三阶段异构构建流水线:
- 第一阶段:利用 GPU 加速粗粒度 K-Means 计算,快速生成初始质心。
- 第二阶段:使用弹性 CPU 资源池进行细粒度切分、负载均衡和边界填充。
- 第三阶段:由多核 CPU 服务器合并分片,构建质心图并训练 LLSP 模型。
通过这种异构流水线,HELMSMAN 将 10B(百亿)规模索引的重建时间缩短至数小时,为高频模型更新提供了坚实的基础设施支撑。
工业级实测:硬件成本骤降90%与性能飞跃
在小红书真实生产负载的测试中,HELMSMAN 展现出了极其震撼的性能与成本优势:
- 成本降低90%:使用约 40 台全闪存服务器,稳定承载了原本需要 35,000 个 CPU Core 和 350 TB DRAM 才能支撑的在线检索负载。
- 吞吐大幅提升:相比于现有的 DRAM-SSD 系统(如 DiskANN 和 SPANN),HELMSMAN 获得了 2-16 倍的吞吐提升,最高达到了纯内存部署 85% 的吞吐能力。
- 超低延迟保障:在满足 5-10 毫秒级平均延迟的同时,显著优化了 P999 长尾延迟,满足了搜索和广告等核心业务的严苛 SLA 要求。
- 高带宽利用率:在 PCIe Gen4 SSD 上,带宽利用率达到了 85%,远超传统系统的 20%。
总结与展望
小红书引擎架构团队在 OSDI 2026 上发表的 HELMSMAN 系统,为工业界提供了一条切实可行的低成本、高性能全闪存 ANNS 技术路线。它证明了通过软硬件协同优化,在大幅降低硬件成本的同时,依然能够保持媲美纯内存的在线检索性能。
随着人工智能与大模型技术的持续演进,底层基础设施的效率将直接决定 AI 应用的落地速度。如果您想了解更多关于大模型、AGI 以及最新 AI 资讯,欢迎访问 AI 门户
https://aigc.bar,获取最前沿的技术日报与行业动态。Loading...
.png?table=collection&id=cbe6506e-1263-8358-a4d7-07ce62fcbb3f&t=cbe6506e-1263-8358-a4d7-07ce62fcbb3f)