近日,得物技术团队发布了一篇题为《RAG 核心概念与原理:Chunking、Embedding、相似度、HNSW 与多路召回》的深度技术文章,系统梳理了检索增强生成(RAG)这一重要技术栈的关键环节。文章从工程实践角度出发,详细拆解了构成RAG系统的五大核心模块,为开发者和技术管理者提供了一份清晰的技术路线图。

RAG:补齐大模型短板的关键架构

在大型语言模型应用日益普及的背景下,“幻觉”现象、知识时效性不足以及专有数据无法纳入训练等问题成为落地瓶颈。RAG(Retrieval-Augmented Generation)通过“先检索、后生成”的范式,将外部知识库中的相关片段动态注入提示词,大幅提升了回答的准确性和可解释性。得物技术团队指出,RAG并非简单的检索+生成,其性能高度依赖于各组件之间的协同。

Chunking:知识库的“颗粒度”处理

RAG的第一步是将文档切割为语义完整的片段,即Chunking(分块)。文章强调,分块策略直接影响检索质量:块过小则语义割裂,块过大则引入噪声。得物技术团队在实践中采用“固定大小+重叠窗口”的混合策略,并针对代码文档、商品描述等不同类型数据调整块大小(通常256-512 tokens),同时保留10%-20%的重叠,确保上下文连贯性。

Embedding:从文本到向量的“翻译”

分块后的文本需要转化为机器可计算的向量,这一过程称为Embedding(向量化)。文章指出,Embedding模型的选择至关重要:通用领域可选用开源的text-embedding-ada-002或BGE系列,垂直领域则需微调。得物技术团队在电商场景下对比了多种模型,发现经过领域数据适配的Embedding模型在商品检索任务中Recall@10提升超过12%。

相似度与HNSW:高效向量检索双引擎

向量化后,系统需要快速找到与用户查询最相似的片段。文章介绍了两种核心机制:一是相似度计算,通常采用余弦相似度(Cosine Similarity),因其对向量模长不敏感,更注重方向;二是向量索引结构,其中HNSW(Hierarchical Navigable Small World)成为当前工业界首选。HNSW通过构建多层图结构,在保证检索精度的同时将延迟压缩至数十毫秒级,即使在百万级向量库中也能实现亚秒级响应。

多路召回:融合多元信号提升鲁棒性

单一向量检索往往存在“语义漂移”问题,例如商品名称“苹果”可能被误检为水果而非品牌。得物技术团队引入多路召回策略:同时执行向量检索、BM25关键词检索以及基于实体链接的精确匹配,再通过重排序模型(如交叉编码器)对结果进行融合。实验表明,这种混合方案在电商售后问答场景中,准确率比单一向量召回高出23%。

技术展望:RAG的持续进化

得物技术的文章最后指出,RAG仍处于快速演进阶段。未来,长文本理解、多模态检索以及检索与生成的端到端优化将成为突破方向。对于企业而言,构建一个高效、可扩展的RAG系统,不仅需要在上述核心概念上精耕细作,更需结合业务场景进行持续调优。这篇技术文章为行业提供了宝贵的实战参考,也展现了得物团队在AI工程化领域的前瞻探索。