RAG 与知识索引
什么是知识索引?想象你走进一个巨大的企业资料库。知识索引就像这个资料库的"智能目录系统",它把海量的文档、数据提炼成结构化、易查找的"地址簿"。AI 通过它能迅速定位相关知识位置。
索引与 RAG 的关系:RAG(检索增强生成)是让大模型回答问题的技术。它"问问题"时,知识索引就是 RAG 的"即时资料库"。RAG 先查询索引,找出最相关的信息片段,再基于这些片段生成准确回答——索引为 RAG 提供精准弹药。
为什么必须构建索引?对企业意味着什么?
- 效率与成本:企业知识库可能到达 TB 级,直接塞给大模型耗时费钱。索引预先组织信息,实现毫秒级检索。
- 准确性:保证 AI 的回答牢牢基于企业最新内部知识(产品手册、客户案例等),避免"胡说八道"。
- 专业性:让通用大模型瞬间变身"企业专属专家",解锁高质量内部知识问答。
语义分段策略
纷享在语义分段中采用以下策略提高召回的准确性。
选择知识的标题字段

在对象分段时,需要选择标题字段。在用户检索时,除了语义检索和全文检索的召回分段外,同时还会对标题字段进行检索,并把检索出来的数据所属分段作为单独一路召回,最后对多路召回的分段进行重排,以生成最完整、全面的答案。
建议:尽量选择有业务含义,并且在用户 query 时最常使用的信息作为标题字段。
引入分块字段

分段配置可以引入分块字段,分块字段的值会自动加入到分段中,作为分段的语义加强信息。
建议:尽量选择有业务含义,并且在用户 query 时最常使用的信息作为分段字段。
文档分段中的层级
文档类型的语义索引配置,在用户配置分段配置的基础上,系统还会在所有的分段 chunk 上添加当前分段内容的文档层级(只要是有层级结构的文档)。
层级信息可以给分段的内容增加层级关系和主题归属信息,提高召回的准确性和质量。如果用户的提问匹配到了某个层级的内容,其层级下面的所有分段内容都被召回并生成答案,从而提高召回率和精确率。