切分、匹配、排序和来源编号
文档按段落和长度切分,问题经过基础分词后与片段匹配,并按命中情况排序。结果保留原文,方便判断是否真的找到了回答问题所需的信息。
06 · 文档检索
把文档切成可检索片段,再根据问题召回最相关的原文。这个演示只展示 RAG 的检索阶段,不调用大模型,也不会编造文档之外的答案。
结果会标记片段编号、匹配词和原文内容,方便理解答案应该引用什么。
使用说明 · 先检索,再生成
这个演示只实现检索阶段:把文档切成片段,根据问题中的词对片段排序并展示来源。刻意不生成答案,便于观察召回质量和引用依据。
文档按段落和长度切分,问题经过基础分词后与片段匹配,并按命中情况排序。结果保留原文,方便判断是否真的找到了回答问题所需的信息。
生产级 RAG 通常结合关键词检索和向量召回,再用重排模型选出上下文。检索前后都要带上部门、角色、文档密级和有效期,避免越权引用。
从业务人员历史问答中建立测试集,分别记录目标片段、Top-K 命中率、无答案识别和引用准确性。检索不到时应明确拒答或转人工。
当前版本使用简化的本地词项匹配,不代表向量数据库或重排模型效果,也不支持 PDF 解析、OCR、表格语义、权限和版本控制。它用于解释检索链路,不用于生产知识库。
由涧序数字技术团队设计与维护 · 更新于 2026-07-27