后端
企业知识库 RAG 问答系统
参与企业知识库问答系统开发,支持 PDF、Word、Markdown 文档导入、向量索引、来源引用、低置信度兜底和增量更新。
01
我的工作
- 实现 PDF、Word、Markdown 等文档导入流程,将企业内部知识资料统一进入知识库处理链路。
- 参与文档清洗、Chunk 切分和 Embedding 向量化处理,使非结构化文档能够被稳定检索。
- 基于 Chroma 构建向量索引,并结合相似度召回支持客服和运营人员快速获取知识。
- 支持答案来源引用,让回答能够回溯到对应文档片段,降低知识库问答的不可解释性。
- 设计低置信度兜底策略,对召回不足或回答不确定的情况进行提示或转人工处理。
- 支持知识库增量更新,使新增商品 FAQ、售后规则和客服 SOP 能够持续补充到检索系统中。
- 针对商品 FAQ、售后规则、客服 SOP 等不同类型文档设计分层切片策略,提高召回准确率。
02
技术流程
- 上传或导入企业文档
- 完成清洗、切分和向量化
- 写入 Chroma 向量索引并保存元信息
- 用户问题触发相似度召回
- 模型结合召回片段生成带来源的回答
- 低置信度场景触发兜底策略
03
问题与约束
企业知识库的难点不只是接入向量数据库,而是让不同格式、不同结构和不同业务语义的文档能够被稳定召回。项目需要在文档清洗、切片粒度、来源引用和低置信度兜底之间取得平衡,避免回答看似流畅但缺少可靠依据。
04
关键技术决策
按文档类型分层切片
针对 FAQ、售后规则和客服 SOP 采用不同切片策略,减少过长片段带来的噪声,也避免过短片段丢失上下文。
保留来源引用
在检索结果中保留文档来源和片段信息,让回答可以追溯,便于人工核验和后续知识库维护。
低置信度不强答
当召回质量不足时使用兜底策略,而不是让模型凭空补全业务规则,降低错误回答风险。
05
结果与复盘
完成企业知识库问答核心链路,覆盖文档导入、清洗切分、向量索引、相似度召回、来源引用、低置信度兜底和增量更新,为客服及运营知识检索提供基础能力。
06
项目边界
公司项目。页面不公开内部知识库内容、客户资料、业务规则全文、源码和线上部署信息。