← 返回项目列表
后端

企业知识库 RAG 问答系统

参与企业知识库问答系统开发,支持 PDF、Word、Markdown 文档导入、向量索引、来源引用、低置信度兜底和增量更新。

周期
任职期间
角色
AI 应用开发
类型
后端

01

我的工作

  • 实现 PDF、Word、Markdown 等文档导入流程,将企业内部知识资料统一进入知识库处理链路。
  • 参与文档清洗、Chunk 切分和 Embedding 向量化处理,使非结构化文档能够被稳定检索。
  • 基于 Chroma 构建向量索引,并结合相似度召回支持客服和运营人员快速获取知识。
  • 支持答案来源引用,让回答能够回溯到对应文档片段,降低知识库问答的不可解释性。
  • 设计低置信度兜底策略,对召回不足或回答不确定的情况进行提示或转人工处理。
  • 支持知识库增量更新,使新增商品 FAQ、售后规则和客服 SOP 能够持续补充到检索系统中。
  • 针对商品 FAQ、售后规则、客服 SOP 等不同类型文档设计分层切片策略,提高召回准确率。

02

技术流程

  1. 上传或导入企业文档
  2. 完成清洗、切分和向量化
  3. 写入 Chroma 向量索引并保存元信息
  4. 用户问题触发相似度召回
  5. 模型结合召回片段生成带来源的回答
  6. 低置信度场景触发兜底策略

03

问题与约束

企业知识库的难点不只是接入向量数据库,而是让不同格式、不同结构和不同业务语义的文档能够被稳定召回。项目需要在文档清洗、切片粒度、来源引用和低置信度兜底之间取得平衡,避免回答看似流畅但缺少可靠依据。

04

关键技术决策

按文档类型分层切片

针对 FAQ、售后规则和客服 SOP 采用不同切片策略,减少过长片段带来的噪声,也避免过短片段丢失上下文。

保留来源引用

在检索结果中保留文档来源和片段信息,让回答可以追溯,便于人工核验和后续知识库维护。

低置信度不强答

当召回质量不足时使用兜底策略,而不是让模型凭空补全业务规则,降低错误回答风险。

05

结果与复盘

完成企业知识库问答核心链路,覆盖文档导入、清洗切分、向量索引、相似度召回、来源引用、低置信度兜底和增量更新,为客服及运营知识检索提供基础能力。

06

项目边界

公司项目。页面不公开内部知识库内容、客户资料、业务规则全文、源码和线上部署信息。