实践:搭建知识库问答助手 | LanSphere 使用手册

实践:搭建知识库问答助手

本篇以「为单位搭建一个基于内部制度文件的问答助手」为例,带你走完从创建知识库、召回验证、编排对话流、调试测试到发布上线的完整流程。适合首次在蓝域(LanSphere)上搭建对话类应用的开发人员与管理员阅读。

场景与价值

单位的规章制度、管理办法通常散落在多份文件中,日常咨询高度依赖人工答疑:

  • 员工遇到问题要翻多份文件,找不到、看得慢;
  • 人事行政部门反复回答同类问题,占用大量精力;
  • 不同人答复口径不一致,容易引发争议;
  • 新文件下发后,旧答复还在流传,信息滞后。

把制度文件放进知识库,让对话流基于知识库作答:员工随时自助提问,答案有据可查、口径统一,人事行政部门也能从重复答疑中解放出来。

你将搭建什么

一个「制度问答助手」对话流应用:员工在对话中提问,应用从制度知识库中检索相关内容,由大模型组织语言回答并标注引用来源;查不到时明确告知,不编造。最终将应用发布到应用广场,并上架蓝信客户端「AI 助理市场」,全单位员工在蓝信中即可使用。

整体链路:知识库(制度文件)→ 对话流(输入 → 知识库 → 大模型 → 回复)→ 发布(应用广场 + 蓝信 AI 助理)

推荐流程

步骤 说明
1 创建知识库 简易模式上传制度 PDF,选「通用文档问答」分段策略,向量索引 + 重排序模型
2 召回测试 用典型问题验证召回片段、匹配度与来源,不合格先调知识库
3 编排对话流 输入 → 知识库(Top K 3、混合检索)→ 大模型(约束提示词)→ 回复
4 配置对话功能 开场白、引用归属、敏感词审查
5 调试测试 覆盖「该答对」与「该拒答」两类用例,多轮追问验证记忆
6 发布上线 保存 → 发布到应用广场 → 发布到蓝信 AI 助理

准备工作

项目 要求
平台角色 开发人员及以上(创建知识库、编排对话流);发布到蓝信 AI 助理需管理员及以上
资源归属 发布到蓝信仅限本人创建的应用,建议全程使用同一账号操作
蓝信绑定 发布前确认账号已绑定蓝信(「个人中心 → 绑定蓝信」)
制度文件 PDF 格式,单文件不超过 15MB(亦支持 DOCX、TXT、MD、XLSX、XLS、CSV 等)
模型 对话大模型可用;向量模型(必选)与重排序模型(建议)已在「模型列表」中配置,未配置请联系管理员

第一步:创建知识库

  1. 进入「左侧菜单 → 知识库」,点击「创建知识库」,构建模式选择「简易」(标准创建)。
  2. 基础信息:填写名称(必填,不超过 30 字符,如「单位制度知识库」)与描述(选填)。
  3. 上传文件:上传制度 PDF 文件。
  4. 分段策略:选择预设策略「通用文档问答」。该策略为父子分段·段落模式,子块最大 512,适合制度条款这类按段落组织的文档,无需手动调整分段规则。
  5. 参数确认:父子分段模式下索引方式锁定为「向量索引」;选择向量模型(必选),建议同时选择重排序模型以提升召回精度。
  6. 确认创建:页面逐文件显示处理进度,全部成功后点击「进入知识库」。

注意:向量索引选定后不支持切回关键词索引;后续向该知识库追加文件时,自动继承创建时的分段模式,不可变更。

第二步:召回测试验证知识库

知识库创建后先不要急着编排应用,先做召回测试,确认「问得到、问得准」:

  1. 进入刚创建的知识库,打开召回测试功能(按页面提示进入)。
  2. 输入几个典型问题,如「年假有几天」「出差住宿标准是多少」。
  3. 查看召回片段、匹配度与来源文档:
    • 召回片段确实包含答案 → 知识库可用,进入下一步;
    • 召回片段不相关或为空 → 先处理知识库分段问题(见文末「验证与调优」),不要带着问题上画布。

提示:召回测试阶段多试几种问法(口语化问法、简称),这些就是员工真实的提问方式。

第三步:编排对话流

  1. 点击「新建项目」,应用类型选择「对话流」,填写应用名称(如「制度问答助手」)。
  2. 进入「应用开发」页签的画布,「输入」节点默认存在,作为对话入口。
  3. 点击添加「知识库」节点,连接在「输入」节点之后:
    • 关联知识库:选择刚创建的「单位制度知识库」;
    • 检索方式:选择「混合检索」(语义与关键词加权,对条款编号、专有名词更友好);
    • Top K:保持默认 3;
    • 已配置重排序模型时,可启用以提升精度。
  4. 点击添加「大模型」节点,连接在「知识库」节点之后。选择对话模型,将知识库节点的检索结果作为上下文传入,并编写提示词:
你是单位的制度问答助手,负责依据知识库检索结果回答员工关于规章制度的问题。

【知识库检索结果】
(此处插入知识库节点的输出变量)

请严格遵守以下规则:
1. 仅依据上方检索结果回答,不得使用检索结果之外的任何信息。
2. 检索结果中没有答案时,明确回复"未在现行制度文件中找到相关规定",
   并建议员工咨询人事行政部门,不要编造条款或数字。
3. 回答末尾标注引用来源,格式:来源:《文件名》相关章节。
4. 分条陈述,语言简洁正式;与制度无关的问题,礼貌说明本助手仅解答制度问题。

提示:提示词中的上下文请通过画布的变量选择器插入知识库节点的输出变量,占位写法以实际变量名为准。

  1. 点击添加「回复」节点,连接在「大模型」节点之后,回复内容引用大模型节点的输出。对话流通过「回复」节点向用户输出消息。

第四步:配置对话功能

在对话流的功能配置中开启以下能力(按页面提示完成配置):

功能 配置建议 作用
开场白 开启,预置 2-3 个常见问题(如「年假怎么申请?」) 首次进入自动展示,引导员工提问
引用归属 开启 回答标注引用的知识库来源,增强可信度
敏感词审查 开启 对输入与输出做敏感内容审查,符合单位合规要求

第五步:调试与典型问题测试

  1. 使用整体调试进行多轮对话测试,每轮查看各节点的输入、输出与报错;过往记录可在「调试历史」中回看。
  2. 按下表覆盖两类用例——该答对的要答准,该拒答的要拒答
类型 测试问题示例 预期表现
该答对 「年假有几天?怎么申请?」 依据制度文件分条回答,标注来源
该答对 「出差住宿标准是多少?」 引用对应文件中的标准条款
该答对 「试用期多久?」(口语化问法) 能召回相关条款并正确回答
该拒答 「食堂今天中午吃什么?」 明说知识库中没有相关规定,不编造
该拒答 「帮我写一份年终总结」 礼貌说明仅解答制度相关问题
  1. 多轮追问测试:先问「年假有几天」,再追问「那探亲假呢」,确认多轮记忆正常、上下文不串。

第六步:保存与发布

  1. 保存:点击「保存」,草稿仅本人可见。
  2. 发布到应用广场:保存最新内容后,点击「保存」按钮下拉 →「发布到应用广场」。上架后平台内全员(含阅览成员)可见可用,适合先小范围试用、收集反馈。
  3. 发布到蓝信 AI 助理(需管理员及以上角色):
    • 进入应用详情页「发布渠道」页签,选择「蓝信 AI 助理」渠道;
    • 账号已绑定蓝信:确认弹窗后直接发布;未绑定:按弹窗引导跳转蓝信授权认证中心,扫码认证通过后自动执行发布;
    • 助理标题默认继承应用名称(不超过 10 字)、描述默认继承应用说明(不超过 20 字),命名时请注意长度限制;
    • 发布后按钮变为「已发布」置灰,不可重复发布;系统自动在蓝信侧创建应用与机器人实例,上架蓝信客户端「AI 助理市场」。

员工侧体验:在蓝信「AI 助理市场」看到助理头像、标题与描述,点击进入;首次使用需完成数据授权,同意授权后方可对话;若拒绝则无法使用,再次进入会重新推送授权卡片。

验证与调优

上线后在「对话日志」页签查看真实提问,对回答标记好评/差评并添加标注回复,按下表针对性调优:

现象 可能原因 调整方法
答非所问 召回片段不相关 用召回测试复查;调大 Top K;启用重排序模型
编造答案(幻觉) 提示词约束不足 强化「仅依据知识库回答、无答案明说」规则;确认已开启引用归属
已有条款查不到 文档分段不合理 查看分段结果;条款被截断时调整分段策略后重建知识库
回答冗长、跑题 输出未限定 在提示词中限定分条陈述与篇幅

验收要点

  • 制度类问题回答准确,内容与文件原文一致,末尾标注引用来源;
  • 知识库中没有的问题明确拒答,不编造条款、不编造数字;
  • 多轮追问上下文连贯,引用归属正常展示;
  • 蓝信「AI 助理市场」中可见该助理,终端用户完成数据授权后可正常对话。

扩展思路

  • 开启「文件上传」,让员工临时上传一份文件参与问答;
  • 开启「推荐提问」,根据本轮回答自动推荐下一轮问题,提升连续使用体验;
  • 在画布中加入「意图识别」节点,把制度咨询与其他事务分流到不同分支;
  • 通过「发布渠道 → API 访问」将问答能力接入单位内部系统。