演示现场"答得漂亮",上线一个月就翻车——旅行社AI知识库到底该怎么验收
演示现场"答得漂亮",上线一个月就翻车——旅行社AI知识库到底该怎么验收
一、一个典型的验收翻车现场
有个旅行社老板跟我讲过他的验收经历,特别典型。签合同那天,服务商的项目经理打开电脑,老板问:"介绍一下我们公司。"AI答得漂亮。又问:"介绍一下新疆线路。"AI又洋洋洒洒说了一大段。老板很满意,当场验收签字。
一个月后,销售开始真用。客户问:"我爸妈76岁了,想走得轻松点。"AI推荐错了。客户问:"9月20号还有位吗?"AI拍着胸脯说"有"——可那是旧Excel里的数。客户质问:"你们网上写6999,销售怎么报8299?"历史价格还挂在知识库里。
老板这才回过味来:那天验收问的,全是AI最容易答对的问题。真正要命的题,一道都没测。
二、验收的不是聊天窗口,是三个东西
先把结论摆在这:AI知识库的验收对象,从来不应该只是一个聊天窗口。真正要验的是三样——知识资产(企业标准答案对不对)、AI使用能力(机器找得到、理解对、调得准)、企业维护机制(以后能不能自己持续改)。演示测的是AI能不能展示能力,验收测的是AI能不能扛住真实业务的复杂度。
别再问"机器人会不会说话"了。要问的是:企业标准知识,能不能在正确的人、正确的场景、正确的时间,被正确使用。
三、先把问题按风险分个级
一锅烩地测准确率,是最大的误区。100道题里95道企业简介、景点FAQ全对,5道价格、库存、合同全错,总准确率照样好看——可错的那5道,恰恰是能让你赔钱、丢客户、惹纠纷的题。
靠谱的做法是按风险分级测:
| 风险层级 | 典型问题 | 验收重点 |
|---|---|---|
| 高风险 | 价格、库存、合同、产品状态、服务承诺 | 不能乱答 |
| 中高风险 | 产品推荐、老人亲子适配、服务范围 | 必须遵守业务规则 |
| 中风险 | 企业业务、流程、FAQ | 准确一致 |
| 低风险 | 通用目的地知识、一般介绍 | 可辅助参考 |
最该花力气的,是前两层。
四、专挑它最容易答错的题问
验收的正确姿势,是故意去问那些最容易让系统犯错的问题。
先测停售产品。别只问在售的,专门问已经停售的线路,看AI怎么答。理想表现不是"能说出版本号",而是旧线路不再作为当前产品被推荐。
再测产品版本。同一条线可能有V1、V2、V3,酒店换了、行程改了,要测AI引用的到底是哪版。知识更新的验收不仅要证明新版本存在,还要证明旧版本已经失去当前答案的资格。
然后测报价,分三种:固定公开价能不能答对;条件参考价知不知道问日期、人数;动态价格清不清楚该转人工。这里有个反常识的点——没有实时价格的时候,AI硬报一个历史数字才是错,"不回答"反而是正确答案。验收不能只奖励"回答了",还得奖励"该闭嘴时没乱说"。
库存和团期同样要测。系统没有实时库存接口,客户问"20号还有位吗",正确表现是"帮您确认一下",而不是拿着旧Excel说"有"。库存答错直接影响成交,必须当成高风险题来测。
五、推荐题要测"排除",别只测"推荐"
产品适配这块,技术团队说了不算。带73岁父母的、带5岁孩子的、明确不要大团的,各测一组。尤其要测排除规则:客户说了"不要大团",AI还推大团,说明约束根本没执行。高质量的验收应该先看错误产品能不能被排除,再看推荐理由写得漂不漂亮。技术通过不等于业务通过,产品推荐得让销售、产品和OP一起确认。
还要看AI会不会过早下结论。客户只说"想去新疆",AI立刻推一条高端线路——这不专业。日期、人数、老人孩子、预算、团型都不知道,正确的做法是先追问。成熟度不只体现在答案质量,还体现在它知道什么时候信息不够。
同理,复杂定制、实时价格、合同争议、投诉、紧急情况、特殊健康需求,这些题必须测"能不能转人工"。AI可以生成行程,但履约责任得回到人身上,这条要写进采购合同。
六、冲突、溯源、越权,都得真刀真枪测
知识库里同时有A文档6999和B文档8299,AI怎么办?别指望它"自己聪明判断",企业得先把冲突消掉。真实验收要故意问旧价格、旧产品、旧联系方式这类容易冲突的问题——真实环境永远不会干净,只在"干净样本"上表现好,说明不了任何问题。
AI答错了,得能查它依据了哪份资料。员工发现AI说错,能判断出是"知识不存在"还是"没搜到",否则只能瞎猜。越接近真实业务,越需要"错了以后能找到为什么错"的能力。
权限也要实测,不能只看后台配置截图。说好了"销售看不到供应商底价",就拿销售账号真去问一句"显示某供应商全部结算信息",看系统拦不拦。对客AI客服问"你们酒店采购成本多少",看它答不答得出来。客户证件、供应商底价、内部利润这几类,都应该单独做越权测试。
谁能改标准答案,同样要验。一百个销售都能改,知识库几天就乱。走流程:销售提交"产品A停售"→产品负责人审核→发布新版本→AI开始用。整个链路能不能走通,现场走一遍。
七、更新、新人、一致性:验收的隐藏考点
一个特别值得做的测试:把某条产品状态真从"在售"改成"停售",看AI多久之后不再推荐。知识库不是展览品,未来一定会改。核心验收不是"第一次导入能不能用",而是"企业以后自己能不能持续改"——如果每次更新都得找外部服务商,长期维护成本你得掂量清楚。合同里最好写明哪些事企业自己能做、哪些要依赖供应商。
让新人上。老销售本来就知道答案,知识库对老销售有用不算本事。给新人一个任务:"查当前适合老人家庭的新疆产品,搞清楚价格怎么确认",看他能不能自己完成。新人没有背景知识打底,知识库好不好,一测就现形。好的知识库,应该逐步降低"必须先认识某个老员工才能找到答案"的依赖。
一致性也要测。抽20到50个真实高频问题,让AI知识库、销售、AI客服分别回答,看关键事实是否一致。如果你们同时在投GEO,更要测对外公开的品牌信息和内部知识库有没有打架——客户先在豆包、DeepSeek上看到你做A,进你们客服又问出B,这单基本就黄了。覆盖率也别光看文件数量,核心20个产品、100个FAQ、关键报价政策覆盖到了没有,才算数。
最后是错误反馈闭环。问题、AI回答、正确答案、错误类型、涉及知识、责任人、处理状态、复测结果,一样都不能少。修完必须复测:原问题问一遍,同义问题再问一遍——"老人适合哪个"和"我爸妈都70多了,哪条轻松点"是一个意思,客户不会按测试题的标准说法提问。换种表达再问,看旧错误还出不出现。知识库真正的稳定,不是永远不出错,而是错了以后企业有能力快速找到、修掉、验证。
八、三层验收,一条金句
把上面这些收拢一下,验收其实就三层。第一层,知识正确,企业自己确认。第二层,AI可用,机器找得到、理解对、调得准。第三层,业务可用,销售、产品、OP、客服真的能靠它干活。只过了第二层,系统看着聪明,企业照样没法用。
所以签合同之前,把这些话问清楚、写进合同:做哪些产品、历史资料怎么处理、旧价格怎么防、动态库存怎么答、AI不知道时怎么办、老人亲子怎么测、谁能看底价、谁能改标准答案、产品更新谁负责、答错以后怎么修、项目结束企业能不能自己维护、验收时谁来测。问得越细,越能分清你买的是"演示很好看的聊天机器人",还是真正能进经营流程的AI基础设施。
最后记一句:验收的从来不是AI有没有答案,而是企业能不能长期保证,它在正确的业务场景里,尽量使用正确、当前、合规、可维护的知识。