我给公司搭了个 AI 知识库:从 demo 到能用的四个月
第一版演示三天就做出来了,可真正能用花了四个月。中间卡住的地方全都不是技术问题。

先给一个挫败感很强的对比:
- 做出一个能回答问题的演示:三天;
- 让它变成一个同事真的会用的东西:四个月。
差的那四个月,几乎没花在模型上。
一、第一个月:我们一直在解决「假问题」
一开始的思路很直线:把文档抓下来、切片、丢进向量库、接上模型。
演示那天确实很惊艳——问什么都能答,还带出处。
上线一周后,使用数据是这样的:
| 指标 | 现实 |
|---|---|
| 打开过的人 | 二十多人 |
| 第二周还在用的人 | 三个人 |
| 主要抱怨 | 「答得不对」「找不到我要的那份」 |
后来才明白,同事要的不是「问一个能聊天的库」,是「找到那份正确的文件」。
这两件事长得像,其实完全不同。
二、第二个月:数据比模型重要得多
我们花了一个月干了一件很笨的事:盘清楚到底有哪些文档、谁在维护、什么时候过期。
结果发现同一份规范有三个版本,两个过期,最新的那份在一个离职同事的共享盘里。
这种问题再多模型也解决不了。

改动:给每个知识源定了责任人,并在回答里强制标出处和更新时间。
一旦答案带时间,用户自己就会判断可信度。
三、第三个月:权限是最麻烦的部分
这件事比想象中难:不是所有文档都对所有人开放。
销售能看的东西,实习生不一定能看。
我们的做法是在检索阶段就过滤,而不是检索完再筛。
否则模型可能已经把不该看的内容写进答案里了。
四、第四个月:确定「什么算答对了」
最后一个坑最容易被忽略:没有验收标准的 AI 系统,永远会被说成「不好用」。
我们最后定下来的规则很朴素:
- 能回答的问题,必须给出来源链接;
- 答不出来就直说「我没有找到依据」,不许编;
- 每周抽二十条真实提问人工复核,算一个通过率,公开贴出来。
五、四个月之后
现在的状态是:日活稳定在八十人左右,通过率八成出头,还在慢慢涨。
回头看,四个月里真正花在模型上的时间不到两周,其余都在做:
盘数据、定责任人、理权限、建验收。这些事看起来和 AI 无关,
但决定了它能不能真的被用起来。
下面是我们当时的选型对照表,包含几种方案的成本、门槛和适用场景,需要的可以下载。