RAG 是当前解决大模型三大短板——知识过时、知识库受限、幻觉乱编——最实用、成本最低的方案。核心思想:不改变模型本身,给它配一个"外挂资料库"。
| 问题 | 表现 | 根因 |
|---|---|---|
| 知识过时 | 问"今天有什么新闻"回答 2023 年的事 | 训练数据有截止日期 |
| 知识库受限 | 问公司内部文档,完全不知道 | 私有数据不在训练集里 |
| 幻觉乱编 | 一本正经地胡说八道 | 模型本质是概率预测,不是知识检索 |
RAG 的解法:不给模型口头承诺,把真实资料原文塞进提示词,让它"照本宣科"。
原文档(50 页 PDF)
↓ 文本提取 + 切片(chunk_size=512, chunk_overlap=50)
[块1] [块2] [块3] ... [块N]
↓ 去除空行、特殊字符、无意义短块
干净的知识片段
用户问题:"公司去年营收多少?"
↓ Embedding → 问题向量
在向量库中计算余弦相似度
↓
[块47: 0.91] [块12: 0.78] [块89: 0.65]
↓ 取 Top-K (通常 3~10)
最相关的文档片段
System Prompt:
"请只根据以下资料回答,如无答案请说'未找到'。
【参考资料】
{检索到的 Top-K 文本块}
【用户问题】
{用户原始问题}" → LLM → 有据可查的答案
| 价值 | 说明 |
|---|---|
| 💰 低成本 | 不用微调大模型,外挂知识库即可 |
| 🔒 数据安全 | 全部私有资料,数据不外泄 |
| ✅ 杜绝幻觉 | 答案有据可查,可追溯来源 |
| 🔄 实时更新 | 随时更新知识库,不用重新训练 |
| 短板 | 说明 | 应对 |
|---|---|---|
| 无语义逻辑 | 只能做相似匹配,不懂因果 | 搭配图数据库(Neo4j) |
| 切片信息断裂 | 切割可能破坏上下文 | 优化切片策略 |
| 检索精度瓶颈 | 纯向量相似 ≠ 真正相关 | Reranker + 混合检索 |
| 复杂推理乏力 | 多步推理需多次检索 | Agent + 多轮 RAG |
切片→向量→检索→回答
FAQ、文档问答
+Reranker+混合检索
企业知识库、客服
+Neo4j 图数据库
知识图谱、风控溯源
+Agent + 工具调用
研究助手、深度问答
RAG 的地基——轻量高性能向量数据库。文本→Embedding→向量存储→语义检索。含 Python 代码示例。
节点 + 关系 + 属性——储存逻辑脉络而非数据罗列。Cypher 查询语法 + 知识图谱构建。
普通 RAG 只用向量库,高阶智能 RAG 必须向量库+图库联动。含决策指南和 GraphRAG 架构。
RAG 的优雅之处在于它的务实——不追求从根本上"修复"大模型的幻觉问题,而是用一个外挂系统绕过去。就像一个人不可能记住所有知识,但只要有个好图书馆和检索能力,就能回答大部分问题。
但 RAG 不是银弹。真正深度的理解和推理,是 RAG + LLM + Knowledge Graph 三者共振的结果。