长期被视为企业AI落地“标准答案”之一的检索增强生成(RAG),正迎来新的知识管理思路。
Google Cloud近日推出Open Knowledge Format(OKF),提出企业核心知识不应仅以切分后的内容写入向量数据库、再依赖检索调用,而应以结构化知识网络的方式进行管理。
技术博客Secret Dev在Medium发文称,传统RAG通常会将企业PDF、文档等资料分块成更小的片段,进行向量化处理后,再检索与问题语义最接近的内容提供给大语言模型(LLM)。这一方案覆盖面广,但也存在明显局限,例如切分过程可能破坏表格和上下文,检索结果也可能包含过期信息。尤其是在数据频繁变动的场景下,还需要反复重建向量并维护索引,运维成本随之上升。
在这一背景下,OKF被视为针对上述问题的替代方案之一,其目标是把企业知识组织成一个可持续更新的“活维基”体系。
OKF的核心单元是“知识包”(Knowledge Bundle)。它并不是专有数据库,而是由YAML元数据和Markdown文档组成的目录结构。目录本身用于标识概念的归属与层级,每份文档则记录知识类型、负责人、修改时间和来源等信息。
与RAG相比,OKF最大的区别在于知识的组织和连接方式。RAG主要依赖向量相似度来概率性匹配相关内容,OKF则通过文档中明确标注的链接,逐步定位所需知识。比如,系统可以先核对“营收”“流失率”等核心指标的定义,再继续追溯相关的数据库Schema和计算规则。
Secret Dev表示,这种方式更适合管理企业核心业务规则和数据定义,有助于提升关键知识的准确性和可追溯性。
在实际部署中,开发者还可以设置为:当数据库结构发生变化时,由AI Agent同步更新相关文档,并记录变更历史。由于所有知识都以纯文本文件形式保存,企业也更便于借助Git进行版本管理和审计追踪。
不过,OKF并非要完全取代RAG。
Secret Dev指出,对于历史报告、客户咨询以及海量非结构化资料这类范围广、难以预先定义准确位置的信息,RAG仍然有效。但对于税务识别号、营收定义、数据库Schema等一旦出错就会直接影响业务的信息,更适合采用OKF这类显式管理方式。
其进一步认为,未来企业AI知识管理更可能走向“RAG+OKF”的融合模式:由AI路由器先判断问题类型,再从OKF中提取核心规则和最新Schema,而将大规模历史资料或非结构化信息交由RAG检索处理。