研究與評測
vivo 發表 KDC 知識工程理論:區分表示與知識,指出 RAG 檢索片段需經驗證才能作為知識
InfoQ 中國多家報導
尚未逐項核實
多個報導來源提及此事;未必是彼此獨立的證據。
vivo 肖博與 GPT-5.5 協作發表「知識驅動計算(KDC)」AI 應用軟體工程理論,探討 RAG(檢索增強生成)系統中的知識表示與驗證機制。文章指出,企業 AI 系統常將「尋找材料」與「獲取知識」混淆,例如 RAG 系統可能因語義匹配度高而召回已過期的舊版退款政策,導致模型生成錯誤回答。
KDC 理論區分了「表示(Representation)」與「知識(Knowledge)」:PDF、資料庫紀錄、Embedding 向量與 RAG 檢索片段僅為現實的數位表示,無法自動證明其真實性、有效性或適用性。知識則被明確定義為「已驗證、可復用,並能降低預測、推理、決策或行動不確定性的認知成果」。
該理論引入「知識成熟度(Knowledge Maturity)」,將內容劃分為假設(Hypothesis)、候選知識(Candidate Knowledge)、已驗證知識(Verified Knowledge)與權威知識(Canonical Knowledge)四個階段,不同成熟度將觸發不同的系統行為與風險控制。
在工程實作上,KDC 要求將內容封裝為「知識物件(Knowledge Object)」,必須包含身分、來源、語義、上下文、證據、版本、成熟度、衝突狀態、生命週期與權限等屬性。KDC 將 RAG 定位為知識流的局部機制,僅負責材料召回與上下文裝配,需與版本關係、有效期限、衝突處理及適用範圍過濾等機制協同,而非獨自承擔完整的知識生命週期。
讀原始報導背景
檢索增強生成(RAG)是一種讓大型語言模型(LLM)能從外部資料來源檢索並整合新資訊的技術。在目前的 AI 應用中,系統常透過 Embedding 將內容編碼到向量空間來計算相似性並召回資料。然而,這些技術僅解決了資料的檢索與表示問題,並不代表模型獲得了經過驗證且當前有效的知識。
來源
- AI 前線infoq.cn
- en.wikipedia.org