研究與評測
華為團隊提出 PrismAlign 表格提取方法:採多視角 VLM 對齊解決幻覺,OmniDocBench 1.5 獲 95 分
AI 前線單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
據報導,華為團隊提出名為 PrismAlign 的多視角視覺語言模型(VLM)對齊框架,旨在解決複雜表格結構化提取中的幻覺問題,相關論文獲 EMNLP Industry Track 2026 收錄。
該方法借鑒人類立體視覺,將表格結構對齊與單元格內容對齊解耦,並引入「行列守恆」與「物理極限」等表格幾何不變量作為先驗約束。在推論階段,PrismAlign 透過貝氏推論計算最大後驗機率(MAP),並引入 TEDS-Structure 相似度過濾與多數視角拓撲偏離的異常輸出,僅在單元格粒度達成高置信共識時才確認結果。
在工程部署上,PrismAlign 支援 Shared-Encoder 方案,讓參與觀測的多個模型共用視覺編碼器權重,避免記憶體與 prefill 時間隨模型數量線性增加;同時系統可輸出單元格粒度的置信度分數,支援 Human-in-the-Loop 工作流,將低置信區域精準路由至人工複核。
評測數據顯示,PrismAlign 在 OmniDocBench 1.5 中 TEDS 達 94.62、TEDS-Structure 達 97.30、Overall 達 95 分區間,並在 CC-OCR 與 PureDocBench 的表格任務中達到 SOTA。
讀原始報導