跳到主要內容
2026-09-02 日報
研究與評測

WebWorld 框架將瀏覽器作為世界模型驗證網頁程式碼,助 27B VLM 效能匹敵 GPT-5.4

HF Daily Papers一手來源
尚未逐項核實

來源為發布方或研究資料;不代表所有主張已獲獨立核實。

WebWorld 系統為了解決視覺語言模型(VLM)在自主改進網頁程式碼時「球員兼裁判」的結構性缺陷,提出將瀏覽器作為確定性的可執行世界模型。 在該框架下,VLM 僅負責生成假設與修復方案,瀏覽器會重新執行候選程式碼,只有在達成目標進度且保留所有先前已驗證功能的條件下,才會核發接受憑證。這些經過認證的行為轉換將作為品質保證,成為監督式微調(SFT)的唯一訓練資料來源。 實驗數據顯示,WebWorld-27B 較原始 27B 模型在 HTMLBench-400 提升 5.3 分,在 MiniAppBench-Val 提升 14.9 分,其互動式 HTML 生成能力已達到 Kimi-K2.6 與 GPT-5.4 等前沿系統水準。消融實驗進一步證實,若移除瀏覽器認證機制,9B 模型的效能提升幅度將大幅縮水至僅剩 0.4 分。
讀原始報導

背景

視覺語言模型(VLM)是一種能同時處理與生成文字及影像資訊的多模態人工智慧系統。在人工智慧領域中,世界模型(World model)則是機器學習系統為環境建立的內部表徵,可預測環境對動作的反應,藉此協助 AI 代理進行規劃與推理。

來源

本期分類