研究與評測
WebWorld 框架將瀏覽器作為世界模型驗證網頁程式碼,助 27B VLM 效能匹敵 GPT-5.4
HF Daily Papers一手來源
尚未逐項核實
來源為發布方或研究資料;不代表所有主張已獲獨立核實。
WebWorld 系統為了解決視覺語言模型(VLM)在自主改進網頁程式碼時「球員兼裁判」的結構性缺陷,提出將瀏覽器作為確定性的可執行世界模型。
在該框架下,VLM 僅負責生成假設與修復方案,瀏覽器會重新執行候選程式碼,只有在達成目標進度且保留所有先前已驗證功能的條件下,才會核發接受憑證。這些經過認證的行為轉換將作為品質保證,成為監督式微調(SFT)的唯一訓練資料來源。
實驗數據顯示,WebWorld-27B 較原始 27B 模型在 HTMLBench-400 提升 5.3 分,在 MiniAppBench-Val 提升 14.9 分,其互動式 HTML 生成能力已達到 Kimi-K2.6 與 GPT-5.4 等前沿系統水準。消融實驗進一步證實,若移除瀏覽器認證機制,9B 模型的效能提升幅度將大幅縮水至僅剩 0.4 分。
讀原始報導背景
視覺語言模型(VLM)是一種能同時處理與生成文字及影像資訊的多模態人工智慧系統。在人工智慧領域中,世界模型(World model)則是機器學習系統為環境建立的內部表徵,可預測環境對動作的反應,藉此協助 AI 代理進行規劃與推理。