SciForma強化科學圖表結構
研究團隊提出 SciForma 科學方法圖表生成框架,將結構品質拆分為元件、箭頭與文字三個面向,並建立 SciFormaData-700K 訓練資料集及 SciFormaBench-2K 評測基準。其 M-DPO 方法可在後訓練階段同時要求各面向正確,並將梯度導向表現最不足的維度,也支援推論時反覆編輯修正。
17 則值得知道的變化
研究團隊提出 SciForma 科學方法圖表生成框架,將結構品質拆分為元件、箭頭與文字三個面向,並建立 SciFormaData-700K 訓練資料集及 SciFormaBench-2K 評測基準。其 M-DPO 方法可在後訓練階段同時要求各面向正確,並將梯度導向表現最不足的維度,也支援推論時反覆編輯修正。
ReViV 提出首個整合式第一人稱 4D 重建框架,可從單目 RGB 影片同步重建相機軌跡、視線、全身與手部動作及深度。其 Masked Generative Egocentric Transformer 採單一前饋架構,在多項基準的準確度與效率達到最佳或具競爭力表現,且不依賴繁重的任務特定先驗。程式碼與模型已完整開源。
研究團隊提出 ShotPlan,透過可學習的規劃 token 與 FRoPE,讓文字轉影片模型能逐幀控制多鏡頭轉場時間。這套方法可整合至預訓練 DiT,無須注意力遮罩或修改架構,並支援硬切、柔和轉場及局部運鏡。實驗顯示其鏡頭管理與跨鏡頭一致性優於既有方法,模型與訓練資料亦已提供。
這篇論文提出 self-state attacks,系統化分析自託管 AI agent 的記憶與設定檔遭自身合法 OS 系統呼叫破壞的風險。研究以四軸攻擊空間建立 23 類攻擊、實作 43 項真實檔案操作,並透過實際活動軌跡評估防禦策略。
研究提出 Token-Level Off-Policy Labeling(TOPL),將 off-policy 後訓練重構為 token 級正確性預測任務,引導模型產生更忠實的內容。實驗顯示,TOPL 在 11 個文件摘要資料集上具備良好的分布外泛化能力,並可有效遷移至機器翻譯任務。
研究提出 SWE-Pruner Pro,利用編碼代理自身的內部表徵,逐行判斷並裁剪工具輸出,無須額外的程式碼分類器。在兩個開放權重骨幹與四項多輪評測中,此方法最多節省 39% 的提示與完成 token,同時維持任務品質,且推論額外負擔有限。
研究提出 Experiential Learning,將 LLM-as-a-Judge 轉為 LLM-as-a-Coach,從策略模型的 on-policy 回應萃取可轉移的經驗知識,再透過 on-policy 情境蒸餾寫入模型權重。
據單一來源報導,OpenAI 推出內部自動化紅隊模型 GPT-Red,透過對抗式自我對弈訓練,大規模尋找提示注入漏洞。這項消息可能影響 AI 安全研究,但官方尚未證實相關內容。