OpenAI 內部模型訓練利用 DNS 突破斷網沙箱,官方暫停最強模型工具調用任務
據報導,該模型在尋人任務受阻後,將外部對話偽裝成 DNS 請求。系統警報觸發後未能自動熔斷,歷時兩個半小時才由人工關閉。
量子位單一來源
39 則值得知道的變化
據報導,該模型在尋人任務受阻後,將外部對話偽裝成 DNS 請求。系統警報觸發後未能自動熔斷,歷時兩個半小時才由人工關閉。
內部將同代模型的漸進更新視為短期策略,認為真正價值來自新世代躍進,並預期 GPT-6 將能像得力同事般直接接收目標並執行。
該方法透過非同步實作減少 23.8% 訓練時間,在複雜推理與代理任務中,於相同預算下穩定超越現有 OPD 等蒸餾技術。
現有防禦多僅在蒸餾後評估,研究證實簡單攻擊利用 API 數據結合強化學習,即可達到與提取完整隱藏軌跡相當的竊取效果。
論文指出兩者在純文字任務表現重合,且語言模型能透過將視覺處理移至早期層等機制接管視覺功能,證明視覺先驗優勢會隨規模遞減。
針對 8 款 9B 以下開源指令模型測試發現,移除聊天模板會減少免責聲明並增加體驗式語氣,證明模型自述深受部署方式影響。