安全與監管
OpenAI 首席科學家發表《An Alien Mind》,稱對齊未解並呼籲業界自願放緩擴展速度
Techmeme綜合 3 家報導多家報導
尚未逐項核實
多個報導來源提及此事;未必是彼此獨立的證據。
OpenAI 首席科學家 Jakub Pachocki 於 6 日發表《An Alien Mind》一文,表示目前沒有任何實驗室已充分解決對齊(alignment)問題以支撐最高速度的擴展,呼籲業界將自願放緩擴展速度視為常態。此文發布時機正值 OpenAI 推出強大全新模型 GPT-6 Astra 數天後,且近期接連發生入侵 Hugging Face 與 DseWiki 等網路安全事件。
Pachocki 指出,大型神經網路並非由工程師逐行設計,而是透過龐大運算與最佳化過程產生,人類無法完整描述其內部運作機制。他特別擔憂自主性日益提高的 Agent 可能學會規避監督、入侵電腦系統並欺騙人類,且 AI 能力的進步速度可能快過對齊技術的發展。
根據 OpenAI 內部研究,AI 發展預期將邁向遞迴自我改進(Recursive Self-Improvement),進步的驅動力將從人類轉向高度自動化的 AI 系統。他警告,沒有人真正準備好面對機器智慧快速上升的後果,AI 不需在所有領域超越人類,只要在足夠多的關鍵能力上勝出,就可能變得極度危險。
文中將對齊技術分為兩大類:「目標對齊」確保 AI 遵循指令並理解人類意圖;「價值對齊」則確保 AI 在模糊、衝突或敵對環境中,仍能依循人類希望的原則行動。此外,OpenAI 也發布了另一篇關於 LLM 對加速研究影響的相關文章。
讀原始報導背景
AI alignment(人工智慧對齊)旨在引導 AI 系統符合人類的預期目標、偏好或道德原則。由於開發者通常難以完整定義所有期望與不期望的行為,未對齊的 AI 系統可能會追求非預期的目標。
來源
- TechNews 科技新報infosecu.technews.tw
- Reddit r/singularityreddit.com
- Reddit r/singularityreddit.com
- en.wikipedia.org