跳到主要內容
2026-08-26 日報
研究與評測

Anthropic 啟動 500 萬美元資助計畫,徵求開發 AI 福祉開源評測基準

Anthropic 官網一手來源
尚未逐項核實

來源為發布方或研究資料;不代表所有主張已獲獨立核實。

Anthropic 宣布啟動 500 萬美元的資助計畫,支持獨立研究人員開發開源評測基準,以衡量 AI 模型對使用者福祉(wellbeing)的影響。獲選者將獲得直接資金、Anthropic 模型存取權及技術支援,且研究成果必須作為開源專案發布,供所有開發者使用。 官方指出,福祉評估的難點在於需要大量上下文,例如使用者在心理危機或飲食失調的求助,往往在長篇多輪對話中才會顯現,單一回應在不同情境下可能從合理變為有害。 該計畫鼓勵臨床醫師、心理學家及方法學家參與,並明訂理想的評測基準須具備以下條件: - 包含臨床與主題專家的設計與驗證。 - 同時測試防護措施與潛在傷害,評估過度合規(overcompliance)與過度拒絕(overrefusal)的風險。 - 反映真實使用情況,建構風險會隨對話推進而升級的多輪對話情境。 - 評分標準須經真實專家驗證。 計畫申請截止日期為 9 月 21 日,獲選提交完整提案的名單將於 10 月 5 日公布。
讀原始報導

背景

Claude 是由美國軟體公司 Anthropic 所開發的大型語言模型系列,於 2023 年 3 月首次作為 AI 聊天機器人推出。該模型採用「Constitutional AI」技術進行訓練,旨在提升其安全性、準確性以及道德與法律規範的遵循程度。

來源

相關主題