模型發布
Cactus發布Gemma 4 Hybrid
Hacker News
Cactus 發布 Gemma 4 E2B Hybrid,在模型 checkpoint 內建信心探針,為每次回答輸出 0 至 1 的信心分數,低於門檻時可自動轉交較大型模型。FP16 版本在多數基準僅需將 15–35% 的查詢轉交 Gemini 3.1 Flash-Lite,即可達到相近表現。其判別答案正誤的平均 AUROC 為 0.814,且未使用音訊資料訓練探針,仍在四項音訊基準取得 0.79–0.88。所有版本已上架 Hugging Face,程式採 MIT 授權,但 Gemma 模型仍受 Gemma 條款約束。
讀原始報導背景
選擇性預測(selective prediction)利用校準後的信心指標,讓模型在輸出可能不可靠時停止作答,以提升安全性與準確度。Cactus Hybrid 將評分探針置入模型檢查點,為每次回答提供 0 到 1 的結構化信心分數,讓應用程式可在信心不足時把請求轉交雲端或更大型的模型。
社群討論
整體肯定從 hidden state 擷取不確定性訊號的想法,但核心爭議是它只能衡量「不確定/不一致」,不能宣稱模型「知道自己錯了」;也有人質疑若分數可靠,低分時改用不同 seed 重跑即可,未必需要 handoff。留言建議用 conformal prediction 校準門檻、結合 token entropy 與 verbal confidence,並測試 coding task、較大型本地模型及模型品質是否退化。開發者補充目前以 rolling entropy 做逐 token early exit、probe 評估完整輸出,主模型權重凍結所以不會因此退化,但重跑在 edge device 很耗電,且主要只在 7B+ 模型上有「尚可」效果。