LLM
8 則報導橫跨 8 期2026-08-08 起
2026-09-05Hacker News
開發者撰文指「下一個 token 預測」非 LLM 完整思維模型,RLVR 後訓練已使其轉向探索與追求回報
2026-09-01SemiWiki
Google 發表 UniRoute 模型路由研究:無需重新訓練即可動態新增 LLM,同等品質下成本降 3 至 5 倍
2026-08-29HF Daily Papers
研究指演化策略(ES)在 LLM 推理後訓練具更廣覆蓋率,能解決 GRPO 熵崩潰並提升 Pass@K
2026-08-28INSIDE
Appier 發表 LLM 研究:大型推理模型逾九成推理與回答語言不一致,DPO 訓練可提升 30% 拒答準確率
2026-08-26HF Daily Papers
FORGE 評測指出單一污染網頁即可讓搜尋增強 LLM 推薦假商品,開啟推理反使誤導率上升
2026-08-23Techmeme
SemiAnalysis 報告:從擴展、推論到代理時代,開源模型追趕首個閉源模型的時間皆縮短一半
2026-08-18Reddit r/LocalLLaMA
據報 DeepMind 發表論文指出 LLM 無法生成新穎解釋性假說
2026-08-08DigiTimes