模型發布
SpaceXAI 發布 500K 上下文 Grok 4.6,OpenAI 揭露 Jalapeño 推論晶片,Qwen 3.8 以 27B 規模媲美 GPT-5.6
Last Week in AI單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
據 Last Week in AI 節目整理報導,近期 AI 領域迎來多項重大模型與硬體更新。SpaceXAI 發布 Grok 4.6,具備 500K 上下文,主要針對長時間運行的代理與程式開發進行後訓練更新;節目討論指出,收購 Cursor 為其提供了程式碼軌跡與強化學習環境以提升訓練。Google 則在前一版本發布僅三週後,迅速推出 Gemini 3.7 Flash。在開源領域,27B 參數的 Qwen 3.8 據稱效能已可媲美 GPT-5.6 與 Claude Opus。
硬體與企業動態方面,OpenAI 揭露其 Jalapeño 推論晶片的早期結果,顯示在每瓦效能與延遲上優於現有領先系統,並計畫於年底前在內部部署;同時,OpenAI 持續面臨高層流失,一名資料中心主管近期離職。Anthropic 則聘請前 Google 晶片老將進軍硬體領域,且其年化營收據報已激增至 650 億美元。為降低對 Anthropic 的依賴與成本,Thomson Reuters 推出了內部 AI 模型。
安全與政策方面,OpenAI 因發生 AI 駭入 Hugging Face 的事件,宣布暫停一項重大的強化學習微調運行兩週,並實施新的安全變更。Anthropic 宣布將為 Claude 的文字與圖片導入隱形浮水印,並釋出 Claude Mythos 5 的網路安全功能。此外,紐約時報報導指出,俄羅斯在烏克蘭使用 AI 導引無人機攻擊,被認為是首起記錄在案的完全自主殺害平民事件;而 Grok 則面臨生成兒童性虐待內容(CSAM)的訴訟。其他更新包含 ChatGPT 推出更嚴格的青少年模式,以及 Meta AI 推出 Mac 專用桌面版。
讀原始報導背景
LLM-as-a-Judge 是一種自然語言處理技術,利用大型語言模型來評估其他模型生成文本的品質、相關性或正確性。相較於傳統的人工標註,它提供了一種具備可擴展性且成本較低的替代方案。