跳到主要內容
2026-08-26 日報
模型發布

研究團隊開源 Industrial-Instruction 框架與資料集,以 Panasonic 技術文件生成工業 QA,實測 Claude 生成品質較佳但成本高百倍

HF Daily Papers一手來源
尚未逐項核實

來源為發布方或研究資料;不代表所有主張已獲獨立核實。

研究團隊發布並開源 Industrial-Instruction 端到端框架,旨在從工業技術報告中建構指令微調與基準評測資料集。該專案處理 906 份(共 7,525 頁)公開的 Panasonic 文件,透過版面感知擷取與語意檢索索引,合成基於檢索證據的選擇題問答。 團隊使用相同流程產出兩套資料集以進行對比:一套由開源權重的 Qwen3-30B-A3B-Instruct 生成,另一套由閉源 API Claude-Opus-4.6 生成。在過濾初始的 2.39 萬筆樣本後,各提供約 1.36 萬筆問答。實測顯示,Claude-Opus-4.6 產出的原始資料更乾淨(僅 0.5% 被過濾,Qwen 為 43%),但 API 成本約 330 美元,遠高於 Qwen 本地運算的 3.2 美元。 在微調 Qwen3-4B 模型的表現上,使用 Qwen 生成資料使 Set-Match 準確率從 28.5% 提升至 42.0%;使用 Claude 生成資料則從 40.9% 提升至 56.4%。MMLU 評測指出,經 Claude 資料訓練的模型基本保留了通用知識(72.13 降至 72.08),而 Qwen 資料訓練的模型則出現微小的遺忘效應(降至 70.87)。 目前包含兩套資料集、微調後的模型、FAISS 索引及完整生成程式碼均已公開釋出。
讀原始報導

背景

大型語言模型(LLM)通常基於 Transformer 架構,透過大量文本訓練來執行自然語言處理與生成任務。這些模型是 ChatGPT、Claude 等現代聊天機器人的基礎,能夠在多種情境下生成、摘要與分析文本。

來源