跳到主要內容
2026-10-09 日報
模型發布

邊緣運算語音辨識模型 Whistle 發布:大小僅 16.9MB,純 CPU 運行並支援 7 國語言轉錄

Hacker News單一來源
核實資料不足

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

本次未取得足夠原文證據

據發布說明,邊緣運算語音辨識模型 Whistle 正式推出,模型檔案僅 16.9 MB,無任何依賴項且完全在 CPU 上運行。該模型與 Needle 共用相同的 C++ 引擎、容器與量化方式,專為手機、穿戴裝置、機器人及微控制器設計。 Whistle 具備三大設備端功能:支援最高 30 秒 16 kHz 單聲道音訊的語音轉錄(涵蓋英、德、法、西、義、荷、波 7 種語言並支援自動偵測)、提供包含機率的單字時間戳,以及無需解碼即可輸出每 80ms 一幀的語音嵌入(Speech embedding)。架構上,編碼器採用 8 個非因果 Simple Attention 區塊,解碼器具備 8 個 Laddered Simple Attention 區塊,並支援透過 `--audio-depth` 參數在載入時選擇解碼層數。解碼過程採用 5 beams 搜尋,支援透過 Aho-Corasick 自動機進行關鍵字偏置(Keyword biasing)以提升特定詞彙機率;若偵測到靜音則直接回傳空值以節省算力。 在官方公布的評測中,Whistle 於 LibriSpeech、SPGISpeech、Earnings-22 及 FLEURS 平均表現上領先;而體積達 145.3 MB 的 Whisper base 則在 TED-LIUM、AMI 及 MLS 平均上佔優。在首字延遲方面,Whistle 隨音訊長度變化,處理 5 秒音訊僅需 5.9 毫秒,30 秒音訊為 36.3 毫秒。目前 Whistle 權重已上架 Hugging Face,C++ 引擎提供包含 iOS、Android、Windows on ARM、RISC-V 及 WASI 等 17 種目標平台的預先編譯版本。
讀原始報導

社群討論

社群讚賞 Whistle 體積小且支援純 CPU 運行,對英語及技術名詞辨識度極高,非常適合嵌入輕量應用。然而,其非英語表現不佳、缺乏即時串流輸出,且有時會陷入重複輸出特定字詞的幻覺。實測顯示其準確度仍不及大型模型(170 句測試中 Qwen 答對 168 句,Whistle 僅 70 句),許多網友更推薦 Parakeet 作為替代方案。