模型發布
Google 發布多模態模型 DiarizationLM-Gemma-4-E4B-v1,支援 Transformers 與 vLLM 等多種推論框架
HF @google一手來源
尚未逐項核實
來源為發布方或研究資料;不代表所有主張已獲獨立核實。
Google 在 Hugging Face 平台正式上架全新多模態模型 DiarizationLM-Gemma-4-E4B-v1。根據官方提供的程式碼範例,該模型支援「圖文轉文字」(image-text-to-text)任務,可同時接收圖片與文字提示進行推論。
為方便開發者部署,Google 提供了廣泛的工具支援與具體設定範例。開發者可透過 Transformers 函式庫的高階 pipeline 或直接載入模型進行推論。此外,該模型亦支援多種主流推論與服務框架,包含 llama.cpp、vLLM、SGLang 與 Ollama,並提供 Q4_0 量化版本的執行指令,允許使用者在 macOS、Linux、Windows 環境或透過 Docker 進行本地端部署,以及架設與 OpenAI 相容的 API 伺服器。
讀原始報導背景
語者分段(Speaker Diarization)是指將音訊根據不同說話者的身分進行切割與標記的技術。DiarizationLM 是 Google 提出的一種框架,利用大型語言模型對語者分段系統的輸出進行後處理。Gemma 則是 Google 基於 Gemini 技術打造的輕量級開源模型系列。