Google 推出 Gemini 3.5 Transcribe 語音轉文字模型,支援雙 API 模式
提供即時串流與預錄處理雙 API,轉錄速度較 Chirp 3 提升 70%,並支援函數呼叫,可委託其他 Gemini 模型執行背景任務。
Google DeepMind綜合 2 家一手來源
64 則值得知道的變化
提供即時串流與預錄處理雙 API,轉錄速度較 Chirp 3 提升 70%,並支援函數呼叫,可委託其他 Gemini 模型執行背景任務。
團隊從 CommonCrawl 下載 8000 萬支影片,透過場景偵測萃取片段並生成影音字幕,支援影片、聲音與圖片的跨模態預訓練。
Runway 宣布即日起在平台上提供 Meta 的 Muse Image 模型,與現有影像及影片模型並列,其底層 Muse-Glimmer-30B 採開源 Apache 2.0 授權。