開發生態
FlashRT 最佳化多 GPU 部署
HF Daily Papers
FlashRT 提出 agent harness,以 coding agent 將開發者撰寫的多模態參考實作轉換為最佳化的多 GPU 部署。論文指出,其在 NVIDIA B200 上將延遲最高降低約 70 倍、吞吐量提升 2.8 倍;在 AMD MI355X 上達到相近延遲降幅,吞吐量最高提升 3.6 倍。針對 Qwen3-Omni 文字轉音訊推論,FlashRT 在 AMD MI355X 上的回應延遲較專家實作 vLLM-Omni 低 65%。
讀原始報導背景
Agent harness 目前尚無統一定義,通常可理解為包覆模型、使其成為代理程式的系統,負責補足模型本身無法直接完成的能力。既有的 Chain-of-Programming(CoP)框架則將程式生成拆成需求分析、演算法設計、程式實作、除錯與註解五個步驟,呈現以多階段流程引導程式開發的思路。