研究與評測
Shopify 推出 Gisting 提示詞壓縮技術:系統提示詞縮減 75%,端到端延遲降至 4.2 秒
AI 前線單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
據報導,Shopify 工程團隊推出名為 Gisting 的新技術,可將冗長的 LLM 系統提示詞壓縮為精簡的「Gist」詞元集合,以提升吞吐量並降低推論成本。在 Sidekick GraphQL 代理的應用中,該技術將系統提示詞從約 6000 個詞元壓縮至 1500 個(4:1 壓縮比),且未犧牲預測品質。
效能數據顯示,在每分鐘 350 次請求(RPM)負載下,首詞元時間(TTFT)中位數從 438 毫秒降至 354 毫秒,端到端請求延遲中位數從 6.8 秒降至 4.2 秒,吞吐量從 20.2 QPS 提升至 23.4 QPS,使團隊得以減少 GPU 分配量。
Gisting 技術源自 2022 年的論文,透過教師與學生模型的兩步流程,最小化兩者對數機率的 KL 散度來學習 Gist 詞元的嵌入向量。訓練完成後,Gist 嵌入會直接寫入模型的嵌入矩陣,並註冊為分詞器中的特殊詞元。在推論階段,模型可如常載入運行,無需修改核心權重、自訂注意力遮罩或額外編碼器。
Shopify 強調,Gisting 處理的是經過學習的表徵而非傳統文本摘要,且與前綴快取(Prefix Caching)技術高度互補。前綴快取可避免重新計算 KV 張量,而 Gisting 則透過縮短詞元序列進一步減少解碼階段處理快取張量的開銷,兩者疊加使用可最大化最佳化效果。
讀原始報導