開發生態
Cloudflare 詳解 Town Lake 統一資料平台:計費工作負載占查詢 53%,Skipper 支援自然語言分析
InfoQ 中國多家報導
尚未逐項核實
多個報導來源提及此事;未必是彼此獨立的證據。
Cloudflare 公布內部統一資料平台 Town Lake 的架構與使用情況,計費工作負載占平台查詢的 53%;搭配 AI 資料代理 Skipper後,員工可用自然語言提出可稽核的企業資料查詢。Cloudflare 的全球網路遍及 120 個國家、超過 330 座城市,每秒處理逾 10 億筆事件;Town Lake 用於統一存取原先散落於 Postgres、ClickHouse、Kafka、BigQuery 與物件儲存系統的營運、計費、安全及業務資料。
Town Lake 採用 lakehouse 架構,由 Apache Trino、Apache Iceberg、Cloudflare R2 與負責中繼資料管理的 DataHub 組成,透過單一 SQL 介面跨系統查詢。單一查詢可在不搬移資料的情況下連接 Postgres、ClickHouse 與 Iceberg 表,周邊服務則負責資料擷取、轉換、存取控制及個人身分識別資訊(PII)偵測。
平台採預設封閉的治理模式,新加入的資料集在完成自動掃描與人工審查前均不可存取。內部服務 Skimmer 結合自動分類與 AI 分析偵測敏感資料,再由人工複核分類並授予權限。
建構於 Town Lake 之上的 Skipper,會使用中繼資料、結構定義、轉換譜系、文件及執行階段檢查,把自然語言要求轉換為經驗證的查詢,目前用於計費分析、客戶支援調查、商業智慧與安全工作流程。測量期間共有 324 名員工發起 91,760 次計費相關查詢,涵蓋計費分析、支援調查與營運報告。
Cloudflare 的實作結果顯示,簡化 Skipper 的提示詞可提高準確度,合併功能重疊的工具可減少錯誤選擇;將 SQL 轉換邏輯與資料譜系納入代理上下文,也比僅提供結構中繼資料更能協助理解業務語意。Cloudflare 接下來計畫把 Skipper 更深入整合至內部聊天、工單與開發工作流程,並擴充 Transformer 流水線,讓團隊以 SQL 和中繼資料檔案定義資料集,再自動完成部署、監控、編目及在 DataHub 與 Skipper 中呈現;公司也預計把更多 Town Lake 工作負載移至 R2 SQL。
讀原始報導來源
- AI 前線infoq.cn