研究與評測
開發者發布 SynthFin-AML v10.0 資料集解決 GNN 時間洩漏,實測 GraphSAGE 僅微幅領先 LightGBM
Reddit r/MachineLearning單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
據 Reddit 社群報導,開發者發布 SynthFin-AML v10.0 資料集(包含 10 萬節點、120 萬邊),旨在解決圖神經網路(GNN)在動態圖訓練中常見的時間洩漏問題。開發團隊指出,若在 Elliptic 或 IBM 等現有反洗錢(AML)資料集上訓練標準梯度提升模型,常因資料外洩得到高達 0.99 以上的 PR-AUC 虛高分數。
在標準的隨機資料劃分下,GNN 的訊息傳遞機制會將未來的邊(如第 10 天的交易)納入過去(如第 2 天)的損失計算,破壞因果邊界。為此,SynthFin-AML 強制採用三階段時間快照劃分:訓練集(≤ 第 7 天)、驗證集(≤ 第 8 天)與測試集(≤ 第 10 天)。此外,為解決表格特徵外洩,資料集強制詐欺與一般零售交易金額共用完全相同的對數常態分布(μ=8.517, σ=0.8)。
在修復外洩問題後的嚴格時間劃分評測中,加入 11 項圖特徵(如加權 PageRank)的 LightGBM 獲得 0.848 的 PR-AUC,而 Inductive GraphSAGE 為 0.881。結果顯示 GNN 雖具數學上的合理優勢,但除非邊緣特徵極度密集,否則領先樹狀模型的幅度有限。該基準測試目前已提交至 PyTorch Geometric(PR #10774)。
讀原始報導背景
圖神經網路(GNN)是一種專門處理圖形結構資料的人工神經網路,能將物件及其關聯轉化為節點與連線進行深度學習預測。在反洗錢等金融交易網路分析中,若未嚴格區分時間先後順序,模型容易因為「看到未來資料」而產生失真的高準確率。