跳到主要內容
2026-09-16 日報
模型發布

NVIDIA 於 Hugging Face 釋出 FoundationPose 6D 姿態估計模型,免微調即可追蹤新物件並開放商用

HF @nvidia綜合 2 家報導一手來源
已查原文 · 5 項主張

來源為發布方或研究資料;不代表所有主張已獲獨立核實。

報導內容關於 NVIDIA 釋出 FoundationPose 模型的重要主張均有充分證據支持。其基於 Transformer 的架構設計、使用 Isaac Sim 合成資料訓練的細節、支援無微調(zero-shot)及 model-free 部署的特性、開放商業應用的授權條款,以及對各 GPU 微架構的廣泛相容性,皆與 Hugging Face 官方模型卡、GitHub 儲存庫及 arXiv 的公開資訊完全相符。

FoundationPose 採 NVIDIA Open Model License 開放商用,為基於 Transformer 架構,免微調即可應用於新物件。

Hugging Face 模型卡明確指出該模型為商用準備就緒、採用 Transformer 架構,且測試時支援免微調。

ready for commercial use

查看原始出處

Transformer-based

查看原始出處

without fine-tuning

查看原始出處

該模型論文於 2024 年 3 月發布並入選 CVPR 2024 Highlight。

官方 GitHub 註明論文入選 CVPR 2024 Highlight,arXiv 紀錄顯示論文 v2 於 2024 年 3 月更新。

CVPR 2024 (Highlight)

查看原始出處

26 Mar 2024

查看原始出處

推論時需輸入多種資訊,HF 模型卡要求提供 OBJ 格式,而官方 GitHub 亦支援無模型 (model-free) 設定。

模型卡的 Input 區段列出 OBJ 格式要求,而 GitHub 專案則證實了同時支援無模型的追蹤模式。

OBJ format

查看原始出處

model-free setups

查看原始出處

模型訓練完全使用 NVIDIA Isaac Sim 生成的純合成資料,涵蓋 Objaverse 與 GSO 的物件。

模型卡的資料集段落確認了資料來源皆為 Isaac Sim 生成的純合成資料,並包含這兩個資料集。

Purely Synthetic

查看原始出處

NVIDIA Isaac Sim

查看原始出處

Objaverse and GSO

查看原始出處

Deployable_v1.0 提供解密的 ONNX 檔案,支援 TensorRT 及 Blackwell 等全系列 NVIDIA GPU 微架構。

模型卡明確列出 Deployable_v1.0 的檔案格式為解密的 ONNX、採用 TensorRT 引擎,並相容多種 GPU 架構。

decrypted ONNX

查看原始出處

Tensor(RT)

查看原始出處

NVIDIA Blackwell

查看原始出處
NVIDIA 於 Hugging Face 上架 FoundationPose 模型,這是一款用於 6-DoF(自由度)物件姿態估計與追蹤的基礎模型,採 NVIDIA Open Model License 授權,開放商業使用。該模型論文於 2024 年 3 月發布並入選 CVPR 2024 Highlight,採用基於 Transformer 的架構,包含精煉網路(refine net)與評分網路(score net),測試時無需微調即可直接應用於新物件。 推論時需輸入 RGB 影像、深度影像、2D 邊界框與相機內參矩陣。Hugging Face 模型卡指出需提供物件的 CAD 模型(OBJ 格式),但官方 GitHub 儲存庫顯示該模型亦支援無模型(model-free)的追蹤設定。模型訓練完全使用 NVIDIA Isaac Sim 生成的純合成資料,涵蓋來自 ObjaverseLVIS 與 Google Scanned Objects (GSO) 的 3D 物件,並在 LINEMOD 與 YCB-Video 資料集進行評估。 目前釋出的 Deployable_v1.0 版本提供解密的 ONNX 檔案,可於 TAO Triton 應用程式執行推論,並支援 TensorRT。硬體方面,相容從 Pascal、Volta 到 Hopper、Blackwell 等全系列 NVIDIA GPU 微架構。
讀原始報導

背景

FoundationPose 是由 NVIDIA 提出的 6D 物件姿態估計與追蹤基礎模型,結合了卷積神經網路(CNN)與 Transformer 架構,能在不經過微調的情況下直接應用於全新物件。該模型亦可搭配 NVIDIA 的 TensorRT 軟體開發套件(SDK),在 GPU 上實現低延遲與高吞吐量的深度學習推論。

來源