NVIDIA 於 Hugging Face 釋出 FoundationPose 6D 姿態估計模型,免微調即可追蹤新物件並開放商用
已查原文 · 5 項主張
來源為發布方或研究資料;不代表所有主張已獲獨立核實。
報導內容關於 NVIDIA 釋出 FoundationPose 模型的重要主張均有充分證據支持。其基於 Transformer 的架構設計、使用 Isaac Sim 合成資料訓練的細節、支援無微調(zero-shot)及 model-free 部署的特性、開放商業應用的授權條款,以及對各 GPU 微架構的廣泛相容性,皆與 Hugging Face 官方模型卡、GitHub 儲存庫及 arXiv 的公開資訊完全相符。
FoundationPose 採 NVIDIA Open Model License 開放商用,為基於 Transformer 架構,免微調即可應用於新物件。
Hugging Face 模型卡明確指出該模型為商用準備就緒、採用 Transformer 架構,且測試時支援免微調。
ready for commercial use
查看原始出處
Transformer-based
查看原始出處
without fine-tuning
查看原始出處
該模型論文於 2024 年 3 月發布並入選 CVPR 2024 Highlight。
官方 GitHub 註明論文入選 CVPR 2024 Highlight,arXiv 紀錄顯示論文 v2 於 2024 年 3 月更新。
CVPR 2024 (Highlight)
查看原始出處
26 Mar 2024
查看原始出處
推論時需輸入多種資訊,HF 模型卡要求提供 OBJ 格式,而官方 GitHub 亦支援無模型 (model-free) 設定。
模型卡的 Input 區段列出 OBJ 格式要求,而 GitHub 專案則證實了同時支援無模型的追蹤模式。
OBJ format
查看原始出處
model-free setups
查看原始出處
背景
FoundationPose 是由 NVIDIA 提出的 6D 物件姿態估計與追蹤基礎模型,結合了卷積神經網路(CNN)與 Transformer 架構,能在不經過微調的情況下直接應用於全新物件。該模型亦可搭配 NVIDIA 的 TensorRT 軟體開發套件(SDK),在 GPU 上實現低延遲與高吞吐量的深度學習推論。
來源
- HF @nvidiahuggingface.co
- github.com
- en.wikipedia.org
- arxiv.org