DeltaMedia
2026-07-21
模型動態

ZipSplat 重構 Gaussian 分配邏輯:預算從像素網格解綁,跟著場景複雜度走

主流 feed-forward 3DGS 每個輸入像素對應一個 Gaussian,把表徵預算釘在相機解析度上,白牆和高紋理物件分到一樣多 Gaussian,幾何需求嚴重錯配。

ZipSplat 重構 Gaussian 分配邏輯:預算從像素網格解綁,跟著場景複雜度走

主流 feed-forward 3DGS 每個輸入像素對應一個 Gaussian,把表徵預算釘在相機解析度上,白牆和高紋理物件分到一樣多 Gaussian,幾何需求嚴重錯配。ZipSplat 以 token-based 架構打破慣例:多視角骨幹提取密集視覺 token,k-means 在推理時壓縮為緊湊 scene token,經 attention 精修後由輕量 MLP 解碼為位置不受像素網格約束的 Gaussian。全程不需地面真值姿態或相機內參,論文宣稱在 DL3DV 和 RealEstate10K 雙基準創下新 SOTA。

k-means 聚類在推理而非訓練時執行,是這個架構最值得注意的設計決策:同一訓練好的模型只需調整聚類粒度,就能在品質與效率之間連續滑動,無需重訓。對需要在多種硬體預算下部署 3D 重建的工程團隊,這等於把 quality-efficiency 曲線的控制權交回給使用者。

這篇論文真正丟出的問題是:pixel-aligned 架構是否天生帶著效率上限?如果表徵預算本該跟著幾何複雜度分配,那大多數現有 feed-forward 3DGS 方案都在用錯誤的假設做優化。值得注意的是,SOTA 宣稱目前僅見於論文,架構未經社群獨立複現,留待驗證。

本文由 DeltaMedia 編輯團隊審核後發布 · 編輯原則