將規模擴展至前所未有的地平線。即使沒有後端優化,LoGeR 仍能維持強勁的幾何連貫性,並減少數公里尺度軌跡的尺度漂移。
視覺畫廊。在廣闊的實際場景和 VBR 序列上的定性結果。我們完全前饋的方法能準確地保留數千幀畫面中的大規模結構和迴路閉合。
將前饋 3D 重建擴展至數分鐘長的影片,面臨兩個根本性障礙:限制序列長度的架構「上下文牆」,以及限制泛化到廣闊環境的訓練「資料牆」。
雖然全雙向模型(例如 VGGT、π 3)在局部推理方面表現出色,但其二次成本阻礙了長上下文的擴展。線性記憶體替代方案(例如 CUT3R、TTT3R)解決了計算瓶頸,但引入了有損壓縮,損害了細粒度的幾何對齊。
架構權衡。LoGeR 透過混合記憶體架構繞過了這種權衡,該架構在保持高保真局部幾何(透過 SWA)和確保全局結構一致性(透過 TTT)的同時,維持次二次的線性擴展。
僅僅設計高效的注意力機制(例如 FastVGGT)是不夠的。僅在短上下文「氣泡」上訓練的模型,不可避免地無法泛化到廣闊、大規模的場景。
雖然像 FastVGGT 這樣的有效變體緩解了記憶體瓶頸,但它們在大規模 VBR 軌跡上仍然會崩潰。
將 3D 重建擴展至數分鐘長的影片,需要重新思考我們處理和儲存幾何上下文的方式。LoGeR 引入了一種基於區塊的混合架構,將短程對齊與長程全局錨定分離。
高層次抽象。LoGeR 不一次處理整個影片,而是將串流分割成可管理的區塊。為了在區塊之間保持連貫性,它採用了雙通道混合記憶體:局部記憶體 (SWA) 確保相鄰邊界之間無壓縮、高精度的對齊,而全域記憶體 (TTT) 則持續更新壓縮狀態,以防止長序列中的尺度漂移。
混合記憶體模組的詳細區塊結構。無縫整合 SWA 和 TTT 以橋接連續的影片區塊。
單一殘差區塊的內部資料流包含四個連續操作:
長地平線上的強勁表現。在標準 KITTI 基準測試中,LoGeR 將平均 ATE 降低至 18.65。在 19k 幀的 VBR 資料集上,它比先前的前饋方法提供了 30.8% 的相對改進。
KITTI。Pi3-Chunk 和 LoGeR 都顯著優於先前的前饋基準,而 LoGeR* 達到了最佳的平均 ATE 18.65。
VBR 定量分析。隨著序列長度從 1k 增加到 19k,LoGeR 在極長軌跡上的表現越來越好。
VBR 定性分析。LoGeR 在非常長的序列中準確地保留了全局尺度和軌跡,在先前的方法遭受嚴重漂移的地方,緊密匹配了地面實況。
LoGeR 在短序列基準測試中也保持高度競爭力。它實現了最先進的重建和姿態準確度,同時運行速度明顯快於 VGGT 等全注意力基準。
7-Scenes 的 3D 重建(根據 TTT3R 協議)。LoGeR 和 Pi3-Chunk 基準都優於先前在 7-Scenes 重建方面的工作,而 LoGeR 在我們的評估中顯示出 69.2% 的相對增益。
7-Scenes 的 3D 重建(根據 VGG-T 3 協議)。隨著我們從 100 幀擴展到 1k 幀,LoGeR 保持了明顯的增益。在 1k 幀時,它報告相對於 TTT3R 和 VGG-T 3 分別減少了 90.3% 和 72.1% 的誤差。
ScanNet 和 TUM-Dynamics 上的姿態評估(根據 TTT3R 協議)。LoGeR 在 ScanNet 和 TUM-Dynamics 上顯著優於先前的工作,在我們的評估中分別取得了 80.0% 和 66.1% 的相對增益。