VGGT-Det: Mining VGGT Internal Priors for Sensor-Geometry-Free Multi-View Indoor 3D Object Detection
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Cao, Yang, Wu, Feize, Chen, Dave Zhenyu, Zhong, Yingji, Hong, Lanqing, Xu, Dan |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Taming Video Diffusion Prior with Scene-Grounding Guidance for 3D Gaussian Splatting from Sparse Inputs
par: Zhong, Yingji, et autres
Publié: (2025)
par: Zhong, Yingji, et autres
Publié: (2025)
FrameVGGT: Geometry-Aligned Frame-Level Memory for Bounded Streaming VGGT
par: Xu, Zhisong, et autres
Publié: (2026)
par: Xu, Zhisong, et autres
Publié: (2026)
VGGT-World: Transforming VGGT into an Autoregressive Geometry World Model
par: Sun, Xiangyu, et autres
Publié: (2026)
par: Sun, Xiangyu, et autres
Publié: (2026)
VGGT-Segmentor: Geometry-Enhanced Cross-View Segmentation
par: Gao, Yulu, et autres
Publié: (2026)
par: Gao, Yulu, et autres
Publié: (2026)
VGGT-X: When VGGT Meets Dense Novel View Synthesis
par: Liu, Yang, et autres
Publié: (2025)
par: Liu, Yang, et autres
Publié: (2025)
LiteVGGT: Boosting Vanilla VGGT via Geometry-aware Cached Token Merging
par: Shu, Zhijian, et autres
Publié: (2025)
par: Shu, Zhijian, et autres
Publié: (2025)
FastVGGT: Training-Free Acceleration of Visual Geometry Transformer
par: Shen, You, et autres
Publié: (2025)
par: Shen, You, et autres
Publié: (2025)
GPA-VGGT:Adapting VGGT to Large Scale Localization by Self-Supervised Learning with Geometry and Physics Aware Loss
par: Xu, Yangfan, et autres
Publié: (2026)
par: Xu, Yangfan, et autres
Publié: (2026)
Dense Semantic Matching with VGGT Prior
par: Yang, Songlin, et autres
Publié: (2025)
par: Yang, Songlin, et autres
Publié: (2025)
FlashVGGT: Efficient and Scalable Visual Geometry Transformers with Compressed Descriptor Attention
par: Wang, Zipeng, et autres
Publié: (2025)
par: Wang, Zipeng, et autres
Publié: (2025)
VGGT: Visual Geometry Grounded Transformer
par: Wang, Jianyuan, et autres
Publié: (2025)
par: Wang, Jianyuan, et autres
Publié: (2025)
StereoVGGT: A Training-Free Visual Geometry Transformer for Stereo Vision
par: Chen, Ziyang, et autres
Publié: (2026)
par: Chen, Ziyang, et autres
Publié: (2026)
VGGT-$Ω$
par: Wang, Jianyuan, et autres
Publié: (2026)
par: Wang, Jianyuan, et autres
Publié: (2026)
VGGT-SLAM++
par: Mandal, Avilasha, et autres
Publié: (2026)
par: Mandal, Avilasha, et autres
Publié: (2026)
VGGT-CD: Training-Free Robust Registration for 3D Change Detection
par: Zhang, Wei, et autres
Publié: (2026)
par: Zhang, Wei, et autres
Publié: (2026)
VGGT4D: Mining Motion Cues in Visual Geometry Transformers for 4D Scene Reconstruction
par: Hu, Yu, et autres
Publié: (2025)
par: Hu, Yu, et autres
Publié: (2025)
VGGT-MPR: VGGT-Enhanced Multimodal Place Recognition in Autonomous Driving Environments
par: Xu, Jingyi, et autres
Publié: (2026)
par: Xu, Jingyi, et autres
Publié: (2026)
CVT-xRF: Contrastive In-Voxel Transformer for 3D Consistent Radiance Fields from Sparse Inputs
par: Zhong, Yingji, et autres
Publié: (2024)
par: Zhong, Yingji, et autres
Publié: (2024)
HD-VGGT: High-Resolution Visual Geometry Transformer
par: Chen, Tianrun, et autres
Publié: (2026)
par: Chen, Tianrun, et autres
Publié: (2026)
4DLangVGGT: 4D Language-Visual Geometry Grounded Transformer
par: Wu, Xianfeng, et autres
Publié: (2025)
par: Wu, Xianfeng, et autres
Publié: (2025)
Reloc-VGGT: Visual Re-localization with Geometry Grounded Transformer
par: Deng, Tianchen, et autres
Publié: (2025)
par: Deng, Tianchen, et autres
Publié: (2025)
PaceVGGT: Pre-Alternating-Attention Token Pruning for Visual Geometry Transformers
par: Li, Haotang, et autres
Publié: (2026)
par: Li, Haotang, et autres
Publié: (2026)
SceneVGGT: VGGT-based online 3D semantic SLAM for indoor scene understanding and navigation
par: Gelencsér-Horváth, Anna, et autres
Publié: (2026)
par: Gelencsér-Horváth, Anna, et autres
Publié: (2026)
DriveVGGT: Calibration-Constrained Visual Geometry Transformers for Multi-Camera Autonomous Driving
par: Jia, Xiaosong, et autres
Publié: (2025)
par: Jia, Xiaosong, et autres
Publié: (2025)
VGGT-Long: Chunk it, Loop it, Align it -- Pushing VGGT's Limits on Kilometer-scale Long RGB Sequences
par: Deng, Kai, et autres
Publié: (2025)
par: Deng, Kai, et autres
Publié: (2025)
TurboVGGT: Fast Visual Geometry Reconstruction with Adaptive Alternating Attention
par: Huang, David, et autres
Publié: (2026)
par: Huang, David, et autres
Publié: (2026)
InfiniteVGGT: Visual Geometry Grounded Transformer for Endless Streams
par: Yuan, Shuai, et autres
Publié: (2026)
par: Yuan, Shuai, et autres
Publié: (2026)
SegVGGT: Joint 3D Reconstruction and Instance Segmentation from Multi-View Images
par: Qu, Jinyuan, et autres
Publié: (2026)
par: Qu, Jinyuan, et autres
Publié: (2026)
OmniVGGT: Omni-Modality Driven Visual Geometry Grounded Transformer
par: Peng, Haosong, et autres
Publié: (2025)
par: Peng, Haosong, et autres
Publié: (2025)
Empowering Sparse-Input Neural Radiance Fields with Dual-Level Semantic Guidance from Dense Novel Views
par: Zhong, Yingji, et autres
Publié: (2025)
par: Zhong, Yingji, et autres
Publié: (2025)
VGGT-360: Geometry-Consistent Zero-Shot Panoramic Depth Estimation
par: Yuan, Jiayi, et autres
Publié: (2026)
par: Yuan, Jiayi, et autres
Publié: (2026)
PAGE-4D: VGGT-4D Perception via Disentangled Pose and Geometry Estimation
par: Zhou, Kaichen, et autres
Publié: (2025)
par: Zhou, Kaichen, et autres
Publié: (2025)
VGGT-Occ: Geometry-Grounded and Density-Aware Gated Fusion for 3D Occupancy Prediction
par: Chen, Xun, et autres
Publié: (2026)
par: Chen, Xun, et autres
Publié: (2026)
UrbanVGGT: Scalable Sidewalk Width Estimation from Street View Images
par: Tan, Kaizhen, et autres
Publié: (2026)
par: Tan, Kaizhen, et autres
Publié: (2026)
VGGT-Motion: Motion-Aware Calibration-Free Monocular SLAM for Long-Range Consistency
par: Xiong, Zhuang, et autres
Publié: (2026)
par: Xiong, Zhuang, et autres
Publié: (2026)
UniDet3D: Multi-dataset Indoor 3D Object Detection
par: Kolodiazhnyi, Maksim, et autres
Publié: (2024)
par: Kolodiazhnyi, Maksim, et autres
Publié: (2024)
AVGGT: Rethinking Global Attention for Accelerating VGGT
par: Sun, Xianbing, et autres
Publié: (2025)
par: Sun, Xianbing, et autres
Publié: (2025)
SwiftVGGT: A Scalable Visual Geometry Grounded Transformer for Large-Scale Scenes
par: Lee, Jungho, et autres
Publié: (2025)
par: Lee, Jungho, et autres
Publié: (2025)
4D-VGGT: A General Foundation Model with SpatioTemporal Awareness for Dynamic Scene Geometry Estimation
par: Wang, Haonan, et autres
Publié: (2025)
par: Wang, Haonan, et autres
Publié: (2025)
StreamCacheVGGT: Streaming Visual Geometry Transformers with Robust Scoring and Hybrid Cache Compression
par: Liu, Xuanyi, et autres
Publié: (2026)
par: Liu, Xuanyi, et autres
Publié: (2026)
Documents similaires
-
Taming Video Diffusion Prior with Scene-Grounding Guidance for 3D Gaussian Splatting from Sparse Inputs
par: Zhong, Yingji, et autres
Publié: (2025) -
FrameVGGT: Geometry-Aligned Frame-Level Memory for Bounded Streaming VGGT
par: Xu, Zhisong, et autres
Publié: (2026) -
VGGT-World: Transforming VGGT into an Autoregressive Geometry World Model
par: Sun, Xiangyu, et autres
Publié: (2026) -
VGGT-Segmentor: Geometry-Enhanced Cross-View Segmentation
par: Gao, Yulu, et autres
Publié: (2026) -
VGGT-X: When VGGT Meets Dense Novel View Synthesis
par: Liu, Yang, et autres
Publié: (2025)