VGGT-Segmentor: Geometry-Enhanced Cross-View Segmentation
Fuente:
arXiv
Guardado en:
| Autores principales: | Gao, Yulu, Zhang, Bohao, Tang, Zongheng, Liao, Jitong, Wu, Wenjun, Liu, Si |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
DOMR: Establishing Cross-View Segmentation via Dense Object Matching
por: Liao, Jitong, et al.
Publicado: (2025)
por: Liao, Jitong, et al.
Publicado: (2025)
VGGT-X: When VGGT Meets Dense Novel View Synthesis
por: Liu, Yang, et al.
Publicado: (2025)
por: Liu, Yang, et al.
Publicado: (2025)
CoST: Efficient Collaborative Perception From Unified Spatiotemporal Perspective
por: Tang, Zongheng, et al.
Publicado: (2025)
por: Tang, Zongheng, et al.
Publicado: (2025)
VGGT-World: Transforming VGGT into an Autoregressive Geometry World Model
por: Sun, Xiangyu, et al.
Publicado: (2026)
por: Sun, Xiangyu, et al.
Publicado: (2026)
VGGT-Det: Mining VGGT Internal Priors for Sensor-Geometry-Free Multi-View Indoor 3D Object Detection
por: Cao, Yang, et al.
Publicado: (2026)
por: Cao, Yang, et al.
Publicado: (2026)
Learning Robust Anymodal Segmentor with Unimodal and Cross-modal Distillation
por: Zheng, Xu, et al.
Publicado: (2024)
por: Zheng, Xu, et al.
Publicado: (2024)
FrameVGGT: Geometry-Aligned Frame-Level Memory for Bounded Streaming VGGT
por: Xu, Zhisong, et al.
Publicado: (2026)
por: Xu, Zhisong, et al.
Publicado: (2026)
GPA-VGGT:Adapting VGGT to Large Scale Localization by Self-Supervised Learning with Geometry and Physics Aware Loss
por: Xu, Yangfan, et al.
Publicado: (2026)
por: Xu, Yangfan, et al.
Publicado: (2026)
OmniSegmentor: A Flexible Multi-Modal Learning Framework for Semantic Segmentation
por: Yin, Bo-Wen, et al.
Publicado: (2025)
por: Yin, Bo-Wen, et al.
Publicado: (2025)
VGGT: Visual Geometry Grounded Transformer
por: Wang, Jianyuan, et al.
Publicado: (2025)
por: Wang, Jianyuan, et al.
Publicado: (2025)
Reloc-VGGT: Visual Re-localization with Geometry Grounded Transformer
por: Deng, Tianchen, et al.
Publicado: (2025)
por: Deng, Tianchen, et al.
Publicado: (2025)
VGGT-MPR: VGGT-Enhanced Multimodal Place Recognition in Autonomous Driving Environments
por: Xu, Jingyi, et al.
Publicado: (2026)
por: Xu, Jingyi, et al.
Publicado: (2026)
SegVGGT: Joint 3D Reconstruction and Instance Segmentation from Multi-View Images
por: Qu, Jinyuan, et al.
Publicado: (2026)
por: Qu, Jinyuan, et al.
Publicado: (2026)
LiteVGGT: Boosting Vanilla VGGT via Geometry-aware Cached Token Merging
por: Shu, Zhijian, et al.
Publicado: (2025)
por: Shu, Zhijian, et al.
Publicado: (2025)
TurboVGGT: Fast Visual Geometry Reconstruction with Adaptive Alternating Attention
por: Huang, David, et al.
Publicado: (2026)
por: Huang, David, et al.
Publicado: (2026)
Knowledge Distillation via Query Selection for Detection Transformer
por: Liu, Yi, et al.
Publicado: (2024)
por: Liu, Yi, et al.
Publicado: (2024)
InfiniteVGGT: Visual Geometry Grounded Transformer for Endless Streams
por: Yuan, Shuai, et al.
Publicado: (2026)
por: Yuan, Shuai, et al.
Publicado: (2026)
4DLangVGGT: 4D Language-Visual Geometry Grounded Transformer
por: Wu, Xianfeng, et al.
Publicado: (2025)
por: Wu, Xianfeng, et al.
Publicado: (2025)
HD-VGGT: High-Resolution Visual Geometry Transformer
por: Chen, Tianrun, et al.
Publicado: (2026)
por: Chen, Tianrun, et al.
Publicado: (2026)
FastVGGT: Training-Free Acceleration of Visual Geometry Transformer
por: Shen, You, et al.
Publicado: (2025)
por: Shen, You, et al.
Publicado: (2025)
OmniVGGT: Omni-Modality Driven Visual Geometry Grounded Transformer
por: Peng, Haosong, et al.
Publicado: (2025)
por: Peng, Haosong, et al.
Publicado: (2025)
Integrating Extra Modality Helps Segmentor Find Camouflaged Objects Well
por: Fang, Chengyu, et al.
Publicado: (2025)
por: Fang, Chengyu, et al.
Publicado: (2025)
Unleashing the Temporal-Spatial Reasoning Capacity of GPT for Training-Free Audio and Language Referenced Video Object Segmentation
por: Huang, Shaofei, et al.
Publicado: (2024)
por: Huang, Shaofei, et al.
Publicado: (2024)
UrbanVGGT: Scalable Sidewalk Width Estimation from Street View Images
por: Tan, Kaizhen, et al.
Publicado: (2026)
por: Tan, Kaizhen, et al.
Publicado: (2026)
VGGT-$Ω$
por: Wang, Jianyuan, et al.
Publicado: (2026)
por: Wang, Jianyuan, et al.
Publicado: (2026)
Language-guided Scale-aware MedSegmentor for Lesion Segmentation in Medical Imaging
por: Ouyang, Shuyi, et al.
Publicado: (2024)
por: Ouyang, Shuyi, et al.
Publicado: (2024)
VGGT-360: Geometry-Consistent Zero-Shot Panoramic Depth Estimation
por: Yuan, Jiayi, et al.
Publicado: (2026)
por: Yuan, Jiayi, et al.
Publicado: (2026)
Making Training-Free Diffusion Segmentors Scale with the Generative Power
por: Meng, Benyuan, et al.
Publicado: (2026)
por: Meng, Benyuan, et al.
Publicado: (2026)
AVGGT: Rethinking Global Attention for Accelerating VGGT
por: Sun, Xianbing, et al.
Publicado: (2025)
por: Sun, Xianbing, et al.
Publicado: (2025)
DriveVGGT: Calibration-Constrained Visual Geometry Transformers for Multi-Camera Autonomous Driving
por: Jia, Xiaosong, et al.
Publicado: (2025)
por: Jia, Xiaosong, et al.
Publicado: (2025)
Balanced Learning for Domain Adaptive Semantic Segmentation
por: Li, Wangkai, et al.
Publicado: (2025)
por: Li, Wangkai, et al.
Publicado: (2025)
XStreamVGGT: Extremely Memory-Efficient Streaming Vision Geometry Grounded Transformer with KV Cache Compression
por: Su, Zunhai, et al.
Publicado: (2026)
por: Su, Zunhai, et al.
Publicado: (2026)
XStreamVGGT: Extremely Memory-Efficient Streaming Vision Geometry Grounded Transformer with KV Cache Compression
por: Su, Zunhai, et al.
Publicado: (2026)
por: Su, Zunhai, et al.
Publicado: (2026)
PaceVGGT: Pre-Alternating-Attention Token Pruning for Visual Geometry Transformers
por: Li, Haotang, et al.
Publicado: (2026)
por: Li, Haotang, et al.
Publicado: (2026)
StereoVGGT: A Training-Free Visual Geometry Transformer for Stereo Vision
por: Chen, Ziyang, et al.
Publicado: (2026)
por: Chen, Ziyang, et al.
Publicado: (2026)
CV-MOS: A Cross-View Model for Motion Segmentation
por: Tang, Xiaoyu, et al.
Publicado: (2024)
por: Tang, Xiaoyu, et al.
Publicado: (2024)
FlashVGGT: Efficient and Scalable Visual Geometry Transformers with Compressed Descriptor Attention
por: Wang, Zipeng, et al.
Publicado: (2025)
por: Wang, Zipeng, et al.
Publicado: (2025)
Hybrid-Segmentor: A Hybrid Approach to Automated Fine-Grained Crack Segmentation in Civil Infrastructure
por: Goo, June Moh, et al.
Publicado: (2024)
por: Goo, June Moh, et al.
Publicado: (2024)
StreamCacheVGGT: Streaming Visual Geometry Transformers with Robust Scoring and Hybrid Cache Compression
por: Liu, Xuanyi, et al.
Publicado: (2026)
por: Liu, Xuanyi, et al.
Publicado: (2026)
VGGT-SLAM++
por: Mandal, Avilasha, et al.
Publicado: (2026)
por: Mandal, Avilasha, et al.
Publicado: (2026)
Ejemplares similares
-
DOMR: Establishing Cross-View Segmentation via Dense Object Matching
por: Liao, Jitong, et al.
Publicado: (2025) -
VGGT-X: When VGGT Meets Dense Novel View Synthesis
por: Liu, Yang, et al.
Publicado: (2025) -
CoST: Efficient Collaborative Perception From Unified Spatiotemporal Perspective
por: Tang, Zongheng, et al.
Publicado: (2025) -
VGGT-World: Transforming VGGT into an Autoregressive Geometry World Model
por: Sun, Xiangyu, et al.
Publicado: (2026) -
VGGT-Det: Mining VGGT Internal Priors for Sensor-Geometry-Free Multi-View Indoor 3D Object Detection
por: Cao, Yang, et al.
Publicado: (2026)