GaussTR: Foundation Model-Aligned Gaussian Transformer for Self-Supervised 3D Spatial Understanding
Fuente:
arXiv
Guardado en:
| Autores principales: | Jiang, Haoyi, Liu, Liu, Cheng, Tianheng, Wang, Xinjie, Lin, Tianwei, Su, Zhizhong, Liu, Wenyu, Wang, Xinggang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Spa3R: Predictive Spatial Field Modeling for 3D Visual Reasoning
por: Jiang, Haoyi, et al.
Publicado: (2026)
por: Jiang, Haoyi, et al.
Publicado: (2026)
Uni3R: Unified 3D Reconstruction and Semantic Understanding via Generalizable Gaussian Splatting from Unposed Multi-View Images
por: Sun, Xiangyu, et al.
Publicado: (2025)
por: Sun, Xiangyu, et al.
Publicado: (2025)
GLS: Geometry-aware 3D Language Gaussian Splatting
por: Qiu, Jiaxiong, et al.
Publicado: (2024)
por: Qiu, Jiaxiong, et al.
Publicado: (2024)
Gaussian Object Carver: Object-Compositional Gaussian Splatting with surfaces completion
por: Liu, Liu, et al.
Publicado: (2024)
por: Liu, Liu, et al.
Publicado: (2024)
Cross-Layer Attentive Feature Upsampling for Low-latency Semantic Segmentation
por: Cheng, Tianheng, et al.
Publicado: (2026)
por: Cheng, Tianheng, et al.
Publicado: (2026)
Occupancy as Set of Points
por: Shi, Yiang, et al.
Publicado: (2024)
por: Shi, Yiang, et al.
Publicado: (2024)
Mask-Adapter: The Devil is in the Masks for Open-Vocabulary Segmentation
por: Li, Yongkang, et al.
Publicado: (2024)
por: Li, Yongkang, et al.
Publicado: (2024)
PersonViT: Large-scale Self-supervised Vision Transformer for Person Re-Identification
por: Hu, Bin, et al.
Publicado: (2024)
por: Hu, Bin, et al.
Publicado: (2024)
Polar Parametrization for Vision-based Surround-View 3D Detection
por: Chen, Shaoyu, et al.
Publicado: (2022)
por: Chen, Shaoyu, et al.
Publicado: (2022)
YOLO-World: Real-Time Open-Vocabulary Object Detection
por: Cheng, Tianheng, et al.
Publicado: (2024)
por: Cheng, Tianheng, et al.
Publicado: (2024)
FasterDiT: Towards Faster Diffusion Transformers Training without Architecture Modification
por: Yao, Jingfeng, et al.
Publicado: (2024)
por: Yao, Jingfeng, et al.
Publicado: (2024)
Understanding Self-Supervised Pretraining with Part-Aware Representation Learning
por: Zhu, Jie, et al.
Publicado: (2023)
por: Zhu, Jie, et al.
Publicado: (2023)
STP4D: Spatio-Temporal-Prompt Consistent Modeling for Text-to-4D Gaussian Splatting
por: Deng, Yunze, et al.
Publicado: (2025)
por: Deng, Yunze, et al.
Publicado: (2025)
Lane Graph as Path: Continuity-preserving Path-wise Modeling for Online Lane Graph Construction
por: Liao, Bencheng, et al.
Publicado: (2023)
por: Liao, Bencheng, et al.
Publicado: (2023)
MaTVLM: Hybrid Mamba-Transformer for Efficient Vision-Language Modeling
por: Li, Yingyue, et al.
Publicado: (2025)
por: Li, Yingyue, et al.
Publicado: (2025)
SEM: Enhancing Spatial Understanding for Robust Robot Manipulation
por: Lin, Xuewu, et al.
Publicado: (2025)
por: Lin, Xuewu, et al.
Publicado: (2025)
Dynamic 2D Gaussians: Geometrically Accurate Radiance Fields for Dynamic Objects
por: Zhang, Shuai, et al.
Publicado: (2024)
por: Zhang, Shuai, et al.
Publicado: (2024)
Multimodal Mamba: Decoder-only Multimodal State Space Model via Quadratic to Linear Distillation
por: Liao, Bencheng, et al.
Publicado: (2025)
por: Liao, Bencheng, et al.
Publicado: (2025)
OmniMamba: Efficient and Unified Multimodal Understanding and Generation via State Space Models
por: Zou, Jialv, et al.
Publicado: (2025)
por: Zou, Jialv, et al.
Publicado: (2025)
Scaling Sim-to-Real Reinforcement Learning for Robot VLAs with Generative 3D Worlds
por: Choi, Andrew, et al.
Publicado: (2026)
por: Choi, Andrew, et al.
Publicado: (2026)
GroundingSuite: Measuring Complex Multi-Granular Pixel Grounding
por: Hu, Rui, et al.
Publicado: (2025)
por: Hu, Rui, et al.
Publicado: (2025)
EVF-SAM: Early Vision-Language Fusion for Text-Prompted Segment Anything Model
por: Zhang, Yuxuan, et al.
Publicado: (2024)
por: Zhang, Yuxuan, et al.
Publicado: (2024)
Segment Any 4D Gaussians
por: Ji, Shengxiang, et al.
Publicado: (2024)
por: Ji, Shengxiang, et al.
Publicado: (2024)
Speeding Up the Learning of 3D Gaussians with Much Shorter Gaussian Lists
por: Liu, Jiaqi, et al.
Publicado: (2026)
por: Liu, Jiaqi, et al.
Publicado: (2026)
EVA-X: A Foundation Model for General Chest X-ray Analysis with Self-supervised Learning
por: Yao, Jingfeng, et al.
Publicado: (2024)
por: Yao, Jingfeng, et al.
Publicado: (2024)
GaussianDreamer: Fast Generation from Text to 3D Gaussians by Bridging 2D and 3D Diffusion Models
por: Yi, Taoran, et al.
Publicado: (2023)
por: Yi, Taoran, et al.
Publicado: (2023)
2D Gaussians Meet Visual Tokenizer
por: Shi, Yiang, et al.
Publicado: (2025)
por: Shi, Yiang, et al.
Publicado: (2025)
BIP3D: Bridging 2D Images and 3D Perception for Embodied Intelligence
por: Lin, Xuewu, et al.
Publicado: (2024)
por: Lin, Xuewu, et al.
Publicado: (2024)
ControlAR: Controllable Image Generation with Autoregressive Models
por: Li, Zongming, et al.
Publicado: (2024)
por: Li, Zongming, et al.
Publicado: (2024)
TOGS: Gaussian Splatting with Temporal Opacity Offset for Real-Time 4D DSA Rendering
por: Zhang, Shuai, et al.
Publicado: (2024)
por: Zhang, Shuai, et al.
Publicado: (2024)
3D-Fixer: Coarse-to-Fine In-place Completion for 3D Scenes from a Single Image
por: Yin, Ze-Xin, et al.
Publicado: (2026)
por: Yin, Ze-Xin, et al.
Publicado: (2026)
MolSight: Optical Chemical Structure Recognition with SMILES Pretraining, Multi-Granularity Learning and Reinforcement Learning
por: Zhang, Wenrui, et al.
Publicado: (2025)
por: Zhang, Wenrui, et al.
Publicado: (2025)
GaraMoSt: Parallel Multi-Granularity Motion and Structural Modeling for Efficient Multi-Frame Interpolation in DSA Images
por: Xu, Ziyang, et al.
Publicado: (2024)
por: Xu, Ziyang, et al.
Publicado: (2024)
Matte Anything: Interactive Natural Image Matting with Segment Anything Models
por: Yao, Jingfeng, et al.
Publicado: (2023)
por: Yao, Jingfeng, et al.
Publicado: (2023)
Causality-inspired Discriminative Feature Learning in Triple Domains for Gait Recognition
por: Xiong, Haijun, et al.
Publicado: (2024)
por: Xiong, Haijun, et al.
Publicado: (2024)
AlphaDrive: Unleashing the Power of VLMs in Autonomous Driving via Reinforcement Learning and Reasoning
por: Jiang, Bo, et al.
Publicado: (2025)
por: Jiang, Bo, et al.
Publicado: (2025)
MIM4D: Masked Modeling with Multi-View Video for Autonomous Driving Representation Learning
por: Zou, Jialv, et al.
Publicado: (2024)
por: Zou, Jialv, et al.
Publicado: (2024)
EmbodiedGen: Towards a Generative 3D World Engine for Embodied Intelligence
por: Wang, Xinjie, et al.
Publicado: (2025)
por: Wang, Xinjie, et al.
Publicado: (2025)
Spatial-SSRL: Enhancing Spatial Understanding via Self-Supervised Reinforcement Learning
por: Liu, Yuhong, et al.
Publicado: (2025)
por: Liu, Yuhong, et al.
Publicado: (2025)
ViTGaze: Gaze Following with Interaction Features in Vision Transformers
por: Song, Yuehao, et al.
Publicado: (2024)
por: Song, Yuehao, et al.
Publicado: (2024)
Ejemplares similares
-
Spa3R: Predictive Spatial Field Modeling for 3D Visual Reasoning
por: Jiang, Haoyi, et al.
Publicado: (2026) -
Uni3R: Unified 3D Reconstruction and Semantic Understanding via Generalizable Gaussian Splatting from Unposed Multi-View Images
por: Sun, Xiangyu, et al.
Publicado: (2025) -
GLS: Geometry-aware 3D Language Gaussian Splatting
por: Qiu, Jiaxiong, et al.
Publicado: (2024) -
Gaussian Object Carver: Object-Compositional Gaussian Splatting with surfaces completion
por: Liu, Liu, et al.
Publicado: (2024) -
Cross-Layer Attentive Feature Upsampling for Low-latency Semantic Segmentation
por: Cheng, Tianheng, et al.
Publicado: (2026)