GAP-MLLM: Geometry-Aligned Pre-training for Activating 3D Spatial Perception in Multimodal Large Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Jiaxin, Jiang, Junjun, Li, Haijie, Chen, Youyu, Jiang, Kui, Chen, Dave Zhenyu |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
COB-GS: Clear Object Boundaries in 3DGS Segmentation Based on Boundary-Adaptive Gaussian Splitting
por: Zhang, Jiaxin, et al.
Publicado: (2025)
por: Zhang, Jiaxin, et al.
Publicado: (2025)
Reliev3R: Relieving Feed-forward Reconstruction from Multi-View Geometric Annotations
por: Chen, Youyu, et al.
Publicado: (2026)
por: Chen, Youyu, et al.
Publicado: (2026)
DashGaussian: Optimizing 3D Gaussian Splatting in 200 Seconds
por: Chen, Youyu, et al.
Publicado: (2025)
por: Chen, Youyu, et al.
Publicado: (2025)
FUSE: Label-Free Image-Event Joint Monocular Depth Estimation via Frequency-Decoupled Alignment and Degradation-Robust Fusion
por: Sun, Pihai, et al.
Publicado: (2025)
por: Sun, Pihai, et al.
Publicado: (2025)
MLLM-For3D: Adapting Multimodal Large Language Model for 3D Reasoning Segmentation
por: Huang, Jiaxin, et al.
Publicado: (2025)
por: Huang, Jiaxin, et al.
Publicado: (2025)
LLV-FSR: Exploiting Large Language-Vision Prior for Face Super-resolution
por: Wang, Chenyang, et al.
Publicado: (2024)
por: Wang, Chenyang, et al.
Publicado: (2024)
Vision to Geometry: 3D Spatial Memory for Sequential Embodied MLLM Reasoning and Exploration
por: Cai, Zhongyi, et al.
Publicado: (2025)
por: Cai, Zhongyi, et al.
Publicado: (2025)
Large-Scale 3D Medical Image Pre-training with Geometric Context Priors
por: Wu, Linshan, et al.
Publicado: (2024)
por: Wu, Linshan, et al.
Publicado: (2024)
GeoAlign: Geometric Feature Realignment for MLLM Spatial Reasoning
por: Liu, Zhaochen, et al.
Publicado: (2026)
por: Liu, Zhaochen, et al.
Publicado: (2026)
Part-X-MLLM: Part-aware 3D Multimodal Large Language Model
por: Wang, Chunshi, et al.
Publicado: (2025)
por: Wang, Chunshi, et al.
Publicado: (2025)
Spatial Annealing for Efficient Few-shot Neural Rendering
por: Xiao, Yuru, et al.
Publicado: (2024)
por: Xiao, Yuru, et al.
Publicado: (2024)
MCGS: Multiview Consistency Enhancement for Sparse-View 3D Gaussian Radiance Fields
por: Xiao, Yuru, et al.
Publicado: (2024)
por: Xiao, Yuru, et al.
Publicado: (2024)
CoMP: Continual Multimodal Pre-training for Vision Foundation Models
por: Chen, Yitong, et al.
Publicado: (2025)
por: Chen, Yitong, et al.
Publicado: (2025)
Learning from History: Task-agnostic Model Contrastive Learning for Image Restoration
por: Wu, Gang, et al.
Publicado: (2023)
por: Wu, Gang, et al.
Publicado: (2023)
Boosting All-in-One Image Restoration via Self-Improved Privilege Learning
por: Wu, Gang, et al.
Publicado: (2025)
por: Wu, Gang, et al.
Publicado: (2025)
Dual-Pathway Geometry-Aware MLLM for Spatial Intelligence
por: Zheng, Yufei, et al.
Publicado: (2026)
por: Zheng, Yufei, et al.
Publicado: (2026)
Fill the GAP: A Granular Alignment Paradigm for Visual Reasoning in Multimodal Large Language Models
por: Miao, Yanting, et al.
Publicado: (2026)
por: Miao, Yanting, et al.
Publicado: (2026)
ControlMLLM: Training-Free Visual Prompt Learning for Multimodal Large Language Models
por: Wu, Mingrui, et al.
Publicado: (2024)
por: Wu, Mingrui, et al.
Publicado: (2024)
E-RayZer: Self-supervised 3D Reconstruction as Spatial Visual Pre-training
por: Zhao, Qitao, et al.
Publicado: (2025)
por: Zhao, Qitao, et al.
Publicado: (2025)
MG-3D: Multi-Grained Knowledge-Enhanced 3D Medical Vision-Language Pre-training
por: Ni, Xuefeng, et al.
Publicado: (2024)
por: Ni, Xuefeng, et al.
Publicado: (2024)
RADAR: Revealing Asymmetric Development of Abilities in MLLM Pre-training
por: Nie, Yunshuang, et al.
Publicado: (2026)
por: Nie, Yunshuang, et al.
Publicado: (2026)
Fully $1\times1$ Convolutional Network for Lightweight Image Super-Resolution
por: Wu, Gang, et al.
Publicado: (2023)
por: Wu, Gang, et al.
Publicado: (2023)
Multi-SpatialMLLM: Multi-Frame Spatial Understanding with Multi-Modal Large Language Models
por: Xu, Runsen, et al.
Publicado: (2025)
por: Xu, Runsen, et al.
Publicado: (2025)
VGGT-Det: Mining VGGT Internal Priors for Sensor-Geometry-Free Multi-View Indoor 3D Object Detection
por: Cao, Yang, et al.
Publicado: (2026)
por: Cao, Yang, et al.
Publicado: (2026)
MR-MLLM: Mutual Reinforcement of Multimodal Comprehension and Vision Perception
por: Wang, Guanqun, et al.
Publicado: (2024)
por: Wang, Guanqun, et al.
Publicado: (2024)
Improving Adversarial Transferability of Vision-Language Pre-training Models through Collaborative Multimodal Interaction
por: Fu, Jiyuan, et al.
Publicado: (2024)
por: Fu, Jiyuan, et al.
Publicado: (2024)
Exploiting Self-Supervised Constraints in Image Super-Resolution
por: Wu, Gang, et al.
Publicado: (2024)
por: Wu, Gang, et al.
Publicado: (2024)
DSwinIR: Rethinking Window-based Attention for Image Restoration
por: Wu, Gang, et al.
Publicado: (2025)
por: Wu, Gang, et al.
Publicado: (2025)
M2DAO-Talker: Harmonizing Multi-granular Motion Decoupling and Alternating Optimization for Talking-head Generation
por: Jiang, Kui, et al.
Publicado: (2025)
por: Jiang, Kui, et al.
Publicado: (2025)
Fast and Accurate Gigapixel Pathological Image Classification with Hierarchical Distillation Multi-Instance Learning
por: Dong, Jiuyang, et al.
Publicado: (2025)
por: Dong, Jiuyang, et al.
Publicado: (2025)
AHDMIL: Asymmetric Hierarchical Distillation Multi-Instance Learning for Fast and Accurate Whole-Slide Image Classification
por: Dong, Jiuyang, et al.
Publicado: (2025)
por: Dong, Jiuyang, et al.
Publicado: (2025)
Beyond Degradation Redundancy: Contrastive Prompt Learning for All-in-One Image Restoration
por: Wu, Gang, et al.
Publicado: (2025)
por: Wu, Gang, et al.
Publicado: (2025)
Primitive Geometry Segment Pre-training for 3D Medical Image Segmentation
por: Tadokoro, Ryu, et al.
Publicado: (2024)
por: Tadokoro, Ryu, et al.
Publicado: (2024)
Face-MLLM: A Large Face Perception Model
por: Sun, Haomiao, et al.
Publicado: (2024)
por: Sun, Haomiao, et al.
Publicado: (2024)
Are Large Pre-trained Vision Language Models Effective Construction Safety Inspectors?
por: Chen, Xuezheng, et al.
Publicado: (2025)
por: Chen, Xuezheng, et al.
Publicado: (2025)
Chain of Visual Perception: Harnessing Multimodal Large Language Models for Zero-shot Camouflaged Object Detection
por: Tang, Lv, et al.
Publicado: (2023)
por: Tang, Lv, et al.
Publicado: (2023)
Enhancing MLLM Spatial Understanding via Active 3D Scene Exploration for Multi-Perspective Reasoning
por: Chen, Jiahua, et al.
Publicado: (2026)
por: Chen, Jiahua, et al.
Publicado: (2026)
CG-MLLM: Captioning and Generating 3D content via Multi-modal Large Language Models
por: Huang, Junming, et al.
Publicado: (2026)
por: Huang, Junming, et al.
Publicado: (2026)
SafeVid: Toward Safety Aligned Video Large Multimodal Models
por: Wang, Yixu, et al.
Publicado: (2025)
por: Wang, Yixu, et al.
Publicado: (2025)
LLMI3D: MLLM-based 3D Perception from a Single 2D Image
por: Yang, Fan, et al.
Publicado: (2024)
por: Yang, Fan, et al.
Publicado: (2024)
Ejemplares similares
-
COB-GS: Clear Object Boundaries in 3DGS Segmentation Based on Boundary-Adaptive Gaussian Splitting
por: Zhang, Jiaxin, et al.
Publicado: (2025) -
Reliev3R: Relieving Feed-forward Reconstruction from Multi-View Geometric Annotations
por: Chen, Youyu, et al.
Publicado: (2026) -
DashGaussian: Optimizing 3D Gaussian Splatting in 200 Seconds
por: Chen, Youyu, et al.
Publicado: (2025) -
FUSE: Label-Free Image-Event Joint Monocular Depth Estimation via Frequency-Decoupled Alignment and Degradation-Robust Fusion
por: Sun, Pihai, et al.
Publicado: (2025) -
MLLM-For3D: Adapting Multimodal Large Language Model for 3D Reasoning Segmentation
por: Huang, Jiaxin, et al.
Publicado: (2025)