Abstract 3D Perception for Spatial Intelligence in Vision-Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liu, Yifan, Zhan, Fangneng, Zhou, Kaichen, Du, Yilun, Liang, Paul Pu, Pfister, Hanspeter |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
AREA3D: Active Reconstruction Agent with Unified Feed-Forward 3D Perception and Vision-Language Guidance
par: Xu, Tianling, et autres
Publié: (2025)
par: Xu, Tianling, et autres
Publié: (2025)
PAGE-4D: VGGT-4D Perception via Disentangled Pose and Geometry Estimation
par: Zhou, Kaichen, et autres
Publié: (2025)
par: Zhou, Kaichen, et autres
Publié: (2025)
Stream3D: Sequential Multi-View 3D Generation via Evidential Memory
par: Zhou, Kaichen, et autres
Publié: (2026)
par: Zhou, Kaichen, et autres
Publié: (2026)
RoboTAG: End-to-end Robot Configuration Estimation via Topological Alignment Graph
par: Liu, Yifan, et autres
Publié: (2025)
par: Liu, Yifan, et autres
Publié: (2025)
GEM-4D: Geometry-Enhanced Video World Models for Robot Manipulation
par: Zhou, Kaichen, et autres
Publié: (2026)
par: Zhou, Kaichen, et autres
Publié: (2026)
Advances in Feed-Forward 3D Reconstruction and View Synthesis: A Survey
par: Zhang, Jiahui, et autres
Publié: (2025)
par: Zhang, Jiahui, et autres
Publié: (2025)
GeCo: Evaluating Geometric Consistency for Video Generation via Motion and Structure
par: Gu, Leslie, et autres
Publié: (2025)
par: Gu, Leslie, et autres
Publié: (2025)
LangSplat: 3D Language Gaussian Splatting
par: Qin, Minghan, et autres
Publié: (2023)
par: Qin, Minghan, et autres
Publié: (2023)
Understanding Graphical Perception in Data Visualization through Zero-shot Prompting of Vision-Language Models
par: Guo, Grace, et autres
Publié: (2024)
par: Guo, Grace, et autres
Publié: (2024)
LangFlash: Feed-forward 3D Language Gaussian Splatting from Sparse Unposed Images
par: Liu, Yilong, et autres
Publié: (2026)
par: Liu, Yilong, et autres
Publié: (2026)
Lite2Relight: 3D-aware Single Image Portrait Relighting
par: Rao, Pramod, et autres
Publié: (2024)
par: Rao, Pramod, et autres
Publié: (2024)
Tree of Attributes Prompt Learning for Vision-Language Models
par: Ding, Tong, et autres
Publié: (2024)
par: Ding, Tong, et autres
Publié: (2024)
CTRL-GS: Cascaded Temporal Residue Learning for 4D Gaussian Splatting
par: Hou, Karly, et autres
Publié: (2025)
par: Hou, Karly, et autres
Publié: (2025)
DiffAge3D: Diffusion-based 3D-aware Face Aging
par: Wahid, Junaid, et autres
Publié: (2024)
par: Wahid, Junaid, et autres
Publié: (2024)
4D LangSplat: 4D Language Gaussian Splatting via Multimodal Large Language Models
par: Li, Wanhua, et autres
Publié: (2025)
par: Li, Wanhua, et autres
Publié: (2025)
3DPR: Single Image 3D Portrait Relight using Generative Priors
par: Rao, Pramod, et autres
Publié: (2025)
par: Rao, Pramod, et autres
Publié: (2025)
Visual Acoustic Fields
par: Li, Yuelei, et autres
Publié: (2025)
par: Li, Yuelei, et autres
Publié: (2025)
OV-NeRF: Open-vocabulary Neural Radiance Fields with Vision and Language Foundation Models for 3D Semantic Understanding
par: Liao, Guibiao, et autres
Publié: (2024)
par: Liao, Guibiao, et autres
Publié: (2024)
SOGS: Second-Order Anchor for Advanced 3D Gaussian Splatting
par: Zhang, Jiahui, et autres
Publié: (2025)
par: Zhang, Jiahui, et autres
Publié: (2025)
DualEdit: Dual Editing for Knowledge Updating in Vision-Language Models
par: Shi, Zhiyi, et autres
Publié: (2025)
par: Shi, Zhiyi, et autres
Publié: (2025)
Flow Equivariant World Models: Memory for Partially Observed Dynamic Environments
par: Lillemark, Hansen Jin, et autres
Publié: (2026)
par: Lillemark, Hansen Jin, et autres
Publié: (2026)
When Visuals Aren't the Problem: Evaluating Vision-Language Models on Misleading Data Visualizations
par: Lalai, Harsh Nishant, et autres
Publié: (2026)
par: Lalai, Harsh Nishant, et autres
Publié: (2026)
Spatial 3D-LLM: Exploring Spatial Awareness in 3D Vision-Language Models
par: Wang, Xiaoyan, et autres
Publié: (2025)
par: Wang, Xiaoyan, et autres
Publié: (2025)
Grounded 3D-Aware Spatial Vision-Language Modeling
par: Cheng, An-Chieh, et autres
Publié: (2026)
par: Cheng, An-Chieh, et autres
Publié: (2026)
HiSpatial: Taming Hierarchical 3D Spatial Understanding in Vision-Language Models
par: Liang, Huizhi, et autres
Publié: (2026)
par: Liang, Huizhi, et autres
Publié: (2026)
FreGS: 3D Gaussian Splatting with Progressive Frequency Regularization
par: Zhang, Jiahui, et autres
Publié: (2024)
par: Zhang, Jiahui, et autres
Publié: (2024)
LangSplatV2: High-dimensional 3D Language Gaussian Splatting with 450+ FPS
par: Li, Wanhua, et autres
Publié: (2025)
par: Li, Wanhua, et autres
Publié: (2025)
Memorization in 3D Shape Generation: An Empirical Study
par: Pu, Shu, et autres
Publié: (2025)
par: Pu, Shu, et autres
Publié: (2025)
StyleGaussian: Instant 3D Style Transfer with Gaussian Splatting
par: Liu, Kunhao, et autres
Publié: (2024)
par: Liu, Kunhao, et autres
Publié: (2024)
RiGS: Rigid-aware 4D Gaussian Splatting from a Single Monocular Video
par: Wu, Chenyu, et autres
Publié: (2026)
par: Wu, Chenyu, et autres
Publié: (2026)
DatasetNeRF: Efficient 3D-aware Data Factory with Generative Radiance Fields
par: Chi, Yu, et autres
Publié: (2023)
par: Chi, Yu, et autres
Publié: (2023)
MuSASplat: Efficient Sparse-View 3D Gaussian Splats via Lightweight Multi-Scale Adaptation
par: Xu, Muyu, et autres
Publié: (2025)
par: Xu, Muyu, et autres
Publié: (2025)
GeoWorld-VLM: Geometry from World Models for Vision-Language Models
par: Gu, Renjie, et autres
Publié: (2026)
par: Gu, Renjie, et autres
Publié: (2026)
Improving Vision-language Models with Perception-centric Process Reward Models
par: Min, Yingqian, et autres
Publié: (2026)
par: Min, Yingqian, et autres
Publié: (2026)
A Vision for Multisensory Intelligence: Sensing, Science, and Synergy
par: Liang, Paul Pu
Publié: (2026)
par: Liang, Paul Pu
Publié: (2026)
Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models
par: Ma, Martin Q., et autres
Publié: (2026)
par: Ma, Martin Q., et autres
Publié: (2026)
Evolutive Rendering Models
par: Zhan, Fangneng, et autres
Publié: (2024)
par: Zhan, Fangneng, et autres
Publié: (2024)
Unleashing the Capabilities of Large Vision-Language Models for Intelligent Perception of Roadside Infrastructure
par: Fu, Luxuan, et autres
Publié: (2026)
par: Fu, Luxuan, et autres
Publié: (2026)
Seeing the Abstract: Translating the Abstract Language for Vision Language Models
par: Talon, Davide, et autres
Publié: (2025)
par: Talon, Davide, et autres
Publié: (2025)
General Neural Gauge Fields
par: Zhan, Fangneng, et autres
Publié: (2023)
par: Zhan, Fangneng, et autres
Publié: (2023)
Documents similaires
-
AREA3D: Active Reconstruction Agent with Unified Feed-Forward 3D Perception and Vision-Language Guidance
par: Xu, Tianling, et autres
Publié: (2025) -
PAGE-4D: VGGT-4D Perception via Disentangled Pose and Geometry Estimation
par: Zhou, Kaichen, et autres
Publié: (2025) -
Stream3D: Sequential Multi-View 3D Generation via Evidential Memory
par: Zhou, Kaichen, et autres
Publié: (2026) -
RoboTAG: End-to-end Robot Configuration Estimation via Topological Alignment Graph
par: Liu, Yifan, et autres
Publié: (2025) -
GEM-4D: Geometry-Enhanced Video World Models for Robot Manipulation
par: Zhou, Kaichen, et autres
Publié: (2026)