SPARTUN3D: Situated Spatial Understanding of 3D World in Large Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Zhang, Yue, Xu, Zhiyang, Shen, Ying, Kordjamshidi, Parisa, Huang, Lifu |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Exploring Spatial Language Grounding Through Referring Expressions
von: Tumu, Akshar, et al.
Veröffentlicht: (2025)
von: Tumu, Akshar, et al.
Veröffentlicht: (2025)
Narrowing the Gap between Vision and Action in Navigation
von: Zhang, Yue, et al.
Veröffentlicht: (2024)
von: Zhang, Yue, et al.
Veröffentlicht: (2024)
Think, Act, Build: An Agentic Framework with Vision Language Models for Zero-Shot 3D Visual Grounding
von: Wang, Haibo, et al.
Veröffentlicht: (2026)
von: Wang, Haibo, et al.
Veröffentlicht: (2026)
Referring Expressions as a Lens into Spatial Language Grounding in Vision-Language Models
von: Tumu, Akshar, et al.
Veröffentlicht: (2025)
von: Tumu, Akshar, et al.
Veröffentlicht: (2025)
FoR-SALE: Frame of Reference-guided Spatial Adjustment in LLM-based Diffusion Editing
von: Premsri, Tanawan, et al.
Veröffentlicht: (2025)
von: Premsri, Tanawan, et al.
Veröffentlicht: (2025)
Situat3DChange: Situated 3D Change Understanding Dataset for Multimodal Large Language Model
von: Liu, Ruiping, et al.
Veröffentlicht: (2025)
von: Liu, Ruiping, et al.
Veröffentlicht: (2025)
HiSpatial: Taming Hierarchical 3D Spatial Understanding in Vision-Language Models
von: Liang, Huizhi, et al.
Veröffentlicht: (2026)
von: Liang, Huizhi, et al.
Veröffentlicht: (2026)
NePTune: A Neuro-Pythonic Framework for Tunable Compositional Reasoning on Vision-Language
von: Kamali, Danial, et al.
Veröffentlicht: (2025)
von: Kamali, Danial, et al.
Veröffentlicht: (2025)
Breaking Down and Building Up: Mixture of Skill-Based Vision-and-Language Navigation Agents
von: Ma, Tianyi, et al.
Veröffentlicht: (2025)
von: Ma, Tianyi, et al.
Veröffentlicht: (2025)
Empowering Large Language Models with 3D Situation Awareness
von: Yuan, Zhihao, et al.
Veröffentlicht: (2025)
von: Yuan, Zhihao, et al.
Veröffentlicht: (2025)
SuperFlow: Training Flow Matching Models with RL on the Fly
von: Chen, Kaijie, et al.
Veröffentlicht: (2025)
von: Chen, Kaijie, et al.
Veröffentlicht: (2025)
Incentivizing Temporal-Awareness in Egocentric Video Understanding Models
von: Xu, Zhiyang, et al.
Veröffentlicht: (2026)
von: Xu, Zhiyang, et al.
Veröffentlicht: (2026)
Do Vision-Language Models Represent Space and How? Evaluating Spatial Frame of Reference Under Ambiguities
von: Zhang, Zheyuan, et al.
Veröffentlicht: (2024)
von: Zhang, Zheyuan, et al.
Veröffentlicht: (2024)
Multimodal Instruction Tuning with Conditional Mixture of LoRA
von: Shen, Ying, et al.
Veröffentlicht: (2024)
von: Shen, Ying, et al.
Veröffentlicht: (2024)
Story3D-Agent: Exploring 3D Storytelling Visualization with Large Language Models
von: Huang, Yuzhou, et al.
Veröffentlicht: (2024)
von: Huang, Yuzhou, et al.
Veröffentlicht: (2024)
Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding
von: Huang, Wencan, et al.
Veröffentlicht: (2025)
von: Huang, Wencan, et al.
Veröffentlicht: (2025)
Vision-and-Language Navigation with Analogical Textual Descriptions in LLMs
von: Zhang, Yue, et al.
Veröffentlicht: (2025)
von: Zhang, Yue, et al.
Veröffentlicht: (2025)
Think-Program-reCtify: 3D Situated Reasoning with Large Language Models
von: He, Qingrong, et al.
Veröffentlicht: (2024)
von: He, Qingrong, et al.
Veröffentlicht: (2024)
Modality-Specialized Synergizers for Interleaved Vision-Language Generalists
von: Xu, Zhiyang, et al.
Veröffentlicht: (2024)
von: Xu, Zhiyang, et al.
Veröffentlicht: (2024)
AR-RAG: Autoregressive Retrieval Augmentation for Image Generation
von: Qi, Jingyuan, et al.
Veröffentlicht: (2025)
von: Qi, Jingyuan, et al.
Veröffentlicht: (2025)
Learning to Reason in 4D: Dynamic Spatial Understanding for Vision Language Models
von: Zhou, Shengchao, et al.
Veröffentlicht: (2025)
von: Zhou, Shengchao, et al.
Veröffentlicht: (2025)
Descrip3D: Enhancing Large Language Model-based 3D Scene Understanding with Object-Level Text Descriptions
von: Xue, Jintang, et al.
Veröffentlicht: (2025)
von: Xue, Jintang, et al.
Veröffentlicht: (2025)
Pts3D-LLM: Studying the Impact of Token Structure for 3D Scene Understanding With Large Language Models
von: Thomas, Hugues, et al.
Veröffentlicht: (2025)
von: Thomas, Hugues, et al.
Veröffentlicht: (2025)
N3D-VLM: Native 3D Grounding Enables Accurate Spatial Reasoning in Vision-Language Models
von: Wang, Yuxin, et al.
Veröffentlicht: (2025)
von: Wang, Yuxin, et al.
Veröffentlicht: (2025)
Find The Gap: Knowledge Base Reasoning For Visual Question Answering
von: Barezi, Elham J., et al.
Veröffentlicht: (2024)
von: Barezi, Elham J., et al.
Veröffentlicht: (2024)
Large Spatial Model: End-to-end Unposed Images to Semantic 3D
von: Fan, Zhiwen, et al.
Veröffentlicht: (2024)
von: Fan, Zhiwen, et al.
Veröffentlicht: (2024)
Spatial 3D-LLM: Exploring Spatial Awareness in 3D Vision-Language Models
von: Wang, Xiaoyan, et al.
Veröffentlicht: (2025)
von: Wang, Xiaoyan, et al.
Veröffentlicht: (2025)
Vision-and-Language Navigation Today and Tomorrow: A Survey in the Era of Foundation Models
von: Zhang, Yue, et al.
Veröffentlicht: (2024)
von: Zhang, Yue, et al.
Veröffentlicht: (2024)
HMR3D: Hierarchical Multimodal Representation for 3D Scene Understanding with Large Vision-Language Model
von: Li, Chen, et al.
Veröffentlicht: (2025)
von: Li, Chen, et al.
Veröffentlicht: (2025)
3UR-LLM: An End-to-End Multimodal Large Language Model for 3D Scene Understanding
von: Xiong, Haomiao, et al.
Veröffentlicht: (2025)
von: Xiong, Haomiao, et al.
Veröffentlicht: (2025)
GaussianDWM: 3D Gaussian Driving World Model for Unified Scene Understanding and Multi-Modal Generation
von: Deng, Tianchen, et al.
Veröffentlicht: (2025)
von: Deng, Tianchen, et al.
Veröffentlicht: (2025)
Discovering Failure Modes in Vision-Language Models using RL
von: Jain, Kanishk, et al.
Veröffentlicht: (2026)
von: Jain, Kanishk, et al.
Veröffentlicht: (2026)
SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes
von: Huang, Jiaxin, et al.
Veröffentlicht: (2025)
von: Huang, Jiaxin, et al.
Veröffentlicht: (2025)
TrackingWorld: World-centric Monocular 3D Tracking of Almost All Pixels
von: Lu, Jiahao, et al.
Veröffentlicht: (2025)
von: Lu, Jiahao, et al.
Veröffentlicht: (2025)
SpatialReasoner: Active Perception for Large-Scale 3D Scene Understanding
von: Zheng, Hongpei, et al.
Veröffentlicht: (2025)
von: Zheng, Hongpei, et al.
Veröffentlicht: (2025)
R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation
von: Chen, Kaijie, et al.
Veröffentlicht: (2025)
von: Chen, Kaijie, et al.
Veröffentlicht: (2025)
OpenSU3D: Open World 3D Scene Understanding using Foundation Models
von: Mohiuddin, Rafay, et al.
Veröffentlicht: (2024)
von: Mohiuddin, Rafay, et al.
Veröffentlicht: (2024)
SHINE: Saliency-aware HIerarchical NEgative Ranking for Compositional Temporal Grounding
von: Cheng, Zixu, et al.
Veröffentlicht: (2024)
von: Cheng, Zixu, et al.
Veröffentlicht: (2024)
LaTtE-Flow: Layerwise Timestep-Expert Flow-based Transformer
von: Shen, Ying, et al.
Veröffentlicht: (2025)
von: Shen, Ying, et al.
Veröffentlicht: (2025)
Understanding and Evaluating Hallucinations in 3D Visual Language Models
von: Peng, Ruiying, et al.
Veröffentlicht: (2025)
von: Peng, Ruiying, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Exploring Spatial Language Grounding Through Referring Expressions
von: Tumu, Akshar, et al.
Veröffentlicht: (2025) -
Narrowing the Gap between Vision and Action in Navigation
von: Zhang, Yue, et al.
Veröffentlicht: (2024) -
Think, Act, Build: An Agentic Framework with Vision Language Models for Zero-Shot 3D Visual Grounding
von: Wang, Haibo, et al.
Veröffentlicht: (2026) -
Referring Expressions as a Lens into Spatial Language Grounding in Vision-Language Models
von: Tumu, Akshar, et al.
Veröffentlicht: (2025) -
FoR-SALE: Frame of Reference-guided Spatial Adjustment in LLM-based Diffusion Editing
von: Premsri, Tanawan, et al.
Veröffentlicht: (2025)