World2VLM: Distilling World Model Imagination into VLMs for Dynamic Spatial Reasoning
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Wanyue, Wu, Wenxiang, Xu, Wang, Luo, Jiaxin, Zhi, Helu, Huang, Yibin, Ren, Shuo, Liu, Zitao, Zhang, Jiajun |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Why Do MLLMs Struggle with Spatial Understanding? A Systematic Analysis from Data to Architecture
por: Zhang, Wanyue, et al.
Publicado: (2025)
por: Zhang, Wanyue, et al.
Publicado: (2025)
Video2Layout: Recall and Reconstruct Metric-Grounded Cognitive Map for Spatial Reasoning
por: Huang, Yibin, et al.
Publicado: (2025)
por: Huang, Yibin, et al.
Publicado: (2025)
Thinking with Spatial Code for Physical-World Video Reasoning
por: Chen, Jieneng, et al.
Publicado: (2026)
por: Chen, Jieneng, et al.
Publicado: (2026)
Can World Models Benefit VLMs for World Dynamics?
por: Zhang, Kevin, et al.
Publicado: (2025)
por: Zhang, Kevin, et al.
Publicado: (2025)
HKD4VLM: A Progressive Hybrid Knowledge Distillation Framework for Robust Multimodal Hallucination and Factuality Detection in VLMs
por: Zhang, Zijian, et al.
Publicado: (2025)
por: Zhang, Zijian, et al.
Publicado: (2025)
WorldVLM: Combining World Model Forecasting and Vision-Language Reasoning
por: Englmeier, Stefan, et al.
Publicado: (2026)
por: Englmeier, Stefan, et al.
Publicado: (2026)
MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders
por: Cao, Jiajun, et al.
Publicado: (2025)
por: Cao, Jiajun, et al.
Publicado: (2025)
Thinking in Dynamics: How Multimodal Large Language Models Perceive, Track, and Reason Dynamics in Physical 4D World
por: Huang, Yuzhi, et al.
Publicado: (2026)
por: Huang, Yuzhi, et al.
Publicado: (2026)
ProSR: Process-Shaped Spatial Reasoning for Reliable Chain-of-Thought in VLMs
por: Li, Jiangyang, et al.
Publicado: (2026)
por: Li, Jiangyang, et al.
Publicado: (2026)
SpatialImaginer: Towards Adaptive Visual Imagination for Spatial Reasoning
por: Li, Yian, et al.
Publicado: (2026)
por: Li, Yian, et al.
Publicado: (2026)
When and How Much to Imagine: Adaptive Test-Time Scaling with World Models for Visual Spatial Reasoning
por: Yu, Shoubin, et al.
Publicado: (2026)
por: Yu, Shoubin, et al.
Publicado: (2026)
PhysicsMind: Sim and Real Mechanics Benchmarking for Physical Reasoning and Prediction in Foundational VLMs and World Models
por: Mak, Chak-Wing, et al.
Publicado: (2026)
por: Mak, Chak-Wing, et al.
Publicado: (2026)
Seeing through Imagination: Learning Scene Geometry via Implicit Spatial World Modeling
por: Cao, Meng, et al.
Publicado: (2025)
por: Cao, Meng, et al.
Publicado: (2025)
Adaptive Chain-of-Focus Reasoning via Dynamic Visual Search and Zooming for Efficient VLMs
por: Zhang, Xintong, et al.
Publicado: (2025)
por: Zhang, Xintong, et al.
Publicado: (2025)
WPT: World-to-Policy Transfer via Online World Model Distillation
por: Jiang, Guangfeng, et al.
Publicado: (2025)
por: Jiang, Guangfeng, et al.
Publicado: (2025)
Choreographing a World of Dynamic Objects
por: Lyu, Yanzhe, et al.
Publicado: (2026)
por: Lyu, Yanzhe, et al.
Publicado: (2026)
GeoWorld-VLM: Geometry from World Models for Vision-Language Models
por: Gu, Renjie, et al.
Publicado: (2026)
por: Gu, Renjie, et al.
Publicado: (2026)
From Indoor to Open World: Revealing the Spatial Reasoning Gap in MLLMs
por: Wu, Mingrui, et al.
Publicado: (2025)
por: Wu, Mingrui, et al.
Publicado: (2025)
VISTAv2: World Imagination for Indoor Vision-and-Language Navigation
por: Huang, Yanjia, et al.
Publicado: (2025)
por: Huang, Yanjia, et al.
Publicado: (2025)
Fine-Grained Preference Optimization Improves Spatial Reasoning in VLMs
por: Shen, Yifan, et al.
Publicado: (2025)
por: Shen, Yifan, et al.
Publicado: (2025)
WorldGenBench: A World-Knowledge-Integrated Benchmark for Reasoning-Driven Text-to-Image Generation
por: Zhang, Daoan, et al.
Publicado: (2025)
por: Zhang, Daoan, et al.
Publicado: (2025)
SpatialStack: Layered Geometry-Language Fusion for 3D VLM Spatial Reasoning
por: Zhang, Jian, et al.
Publicado: (2026)
por: Zhang, Jian, et al.
Publicado: (2026)
Attention in Space: Functional Roles of VLM Heads for Spatial Reasoning
por: Ma, Xueqi, et al.
Publicado: (2026)
por: Ma, Xueqi, et al.
Publicado: (2026)
MyVLM: Personalizing VLMs for User-Specific Queries
por: Alaluf, Yuval, et al.
Publicado: (2024)
por: Alaluf, Yuval, et al.
Publicado: (2024)
CLGRPO: Reasoning Ability Enhancement for Small VLMs
por: Wang, Fanyi, et al.
Publicado: (2025)
por: Wang, Fanyi, et al.
Publicado: (2025)
MineDreamer: Learning to Follow Instructions via Chain-of-Imagination for Simulated-World Control
por: Zhou, Enshen, et al.
Publicado: (2024)
por: Zhou, Enshen, et al.
Publicado: (2024)
SIRI-Bench: Challenging VLMs' Spatial Intelligence through Complex Reasoning Tasks
por: Song, Zijian, et al.
Publicado: (2025)
por: Song, Zijian, et al.
Publicado: (2025)
SpinBench: Perspective and Rotation as a Lens on Spatial Reasoning in VLMs
por: Zhang, Yuyou, et al.
Publicado: (2025)
por: Zhang, Yuyou, et al.
Publicado: (2025)
Ego to World: Collaborative Spatial Reasoning in Embodied Systems via Reinforcement Learning
por: Zhou, Heng, et al.
Publicado: (2026)
por: Zhou, Heng, et al.
Publicado: (2026)
Linear Scaling Video VLMs for Long Video Understanding
por: Eyzaguirre, Cristobal, et al.
Publicado: (2026)
por: Eyzaguirre, Cristobal, et al.
Publicado: (2026)
An Open-World, Diverse, Cross-Spatial-Temporal Benchmark for Dynamic Wild Person Re-Identification
por: Zhang, Lei, et al.
Publicado: (2024)
por: Zhang, Lei, et al.
Publicado: (2024)
VLM-KD: Knowledge Distillation from VLM for Long-Tail Visual Recognition
por: Zhang, Zaiwei, et al.
Publicado: (2024)
por: Zhang, Zaiwei, et al.
Publicado: (2024)
Jigsaw++: Imagining Complete Shape Priors for Object Reassembly
por: Lu, Jiaxin, et al.
Publicado: (2024)
por: Lu, Jiaxin, et al.
Publicado: (2024)
DynaSolidGeo: A Dynamic Benchmark for Genuine Spatial Mathematical Reasoning of VLMs in Solid Geometry
por: Wu, Changti, et al.
Publicado: (2025)
por: Wu, Changti, et al.
Publicado: (2025)
MetaSpatial: Reinforcing 3D Spatial Reasoning in VLMs for the Metaverse
por: Pan, Zhenyu, et al.
Publicado: (2025)
por: Pan, Zhenyu, et al.
Publicado: (2025)
N3D-VLM: Native 3D Grounding Enables Accurate Spatial Reasoning in Vision-Language Models
por: Wang, Yuxin, et al.
Publicado: (2025)
por: Wang, Yuxin, et al.
Publicado: (2025)
What if? Emulative Simulation with World Models for Situated Reasoning
por: Liu, Ruiping, et al.
Publicado: (2026)
por: Liu, Ruiping, et al.
Publicado: (2026)
UniReason 1.0: A Unified Reasoning Framework for World Knowledge Aligned Image Generation and Editing
por: Wang, Dianyi, et al.
Publicado: (2026)
por: Wang, Dianyi, et al.
Publicado: (2026)
Reasoning in Space via Grounding in the World
por: Chen, Yiming, et al.
Publicado: (2025)
por: Chen, Yiming, et al.
Publicado: (2025)
Audio-Visual World Models: Towards Multisensory Imagination in Sight and Sound
por: Wang, Jiahua, et al.
Publicado: (2025)
por: Wang, Jiahua, et al.
Publicado: (2025)
Ejemplares similares
-
Why Do MLLMs Struggle with Spatial Understanding? A Systematic Analysis from Data to Architecture
por: Zhang, Wanyue, et al.
Publicado: (2025) -
Video2Layout: Recall and Reconstruct Metric-Grounded Cognitive Map for Spatial Reasoning
por: Huang, Yibin, et al.
Publicado: (2025) -
Thinking with Spatial Code for Physical-World Video Reasoning
por: Chen, Jieneng, et al.
Publicado: (2026) -
Can World Models Benefit VLMs for World Dynamics?
por: Zhang, Kevin, et al.
Publicado: (2025) -
HKD4VLM: A Progressive Hybrid Knowledge Distillation Framework for Robust Multimodal Hallucination and Factuality Detection in VLMs
por: Zhang, Zijian, et al.
Publicado: (2025)