Gespeichert in:
| Hauptverfasser: | Deng, Wei, Zhang, Xianlin, Qi, Mengshi |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | https://arxiv.org/abs/2606.02459 |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Explainable Action Form Assessment by Exploiting Multimodal Chain-of-Thoughts Reasoning
von: Qi, Mengshi, et al.
Veröffentlicht: (2025)
von: Qi, Mengshi, et al.
Veröffentlicht: (2025)
Chain-of-Evidence Multimodal Reasoning for Few-shot Temporal Action Localization
von: Qi, Mengshi, et al.
Veröffentlicht: (2025)
von: Qi, Mengshi, et al.
Veröffentlicht: (2025)
Towards Balanced Multi-Modal Learning in 3D Human Pose Estimation
von: Qi, Mengshi, et al.
Veröffentlicht: (2025)
von: Qi, Mengshi, et al.
Veröffentlicht: (2025)
Global-Local Tree Search in VLMs for 3D Indoor Scene Generation
von: Deng, Wei, et al.
Veröffentlicht: (2025)
von: Deng, Wei, et al.
Veröffentlicht: (2025)
Question-Aware Evidence Ledgers for Video Relational Reasoning
von: Ou, Yilin, et al.
Veröffentlicht: (2026)
von: Ou, Yilin, et al.
Veröffentlicht: (2026)
Robust Disentangled Counterfactual Learning for Physical Audiovisual Commonsense Reasoning
von: Qi, Mengshi, et al.
Veröffentlicht: (2025)
von: Qi, Mengshi, et al.
Veröffentlicht: (2025)
InternSpatial: A Comprehensive Dataset for Spatial Reasoning in Vision-Language Models
von: Deng, Nianchen, et al.
Veröffentlicht: (2025)
von: Deng, Nianchen, et al.
Veröffentlicht: (2025)
Learning to Reason in 4D: Dynamic Spatial Understanding for Vision Language Models
von: Zhou, Shengchao, et al.
Veröffentlicht: (2025)
von: Zhou, Shengchao, et al.
Veröffentlicht: (2025)
Reinforcing Spatial Reasoning in Vision-Language Models with Interwoven Thinking and Visual Drawing
von: Wu, Junfei, et al.
Veröffentlicht: (2025)
von: Wu, Junfei, et al.
Veröffentlicht: (2025)
Boosting the Generalization and Reasoning of Vision Language Models with Curriculum Reinforcement Learning
von: Deng, Huilin, et al.
Veröffentlicht: (2025)
von: Deng, Huilin, et al.
Veröffentlicht: (2025)
T2SG: Traffic Topology Scene Graph for Topology Reasoning in Autonomous Driving
von: Lv, Changsheng, et al.
Veröffentlicht: (2024)
von: Lv, Changsheng, et al.
Veröffentlicht: (2024)
Multi-Stage Contrastive Regression for Action Quality Assessment
von: An, Qi, et al.
Veröffentlicht: (2024)
von: An, Qi, et al.
Veröffentlicht: (2024)
OmniSpatial: Towards Comprehensive Spatial Reasoning Benchmark for Vision Language Models
von: Jia, Mengdi, et al.
Veröffentlicht: (2025)
von: Jia, Mengdi, et al.
Veröffentlicht: (2025)
SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models
von: Cheng, An-Chieh, et al.
Veröffentlicht: (2024)
von: Cheng, An-Chieh, et al.
Veröffentlicht: (2024)
See, Remember, Explore: A Benchmark and Baselines for Streaming Spatial Reasoning
von: Wei, Yuxi, et al.
Veröffentlicht: (2026)
von: Wei, Yuxi, et al.
Veröffentlicht: (2026)
Spatial 3D-LLM: Exploring Spatial Awareness in 3D Vision-Language Models
von: Wang, Xiaoyan, et al.
Veröffentlicht: (2025)
von: Wang, Xiaoyan, et al.
Veröffentlicht: (2025)
Vision-Language Memory for Spatial Reasoning
von: Liu, Zuntao, et al.
Veröffentlicht: (2025)
von: Liu, Zuntao, et al.
Veröffentlicht: (2025)
ActFER: Agentic Facial Expression Recognition via Active Tool-Augmented Visual Reasoning
von: Liu, Shifeng, et al.
Veröffentlicht: (2026)
von: Liu, Shifeng, et al.
Veröffentlicht: (2026)
SURDS: Benchmarking Spatial Understanding and Reasoning in Driving Scenarios with Vision Language Models
von: Guo, Xianda, et al.
Veröffentlicht: (2024)
von: Guo, Xianda, et al.
Veröffentlicht: (2024)
Sparkle: Mastering Basic Spatial Capabilities in Vision Language Models Elicits Generalization to Spatial Reasoning
von: Tang, Yihong, et al.
Veröffentlicht: (2024)
von: Tang, Yihong, et al.
Veröffentlicht: (2024)
SpatialDreamer: Incentivizing Spatial Reasoning via Active Mental Imagery
von: Cao, Meng, et al.
Veröffentlicht: (2025)
von: Cao, Meng, et al.
Veröffentlicht: (2025)
Ascending the Infinite Ladder: Benchmarking Spatial Deformation Reasoning in Vision-Language Models
von: Zhang, Jiahuan, et al.
Veröffentlicht: (2025)
von: Zhang, Jiahuan, et al.
Veröffentlicht: (2025)
Spatial Reasoning with Vision-Language Models in Ego-Centric Multi-View Scenes
von: Gholami, Mohsen, et al.
Veröffentlicht: (2025)
von: Gholami, Mohsen, et al.
Veröffentlicht: (2025)
Spatial-DISE: A Unified Benchmark for Evaluating Spatial Reasoning in Vision-Language Models
von: Huang, Xinmiao, et al.
Veröffentlicht: (2025)
von: Huang, Xinmiao, et al.
Veröffentlicht: (2025)
Learning Group Interactions and Semantic Intentions for Multi-Object Trajectory Prediction
von: Qi, Mengshi, et al.
Veröffentlicht: (2024)
von: Qi, Mengshi, et al.
Veröffentlicht: (2024)
Decomposed Vector-Quantized Variational Autoencoder for Human Grasp Generation
von: Zhao, Zhe, et al.
Veröffentlicht: (2024)
von: Zhao, Zhe, et al.
Veröffentlicht: (2024)
Seeing Across Views: Benchmarking Spatial Reasoning of Vision-Language Models in Robotic Scenes
von: Feng, Zhiyuan, et al.
Veröffentlicht: (2025)
von: Feng, Zhiyuan, et al.
Veröffentlicht: (2025)
HiSpatial: Taming Hierarchical 3D Spatial Understanding in Vision-Language Models
von: Liang, Huizhi, et al.
Veröffentlicht: (2026)
von: Liang, Huizhi, et al.
Veröffentlicht: (2026)
ViThinker: Active Vision-Language Reasoning via Dynamic Perceptual Querying
von: You, Weihang, et al.
Veröffentlicht: (2026)
von: You, Weihang, et al.
Veröffentlicht: (2026)
Thinking with Blueprints: Assisting Vision-Language Models in Spatial Reasoning via Structured Object Representation
von: Ma, Weijian, et al.
Veröffentlicht: (2026)
von: Ma, Weijian, et al.
Veröffentlicht: (2026)
Uncovering the human motion pattern: Pattern Memory-based Diffusion Model for Trajectory Prediction
von: Yang, Yuxin, et al.
Veröffentlicht: (2024)
von: Yang, Yuxin, et al.
Veröffentlicht: (2024)
SSR: Enhancing Depth Perception in Vision-Language Models via Rationale-Guided Spatial Reasoning
von: Liu, Yang, et al.
Veröffentlicht: (2025)
von: Liu, Yang, et al.
Veröffentlicht: (2025)
Recognition through Reasoning: Reinforcing Image Geo-localization with Large Vision-Language Models
von: Li, Ling, et al.
Veröffentlicht: (2025)
von: Li, Ling, et al.
Veröffentlicht: (2025)
SpatialLadder: Progressive Training for Spatial Reasoning in Vision-Language Models
von: Li, Hongxing, et al.
Veröffentlicht: (2025)
von: Li, Hongxing, et al.
Veröffentlicht: (2025)
SenseNova-MARS: Empowering Multimodal Agentic Reasoning and Search via Reinforcement Learning
von: Chng, Yong Xien, et al.
Veröffentlicht: (2025)
von: Chng, Yong Xien, et al.
Veröffentlicht: (2025)
Mind the Gap: Benchmarking Spatial Reasoning in Vision-Language Models
von: Stogiannidis, Ilias, et al.
Veröffentlicht: (2025)
von: Stogiannidis, Ilias, et al.
Veröffentlicht: (2025)
VIoTGPT: Learning to Schedule Vision Tools in LLMs towards Intelligent Video Internet of Things
von: Zhong, Yaoyao, et al.
Veröffentlicht: (2023)
von: Zhong, Yaoyao, et al.
Veröffentlicht: (2023)
Think or Not? Selective Reasoning via Reinforcement Learning for Vision-Language Models
von: Wang, Jiaqi, et al.
Veröffentlicht: (2025)
von: Wang, Jiaqi, et al.
Veröffentlicht: (2025)
Enhancing MLLM Spatial Understanding via Active 3D Scene Exploration for Multi-Perspective Reasoning
von: Chen, Jiahua, et al.
Veröffentlicht: (2026)
von: Chen, Jiahua, et al.
Veröffentlicht: (2026)
Beyond Semantics: Rediscovering Spatial Awareness in Vision-Language Models
von: Qi, Jianing, et al.
Veröffentlicht: (2025)
von: Qi, Jianing, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Explainable Action Form Assessment by Exploiting Multimodal Chain-of-Thoughts Reasoning
von: Qi, Mengshi, et al.
Veröffentlicht: (2025) -
Chain-of-Evidence Multimodal Reasoning for Few-shot Temporal Action Localization
von: Qi, Mengshi, et al.
Veröffentlicht: (2025) -
Towards Balanced Multi-Modal Learning in 3D Human Pose Estimation
von: Qi, Mengshi, et al.
Veröffentlicht: (2025) -
Global-Local Tree Search in VLMs for 3D Indoor Scene Generation
von: Deng, Wei, et al.
Veröffentlicht: (2025) -
Question-Aware Evidence Ledgers for Video Relational Reasoning
von: Ou, Yilin, et al.
Veröffentlicht: (2026)