Enregistré dans:
| Auteurs principaux: | Deng, Wei, Zhang, Xianlin, Qi, Mengshi |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2606.02459 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Explainable Action Form Assessment by Exploiting Multimodal Chain-of-Thoughts Reasoning
par: Qi, Mengshi, et autres
Publié: (2025)
par: Qi, Mengshi, et autres
Publié: (2025)
Chain-of-Evidence Multimodal Reasoning for Few-shot Temporal Action Localization
par: Qi, Mengshi, et autres
Publié: (2025)
par: Qi, Mengshi, et autres
Publié: (2025)
Towards Balanced Multi-Modal Learning in 3D Human Pose Estimation
par: Qi, Mengshi, et autres
Publié: (2025)
par: Qi, Mengshi, et autres
Publié: (2025)
Global-Local Tree Search in VLMs for 3D Indoor Scene Generation
par: Deng, Wei, et autres
Publié: (2025)
par: Deng, Wei, et autres
Publié: (2025)
Question-Aware Evidence Ledgers for Video Relational Reasoning
par: Ou, Yilin, et autres
Publié: (2026)
par: Ou, Yilin, et autres
Publié: (2026)
Robust Disentangled Counterfactual Learning for Physical Audiovisual Commonsense Reasoning
par: Qi, Mengshi, et autres
Publié: (2025)
par: Qi, Mengshi, et autres
Publié: (2025)
InternSpatial: A Comprehensive Dataset for Spatial Reasoning in Vision-Language Models
par: Deng, Nianchen, et autres
Publié: (2025)
par: Deng, Nianchen, et autres
Publié: (2025)
Learning to Reason in 4D: Dynamic Spatial Understanding for Vision Language Models
par: Zhou, Shengchao, et autres
Publié: (2025)
par: Zhou, Shengchao, et autres
Publié: (2025)
Reinforcing Spatial Reasoning in Vision-Language Models with Interwoven Thinking and Visual Drawing
par: Wu, Junfei, et autres
Publié: (2025)
par: Wu, Junfei, et autres
Publié: (2025)
Boosting the Generalization and Reasoning of Vision Language Models with Curriculum Reinforcement Learning
par: Deng, Huilin, et autres
Publié: (2025)
par: Deng, Huilin, et autres
Publié: (2025)
T2SG: Traffic Topology Scene Graph for Topology Reasoning in Autonomous Driving
par: Lv, Changsheng, et autres
Publié: (2024)
par: Lv, Changsheng, et autres
Publié: (2024)
Multi-Stage Contrastive Regression for Action Quality Assessment
par: An, Qi, et autres
Publié: (2024)
par: An, Qi, et autres
Publié: (2024)
OmniSpatial: Towards Comprehensive Spatial Reasoning Benchmark for Vision Language Models
par: Jia, Mengdi, et autres
Publié: (2025)
par: Jia, Mengdi, et autres
Publié: (2025)
SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models
par: Cheng, An-Chieh, et autres
Publié: (2024)
par: Cheng, An-Chieh, et autres
Publié: (2024)
See, Remember, Explore: A Benchmark and Baselines for Streaming Spatial Reasoning
par: Wei, Yuxi, et autres
Publié: (2026)
par: Wei, Yuxi, et autres
Publié: (2026)
Spatial 3D-LLM: Exploring Spatial Awareness in 3D Vision-Language Models
par: Wang, Xiaoyan, et autres
Publié: (2025)
par: Wang, Xiaoyan, et autres
Publié: (2025)
Vision-Language Memory for Spatial Reasoning
par: Liu, Zuntao, et autres
Publié: (2025)
par: Liu, Zuntao, et autres
Publié: (2025)
ActFER: Agentic Facial Expression Recognition via Active Tool-Augmented Visual Reasoning
par: Liu, Shifeng, et autres
Publié: (2026)
par: Liu, Shifeng, et autres
Publié: (2026)
SURDS: Benchmarking Spatial Understanding and Reasoning in Driving Scenarios with Vision Language Models
par: Guo, Xianda, et autres
Publié: (2024)
par: Guo, Xianda, et autres
Publié: (2024)
Sparkle: Mastering Basic Spatial Capabilities in Vision Language Models Elicits Generalization to Spatial Reasoning
par: Tang, Yihong, et autres
Publié: (2024)
par: Tang, Yihong, et autres
Publié: (2024)
SpatialDreamer: Incentivizing Spatial Reasoning via Active Mental Imagery
par: Cao, Meng, et autres
Publié: (2025)
par: Cao, Meng, et autres
Publié: (2025)
Ascending the Infinite Ladder: Benchmarking Spatial Deformation Reasoning in Vision-Language Models
par: Zhang, Jiahuan, et autres
Publié: (2025)
par: Zhang, Jiahuan, et autres
Publié: (2025)
Spatial Reasoning with Vision-Language Models in Ego-Centric Multi-View Scenes
par: Gholami, Mohsen, et autres
Publié: (2025)
par: Gholami, Mohsen, et autres
Publié: (2025)
Spatial-DISE: A Unified Benchmark for Evaluating Spatial Reasoning in Vision-Language Models
par: Huang, Xinmiao, et autres
Publié: (2025)
par: Huang, Xinmiao, et autres
Publié: (2025)
Learning Group Interactions and Semantic Intentions for Multi-Object Trajectory Prediction
par: Qi, Mengshi, et autres
Publié: (2024)
par: Qi, Mengshi, et autres
Publié: (2024)
Decomposed Vector-Quantized Variational Autoencoder for Human Grasp Generation
par: Zhao, Zhe, et autres
Publié: (2024)
par: Zhao, Zhe, et autres
Publié: (2024)
Seeing Across Views: Benchmarking Spatial Reasoning of Vision-Language Models in Robotic Scenes
par: Feng, Zhiyuan, et autres
Publié: (2025)
par: Feng, Zhiyuan, et autres
Publié: (2025)
HiSpatial: Taming Hierarchical 3D Spatial Understanding in Vision-Language Models
par: Liang, Huizhi, et autres
Publié: (2026)
par: Liang, Huizhi, et autres
Publié: (2026)
ViThinker: Active Vision-Language Reasoning via Dynamic Perceptual Querying
par: You, Weihang, et autres
Publié: (2026)
par: You, Weihang, et autres
Publié: (2026)
Thinking with Blueprints: Assisting Vision-Language Models in Spatial Reasoning via Structured Object Representation
par: Ma, Weijian, et autres
Publié: (2026)
par: Ma, Weijian, et autres
Publié: (2026)
Uncovering the human motion pattern: Pattern Memory-based Diffusion Model for Trajectory Prediction
par: Yang, Yuxin, et autres
Publié: (2024)
par: Yang, Yuxin, et autres
Publié: (2024)
SSR: Enhancing Depth Perception in Vision-Language Models via Rationale-Guided Spatial Reasoning
par: Liu, Yang, et autres
Publié: (2025)
par: Liu, Yang, et autres
Publié: (2025)
Recognition through Reasoning: Reinforcing Image Geo-localization with Large Vision-Language Models
par: Li, Ling, et autres
Publié: (2025)
par: Li, Ling, et autres
Publié: (2025)
SpatialLadder: Progressive Training for Spatial Reasoning in Vision-Language Models
par: Li, Hongxing, et autres
Publié: (2025)
par: Li, Hongxing, et autres
Publié: (2025)
SenseNova-MARS: Empowering Multimodal Agentic Reasoning and Search via Reinforcement Learning
par: Chng, Yong Xien, et autres
Publié: (2025)
par: Chng, Yong Xien, et autres
Publié: (2025)
Mind the Gap: Benchmarking Spatial Reasoning in Vision-Language Models
par: Stogiannidis, Ilias, et autres
Publié: (2025)
par: Stogiannidis, Ilias, et autres
Publié: (2025)
VIoTGPT: Learning to Schedule Vision Tools in LLMs towards Intelligent Video Internet of Things
par: Zhong, Yaoyao, et autres
Publié: (2023)
par: Zhong, Yaoyao, et autres
Publié: (2023)
Think or Not? Selective Reasoning via Reinforcement Learning for Vision-Language Models
par: Wang, Jiaqi, et autres
Publié: (2025)
par: Wang, Jiaqi, et autres
Publié: (2025)
Enhancing MLLM Spatial Understanding via Active 3D Scene Exploration for Multi-Perspective Reasoning
par: Chen, Jiahua, et autres
Publié: (2026)
par: Chen, Jiahua, et autres
Publié: (2026)
Beyond Semantics: Rediscovering Spatial Awareness in Vision-Language Models
par: Qi, Jianing, et autres
Publié: (2025)
par: Qi, Jianing, et autres
Publié: (2025)
Documents similaires
-
Explainable Action Form Assessment by Exploiting Multimodal Chain-of-Thoughts Reasoning
par: Qi, Mengshi, et autres
Publié: (2025) -
Chain-of-Evidence Multimodal Reasoning for Few-shot Temporal Action Localization
par: Qi, Mengshi, et autres
Publié: (2025) -
Towards Balanced Multi-Modal Learning in 3D Human Pose Estimation
par: Qi, Mengshi, et autres
Publié: (2025) -
Global-Local Tree Search in VLMs for 3D Indoor Scene Generation
par: Deng, Wei, et autres
Publié: (2025) -
Question-Aware Evidence Ledgers for Video Relational Reasoning
par: Ou, Yilin, et autres
Publié: (2026)