ReasoningTrack: Chain-of-Thought Reasoning for Long-term Vision-Language Tracking
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Xiao, Jin, Liye, Lou, Xufeng, Wang, Shiao, Chen, Lan, Jiang, Bo, Zhang, Zhipeng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Long-Term Visual Object Tracking with Event Cameras: An Associative Memory Augmented Tracker and A Benchmark Dataset
por: Wang, Xiao, et al.
Publicado: (2024)
por: Wang, Xiao, et al.
Publicado: (2024)
Towards Low-Latency Event Stream-based Visual Object Tracking: A Slow-Fast Approach
por: Wang, Shiao, et al.
Publicado: (2025)
por: Wang, Shiao, et al.
Publicado: (2025)
Event Stream-based Visual Object Tracking: HDETrack V2 and A High-Definition Benchmark
por: Wang, Shiao, et al.
Publicado: (2025)
por: Wang, Shiao, et al.
Publicado: (2025)
Mamba-FETrack: Frame-Event Tracking via State Space Model
por: Huang, Ju, et al.
Publicado: (2024)
por: Huang, Ju, et al.
Publicado: (2024)
MambaEVT: Event Stream based Visual Object Tracking using State Space Model
por: Wang, Xiao, et al.
Publicado: (2024)
por: Wang, Xiao, et al.
Publicado: (2024)
ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning
por: Wang, Xiao, et al.
Publicado: (2025)
por: Wang, Xiao, et al.
Publicado: (2025)
Mamba-FETrack V2: Revisiting State Space Model for Frame-Event based Visual Object Tracking
por: Wang, Shiao, et al.
Publicado: (2025)
por: Wang, Shiao, et al.
Publicado: (2025)
Dynamic Pondering Sparsity-aware Mixture-of-Experts Transformer for Event Stream based Visual Object Tracking
por: Wang, Shiao, et al.
Publicado: (2026)
por: Wang, Shiao, et al.
Publicado: (2026)
Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning
por: Tian, Shulin, et al.
Publicado: (2025)
por: Tian, Shulin, et al.
Publicado: (2025)
Decoupling Amplitude and Phase Attention in Frequency Domain for RGB-Event based Visual Object Tracking
por: Wang, Shiao, et al.
Publicado: (2026)
por: Wang, Shiao, et al.
Publicado: (2026)
Revisiting the Necessity of Lengthy Chain-of-Thought in Vision-centric Reasoning Generalization
por: Du, Yifan, et al.
Publicado: (2025)
por: Du, Yifan, et al.
Publicado: (2025)
CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models
por: Zhao, Qingqing, et al.
Publicado: (2025)
por: Zhao, Qingqing, et al.
Publicado: (2025)
ImgCoT: Compressing Long Chain of Thought into Compact Visual Tokens for Efficient Reasoning of Large Language Model
por: Chen, Xiaoshu, et al.
Publicado: (2026)
por: Chen, Xiaoshu, et al.
Publicado: (2026)
Multimodal Chain-of-Thought Reasoning in Language Models
por: Zhang, Zhuosheng, et al.
Publicado: (2023)
por: Zhang, Zhuosheng, et al.
Publicado: (2023)
GEMeX-RMCoT: An Enhanced Med-VQA Dataset for Region-Aware Multimodal Chain-of-Thought Reasoning
por: Liu, Bo, et al.
Publicado: (2025)
por: Liu, Bo, et al.
Publicado: (2025)
Underwater Camouflaged Object Tracking Meets Vision-Language SAM2
por: Zhang, Chunhui, et al.
Publicado: (2024)
por: Zhang, Chunhui, et al.
Publicado: (2024)
TrackVLA++: Unleashing Reasoning and Memory Capabilities in VLA Models for Embodied Visual Tracking
por: Liu, Jiahang, et al.
Publicado: (2025)
por: Liu, Jiahang, et al.
Publicado: (2025)
Adversarial Attack for RGB-Event based Visual Object Tracking
por: Chen, Qiang, et al.
Publicado: (2025)
por: Chen, Qiang, et al.
Publicado: (2025)
Let's Think with Images Efficiently! An Interleaved-Modal Chain-of-Thought Reasoning Framework with Dynamic and Precise Visual Thoughts
por: Liu, Xu, et al.
Publicado: (2026)
por: Liu, Xu, et al.
Publicado: (2026)
Spatial Orthogonal Refinement for Robust RGB-Event Visual Object Tracking
por: Huang, Dexing, et al.
Publicado: (2026)
por: Huang, Dexing, et al.
Publicado: (2026)
Rethinking Chain-of-Thought Reasoning for Videos
por: Zhong, Yiwu, et al.
Publicado: (2025)
por: Zhong, Yiwu, et al.
Publicado: (2025)
Long Grounded Thoughts: Synthesizing Visual Problems and Reasoning Chains at Scale
por: Acuna, David, et al.
Publicado: (2025)
por: Acuna, David, et al.
Publicado: (2025)
Unveiling Chain of Step Reasoning for Vision-Language Models with Fine-grained Rewards
por: Chen, Honghao, et al.
Publicado: (2025)
por: Chen, Honghao, et al.
Publicado: (2025)
MM-CoT:A Benchmark for Probing Visual Chain-of-Thought Reasoning in Multimodal Models
por: Zhang, Jusheng, et al.
Publicado: (2025)
por: Zhang, Jusheng, et al.
Publicado: (2025)
MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency
por: Jiang, Dongzhi, et al.
Publicado: (2025)
por: Jiang, Dongzhi, et al.
Publicado: (2025)
Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought
por: Man, Yunze, et al.
Publicado: (2025)
por: Man, Yunze, et al.
Publicado: (2025)
Theorem-Validated Reverse Chain-of-Thought Problem Generation for Geometric Reasoning
por: Deng, Linger, et al.
Publicado: (2024)
por: Deng, Linger, et al.
Publicado: (2024)
Stop Reasoning! When Multimodal LLM with Chain-of-Thought Reasoning Meets Adversarial Image
por: Wang, Zefeng, et al.
Publicado: (2024)
por: Wang, Zefeng, et al.
Publicado: (2024)
RBF++: Quantifying and Optimizing Reasoning Boundaries across Measurable and Unmeasurable Capabilities for Chain-of-Thought Reasoning
por: Chen, Qiguang, et al.
Publicado: (2025)
por: Chen, Qiguang, et al.
Publicado: (2025)
Process-of-Thought Reasoning for Videos
por: Zhang, Jusheng, et al.
Publicado: (2026)
por: Zhang, Jusheng, et al.
Publicado: (2026)
GeoChain: Multimodal Chain-of-Thought for Geographic Reasoning
por: Yerramilli, Sahiti, et al.
Publicado: (2025)
por: Yerramilli, Sahiti, et al.
Publicado: (2025)
FantasyVLN: Unified Multimodal Chain-of-Thought Reasoning for Vision-Language Navigation
por: Zuo, Jing, et al.
Publicado: (2026)
por: Zuo, Jing, et al.
Publicado: (2026)
Reason-RFT: Reinforcement Fine-Tuning for Visual Reasoning of Vision Language Models
por: Tan, Huajie, et al.
Publicado: (2025)
por: Tan, Huajie, et al.
Publicado: (2025)
More Thought, Less Accuracy? On the Dual Nature of Reasoning in Vision-Language Models
por: Tian, Xinyu, et al.
Publicado: (2025)
por: Tian, Xinyu, et al.
Publicado: (2025)
Imitation Game for Adversarial Disillusion with Chain-of-Thought Reasoning in Generative AI
por: Chang, Ching-Chun, et al.
Publicado: (2025)
por: Chang, Ching-Chun, et al.
Publicado: (2025)
Bridging the Dynamic Perception Gap: Training-Free Draft Chain-of-Thought for Dynamic Multimodal Spatial Reasoning
por: Ou, Siqu, et al.
Publicado: (2025)
por: Ou, Siqu, et al.
Publicado: (2025)
HMVLM: Multistage Reasoning-Enhanced Vision-Language Model for Long-Tailed Driving Scenarios
por: Wang, Daming, et al.
Publicado: (2025)
por: Wang, Daming, et al.
Publicado: (2025)
Chart-R1: Chain-of-Thought Supervision and Reinforcement for Advanced Chart Reasoner
por: Chen, Lei, et al.
Publicado: (2025)
por: Chen, Lei, et al.
Publicado: (2025)
VLM-R$^3$: Region Recognition, Reasoning, and Refinement for Enhanced Multimodal Chain-of-Thought
por: Jiang, Chaoya, et al.
Publicado: (2025)
por: Jiang, Chaoya, et al.
Publicado: (2025)
RGB-Event based Pedestrian Attribute Recognition: A Benchmark Dataset and An Asymmetric RWKV Fusion Framework
por: Wang, Xiao, et al.
Publicado: (2025)
por: Wang, Xiao, et al.
Publicado: (2025)
Ejemplares similares
-
Long-Term Visual Object Tracking with Event Cameras: An Associative Memory Augmented Tracker and A Benchmark Dataset
por: Wang, Xiao, et al.
Publicado: (2024) -
Towards Low-Latency Event Stream-based Visual Object Tracking: A Slow-Fast Approach
por: Wang, Shiao, et al.
Publicado: (2025) -
Event Stream-based Visual Object Tracking: HDETrack V2 and A High-Definition Benchmark
por: Wang, Shiao, et al.
Publicado: (2025) -
Mamba-FETrack: Frame-Event Tracking via State Space Model
por: Huang, Ju, et al.
Publicado: (2024) -
MambaEVT: Event Stream based Visual Object Tracking using State Space Model
por: Wang, Xiao, et al.
Publicado: (2024)