Reinforcing Structured Chain-of-Thought for Video Understanding
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Peiyao, Xu, Haotian, Vesdapunt, Noranart, Hou, Rui, Zhang, Jingyi, Ling, Haibin, Obiednikov, Oleksandr, Zhou, Ning, Fu, Kah Kuen |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
$Δ$ynamics: Language-Based Representation for Inferring Rigid-Body Dynamics From Videos
di: Kao, Chia-Hsiang, et al.
Pubblicazione: (2026)
di: Kao, Chia-Hsiang, et al.
Pubblicazione: (2026)
SVQA-R1: Reinforcing Spatial Reasoning in MLLMs via View-Consistent Reward Optimization
di: Wang, Peiyao, et al.
Pubblicazione: (2025)
di: Wang, Peiyao, et al.
Pubblicazione: (2025)
RCoT-Seg: Reinforced Chain-of-Thought for Video Reasoning and Segmentation
di: Wen, Junwei, et al.
Pubblicazione: (2026)
di: Wen, Junwei, et al.
Pubblicazione: (2026)
Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought
di: Zhang, Shuyi, et al.
Pubblicazione: (2025)
di: Zhang, Shuyi, et al.
Pubblicazione: (2025)
Efficient Temporal Action Segmentation via Boundary-aware Query Voting
di: Wang, Peiyao, et al.
Pubblicazione: (2024)
di: Wang, Peiyao, et al.
Pubblicazione: (2024)
ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding
di: Fu, Xingyu, et al.
Pubblicazione: (2025)
di: Fu, Xingyu, et al.
Pubblicazione: (2025)
Visual Thoughts: A Unified Perspective of Understanding Multimodal Chain-of-Thought
di: Cheng, Zihui, et al.
Pubblicazione: (2025)
di: Cheng, Zihui, et al.
Pubblicazione: (2025)
ViTCoT: Video-Text Interleaved Chain-of-Thought for Boosting Video Understanding in Large Language Models
di: Zhang, Yongheng, et al.
Pubblicazione: (2025)
di: Zhang, Yongheng, et al.
Pubblicazione: (2025)
VideoCoT: A Video Chain-of-Thought Dataset with Active Annotation Tool
di: Wang, Yan, et al.
Pubblicazione: (2024)
di: Wang, Yan, et al.
Pubblicazione: (2024)
Understanding and Mitigating Hallucinations in Multimodal Chain-of-Thought Models
di: Ma, Ji, et al.
Pubblicazione: (2026)
di: Ma, Ji, et al.
Pubblicazione: (2026)
S-Chain: Structured Visual Chain-of-Thought For Medicine
di: Le-Duc, Khai, et al.
Pubblicazione: (2025)
di: Le-Duc, Khai, et al.
Pubblicazione: (2025)
Bootstrapping Grounded Chain-of-Thought in Multimodal LLMs for Data-Efficient Model Adaptation
di: Xia, Jiaer, et al.
Pubblicazione: (2025)
di: Xia, Jiaer, et al.
Pubblicazione: (2025)
CoT-RVS: Zero-Shot Chain-of-Thought Reasoning Segmentation for Videos
di: Kao, Shiu-hong, et al.
Pubblicazione: (2025)
di: Kao, Shiu-hong, et al.
Pubblicazione: (2025)
C-Drag: Chain-of-Thought Driven Motion Controller for Video Generation
di: Li, Yuhao, et al.
Pubblicazione: (2025)
di: Li, Yuhao, et al.
Pubblicazione: (2025)
Chain of Event-Centric Causal Thought for Physically Plausible Video Generation
di: Wang, Zixuan, et al.
Pubblicazione: (2026)
di: Wang, Zixuan, et al.
Pubblicazione: (2026)
CaRDiff: Video Salient Object Ranking Chain of Thought Reasoning for Saliency Prediction with Diffusion
di: Tang, Yolo Yunlong, et al.
Pubblicazione: (2024)
di: Tang, Yolo Yunlong, et al.
Pubblicazione: (2024)
Dynamic Token Compression for Efficient Video Understanding through Reinforcement Learning
di: Wang, Shida, et al.
Pubblicazione: (2026)
di: Wang, Shida, et al.
Pubblicazione: (2026)
SurgCoT: Advancing Spatiotemporal Reasoning in Surgical Videos through a Chain-of-Thought Benchmark
di: Wang, Gui, et al.
Pubblicazione: (2026)
di: Wang, Gui, et al.
Pubblicazione: (2026)
Spatial Chain-of-Thought: Bridging Understanding and Generation Models for Spatial Reasoning Generation
di: Chen, Wei, et al.
Pubblicazione: (2026)
di: Chen, Wei, et al.
Pubblicazione: (2026)
From Intent to Execution: Multimodal Chain-of-Thought Reinforcement Learning for Precise CAD Code Generation
di: Niu, Ke, et al.
Pubblicazione: (2025)
di: Niu, Ke, et al.
Pubblicazione: (2025)
Rethinking Chain-of-Thought Reasoning for Videos
di: Zhong, Yiwu, et al.
Pubblicazione: (2025)
di: Zhong, Yiwu, et al.
Pubblicazione: (2025)
Revisiting the Necessity of Lengthy Chain-of-Thought in Vision-centric Reasoning Generalization
di: Du, Yifan, et al.
Pubblicazione: (2025)
di: Du, Yifan, et al.
Pubblicazione: (2025)
Unified Multimodal Chain-of-Thought Reward Model through Reinforcement Fine-Tuning
di: Wang, Yibin, et al.
Pubblicazione: (2025)
di: Wang, Yibin, et al.
Pubblicazione: (2025)
Chain-of-Cooking:Cooking Process Visualization via Bidirectional Chain-of-Thought Guidance
di: Xu, Mengling, et al.
Pubblicazione: (2025)
di: Xu, Mengling, et al.
Pubblicazione: (2025)
Rethinking Token-Level Policy Optimization for Multimodal Chain-of-Thought
di: Li, Yunheng, et al.
Pubblicazione: (2026)
di: Li, Yunheng, et al.
Pubblicazione: (2026)
ArgusCogito: Chain-of-Thought for Cross-Modal Synergy and Omnidirectional Reasoning in Camouflaged Object Segmentation
di: Tan, Jianwen, et al.
Pubblicazione: (2025)
di: Tan, Jianwen, et al.
Pubblicazione: (2025)
StreamingCoT: A Dataset for Temporal Dynamics and Multimodal Chain-of-Thought Reasoning in Streaming VideoQA
di: Hu, Yuhang, et al.
Pubblicazione: (2025)
di: Hu, Yuhang, et al.
Pubblicazione: (2025)
MathCanvas: Intrinsic Visual Chain-of-Thought for Multimodal Mathematical Reasoning
di: Shi, Weikang, et al.
Pubblicazione: (2025)
di: Shi, Weikang, et al.
Pubblicazione: (2025)
PhysCorr: Dual-Reward DPO for Physics-Constrained Text-to-Video Generation with Automated Preference Selection
di: Wang, Peiyao, et al.
Pubblicazione: (2025)
di: Wang, Peiyao, et al.
Pubblicazione: (2025)
TumorChain: Interleaved Multimodal Chain-of-Thought Reasoning for Traceable Clinical Tumor Analysis
di: Li, Sijing, et al.
Pubblicazione: (2026)
di: Li, Sijing, et al.
Pubblicazione: (2026)
CoTasks: Chain-of-Thought based Video Instruction Tuning Tasks
di: Wang, Yanan, et al.
Pubblicazione: (2025)
di: Wang, Yanan, et al.
Pubblicazione: (2025)
VideoStir: Understanding Long Videos via Spatio-Temporally Structured and Intent-Aware RAG
di: Fu, Honghao, et al.
Pubblicazione: (2026)
di: Fu, Honghao, et al.
Pubblicazione: (2026)
CoS: Chain-of-Shot Prompting for Long Video Understanding
di: Hu, Jian, et al.
Pubblicazione: (2025)
di: Hu, Jian, et al.
Pubblicazione: (2025)
Generative Visual Chain-of-Thought for Image Editing
di: Yin, Zijin, et al.
Pubblicazione: (2026)
di: Yin, Zijin, et al.
Pubblicazione: (2026)
VideoTIR: Accurate Understanding for Long Videos with Efficient Tool-Integrated Reasoning
di: Gao, Zhe, et al.
Pubblicazione: (2026)
di: Gao, Zhe, et al.
Pubblicazione: (2026)
RGBX-R1: Visual Modality Chain-of-Thought Guided Reinforcement Learning for Multimodal Grounding
di: Wu, Jiahe, et al.
Pubblicazione: (2026)
di: Wu, Jiahe, et al.
Pubblicazione: (2026)
MedCoT: Medical Chain of Thought via Hierarchical Expert
di: Liu, Jiaxiang, et al.
Pubblicazione: (2024)
di: Liu, Jiaxiang, et al.
Pubblicazione: (2024)
ReaSon: Reinforced Causal Search with Information Bottleneck for Video Understanding
di: Zhou, Yuan, et al.
Pubblicazione: (2025)
di: Zhou, Yuan, et al.
Pubblicazione: (2025)
X-CoT: Explainable Text-to-Video Retrieval via LLM-based Chain-of-Thought Reasoning
di: Pulakurthi, Prasanna Reddy, et al.
Pubblicazione: (2025)
di: Pulakurthi, Prasanna Reddy, et al.
Pubblicazione: (2025)
Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought
di: Huang, Chao, et al.
Pubblicazione: (2025)
di: Huang, Chao, et al.
Pubblicazione: (2025)
Documenti analoghi
-
$Δ$ynamics: Language-Based Representation for Inferring Rigid-Body Dynamics From Videos
di: Kao, Chia-Hsiang, et al.
Pubblicazione: (2026) -
SVQA-R1: Reinforcing Spatial Reasoning in MLLMs via View-Consistent Reward Optimization
di: Wang, Peiyao, et al.
Pubblicazione: (2025) -
RCoT-Seg: Reinforced Chain-of-Thought for Video Reasoning and Segmentation
di: Wen, Junwei, et al.
Pubblicazione: (2026) -
Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought
di: Zhang, Shuyi, et al.
Pubblicazione: (2025) -
Efficient Temporal Action Segmentation via Boundary-aware Query Voting
di: Wang, Peiyao, et al.
Pubblicazione: (2024)