Reinforcing Video Reasoning with Focused Thinking
Fuente:
arXiv
Guardado en:
| Autores principales: | Dang, Jisheng, Wu, Jingze, Wang, Teng, Lin, Xuanhui, Zhu, Nannan, Chen, Hongbo, Zheng, Wei-Shi, Wang, Meng, Chua, Tat-Seng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering
por: Dang, Jisheng, et al.
Publicado: (2025)
por: Dang, Jisheng, et al.
Publicado: (2025)
Thinking Before Matching: A Reinforcement Reasoning Paradigm Towards General Person Re-Identification
por: Zhang, Quan, et al.
Publicado: (2026)
por: Zhang, Quan, et al.
Publicado: (2026)
Long-Term TalkingFace Generation via Motion-Prior Conditional Diffusion Model
por: Shen, Fei, et al.
Publicado: (2025)
por: Shen, Fei, et al.
Publicado: (2025)
Extending Visual Dynamics for Video-to-Music Generation
por: Liu, Xiaohao, et al.
Publicado: (2025)
por: Liu, Xiaohao, et al.
Publicado: (2025)
Understanding Long Videos via LLM-Powered Entity Relation Graphs
por: Chu, Meng, et al.
Publicado: (2025)
por: Chu, Meng, et al.
Publicado: (2025)
Thinking with Blueprints: Assisting Vision-Language Models in Spatial Reasoning via Structured Object Representation
por: Ma, Weijian, et al.
Publicado: (2026)
por: Ma, Weijian, et al.
Publicado: (2026)
Towards Natural Language-Guided Drones: GeoText-1652 Benchmark with Spatial Relation Matching
por: Chu, Meng, et al.
Publicado: (2023)
por: Chu, Meng, et al.
Publicado: (2023)
Turing Patterns for Multimedia: Reaction-Diffusion Multi-Modal Fusion for Language-Guided Video Moment Retrieval
por: Fang, Xiang, et al.
Publicado: (2026)
por: Fang, Xiang, et al.
Publicado: (2026)
Universal Scene Graph Generation
por: Wu, Shengqiong, et al.
Publicado: (2025)
por: Wu, Shengqiong, et al.
Publicado: (2025)
Dysen-VDM: Empowering Dynamics-aware Text-to-Video Diffusion with LLMs
por: Fei, Hao, et al.
Publicado: (2023)
por: Fei, Hao, et al.
Publicado: (2023)
Beyond Perceptual Shortcuts: Causal-Inspired Debiasing Optimization for Generalizable Video Reasoning in Lightweight MLLMs
por: Wu, Jingze, et al.
Publicado: (2026)
por: Wu, Jingze, et al.
Publicado: (2026)
3D Magic Mirror: Clothing Reconstruction from a Single Image via a Causal Perspective
por: Zheng, Zhedong, et al.
Publicado: (2022)
por: Zheng, Zhedong, et al.
Publicado: (2022)
Compose Your Aesthetics: Empowering Text-to-Image Models with the Principles of Art
por: Jin, Zhe, et al.
Publicado: (2025)
por: Jin, Zhe, et al.
Publicado: (2025)
A Reason-then-Describe Instruction Interpreter for Controllable Video Generation
por: Wu, Shengqiong, et al.
Publicado: (2025)
por: Wu, Shengqiong, et al.
Publicado: (2025)
Instilling Multi-round Thinking to Text-guided Image Generation
por: Zeng, Lidong, et al.
Publicado: (2024)
por: Zeng, Lidong, et al.
Publicado: (2024)
Zero-1-to-A: Zero-Shot One Image to Animatable Head Avatars Using Video Diffusion
por: Zhou, Zhenglin, et al.
Publicado: (2025)
por: Zhou, Zhenglin, et al.
Publicado: (2025)
An LMM for Efficient Video Understanding via Reinforced Compression of Video Cubes
por: Qi, Ji, et al.
Publicado: (2025)
por: Qi, Ji, et al.
Publicado: (2025)
Disentangling Masked Autoencoders for Unsupervised Domain Generalization
por: Zhang, An, et al.
Publicado: (2024)
por: Zhang, An, et al.
Publicado: (2024)
Combating Multimodal LLM Hallucination via Bottom-Up Holistic Reasoning
por: Wu, Shengqiong, et al.
Publicado: (2024)
por: Wu, Shengqiong, et al.
Publicado: (2024)
Momentor: Advancing Video Large Language Model with Fine-Grained Temporal Reasoning
por: Qian, Long, et al.
Publicado: (2024)
por: Qian, Long, et al.
Publicado: (2024)
Decoupled Seg Tokens Make Stronger Reasoning Video Segmenter and Grounder
por: Jisheng, Dang, et al.
Publicado: (2025)
por: Jisheng, Dang, et al.
Publicado: (2025)
Composed Image Retrieval with Text Feedback via Multi-grained Uncertainty Regularization
por: Chen, Yiyang, et al.
Publicado: (2022)
por: Chen, Yiyang, et al.
Publicado: (2022)
Dynamic Multimodal Fusion via Meta-Learning Towards Micro-Video Recommendation
por: Liu, Han, et al.
Publicado: (2025)
por: Liu, Han, et al.
Publicado: (2025)
Can I Trust Your Answer? Visually Grounded Video Question Answering
por: Xiao, Junbin, et al.
Publicado: (2023)
por: Xiao, Junbin, et al.
Publicado: (2023)
Fact :Teaching MLLMs with Faithful, Concise and Transferable Rationales
por: Gao, Minghe, et al.
Publicado: (2024)
por: Gao, Minghe, et al.
Publicado: (2024)
TTOM: Test-Time Optimization and Memorization for Compositional Video Generation
por: Qu, Leigang, et al.
Publicado: (2025)
por: Qu, Leigang, et al.
Publicado: (2025)
Scene-Text Grounding for Text-Based Video Question Answering
por: Zhou, Sheng, et al.
Publicado: (2024)
por: Zhou, Sheng, et al.
Publicado: (2024)
Enhancing Video-Language Representations with Structural Spatio-Temporal Alignment
por: Fei, Hao, et al.
Publicado: (2024)
por: Fei, Hao, et al.
Publicado: (2024)
Think with Grounding: Curriculum Reinforced Reasoning with Video Grounding for Long Video Understanding
por: Chen, Houlun, et al.
Publicado: (2026)
por: Chen, Houlun, et al.
Publicado: (2026)
Video-Holmes: Can MLLM Think Like Holmes for Complex Video Reasoning?
por: Cheng, Junhao, et al.
Publicado: (2025)
por: Cheng, Junhao, et al.
Publicado: (2025)
Suppressing Forgery-Specific Shortcuts for Generalizable Deepfake Detection
por: Wang, Yihui, et al.
Publicado: (2026)
por: Wang, Yihui, et al.
Publicado: (2026)
Multiple-environment Self-adaptive Network for Aerial-view Geo-localization
por: Wang, Tingyu, et al.
Publicado: (2022)
por: Wang, Tingyu, et al.
Publicado: (2022)
Beyond Surface Artifacts: Capturing Shared Latent Forgery Knowledge Across Modalities
por: Dou, Jingtong, et al.
Publicado: (2026)
por: Dou, Jingtong, et al.
Publicado: (2026)
InstructVid2Vid: Controllable Video Editing with Natural Language Instructions
por: Qin, Bosheng, et al.
Publicado: (2023)
por: Qin, Bosheng, et al.
Publicado: (2023)
Thinking with Drafts: Speculative Temporal Reasoning for Efficient Long Video Understanding
por: Hu, Pengfei, et al.
Publicado: (2025)
por: Hu, Pengfei, et al.
Publicado: (2025)
CVBench: Benchmarking Cross-Video Synergies for Complex Multimodal Reasoning
por: Zhu, Nannan, et al.
Publicado: (2025)
por: Zhu, Nannan, et al.
Publicado: (2025)
EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering
por: Zhou, Sheng, et al.
Publicado: (2025)
por: Zhou, Sheng, et al.
Publicado: (2025)
STEP: Enhancing Video-LLMs' Compositional Reasoning by Spatio-Temporal Graph-guided Self-Training
por: Qiu, Haiyi, et al.
Publicado: (2024)
por: Qiu, Haiyi, et al.
Publicado: (2024)
SynPO: Synergizing Descriptiveness and Preference Optimization for Video Detailed Captioning
por: Dang, Jisheng, et al.
Publicado: (2025)
por: Dang, Jisheng, et al.
Publicado: (2025)
PSVMA+: Exploring Multi-granularity Semantic-visual Adaption for Generalized Zero-shot Learning
por: Liu, Man, et al.
Publicado: (2024)
por: Liu, Man, et al.
Publicado: (2024)
Ejemplares similares
-
MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering
por: Dang, Jisheng, et al.
Publicado: (2025) -
Thinking Before Matching: A Reinforcement Reasoning Paradigm Towards General Person Re-Identification
por: Zhang, Quan, et al.
Publicado: (2026) -
Long-Term TalkingFace Generation via Motion-Prior Conditional Diffusion Model
por: Shen, Fei, et al.
Publicado: (2025) -
Extending Visual Dynamics for Video-to-Music Generation
por: Liu, Xiaohao, et al.
Publicado: (2025) -
Understanding Long Videos via LLM-Powered Entity Relation Graphs
por: Chu, Meng, et al.
Publicado: (2025)