Video-Thinker: Sparking "Thinking with Videos" via Reinforcement Learning
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Shijian, Jin, Jiarui, Wang, Xingjian, Song, Linxin, Fu, Runhao, Wang, Hecheng, Ge, Zongyuan, Lu, Yuan, Cheng, Xuelian |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
MuSEAgent: A Multimodal Reasoning Agent with Stateful Experiences
por: Wang, Shijian, et al.
Publicado: (2026)
por: Wang, Shijian, et al.
Publicado: (2026)
Synthetic Curriculum Reinforces Compositional Text-to-Image Generation
por: Wang, Shijian, et al.
Publicado: (2025)
por: Wang, Shijian, et al.
Publicado: (2025)
GraphThinker: Reinforcing Temporally Grounded Video Reasoning with Event Graph Thinking
por: Cheng, Zixu, et al.
Publicado: (2026)
por: Cheng, Zixu, et al.
Publicado: (2026)
FrameThinker: Learning to Think with Long Videos via Multi-Turn Frame Spotlighting
por: He, Zefeng, et al.
Publicado: (2025)
por: He, Zefeng, et al.
Publicado: (2025)
Pest-Thinker: Learning to Think and Reason like Entomologists via Reinforcement Learning
por: Li, Xueheng, et al.
Publicado: (2026)
por: Li, Xueheng, et al.
Publicado: (2026)
VR-Thinker: Boosting Video Reward Models through Thinking-with-Image Reasoning
por: Wang, Qunzhong, et al.
Publicado: (2025)
por: Wang, Qunzhong, et al.
Publicado: (2025)
ColonAdapter: Geometry Estimation Through Foundation Model Adaptation for Colonoscopy
por: Jiang, Zhiyi, et al.
Publicado: (2025)
por: Jiang, Zhiyi, et al.
Publicado: (2025)
RoomPlanner: Explicit Layout Planner for Easier LLM-Driven 3D Room Generation
por: Sun, Wenzhuo, et al.
Publicado: (2025)
por: Sun, Wenzhuo, et al.
Publicado: (2025)
Video-Holmes: Can MLLM Think Like Holmes for Complex Video Reasoning?
por: Cheng, Junhao, et al.
Publicado: (2025)
por: Cheng, Junhao, et al.
Publicado: (2025)
AdaSpark: Adaptive Sparsity for Efficient Long-Video Understanding
por: Li, Handong, et al.
Publicado: (2026)
por: Li, Handong, et al.
Publicado: (2026)
Reinforcing Video Reasoning with Focused Thinking
por: Dang, Jisheng, et al.
Publicado: (2025)
por: Dang, Jisheng, et al.
Publicado: (2025)
LongVT: Incentivizing "Thinking with Long Videos" via Native Tool Calling
por: Yang, Zuhao, et al.
Publicado: (2025)
por: Yang, Zuhao, et al.
Publicado: (2025)
VideoThinker: Building Agentic VideoLLMs with LLM-Guided Tool Reasoning
por: Li, Chenglin, et al.
Publicado: (2026)
por: Li, Chenglin, et al.
Publicado: (2026)
DDA-Thinker: Decoupled Dual-Atomic Reinforcement Learning for Reasoning-Driven Image Editing
por: Yang, Hanqing, et al.
Publicado: (2026)
por: Yang, Hanqing, et al.
Publicado: (2026)
Thinking with Frames: Generative Video Distortion Evaluation via Frame Reward Model
por: Wang, Yuan, et al.
Publicado: (2026)
por: Wang, Yuan, et al.
Publicado: (2026)
OphNet: A Large-Scale Video Benchmark for Ophthalmic Surgical Workflow Understanding
por: Hu, Ming, et al.
Publicado: (2024)
por: Hu, Ming, et al.
Publicado: (2024)
Thinking in Streaming Video
por: Liu, Zikang, et al.
Publicado: (2026)
por: Liu, Zikang, et al.
Publicado: (2026)
Attributed Synthetic Data Generation for Zero-shot Domain-specific Image Classification
por: Wang, Shijian, et al.
Publicado: (2025)
por: Wang, Shijian, et al.
Publicado: (2025)
Towards Long Video Understanding via Fine-detailed Video Story Generation
por: You, Zeng, et al.
Publicado: (2024)
por: You, Zeng, et al.
Publicado: (2024)
V-Thinker: Interactive Thinking with Images
por: Qiao, Runqi, et al.
Publicado: (2025)
por: Qiao, Runqi, et al.
Publicado: (2025)
VideoCuRL: Video Curriculum Reinforcement Learning with Orthogonal Difficulty Decomposition
por: Jin, Hongbo, et al.
Publicado: (2025)
por: Jin, Hongbo, et al.
Publicado: (2025)
TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding
por: Yang, Zuhao, et al.
Publicado: (2025)
por: Yang, Zuhao, et al.
Publicado: (2025)
Reinforcing Video Reasoning Segmentation to Think Before It Segments
por: Gong, Sitong, et al.
Publicado: (2025)
por: Gong, Sitong, et al.
Publicado: (2025)
MMD-Thinker: Adaptive Multi-Dimensional Thinking for Multimodal Misinformation Detection
por: Wu, Junjie, et al.
Publicado: (2025)
por: Wu, Junjie, et al.
Publicado: (2025)
Thinking With Videos: Multimodal Tool-Augmented Reinforcement Learning for Long Video Reasoning
por: Zhang, Haoji, et al.
Publicado: (2025)
por: Zhang, Haoji, et al.
Publicado: (2025)
LION-FS: Fast & Slow Video-Language Thinker as Online Video Assistant
por: Li, Wei, et al.
Publicado: (2025)
por: Li, Wei, et al.
Publicado: (2025)
Novel View Extrapolation with Video Diffusion Priors
por: Liu, Kunhao, et al.
Publicado: (2024)
por: Liu, Kunhao, et al.
Publicado: (2024)
Versatile Transition Generation with Image-to-Video Diffusion
por: Yang, Zuhao, et al.
Publicado: (2025)
por: Yang, Zuhao, et al.
Publicado: (2025)
VideoChat-A1: Thinking with Long Videos by Chain-of-Shot Reasoning
por: Wang, Zikang, et al.
Publicado: (2025)
por: Wang, Zikang, et al.
Publicado: (2025)
FrameMind: Frame-Interleaved Video Reasoning via Reinforcement Learning
por: Ge, Haonan, et al.
Publicado: (2025)
por: Ge, Haonan, et al.
Publicado: (2025)
SparkVSR: Interactive Video Super-Resolution via Sparse Keyframe Propagation
por: Yu, Jiongze, et al.
Publicado: (2026)
por: Yu, Jiongze, et al.
Publicado: (2026)
Think with Grounding: Curriculum Reinforced Reasoning with Video Grounding for Long Video Understanding
por: Chen, Houlun, et al.
Publicado: (2026)
por: Chen, Houlun, et al.
Publicado: (2026)
Investigating the Scaling Effect of Instruction Templates for Training Multimodal Language Model
por: Wang, Shijian, et al.
Publicado: (2024)
por: Wang, Shijian, et al.
Publicado: (2024)
VideoRFT: Incentivizing Video Reasoning Capability in MLLMs via Reinforced Fine-Tuning
por: Wang, Qi, et al.
Publicado: (2025)
por: Wang, Qi, et al.
Publicado: (2025)
Video-MTR: Reinforced Multi-Turn Reasoning for Long Video Understanding
por: Xie, Yuan, et al.
Publicado: (2025)
por: Xie, Yuan, et al.
Publicado: (2025)
ParaVT: Taming the Tool Prior Paradox for Parallel Tool Use in Agentic Video Reinforcement Learning
por: Yang, Zuhao, et al.
Publicado: (2026)
por: Yang, Zuhao, et al.
Publicado: (2026)
VideoTG-R1: Boosting Video Temporal Grounding via Curriculum Reinforcement Learning on Reflected Boundary Annotations
por: Dong, Lu, et al.
Publicado: (2025)
por: Dong, Lu, et al.
Publicado: (2025)
Video-KTR: Reinforcing Video Reasoning via Key Token Attribution
por: Wang, Ziyue, et al.
Publicado: (2026)
por: Wang, Ziyue, et al.
Publicado: (2026)
Thinking with Drafts: Speculative Temporal Reasoning for Efficient Long Video Understanding
por: Hu, Pengfei, et al.
Publicado: (2025)
por: Hu, Pengfei, et al.
Publicado: (2025)
Think, then Score: Decoupled Reasoning and Scoring for Video Reward Modeling
por: Wang, Yuan, et al.
Publicado: (2026)
por: Wang, Yuan, et al.
Publicado: (2026)
Ejemplares similares
-
MuSEAgent: A Multimodal Reasoning Agent with Stateful Experiences
por: Wang, Shijian, et al.
Publicado: (2026) -
Synthetic Curriculum Reinforces Compositional Text-to-Image Generation
por: Wang, Shijian, et al.
Publicado: (2025) -
GraphThinker: Reinforcing Temporally Grounded Video Reasoning with Event Graph Thinking
por: Cheng, Zixu, et al.
Publicado: (2026) -
FrameThinker: Learning to Think with Long Videos via Multi-Turn Frame Spotlighting
por: He, Zefeng, et al.
Publicado: (2025) -
Pest-Thinker: Learning to Think and Reason like Entomologists via Reinforcement Learning
por: Li, Xueheng, et al.
Publicado: (2026)