Video Models Can Reason with Verifiable Rewards
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhu, Tinghui, Zhang, Sheng, Huang, James Y., Song, Selena, Wen, Xiaofei, Li, Yuankai, Poon, Hoifung, Chen, Muhao |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Learning Adaptive Reasoning Paths for Efficient Visual Reasoning
di: Huang, Yixu, et al.
Pubblicazione: (2026)
di: Huang, Yixu, et al.
Pubblicazione: (2026)
mDPO: Conditional Preference Optimization for Multimodal Large Language Models
di: Wang, Fei, et al.
Pubblicazione: (2024)
di: Wang, Fei, et al.
Pubblicazione: (2024)
From Introspection to Best Practices: Principled Analysis of Demonstrations in Multimodal In-Context Learning
di: Xu, Nan, et al.
Pubblicazione: (2024)
di: Xu, Nan, et al.
Pubblicazione: (2024)
Is Extending Modality The Right Path Towards Omni-Modality?
di: Zhu, Tinghui, et al.
Pubblicazione: (2025)
di: Zhu, Tinghui, et al.
Pubblicazione: (2025)
OmniGuard: Unified Omni-Modal Guardrails with Deliberate Reasoning
di: Zhu, Boyu, et al.
Pubblicazione: (2025)
di: Zhu, Boyu, et al.
Pubblicazione: (2025)
AQuaUI: Visual Token Reduction for GUI Agents with Adaptive Quadtrees
di: Li, Yuankai, et al.
Pubblicazione: (2026)
di: Li, Yuankai, et al.
Pubblicazione: (2026)
Unraveling Cross-Modality Knowledge Conflicts in Large Vision-Language Models
di: Zhu, Tinghui, et al.
Pubblicazione: (2024)
di: Zhu, Tinghui, et al.
Pubblicazione: (2024)
Semantic-Clipping: Efficient Vision-Language Modeling with Semantic-Guidedd Visual Selection
di: Li, Bangzheng, et al.
Pubblicazione: (2025)
di: Li, Bangzheng, et al.
Pubblicazione: (2025)
When Vision Speaks for Sound
di: Wen, Xiaofei, et al.
Pubblicazione: (2026)
di: Wen, Xiaofei, et al.
Pubblicazione: (2026)
Smooth Operator: Smooth Verifiable Reward Activates Spatial Reasoning Ability of Vision-Language Model
di: Jiao, Siwen, et al.
Pubblicazione: (2026)
di: Jiao, Siwen, et al.
Pubblicazione: (2026)
Taming Camera-Controlled Video Generation with Verifiable Geometry Reward
di: Wang, Zhaoqing, et al.
Pubblicazione: (2025)
di: Wang, Zhaoqing, et al.
Pubblicazione: (2025)
Diagnosing and Mitigating Modality Interference in Multimodal Large Language Models
di: Cai, Rui, et al.
Pubblicazione: (2025)
di: Cai, Rui, et al.
Pubblicazione: (2025)
Wan-R1: Verifiable-Reinforcement Learning for Video Reasoning
di: Liu, Ming, et al.
Pubblicazione: (2026)
di: Liu, Ming, et al.
Pubblicazione: (2026)
Are Synthetic Videos Useful? A Benchmark for Retrieval-Centric Evaluation of Synthetic Videos
di: Zhao, Zecheng, et al.
Pubblicazione: (2025)
di: Zhao, Zecheng, et al.
Pubblicazione: (2025)
Adapt2Reward: Adapting Video-Language Models to Generalizable Robotic Rewards via Failure Prompts
di: Yang, Yanting, et al.
Pubblicazione: (2024)
di: Yang, Yanting, et al.
Pubblicazione: (2024)
Foundation Models for Biomedical Image Segmentation: A Survey
di: Lee, Ho Hin, et al.
Pubblicazione: (2024)
di: Lee, Ho Hin, et al.
Pubblicazione: (2024)
Few-Shot Vision-Language Reasoning for Satellite Imagery via Verifiable Rewards
di: Koksal, Aybora, et al.
Pubblicazione: (2025)
di: Koksal, Aybora, et al.
Pubblicazione: (2025)
Chart-RVR: Reinforcement Learning with Verifiable Rewards for Explainable Chart Reasoning
di: Sinha, Sanchit, et al.
Pubblicazione: (2025)
di: Sinha, Sanchit, et al.
Pubblicazione: (2025)
VideoRewardBench: Comprehensive Evaluation of Multimodal Reward Models for Video Understanding
di: Zhang, Zhihong, et al.
Pubblicazione: (2025)
di: Zhang, Zhihong, et al.
Pubblicazione: (2025)
Think, then Score: Decoupled Reasoning and Scoring for Video Reward Modeling
di: Wang, Yuan, et al.
Pubblicazione: (2026)
di: Wang, Yuan, et al.
Pubblicazione: (2026)
VideoReasonBench: Can MLLMs Perform Vision-Centric Complex Video Reasoning?
di: Liu, Yuanxin, et al.
Pubblicazione: (2025)
di: Liu, Yuanxin, et al.
Pubblicazione: (2025)
Learning Plug-and-play Memory for Guiding Video Diffusion Models
di: Song, Selena, et al.
Pubblicazione: (2025)
di: Song, Selena, et al.
Pubblicazione: (2025)
Video-Based Reward Modeling for Computer-Use Agents
di: Song, Linxin, et al.
Pubblicazione: (2026)
di: Song, Linxin, et al.
Pubblicazione: (2026)
VR-Thinker: Boosting Video Reward Models through Thinking-with-Image Reasoning
di: Wang, Qunzhong, et al.
Pubblicazione: (2025)
di: Wang, Qunzhong, et al.
Pubblicazione: (2025)
MOSS-ChatV: Reinforcement Learning with Process Reasoning Reward for Video Temporal Reasoning
di: Tao, Sicheng, et al.
Pubblicazione: (2025)
di: Tao, Sicheng, et al.
Pubblicazione: (2025)
What, Whether and How? Unveiling Process Reward Models for Thinking with Images Reasoning
di: Zhou, Yujin, et al.
Pubblicazione: (2026)
di: Zhou, Yujin, et al.
Pubblicazione: (2026)
EgoVITA: Learning to Plan and Verify for Egocentric Video Reasoning
di: Kulkarni, Yogesh, et al.
Pubblicazione: (2025)
di: Kulkarni, Yogesh, et al.
Pubblicazione: (2025)
Skywork-VL Reward: An Effective Reward Model for Multimodal Understanding and Reasoning
di: Wang, Xiaokun, et al.
Pubblicazione: (2025)
di: Wang, Xiaokun, et al.
Pubblicazione: (2025)
SpatialReward: Verifiable Spatial Reward Modeling for Fine-Grained Spatial Consistency in Text-to-Image Generation
di: Zhou, Sashuai, et al.
Pubblicazione: (2026)
di: Zhou, Sashuai, et al.
Pubblicazione: (2026)
Boltzmann Attention Sampling for Image Analysis with Small Objects
di: Zhao, Theodore, et al.
Pubblicazione: (2025)
di: Zhao, Theodore, et al.
Pubblicazione: (2025)
Evidence-Based Actor-Verifier Reasoning for Echocardiographic Agents
di: Huang, Peng, et al.
Pubblicazione: (2026)
di: Huang, Peng, et al.
Pubblicazione: (2026)
TinyLLaVA-Video-R1: Towards Smaller LMMs for Video Reasoning
di: Zhang, Xingjian, et al.
Pubblicazione: (2025)
di: Zhang, Xingjian, et al.
Pubblicazione: (2025)
Self-Rewarded Multimodal Coherent Reasoning Across Diverse Visual Domains
di: Zhang, Jesen, et al.
Pubblicazione: (2025)
di: Zhang, Jesen, et al.
Pubblicazione: (2025)
Reward Forcing: Efficient Streaming Video Generation with Rewarded Distribution Matching Distillation
di: Lu, Yunhong, et al.
Pubblicazione: (2025)
di: Lu, Yunhong, et al.
Pubblicazione: (2025)
RETTA: Retrieval-Enhanced Test-Time Adaptation for Zero-Shot Video Captioning
di: Ma, Yunchuan, et al.
Pubblicazione: (2024)
di: Ma, Yunchuan, et al.
Pubblicazione: (2024)
Organoid Tracker: A SAM2-Powered Platform for Zero-shot Cyst Analysis in Human Kidney Organoid Videos
di: Huang, Xiaoyu, et al.
Pubblicazione: (2025)
di: Huang, Xiaoyu, et al.
Pubblicazione: (2025)
TiViBench: Benchmarking Think-in-Video Reasoning for Video Generative Models
di: Chen, Harold Haodong, et al.
Pubblicazione: (2025)
di: Chen, Harold Haodong, et al.
Pubblicazione: (2025)
Unveiling Chain of Step Reasoning for Vision-Language Models with Fine-grained Rewards
di: Chen, Honghao, et al.
Pubblicazione: (2025)
di: Chen, Honghao, et al.
Pubblicazione: (2025)
Can Generative Video Models Help Pose Estimation?
di: Cai, Ruojin, et al.
Pubblicazione: (2024)
di: Cai, Ruojin, et al.
Pubblicazione: (2024)
What about gravity in video generation? Post-Training Newton's Laws with Verifiable Rewards
di: Le, Minh-Quan, et al.
Pubblicazione: (2025)
di: Le, Minh-Quan, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Learning Adaptive Reasoning Paths for Efficient Visual Reasoning
di: Huang, Yixu, et al.
Pubblicazione: (2026) -
mDPO: Conditional Preference Optimization for Multimodal Large Language Models
di: Wang, Fei, et al.
Pubblicazione: (2024) -
From Introspection to Best Practices: Principled Analysis of Demonstrations in Multimodal In-Context Learning
di: Xu, Nan, et al.
Pubblicazione: (2024) -
Is Extending Modality The Right Path Towards Omni-Modality?
di: Zhu, Tinghui, et al.
Pubblicazione: (2025) -
OmniGuard: Unified Omni-Modal Guardrails with Deliberate Reasoning
di: Zhu, Boyu, et al.
Pubblicazione: (2025)