VLMs are Good Teachers for Video Reasoning via Adaptive Test-Time Optimization
Fuente:
arXiv
Guardado en:
| Autores principales: | Cheng, Junhao, Hou, Liang, Zhong, Tianxiong, Tao, Xin, Wan, Pengfei, Gai, Kun, Liao, Jing |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Video-as-Answer: Predict and Generate Next Video Event with Joint-GRPO
por: Cheng, Junhao, et al.
Publicado: (2025)
por: Cheng, Junhao, et al.
Publicado: (2025)
Scaling Image and Video Generation via Test-Time Evolutionary Search
por: He, Haoran, et al.
Publicado: (2025)
por: He, Haoran, et al.
Publicado: (2025)
VFRTok: Variable Frame Rates Video Tokenizer with Duration-Proportional Information Assumption
por: Zhong, Tianxiong, et al.
Publicado: (2025)
por: Zhong, Tianxiong, et al.
Publicado: (2025)
Decoupling Complexity from Scale in Latent Diffusion Model
por: Zhong, Tianxiong, et al.
Publicado: (2025)
por: Zhong, Tianxiong, et al.
Publicado: (2025)
MTV-Inpaint: Multi-Task Long Video Inpainting
por: Yang, Shiyuan, et al.
Publicado: (2025)
por: Yang, Shiyuan, et al.
Publicado: (2025)
Boosting Resolution Generalization of Diffusion Transformers with Randomized Positional Encodings
por: Hou, Liang, et al.
Publicado: (2025)
por: Hou, Liang, et al.
Publicado: (2025)
ConceptMaster: Multi-Concept Video Customization on Diffusion Transformer Models Without Test-Time Tuning
por: Huang, Yuzhou, et al.
Publicado: (2025)
por: Huang, Yuzhou, et al.
Publicado: (2025)
Video-Holmes: Can MLLM Think Like Holmes for Complex Video Reasoning?
por: Cheng, Junhao, et al.
Publicado: (2025)
por: Cheng, Junhao, et al.
Publicado: (2025)
3D-Aware Implicit Motion Control for View-Adaptive Human Video Generation
por: Fang, Zhixue, et al.
Publicado: (2026)
por: Fang, Zhixue, et al.
Publicado: (2026)
VIVID-10M: A Dataset and Baseline for Versatile and Interactive Video Local Editing
por: Hu, Jiahao, et al.
Publicado: (2024)
por: Hu, Jiahao, et al.
Publicado: (2024)
GridProbe: Posterior-Probing for Adaptive Test-Time Compute in Long-Video VLMs
por: Eltahir, Mohamed, et al.
Publicado: (2026)
por: Eltahir, Mohamed, et al.
Publicado: (2026)
Direct-a-Video: Customized Video Generation with User-Directed Camera Movement and Object Motion
por: Yang, Shiyuan, et al.
Publicado: (2024)
por: Yang, Shiyuan, et al.
Publicado: (2024)
A Reason-then-Describe Instruction Interpreter for Controllable Video Generation
por: Wu, Shengqiong, et al.
Publicado: (2025)
por: Wu, Shengqiong, et al.
Publicado: (2025)
UniVideo: Unified Understanding, Generation, and Editing for Videos
por: Wei, Cong, et al.
Publicado: (2025)
por: Wei, Cong, et al.
Publicado: (2025)
MemFlow: Flowing Adaptive Memory for Consistent and Efficient Long Video Narratives
por: Ji, Sihui, et al.
Publicado: (2025)
por: Ji, Sihui, et al.
Publicado: (2025)
Can Vision-Language Models be a Good Guesser? Exploring VLMs for Times and Location Reasoning
por: Zhang, Gengyuan, et al.
Publicado: (2023)
por: Zhang, Gengyuan, et al.
Publicado: (2023)
VideoCanvas: Unified Video Completion from Arbitrary Spatiotemporal Patches via In-Context Conditioning
por: Cai, Minghong, et al.
Publicado: (2025)
por: Cai, Minghong, et al.
Publicado: (2025)
PhysMaster: Mastering Physical Representation for Video Generation via Reinforcement Learning
por: Ji, Sihui, et al.
Publicado: (2025)
por: Ji, Sihui, et al.
Publicado: (2025)
Adaptive Chain-of-Focus Reasoning via Dynamic Visual Search and Zooming for Efficient VLMs
por: Zhang, Xintong, et al.
Publicado: (2025)
por: Zhang, Xintong, et al.
Publicado: (2025)
VMoBA: Mixture-of-Block Attention for Video Diffusion Models
por: Wu, Jianzong, et al.
Publicado: (2025)
por: Wu, Jianzong, et al.
Publicado: (2025)
How Auxiliary Reasoning Unleashes GUI Grounding in VLMs
por: Li, Weiming, et al.
Publicado: (2025)
por: Li, Weiming, et al.
Publicado: (2025)
Stable Velocity: A Variance Perspective on Flow Matching
por: Yang, Donglin, et al.
Publicado: (2026)
por: Yang, Donglin, et al.
Publicado: (2026)
Test-Time Reasoning Through Visual Human Preferences with VLMs and Soft Rewards
por: Gambashidze, Alexander, et al.
Publicado: (2025)
por: Gambashidze, Alexander, et al.
Publicado: (2025)
Monet: Reasoning in Latent Visual Space Beyond Images and Language
por: Wang, Qixun, et al.
Publicado: (2025)
por: Wang, Qixun, et al.
Publicado: (2025)
Mitigating the Noise Shift for Denoising Generative Models via Noise Awareness Guidance
por: Zhong, Jincheng, et al.
Publicado: (2025)
por: Zhong, Jincheng, et al.
Publicado: (2025)
TimeChat-Captioner: Scripting Multi-Scene Videos with Time-Aware and Structural Audio-Visual Captions
por: Yao, Linli, et al.
Publicado: (2026)
por: Yao, Linli, et al.
Publicado: (2026)
RelightMaster: Precise Video Relighting with Multi-plane Light Images
por: Bian, Weikang, et al.
Publicado: (2025)
por: Bian, Weikang, et al.
Publicado: (2025)
TIR-Flow: Active Video Search and Reasoning with Frozen VLMs
por: Jin, Hongbo, et al.
Publicado: (2026)
por: Jin, Hongbo, et al.
Publicado: (2026)
FullDiT: Multi-Task Video Generative Foundation Model with Full Attention
por: Ju, Xuan, et al.
Publicado: (2025)
por: Ju, Xuan, et al.
Publicado: (2025)
CamCloneMaster: Enabling Reference-based Camera Control for Video Generation
por: Luo, Yawen, et al.
Publicado: (2025)
por: Luo, Yawen, et al.
Publicado: (2025)
VRIQ: Benchmarking and Analyzing Visual-Reasoning IQ of VLMs
por: Khezresmaeilzadeh, Tina, et al.
Publicado: (2026)
por: Khezresmaeilzadeh, Tina, et al.
Publicado: (2026)
A Survey of Interactive Generative Video
por: Yu, Jiwen, et al.
Publicado: (2025)
por: Yu, Jiwen, et al.
Publicado: (2025)
UNIC: Unified In-Context Video Editing
por: Ye, Zixuan, et al.
Publicado: (2025)
por: Ye, Zixuan, et al.
Publicado: (2025)
VINO: A Unified Visual Generator with Interleaved OmniModal Context
por: Chen, Junyi, et al.
Publicado: (2026)
por: Chen, Junyi, et al.
Publicado: (2026)
Think, then Score: Decoupled Reasoning and Scoring for Video Reward Modeling
por: Wang, Yuan, et al.
Publicado: (2026)
por: Wang, Yuan, et al.
Publicado: (2026)
VideoPro: Adaptive Program Reasoning for Long Video Understanding
por: Li, Chenglin, et al.
Publicado: (2025)
por: Li, Chenglin, et al.
Publicado: (2025)
Reasoning via Video: The First Evaluation of Video Models' Reasoning Abilities through Maze-Solving Tasks
por: Yang, Cheng, et al.
Publicado: (2025)
por: Yang, Cheng, et al.
Publicado: (2025)
Imbalance in Balance: Online Concept Balancing in Generation Models
por: Shi, Yukai, et al.
Publicado: (2025)
por: Shi, Yukai, et al.
Publicado: (2025)
ANTS: Adaptive Negative Textual Space Shaping for OOD Detection via Test-Time MLLM Understanding and Reasoning
por: Zhu, Wenjie, et al.
Publicado: (2025)
por: Zhu, Wenjie, et al.
Publicado: (2025)
AUTO: Adaptive Outlier Optimization for Test-Time OOD Detection
por: Yang, Puning, et al.
Publicado: (2023)
por: Yang, Puning, et al.
Publicado: (2023)
Ejemplares similares
-
Video-as-Answer: Predict and Generate Next Video Event with Joint-GRPO
por: Cheng, Junhao, et al.
Publicado: (2025) -
Scaling Image and Video Generation via Test-Time Evolutionary Search
por: He, Haoran, et al.
Publicado: (2025) -
VFRTok: Variable Frame Rates Video Tokenizer with Duration-Proportional Information Assumption
por: Zhong, Tianxiong, et al.
Publicado: (2025) -
Decoupling Complexity from Scale in Latent Diffusion Model
por: Zhong, Tianxiong, et al.
Publicado: (2025) -
MTV-Inpaint: Multi-Task Long Video Inpainting
por: Yang, Shiyuan, et al.
Publicado: (2025)