VQ-Insight: Teaching VLMs for AI-Generated Video Quality Understanding via Progressive Visual Reinforcement Learning
Fuente:
arXiv
Saved in:
| Main Authors: | Zhang, Xuanyu, Li, Weiqi, Zhao, Shijie, Li, Junlin, Zhang, Li, Zhang, Jian |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Q-Insight: Understanding Image Quality via Visual Reinforcement Learning
by: Li, Weiqi, et al.
Published: (2025)
by: Li, Weiqi, et al.
Published: (2025)
Reasoning as Representation: Rethinking Visual Reinforcement Learning in Image Quality Assessment
by: Zhao, Shijie, et al.
Published: (2025)
by: Zhao, Shijie, et al.
Published: (2025)
VQ-Jarvis: Retrieval-Augmented Video Restoration Agent with Sharp Vision and Fast Thought
by: Zhang, Xuanyu, et al.
Published: (2026)
by: Zhang, Xuanyu, et al.
Published: (2026)
Improved Adversarial Diffusion Compression for Real-World Video Super-Resolution
by: Chen, Bin, et al.
Published: (2026)
by: Chen, Bin, et al.
Published: (2026)
UARE: A Unified Vision-Language Model for Image Quality Assessment, Restoration, and Enhancement
by: Li, Weiqi, et al.
Published: (2025)
by: Li, Weiqi, et al.
Published: (2025)
OmniDrag: Enabling Motion Control for Omnidirectional Image-to-Video Generation
by: Li, Weiqi, et al.
Published: (2024)
by: Li, Weiqi, et al.
Published: (2024)
OARS: Process-Aware Online Alignment for Generative Real-World Image Super-Resolution
by: Zhao, Shijie, et al.
Published: (2026)
by: Zhao, Shijie, et al.
Published: (2026)
MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection
by: Wang, Shuyu, et al.
Published: (2025)
by: Wang, Shuyu, et al.
Published: (2025)
Adaptive High-Frequency Preprocessing for Video Coding
by: Pang, Yingxue, et al.
Published: (2025)
by: Pang, Yingxue, et al.
Published: (2025)
Region-Adaptive Video Sharpening via Rate-Perception Optimization
by: Pang, Yingxue, et al.
Published: (2025)
by: Pang, Yingxue, et al.
Published: (2025)
TalkFashion: Intelligent Virtual Try-On Assistant Based on Multimodal Large Language Model
by: Hu, Yujie, et al.
Published: (2025)
by: Hu, Yujie, et al.
Published: (2025)
Eliminating VAE for Fast and High-Resolution Generative Detail Restoration
by: Wang, Yan, et al.
Published: (2026)
by: Wang, Yan, et al.
Published: (2026)
ResVR: Joint Rescaling and Viewport Rendering of Omnidirectional Images
by: Li, Weiqi, et al.
Published: (2024)
by: Li, Weiqi, et al.
Published: (2024)
AvatarShield: Visual Reinforcement Learning for Human-Centric Synthetic Video Detection
by: Xu, Zhipei, et al.
Published: (2025)
by: Xu, Zhipei, et al.
Published: (2025)
V2A-Mark: Versatile Deep Visual-Audio Watermarking for Manipulation Localization and Copyright Protection
by: Zhang, Xuanyu, et al.
Published: (2024)
by: Zhang, Xuanyu, et al.
Published: (2024)
A Tri-Dynamic Preprocessing Framework for UGC Video Compression
by: Zhao, Fei, et al.
Published: (2025)
by: Zhao, Fei, et al.
Published: (2025)
A Preprocessing Framework for Video Machine Vision under Compression
by: Zhao, Fei, et al.
Published: (2025)
by: Zhao, Fei, et al.
Published: (2025)
Clapper: Compact Learning and Video Representation in VLMs
by: Kong, Lingyu, et al.
Published: (2025)
by: Kong, Lingyu, et al.
Published: (2025)
Generative Preprocessing for Image Compression with Pre-trained Diffusion Models
by: Guo, Mengxi, et al.
Published: (2025)
by: Guo, Mengxi, et al.
Published: (2025)
TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning
by: Wu, Tao, et al.
Published: (2025)
by: Wu, Tao, et al.
Published: (2025)
360DVD: Controllable Panorama Video Generation with 360-Degree Video Diffusion Model
by: Wang, Qian, et al.
Published: (2024)
by: Wang, Qian, et al.
Published: (2024)
VQ-VA World: Towards High-Quality Visual Question-Visual Answering
by: Gou, Chenhui, et al.
Published: (2025)
by: Gou, Chenhui, et al.
Published: (2025)
A Survey of AI-Generated Video Evaluation
by: Liu, Xiao, et al.
Published: (2024)
by: Liu, Xiao, et al.
Published: (2024)
GenDR: Lighten Generative Detail Restoration
by: Wang, Yan, et al.
Published: (2025)
by: Wang, Yan, et al.
Published: (2025)
Patho-AgenticRAG: Towards Multimodal Agentic Retrieval-Augmented Generation for Pathology VLMs via Reinforcement Learning
by: Zhang, Wenchuan, et al.
Published: (2025)
by: Zhang, Wenchuan, et al.
Published: (2025)
Modular Blind Video Quality Assessment
by: Wen, Wen, et al.
Published: (2024)
by: Wen, Wen, et al.
Published: (2024)
Frequency-Assisted Adaptive Sharpening Scheme Considering Bitrate and Quality Tradeoff
by: Pang, Yingxue, et al.
Published: (2025)
by: Pang, Yingxue, et al.
Published: (2025)
Protect-Your-IP: Scalable Source-Tracing and Attribution against Personalized Generation
by: Li, Runyi, et al.
Published: (2024)
by: Li, Runyi, et al.
Published: (2024)
COEF-VQ: Cost-Efficient Video Quality Understanding through a Cascaded Multimodal LLM Framework
by: Dong, Xin, et al.
Published: (2024)
by: Dong, Xin, et al.
Published: (2024)
VisualQuality-R1: Reasoning-Induced Image Quality Assessment via Reinforcement Learning to Rank
by: Wu, Tianhe, et al.
Published: (2025)
by: Wu, Tianhe, et al.
Published: (2025)
Adaptive Chain-of-Focus Reasoning via Dynamic Visual Search and Zooming for Efficient VLMs
by: Zhang, Xintong, et al.
Published: (2025)
by: Zhang, Xintong, et al.
Published: (2025)
ACD: Direct Conditional Control for Video Diffusion Models via Attention Supervision
by: Li, Weiqi, et al.
Published: (2025)
by: Li, Weiqi, et al.
Published: (2025)
Invertible Diffusion Models for Compressed Sensing
by: Chen, Bin, et al.
Published: (2024)
by: Chen, Bin, et al.
Published: (2024)
LG-VQ: Language-Guided Codebook Learning
by: Liang, Guotao, et al.
Published: (2024)
by: Liang, Guotao, et al.
Published: (2024)
Spatio-Temporal Distortion Aware Omnidirectional Video Super-Resolution
by: An, Hongyu, et al.
Published: (2024)
by: An, Hongyu, et al.
Published: (2024)
LVC: A Lightweight Compression Framework for Enhancing VLMs in Long Video Understanding
by: Wang, Ziyi, et al.
Published: (2025)
by: Wang, Ziyi, et al.
Published: (2025)
CAMixerSR: Only Details Need More "Attention"
by: Wang, Yan, et al.
Published: (2024)
by: Wang, Yan, et al.
Published: (2024)
Spatial Degradation-Aware and Temporal Consistent Diffusion Model for Compressed Video Super-Resolution
by: An, Hongyu, et al.
Published: (2025)
by: An, Hongyu, et al.
Published: (2025)
Ground-V: Teaching VLMs to Ground Complex Instructions in Pixels
by: Zong, Yongshuo, et al.
Published: (2025)
by: Zong, Yongshuo, et al.
Published: (2025)
GPD: Guided Progressive Distillation for Fast and High-Quality Video Generation
by: Liang, Xiao, et al.
Published: (2026)
by: Liang, Xiao, et al.
Published: (2026)
Similar Items
-
Q-Insight: Understanding Image Quality via Visual Reinforcement Learning
by: Li, Weiqi, et al.
Published: (2025) -
Reasoning as Representation: Rethinking Visual Reinforcement Learning in Image Quality Assessment
by: Zhao, Shijie, et al.
Published: (2025) -
VQ-Jarvis: Retrieval-Augmented Video Restoration Agent with Sharp Vision and Fast Thought
by: Zhang, Xuanyu, et al.
Published: (2026) -
Improved Adversarial Diffusion Compression for Real-World Video Super-Resolution
by: Chen, Bin, et al.
Published: (2026) -
UARE: A Unified Vision-Language Model for Image Quality Assessment, Restoration, and Enhancement
by: Li, Weiqi, et al.
Published: (2025)