MJ-VIDEO: Fine-Grained Benchmarking and Rewarding Video Preferences in Video Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Tong, Haibo, Wang, Zhaoyang, Chen, Zhaorun, Ji, Haonian, Qiu, Shi, Han, Siwei, Geng, Kexin, Xue, Zhongkai, Zhou, Yiyang, Xia, Peng, Ding, Mingyu, Rafailov, Rafael, Finn, Chelsea, Yao, Huaxiu |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Aligning Modalities in Vision Large Language Models via Preference Fine-tuning
par: Zhou, Yiyang, et autres
Publié: (2024)
par: Zhou, Yiyang, et autres
Publié: (2024)
MJ-Bench: Is Your Multimodal Reward Model Really a Good Judge for Text-to-Image Generation?
par: Chen, Zhaorun, et autres
Publié: (2024)
par: Chen, Zhaorun, et autres
Publié: (2024)
From EduVisBench to EduVisAgent: A Benchmark and Multi-Agent Framework for Reasoning-Driven Pedagogical Visualization
par: Ji, Haonian, et autres
Publié: (2025)
par: Ji, Haonian, et autres
Publié: (2025)
Fine-Grained Verifiers: Preference Modeling as Next-token Prediction in Vision-Language Alignment
par: Cui, Chenhang, et autres
Publié: (2024)
par: Cui, Chenhang, et autres
Publié: (2024)
GLIMPSE: Do Large Vision-Language Models Truly Think With Videos or Just Glimpse at Them?
par: Zhou, Yiyang, et autres
Publié: (2025)
par: Zhou, Yiyang, et autres
Publié: (2025)
Disentangling Length from Quality in Direct Preference Optimization
par: Park, Ryan, et autres
Publié: (2024)
par: Park, Ryan, et autres
Publié: (2024)
MMIE: Massive Multimodal Interleaved Comprehension Benchmark for Large Vision-Language Models
par: Xia, Peng, et autres
Publié: (2024)
par: Xia, Peng, et autres
Publié: (2024)
Direct Preference Optimization: Your Language Model is Secretly a Reward Model
par: Rafailov, Rafael, et autres
Publié: (2023)
par: Rafailov, Rafael, et autres
Publié: (2023)
ReAgent-V: A Reward-Driven Multi-Agent Framework for Video Understanding
par: Zhou, Yiyang, et autres
Publié: (2025)
par: Zhou, Yiyang, et autres
Publié: (2025)
Agent0-VL: Exploring Self-Evolving Agent for Tool-Integrated Vision-Language Reasoning
par: Liu, Jiaqi, et autres
Publié: (2025)
par: Liu, Jiaqi, et autres
Publié: (2025)
GRAPE: Generalizing Robot Policy via Preference Alignment
par: Zhang, Zijian, et autres
Publié: (2024)
par: Zhang, Zijian, et autres
Publié: (2024)
Preference Fine-Tuning of LLMs Should Leverage Suboptimal, On-Policy Data
par: Tajwar, Fahim, et autres
Publié: (2024)
par: Tajwar, Fahim, et autres
Publié: (2024)
ClawArena: Benchmarking AI Agents in Evolving Information Environments
par: Ji, Haonian, et autres
Publié: (2026)
par: Ji, Haonian, et autres
Publié: (2026)
From $r$ to $Q^*$: Your Language Model is Secretly a Q-Function
par: Rafailov, Rafael, et autres
Publié: (2024)
par: Rafailov, Rafael, et autres
Publié: (2024)
MOTO: Offline Pre-training to Online Fine-tuning for Model-based Robot Learning
par: Rafailov, Rafael, et autres
Publié: (2024)
par: Rafailov, Rafael, et autres
Publié: (2024)
VisionReward: Fine-Grained Multi-Dimensional Human Preference Learning for Image and Video Generation
par: Xu, Jiazheng, et autres
Publié: (2024)
par: Xu, Jiazheng, et autres
Publié: (2024)
Contrastive Preference Learning: Learning from Human Feedback without RL
par: Hejna, Joey, et autres
Publié: (2023)
par: Hejna, Joey, et autres
Publié: (2023)
Scaling Laws for Reward Model Overoptimization in Direct Alignment Algorithms
par: Rafailov, Rafael, et autres
Publié: (2024)
par: Rafailov, Rafael, et autres
Publié: (2024)
Calibrated Self-Rewarding Vision Language Models
par: Zhou, Yiyang, et autres
Publié: (2024)
par: Zhou, Yiyang, et autres
Publié: (2024)
Efficient Imitation Learning with Conservative World Models
par: Kolev, Victor, et autres
Publié: (2024)
par: Kolev, Victor, et autres
Publié: (2024)
Generative Reward Models
par: Mahan, Dakota, et autres
Publié: (2024)
par: Mahan, Dakota, et autres
Publié: (2024)
PERSONA: A Reproducible Testbed for Pluralistic Alignment
par: Castricato, Louis, et autres
Publié: (2024)
par: Castricato, Louis, et autres
Publié: (2024)
Analyzing and Mitigating Object Hallucination in Large Vision-Language Models
par: Zhou, Yiyang, et autres
Publié: (2023)
par: Zhou, Yiyang, et autres
Publié: (2023)
VERIFIED: A Video Corpus Moment Retrieval Benchmark for Fine-Grained Video Understanding
par: Chen, Houlun, et autres
Publié: (2024)
par: Chen, Houlun, et autres
Publié: (2024)
Anyprefer: An Agentic Framework for Preference Data Synthesis
par: Zhou, Yiyang, et autres
Publié: (2025)
par: Zhou, Yiyang, et autres
Publié: (2025)
DenseDPO: Fine-Grained Temporal Preference Optimization for Video Diffusion Models
par: Wu, Ziyi, et autres
Publié: (2025)
par: Wu, Ziyi, et autres
Publié: (2025)
BrokenVideos: A Benchmark Dataset for Fine-Grained Artifact Localization in AI-Generated Videos
par: Lin, Jiahao, et autres
Publié: (2025)
par: Lin, Jiahao, et autres
Publié: (2025)
EgoCVR: An Egocentric Benchmark for Fine-Grained Composed Video Retrieval
par: Hummel, Thomas, et autres
Publié: (2024)
par: Hummel, Thomas, et autres
Publié: (2024)
MotionCharacter: Fine-Grained Motion Controllable Human Video Generation
par: Fang, Haopeng, et autres
Publié: (2024)
par: Fang, Haopeng, et autres
Publié: (2024)
FineVAU: A Novel Human-Aligned Benchmark for Fine-Grained Video Anomaly Understanding
par: Pereira, João, et autres
Publié: (2026)
par: Pereira, João, et autres
Publié: (2026)
Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning
par: Xiang, Violet, et autres
Publié: (2025)
par: Xiang, Violet, et autres
Publié: (2025)
Agent Q: Advanced Reasoning and Learning for Autonomous AI Agents
par: Putta, Pranav, et autres
Publié: (2024)
par: Putta, Pranav, et autres
Publié: (2024)
Conservative Prediction via Data-Driven Confidence Minimization
par: Choi, Caroline, et autres
Publié: (2023)
par: Choi, Caroline, et autres
Publié: (2023)
CaReBench: A Fine-Grained Benchmark for Video Captioning and Retrieval
par: Xu, Yifan, et autres
Publié: (2024)
par: Xu, Yifan, et autres
Publié: (2024)
FAVOR-Bench: A Comprehensive Benchmark for Fine-Grained Video Motion Understanding
par: Tu, Chongjun, et autres
Publié: (2025)
par: Tu, Chongjun, et autres
Publié: (2025)
Arena as Offline Reward: Efficient Fine-Grained Preference Optimization for Diffusion Models
par: Li, Zhikai, et autres
Publié: (2026)
par: Li, Zhikai, et autres
Publié: (2026)
Fine-grained Video Dubbing Duration Alignment with Segment Supervised Preference Optimization
par: Cui, Chaoqun, et autres
Publié: (2025)
par: Cui, Chaoqun, et autres
Publié: (2025)
Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success
par: Kim, Moo Jin, et autres
Publié: (2025)
par: Kim, Moo Jin, et autres
Publié: (2025)
RoboReward: General-Purpose Vision-Language Reward Models for Robotics
par: Lee, Tony, et autres
Publié: (2026)
par: Lee, Tony, et autres
Publié: (2026)
Multi-entity Video Transformers for Fine-Grained Video Representation Learning
par: Walmer, Matthew, et autres
Publié: (2023)
par: Walmer, Matthew, et autres
Publié: (2023)
Documents similaires
-
Aligning Modalities in Vision Large Language Models via Preference Fine-tuning
par: Zhou, Yiyang, et autres
Publié: (2024) -
MJ-Bench: Is Your Multimodal Reward Model Really a Good Judge for Text-to-Image Generation?
par: Chen, Zhaorun, et autres
Publié: (2024) -
From EduVisBench to EduVisAgent: A Benchmark and Multi-Agent Framework for Reasoning-Driven Pedagogical Visualization
par: Ji, Haonian, et autres
Publié: (2025) -
Fine-Grained Verifiers: Preference Modeling as Next-token Prediction in Vision-Language Alignment
par: Cui, Chenhang, et autres
Publié: (2024) -
GLIMPSE: Do Large Vision-Language Models Truly Think With Videos or Just Glimpse at Them?
par: Zhou, Yiyang, et autres
Publié: (2025)