Dual-IPO: Dual-Iterative Preference Optimization for Text-to-Video Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yang, Xiaomeng, Yang, Mengping, Gong, Jia, Qin, Luozheng, Tan, Zhiyu, Li, Hao |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Omni-Video: Democratizing Unified Video Understanding and Generation
par: Tan, Zhiyu, et autres
Publié: (2025)
par: Tan, Zhiyu, et autres
Publié: (2025)
Cockatiel: Ensembling Synthetic and Human Preferenced Training for Detailed Video Caption
par: Qin, Luozheng, et autres
Publié: (2025)
par: Qin, Luozheng, et autres
Publié: (2025)
EVALALIGN: Supervised Fine-Tuning Multimodal LLMs with Human-Aligned Data for Evaluating Text-to-Image Models
par: Tan, Zhiyu, et autres
Publié: (2024)
par: Tan, Zhiyu, et autres
Publié: (2024)
VidGen-1M: A Large-Scale Dataset for Text-to-video Generation
par: Tan, Zhiyu, et autres
Publié: (2024)
par: Tan, Zhiyu, et autres
Publié: (2024)
Omni-Video 2: Scaling MLLM-Conditioned Diffusion for Unified Video Generation and Editing
par: Yang, Hao, et autres
Publié: (2026)
par: Yang, Hao, et autres
Publié: (2026)
Uni-ViGU: Towards Unified Video Generation and Understanding via A Diffusion-Based Video Generator
par: Qin, Luozheng, et autres
Publié: (2026)
par: Qin, Luozheng, et autres
Publié: (2026)
Uni-cot: Towards Unified Chain-of-Thought Reasoning Across Text and Vision
par: Qin, Luozheng, et autres
Publié: (2025)
par: Qin, Luozheng, et autres
Publié: (2025)
An Empirical Study and Analysis of Text-to-Image Generation Using Large Language Model-Powered Textual Representation
par: Tan, Zhiyu, et autres
Publié: (2024)
par: Tan, Zhiyu, et autres
Publié: (2024)
Synergistic Dual Spatial-aware Generation of Image-to-Text and Text-to-Image
par: Zhao, Yu, et autres
Publié: (2024)
par: Zhao, Yu, et autres
Publié: (2024)
Reg-DPO: SFT-Regularized Direct Preference Optimization with GT-Pair for Improving Video Generation
par: Du, Jie, et autres
Publié: (2025)
par: Du, Jie, et autres
Publié: (2025)
Diff-Aid: Inference-time Adaptive Interaction Denoising for Rectified Text-to-Image Generation
par: Li, Binglei, et autres
Publié: (2026)
par: Li, Binglei, et autres
Publié: (2026)
Image Synthesis under Limited Data: A Survey and Taxonomy
par: Yang, Mengping, et autres
Publié: (2023)
par: Yang, Mengping, et autres
Publié: (2023)
DiverseDiT: Towards Diverse Representation Learning in Diffusion Transformers
par: Yang, Mengping, et autres
Publié: (2026)
par: Yang, Mengping, et autres
Publié: (2026)
Raccoon: Multi-stage Diffusion Training with Coarse-to-Fine Curating Videos
par: Tan, Zhiyu, et autres
Publié: (2025)
par: Tan, Zhiyu, et autres
Publié: (2025)
Echo-Path: Pathology-Conditioned Echo Video Generation
par: Muhammad, Kabir Hamzah, et autres
Publié: (2025)
par: Muhammad, Kabir Hamzah, et autres
Publié: (2025)
VC4VG: Optimizing Video Captions for Text-to-Video Generation
par: Du, Yang, et autres
Publié: (2025)
par: Du, Yang, et autres
Publié: (2025)
PhyT2V: LLM-Guided Iterative Self-Refinement for Physics-Grounded Text-to-Video Generation
par: Xue, Qiyao, et autres
Publié: (2024)
par: Xue, Qiyao, et autres
Publié: (2024)
Unraveling MMDiT Blocks: Training-free Analysis and Enhancement of Text-conditioned Diffusion
par: Li, Binglei, et autres
Publié: (2026)
par: Li, Binglei, et autres
Publié: (2026)
Grounding is All You Need? Dual Temporal Grounding for Video Dialog
par: Qin, You, et autres
Publié: (2024)
par: Qin, You, et autres
Publié: (2024)
DualTSR: Unified Dual-Diffusion Transformer for Scene Text Image Super-Resolution
par: Niu, Axi, et autres
Publié: (2026)
par: Niu, Axi, et autres
Publié: (2026)
SWIFT: Prompt-Adaptive Memory for Efficient Interactive Long Video Generation
par: Tan, Shanwen, et autres
Publié: (2026)
par: Tan, Shanwen, et autres
Publié: (2026)
SHAPE : Self-Improved Visual Preference Alignment by Iteratively Generating Holistic Winner
par: Chen, Kejia, et autres
Publié: (2025)
par: Chen, Kejia, et autres
Publié: (2025)
SafeSora: Towards Safety Alignment of Text2Video Generation via a Human Preference Dataset
par: Dai, Josef, et autres
Publié: (2024)
par: Dai, Josef, et autres
Publié: (2024)
Dual-Modal Attention-Enhanced Text-Video Retrieval with Triplet Partial Margin Contrastive Learning
par: Jiang, Chen, et autres
Publié: (2023)
par: Jiang, Chen, et autres
Publié: (2023)
Instant Preference Alignment for Text-to-Image Diffusion Models
par: Li, Yang, et autres
Publié: (2025)
par: Li, Yang, et autres
Publié: (2025)
LiFT: Leveraging Human Feedback for Text-to-Video Model Alignment
par: Wang, Yibin, et autres
Publié: (2024)
par: Wang, Yibin, et autres
Publié: (2024)
Online Iterative Self-Alignment for Radiology Report Generation
par: Xiao, Ting, et autres
Publié: (2025)
par: Xiao, Ting, et autres
Publié: (2025)
Collaborative Few-Step Distillation and Low-Bit Quantization for Wan2.2 Dual-Expert Video Diffusion Models
par: Du, Jinyang, et autres
Publié: (2026)
par: Du, Jinyang, et autres
Publié: (2026)
Video-Infinity: Distributed Long Video Generation
par: Tan, Zhenxiong, et autres
Publié: (2024)
par: Tan, Zhenxiong, et autres
Publié: (2024)
Towards Effective Usage of Human-Centric Priors in Diffusion Models for Text-based Human Image Generation
par: Wang, Junyan, et autres
Publié: (2024)
par: Wang, Junyan, et autres
Publié: (2024)
DA-Flow: Dual Attention Normalizing Flow for Skeleton-based Video Anomaly Detection
par: Wu, Ruituo, et autres
Publié: (2024)
par: Wu, Ruituo, et autres
Publié: (2024)
VideoRouter: Query-Adaptive Dual Routing for Efficient Long-Video Understanding
par: Lin, Kuanwei, et autres
Publié: (2026)
par: Lin, Kuanwei, et autres
Publié: (2026)
Knowledge-Refined Dual Context-Aware Network for Partially Relevant Video Retrieval
par: Yang, Junkai, et autres
Publié: (2026)
par: Yang, Junkai, et autres
Publié: (2026)
V.I.P. : Iterative Online Preference Distillation for Efficient Video Diffusion Models
par: Kim, Jisoo, et autres
Publié: (2025)
par: Kim, Jisoo, et autres
Publié: (2025)
Free Lunch Alignment of Text-to-Image Diffusion Models without Preference Image Pairs
par: Xian, Jia Jun Cheng, et autres
Publié: (2025)
par: Xian, Jia Jun Cheng, et autres
Publié: (2025)
SynPO: Synergizing Descriptiveness and Preference Optimization for Video Detailed Captioning
par: Dang, Jisheng, et autres
Publié: (2025)
par: Dang, Jisheng, et autres
Publié: (2025)
DualCap: Enhancing Lightweight Image Captioning via Dual Retrieval with Similar Scenes Visual Prompts
par: Li, Binbin, et autres
Publié: (2025)
par: Li, Binbin, et autres
Publié: (2025)
Direct Preference Optimization of Video Large Multimodal Models from Language Model Reward
par: Zhang, Ruohong, et autres
Publié: (2024)
par: Zhang, Ruohong, et autres
Publié: (2024)
AdaSin: Enhancing Hard Sample Metrics with Dual Adaptive Penalty for Face Recognition
par: Guo, Qiqi, et autres
Publié: (2025)
par: Guo, Qiqi, et autres
Publié: (2025)
A Survey: Spatiotemporal Consistency in Video Generation
par: Yin, Zhiyu, et autres
Publié: (2025)
par: Yin, Zhiyu, et autres
Publié: (2025)
Documents similaires
-
Omni-Video: Democratizing Unified Video Understanding and Generation
par: Tan, Zhiyu, et autres
Publié: (2025) -
Cockatiel: Ensembling Synthetic and Human Preferenced Training for Detailed Video Caption
par: Qin, Luozheng, et autres
Publié: (2025) -
EVALALIGN: Supervised Fine-Tuning Multimodal LLMs with Human-Aligned Data for Evaluating Text-to-Image Models
par: Tan, Zhiyu, et autres
Publié: (2024) -
VidGen-1M: A Large-Scale Dataset for Text-to-video Generation
par: Tan, Zhiyu, et autres
Publié: (2024) -
Omni-Video 2: Scaling MLLM-Conditioned Diffusion for Unified Video Generation and Editing
par: Yang, Hao, et autres
Publié: (2026)