LiFT: Leveraging Human Feedback for Text-to-Video Model Alignment
Fuente:
arXiv
Saved in:
| Main Authors: | Wang, Yibin, Tan, Zhiyu, Wang, Junyan, Yang, Xiaomeng, Jin, Cheng, Li, Hao |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
SARA: Structural and Adversarial Representation Alignment for Training-efficient Diffusion Models
by: Chen, Hesen, et al.
Published: (2025)
by: Chen, Hesen, et al.
Published: (2025)
LiFT: A Surprisingly Simple Lightweight Feature Transform for Dense ViT Descriptors
by: Suri, Saksham, et al.
Published: (2024)
by: Suri, Saksham, et al.
Published: (2024)
(LiFT) Lightweight Fitness Transformer: A language-vision model for Remote Monitoring of Physical Training
by: Postlmayr, A., et al.
Published: (2025)
by: Postlmayr, A., et al.
Published: (2025)
EVALALIGN: Supervised Fine-Tuning Multimodal LLMs with Human-Aligned Data for Evaluating Text-to-Image Models
by: Tan, Zhiyu, et al.
Published: (2024)
by: Tan, Zhiyu, et al.
Published: (2024)
Cockatiel: Ensembling Synthetic and Human Preferenced Training for Detailed Video Caption
by: Qin, Luozheng, et al.
Published: (2025)
by: Qin, Luozheng, et al.
Published: (2025)
VidGen-1M: A Large-Scale Dataset for Text-to-video Generation
by: Tan, Zhiyu, et al.
Published: (2024)
by: Tan, Zhiyu, et al.
Published: (2024)
LiFT: Lightweight, FPGA-tailored 3D object detection based on LiDAR data
by: Lis, Konrad, et al.
Published: (2025)
by: Lis, Konrad, et al.
Published: (2025)
LiFT: Lifted Inter-slice Feature Trajectories for 3D Image Generation from 2D Generators
by: Zhang, Xinhe, et al.
Published: (2026)
by: Zhang, Xinhe, et al.
Published: (2026)
Towards Effective Usage of Human-Centric Priors in Diffusion Models for Text-based Human Image Generation
by: Wang, Junyan, et al.
Published: (2024)
by: Wang, Junyan, et al.
Published: (2024)
Dual-IPO: Dual-Iterative Preference Optimization for Text-to-Video Generation
by: Yang, Xiaomeng, et al.
Published: (2025)
by: Yang, Xiaomeng, et al.
Published: (2025)
Raccoon: Multi-stage Diffusion Training with Coarse-to-Fine Curating Videos
by: Tan, Zhiyu, et al.
Published: (2025)
by: Tan, Zhiyu, et al.
Published: (2025)
Unified Reward Model for Multimodal Understanding and Generation
by: Wang, Yibin, et al.
Published: (2025)
by: Wang, Yibin, et al.
Published: (2025)
Omni-Video 2: Scaling MLLM-Conditioned Diffusion for Unified Video Generation and Editing
by: Yang, Hao, et al.
Published: (2026)
by: Yang, Hao, et al.
Published: (2026)
DiverseDiT: Towards Diverse Representation Learning in Diffusion Transformers
by: Yang, Mengping, et al.
Published: (2026)
by: Yang, Mengping, et al.
Published: (2026)
Omni-Video: Democratizing Unified Video Understanding and Generation
by: Tan, Zhiyu, et al.
Published: (2025)
by: Tan, Zhiyu, et al.
Published: (2025)
DreamText: High Fidelity Scene Text Synthesis
by: Wang, Yibin, et al.
Published: (2024)
by: Wang, Yibin, et al.
Published: (2024)
An Empirical Study and Analysis of Text-to-Image Generation Using Large Language Model-Powered Textual Representation
by: Tan, Zhiyu, et al.
Published: (2024)
by: Tan, Zhiyu, et al.
Published: (2024)
MagicFace: Training-free Universal-Style Human Image Customized Synthesis
by: Wang, Yibin, et al.
Published: (2024)
by: Wang, Yibin, et al.
Published: (2024)
Uni-cot: Towards Unified Chain-of-Thought Reasoning Across Text and Vision
by: Qin, Luozheng, et al.
Published: (2025)
by: Qin, Luozheng, et al.
Published: (2025)
FT2TF: First-Person Statement Text-To-Talking Face Generation
by: Diao, Xingjian, et al.
Published: (2023)
by: Diao, Xingjian, et al.
Published: (2023)
Bridging the Intention-Expression Gap: Aligning Multi-Dimensional Preferences via Hierarchical Relevance Feedback in Text-to-Image Diffusion
by: Wang, Wenxi, et al.
Published: (2026)
by: Wang, Wenxi, et al.
Published: (2026)
Unraveling MMDiT Blocks: Training-free Analysis and Enhancement of Text-conditioned Diffusion
by: Li, Binglei, et al.
Published: (2026)
by: Li, Binglei, et al.
Published: (2026)
Diff-Aid: Inference-time Adaptive Interaction Denoising for Rectified Text-to-Image Generation
by: Li, Binglei, et al.
Published: (2026)
by: Li, Binglei, et al.
Published: (2026)
Frame-wise Conditioning Adaptation for Fine-Tuning Diffusion Models in Text-to-Video Prediction
by: Liu, Zheyuan, et al.
Published: (2025)
by: Liu, Zheyuan, et al.
Published: (2025)
Rich Human Feedback for Text-to-Image Generation
by: Liang, Youwei, et al.
Published: (2023)
by: Liang, Youwei, et al.
Published: (2023)
Can Text-to-Video Generation help Video-Language Alignment?
by: Zanella, Luca, et al.
Published: (2025)
by: Zanella, Luca, et al.
Published: (2025)
Pref-GRPO: Pairwise Preference Reward-based GRPO for Stable Text-to-Image Reinforcement Learning
by: Wang, Yibin, et al.
Published: (2025)
by: Wang, Yibin, et al.
Published: (2025)
ShortFT: Diffusion Model Alignment via Shortcut-based Fine-Tuning
by: Guo, Xiefan, et al.
Published: (2025)
by: Guo, Xiefan, et al.
Published: (2025)
Unified Multimodal Chain-of-Thought Reward Model through Reinforcement Fine-Tuning
by: Wang, Yibin, et al.
Published: (2025)
by: Wang, Yibin, et al.
Published: (2025)
Modeling Thousands of Human Annotators for Generalizable Text-to-Image Person Re-identification
by: Jiang, Jiayu, et al.
Published: (2025)
by: Jiang, Jiayu, et al.
Published: (2025)
Revealing the Impact of Visual Text Style on Attribute-based Descriptions Produced by Large Visual Language Models
by: Wang, Xiaomeng, et al.
Published: (2026)
by: Wang, Xiaomeng, et al.
Published: (2026)
SAIL: Self-Amplified Iterative Learning for Diffusion Model Alignment with Minimal Human Feedback
by: He, Xiaoxuan, et al.
Published: (2026)
by: He, Xiaoxuan, et al.
Published: (2026)
FastVideoEdit: Leveraging Consistency Models for Efficient Text-to-Video Editing
by: Zhang, Youyuan, et al.
Published: (2024)
by: Zhang, Youyuan, et al.
Published: (2024)
Aligning Anime Video Generation with Human Feedback
by: Zhu, Bingwen, et al.
Published: (2025)
by: Zhu, Bingwen, et al.
Published: (2025)
Accelerate High-Quality Diffusion Models with Inner Loop Feedback
by: Gwilliam, Matthew, et al.
Published: (2025)
by: Gwilliam, Matthew, et al.
Published: (2025)
Unveiling Structural Memorization: Structural Membership Inference Attack for Text-to-Image Diffusion Models
by: Li, Qiao, et al.
Published: (2024)
by: Li, Qiao, et al.
Published: (2024)
TokenBinder: Text-Video Retrieval with One-to-Many Alignment Paradigm
by: Zhang, Bingqing, et al.
Published: (2024)
by: Zhang, Bingqing, et al.
Published: (2024)
Text2LiDAR: Text-guided LiDAR Point Cloud Generation via Equirectangular Transformer
by: Wu, Yang, et al.
Published: (2024)
by: Wu, Yang, et al.
Published: (2024)
FITA: Fine-grained Image-Text Aligner for Radiology Report Generation
by: Yang, Honglong, et al.
Published: (2024)
by: Yang, Honglong, et al.
Published: (2024)
Relit-LiVE: Relight Video by Jointly Learning Environment Video
by: Xiao, Weiqing, et al.
Published: (2026)
by: Xiao, Weiqing, et al.
Published: (2026)
Similar Items
-
SARA: Structural and Adversarial Representation Alignment for Training-efficient Diffusion Models
by: Chen, Hesen, et al.
Published: (2025) -
LiFT: A Surprisingly Simple Lightweight Feature Transform for Dense ViT Descriptors
by: Suri, Saksham, et al.
Published: (2024) -
(LiFT) Lightweight Fitness Transformer: A language-vision model for Remote Monitoring of Physical Training
by: Postlmayr, A., et al.
Published: (2025) -
EVALALIGN: Supervised Fine-Tuning Multimodal LLMs with Human-Aligned Data for Evaluating Text-to-Image Models
by: Tan, Zhiyu, et al.
Published: (2024) -
Cockatiel: Ensembling Synthetic and Human Preferenced Training for Detailed Video Caption
by: Qin, Luozheng, et al.
Published: (2025)