Aligning Few-Step Diffusion Models with Dense Reward Difference Learning
Fuente:
arXiv
Saved in:
| Main Authors: | Zhang, Ziyi, Shen, Li, Zhang, Sen, Ye, Deheng, Luo, Yong, Shi, Miaojing, Shan, Dongjing, Du, Bo, Tao, Dacheng |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Refining Few-Step Text-to-Multiview Diffusion via Reinforcement Learning
by: Zhang, Ziyi, et al.
Published: (2025)
by: Zhang, Ziyi, et al.
Published: (2025)
Confronting Reward Overoptimization for Diffusion Models: A Perspective of Inductive and Primacy Biases
by: Zhang, Ziyi, et al.
Published: (2024)
by: Zhang, Ziyi, et al.
Published: (2024)
Memory-guided Network with Uncertainty-based Feature Augmentation for Few-shot Semantic Segmentation
by: Chen, Xinyue, et al.
Published: (2024)
by: Chen, Xinyue, et al.
Published: (2024)
TDM-R1: Reinforcing Few-Step Diffusion Models with Non-Differentiable Reward
by: Luo, Yihong, et al.
Published: (2026)
by: Luo, Yihong, et al.
Published: (2026)
Optimizing Dense Visual Predictions Through Multi-Task Coherence and Prioritization
by: Fontana, Maxime, et al.
Published: (2024)
by: Fontana, Maxime, et al.
Published: (2024)
A Dense Reward View on Aligning Text-to-Image Diffusion with Preference
by: Yang, Shentao, et al.
Published: (2024)
by: Yang, Shentao, et al.
Published: (2024)
Boosting Object Detection with Zero-Shot Day-Night Domain Adaptation
by: Du, Zhipeng, et al.
Published: (2023)
by: Du, Zhipeng, et al.
Published: (2023)
Learning Few-Step Diffusion Models by Trajectory Distribution Matching
by: Luo, Yihong, et al.
Published: (2025)
by: Luo, Yihong, et al.
Published: (2025)
ReAlign: Text-to-Motion Generation via Step-Aware Reward-Guided Alignment
by: Weng, Wanjiang, et al.
Published: (2025)
by: Weng, Wanjiang, et al.
Published: (2025)
GvT: A Graph-based Vision Transformer with Talking-Heads Utilizing Sparsity, Trained from Scratch on Small Datasets
by: Shan, Dongjing, et al.
Published: (2024)
by: Shan, Dongjing, et al.
Published: (2024)
Enhancing Generalized Few-Shot Semantic Segmentation via Effective Knowledge Transfer
by: Chen, Xinyue, et al.
Published: (2024)
by: Chen, Xinyue, et al.
Published: (2024)
Bootstrapping MLLM for Weakly-Supervised Class-Agnostic Object Counting
by: Zhang, Xiaowen, et al.
Published: (2026)
by: Zhang, Xiaowen, et al.
Published: (2026)
Text-promptable Object Counting via Quantity Awareness Enhancement
by: Shi, Miaojing, et al.
Published: (2025)
by: Shi, Miaojing, et al.
Published: (2025)
Enhancing Space-time Video Super-resolution via Spatial-temporal Feature Interaction
by: Yue, Zijie, et al.
Published: (2022)
by: Yue, Zijie, et al.
Published: (2022)
Multitask Learning in Minimally Invasive Surgical Vision: A Review
by: Alabi, Oluwatosin, et al.
Published: (2024)
by: Alabi, Oluwatosin, et al.
Published: (2024)
VSF: Simple, Efficient, and Effective Negative Guidance in Few-Step Image Generation Models By Value Sign Flip
by: Guo, Wenqi, et al.
Published: (2025)
by: Guo, Wenqi, et al.
Published: (2025)
Continuous-Time Distribution Matching for Few-Step Diffusion Distillation
by: Liu, Tao, et al.
Published: (2026)
by: Liu, Tao, et al.
Published: (2026)
AdaTreeFormer: Few Shot Domain Adaptation for Tree Counting from a Single High-Resolution Image
by: Amirkolaee, Hamed Amini, et al.
Published: (2024)
by: Amirkolaee, Hamed Amini, et al.
Published: (2024)
Skeleton2Stage: Reward-Guided Fine-Tuning for Physically Plausible Dance Generation
by: Jia, Jidong, et al.
Published: (2026)
by: Jia, Jidong, et al.
Published: (2026)
GoMatching++: Parameter- and Data-Efficient Arbitrary-Shaped Video Text Spotting and Benchmarking
by: He, Haibin, et al.
Published: (2025)
by: He, Haibin, et al.
Published: (2025)
GoMatching: A Simple Baseline for Video Text Spotting via Long and Short Term Matching
by: He, Haibin, et al.
Published: (2024)
by: He, Haibin, et al.
Published: (2024)
DOLLAR: Few-Step Video Generation via Distillation and Latent Reward Optimization
by: Ding, Zihan, et al.
Published: (2024)
by: Ding, Zihan, et al.
Published: (2024)
Event-based Simultaneous Localization and Mapping: A Comprehensive Survey
by: Huang, Kunping, et al.
Published: (2023)
by: Huang, Kunping, et al.
Published: (2023)
Training-Free Adaptive Diffusion with Bounded Difference Approximation Strategy
by: Ye, Hancheng, et al.
Published: (2024)
by: Ye, Hancheng, et al.
Published: (2024)
DRM: Diffusion-based Reward Model With Step-wise Guidance
by: Zhang, Jaxon, et al.
Published: (2026)
by: Zhang, Jaxon, et al.
Published: (2026)
UniX: Unifying Autoregression and Diffusion for Chest X-Ray Understanding and Generation
by: Zhang, Ruiheng, et al.
Published: (2026)
by: Zhang, Ruiheng, et al.
Published: (2026)
Efficient and Effective Weight-Ensembling Mixture of Experts for Multi-Task Model Merging
by: Shen, Li, et al.
Published: (2024)
by: Shen, Li, et al.
Published: (2024)
Image Captions are Natural Prompts for Text-to-Image Models
by: Lei, Shiye, et al.
Published: (2023)
by: Lei, Shiye, et al.
Published: (2023)
Few-Step Diffusion Sampling Through Instance-Aware Discretizations
by: Yuan, Liangyu, et al.
Published: (2026)
by: Yuan, Liangyu, et al.
Published: (2026)
Diffusion Model as a Noise-Aware Latent Reward Model for Step-Level Preference Optimization
by: Zhang, Tao, et al.
Published: (2025)
by: Zhang, Tao, et al.
Published: (2025)
When Multi-Task Learning Meets Partial Supervision: A Computer Vision Review
by: Fontana, Maxime, et al.
Published: (2023)
by: Fontana, Maxime, et al.
Published: (2023)
Few-Shot Distribution-Aligned Flow Matching for Data Synthesis in Medical Image Segmentation
by: Yang, Jie, et al.
Published: (2026)
by: Yang, Jie, et al.
Published: (2026)
Rethink Sparse Signals for Pose-guided Text-to-image Generation
by: Xuan, Wenjie, et al.
Published: (2025)
by: Xuan, Wenjie, et al.
Published: (2025)
ReDiF: Reinforced Distillation for Few Step Diffusion
by: Tighkhorshid, Amirhossein, et al.
Published: (2025)
by: Tighkhorshid, Amirhossein, et al.
Published: (2025)
Retrieval-Augmented Perception: High-Resolution Image Perception Meets Visual RAG
by: Wang, Wenbin, et al.
Published: (2025)
by: Wang, Wenbin, et al.
Published: (2025)
Merging Multi-Task Models via Weight-Ensembling Mixture of Experts
by: Tang, Anke, et al.
Published: (2024)
by: Tang, Anke, et al.
Published: (2024)
Diffusion Reward: Learning Rewards via Conditional Video Diffusion
by: Huang, Tao, et al.
Published: (2023)
by: Huang, Tao, et al.
Published: (2023)
Beyond Few-Step Inference: Accelerating Video Diffusion Transformer Model Serving with Inter-Request Caching Reuse
by: Liu, Hao, et al.
Published: (2026)
by: Liu, Hao, et al.
Published: (2026)
DeepSolo++: Let Transformer Decoder with Explicit Points Solo for Multilingual Text Spotting
by: Ye, Maoyuan, et al.
Published: (2023)
by: Ye, Maoyuan, et al.
Published: (2023)
Reasoning-OCR: Can Large Multimodal Models Solve Complex Logical Reasoning Problems from OCR Cues?
by: He, Haibin, et al.
Published: (2025)
by: He, Haibin, et al.
Published: (2025)
Similar Items
-
Refining Few-Step Text-to-Multiview Diffusion via Reinforcement Learning
by: Zhang, Ziyi, et al.
Published: (2025) -
Confronting Reward Overoptimization for Diffusion Models: A Perspective of Inductive and Primacy Biases
by: Zhang, Ziyi, et al.
Published: (2024) -
Memory-guided Network with Uncertainty-based Feature Augmentation for Few-shot Semantic Segmentation
by: Chen, Xinyue, et al.
Published: (2024) -
TDM-R1: Reinforcing Few-Step Diffusion Models with Non-Differentiable Reward
by: Luo, Yihong, et al.
Published: (2026) -
Optimizing Dense Visual Predictions Through Multi-Task Coherence and Prioritization
by: Fontana, Maxime, et al.
Published: (2024)