Diffusion Model as a Noise-Aware Latent Reward Model for Step-Level Preference Optimization
Fuente:
arXiv
Saved in:
| Main Authors: | Zhang, Tao, Da, Cheng, Ding, Kun, Yang, Huan, Jin, Kun, Li, Yan, Gao, Tingting, Zhang, Di, Xiang, Shiming, Pan, Chunhong |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
UNIP: Rethinking Pre-trained Attention Patterns for Infrared Semantic Segmentation
by: Zhang, Tao, et al.
Published: (2025)
by: Zhang, Tao, et al.
Published: (2025)
Prompt Tuning with Soft Context Sharing for Vision-Language Models
by: Ding, Kun, et al.
Published: (2022)
by: Ding, Kun, et al.
Published: (2022)
Weak Distribution Detectors Lead to Stronger Generalizability of Vision-Language Prompt Tuning
by: Ding, Kun, et al.
Published: (2024)
by: Ding, Kun, et al.
Published: (2024)
IF-Bench: Benchmarking and Enhancing MLLMs for Infrared Images with Generative Visual Prompting
by: Zhang, Tao, et al.
Published: (2025)
by: Zhang, Tao, et al.
Published: (2025)
EvoVLMA: Evolutionary Vision-Language Model Adaptation
by: Ding, Kun, et al.
Published: (2025)
by: Ding, Kun, et al.
Published: (2025)
Compositional Kronecker Context Optimization for Vision-Language Models
by: Ding, Kun, et al.
Published: (2024)
by: Ding, Kun, et al.
Published: (2024)
Reusable Architecture Growth for Continual Stereo Matching
by: Zhang, Chenghao, et al.
Published: (2024)
by: Zhang, Chenghao, et al.
Published: (2024)
Calibrated Cache Model for Few-Shot Vision-Language Model Adaptation
by: Ding, Kun, et al.
Published: (2024)
by: Ding, Kun, et al.
Published: (2024)
D-Fusion: Direct Preference Optimization for Aligning Diffusion Models with Visually Consistent Samples
by: Hu, Zijing, et al.
Published: (2025)
by: Hu, Zijing, et al.
Published: (2025)
A Survey of Low-shot Vision-Language Model Adaptation via Representer Theorem
by: Ding, Kun, et al.
Published: (2024)
by: Ding, Kun, et al.
Published: (2024)
T-REG: Preference Optimization with Token-Level Reward Regularization
by: Zhou, Wenxuan, et al.
Published: (2024)
by: Zhou, Wenxuan, et al.
Published: (2024)
Enhanced Graph Transformer with Serialized Graph Tokens
by: Wang, Ruixiang, et al.
Published: (2026)
by: Wang, Ruixiang, et al.
Published: (2026)
Towards Identifiable Latent Additive Noise Models
by: Liu, Yuhang, et al.
Published: (2024)
by: Liu, Yuhang, et al.
Published: (2024)
DOLLAR: Few-Step Video Generation via Distillation and Latent Reward Optimization
by: Ding, Zihan, et al.
Published: (2024)
by: Ding, Zihan, et al.
Published: (2024)
Re-ranking Reasoning Context with Tree Search Makes Large Vision-Language Models Stronger
by: Yang, Qi, et al.
Published: (2025)
by: Yang, Qi, et al.
Published: (2025)
Stop Rewarding Hallucinated Steps: Faithfulness-Aware Step-Level Reinforcement Learning for Small Reasoning Models
by: Nie, Shuo, et al.
Published: (2026)
by: Nie, Shuo, et al.
Published: (2026)
Arena as Offline Reward: Efficient Fine-Grained Preference Optimization for Diffusion Models
by: Li, Zhikai, et al.
Published: (2026)
by: Li, Zhikai, et al.
Published: (2026)
InfEngine: A Self-Verifying and Self-Optimizing Intelligent Engine for Infrared Radiation Computing
by: Ding, Kun, et al.
Published: (2026)
by: Ding, Kun, et al.
Published: (2026)
GroundedPRM: Tree-Guided and Fidelity-Aware Process Reward Modeling for Step-Level Reasoning
by: Zhang, Yao, et al.
Published: (2025)
by: Zhang, Yao, et al.
Published: (2025)
Beyond VLM-Based Rewards: Diffusion-Native Latent Reward Modeling
by: Liu, Gongye, et al.
Published: (2026)
by: Liu, Gongye, et al.
Published: (2026)
Steering Visual Generation in Unified Multimodal Models with Understanding Supervision
by: Liu, Zeyu, et al.
Published: (2026)
by: Liu, Zeyu, et al.
Published: (2026)
Aligning Few-Step Diffusion Models with Dense Reward Difference Learning
by: Zhang, Ziyi, et al.
Published: (2024)
by: Zhang, Ziyi, et al.
Published: (2024)
Mitigating the Noise Shift for Denoising Generative Models via Noise Awareness Guidance
by: Zhong, Jincheng, et al.
Published: (2025)
by: Zhong, Jincheng, et al.
Published: (2025)
Debiasing Multimodal Large Language Models via Noise-Aware Preference Optimization
by: Zhang, Zefeng, et al.
Published: (2025)
by: Zhang, Zefeng, et al.
Published: (2025)
Limited Preference Data? Learning Better Reward Model with Latent Space Synthesis
by: Tao, Leitian, et al.
Published: (2025)
by: Tao, Leitian, et al.
Published: (2025)
Diffusion-Modeled Reinforcement Learning for Carbon and Risk-Aware Microgrid Optimization
by: Zhao, Yunyi, et al.
Published: (2025)
by: Zhao, Yunyi, et al.
Published: (2025)
Aesthetic Post-Training Diffusion Models from Generic Preferences with Step-by-step Preference Optimization
by: Liang, Zhanhao, et al.
Published: (2024)
by: Liang, Zhanhao, et al.
Published: (2024)
Discriminative Policy Optimization for Token-Level Reward Models
by: Chen, Hongzhan, et al.
Published: (2025)
by: Chen, Hongzhan, et al.
Published: (2025)
Beyond Pairwise Preferences: Listwise Reward-Aware Alignment for Diffusion Models
by: Wang, Austin, et al.
Published: (2026)
by: Wang, Austin, et al.
Published: (2026)
Smoothed Preference Optimization via ReNoise Inversion for Aligning Diffusion Models with Varied Human Preferences
by: Lu, Yunhong, et al.
Published: (2025)
by: Lu, Yunhong, et al.
Published: (2025)
Structure-based RNA Design by Step-wise Optimization of Latent Diffusion Model
by: Si, Qi, et al.
Published: (2026)
by: Si, Qi, et al.
Published: (2026)
QNCD: Quantization Noise Correction for Diffusion Models
by: Chu, Huanpeng, et al.
Published: (2024)
by: Chu, Huanpeng, et al.
Published: (2024)
Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward
by: Jia, Zhiwei, et al.
Published: (2024)
by: Jia, Zhiwei, et al.
Published: (2024)
One Step Diffusion-based Super-Resolution with Time-Aware Distillation
by: He, Xiao, et al.
Published: (2024)
by: He, Xiao, et al.
Published: (2024)
IRPM: Intergroup Relative Preference Modeling for Pointwise Generative Reward Models
by: Song, Haonan, et al.
Published: (2026)
by: Song, Haonan, et al.
Published: (2026)
Direct Preference Optimization of Video Large Multimodal Models from Language Model Reward
by: Zhang, Ruohong, et al.
Published: (2024)
by: Zhang, Ruohong, et al.
Published: (2024)
Mind the Generative Details: Direct Localized Detail Preference Optimization for Video Diffusion Models
by: Huang, Zitong, et al.
Published: (2026)
by: Huang, Zitong, et al.
Published: (2026)
Full-Step-DPO: Self-Supervised Preference Optimization with Step-wise Rewards for Mathematical Reasoning
by: Xu, Huimin, et al.
Published: (2025)
by: Xu, Huimin, et al.
Published: (2025)
WikiSeeker: Rethinking the Role of Vision-Language Models in Knowledge-Based Visual Question Answering
by: Zhu, Yingjian, et al.
Published: (2026)
by: Zhu, Yingjian, et al.
Published: (2026)
Rethinking Comprehensive Benchmark for Chart Understanding: A Perspective from Scientific Literature
by: Shen, Lingdong, et al.
Published: (2024)
by: Shen, Lingdong, et al.
Published: (2024)
Similar Items
-
UNIP: Rethinking Pre-trained Attention Patterns for Infrared Semantic Segmentation
by: Zhang, Tao, et al.
Published: (2025) -
Prompt Tuning with Soft Context Sharing for Vision-Language Models
by: Ding, Kun, et al.
Published: (2022) -
Weak Distribution Detectors Lead to Stronger Generalizability of Vision-Language Prompt Tuning
by: Ding, Kun, et al.
Published: (2024) -
IF-Bench: Benchmarking and Enhancing MLLMs for Infrared Images with Generative Visual Prompting
by: Zhang, Tao, et al.
Published: (2025) -
EvoVLMA: Evolutionary Vision-Language Model Adaptation
by: Ding, Kun, et al.
Published: (2025)