Saved in:
| Main Authors: | Liu, Gongye, Yang, Bo, Zhi, Yida, Zhong, Zhizhou, Ke, Lei, Deng, Didan, Gao, Han, Huang, Yongxiang, Zhang, Kaihao, Fu, Hongbo, Luo, Wenhan |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2602.11146 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
CannyEdit: Selective Canny Control and Dual-Prompt Guidance for Training-Free Image Editing
by: Xie, Weiyan, et al.
Published: (2025)
by: Xie, Weiyan, et al.
Published: (2025)
The Dark Side of Rich Rewards: Understanding and Mitigating Noise in VLM Rewards
by: Huang, Sukai, et al.
Published: (2024)
by: Huang, Sukai, et al.
Published: (2024)
MB-TaylorFormer V2: Improved Multi-branch Linear Transformer Expanded by Taylor Formula for Image Restoration
by: Jin, Zhi, et al.
Published: (2025)
by: Jin, Zhi, et al.
Published: (2025)
From Demonstrations to Rewards: Test-Time Prompt Optimization for VLM Reward Models
by: Gumbsch, Christian, et al.
Published: (2026)
by: Gumbsch, Christian, et al.
Published: (2026)
Towards Real-World Blind Face Restoration with Generative Diffusion Prior
by: Chen, Xiaoxu, et al.
Published: (2023)
by: Chen, Xiaoxu, et al.
Published: (2023)
Diffusion Reward: Learning Rewards via Conditional Video Diffusion
by: Huang, Tao, et al.
Published: (2023)
by: Huang, Tao, et al.
Published: (2023)
Dual Risk Minimization: Towards Next-Level Robustness in Fine-tuning Zero-Shot Models
by: Li, Kaican, et al.
Published: (2024)
by: Li, Kaican, et al.
Published: (2024)
Guiding VLM Agents with Process Rewards at Inference Time for GUI Navigation
by: Hu, Zhiyuan, et al.
Published: (2025)
by: Hu, Zhiyuan, et al.
Published: (2025)
Beyond Pairwise Preferences: Listwise Reward-Aware Alignment for Diffusion Models
by: Wang, Austin, et al.
Published: (2026)
by: Wang, Austin, et al.
Published: (2026)
Reward Shaping to Mitigate Reward Hacking in RLHF
by: Fu, Jiayi, et al.
Published: (2025)
by: Fu, Jiayi, et al.
Published: (2025)
FlowSteer: Guiding Few-Step Image Synthesis with Authentic Trajectories
by: Ke, Lei, et al.
Published: (2025)
by: Ke, Lei, et al.
Published: (2025)
Prompt-Level Reward Specifications for Open-Ended Post-Training
by: Weng, Zijun, et al.
Published: (2026)
by: Weng, Zijun, et al.
Published: (2026)
Systematic Reward Gap Optimization for Mitigating VLM Hallucinations
by: He, Lehan, et al.
Published: (2024)
by: He, Lehan, et al.
Published: (2024)
PRDP: Proximal Reward Difference Prediction for Large-Scale Reward Finetuning of Diffusion Models
by: Deng, Fei, et al.
Published: (2024)
by: Deng, Fei, et al.
Published: (2024)
Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward
by: Jia, Zhiwei, et al.
Published: (2024)
by: Jia, Zhiwei, et al.
Published: (2024)
Self-Corrected Image Generation with Explainable Latent Rewards
by: Luo, Yinyi, et al.
Published: (2026)
by: Luo, Yinyi, et al.
Published: (2026)
Prrr: Personal Random Rewards for Blockchain Reporting
by: Chen, Hongyin, et al.
Published: (2025)
by: Chen, Hongyin, et al.
Published: (2025)
LatSearch: Latent Reward-Guided Search for Faster Inference-Time Scaling in Video Diffusion
by: Zhao, Zengqun, et al.
Published: (2026)
by: Zhao, Zengqun, et al.
Published: (2026)
Scouting By Reward: VLM-TO-IRL-Driven Player Selection For Esports
by: Yan, Qing, et al.
Published: (2026)
by: Yan, Qing, et al.
Published: (2026)
Fast-dVLM: Efficient Block-Diffusion VLM via Direct Conversion from Autoregressive VLM
by: Wu, Chengyue, et al.
Published: (2026)
by: Wu, Chengyue, et al.
Published: (2026)
Video Generation Models Are Good Latent Reward Models
by: Mi, Xiaoyue, et al.
Published: (2025)
by: Mi, Xiaoyue, et al.
Published: (2025)
Self-Rewarding Sequential Monte Carlo for Masked Diffusion Language Models
by: Luo, Ziwei, et al.
Published: (2026)
by: Luo, Ziwei, et al.
Published: (2026)
Text2Reward: Reward Shaping with Language Models for Reinforcement Learning
by: Xie, Tianbao, et al.
Published: (2023)
by: Xie, Tianbao, et al.
Published: (2023)
Reward Guided Latent Consistency Distillation
by: Li, Jiachen, et al.
Published: (2024)
by: Li, Jiachen, et al.
Published: (2024)
Beyond Reward Hacking: Causal Rewards for Large Language Model Alignment
by: Wang, Chaoqi, et al.
Published: (2025)
by: Wang, Chaoqi, et al.
Published: (2025)
Exploration by Random Reward Perturbation
by: Ma, Haozhe, et al.
Published: (2025)
by: Ma, Haozhe, et al.
Published: (2025)
Reward Balancing Revisited: Enhancing Offline Reinforcement Learning for Recommender Systems
by: Shu, Wenzheng, et al.
Published: (2025)
by: Shu, Wenzheng, et al.
Published: (2025)
Diffusion Model as a Noise-Aware Latent Reward Model for Step-Level Preference Optimization
by: Zhang, Tao, et al.
Published: (2025)
by: Zhang, Tao, et al.
Published: (2025)
ProcVLM: Learning Procedure-Grounded Progress Rewards for Robotic Manipulation
by: Feng, Youhe, et al.
Published: (2026)
by: Feng, Youhe, et al.
Published: (2026)
VIVA: VLM-Guided Instruction-Based Video Editing with Reward Optimization
by: Cong, Xiaoyan, et al.
Published: (2025)
by: Cong, Xiaoyan, et al.
Published: (2025)
RewardDance: Reward Scaling in Visual Generation
by: Wu, Jie, et al.
Published: (2025)
by: Wu, Jie, et al.
Published: (2025)
MRD: Multi-resolution Retrieval-Detection Fusion for High-Resolution Image Understanding
by: Yang, Fan, et al.
Published: (2025)
by: Yang, Fan, et al.
Published: (2025)
Driving Beyond Privilege: Distilling Dense-Reward Knowledge into Sparse-Reward Policies
by: Khanzada, Feeza Khan, et al.
Published: (2025)
by: Khanzada, Feeza Khan, et al.
Published: (2025)
VLM-TDP: VLM-guided Trajectory-conditioned Diffusion Policy for Robust Long-Horizon Manipulation
by: Huang, Kefeng, et al.
Published: (2025)
by: Huang, Kefeng, et al.
Published: (2025)
Reward Prediction with Factorized World States
by: Shen, Yijun, et al.
Published: (2026)
by: Shen, Yijun, et al.
Published: (2026)
CommentScope: A Comment-Embedded Assisted Reading System for a Long Text
by: Chen, Shuai, et al.
Published: (2025)
by: Chen, Shuai, et al.
Published: (2025)
RFSR: Improving ISR Diffusion Models via Reward Feedback Learning
by: Sun, Xiaopeng, et al.
Published: (2024)
by: Sun, Xiaopeng, et al.
Published: (2024)
Aligning Few-Step Diffusion Models with Dense Reward Difference Learning
by: Zhang, Ziyi, et al.
Published: (2024)
by: Zhang, Ziyi, et al.
Published: (2024)
Reward-Augmented Decoding: Efficient Controlled Text Generation With a Unidirectional Reward Model
by: Deng, Haikang, et al.
Published: (2023)
by: Deng, Haikang, et al.
Published: (2023)
BaseReward: A Strong Baseline for Multimodal Reward Model
by: Zhang, Yi-Fan, et al.
Published: (2025)
by: Zhang, Yi-Fan, et al.
Published: (2025)
Similar Items
-
CannyEdit: Selective Canny Control and Dual-Prompt Guidance for Training-Free Image Editing
by: Xie, Weiyan, et al.
Published: (2025) -
The Dark Side of Rich Rewards: Understanding and Mitigating Noise in VLM Rewards
by: Huang, Sukai, et al.
Published: (2024) -
MB-TaylorFormer V2: Improved Multi-branch Linear Transformer Expanded by Taylor Formula for Image Restoration
by: Jin, Zhi, et al.
Published: (2025) -
From Demonstrations to Rewards: Test-Time Prompt Optimization for VLM Reward Models
by: Gumbsch, Christian, et al.
Published: (2026) -
Towards Real-World Blind Face Restoration with Generative Diffusion Prior
by: Chen, Xiaoxu, et al.
Published: (2023)