Gespeichert in:
| Hauptverfasser: | Liu, Gongye, Yang, Bo, Zhi, Yida, Zhong, Zhizhou, Ke, Lei, Deng, Didan, Gao, Han, Huang, Yongxiang, Zhang, Kaihao, Fu, Hongbo, Luo, Wenhan |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | https://arxiv.org/abs/2602.11146 |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
CannyEdit: Selective Canny Control and Dual-Prompt Guidance for Training-Free Image Editing
von: Xie, Weiyan, et al.
Veröffentlicht: (2025)
von: Xie, Weiyan, et al.
Veröffentlicht: (2025)
The Dark Side of Rich Rewards: Understanding and Mitigating Noise in VLM Rewards
von: Huang, Sukai, et al.
Veröffentlicht: (2024)
von: Huang, Sukai, et al.
Veröffentlicht: (2024)
MB-TaylorFormer V2: Improved Multi-branch Linear Transformer Expanded by Taylor Formula for Image Restoration
von: Jin, Zhi, et al.
Veröffentlicht: (2025)
von: Jin, Zhi, et al.
Veröffentlicht: (2025)
From Demonstrations to Rewards: Test-Time Prompt Optimization for VLM Reward Models
von: Gumbsch, Christian, et al.
Veröffentlicht: (2026)
von: Gumbsch, Christian, et al.
Veröffentlicht: (2026)
Towards Real-World Blind Face Restoration with Generative Diffusion Prior
von: Chen, Xiaoxu, et al.
Veröffentlicht: (2023)
von: Chen, Xiaoxu, et al.
Veröffentlicht: (2023)
Diffusion Reward: Learning Rewards via Conditional Video Diffusion
von: Huang, Tao, et al.
Veröffentlicht: (2023)
von: Huang, Tao, et al.
Veröffentlicht: (2023)
Dual Risk Minimization: Towards Next-Level Robustness in Fine-tuning Zero-Shot Models
von: Li, Kaican, et al.
Veröffentlicht: (2024)
von: Li, Kaican, et al.
Veröffentlicht: (2024)
Guiding VLM Agents with Process Rewards at Inference Time for GUI Navigation
von: Hu, Zhiyuan, et al.
Veröffentlicht: (2025)
von: Hu, Zhiyuan, et al.
Veröffentlicht: (2025)
Beyond Pairwise Preferences: Listwise Reward-Aware Alignment for Diffusion Models
von: Wang, Austin, et al.
Veröffentlicht: (2026)
von: Wang, Austin, et al.
Veröffentlicht: (2026)
Reward Shaping to Mitigate Reward Hacking in RLHF
von: Fu, Jiayi, et al.
Veröffentlicht: (2025)
von: Fu, Jiayi, et al.
Veröffentlicht: (2025)
FlowSteer: Guiding Few-Step Image Synthesis with Authentic Trajectories
von: Ke, Lei, et al.
Veröffentlicht: (2025)
von: Ke, Lei, et al.
Veröffentlicht: (2025)
Prompt-Level Reward Specifications for Open-Ended Post-Training
von: Weng, Zijun, et al.
Veröffentlicht: (2026)
von: Weng, Zijun, et al.
Veröffentlicht: (2026)
Systematic Reward Gap Optimization for Mitigating VLM Hallucinations
von: He, Lehan, et al.
Veröffentlicht: (2024)
von: He, Lehan, et al.
Veröffentlicht: (2024)
PRDP: Proximal Reward Difference Prediction for Large-Scale Reward Finetuning of Diffusion Models
von: Deng, Fei, et al.
Veröffentlicht: (2024)
von: Deng, Fei, et al.
Veröffentlicht: (2024)
Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward
von: Jia, Zhiwei, et al.
Veröffentlicht: (2024)
von: Jia, Zhiwei, et al.
Veröffentlicht: (2024)
Self-Corrected Image Generation with Explainable Latent Rewards
von: Luo, Yinyi, et al.
Veröffentlicht: (2026)
von: Luo, Yinyi, et al.
Veröffentlicht: (2026)
Prrr: Personal Random Rewards for Blockchain Reporting
von: Chen, Hongyin, et al.
Veröffentlicht: (2025)
von: Chen, Hongyin, et al.
Veröffentlicht: (2025)
LatSearch: Latent Reward-Guided Search for Faster Inference-Time Scaling in Video Diffusion
von: Zhao, Zengqun, et al.
Veröffentlicht: (2026)
von: Zhao, Zengqun, et al.
Veröffentlicht: (2026)
Scouting By Reward: VLM-TO-IRL-Driven Player Selection For Esports
von: Yan, Qing, et al.
Veröffentlicht: (2026)
von: Yan, Qing, et al.
Veröffentlicht: (2026)
Fast-dVLM: Efficient Block-Diffusion VLM via Direct Conversion from Autoregressive VLM
von: Wu, Chengyue, et al.
Veröffentlicht: (2026)
von: Wu, Chengyue, et al.
Veröffentlicht: (2026)
Video Generation Models Are Good Latent Reward Models
von: Mi, Xiaoyue, et al.
Veröffentlicht: (2025)
von: Mi, Xiaoyue, et al.
Veröffentlicht: (2025)
Self-Rewarding Sequential Monte Carlo for Masked Diffusion Language Models
von: Luo, Ziwei, et al.
Veröffentlicht: (2026)
von: Luo, Ziwei, et al.
Veröffentlicht: (2026)
Text2Reward: Reward Shaping with Language Models for Reinforcement Learning
von: Xie, Tianbao, et al.
Veröffentlicht: (2023)
von: Xie, Tianbao, et al.
Veröffentlicht: (2023)
Reward Guided Latent Consistency Distillation
von: Li, Jiachen, et al.
Veröffentlicht: (2024)
von: Li, Jiachen, et al.
Veröffentlicht: (2024)
Beyond Reward Hacking: Causal Rewards for Large Language Model Alignment
von: Wang, Chaoqi, et al.
Veröffentlicht: (2025)
von: Wang, Chaoqi, et al.
Veröffentlicht: (2025)
Exploration by Random Reward Perturbation
von: Ma, Haozhe, et al.
Veröffentlicht: (2025)
von: Ma, Haozhe, et al.
Veröffentlicht: (2025)
Reward Balancing Revisited: Enhancing Offline Reinforcement Learning for Recommender Systems
von: Shu, Wenzheng, et al.
Veröffentlicht: (2025)
von: Shu, Wenzheng, et al.
Veröffentlicht: (2025)
Diffusion Model as a Noise-Aware Latent Reward Model for Step-Level Preference Optimization
von: Zhang, Tao, et al.
Veröffentlicht: (2025)
von: Zhang, Tao, et al.
Veröffentlicht: (2025)
ProcVLM: Learning Procedure-Grounded Progress Rewards for Robotic Manipulation
von: Feng, Youhe, et al.
Veröffentlicht: (2026)
von: Feng, Youhe, et al.
Veröffentlicht: (2026)
VIVA: VLM-Guided Instruction-Based Video Editing with Reward Optimization
von: Cong, Xiaoyan, et al.
Veröffentlicht: (2025)
von: Cong, Xiaoyan, et al.
Veröffentlicht: (2025)
RewardDance: Reward Scaling in Visual Generation
von: Wu, Jie, et al.
Veröffentlicht: (2025)
von: Wu, Jie, et al.
Veröffentlicht: (2025)
MRD: Multi-resolution Retrieval-Detection Fusion for High-Resolution Image Understanding
von: Yang, Fan, et al.
Veröffentlicht: (2025)
von: Yang, Fan, et al.
Veröffentlicht: (2025)
Driving Beyond Privilege: Distilling Dense-Reward Knowledge into Sparse-Reward Policies
von: Khanzada, Feeza Khan, et al.
Veröffentlicht: (2025)
von: Khanzada, Feeza Khan, et al.
Veröffentlicht: (2025)
VLM-TDP: VLM-guided Trajectory-conditioned Diffusion Policy for Robust Long-Horizon Manipulation
von: Huang, Kefeng, et al.
Veröffentlicht: (2025)
von: Huang, Kefeng, et al.
Veröffentlicht: (2025)
Reward Prediction with Factorized World States
von: Shen, Yijun, et al.
Veröffentlicht: (2026)
von: Shen, Yijun, et al.
Veröffentlicht: (2026)
CommentScope: A Comment-Embedded Assisted Reading System for a Long Text
von: Chen, Shuai, et al.
Veröffentlicht: (2025)
von: Chen, Shuai, et al.
Veröffentlicht: (2025)
RFSR: Improving ISR Diffusion Models via Reward Feedback Learning
von: Sun, Xiaopeng, et al.
Veröffentlicht: (2024)
von: Sun, Xiaopeng, et al.
Veröffentlicht: (2024)
Aligning Few-Step Diffusion Models with Dense Reward Difference Learning
von: Zhang, Ziyi, et al.
Veröffentlicht: (2024)
von: Zhang, Ziyi, et al.
Veröffentlicht: (2024)
Reward-Augmented Decoding: Efficient Controlled Text Generation With a Unidirectional Reward Model
von: Deng, Haikang, et al.
Veröffentlicht: (2023)
von: Deng, Haikang, et al.
Veröffentlicht: (2023)
BaseReward: A Strong Baseline for Multimodal Reward Model
von: Zhang, Yi-Fan, et al.
Veröffentlicht: (2025)
von: Zhang, Yi-Fan, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
CannyEdit: Selective Canny Control and Dual-Prompt Guidance for Training-Free Image Editing
von: Xie, Weiyan, et al.
Veröffentlicht: (2025) -
The Dark Side of Rich Rewards: Understanding and Mitigating Noise in VLM Rewards
von: Huang, Sukai, et al.
Veröffentlicht: (2024) -
MB-TaylorFormer V2: Improved Multi-branch Linear Transformer Expanded by Taylor Formula for Image Restoration
von: Jin, Zhi, et al.
Veröffentlicht: (2025) -
From Demonstrations to Rewards: Test-Time Prompt Optimization for VLM Reward Models
von: Gumbsch, Christian, et al.
Veröffentlicht: (2026) -
Towards Real-World Blind Face Restoration with Generative Diffusion Prior
von: Chen, Xiaoxu, et al.
Veröffentlicht: (2023)