MARBLE: Multi-Aspect Reward Balance for Diffusion RL
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhao, Canyu, Chen, Hao, Tong, Yunze, Qiao, Yu, Li, Jiacheng, Shen, Chunhua |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Tinker: Diffusion's Gift to 3D--Multi-View Consistent Editing From Sparse Inputs without Per-Scene Optimization
par: Zhao, Canyu, et autres
Publié: (2025)
par: Zhao, Canyu, et autres
Publié: (2025)
Noise Projection: Closing the Prompt-Agnostic Gap Behind Text-to-Image Misalignment in Diffusion Models
par: Tong, Yunze, et autres
Publié: (2025)
par: Tong, Yunze, et autres
Publié: (2025)
On the Trajectory Regularity of ODE-based Diffusion Sampling
par: Chen, Defang, et autres
Publié: (2024)
par: Chen, Defang, et autres
Publié: (2024)
A Geometric Perspective on Diffusion Models
par: Chen, Defang, et autres
Publié: (2023)
par: Chen, Defang, et autres
Publié: (2023)
GDRO: Group-level Reward Post-training Suitable for Diffusion Models
par: Wang, Yiyang, et autres
Publié: (2026)
par: Wang, Yiyang, et autres
Publié: (2026)
MMControl: Unified Multi-Modal Control for Joint Audio-Video Generation
par: Li, Liyang, et autres
Publié: (2026)
par: Li, Liyang, et autres
Publié: (2026)
Carve3D: Improving Multi-view Reconstruction Consistency for Diffusion Models with RL Finetuning
par: Xie, Desai, et autres
Publié: (2023)
par: Xie, Desai, et autres
Publié: (2023)
DICEPTION: A Generalist Diffusion Model for Visual Perceptual Tasks
par: Zhao, Canyu, et autres
Publié: (2025)
par: Zhao, Canyu, et autres
Publié: (2025)
Diff-Instruct with Diffused Reward: Towards Principled One-step Generator RL
par: Wu, Junyi, et autres
Publié: (2026)
par: Wu, Junyi, et autres
Publié: (2026)
LoRAPrune: Structured Pruning Meets Low-Rank Parameter-Efficient Fine-Tuning
par: Zhang, Mingyang, et autres
Publié: (2023)
par: Zhang, Mingyang, et autres
Publié: (2023)
RL-Selector: Reinforcement Learning-Guided Data Selection via Redundancy Assessment
par: Yang, Suorong, et autres
Publié: (2025)
par: Yang, Suorong, et autres
Publié: (2025)
Aligning Few-Step Diffusion Models with Dense Reward Difference Learning
par: Zhang, Ziyi, et autres
Publié: (2024)
par: Zhang, Ziyi, et autres
Publié: (2024)
FreeCustom: Tuning-Free Customized Image Generation for Multi-Concept Composition
par: Ding, Ganggui, et autres
Publié: (2024)
par: Ding, Ganggui, et autres
Publié: (2024)
Diffusion Reward: Learning Rewards via Conditional Video Diffusion
par: Huang, Tao, et autres
Publié: (2023)
par: Huang, Tao, et autres
Publié: (2023)
MJ-Bench: Is Your Multimodal Reward Model Really a Good Judge for Text-to-Image Generation?
par: Chen, Zhaorun, et autres
Publié: (2024)
par: Chen, Zhaorun, et autres
Publié: (2024)
Exploring 3D Dataset Pruning
par: Zhao, Xiaohan, et autres
Publié: (2026)
par: Zhao, Xiaohan, et autres
Publié: (2026)
RLAnything: Forge Environment, Policy, and Reward Model in Completely Dynamic RL System
par: Wang, Yinjie, et autres
Publié: (2026)
par: Wang, Yinjie, et autres
Publié: (2026)
Generalization of Diffusion Models Arises with a Balanced Representation Space
par: Zhang, Zekai, et autres
Publié: (2025)
par: Zhang, Zekai, et autres
Publié: (2025)
Towards Better Alignment: Training Diffusion Models with Reinforcement Learning Against Sparse Rewards
par: Hu, Zijing, et autres
Publié: (2025)
par: Hu, Zijing, et autres
Publié: (2025)
BiGain: Unified Token Compression for Joint Generation and Classification
par: Liu, Jiacheng, et autres
Publié: (2026)
par: Liu, Jiacheng, et autres
Publié: (2026)
Directly Fine-Tuning Diffusion Models on Differentiable Rewards
par: Clark, Kevin, et autres
Publié: (2023)
par: Clark, Kevin, et autres
Publié: (2023)
FOD-Diff: 3D Multi-Channel Patch Diffusion Model for Fiber Orientation Distribution
par: Tang, Hao, et autres
Publié: (2025)
par: Tang, Hao, et autres
Publié: (2025)
SoliReward: Mitigating Susceptibility to Reward Hacking and Annotation Noise in Video Generation Reward Models
par: Lian, Jiesong, et autres
Publié: (2025)
par: Lian, Jiesong, et autres
Publié: (2025)
Auto MC-Reward: Automated Dense Reward Design with Large Language Models for Minecraft
par: Li, Hao, et autres
Publié: (2023)
par: Li, Hao, et autres
Publié: (2023)
Using Human Feedback to Fine-tune Diffusion Models without Any Reward Model
par: Yang, Kai, et autres
Publié: (2023)
par: Yang, Kai, et autres
Publié: (2023)
Enhancing Medical Image Segmentation with Deep Learning and Diffusion Models
par: Liu, Houze, et autres
Publié: (2024)
par: Liu, Houze, et autres
Publié: (2024)
OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents
par: Yang, Rui, et autres
Publié: (2026)
par: Yang, Rui, et autres
Publié: (2026)
PromptRL: Prompt Matters in RL for Flow-Based Image Generation
par: Wang, Fu-Yun, et autres
Publié: (2026)
par: Wang, Fu-Yun, et autres
Publié: (2026)
Learning an Efficient Optimizer via Hybrid-Policy Sub-Trajectory Balance
par: Guan, Yunchuan, et autres
Publié: (2025)
par: Guan, Yunchuan, et autres
Publié: (2025)
Pixel-wise RL on Diffusion Models: Reinforcement Learning from Rich Feedback
par: Kordzanganeh, Mo, et autres
Publié: (2024)
par: Kordzanganeh, Mo, et autres
Publié: (2024)
VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL
par: Dai, Fengyuan, et autres
Publié: (2025)
par: Dai, Fengyuan, et autres
Publié: (2025)
FuRL: Visual-Language Models as Fuzzy Rewards for Reinforcement Learning
par: Fu, Yuwei, et autres
Publié: (2024)
par: Fu, Yuwei, et autres
Publié: (2024)
RL for Consistency Models: Faster Reward Guided Text-to-Image Generation
par: Oertell, Owen, et autres
Publié: (2024)
par: Oertell, Owen, et autres
Publié: (2024)
Adaptive Transformer Attention and Multi-Scale Fusion for Spine 3D Segmentation
par: Xiang, Yanlin, et autres
Publié: (2025)
par: Xiang, Yanlin, et autres
Publié: (2025)
Mitigating Accuracy-Robustness Trade-off via Balanced Multi-Teacher Adversarial Distillation
par: Zhao, Shiji, et autres
Publié: (2023)
par: Zhao, Shiji, et autres
Publié: (2023)
DiffPattern-Flex: Efficient Layout Pattern Generation via Discrete Diffusion
par: Wang, Zixiao, et autres
Publié: (2025)
par: Wang, Zixiao, et autres
Publié: (2025)
Modality-Balanced Collaborative Distillation for Multi-Modal Domain Generalization
par: Wang, Xiaohan, et autres
Publié: (2025)
par: Wang, Xiaohan, et autres
Publié: (2025)
Beyond Pairwise Preferences: Listwise Reward-Aware Alignment for Diffusion Models
par: Wang, Austin, et autres
Publié: (2026)
par: Wang, Austin, et autres
Publié: (2026)
ParetoSlider: Diffusion Models Post-Training for Continuous Reward Control
par: Golan, Shelly, et autres
Publié: (2026)
par: Golan, Shelly, et autres
Publié: (2026)
Balancing Multimodal Domain Generalization via Gradient Modulation and Projection
par: Li, Hongzhao, et autres
Publié: (2026)
par: Li, Hongzhao, et autres
Publié: (2026)
Documents similaires
-
Tinker: Diffusion's Gift to 3D--Multi-View Consistent Editing From Sparse Inputs without Per-Scene Optimization
par: Zhao, Canyu, et autres
Publié: (2025) -
Noise Projection: Closing the Prompt-Agnostic Gap Behind Text-to-Image Misalignment in Diffusion Models
par: Tong, Yunze, et autres
Publié: (2025) -
On the Trajectory Regularity of ODE-based Diffusion Sampling
par: Chen, Defang, et autres
Publié: (2024) -
A Geometric Perspective on Diffusion Models
par: Chen, Defang, et autres
Publié: (2023) -
GDRO: Group-level Reward Post-training Suitable for Diffusion Models
par: Wang, Yiyang, et autres
Publié: (2026)