Confidence-aware Reward Optimization for Fine-tuning Text-to-Image Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Kim, Kyuyoung, Jeong, Jongheon, An, Minyong, Ghavamzadeh, Mohammad, Dvijotham, Krishnamurthy, Shin, Jinwoo, Lee, Kimin |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Confidence-aware Denoised Fine-tuning of Off-the-shelf Models for Certified Robustness
por: Jang, Suhyeok, et al.
Publicado: (2024)
por: Jang, Suhyeok, et al.
Publicado: (2024)
StarFT: Robust Fine-tuning of Zero-shot Models via Spuriosity Alignment
por: Kim, Younghyun, et al.
Publicado: (2025)
por: Kim, Younghyun, et al.
Publicado: (2025)
DiffExp: Efficient Exploration in Reward Fine-tuning for Text-to-Image Diffusion Models
por: Chae, Daewon, et al.
Publicado: (2025)
por: Chae, Daewon, et al.
Publicado: (2025)
Spread Preference Annotation: Direct Preference Judgment for Efficient LLM Alignment
por: Kim, Dongyoung, et al.
Publicado: (2024)
por: Kim, Dongyoung, et al.
Publicado: (2024)
Optimized Feature Generation for Tabular Data via LLMs with Decision Tree Reasoning
por: Nam, Jaehyun, et al.
Publicado: (2024)
por: Nam, Jaehyun, et al.
Publicado: (2024)
Safety Alignment Backfires: Preventing the Re-emergence of Suppressed Concepts in Fine-tuned Text-to-Image Diffusion Models
por: Kim, Sanghyun, et al.
Publicado: (2024)
por: Kim, Sanghyun, et al.
Publicado: (2024)
Subtask-Aware Visual Reward Learning from Segmented Demonstrations
por: Kim, Changyeon, et al.
Publicado: (2025)
por: Kim, Changyeon, et al.
Publicado: (2025)
Learning from the Undesirable: Robust Adaptation of Language Models without Forgetting
por: Nam, Yunhun, et al.
Publicado: (2025)
por: Nam, Yunhun, et al.
Publicado: (2025)
RedacBench: Can AI Erase Your Secrets?
por: Jeon, Hyunjun, et al.
Publicado: (2026)
por: Jeon, Hyunjun, et al.
Publicado: (2026)
Adversarial Robustification via Text-to-Image Diffusion Models
por: Choi, Daewon, et al.
Publicado: (2024)
por: Choi, Daewon, et al.
Publicado: (2024)
Achieving the Tightest Relaxation of Sigmoids for Formal Verification
por: Chevalier, Samuel, et al.
Publicado: (2024)
por: Chevalier, Samuel, et al.
Publicado: (2024)
Beyond Binary Preferences: A Principled Framework for Reward Modeling with Ordinal Feedback
por: Afsharrad, Amirhossein, et al.
Publicado: (2026)
por: Afsharrad, Amirhossein, et al.
Publicado: (2026)
Margin Matching Preference Optimization: Enhanced Model Alignment with Granular Feedback
por: Kim, Kyuyoung, et al.
Publicado: (2024)
por: Kim, Kyuyoung, et al.
Publicado: (2024)
Benchmarking Mobile Device Control Agents across Diverse Configurations
por: Lee, Juyong, et al.
Publicado: (2024)
por: Lee, Juyong, et al.
Publicado: (2024)
Reward Score Matching: Unifying Reward-based Fine-tuning for Flow and Diffusion Models
por: Lee, Jeongjae, et al.
Publicado: (2026)
por: Lee, Jeongjae, et al.
Publicado: (2026)
Automated Filtering of Human Feedback Data for Aligning Text-to-Image Diffusion Models
por: Yang, Yongjin, et al.
Publicado: (2024)
por: Yang, Yongjin, et al.
Publicado: (2024)
A Minimalist Method for Fine-tuning Text-to-Image Diffusion Models
por: Miao, Yanting, et al.
Publicado: (2025)
por: Miao, Yanting, et al.
Publicado: (2025)
Scalable and Robust LLM Unlearning by Correcting Responses with Retrieved Exclusions
por: Kim, Junbeom, et al.
Publicado: (2025)
por: Kim, Junbeom, et al.
Publicado: (2025)
Preference Optimization via Contrastive Divergence: Your Reward Model is Secretly an NLL Estimator
por: Chen, Zhuotong, et al.
Publicado: (2025)
por: Chen, Zhuotong, et al.
Publicado: (2025)
Conservative Contextual Bandits: Beyond Linear Representations
por: Deb, Rohan, et al.
Publicado: (2024)
por: Deb, Rohan, et al.
Publicado: (2024)
Fine-tuning Language Models with Generative Adversarial Reward Modelling
por: Yu, Zhang Ze, et al.
Publicado: (2023)
por: Yu, Zhang Ze, et al.
Publicado: (2023)
Self-Refining Language Model Anonymizers via Adversarial Distillation
por: Kim, Kyuyoung, et al.
Publicado: (2025)
por: Kim, Kyuyoung, et al.
Publicado: (2025)
Enhancing Variational Autoencoders with Smooth Robust Latent Encoding
por: Lee, Hyomin, et al.
Publicado: (2025)
por: Lee, Hyomin, et al.
Publicado: (2025)
Unintended Misalignment from Agentic Fine-Tuning: Risks and Mitigation
por: Hahm, Dongyoon, et al.
Publicado: (2025)
por: Hahm, Dongyoon, et al.
Publicado: (2025)
Adversarial Reinforcement Learning Framework for ESP Cheater Simulation
por: Park, Inkyu, et al.
Publicado: (2025)
por: Park, Inkyu, et al.
Publicado: (2025)
Rethinking Safety in LLM Fine-tuning: An Optimization Perspective
por: Kim, Minseon, et al.
Publicado: (2025)
por: Kim, Minseon, et al.
Publicado: (2025)
Learning to Receive Help: Intervention-Aware Concept Embedding Models
por: Zarlenga, Mateo Espinosa, et al.
Publicado: (2023)
por: Zarlenga, Mateo Espinosa, et al.
Publicado: (2023)
No, of Course I Can! Deeper Fine-Tuning Attacks That Bypass Token-Level Safety Mechanisms
por: Kazdan, Joshua, et al.
Publicado: (2025)
por: Kazdan, Joshua, et al.
Publicado: (2025)
Provably Bounding Neural Network Preimages
por: Kotha, Suhas, et al.
Publicado: (2023)
por: Kotha, Suhas, et al.
Publicado: (2023)
Verified Neural Compressed Sensing
por: Bunel, Rudy, et al.
Publicado: (2024)
por: Bunel, Rudy, et al.
Publicado: (2024)
Reward Sharpness-Aware Fine-Tuning for Diffusion Models
por: Kim, Kwanyoung, et al.
Publicado: (2026)
por: Kim, Kwanyoung, et al.
Publicado: (2026)
Alignment Tampering: How Reinforcement Learning from Human Feedback Is Exploited to Optimize Misaligned Biases
por: Hahm, Dongyoon, et al.
Publicado: (2026)
por: Hahm, Dongyoon, et al.
Publicado: (2026)
Adaptive Divergence Regularized Policy Optimization for Fine-tuning Generative Models
por: Fan, Jiajun, et al.
Publicado: (2025)
por: Fan, Jiajun, et al.
Publicado: (2025)
SASSHA: Sharpness-aware Adaptive Second-order Optimization with Stable Hessian Approximation
por: Shin, Dahun, et al.
Publicado: (2025)
por: Shin, Dahun, et al.
Publicado: (2025)
Debiasing Online Preference Learning via Preference Feature Preservation
por: Kim, Dongyoung, et al.
Publicado: (2025)
por: Kim, Dongyoung, et al.
Publicado: (2025)
Verifier-free Test-Time Sampling for Vision Language Action Models
por: Jang, Suhyeok, et al.
Publicado: (2025)
por: Jang, Suhyeok, et al.
Publicado: (2025)
Trust Region Q Adjoint Matching
por: Dong, Yonghoon, et al.
Publicado: (2026)
por: Dong, Yonghoon, et al.
Publicado: (2026)
RASR: Risk-Averse Soft-Robust MDPs with EVaR and Entropic Risk
por: Hau, Jia Lin, et al.
Publicado: (2022)
por: Hau, Jia Lin, et al.
Publicado: (2022)
Safeguard Text-to-Image Diffusion Models with Human Feedback Inversion
por: Kim, Sanghyun, et al.
Publicado: (2024)
por: Kim, Sanghyun, et al.
Publicado: (2024)
Lookahead Sample Reward Guidance for Test-Time Scaling of Diffusion Models
por: Kim, Yeongmin, et al.
Publicado: (2026)
por: Kim, Yeongmin, et al.
Publicado: (2026)
Ejemplares similares
-
Confidence-aware Denoised Fine-tuning of Off-the-shelf Models for Certified Robustness
por: Jang, Suhyeok, et al.
Publicado: (2024) -
StarFT: Robust Fine-tuning of Zero-shot Models via Spuriosity Alignment
por: Kim, Younghyun, et al.
Publicado: (2025) -
DiffExp: Efficient Exploration in Reward Fine-tuning for Text-to-Image Diffusion Models
por: Chae, Daewon, et al.
Publicado: (2025) -
Spread Preference Annotation: Direct Preference Judgment for Efficient LLM Alignment
por: Kim, Dongyoung, et al.
Publicado: (2024) -
Optimized Feature Generation for Tabular Data via LLMs with Decision Tree Reasoning
por: Nam, Jaehyun, et al.
Publicado: (2024)