Aligning Diffusion Language Models via Unpaired Preference Optimization
Fuente:
arXiv
Guardado en:
| Autores principales: | Jindal, Vaibhav, Sang, Hejian, Lai, Chun-Mao, Chen, Yanning, Wang, Zhipeng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Debunk the Myth of SFT Generalization
por: Lin, Xiaofeng, et al.
Publicado: (2025)
por: Lin, Xiaofeng, et al.
Publicado: (2025)
Beyond GRPO and On-Policy Distillation: An Empirical Sparse-to-Dense Reward Principle for Language-Model Post-Training
por: Xu, Yuanda, et al.
Publicado: (2026)
por: Xu, Yuanda, et al.
Publicado: (2026)
Overconfident Errors Need Stronger Correction: Asymmetric Confidence Penalties for Reinforcement Learning
por: Xu, Yuanda, et al.
Publicado: (2026)
por: Xu, Yuanda, et al.
Publicado: (2026)
PACED: Distillation and On-Policy Self-Distillation at the Frontier of Student Competence
por: Xu, Yuanda, et al.
Publicado: (2026)
por: Xu, Yuanda, et al.
Publicado: (2026)
Not all tokens are needed(NAT): token efficient reinforcement learning
por: Sang, Hejian, et al.
Publicado: (2026)
por: Sang, Hejian, et al.
Publicado: (2026)
SIPO: Stabilized and Improved Preference Optimization for Aligning Diffusion Models
por: Yang, Xiaomeng, et al.
Publicado: (2025)
por: Yang, Xiaomeng, et al.
Publicado: (2025)
TIP: Token Importance in On-Policy Distillation
por: Xu, Yuanda, et al.
Publicado: (2026)
por: Xu, Yuanda, et al.
Publicado: (2026)
Soft Preference Optimization: Aligning Language Models to Expert Distributions
por: Sharifnassab, Arsalan, et al.
Publicado: (2024)
por: Sharifnassab, Arsalan, et al.
Publicado: (2024)
Scaling In-Context Online Learning Capability of LLMs via Cross-Episode Meta-RL
por: Lin, Xiaofeng, et al.
Publicado: (2026)
por: Lin, Xiaofeng, et al.
Publicado: (2026)
Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization
por: Nguyen, Thanh Thi, et al.
Publicado: (2025)
por: Nguyen, Thanh Thi, et al.
Publicado: (2025)
Diffusion Model-Augmented Behavioral Cloning
por: Chen, Shang-Fu, et al.
Publicado: (2023)
por: Chen, Shang-Fu, et al.
Publicado: (2023)
Aligning CodeLLMs with Direct Preference Optimization
por: Miao, Yibo, et al.
Publicado: (2024)
por: Miao, Yibo, et al.
Publicado: (2024)
LifeAlign: Lifelong Alignment for Large Language Models with Memory-Augmented Focalized Preference Optimization
por: Li, Junsong, et al.
Publicado: (2025)
por: Li, Junsong, et al.
Publicado: (2025)
Comparing Bad Apples to Good Oranges: Aligning Large Language Models via Joint Preference Optimization
por: Bansal, Hritik, et al.
Publicado: (2024)
por: Bansal, Hritik, et al.
Publicado: (2024)
Directly Aligning the Full Diffusion Trajectory with Fine-Grained Human Preference
por: Shen, Xiangwei, et al.
Publicado: (2025)
por: Shen, Xiangwei, et al.
Publicado: (2025)
ALaRM: Align Language Models via Hierarchical Rewards Modeling
por: Lai, Yuhang, et al.
Publicado: (2024)
por: Lai, Yuhang, et al.
Publicado: (2024)
Diffusion-Reward Adversarial Imitation Learning
por: Lai, Chun-Mao, et al.
Publicado: (2024)
por: Lai, Chun-Mao, et al.
Publicado: (2024)
Automated Filtering of Human Feedback Data for Aligning Text-to-Image Diffusion Models
por: Yang, Yongjin, et al.
Publicado: (2024)
por: Yang, Yongjin, et al.
Publicado: (2024)
From Noisy Traces to Stable Gradients: Bias-Variance Optimized Preference Optimization for Aligning Large Reasoning Models
por: Zhu, Mingkang, et al.
Publicado: (2025)
por: Zhu, Mingkang, et al.
Publicado: (2025)
Bootstrapping LLMs via Preference-Based Policy Optimization
por: Jia, Chen
Publicado: (2025)
por: Jia, Chen
Publicado: (2025)
Preferred-Action-Optimized Diffusion Policies for Offline Reinforcement Learning
por: Zhang, Tianle, et al.
Publicado: (2024)
por: Zhang, Tianle, et al.
Publicado: (2024)
ROPO: Robust Preference Optimization for Large Language Models
por: Liang, Xize, et al.
Publicado: (2024)
por: Liang, Xize, et al.
Publicado: (2024)
Explainable Molecular Property Prediction: Aligning Chemical Concepts with Predictions via Language Models
por: Wang, Zhenzhong, et al.
Publicado: (2024)
por: Wang, Zhenzhong, et al.
Publicado: (2024)
Preference-Guided Diffusion for Multi-Objective Offline Optimization
por: Annadani, Yashas, et al.
Publicado: (2025)
por: Annadani, Yashas, et al.
Publicado: (2025)
Scaffold-Conditioned Preference Triplets for Controllable Molecular Optimization with Large Language Models
por: Xiong, Yi, et al.
Publicado: (2026)
por: Xiong, Yi, et al.
Publicado: (2026)
Align2Speak: Improving TTS for Low Resource Languages via ASR-Guided Online Preference Optimization
por: Hussain, Shehzeen, et al.
Publicado: (2025)
por: Hussain, Shehzeen, et al.
Publicado: (2025)
Structure-Aligned Protein Language Model
por: Chen, Can, et al.
Publicado: (2025)
por: Chen, Can, et al.
Publicado: (2025)
Aligning with Human Judgement: The Role of Pairwise Preference in Large Language Model Evaluators
por: Liu, Yinhong, et al.
Publicado: (2024)
por: Liu, Yinhong, et al.
Publicado: (2024)
Peering Through Preferences: Unraveling Feedback Acquisition for Aligning Large Language Models
por: Bansal, Hritik, et al.
Publicado: (2023)
por: Bansal, Hritik, et al.
Publicado: (2023)
CodecLM: Aligning Language Models with Tailored Synthetic Data
por: Wang, Zifeng, et al.
Publicado: (2024)
por: Wang, Zifeng, et al.
Publicado: (2024)
AlignedCoT: Prompting Large Language Models via Native-Speaking Demonstrations
por: Yang, Zhicheng, et al.
Publicado: (2023)
por: Yang, Zhicheng, et al.
Publicado: (2023)
CATP-LLM: Empowering Large Language Models for Cost-Aware Tool Planning
por: Wu, Duo, et al.
Publicado: (2024)
por: Wu, Duo, et al.
Publicado: (2024)
Prompt Optimization Via Diffusion Language Models
por: Wang, Shiyu, et al.
Publicado: (2026)
por: Wang, Shiyu, et al.
Publicado: (2026)
VAO: Validation-Aligned Optimization for Cross-Task Generative Auto-Bidding
por: Lv, Yiqin, et al.
Publicado: (2025)
por: Lv, Yiqin, et al.
Publicado: (2025)
Beyond Pairs: Your Language Model is Secretly Optimizing a Preference Graph
por: Liu, Ning, et al.
Publicado: (2026)
por: Liu, Ning, et al.
Publicado: (2026)
Thinking Preference Optimization
por: Yang, Wang, et al.
Publicado: (2025)
por: Yang, Wang, et al.
Publicado: (2025)
Preference-Based Alignment of Discrete Diffusion Models
por: Borso, Umberto, et al.
Publicado: (2025)
por: Borso, Umberto, et al.
Publicado: (2025)
Radiology Report Generation via Multi-objective Preference Optimization
por: Xiao, Ting, et al.
Publicado: (2024)
por: Xiao, Ting, et al.
Publicado: (2024)
MMedPO: Aligning Medical Vision-Language Models with Clinical-Aware Multimodal Preference Optimization
por: Zhu, Kangyu, et al.
Publicado: (2024)
por: Zhu, Kangyu, et al.
Publicado: (2024)
$ξ$-DPO: Direct Preference Optimization via Ratio Reward Margin
por: Fan, Zhengyuan, et al.
Publicado: (2026)
por: Fan, Zhengyuan, et al.
Publicado: (2026)
Ejemplares similares
-
Debunk the Myth of SFT Generalization
por: Lin, Xiaofeng, et al.
Publicado: (2025) -
Beyond GRPO and On-Policy Distillation: An Empirical Sparse-to-Dense Reward Principle for Language-Model Post-Training
por: Xu, Yuanda, et al.
Publicado: (2026) -
Overconfident Errors Need Stronger Correction: Asymmetric Confidence Penalties for Reinforcement Learning
por: Xu, Yuanda, et al.
Publicado: (2026) -
PACED: Distillation and On-Policy Self-Distillation at the Frontier of Student Competence
por: Xu, Yuanda, et al.
Publicado: (2026) -
Not all tokens are needed(NAT): token efficient reinforcement learning
por: Sang, Hejian, et al.
Publicado: (2026)