GroupDPO: Memory efficient Group-wise Direct Preference Optimization
Fuente:
arXiv
Guardado en:
| Autores principales: | Leng, Jixuan, Si, Si, Yu, Hsiang-Fu, Raman, Vinod, Dhillon, Inderjit S. |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
DPO-Shift: Shifting the Distribution of Direct Preference Optimization
por: Yang, Xiliang, et al.
Publicado: (2025)
por: Yang, Xiliang, et al.
Publicado: (2025)
Large Language Models are Interpretable Learners
por: Wang, Ruochen, et al.
Publicado: (2024)
por: Wang, Ruochen, et al.
Publicado: (2024)
Full-Step-DPO: Self-Supervised Preference Optimization with Step-wise Rewards for Mathematical Reasoning
por: Xu, Huimin, et al.
Publicado: (2025)
por: Xu, Huimin, et al.
Publicado: (2025)
MCM-DPO: Multifaceted Cross-Modal Direct Preference Optimization for Alt-text Generation
por: Fu, Jinlan, et al.
Publicado: (2025)
por: Fu, Jinlan, et al.
Publicado: (2025)
LoRA Done RITE: Robust Invariant Transformation Equilibration for LoRA Optimization
por: Yen, Jui-Nan, et al.
Publicado: (2024)
por: Yen, Jui-Nan, et al.
Publicado: (2024)
Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs
por: Lai, Xin, et al.
Publicado: (2024)
por: Lai, Xin, et al.
Publicado: (2024)
Two-stage LLM Fine-tuning with Less Specialization and More Generalization
por: Wang, Yihan, et al.
Publicado: (2022)
por: Wang, Yihan, et al.
Publicado: (2022)
LASER: Attention with Exponential Transformation
por: Duvvuri, Sai Surya, et al.
Publicado: (2024)
por: Duvvuri, Sai Surya, et al.
Publicado: (2024)
BiasDPO: Mitigating Bias in Language Models through Direct Preference Optimization
por: Allam, Ahmed
Publicado: (2024)
por: Allam, Ahmed
Publicado: (2024)
Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment
por: Xiao, Teng, et al.
Publicado: (2024)
por: Xiao, Teng, et al.
Publicado: (2024)
AlphaDPO: Adaptive Reward Margin for Direct Preference Optimization
por: Wu, Junkang, et al.
Publicado: (2024)
por: Wu, Junkang, et al.
Publicado: (2024)
AdaDPO: Self-Adaptive Direct Preference Optimization with Balanced Gradient Updates
por: Chen, Shaolong, et al.
Publicado: (2026)
por: Chen, Shaolong, et al.
Publicado: (2026)
2D-DPO: Scaling Direct Preference Optimization with 2-Dimensional Supervision
por: Li, Shilong, et al.
Publicado: (2024)
por: Li, Shilong, et al.
Publicado: (2024)
Online DPO: Online Direct Preference Optimization with Fast-Slow Chasing
por: Qi, Biqing, et al.
Publicado: (2024)
por: Qi, Biqing, et al.
Publicado: (2024)
No Preference Left Behind: Group Distributional Preference Optimization
por: Yao, Binwei, et al.
Publicado: (2024)
por: Yao, Binwei, et al.
Publicado: (2024)
DreamDPO: Aligning Text-to-3D Generation with Human Preferences via Direct Preference Optimization
por: Zhou, Zhenglin, et al.
Publicado: (2025)
por: Zhou, Zhenglin, et al.
Publicado: (2025)
Pre-DPO: Improving Data Utilization in Direct Preference Optimization Using a Guiding Reference Model
por: Pan, Junshu, et al.
Publicado: (2025)
por: Pan, Junshu, et al.
Publicado: (2025)
TIS-DPO: Token-level Importance Sampling for Direct Preference Optimization With Estimated Weights
por: Liu, Aiwei, et al.
Publicado: (2024)
por: Liu, Aiwei, et al.
Publicado: (2024)
Mix- and MoE-DPO: A Variational Inference Approach to Direct Preference Optimization
por: Bohne, Jason, et al.
Publicado: (2025)
por: Bohne, Jason, et al.
Publicado: (2025)
VERI-DPO: Evidence-Aware Alignment for Clinical Summarization via Claim Verification and Direct Preference Optimization
por: Liu, Weixin, et al.
Publicado: (2026)
por: Liu, Weixin, et al.
Publicado: (2026)
DiaTool-DPO: Multi-Turn Direct Preference Optimization for Tool-Augmented Large Language Models
por: Jung, Sunghee, et al.
Publicado: (2025)
por: Jung, Sunghee, et al.
Publicado: (2025)
RealDPO: Real or Not Real, that is the Preference
por: Cheng, Guo, et al.
Publicado: (2025)
por: Cheng, Guo, et al.
Publicado: (2025)
On-Policy Optimization with Group Equivalent Preference for Multi-Programming Language Understanding
por: Wu, Haoyuan, et al.
Publicado: (2025)
por: Wu, Haoyuan, et al.
Publicado: (2025)
Proximalized Preference Optimization for Diverse Feedback Types: A Decomposed Perspective on DPO
por: Guo, Kaiyang, et al.
Publicado: (2025)
por: Guo, Kaiyang, et al.
Publicado: (2025)
Optimal Stopping vs Best-of-$N$ for Inference Time Optimization
por: Kalayci, Yusuf, et al.
Publicado: (2025)
por: Kalayci, Yusuf, et al.
Publicado: (2025)
Group Robust Preference Optimization in Reward-free RLHF
por: Ramesh, Shyam Sundhar, et al.
Publicado: (2024)
por: Ramesh, Shyam Sundhar, et al.
Publicado: (2024)
GIFT: Group-Relative Implicit Fine-Tuning Integrates GRPO with DPO and UNA
por: Wang, Zhichao
Publicado: (2025)
por: Wang, Zhichao
Publicado: (2025)
DPO Kernels: A Semantically-Aware, Kernel-Enhanced, and Divergence-Rich Paradigm for Direct Preference Optimization
por: Das, Amitava, et al.
Publicado: (2025)
por: Das, Amitava, et al.
Publicado: (2025)
RS-DPO: A Hybrid Rejection Sampling and Direct Preference Optimization Method for Alignment of Large Language Models
por: Khaki, Saeed, et al.
Publicado: (2024)
por: Khaki, Saeed, et al.
Publicado: (2024)
Sem-DPO: Mitigating Semantic Inconsistency in Preference Optimization for Prompt Engineering
por: Mohamed, Anas, et al.
Publicado: (2025)
por: Mohamed, Anas, et al.
Publicado: (2025)
Multi-Preference Optimization: Generalizing DPO via Set-Level Contrasts
por: Gupta, Taneesh, et al.
Publicado: (2024)
por: Gupta, Taneesh, et al.
Publicado: (2024)
Teaching with Lies: Curriculum DPO on Synthetic Negatives for Hallucination Detection
por: Pandit, Shrey, et al.
Publicado: (2025)
por: Pandit, Shrey, et al.
Publicado: (2025)
InCo-DPO: Balancing Distribution Shift and Data Quality for Enhanced Preference Optimization
por: Wang, Yunan, et al.
Publicado: (2025)
por: Wang, Yunan, et al.
Publicado: (2025)
Taming Overconfidence in LLMs: Reward Calibration in RLHF
por: Leng, Jixuan, et al.
Publicado: (2024)
por: Leng, Jixuan, et al.
Publicado: (2024)
Uni-DPO: A Unified Paradigm for Dynamic Preference Optimization of LLMs
por: Peng, Shangpin, et al.
Publicado: (2025)
por: Peng, Shangpin, et al.
Publicado: (2025)
mDPO: Conditional Preference Optimization for Multimodal Large Language Models
por: Wang, Fei, et al.
Publicado: (2024)
por: Wang, Fei, et al.
Publicado: (2024)
Mixture of Weight-shared Heterogeneous Group Attention Experts for Dynamic Token-wise KV Optimization
por: Song, Guanghui, et al.
Publicado: (2025)
por: Song, Guanghui, et al.
Publicado: (2025)
Robust Multi-Objective Preference Alignment with Online DPO
por: Gupta, Raghav, et al.
Publicado: (2025)
por: Gupta, Raghav, et al.
Publicado: (2025)
Rethinking DPO: The Role of Rejected Responses in Preference Misalignment
por: Cho, Jay Hyeon, et al.
Publicado: (2025)
por: Cho, Jay Hyeon, et al.
Publicado: (2025)
SignDPO: Multi-level Direct Preference Optimisation for Skeleton-based Gloss-free Sign Language Translation
por: Pu, Muxin, et al.
Publicado: (2026)
por: Pu, Muxin, et al.
Publicado: (2026)
Ejemplares similares
-
DPO-Shift: Shifting the Distribution of Direct Preference Optimization
por: Yang, Xiliang, et al.
Publicado: (2025) -
Large Language Models are Interpretable Learners
por: Wang, Ruochen, et al.
Publicado: (2024) -
Full-Step-DPO: Self-Supervised Preference Optimization with Step-wise Rewards for Mathematical Reasoning
por: Xu, Huimin, et al.
Publicado: (2025) -
MCM-DPO: Multifaceted Cross-Modal Direct Preference Optimization for Alt-text Generation
por: Fu, Jinlan, et al.
Publicado: (2025) -
LoRA Done RITE: Robust Invariant Transformation Equilibration for LoRA Optimization
por: Yen, Jui-Nan, et al.
Publicado: (2024)