Distributional Preference Alignment of LLMs via Optimal Transport
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Melnyk, Igor, Mroueh, Youssef, Belgodere, Brian, Rigotti, Mattia, Nitsure, Apoorva, Yurochkin, Mikhail, Greenewald, Kristjan, Navratil, Jiri, Ross, Jerret |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Risk Aware Benchmarking of Large Language Models
par: Nitsure, Apoorva, et autres
Publié: (2023)
par: Nitsure, Apoorva, et autres
Publié: (2023)
Revisiting Group Relative Policy Optimization: Insights into On-Policy and Off-Policy Training
par: Mroueh, Youssef, et autres
Publié: (2025)
par: Mroueh, Youssef, et autres
Publié: (2025)
Multivariate Stochastic Dominance via Optimal Transport and Applications to Models Benchmarking
par: Rioux, Gabriel, et autres
Publié: (2024)
par: Rioux, Gabriel, et autres
Publié: (2024)
Auditing and Generating Synthetic Data with Controllable Trust Trade-offs
par: Belgodere, Brian, et autres
Publié: (2023)
par: Belgodere, Brian, et autres
Publié: (2023)
GP-MoLFormer: A Foundation Model For Molecular Generation
par: Ross, Jerret, et autres
Publié: (2024)
par: Ross, Jerret, et autres
Publié: (2024)
Image Captioning as an Assistive Technology: Lessons Learned from VizWiz 2020 Challenge
par: Dognin, Pierre, et autres
Publié: (2020)
par: Dognin, Pierre, et autres
Publié: (2020)
GP-MoLFormer-Sim: Test Time Molecular Optimization through Contextual Similarity Guidance
par: Navratil, Jiri, et autres
Publié: (2025)
par: Navratil, Jiri, et autres
Publié: (2025)
Verify when Uncertain: Beyond Self-Consistency in Black Box Hallucination Detection
par: Xue, Yihao, et autres
Publié: (2025)
par: Xue, Yihao, et autres
Publié: (2025)
CliffSearch: Structured Agentic Co-Evolution over Theory and Code for Scientific Algorithm Discovery
par: Mroueh, Youssef, et autres
Publié: (2026)
par: Mroueh, Youssef, et autres
Publié: (2026)
Distributional Process Reward Models: Calibrated Prediction of Future Rewards via Conditional Optimal Transport
par: Ma, Rachel, et autres
Publié: (2026)
par: Ma, Rachel, et autres
Publié: (2026)
Gradient Flows and Riemannian Structure in the Gromov-Wasserstein Geometry
par: Zhang, Zhengxin, et autres
Publié: (2024)
par: Zhang, Zhengxin, et autres
Publié: (2024)
Partially Observed Trajectory Inference using Optimal Transport and a Dynamics Prior
par: Gu, Anming, et autres
Publié: (2024)
par: Gu, Anming, et autres
Publié: (2024)
Information Theoretic Guarantees For Policy Alignment In Large Language Models
par: Mroueh, Youssef
Publié: (2024)
par: Mroueh, Youssef
Publié: (2024)
Neural Estimation for Scaling Entropic Multimarginal Optimal Transport
par: Tsur, Dor, et autres
Publié: (2025)
par: Tsur, Dor, et autres
Publié: (2025)
Guided Speculative Inference for Efficient Test-Time Alignment of LLMs
par: Geuter, Jonathan, et autres
Publié: (2025)
par: Geuter, Jonathan, et autres
Publié: (2025)
Compress then Serve: Serving Thousands of LoRA Adapters with Little Overhead
par: Brüel-Gabrielsson, Rickard, et autres
Publié: (2024)
par: Brüel-Gabrielsson, Rickard, et autres
Publié: (2024)
Finite sample rates of convergence for the Bigraphical and Tensor graphical Lasso estimators
par: Zhou, Shuheng, et autres
Publié: (2023)
par: Zhou, Shuheng, et autres
Publié: (2023)
Reinforcement Learning with Verifiable Rewards: GRPO's Effective Loss, Dynamics, and Success Amplification
par: Mroueh, Youssef
Publié: (2025)
par: Mroueh, Youssef
Publié: (2025)
Synthetic Census Data Generation via Multidimensional Multiset Sum
par: Dwork, Cynthia, et autres
Publié: (2024)
par: Dwork, Cynthia, et autres
Publié: (2024)
Private Continuous-Time Synthetic Trajectory Generation via Mean-Field Langevin Dynamics
par: Gu, Anming, et autres
Publié: (2025)
par: Gu, Anming, et autres
Publié: (2025)
Domain Adaptable Prescriptive AI Agent for Enterprise
par: Orderique, Piero, et autres
Publié: (2024)
par: Orderique, Piero, et autres
Publié: (2024)
Aligners: Decoupling LLMs and Alignment
par: Ngweta, Lilian, et autres
Publié: (2024)
par: Ngweta, Lilian, et autres
Publié: (2024)
Efficient Multi-Adapter LLM Serving via Cross-Model KV-Cache Reuse with Activated LoRA
par: Li, Allison, et autres
Publié: (2025)
par: Li, Allison, et autres
Publié: (2025)
Fairness Is More Than Algorithms: Racial Disparities in Time-to-Recidivism
par: Han, Jessy Xinyi, et autres
Publié: (2025)
par: Han, Jessy Xinyi, et autres
Publié: (2025)
Asymmetry in Low-Rank Adapters of Foundation Models
par: Zhu, Jiacheng, et autres
Publié: (2024)
par: Zhu, Jiacheng, et autres
Publié: (2024)
Entropic Causal Inference: Graph Identifiability
par: Compton, Spencer, et autres
Publié: (2025)
par: Compton, Spencer, et autres
Publié: (2025)
Privacy without Noisy Gradients: Slicing Mechanism for Generative Model Training
par: Greenewald, Kristjan, et autres
Publié: (2024)
par: Greenewald, Kristjan, et autres
Publié: (2024)
Identification of Incomplete Preferences
par: Rigotti, Luca, et autres
Publié: (2021)
par: Rigotti, Luca, et autres
Publié: (2021)
Slicing Mutual Information Generalization Bounds for Neural Networks
par: Nadjahi, Kimia, et autres
Publié: (2024)
par: Nadjahi, Kimia, et autres
Publié: (2024)
The Narasimhan-Seshadri Theorem revisited
par: Nitsure, Nitin
Publié: (2025)
par: Nitsure, Nitin
Publié: (2025)
Out-of-Distribution Detection using Synthetic Data Generation
par: Abbas, Momin, et autres
Publié: (2025)
par: Abbas, Momin, et autres
Publié: (2025)
Partial Distribution Alignment via Adaptive Optimal Transport
par: Yang, Pei, et autres
Publié: (2025)
par: Yang, Pei, et autres
Publié: (2025)
Uncertainty Quantification via Stable Distribution Propagation
par: Petersen, Felix, et autres
Publié: (2024)
par: Petersen, Felix, et autres
Publié: (2024)
Differentially Private Wasserstein Barycenters
par: Gu, Anming, et autres
Publié: (2025)
par: Gu, Anming, et autres
Publié: (2025)
Know What You Don't Know: Uncertainty Calibration of Process Reward Models
par: Park, Young-Jin, et autres
Publié: (2025)
par: Park, Young-Jin, et autres
Publié: (2025)
GIST: Gauge-Invariant Spectral Transformers for Scalable Graph Neural Operators
par: Rigotti, Mattia, et autres
Publié: (2026)
par: Rigotti, Mattia, et autres
Publié: (2026)
Eliciting Reasoning in Language Models with Cognitive Tools
par: Ebouky, Brown, et autres
Publié: (2025)
par: Ebouky, Brown, et autres
Publié: (2025)
Background Denoising for Ptychography via Wigner Distribution Deconvolution
par: Melnyk, Oleh, et autres
Publié: (2024)
par: Melnyk, Oleh, et autres
Publié: (2024)
Evaluation of medication adherence among Lebanese diabetic patients
par: Lara Mroueh
Publié: (2018)
par: Lara Mroueh
Publié: (2018)
Activated LoRA: Fine-tuned LLMs for Intrinsics
par: Greenewald, Kristjan, et autres
Publié: (2025)
par: Greenewald, Kristjan, et autres
Publié: (2025)
Documents similaires
-
Risk Aware Benchmarking of Large Language Models
par: Nitsure, Apoorva, et autres
Publié: (2023) -
Revisiting Group Relative Policy Optimization: Insights into On-Policy and Off-Policy Training
par: Mroueh, Youssef, et autres
Publié: (2025) -
Multivariate Stochastic Dominance via Optimal Transport and Applications to Models Benchmarking
par: Rioux, Gabriel, et autres
Publié: (2024) -
Auditing and Generating Synthetic Data with Controllable Trust Trade-offs
par: Belgodere, Brian, et autres
Publié: (2023) -
GP-MoLFormer: A Foundation Model For Molecular Generation
par: Ross, Jerret, et autres
Publié: (2024)