Distributional Alignment Games for Answer-Level Fine-Tuning
Fuente:
arXiv
Guardado en:
| Autores principales: | Mohri, Mehryar, Schneider, Jon, Wu, Yifan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Next-Token Prediction and Regret Minimization
por: Mohri, Mehryar, et al.
Publicado: (2026)
por: Mohri, Mehryar, et al.
Publicado: (2026)
Swap Regret and Correlated Equilibria Beyond Normal-Form Games
por: Arunachaleswaran, Eshwar Ram, et al.
Publicado: (2025)
por: Arunachaleswaran, Eshwar Ram, et al.
Publicado: (2025)
Generalized Distributional Alignment Games for Unbiased Answer-Level Fine-Tuning
por: Mohri, Mehryar, et al.
Publicado: (2026)
por: Mohri, Mehryar, et al.
Publicado: (2026)
Efficient Opportunistic Approachability
por: Marinov, Teodor Vanislavov, et al.
Publicado: (2026)
por: Marinov, Teodor Vanislavov, et al.
Publicado: (2026)
High-Dimensional Calibration from Swap Regret
por: Fishelson, Maxwell, et al.
Publicado: (2025)
por: Fishelson, Maxwell, et al.
Publicado: (2025)
Online Learning with Bounded Recall
por: Schneider, Jon, et al.
Publicado: (2022)
por: Schneider, Jon, et al.
Publicado: (2022)
Strategizing against No-regret Learners
por: Deng, Yuan, et al.
Publicado: (2019)
por: Deng, Yuan, et al.
Publicado: (2019)
Strategically-Robust Learning Algorithms for Bidding in First-Price Auctions
por: Kumar, Rachitesh, et al.
Publicado: (2024)
por: Kumar, Rachitesh, et al.
Publicado: (2024)
Balancing of competitive two-player Game Levels with Reinforcement Learning
por: Rupp, Florian, et al.
Publicado: (2023)
por: Rupp, Florian, et al.
Publicado: (2023)
Attacking and Securing Community Detection: A Game-Theoretic Framework
por: Niu, Yifan, et al.
Publicado: (2025)
por: Niu, Yifan, et al.
Publicado: (2025)
Density-Based Algorithms for Corruption-Robust Contextual Search and Convex Optimization
por: Leme, Renato Paes, et al.
Publicado: (2022)
por: Leme, Renato Paes, et al.
Publicado: (2022)
Learning to Play Against Unknown Opponents
por: Arunachaleswaran, Eshwar Ram, et al.
Publicado: (2024)
por: Arunachaleswaran, Eshwar Ram, et al.
Publicado: (2024)
Fundamental Limits of Game-Theoretic LLM Alignment: Smith Consistency and Preference Matching
por: Shi, Zhekun, et al.
Publicado: (2025)
por: Shi, Zhekun, et al.
Publicado: (2025)
Price-Discrimination Game for Distributed Resource Management in Federated Learning
por: Zhang, Han, et al.
Publicado: (2023)
por: Zhang, Han, et al.
Publicado: (2023)
A New Benchmark for Online Learning with Budget-Balancing Constraints
por: Braverman, Mark, et al.
Publicado: (2025)
por: Braverman, Mark, et al.
Publicado: (2025)
Data Valuation for LLM Fine-Tuning: Efficient Shapley Value Approximation via Language Model Arithmetic
por: Tamine, Mélissa, et al.
Publicado: (2025)
por: Tamine, Mélissa, et al.
Publicado: (2025)
Towards Performatively Stable Equilibria in Decision-Dependent Games for Arbitrary Data Distribution Maps
por: Zhong, Guangzheng, et al.
Publicado: (2025)
por: Zhong, Guangzheng, et al.
Publicado: (2025)
Regret Minimization in Stackelberg Games with Side Information
por: Harris, Keegan, et al.
Publicado: (2024)
por: Harris, Keegan, et al.
Publicado: (2024)
Full Swap Regret and Discretized Calibration
por: Fishelson, Maxwell, et al.
Publicado: (2025)
por: Fishelson, Maxwell, et al.
Publicado: (2025)
Nearly-Optimal Bandit Learning in Stackelberg Games with Side Information
por: Balcan, Maria-Florina, et al.
Publicado: (2025)
por: Balcan, Maria-Florina, et al.
Publicado: (2025)
On the Decomposition of Differential Game
por: Zhou, Nanxiang, et al.
Publicado: (2024)
por: Zhou, Nanxiang, et al.
Publicado: (2024)
Calibration without Ground Truth
por: Kong, Yuqing, et al.
Publicado: (2026)
por: Kong, Yuqing, et al.
Publicado: (2026)
Learning in Structured Stackelberg Games
por: Balcan, Maria-Florina, et al.
Publicado: (2025)
por: Balcan, Maria-Florina, et al.
Publicado: (2025)
Learning to Steer Learners in Games
por: Zhang, Yizhou, et al.
Publicado: (2025)
por: Zhang, Yizhou, et al.
Publicado: (2025)
Corrupted Learning Dynamics in Games
por: Tsuchiya, Taira, et al.
Publicado: (2024)
por: Tsuchiya, Taira, et al.
Publicado: (2024)
Blind Inverse Game Theory: Jointly Decoding Rewards and Rationality in Entropy-Regularized Competitive Games
por: Virk, Hamza, et al.
Publicado: (2025)
por: Virk, Hamza, et al.
Publicado: (2025)
Neural Mean-Field Games: Extending Mean-Field Game Theory with Neural Stochastic Differential Equations
por: Thöni, Anna C. M., et al.
Publicado: (2025)
por: Thöni, Anna C. M., et al.
Publicado: (2025)
Scale-Invariant Fast Convergence in Games
por: Tsuchiya, Taira, et al.
Publicado: (2026)
por: Tsuchiya, Taira, et al.
Publicado: (2026)
Regulation Games for Trustworthy Machine Learning
por: Yaghini, Mohammad, et al.
Publicado: (2024)
por: Yaghini, Mohammad, et al.
Publicado: (2024)
Bayesian Learning in Episodic Zero-Sum Games
por: Yueh, Chang-Wei, et al.
Publicado: (2026)
por: Yueh, Chang-Wei, et al.
Publicado: (2026)
On Tractable $Φ$-Equilibria in Non-Concave Games
por: Cai, Yang, et al.
Publicado: (2024)
por: Cai, Yang, et al.
Publicado: (2024)
Adaptively Perturbed Mirror Descent for Learning in Games
por: Abe, Kenshi, et al.
Publicado: (2023)
por: Abe, Kenshi, et al.
Publicado: (2023)
Incentivized Learning in Principal-Agent Bandit Games
por: Scheid, Antoine, et al.
Publicado: (2024)
por: Scheid, Antoine, et al.
Publicado: (2024)
Playing Markov Games Without Observing Payoffs
por: Ablin, Daniel, et al.
Publicado: (2025)
por: Ablin, Daniel, et al.
Publicado: (2025)
Protocols for Verifying Smooth Strategies in Bandits and Games
por: Christ, Miranda, et al.
Publicado: (2025)
por: Christ, Miranda, et al.
Publicado: (2025)
The Power of Regularization in Solving Extensive-Form Games
por: Liu, Mingyang, et al.
Publicado: (2022)
por: Liu, Mingyang, et al.
Publicado: (2022)
Reducing Optimism Bias in Incomplete Cooperative Games
por: Úradník, Filip, et al.
Publicado: (2024)
por: Úradník, Filip, et al.
Publicado: (2024)
Zeroth-Order Stackelberg Control in Combinatorial Congestion Games
por: Masiha, Saeed, et al.
Publicado: (2026)
por: Masiha, Saeed, et al.
Publicado: (2026)
Optimal Rates for Feasible Payoff Set Estimation in Games
por: Barbara, Annalisa, et al.
Publicado: (2026)
por: Barbara, Annalisa, et al.
Publicado: (2026)
Beyond Pessimism: Offline Learning in KL-regularized Games
por: Zhang, Yuheng, et al.
Publicado: (2026)
por: Zhang, Yuheng, et al.
Publicado: (2026)
Ejemplares similares
-
Next-Token Prediction and Regret Minimization
por: Mohri, Mehryar, et al.
Publicado: (2026) -
Swap Regret and Correlated Equilibria Beyond Normal-Form Games
por: Arunachaleswaran, Eshwar Ram, et al.
Publicado: (2025) -
Generalized Distributional Alignment Games for Unbiased Answer-Level Fine-Tuning
por: Mohri, Mehryar, et al.
Publicado: (2026) -
Efficient Opportunistic Approachability
por: Marinov, Teodor Vanislavov, et al.
Publicado: (2026) -
High-Dimensional Calibration from Swap Regret
por: Fishelson, Maxwell, et al.
Publicado: (2025)