Uniformly Stable Algorithms for Adversarial Training and Beyond
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Xiao, Jiancong, Zhang, Jiawei, Luo, Zhi-Quan, Ozdaglar, Asuman |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Beyond RLHF and NLHF: Population-Proportional Alignment under an Axiomatic Framework
par: Kim, Kihyun, et autres
Publié: (2025)
par: Kim, Kihyun, et autres
Publié: (2025)
Offline Reinforcement Learning via Linear-Programming with Error-Bound Induced Constraints
par: Ozdaglar, Asuman, et autres
Publié: (2022)
par: Ozdaglar, Asuman, et autres
Publié: (2022)
A Unified Linear Programming Framework for Offline Reward Learning from Human Demonstrations and Feedback
par: Kim, Kihyun, et autres
Publié: (2024)
par: Kim, Kihyun, et autres
Publié: (2024)
Multi-Player Zero-Sum Markov Games with Networked Separable Interactions
par: Park, Chanwoo, et autres
Publié: (2023)
par: Park, Chanwoo, et autres
Publié: (2023)
UFT: Unifying Supervised and Reinforcement Fine-Tuning
par: Liu, Mingyang, et autres
Publié: (2025)
par: Liu, Mingyang, et autres
Publié: (2025)
LiteEFG: An Efficient Python Library for Solving Extensive-form Games
par: Liu, Mingyang, et autres
Publié: (2024)
par: Liu, Mingyang, et autres
Publié: (2024)
A Policy-Gradient Approach to Solving Imperfect-Information Games with Best-Iterate Convergence
par: Liu, Mingyang, et autres
Publié: (2024)
par: Liu, Mingyang, et autres
Publié: (2024)
Differentially Private Equilibrium Finding in Polymatrix Games
par: Liu, Mingyang, et autres
Publié: (2025)
par: Liu, Mingyang, et autres
Publié: (2025)
The Power of Regularization in Solving Extensive-Form Games
par: Liu, Mingyang, et autres
Publié: (2022)
par: Liu, Mingyang, et autres
Publié: (2022)
What Data Enables Optimal Decisions? An Exact Characterization for Linear Optimization
par: Bennouna, Omar, et autres
Publié: (2025)
par: Bennouna, Omar, et autres
Publié: (2025)
Computing Equilibrium beyond Unilateral Deviation
par: Liu, Mingyang, et autres
Publié: (2026)
par: Liu, Mingyang, et autres
Publié: (2026)
Do LLM Agents Have Regret? A Case Study in Online Learning and Games
par: Park, Chanwoo, et autres
Publié: (2024)
par: Park, Chanwoo, et autres
Publié: (2024)
RLHF from Heterogeneous Feedback via Personalization and Preference Aggregation
par: Park, Chanwoo, et autres
Publié: (2024)
par: Park, Chanwoo, et autres
Publié: (2024)
A Single-Loop Smoothed Gradient Descent-Ascent Algorithm for Nonconvex-Concave Min-Max Problems
par: Zhang, Jiawei, et autres
Publié: (2020)
par: Zhang, Jiawei, et autres
Publié: (2020)
Finite-Sample Guarantees for Learning Dynamics in Zero-Sum Polymatrix Games
par: Faizal, Fathima Zarin, et autres
Publié: (2024)
par: Faizal, Fathima Zarin, et autres
Publié: (2024)
Last-Iterate Convergence of Payoff-Based Independent Learning in Zero-Sum Stochastic Games
par: Chen, Zaiwei, et autres
Publié: (2024)
par: Chen, Zaiwei, et autres
Publié: (2024)
Optimism as Risk-Seeking in Multi-Agent Reinforcement Learning
par: Zhang, Runyu, et autres
Publié: (2025)
par: Zhang, Runyu, et autres
Publié: (2025)
Learning Decision-Sufficient Representations for Linear Optimization
par: Ye, Yuhan, et autres
Publié: (2026)
par: Ye, Yuhan, et autres
Publié: (2026)
Training-Conditional Coverage Bounds for Uniformly Stable Learning Algorithms
par: Pournaderi, Mehrdad, et autres
Publié: (2024)
par: Pournaderi, Mehrdad, et autres
Publié: (2024)
Online Learning and Equilibrium Computation with Ranking Feedback
par: Liu, Mingyang, et autres
Publié: (2026)
par: Liu, Mingyang, et autres
Publié: (2026)
Preserving Diversity in Supervised Fine-Tuning of Large Language Models
par: Li, Ziniu, et autres
Publié: (2024)
par: Li, Ziniu, et autres
Publié: (2024)
Matching of Users and Creators in Two-Sided Markets with Departures
par: Huttenlocher, Daniel, et autres
Publié: (2023)
par: Huttenlocher, Daniel, et autres
Publié: (2023)
Understanding Adversarial Imitation Learning in Small Sample Regime: A Stage-coupled Analysis
par: Xu, Tian, et autres
Publié: (2022)
par: Xu, Tian, et autres
Publié: (2022)
On the Escaping Efficiency of Distributed Adversarial Training Algorithms
par: Cao, Ying, et autres
Publié: (2025)
par: Cao, Ying, et autres
Publié: (2025)
Addressing misspecification in contextual optimization
par: Bennouna, Omar, et autres
Publié: (2024)
par: Bennouna, Omar, et autres
Publié: (2024)
Q-Star Meets Scalable Posterior Sampling: Bridging Theory and Practice via HyperAgent
par: Li, Yingru, et autres
Publié: (2024)
par: Li, Yingru, et autres
Publié: (2024)
Bridging the Gap: Rademacher Complexity in Robust and Standard Generalization
par: Xiao, Jiancong, et autres
Publié: (2024)
par: Xiao, Jiancong, et autres
Publié: (2024)
On the Algorithmic Bias of Aligning Large Language Models with RLHF: Preference Collapse and Matching Regularization
par: Xiao, Jiancong, et autres
Publié: (2024)
par: Xiao, Jiancong, et autres
Publié: (2024)
Fine-Tuning Attention Modules Only: Enhancing Weight Disentanglement in Task Arithmetic
par: Jin, Ruochen, et autres
Publié: (2024)
par: Jin, Ruochen, et autres
Publié: (2024)
Uniform Convergence Beyond Glivenko-Cantelli
par: Devale, Tanmay, et autres
Publié: (2025)
par: Devale, Tanmay, et autres
Publié: (2025)
Steering Beyond the Support: Adversarial Training on Unsupervised Jailbroken Activation Simulation
par: Chen, Luoyu, et autres
Publié: (2026)
par: Chen, Luoyu, et autres
Publié: (2026)
Data-Dependent Stability Analysis of Adversarial Training
par: Wang, Yihan, et autres
Publié: (2024)
par: Wang, Yihan, et autres
Publié: (2024)
Post-Training LLMs as Better Decision-Making Agents: A Regret-Minimization Approach
par: Park, Chanwoo, et autres
Publié: (2025)
par: Park, Chanwoo, et autres
Publié: (2025)
Improved Algorithm for Adversarial Linear Mixture MDPs with Bandit Feedback and Unknown Transition
par: Li, Long-Fei, et autres
Publié: (2024)
par: Li, Long-Fei, et autres
Publié: (2024)
Efficient Optimization Algorithms for Linear Adversarial Training
par: RIbeiro, Antônio H., et autres
Publié: (2024)
par: RIbeiro, Antônio H., et autres
Publié: (2024)
On the Impact of Hard Adversarial Instances on Overfitting in Adversarial Training
par: Liu, Chen, et autres
Publié: (2021)
par: Liu, Chen, et autres
Publié: (2021)
Bridging Distributional and Risk-sensitive Reinforcement Learning with Provable Regret Bounds
par: Liang, Hao, et autres
Publié: (2022)
par: Liang, Hao, et autres
Publié: (2022)
FreshGNN: Reducing Memory Access via Stable Historical Embeddings for Graph Neural Network Training
par: Huang, Kezhao, et autres
Publié: (2023)
par: Huang, Kezhao, et autres
Publié: (2023)
Scalable Exploration via Ensemble++
par: Li, Yingru, et autres
Publié: (2024)
par: Li, Yingru, et autres
Publié: (2024)
UMOEA/D: A Multiobjective Evolutionary Algorithm for Uniform Pareto Objectives based on Decomposition
par: Zhang, Xiaoyuan, et autres
Publié: (2024)
par: Zhang, Xiaoyuan, et autres
Publié: (2024)
Documents similaires
-
Beyond RLHF and NLHF: Population-Proportional Alignment under an Axiomatic Framework
par: Kim, Kihyun, et autres
Publié: (2025) -
Offline Reinforcement Learning via Linear-Programming with Error-Bound Induced Constraints
par: Ozdaglar, Asuman, et autres
Publié: (2022) -
A Unified Linear Programming Framework for Offline Reward Learning from Human Demonstrations and Feedback
par: Kim, Kihyun, et autres
Publié: (2024) -
Multi-Player Zero-Sum Markov Games with Networked Separable Interactions
par: Park, Chanwoo, et autres
Publié: (2023) -
UFT: Unifying Supervised and Reinforcement Fine-Tuning
par: Liu, Mingyang, et autres
Publié: (2025)