Beyond Expectations: Learning with Stochastic Dominance Made Practical
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Cen, Shicong, Mei, Jincheng, Dai, Hanjun, Schuurmans, Dale, Chi, Yuejie, Dai, Bo |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Value-Incentivized Preference Optimization: A Unified Approach to Online and Offline RLHF
par: Cen, Shicong, et autres
Publié: (2024)
par: Cen, Shicong, et autres
Publié: (2024)
Faster WIND: Accelerating Iterative Best-of-$N$ Distillation for LLM Alignment
par: Yang, Tong, et autres
Publié: (2024)
par: Yang, Tong, et autres
Publié: (2024)
Incentivize without Bonus: Provably Efficient Model-based Online Multi-agent RL for Markov Games
par: Yang, Tong, et autres
Publié: (2025)
par: Yang, Tong, et autres
Publié: (2025)
Agentic Transformers Provably Learn to Search via Reinforcement Learning
par: Yang, Tong, et autres
Publié: (2026)
par: Yang, Tong, et autres
Publié: (2026)
Transformers Provably Learn Chain-of-Thought Reasoning with Length Generalization
par: Huang, Yu, et autres
Publié: (2025)
par: Huang, Yu, et autres
Publié: (2025)
Statistical and Algorithmic Foundations of Reinforcement Learning
par: Chi, Yuejie, et autres
Publié: (2025)
par: Chi, Yuejie, et autres
Publié: (2025)
Preconditioning Benefits of Spectral Orthogonalization in Muon
par: Ma, Jianhao, et autres
Publié: (2026)
par: Ma, Jianhao, et autres
Publié: (2026)
The Implicit Curriculum: Learning Dynamics in RL with Verifiable Rewards
par: Huang, Yu, et autres
Publié: (2026)
par: Huang, Yu, et autres
Publié: (2026)
Exploration from a Primal-Dual Lens: Value-Incentivized Actor-Critic Methods for Sample-Efficient Online RL
par: Yang, Tong, et autres
Publié: (2025)
par: Yang, Tong, et autres
Publié: (2025)
Multi-head Transformers Provably Learn Symbolic Multi-step Reasoning via Gradient Descent
par: Yang, Tong, et autres
Publié: (2025)
par: Yang, Tong, et autres
Publié: (2025)
Primal-Dual Spectral Representation for Off-policy Evaluation
par: Hu, Yang, et autres
Publié: (2024)
par: Hu, Yang, et autres
Publié: (2024)
The Sample-Communication Complexity Trade-off in Federated Q-Learning
par: Salgia, Sudeep, et autres
Publié: (2024)
par: Salgia, Sudeep, et autres
Publié: (2024)
Accelerating Convergence of Score-Based Diffusion Models, Provably
par: Li, Gen, et autres
Publié: (2024)
par: Li, Gen, et autres
Publié: (2024)
Federated Natural Policy Gradient and Actor Critic Methods for Multi-task Reinforcement Learning
par: Yang, Tong, et autres
Publié: (2023)
par: Yang, Tong, et autres
Publié: (2023)
Stochastic Learning of Computational Resource Usage as Graph Structured Multimarginal Schrödinger Bridge
par: Bondar, Georgiy A., et autres
Publié: (2024)
par: Bondar, Georgiy A., et autres
Publié: (2024)
A Minimalist Bayesian Framework for Stochastic Optimization
par: Wang, Kaizheng
Publié: (2025)
par: Wang, Kaizheng
Publié: (2025)
SGD at the Edge of Stability: The Stochastic Sharpness Gap
par: Liao, Fangshuo, et autres
Publié: (2026)
par: Liao, Fangshuo, et autres
Publié: (2026)
Benchmarking Reinforcement Learning via Stochastic Converse Optimality: Generating Systems with Known Optimal Policies
par: Ibrahim, Sinan, et autres
Publié: (2026)
par: Ibrahim, Sinan, et autres
Publié: (2026)
Towards Faster Decentralized Stochastic Optimization with Communication Compression
par: Islamov, Rustem, et autres
Publié: (2024)
par: Islamov, Rustem, et autres
Publié: (2024)
On the Convergence of (Stochastic) Gradient Descent for Kolmogorov--Arnold Networks
par: Gao, Yihang, et autres
Publié: (2024)
par: Gao, Yihang, et autres
Publié: (2024)
Understanding Sampler Stochasticity in Training Diffusion Models for RLHF
par: Sheng, Jiayuan, et autres
Publié: (2025)
par: Sheng, Jiayuan, et autres
Publié: (2025)
Stochastic Optimization of Inventory at Large-scale Supply Chains
par: Jin, Zhaoyang Larry, et autres
Publié: (2025)
par: Jin, Zhaoyang Larry, et autres
Publié: (2025)
Almost Bayesian: The Fractal Dynamics of Stochastic Gradient Descent
par: Hennick, Max, et autres
Publié: (2025)
par: Hennick, Max, et autres
Publié: (2025)
Federated Majorize-Minimization: Beyond Parameter Aggregation
par: Dieuleveut, Aymeric, et autres
Publié: (2025)
par: Dieuleveut, Aymeric, et autres
Publié: (2025)
Neural Combinatorial Optimization for Stochastic Flexible Job Shop Scheduling Problems
par: Smit, Igor G., et autres
Publié: (2024)
par: Smit, Igor G., et autres
Publié: (2024)
Asymptotic and Finite Sample Analysis of Nonexpansive Stochastic Approximations with Markovian Noise
par: Blaser, Ethan, et autres
Publié: (2024)
par: Blaser, Ethan, et autres
Publié: (2024)
Stochastic Optimization with Constraints: A Non-asymptotic Instance-Dependent Analysis
par: Khamaru, Koulik
Publié: (2024)
par: Khamaru, Koulik
Publié: (2024)
Stochastic Subgradient Methods with Guaranteed Global Stability in Nonsmooth Nonconvex Optimization
par: Xiao, Nachuan, et autres
Publié: (2023)
par: Xiao, Nachuan, et autres
Publié: (2023)
Weighted Low-rank Approximation via Stochastic Gradient Descent on Manifolds
par: Xu, Conglong, et autres
Publié: (2025)
par: Xu, Conglong, et autres
Publié: (2025)
A Theoretical Analysis of Self-Supervised Learning for Vision Transformers
par: Huang, Yu, et autres
Publié: (2024)
par: Huang, Yu, et autres
Publié: (2024)
The Ky Fan Norms and Beyond: Dual Norms and Combinations for Matrix Optimization
par: Kravatskiy, Alexey, et autres
Publié: (2025)
par: Kravatskiy, Alexey, et autres
Publié: (2025)
Enhancing Stochastic Gradient Descent: A Unified Framework and Novel Acceleration Methods for Faster Convergence
par: Deng, Yichuan, et autres
Publié: (2024)
par: Deng, Yichuan, et autres
Publié: (2024)
StoSignSGD: Unbiased Structural Stochasticity Fixes SignSGD for Training Large Language Models
par: Yu, Dingzhi, et autres
Publié: (2026)
par: Yu, Dingzhi, et autres
Publié: (2026)
Solving Integrated Process Planning and Scheduling Problem via Graph Neural Network Based Deep Reinforcement Learning
par: Li, Hongpei, et autres
Publié: (2024)
par: Li, Hongpei, et autres
Publié: (2024)
Unrealized Expectations: Comparing AI Methods vs Classical Algorithms for Maximum Independent Set
par: Wu, Yikai, et autres
Publié: (2025)
par: Wu, Yikai, et autres
Publié: (2025)
Beyond Minimax Rates in Group Distributionally Robust Optimization via a Novel Notion of Sparsity
par: Nguyen, Quan, et autres
Publié: (2024)
par: Nguyen, Quan, et autres
Publié: (2024)
Data Uniformity Improves Training Efficiency and More, with a Convergence Framework Beyond the NTK Regime
par: Wang, Yuqing, et autres
Publié: (2025)
par: Wang, Yuqing, et autres
Publié: (2025)
Achieving Tighter Finite-Time Rates for Heterogeneous Federated Stochastic Approximation under Markovian Sampling
par: Zhu, Feng, et autres
Publié: (2025)
par: Zhu, Feng, et autres
Publié: (2025)
Lyapunov-stable Neural Control for State and Output Feedback: A Novel Formulation
par: Yang, Lujie, et autres
Publié: (2024)
par: Yang, Lujie, et autres
Publié: (2024)
$γ$-weakly $θ$-up-concavity: A Unified Framework for Non-Convex Optimization Beyond DR-Submodular and OSS Functions
par: Pedramfar, Mohammad, et autres
Publié: (2026)
par: Pedramfar, Mohammad, et autres
Publié: (2026)
Documents similaires
-
Value-Incentivized Preference Optimization: A Unified Approach to Online and Offline RLHF
par: Cen, Shicong, et autres
Publié: (2024) -
Faster WIND: Accelerating Iterative Best-of-$N$ Distillation for LLM Alignment
par: Yang, Tong, et autres
Publié: (2024) -
Incentivize without Bonus: Provably Efficient Model-based Online Multi-agent RL for Markov Games
par: Yang, Tong, et autres
Publié: (2025) -
Agentic Transformers Provably Learn to Search via Reinforcement Learning
par: Yang, Tong, et autres
Publié: (2026) -
Transformers Provably Learn Chain-of-Thought Reasoning with Length Generalization
par: Huang, Yu, et autres
Publié: (2025)