Guardado en:
| Autores principales: | Pan, Pei-Chi, Liang, Yingbin, Lin, Sen |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2602.09305 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Algorithm Design for Online Meta-Learning with Task Boundary Detection
por: Sow, Daouda, et al.
Publicado: (2023)
por: Sow, Daouda, et al.
Publicado: (2023)
Agentic Transformers Provably Learn to Search via Reinforcement Learning
por: Yang, Tong, et al.
Publicado: (2026)
por: Yang, Tong, et al.
Publicado: (2026)
Robust Offline Reinforcement Learning for Non-Markovian Decision Processes
por: Huang, Ruiquan, et al.
Publicado: (2024)
por: Huang, Ruiquan, et al.
Publicado: (2024)
HIPO: Instruction Hierarchy via Constrained Reinforcement Learning
por: Chen, Keru, et al.
Publicado: (2026)
por: Chen, Keru, et al.
Publicado: (2026)
The Implicit Curriculum: Learning Dynamics in RL with Verifiable Rewards
por: Huang, Yu, et al.
Publicado: (2026)
por: Huang, Yu, et al.
Publicado: (2026)
Multi-head Transformers Provably Learn Symbolic Multi-step Reasoning via Gradient Descent
por: Yang, Tong, et al.
Publicado: (2025)
por: Yang, Tong, et al.
Publicado: (2025)
Mixture-of-Transformers Learn Faster: A Theoretical Study on Classification Problems
por: Li, Hongbo, et al.
Publicado: (2025)
por: Li, Hongbo, et al.
Publicado: (2025)
Theory on Mixture-of-Experts in Continual Learning
por: Li, Hongbo, et al.
Publicado: (2024)
por: Li, Hongbo, et al.
Publicado: (2024)
Unlocking the Power of Rehearsal in Continual Learning: A Theoretical Perspective
por: Deng, Junze, et al.
Publicado: (2025)
por: Deng, Junze, et al.
Publicado: (2025)
Near-Optimal Partially Observable Reinforcement Learning with Partial Online State Information
por: Shi, Ming, et al.
Publicado: (2023)
por: Shi, Ming, et al.
Publicado: (2023)
A Theoretical Analysis of Self-Supervised Learning for Vision Transformers
por: Huang, Yu, et al.
Publicado: (2024)
por: Huang, Yu, et al.
Publicado: (2024)
Regret Bounds for Reinforcement Learning from Multi-Source Imperfect Preferences
por: Shi, Ming, et al.
Publicado: (2026)
por: Shi, Ming, et al.
Publicado: (2026)
Reinforcing Multi-Turn Reasoning in LLM Agents via Turn-Level Reward Design
por: Wei, Quan, et al.
Publicado: (2025)
por: Wei, Quan, et al.
Publicado: (2025)
Binary Rewards and Reinforcement Learning: Fundamental Challenges
por: Dymetman, Marc
Publicado: (2026)
por: Dymetman, Marc
Publicado: (2026)
From Scores to Gibbs Correctors: Accelerating Uniform-Rate Discrete Diffusion Models
por: Liang, Yuchen, et al.
Publicado: (2026)
por: Liang, Yuchen, et al.
Publicado: (2026)
Reward Design for Reinforcement Learning Agents
por: Devidze, Rati
Publicado: (2025)
por: Devidze, Rati
Publicado: (2025)
In-Context Learning with Representations: Contextual Generalization of Trained Transformers
por: Yang, Tong, et al.
Publicado: (2024)
por: Yang, Tong, et al.
Publicado: (2024)
Constraint-Rectified Training for Efficient Chain-of-Thought
por: Wu, Qinhang, et al.
Publicado: (2026)
por: Wu, Qinhang, et al.
Publicado: (2026)
Provable In-Context Learning of Nonlinear Regression with Transformers
por: Li, Hongbo, et al.
Publicado: (2025)
por: Li, Hongbo, et al.
Publicado: (2025)
Self-Rewarding Rubric-Based Reinforcement Learning for Open-Ended Reasoning
por: Ye, Zhiling, et al.
Publicado: (2025)
por: Ye, Zhiling, et al.
Publicado: (2025)
Provably Efficient UCB-type Algorithms For Learning Predictive State Representations
por: Huang, Ruiquan, et al.
Publicado: (2023)
por: Huang, Ruiquan, et al.
Publicado: (2023)
Focal Reward: Balanced Reinforcement Learning under Rubric-Based Rewards
por: Huang, Yu, et al.
Publicado: (2026)
por: Huang, Yu, et al.
Publicado: (2026)
RDA: Reward Design Agent for Reinforcement Learning
por: Lee, Hojoon, et al.
Publicado: (2026)
por: Lee, Hojoon, et al.
Publicado: (2026)
Sharp Convergence Rates for Masked Diffusion Models
por: Liang, Yuchen, et al.
Publicado: (2026)
por: Liang, Yuchen, et al.
Publicado: (2026)
Theory on Score-Mismatched Diffusion Models and Zero-Shot Conditional Samplers
por: Liang, Yuchen, et al.
Publicado: (2024)
por: Liang, Yuchen, et al.
Publicado: (2024)
Decomposable Reward Modeling and Realistic Environment Design for Reinforcement Learning-Based Forex Trading
por: Saidd, Nabeel Ahmad
Publicado: (2026)
por: Saidd, Nabeel Ahmad
Publicado: (2026)
Provably Sample-Efficient Robust Reinforcement Learning with Average Reward
por: Roch, Zachary, et al.
Publicado: (2025)
por: Roch, Zachary, et al.
Publicado: (2025)
LinguaFluid: Language Guided Fluid Control via Semantic Rewards in Reinforcement Learning
por: Liang, Aoming, et al.
Publicado: (2025)
por: Liang, Aoming, et al.
Publicado: (2025)
Step-wise Rubric Rewards for LLM Reasoning
por: Xie, Weichu, et al.
Publicado: (2026)
por: Xie, Weichu, et al.
Publicado: (2026)
How Transformers Learn Regular Language Recognition: A Theoretical Study on Training Dynamics and Implicit Bias
por: Huang, Ruiquan, et al.
Publicado: (2025)
por: Huang, Ruiquan, et al.
Publicado: (2025)
Alternating Reinforcement Learning for Rubric-Based Reward Modeling in Non-Verifiable LLM Post-Training
por: Xu, Ran, et al.
Publicado: (2026)
por: Xu, Ran, et al.
Publicado: (2026)
Dynamic Fraud Detection: Integrating Reinforcement Learning into Graph Neural Networks
por: Dong, Yuxin, et al.
Publicado: (2024)
por: Dong, Yuxin, et al.
Publicado: (2024)
R^3: Replay, Reflection, and Ranking Rewards for LLM Reinforcement Learning
por: Jiang, Zhizheng, et al.
Publicado: (2026)
por: Jiang, Zhizheng, et al.
Publicado: (2026)
Information-Theoretic Reward Modeling for Stable RLHF: Detecting and Mitigating Reward Hacking
por: Miao, Yuchun, et al.
Publicado: (2025)
por: Miao, Yuchun, et al.
Publicado: (2025)
Discrete Diffusion Models: Novel Analysis and New Sampler Guarantees
por: Liang, Yuchen, et al.
Publicado: (2025)
por: Liang, Yuchen, et al.
Publicado: (2025)
Rollout-Training Co-Design for Efficient LLM-Based Multi-Agent Reinforcement Learning
por: Jiang, Zhida, et al.
Publicado: (2026)
por: Jiang, Zhida, et al.
Publicado: (2026)
Linking Process to Outcome: Conditional Reward Modeling for LLM Reasoning
por: Zhang, Zheng, et al.
Publicado: (2025)
por: Zhang, Zheng, et al.
Publicado: (2025)
Random Policy Valuation is Enough for LLM Reasoning with Verifiable Rewards
por: He, Haoran, et al.
Publicado: (2025)
por: He, Haoran, et al.
Publicado: (2025)
On Designing Effective RL Reward at Training Time for LLM Reasoning
por: Gao, Jiaxuan, et al.
Publicado: (2024)
por: Gao, Jiaxuan, et al.
Publicado: (2024)
Broadening Target Distributions for Accelerated Diffusion Models via a Novel Analysis Approach
por: Liang, Yuchen, et al.
Publicado: (2024)
por: Liang, Yuchen, et al.
Publicado: (2024)
Ejemplares similares
-
Algorithm Design for Online Meta-Learning with Task Boundary Detection
por: Sow, Daouda, et al.
Publicado: (2023) -
Agentic Transformers Provably Learn to Search via Reinforcement Learning
por: Yang, Tong, et al.
Publicado: (2026) -
Robust Offline Reinforcement Learning for Non-Markovian Decision Processes
por: Huang, Ruiquan, et al.
Publicado: (2024) -
HIPO: Instruction Hierarchy via Constrained Reinforcement Learning
por: Chen, Keru, et al.
Publicado: (2026) -
The Implicit Curriculum: Learning Dynamics in RL with Verifiable Rewards
por: Huang, Yu, et al.
Publicado: (2026)