Agentic Transformers Provably Learn to Search via Reinforcement Learning
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Yang, Tong, Huang, Yu, Liang, Yingbin, Chi, Yuejie |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Multi-head Transformers Provably Learn Symbolic Multi-step Reasoning via Gradient Descent
von: Yang, Tong, et al.
Veröffentlicht: (2025)
von: Yang, Tong, et al.
Veröffentlicht: (2025)
Transformers Provably Learn Chain-of-Thought Reasoning with Length Generalization
von: Huang, Yu, et al.
Veröffentlicht: (2025)
von: Huang, Yu, et al.
Veröffentlicht: (2025)
The Implicit Curriculum: Learning Dynamics in RL with Verifiable Rewards
von: Huang, Yu, et al.
Veröffentlicht: (2026)
von: Huang, Yu, et al.
Veröffentlicht: (2026)
In-Context Learning with Representations: Contextual Generalization of Trained Transformers
von: Yang, Tong, et al.
Veröffentlicht: (2024)
von: Yang, Tong, et al.
Veröffentlicht: (2024)
A Theoretical Analysis of Self-Supervised Learning for Vision Transformers
von: Huang, Yu, et al.
Veröffentlicht: (2024)
von: Huang, Yu, et al.
Veröffentlicht: (2024)
Statistical and Algorithmic Foundations of Reinforcement Learning
von: Chi, Yuejie, et al.
Veröffentlicht: (2025)
von: Chi, Yuejie, et al.
Veröffentlicht: (2025)
Accelerating Convergence of Score-Based Diffusion Models, Provably
von: Li, Gen, et al.
Veröffentlicht: (2024)
von: Li, Gen, et al.
Veröffentlicht: (2024)
Incentivize without Bonus: Provably Efficient Model-based Online Multi-agent RL for Markov Games
von: Yang, Tong, et al.
Veröffentlicht: (2025)
von: Yang, Tong, et al.
Veröffentlicht: (2025)
A Retention-Centric Framework for Continual Learning with Guaranteed Model Developmental Safety
von: Li, Gang, et al.
Veröffentlicht: (2024)
von: Li, Gang, et al.
Veröffentlicht: (2024)
Preconditioning Benefits of Spectral Orthogonalization in Muon
von: Ma, Jianhao, et al.
Veröffentlicht: (2026)
von: Ma, Jianhao, et al.
Veröffentlicht: (2026)
Policy Gradient Methods for Risk-Sensitive Distributional Reinforcement Learning with Provable Convergence
von: Xiao, Minheng, et al.
Veröffentlicht: (2024)
von: Xiao, Minheng, et al.
Veröffentlicht: (2024)
Beyond Expectations: Learning with Stochastic Dominance Made Practical
von: Cen, Shicong, et al.
Veröffentlicht: (2024)
von: Cen, Shicong, et al.
Veröffentlicht: (2024)
One-Layer Transformer Provably Learns One-Nearest Neighbor In Context
von: Li, Zihao, et al.
Veröffentlicht: (2024)
von: Li, Zihao, et al.
Veröffentlicht: (2024)
Provable Offline Reinforcement Learning for Structured Cyclic MDPs
von: Lee, Kyungbok, et al.
Veröffentlicht: (2026)
von: Lee, Kyungbok, et al.
Veröffentlicht: (2026)
Unveiling Induction Heads: Provable Training Dynamics and Feature Learning in Transformers
von: Chen, Siyu, et al.
Veröffentlicht: (2024)
von: Chen, Siyu, et al.
Veröffentlicht: (2024)
Robust Evolutionary Multi-Objective Network Architecture Search for Reinforcement Learning (EMNAS-RL)
von: Adde, Nihal Acharya, et al.
Veröffentlicht: (2025)
von: Adde, Nihal Acharya, et al.
Veröffentlicht: (2025)
Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems
von: Huang, Yilie, et al.
Veröffentlicht: (2025)
von: Huang, Yilie, et al.
Veröffentlicht: (2025)
Sublinear Regret for a Class of Continuous-Time Linear-Quadratic Reinforcement Learning Problems
von: Huang, Yilie, et al.
Veröffentlicht: (2024)
von: Huang, Yilie, et al.
Veröffentlicht: (2024)
Accelerating Cutting-Plane Algorithms via Reinforcement Learning Surrogates
von: Mana, Kyle, et al.
Veröffentlicht: (2023)
von: Mana, Kyle, et al.
Veröffentlicht: (2023)
The Sample-Communication Complexity Trade-off in Federated Q-Learning
von: Salgia, Sudeep, et al.
Veröffentlicht: (2024)
von: Salgia, Sudeep, et al.
Veröffentlicht: (2024)
Combining Reinforcement Learning and Optimal Transport for the Traveling Salesman Problem
von: Goh, Yong Liang, et al.
Veröffentlicht: (2022)
von: Goh, Yong Liang, et al.
Veröffentlicht: (2022)
Robust Reinforcement Learning in Finance: Modeling Market Impact with Elliptic Uncertainty Sets
von: Ma, Shaocong, et al.
Veröffentlicht: (2025)
von: Ma, Shaocong, et al.
Veröffentlicht: (2025)
Deep Reinforcement Learning for Traveling Purchaser Problems
von: Yuan, Haofeng, et al.
Veröffentlicht: (2024)
von: Yuan, Haofeng, et al.
Veröffentlicht: (2024)
Solving Integrated Process Planning and Scheduling Problem via Graph Neural Network Based Deep Reinforcement Learning
von: Li, Hongpei, et al.
Veröffentlicht: (2024)
von: Li, Hongpei, et al.
Veröffentlicht: (2024)
Solving Truly Massive Budgeted Monotonic POMDPs with Oracle-Guided Meta-Reinforcement Learning
von: Vora, Manav, et al.
Veröffentlicht: (2024)
von: Vora, Manav, et al.
Veröffentlicht: (2024)
R2L: Reliable Reinforcement Learning: Guaranteed Return & Reliable Policies in Reinforcement Learning
von: Farhi, Nadir
Veröffentlicht: (2025)
von: Farhi, Nadir
Veröffentlicht: (2025)
ART for Diffusion Sampling: A Reinforcement Learning Approach to Timestep Schedule
von: Huang, Yilie, et al.
Veröffentlicht: (2026)
von: Huang, Yilie, et al.
Veröffentlicht: (2026)
CORL: Reinforcement Learning of MILP Policies Solved via Branch and Bound
von: Anand, Akhil S, et al.
Veröffentlicht: (2025)
von: Anand, Akhil S, et al.
Veröffentlicht: (2025)
Closing the Loop: Coordinating Inventory and Recommendation via Deep Reinforcement Learning on Multiple Timescales
von: Jiang, Jinyang, et al.
Veröffentlicht: (2025)
von: Jiang, Jinyang, et al.
Veröffentlicht: (2025)
Painless Federated Learning: An Interplay of Line-Search and Extrapolation
von: Geetika, et al.
Veröffentlicht: (2024)
von: Geetika, et al.
Veröffentlicht: (2024)
When and How Unlabeled Data Provably Improve In-Context Learning
von: Li, Yingcong, et al.
Veröffentlicht: (2025)
von: Li, Yingcong, et al.
Veröffentlicht: (2025)
Contextual Bilevel Reinforcement Learning for Incentive Alignment
von: Thoma, Vinzenz, et al.
Veröffentlicht: (2024)
von: Thoma, Vinzenz, et al.
Veröffentlicht: (2024)
Infinite-Horizon Reach-Avoid Zero-Sum Games via Deep Reinforcement Learning
von: Li, Jingqi, et al.
Veröffentlicht: (2022)
von: Li, Jingqi, et al.
Veröffentlicht: (2022)
Provable Acceleration for Diffusion Models under Minimal Assumptions
von: Li, Gen, et al.
Veröffentlicht: (2024)
von: Li, Gen, et al.
Veröffentlicht: (2024)
Adaptive Primal-Dual Method for Safe Reinforcement Learning
von: Chen, Weiqin, et al.
Veröffentlicht: (2024)
von: Chen, Weiqin, et al.
Veröffentlicht: (2024)
Performative Policy Gradient: Optimality in Performative Reinforcement Learning
von: Basu, Debabrota, et al.
Veröffentlicht: (2025)
von: Basu, Debabrota, et al.
Veröffentlicht: (2025)
Reinforcement Learning for Multi-Truck Vehicle Routing Problems
von: Levin, Joshua, et al.
Veröffentlicht: (2022)
von: Levin, Joshua, et al.
Veröffentlicht: (2022)
Hyperparameter Optimization for Driving Strategies Based on Reinforcement Learning
von: Adde, Nihal Acharya, et al.
Veröffentlicht: (2024)
von: Adde, Nihal Acharya, et al.
Veröffentlicht: (2024)
Correlated Noise Provably Beats Independent Noise for Differentially Private Learning
von: Choquette-Choo, Christopher A., et al.
Veröffentlicht: (2023)
von: Choquette-Choo, Christopher A., et al.
Veröffentlicht: (2023)
Benchmarking Reinforcement Learning via Stochastic Converse Optimality: Generating Systems with Known Optimal Policies
von: Ibrahim, Sinan, et al.
Veröffentlicht: (2026)
von: Ibrahim, Sinan, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
Multi-head Transformers Provably Learn Symbolic Multi-step Reasoning via Gradient Descent
von: Yang, Tong, et al.
Veröffentlicht: (2025) -
Transformers Provably Learn Chain-of-Thought Reasoning with Length Generalization
von: Huang, Yu, et al.
Veröffentlicht: (2025) -
The Implicit Curriculum: Learning Dynamics in RL with Verifiable Rewards
von: Huang, Yu, et al.
Veröffentlicht: (2026) -
In-Context Learning with Representations: Contextual Generalization of Trained Transformers
von: Yang, Tong, et al.
Veröffentlicht: (2024) -
A Theoretical Analysis of Self-Supervised Learning for Vision Transformers
von: Huang, Yu, et al.
Veröffentlicht: (2024)