Revisiting DAgger in the Era of LLM-Agents
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Changhao, Qiang, Rushi, Huang, Jiawei, Gao, Chenxiao, Zhang, Chao, He, Niao, Dai, Bo |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Exploration-Driven Optimization for Test-Time Large Language Model Reasoning
di: Li, Changhao, et al.
Pubblicazione: (2026)
di: Li, Changhao, et al.
Pubblicazione: (2026)
Matryoshka Pilot: Learning to Drive Black-Box LLMs with LLMs
di: Li, Changhao, et al.
Pubblicazione: (2024)
di: Li, Changhao, et al.
Pubblicazione: (2024)
MLE-Dojo: Interactive Environments for Empowering LLM Agents in Machine Learning Engineering
di: Qiang, Rushi, et al.
Pubblicazione: (2025)
di: Qiang, Rushi, et al.
Pubblicazione: (2025)
Robust Knowledge Transfer in Tiered Reinforcement Learning
di: Huang, Jiawei, et al.
Pubblicazione: (2023)
di: Huang, Jiawei, et al.
Pubblicazione: (2023)
Steering No-Regret Agents in MFGs under Model Uncertainty
di: Widmer, Leo, et al.
Pubblicazione: (2025)
di: Widmer, Leo, et al.
Pubblicazione: (2025)
Model-Based RL for Mean-Field Games is not Statistically Harder than Single-Agent RL
di: Huang, Jiawei, et al.
Pubblicazione: (2024)
di: Huang, Jiawei, et al.
Pubblicazione: (2024)
MLE-Smith: Scaling MLE Tasks with Automated Multi-Agent Pipeline
di: Qiang, Rushi, et al.
Pubblicazione: (2025)
di: Qiang, Rushi, et al.
Pubblicazione: (2025)
On the Statistical Efficiency of Mean-Field Reinforcement Learning with General Function Approximation
di: Huang, Jiawei, et al.
Pubblicazione: (2023)
di: Huang, Jiawei, et al.
Pubblicazione: (2023)
HYDRA: Model Factorization Framework for Black-Box LLM Personalization
di: Zhuang, Yuchen, et al.
Pubblicazione: (2024)
di: Zhuang, Yuchen, et al.
Pubblicazione: (2024)
Can RLHF be More Efficient with Imperfect Reward Models? A Policy Coverage Perspective
di: Huang, Jiawei, et al.
Pubblicazione: (2025)
di: Huang, Jiawei, et al.
Pubblicazione: (2025)
Data-Efficient Multitask DAgger
di: Fu, Haotian, et al.
Pubblicazione: (2025)
di: Fu, Haotian, et al.
Pubblicazione: (2025)
Learning to Steer Markovian Agents under Model Uncertainty
di: Huang, Jiawei, et al.
Pubblicazione: (2024)
di: Huang, Jiawei, et al.
Pubblicazione: (2024)
FlowRL: A Taxonomy and Modular Framework for Reinforcement Learning with Diffusion Policies
di: Gao, Chenxiao, et al.
Pubblicazione: (2026)
di: Gao, Chenxiao, et al.
Pubblicazione: (2026)
Implicit Regularization of Sharpness-Aware Minimization for Scale-Invariant Problems
di: Li, Bingcong, et al.
Pubblicazione: (2024)
di: Li, Bingcong, et al.
Pubblicazione: (2024)
Exploiting Approximate Symmetry for Efficient Multi-Agent Reinforcement Learning
di: Yardim, Batuhan, et al.
Pubblicazione: (2024)
di: Yardim, Batuhan, et al.
Pubblicazione: (2024)
BiLoRA: A Bi-level Optimization Framework for Overfitting-Resilient Low-Rank Adaptation of Large Pre-trained Models
di: Qiang, Rushi, et al.
Pubblicazione: (2024)
di: Qiang, Rushi, et al.
Pubblicazione: (2024)
MEGA-DAgger: Imitation Learning with Multiple Imperfect Experts
di: Sun, Xiatao, et al.
Pubblicazione: (2023)
di: Sun, Xiatao, et al.
Pubblicazione: (2023)
Spectral Representation-based Reinforcement Learning
di: Gao, Chenxiao, et al.
Pubblicazione: (2025)
di: Gao, Chenxiao, et al.
Pubblicazione: (2025)
AmorLIP: Efficient Language-Image Pretraining via Amortization
di: Sun, Haotian, et al.
Pubblicazione: (2025)
di: Sun, Haotian, et al.
Pubblicazione: (2025)
Gaussian Mixture Vector Quantization with Aggregated Categorical Posterior
di: Yan, Mingyuan, et al.
Pubblicazione: (2024)
di: Yan, Mingyuan, et al.
Pubblicazione: (2024)
Decoupling KL and Trajectories: A Unified Perspective for SFT, DAgger, Offline RL, and OPD in LLM Distillation
di: Zhao, Anhao, et al.
Pubblicazione: (2026)
di: Zhao, Anhao, et al.
Pubblicazione: (2026)
UDora: A Unified Red Teaming Framework against LLM Agents by Dynamically Hijacking Their Own Reasoning
di: Zhang, Jiawei, et al.
Pubblicazione: (2025)
di: Zhang, Jiawei, et al.
Pubblicazione: (2025)
Primal Methods for Variational Inequality Problems with Functional Constraints
di: Zhang, Liang, et al.
Pubblicazione: (2024)
di: Zhang, Liang, et al.
Pubblicazione: (2024)
TiAda: A Time-scale Adaptive Algorithm for Nonconvex Minimax Optimization
di: Li, Xiang, et al.
Pubblicazione: (2022)
di: Li, Xiang, et al.
Pubblicazione: (2022)
A Convex Framework for Confounding Robust Inference
di: Ishikawa, Kei, et al.
Pubblicazione: (2023)
di: Ishikawa, Kei, et al.
Pubblicazione: (2023)
A Hessian-Aware Stochastic Differential Equation for Modelling SGD
di: Li, Xiang, et al.
Pubblicazione: (2024)
di: Li, Xiang, et al.
Pubblicazione: (2024)
Diffusion Meets DAgger: Supercharging Eye-in-hand Imitation Learning
di: Zhang, Xiaoyu, et al.
Pubblicazione: (2024)
di: Zhang, Xiaoyu, et al.
Pubblicazione: (2024)
Compliant Residual DAgger: Improving Real-World Contact-Rich Manipulation with Human Corrections
di: Xu, Xiaomeng, et al.
Pubblicazione: (2025)
di: Xu, Xiaomeng, et al.
Pubblicazione: (2025)
Manifold Generalization Provably Proceeds Memorization in Diffusion Models
di: Shen, Zebang, et al.
Pubblicazione: (2026)
di: Shen, Zebang, et al.
Pubblicazione: (2026)
GuardAgent: Safeguard LLM Agents by a Guard Agent via Knowledge-Enabled Reasoning
di: Xiang, Zhen, et al.
Pubblicazione: (2024)
di: Xiang, Zhen, et al.
Pubblicazione: (2024)
From Gradient Clipping to Normalization for Heavy Tailed SGD
di: Hübler, Florian, et al.
Pubblicazione: (2024)
di: Hübler, Florian, et al.
Pubblicazione: (2024)
Linear Convergence of Entropy-Regularized Natural Policy Gradient with Linear Function Approximation
di: Cayci, Semih, et al.
Pubblicazione: (2021)
di: Cayci, Semih, et al.
Pubblicazione: (2021)
ANCRe: Adaptive Neural Connection Reassignment for Efficient Depth Scaling
di: Zhang, Yilang, et al.
Pubblicazione: (2026)
di: Zhang, Yilang, et al.
Pubblicazione: (2026)
TubeDAgger: Reducing the Number of Expert Interventions with Stochastic Reach-Tubes
di: Lemmel, Julian, et al.
Pubblicazione: (2025)
di: Lemmel, Julian, et al.
Pubblicazione: (2025)
When Scores Learn Geometry: Rate Separations under the Manifold Hypothesis
di: Li, Xiang, et al.
Pubblicazione: (2025)
di: Li, Xiang, et al.
Pubblicazione: (2025)
CubeDAgger: Interactive Imitation Learning for Dynamic Systems with Efficient yet Low-risk Interaction
di: Kobayashi, Taisuke
Pubblicazione: (2025)
di: Kobayashi, Taisuke
Pubblicazione: (2025)
On the Benefits of Weight Normalization for Overparameterized Matrix Sensing
di: Wei, Yudong, et al.
Pubblicazione: (2025)
di: Wei, Yudong, et al.
Pubblicazione: (2025)
On the Crucial Role of Initialization for Matrix Factorization
di: Li, Bingcong, et al.
Pubblicazione: (2024)
di: Li, Bingcong, et al.
Pubblicazione: (2024)
Optimal Guarantees for Algorithmic Reproducibility and Gradient Complexity in Convex Optimization
di: Zhang, Liang, et al.
Pubblicazione: (2023)
di: Zhang, Liang, et al.
Pubblicazione: (2023)
Biased Stochastic First-Order Methods for Conditional Stochastic Optimization and Applications in Meta Learning
di: Hu, Yifan, et al.
Pubblicazione: (2020)
di: Hu, Yifan, et al.
Pubblicazione: (2020)
Documenti analoghi
-
Exploration-Driven Optimization for Test-Time Large Language Model Reasoning
di: Li, Changhao, et al.
Pubblicazione: (2026) -
Matryoshka Pilot: Learning to Drive Black-Box LLMs with LLMs
di: Li, Changhao, et al.
Pubblicazione: (2024) -
MLE-Dojo: Interactive Environments for Empowering LLM Agents in Machine Learning Engineering
di: Qiang, Rushi, et al.
Pubblicazione: (2025) -
Robust Knowledge Transfer in Tiered Reinforcement Learning
di: Huang, Jiawei, et al.
Pubblicazione: (2023) -
Steering No-Regret Agents in MFGs under Model Uncertainty
di: Widmer, Leo, et al.
Pubblicazione: (2025)