Salvato in:
| Autori principali: | Zhang, He, Zhou, Ming, Zhai, Shaopeng, Sun, Ying, Xiong, Hui |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2506.21044 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
No Regrets: Investigating and Improving Regret Approximations for Curriculum Discovery
di: Rutherford, Alexander, et al.
Pubblicazione: (2024)
di: Rutherford, Alexander, et al.
Pubblicazione: (2024)
Regret-Based Federated Causal Discovery with Unknown Interventions
di: Baldo, Federico, et al.
Pubblicazione: (2025)
di: Baldo, Federico, et al.
Pubblicazione: (2025)
Skill Weaving: Efficient LLM Improvement via Modular Skillpacks
di: Li, Zhuo, et al.
Pubblicazione: (2026)
di: Li, Zhuo, et al.
Pubblicazione: (2026)
Reference Grounded Skill Discovery
di: Rho, Seungeun, et al.
Pubblicazione: (2025)
di: Rho, Seungeun, et al.
Pubblicazione: (2025)
Agentic Skill Discovery
di: Zhao, Xufeng, et al.
Pubblicazione: (2024)
di: Zhao, Xufeng, et al.
Pubblicazione: (2024)
Proposer-Agent-Evaluator(PAE): Autonomous Skill Discovery For Foundation Model Internet Agents
di: Zhou, Yifei, et al.
Pubblicazione: (2024)
di: Zhou, Yifei, et al.
Pubblicazione: (2024)
Evolutionary Task Discovery: Advancing Reasoning Frontiers via Skill Composition and Complexity Scaling
di: Ye, Liqin, et al.
Pubblicazione: (2026)
di: Ye, Liqin, et al.
Pubblicazione: (2026)
SkillOrchestra: Learning to Route Agents via Skill Transfer
di: Wang, Jiayu, et al.
Pubblicazione: (2026)
di: Wang, Jiayu, et al.
Pubblicazione: (2026)
GoldenStart: Q-Guided Priors and Entropy Control for Distilling Flow Policies
di: Zhang, He, et al.
Pubblicazione: (2026)
di: Zhang, He, et al.
Pubblicazione: (2026)
ReSkill: Reconciling Skill Creation with Policy Optimization in Agentic RL
di: He, Zelin, et al.
Pubblicazione: (2026)
di: He, Zelin, et al.
Pubblicazione: (2026)
Variational Offline Multi-agent Skill Discovery
di: Chen, Jiayu, et al.
Pubblicazione: (2024)
di: Chen, Jiayu, et al.
Pubblicazione: (2024)
Provably Efficient Exploration in Reward Machines with Low Regret
di: Bourel, Hippolyte, et al.
Pubblicazione: (2024)
di: Bourel, Hippolyte, et al.
Pubblicazione: (2024)
Variance-Dependent Regret Lower Bounds for Contextual Bandits
di: He, Jiafan, et al.
Pubblicazione: (2025)
di: He, Jiafan, et al.
Pubblicazione: (2025)
Focused Skill Discovery: Learning to Control Specific State Variables while Minimizing Side Effects
di: Carr, Jonathan Colaço, et al.
Pubblicazione: (2025)
di: Carr, Jonathan Colaço, et al.
Pubblicazione: (2025)
UCPO: Uncertainty-Aware Policy Optimization
di: Zeng, Xianzhou, et al.
Pubblicazione: (2026)
di: Zeng, Xianzhou, et al.
Pubblicazione: (2026)
PROWL: Prioritized Regret-Driven Optimization for World Model Learning
di: Güzel, Ahmet H., et al.
Pubblicazione: (2026)
di: Güzel, Ahmet H., et al.
Pubblicazione: (2026)
Regret-Guided Search Control for Efficient Learning in AlphaZero
di: Tsai, Yun-Jui, et al.
Pubblicazione: (2026)
di: Tsai, Yun-Jui, et al.
Pubblicazione: (2026)
Leveraging Human Feedback for Semantically-Relevant Skill Discovery
di: Hussonnois, Maxence, et al.
Pubblicazione: (2026)
di: Hussonnois, Maxence, et al.
Pubblicazione: (2026)
DRPO: Efficient Reasoning via Decoupled Reward Policy Optimization
di: Li, Gang, et al.
Pubblicazione: (2025)
di: Li, Gang, et al.
Pubblicazione: (2025)
Towards Generalizable PDE Dynamics Forecasting via Physics-Guided Invariant Learning
di: Li, Siyang, et al.
Pubblicazione: (2025)
di: Li, Siyang, et al.
Pubblicazione: (2025)
A Regret Perspective on Online Multiple Testing
di: Hao, Qingyang, et al.
Pubblicazione: (2026)
di: Hao, Qingyang, et al.
Pubblicazione: (2026)
Beyond Shallow Behavior: Task-Efficient Value-Based Multi-Task Offline MARL via Skill Discovery
di: Wang, Xun, et al.
Pubblicazione: (2025)
di: Wang, Xun, et al.
Pubblicazione: (2025)
Missing Premise exacerbates Overthinking: Are Reasoning Models losing Critical Thinking Skill?
di: Fan, Chenrui, et al.
Pubblicazione: (2025)
di: Fan, Chenrui, et al.
Pubblicazione: (2025)
Efficient Differentiable Causal Discovery via Reliable Super-Structure Learning
di: Ma, Pingchuan, et al.
Pubblicazione: (2026)
di: Ma, Pingchuan, et al.
Pubblicazione: (2026)
MMG2Skill: Can Agents Distill In-the-Wild Guides into Self-Evolving Skills?
di: Che, Xinyu, et al.
Pubblicazione: (2026)
di: Che, Xinyu, et al.
Pubblicazione: (2026)
OptSkills: Learning Generalizable Optimization Skills from Problem Archetypes via Cluster-Based Distillation
di: Yang, Haochen, et al.
Pubblicazione: (2026)
di: Yang, Haochen, et al.
Pubblicazione: (2026)
POETS: Uncertainty-Aware LLM Optimization via Compute-Efficient Policy Ensembles
di: Menet, Nicolas, et al.
Pubblicazione: (2026)
di: Menet, Nicolas, et al.
Pubblicazione: (2026)
SUSD: Structured Unsupervised Skill Discovery through State Factorization
di: Hosseini, Seyed Mohammad Hadi, et al.
Pubblicazione: (2026)
di: Hosseini, Seyed Mohammad Hadi, et al.
Pubblicazione: (2026)
Language Guided Skill Discovery
di: Rho, Seungeun, et al.
Pubblicazione: (2024)
di: Rho, Seungeun, et al.
Pubblicazione: (2024)
Benign Overfitting in Adversarial Training for Vision Transformers
di: Zhang, Jiaming, et al.
Pubblicazione: (2026)
di: Zhang, Jiaming, et al.
Pubblicazione: (2026)
Reasoning without Regret
di: Chitra, Tarun
Pubblicazione: (2025)
di: Chitra, Tarun
Pubblicazione: (2025)
Unsupervised Skill Discovery as Exploration for Learning Agile Locomotion
di: Rho, Seungeun, et al.
Pubblicazione: (2025)
di: Rho, Seungeun, et al.
Pubblicazione: (2025)
Adversarial Environment Design via Regret-Guided Diffusion Models
di: Chung, Hojun, et al.
Pubblicazione: (2024)
di: Chung, Hojun, et al.
Pubblicazione: (2024)
Automated Skill Discovery for Language Agents through Exploration and Iterative Feedback
di: Yang, Yongjin, et al.
Pubblicazione: (2025)
di: Yang, Yongjin, et al.
Pubblicazione: (2025)
OSC: Hardware Efficient W4A4 Quantization via Outlier Separation in Channel Dimension
di: Zhang, Zhiyuan, et al.
Pubblicazione: (2026)
di: Zhang, Zhiyuan, et al.
Pubblicazione: (2026)
CATCH: Channel-Aware multivariate Time Series Anomaly Detection via Frequency Patching
di: Wu, Xingjian, et al.
Pubblicazione: (2024)
di: Wu, Xingjian, et al.
Pubblicazione: (2024)
Variance-Dependent Regret Bounds for Non-stationary Linear Bandits
di: Wang, Zhiyong, et al.
Pubblicazione: (2024)
di: Wang, Zhiyong, et al.
Pubblicazione: (2024)
Goal Discovery with Causal Capacity for Efficient Reinforcement Learning
di: Yu, Yan, et al.
Pubblicazione: (2025)
di: Yu, Yan, et al.
Pubblicazione: (2025)
Job-SDF: A Multi-Granularity Dataset for Job Skill Demand Forecasting and Benchmarking
di: Chen, Xi, et al.
Pubblicazione: (2024)
di: Chen, Xi, et al.
Pubblicazione: (2024)
Minimax Optimal Variance-Aware Regret Bounds for Multinomial Logistic MDPs
di: Boudart, Pierre, et al.
Pubblicazione: (2026)
di: Boudart, Pierre, et al.
Pubblicazione: (2026)
Documenti analoghi
-
No Regrets: Investigating and Improving Regret Approximations for Curriculum Discovery
di: Rutherford, Alexander, et al.
Pubblicazione: (2024) -
Regret-Based Federated Causal Discovery with Unknown Interventions
di: Baldo, Federico, et al.
Pubblicazione: (2025) -
Skill Weaving: Efficient LLM Improvement via Modular Skillpacks
di: Li, Zhuo, et al.
Pubblicazione: (2026) -
Reference Grounded Skill Discovery
di: Rho, Seungeun, et al.
Pubblicazione: (2025) -
Agentic Skill Discovery
di: Zhao, Xufeng, et al.
Pubblicazione: (2024)