Maximizing Rollout Informativeness under a Fixed Budget: A Submodular View of Tree Search for Tool-Use Agentic Reinforcement Learning
Fuente:
arXiv
Salvato in:
| Autori principali: | Hu, Yuelin, Yu, Zhenbo, Cheng, Zhengxue, Liu, Wei, Song, Li |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
XAutoLM: Efficient Fine-Tuning of Language Models via Meta-Learning and AutoML
di: Estevanell-Valladares, Ernesto L., et al.
Pubblicazione: (2025)
di: Estevanell-Valladares, Ernesto L., et al.
Pubblicazione: (2025)
Murphys Laws of AI Alignment: Why the Gap Always Wins
di: Gaikwad, Madhava
Pubblicazione: (2025)
di: Gaikwad, Madhava
Pubblicazione: (2025)
Emotion-Inspired Learning Signals (EILS): A Homeostatic Framework for Adaptive Autonomous Agents
di: Tiwari, Dhruv
Pubblicazione: (2025)
di: Tiwari, Dhruv
Pubblicazione: (2025)
Vis-CoT: A Human-in-the-Loop Framework for Interactive Visualization and Intervention in LLM Chain-of-Thought Reasoning
di: Pather, Kaviraj, et al.
Pubblicazione: (2025)
di: Pather, Kaviraj, et al.
Pubblicazione: (2025)
UniPROT: Uniform Prototype Selection via Partial Optimal Transport with Submodular Guarantees
di: Chanda, Prateek, et al.
Pubblicazione: (2026)
di: Chanda, Prateek, et al.
Pubblicazione: (2026)
RoboMoRe: LLM-based Robot Co-design via Joint Optimization of Morphology and Reward
di: Fang, Jiawei, et al.
Pubblicazione: (2025)
di: Fang, Jiawei, et al.
Pubblicazione: (2025)
Approaches to Semantic Textual Similarity in Slovak Language: From Algorithms to Transformers
di: Radosky, Lukas, et al.
Pubblicazione: (2026)
di: Radosky, Lukas, et al.
Pubblicazione: (2026)
Adaptive Minds: Empowering Agents with LoRA-as-Tools
di: Shekar, Pavan C, et al.
Pubblicazione: (2025)
di: Shekar, Pavan C, et al.
Pubblicazione: (2025)
Generative AI and the Transformation of Software Development Practices
di: Acharya, Vivek
Pubblicazione: (2025)
di: Acharya, Vivek
Pubblicazione: (2025)
Streaming Continual Learning for Unified Adaptive Intelligence in Dynamic Environments
di: Giannini, Federico, et al.
Pubblicazione: (2026)
di: Giannini, Federico, et al.
Pubblicazione: (2026)
Empirical Evaluation of QAOA with Zero Noise Extrapolation on NISQ Hardware for Carbon Credit Portfolio Optimization in the Brazilian Cerrado
di: Ribeiro, Hugo José
Pubblicazione: (2026)
di: Ribeiro, Hugo José
Pubblicazione: (2026)
CogniLoad: A Synthetic Natural Language Reasoning Benchmark With Tunable Length, Intrinsic Difficulty, and Distractor Density
di: Kaiser, Daniel, et al.
Pubblicazione: (2025)
di: Kaiser, Daniel, et al.
Pubblicazione: (2025)
Intersymbolic AI: Interlinking Symbolic AI and Subsymbolic AI
di: Platzer, André
Pubblicazione: (2024)
di: Platzer, André
Pubblicazione: (2024)
Diffusion-MPC in Discrete Domains: Feasibility Constraints, Horizon Effects, and Critic Alignment: Case study with Tetris
di: Wang, Haochuan Kevin
Pubblicazione: (2026)
di: Wang, Haochuan Kevin
Pubblicazione: (2026)
optimize_anything: A Universal API for Optimizing any Text Parameter
di: Agrawal, Lakshya A, et al.
Pubblicazione: (2026)
di: Agrawal, Lakshya A, et al.
Pubblicazione: (2026)
Think-at-Hard: Selective Latent Iterations to Improve Reasoning Language Models
di: Fu, Tianyu, et al.
Pubblicazione: (2025)
di: Fu, Tianyu, et al.
Pubblicazione: (2025)
Enhancing Diversity in Multi-objective Feature Selection
di: Miyandoab, Sevil Zanjani, et al.
Pubblicazione: (2024)
di: Miyandoab, Sevil Zanjani, et al.
Pubblicazione: (2024)
Improving LLM Agent Planning with In-Context Learning via Atomic Fact Augmentation and Lookahead Search
di: Holt, Samuel, et al.
Pubblicazione: (2025)
di: Holt, Samuel, et al.
Pubblicazione: (2025)
An Improved Adaptive PID Optimizer with Enhanced Convergence and Stability for Deep Learning
di: Saini, Saurabh, et al.
Pubblicazione: (2026)
di: Saini, Saurabh, et al.
Pubblicazione: (2026)
SALE-Based Offline Reinforcement Learning with Ensemble Q-Networks
di: Chun, Zheng
Pubblicazione: (2025)
di: Chun, Zheng
Pubblicazione: (2025)
AI Agents: Evolution, Architecture, and Real-World Applications
di: Krishnan, Naveen
Pubblicazione: (2025)
di: Krishnan, Naveen
Pubblicazione: (2025)
Discovering Algorithms with Computational Language Processing
di: Bourdais, Theo, et al.
Pubblicazione: (2025)
di: Bourdais, Theo, et al.
Pubblicazione: (2025)
CAPE: Corrective Actions from Precondition Errors using Large Language Models
di: Raman, Shreyas Sundara, et al.
Pubblicazione: (2022)
di: Raman, Shreyas Sundara, et al.
Pubblicazione: (2022)
PLUGH: A Benchmark for Spatial Understanding and Reasoning in Large Language Models
di: Tikhonov, Alexey
Pubblicazione: (2024)
di: Tikhonov, Alexey
Pubblicazione: (2024)
EvoPref: Multi-Objective Evolutionary Optimization Discovers Diverse LLM Alignments Beyond Gradient Descent
di: Guo, Dongxin, et al.
Pubblicazione: (2026)
di: Guo, Dongxin, et al.
Pubblicazione: (2026)
Parameter-Efficient Neuroevolution for Diverse LLM Generation: Quality-Diversity Optimization via Prompt Embedding Evolution
di: Guo, Dongxin, et al.
Pubblicazione: (2026)
di: Guo, Dongxin, et al.
Pubblicazione: (2026)
Dual-Channel Feature Fusion for Joint Prediction in Dynamic Signed Weighted Networks
di: Zhang, Gaoxin, et al.
Pubblicazione: (2026)
di: Zhang, Gaoxin, et al.
Pubblicazione: (2026)
DISC: Dynamic Decomposition Improves LLM Inference Scaling
di: Light, Jonathan, et al.
Pubblicazione: (2025)
di: Light, Jonathan, et al.
Pubblicazione: (2025)
A Structural Threshold in Decision Capacity Governs Collapse in Self-Play Reinforcement Learning
di: Kujur, Arahan
Pubblicazione: (2026)
di: Kujur, Arahan
Pubblicazione: (2026)
A Comparison Between Decision Transformers and Traditional Offline Reinforcement Learning Algorithms
di: Caunhye, Ali Murtaza, et al.
Pubblicazione: (2025)
di: Caunhye, Ali Murtaza, et al.
Pubblicazione: (2025)
SMOSE: Sparse Mixture of Shallow Experts for Interpretable Reinforcement Learning in Continuous Control Tasks
di: Vincze, Mátyás, et al.
Pubblicazione: (2024)
di: Vincze, Mátyás, et al.
Pubblicazione: (2024)
Evolving machine learning workflows through interactive AutoML
di: Barbudo, Rafael, et al.
Pubblicazione: (2024)
di: Barbudo, Rafael, et al.
Pubblicazione: (2024)
Self-Supervised On-Policy Reinforcement Learning via Contrastive Proximal Policy Optimisation
di: Osman, Asim, et al.
Pubblicazione: (2026)
di: Osman, Asim, et al.
Pubblicazione: (2026)
Computational Hardness of Reinforcement Learning with Partial $q^π$-Realizability
di: Karimi, Shayan, et al.
Pubblicazione: (2025)
di: Karimi, Shayan, et al.
Pubblicazione: (2025)
The Geometry of Thought: Disclosing the Transformer as a Tropical Polynomial Circuit
di: Alpay, Faruk, et al.
Pubblicazione: (2026)
di: Alpay, Faruk, et al.
Pubblicazione: (2026)
STRIDE: A Self-Reflective Agent Framework for Reliable Automatic Equation Discovery
di: Su, Jiarui, et al.
Pubblicazione: (2026)
di: Su, Jiarui, et al.
Pubblicazione: (2026)
BudgetMLAgent: A Cost-Effective LLM Multi-Agent system for Automating Machine Learning Tasks
di: Gandhi, Shubham, et al.
Pubblicazione: (2024)
di: Gandhi, Shubham, et al.
Pubblicazione: (2024)
Context Engineering for Multi-Agent LLM Code Assistants Using Elicit, NotebookLM, ChatGPT, and Claude Code
di: Haseeb, Muhammad
Pubblicazione: (2025)
di: Haseeb, Muhammad
Pubblicazione: (2025)
Generative AI in Transportation Planning: A Survey
di: Da, Longchao, et al.
Pubblicazione: (2025)
di: Da, Longchao, et al.
Pubblicazione: (2025)
Practical Quantum CIM Empowerment via All-Domestic-Core Agentic Large Model
di: Rui, Wang, et al.
Pubblicazione: (2026)
di: Rui, Wang, et al.
Pubblicazione: (2026)
Documenti analoghi
-
XAutoLM: Efficient Fine-Tuning of Language Models via Meta-Learning and AutoML
di: Estevanell-Valladares, Ernesto L., et al.
Pubblicazione: (2025) -
Murphys Laws of AI Alignment: Why the Gap Always Wins
di: Gaikwad, Madhava
Pubblicazione: (2025) -
Emotion-Inspired Learning Signals (EILS): A Homeostatic Framework for Adaptive Autonomous Agents
di: Tiwari, Dhruv
Pubblicazione: (2025) -
Vis-CoT: A Human-in-the-Loop Framework for Interactive Visualization and Intervention in LLM Chain-of-Thought Reasoning
di: Pather, Kaviraj, et al.
Pubblicazione: (2025) -
UniPROT: Uniform Prototype Selection via Partial Optimal Transport with Submodular Guarantees
di: Chanda, Prateek, et al.
Pubblicazione: (2026)