Resolving Action Bottleneck: Agentic Reinforcement Learning Informed by Token-Level Energy
Fuente:
arXiv
Salvato in:
| Autori principali: | He, Langzhou, Zhu, Junyou, Zhou, Yue, Gu, Zhengyao, Liu, Junhua, Huang, Wei-Chieh, Zou, Henry Peng, Wipf, David, Yu, Philip S., Wu, Qitian |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
ChatGPT4PCG 2 Competition: Prompt Engineering for Science Birds Level Generation
di: Taveekitworachai, Pittawat, et al.
Pubblicazione: (2024)
di: Taveekitworachai, Pittawat, et al.
Pubblicazione: (2024)
An Explainable Collaborative Dialogue System using a Theory of Mind
di: Cohen, Philip R., et al.
Pubblicazione: (2023)
di: Cohen, Philip R., et al.
Pubblicazione: (2023)
Can AI Assist in Olympiad Coding
di: Ren, Samuel
Pubblicazione: (2025)
di: Ren, Samuel
Pubblicazione: (2025)
Learning Natural Language Constraints for Safe Reinforcement Learning of Language Agents
di: Chua, Jaymari, et al.
Pubblicazione: (2025)
di: Chua, Jaymari, et al.
Pubblicazione: (2025)
Open-TI: Open Traffic Intelligence with Augmented Language Model
di: Da, Longchao, et al.
Pubblicazione: (2023)
di: Da, Longchao, et al.
Pubblicazione: (2023)
From Search to Reasoning: A Five-Level RAG Capability Framework for Enterprise Data
di: Gill, Gurbinder, et al.
Pubblicazione: (2025)
di: Gill, Gurbinder, et al.
Pubblicazione: (2025)
GraphWalk: Enabling Reasoning in Large Language Models through Tool-Based Graph Navigation
di: Ghandi, Taraneh, et al.
Pubblicazione: (2026)
di: Ghandi, Taraneh, et al.
Pubblicazione: (2026)
TrafficRAG: A Multimodal RAG Framework for Traffic Accident Liability Determination
di: Li, Xu, et al.
Pubblicazione: (2026)
di: Li, Xu, et al.
Pubblicazione: (2026)
FATHOMS-RAG: A Framework for the Assessment of Thinking and Observation in Multimodal Systems that use Retrieval Augmented Generation
di: Hildebrand, Samuel, et al.
Pubblicazione: (2025)
di: Hildebrand, Samuel, et al.
Pubblicazione: (2025)
MESS+: Dynamically Learned Inference-Time LLM Routing in Model Zoos with Service Level Guarantees
di: Woisetschläger, Herbert, et al.
Pubblicazione: (2025)
di: Woisetschläger, Herbert, et al.
Pubblicazione: (2025)
Survey Transfer Learning: Recycling Data with Silicon Responses
di: Amini, Ali
Pubblicazione: (2025)
di: Amini, Ali
Pubblicazione: (2025)
ChatGPT4PCG Competition: Character-like Level Generation for Science Birds
di: Taveekitworachai, Pittawat, et al.
Pubblicazione: (2023)
di: Taveekitworachai, Pittawat, et al.
Pubblicazione: (2023)
ConfProBench: A Confidence Evaluation Benchmark for MLLM-Based Process Judges
di: Zhou, Yue, et al.
Pubblicazione: (2025)
di: Zhou, Yue, et al.
Pubblicazione: (2025)
Learning, Fast and Slow: Towards LLMs That Adapt Continually
di: Tiwari, Rishabh, et al.
Pubblicazione: (2026)
di: Tiwari, Rishabh, et al.
Pubblicazione: (2026)
SCULPT: Constraint-Guided Pruned MCTS that Carves Efficient Paths for Mathematical Reasoning
di: Fang, Qitong, et al.
Pubblicazione: (2026)
di: Fang, Qitong, et al.
Pubblicazione: (2026)
On the Limits of Learned Importance Scoring for KV Cache Compression
di: Steele, Brady
Pubblicazione: (2026)
di: Steele, Brady
Pubblicazione: (2026)
Scaling Trends for Multi-Hop Contextual Reasoning in Mid-Scale Language Models
di: Steele, Brady, et al.
Pubblicazione: (2026)
di: Steele, Brady, et al.
Pubblicazione: (2026)
The Reasoning-Creativity Trade-off: Toward Creativity-Driven Problem Solving
di: Luyten, Max Ruiz, et al.
Pubblicazione: (2026)
di: Luyten, Max Ruiz, et al.
Pubblicazione: (2026)
Evo-DKD: Dual-Knowledge Decoding for Autonomous Ontology Evolution in Large Language Models
di: Raman, Vishal, et al.
Pubblicazione: (2025)
di: Raman, Vishal, et al.
Pubblicazione: (2025)
Dynamic Policy Induction for Adaptive Prompt Optimization: Bridging the Efficiency-Accuracy Gap via Lightweight Reinforcement Learning
di: Xu, Jiexi
Pubblicazione: (2025)
di: Xu, Jiexi
Pubblicazione: (2025)
EMOS: Embodiment-aware Heterogeneous Multi-robot Operating System with LLM Agents
di: Chen, Junting, et al.
Pubblicazione: (2024)
di: Chen, Junting, et al.
Pubblicazione: (2024)
Deployment-Time Reliability of Learned Robot Policies
di: Agia, Christopher
Pubblicazione: (2026)
di: Agia, Christopher
Pubblicazione: (2026)
GEPA: Reflective Prompt Evolution Can Outperform Reinforcement Learning
di: Agrawal, Lakshya A, et al.
Pubblicazione: (2025)
di: Agrawal, Lakshya A, et al.
Pubblicazione: (2025)
CSR: Infinite-Horizon Real-Time Policies with Massive Cached State Representations
di: Karlsson, Robin, et al.
Pubblicazione: (2026)
di: Karlsson, Robin, et al.
Pubblicazione: (2026)
How Clued up are LLMs? Evaluating Multi-Step Deductive Reasoning in a Text-Based Game Environment
di: Ansell, Rebecca, et al.
Pubblicazione: (2026)
di: Ansell, Rebecca, et al.
Pubblicazione: (2026)
Critical Insights into Leading Conversational AI Models
di: Kohli, Urja, et al.
Pubblicazione: (2025)
di: Kohli, Urja, et al.
Pubblicazione: (2025)
When Words Change the Model: Sensitivity of LLMs for Constraint Programming Modelling
di: Pellegrino, Alessio, et al.
Pubblicazione: (2025)
di: Pellegrino, Alessio, et al.
Pubblicazione: (2025)
Reinforced Language Models for Sequential Decision Making
di: Dilkes, Jim, et al.
Pubblicazione: (2025)
di: Dilkes, Jim, et al.
Pubblicazione: (2025)
MOCHA: Multi-Objective Chebyshev Annealing for Agent Skill Optimization
di: Tanjim, Md Mehrab, et al.
Pubblicazione: (2026)
di: Tanjim, Md Mehrab, et al.
Pubblicazione: (2026)
Dynamics of COVID-19 Misinformation: An Analysis of Conspiracy Theories, Fake Remedies, and False Reports
di: Thakur, Nirmalya, et al.
Pubblicazione: (2025)
di: Thakur, Nirmalya, et al.
Pubblicazione: (2025)
Procedural Game Level Design with Deep Reinforcement Learning
di: Özkan, Miraç Buğra
Pubblicazione: (2025)
di: Özkan, Miraç Buğra
Pubblicazione: (2025)
AI and Machine Learning Approaches for Predicting Nanoparticles Toxicity The Critical Role of Physiochemical Properties
di: Yousaf, Iqra
Pubblicazione: (2024)
di: Yousaf, Iqra
Pubblicazione: (2024)
CAPE: Corrective Actions from Precondition Errors using Large Language Models
di: Raman, Shreyas Sundara, et al.
Pubblicazione: (2022)
di: Raman, Shreyas Sundara, et al.
Pubblicazione: (2022)
The Final-Stage Bottleneck: A Systematic Dissection of the R-Learner for Network Causal Inference
di: Sairam, S, et al.
Pubblicazione: (2025)
di: Sairam, S, et al.
Pubblicazione: (2025)
TRIZ Agents: A Multi-Agent LLM Approach for TRIZ-Based Innovation
di: Szczepanik, Kamil, et al.
Pubblicazione: (2025)
di: Szczepanik, Kamil, et al.
Pubblicazione: (2025)
Collaborative LLM Agents for C4 Software Architecture Design Automation
di: Szczepanik, Kamil, et al.
Pubblicazione: (2025)
di: Szczepanik, Kamil, et al.
Pubblicazione: (2025)
Comparing Apples to Oranges: LLM-powered Multimodal Intention Prediction in an Object Categorization Task
di: Ali, Hassan, et al.
Pubblicazione: (2024)
di: Ali, Hassan, et al.
Pubblicazione: (2024)
Aligning LLMs on a Budget: Inference-Time Alignment with Heuristic Reward Models
di: Nakamura, Mason, et al.
Pubblicazione: (2025)
di: Nakamura, Mason, et al.
Pubblicazione: (2025)
XAutoLM: Efficient Fine-Tuning of Language Models via Meta-Learning and AutoML
di: Estevanell-Valladares, Ernesto L., et al.
Pubblicazione: (2025)
di: Estevanell-Valladares, Ernesto L., et al.
Pubblicazione: (2025)
Predicting Future Actions of Reinforcement Learning Agents
di: Chung, Stephen, et al.
Pubblicazione: (2024)
di: Chung, Stephen, et al.
Pubblicazione: (2024)
Documenti analoghi
-
ChatGPT4PCG 2 Competition: Prompt Engineering for Science Birds Level Generation
di: Taveekitworachai, Pittawat, et al.
Pubblicazione: (2024) -
An Explainable Collaborative Dialogue System using a Theory of Mind
di: Cohen, Philip R., et al.
Pubblicazione: (2023) -
Can AI Assist in Olympiad Coding
di: Ren, Samuel
Pubblicazione: (2025) -
Learning Natural Language Constraints for Safe Reinforcement Learning of Language Agents
di: Chua, Jaymari, et al.
Pubblicazione: (2025) -
Open-TI: Open Traffic Intelligence with Augmented Language Model
di: Da, Longchao, et al.
Pubblicazione: (2023)