Reinforced Language Models for Sequential Decision Making
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Dilkes, Jim, Yazdanpanah, Vahid, Stein, Sebastian |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Language Models, Graph Searching, and Supervision Adulteration: When More Supervision is Less and How to Make More More
par: Frydenlund, Arvid
Publié: (2025)
par: Frydenlund, Arvid
Publié: (2025)
Resolving Action Bottleneck: Agentic Reinforcement Learning Informed by Token-Level Energy
par: He, Langzhou, et autres
Publié: (2026)
par: He, Langzhou, et autres
Publié: (2026)
Assisting humans in complex comparisons: automated information comparison at scale
par: Yuen, Truman, et autres
Publié: (2024)
par: Yuen, Truman, et autres
Publié: (2024)
REVOLVE: Optimizing AI Systems by Tracking Response Evolution in Textual Optimization
par: Zhang, Peiyan, et autres
Publié: (2024)
par: Zhang, Peiyan, et autres
Publié: (2024)
Dynamic Policy Induction for Adaptive Prompt Optimization: Bridging the Efficiency-Accuracy Gap via Lightweight Reinforcement Learning
par: Xu, Jiexi
Publié: (2025)
par: Xu, Jiexi
Publié: (2025)
Aligning LLMs on a Budget: Inference-Time Alignment with Heuristic Reward Models
par: Nakamura, Mason, et autres
Publié: (2025)
par: Nakamura, Mason, et autres
Publié: (2025)
Navigating WebAI: Training Agents to Complete Web Tasks with Large Language Models and Reinforcement Learning
par: Thil, Lucas-Andreï, et autres
Publié: (2024)
par: Thil, Lucas-Andreï, et autres
Publié: (2024)
Critical Insights into Leading Conversational AI Models
par: Kohli, Urja, et autres
Publié: (2025)
par: Kohli, Urja, et autres
Publié: (2025)
When Words Change the Model: Sensitivity of LLMs for Constraint Programming Modelling
par: Pellegrino, Alessio, et autres
Publié: (2025)
par: Pellegrino, Alessio, et autres
Publié: (2025)
GraphEval36K: Benchmarking Coding and Reasoning Capabilities of Large Language Models on Graph Datasets
par: Wu, Qiming, et autres
Publié: (2024)
par: Wu, Qiming, et autres
Publié: (2024)
How Clued up are LLMs? Evaluating Multi-Step Deductive Reasoning in a Text-Based Game Environment
par: Ansell, Rebecca, et autres
Publié: (2026)
par: Ansell, Rebecca, et autres
Publié: (2026)
ChatGPT4PCG Competition: Character-like Level Generation for Science Birds
par: Taveekitworachai, Pittawat, et autres
Publié: (2023)
par: Taveekitworachai, Pittawat, et autres
Publié: (2023)
Scaling Trends for Multi-Hop Contextual Reasoning in Mid-Scale Language Models
par: Steele, Brady, et autres
Publié: (2026)
par: Steele, Brady, et autres
Publié: (2026)
Learning Natural Language Constraints for Safe Reinforcement Learning of Language Agents
par: Chua, Jaymari, et autres
Publié: (2025)
par: Chua, Jaymari, et autres
Publié: (2025)
Improving Existing Optimization Algorithms with LLMs
par: Sartori, Camilo Chacón, et autres
Publié: (2025)
par: Sartori, Camilo Chacón, et autres
Publié: (2025)
GEPA: Reflective Prompt Evolution Can Outperform Reinforcement Learning
par: Agrawal, Lakshya A, et autres
Publié: (2025)
par: Agrawal, Lakshya A, et autres
Publié: (2025)
GuardVal: Dynamic Large Language Model Jailbreak Evaluation for Comprehensive Safety Testing
par: Zhang, Peiyan, et autres
Publié: (2025)
par: Zhang, Peiyan, et autres
Publié: (2025)
SCULPT: Constraint-Guided Pruned MCTS that Carves Efficient Paths for Mathematical Reasoning
par: Fang, Qitong, et autres
Publié: (2026)
par: Fang, Qitong, et autres
Publié: (2026)
On the Limits of Learned Importance Scoring for KV Cache Compression
par: Steele, Brady
Publié: (2026)
par: Steele, Brady
Publié: (2026)
MESS+: Dynamically Learned Inference-Time LLM Routing in Model Zoos with Service Level Guarantees
par: Woisetschläger, Herbert, et autres
Publié: (2025)
par: Woisetschläger, Herbert, et autres
Publié: (2025)
Automated Theorem Provers Help Improve Large Language Model Reasoning
par: McGinness, Lachlan, et autres
Publié: (2024)
par: McGinness, Lachlan, et autres
Publié: (2024)
Open-TI: Open Traffic Intelligence with Augmented Language Model
par: Da, Longchao, et autres
Publié: (2023)
par: Da, Longchao, et autres
Publié: (2023)
TrafficRAG: A Multimodal RAG Framework for Traffic Accident Liability Determination
par: Li, Xu, et autres
Publié: (2026)
par: Li, Xu, et autres
Publié: (2026)
ChatGPT4PCG 2 Competition: Prompt Engineering for Science Birds Level Generation
par: Taveekitworachai, Pittawat, et autres
Publié: (2024)
par: Taveekitworachai, Pittawat, et autres
Publié: (2024)
REPOT: Recoverable Program-of-Thought via Checkpoint Repair
par: Mazaheri, Parsa
Publié: (2026)
par: Mazaheri, Parsa
Publié: (2026)
Pioneer Agent: Continual Improvement of Small Language Models in Production
par: Atreja, Dhruv, et autres
Publié: (2026)
par: Atreja, Dhruv, et autres
Publié: (2026)
Game of Thought: Robust Information Seeking with Large Language Models Using Game Theory
par: Cui, Langyuan, et autres
Publié: (2026)
par: Cui, Langyuan, et autres
Publié: (2026)
Tiny QA Benchmark++: Ultra-Lightweight, Synthetic Multilingual Dataset Generation & Smoke-Tests for Continuous LLM Evaluation
par: Koc, Vincent
Publié: (2025)
par: Koc, Vincent
Publié: (2025)
ReaGeo: Reasoning-Enhanced End-to-End Geocoding with LLMs
par: Cui, Jian, et autres
Publié: (2026)
par: Cui, Jian, et autres
Publié: (2026)
Learning, Fast and Slow: Towards LLMs That Adapt Continually
par: Tiwari, Rishabh, et autres
Publié: (2026)
par: Tiwari, Rishabh, et autres
Publié: (2026)
Primary Care Diagnoses as a Reliable Predictor for Orthopedic Surgical Interventions
par: Verma, Khushboo, et autres
Publié: (2025)
par: Verma, Khushboo, et autres
Publié: (2025)
CAPE: Corrective Actions from Precondition Errors using Large Language Models
par: Raman, Shreyas Sundara, et autres
Publié: (2022)
par: Raman, Shreyas Sundara, et autres
Publié: (2022)
Gyan: An Explainable Neuro-Symbolic Language Model
par: Srinivasan, Venkat, et autres
Publié: (2026)
par: Srinivasan, Venkat, et autres
Publié: (2026)
DySK-Attn: A Framework for Efficient, Real-Time Knowledge Updating in Large Language Models via Dynamic Sparse Knowledge Attention
par: Khan, Kabir, et autres
Publié: (2025)
par: Khan, Kabir, et autres
Publié: (2025)
Comparison of Unsupervised Metrics for Evaluating Judicial Decision Extraction
par: Litvak, Ivan Leonidovich, et autres
Publié: (2025)
par: Litvak, Ivan Leonidovich, et autres
Publié: (2025)
GraphWalk: Enabling Reasoning in Large Language Models through Tool-Based Graph Navigation
par: Ghandi, Taraneh, et autres
Publié: (2026)
par: Ghandi, Taraneh, et autres
Publié: (2026)
HiFi-RAG: Hierarchical Content Filtering and Two-Pass Generation for Open-Domain RAG
par: Nuengsigkapian, Cattalyya
Publié: (2025)
par: Nuengsigkapian, Cattalyya
Publié: (2025)
Knowledge Graphs as the Missing Data Layer for LLM-Based Industrial Asset Operations
par: Mandarapu, Madhulatha, et autres
Publié: (2026)
par: Mandarapu, Madhulatha, et autres
Publié: (2026)
FATHOMS-RAG: A Framework for the Assessment of Thinking and Observation in Multimodal Systems that use Retrieval Augmented Generation
par: Hildebrand, Samuel, et autres
Publié: (2025)
par: Hildebrand, Samuel, et autres
Publié: (2025)
Structured Prompting and Feedback-Guided Reasoning with LLMs for Data Interpretation
par: Rath, Amit
Publié: (2025)
par: Rath, Amit
Publié: (2025)
Documents similaires
-
Language Models, Graph Searching, and Supervision Adulteration: When More Supervision is Less and How to Make More More
par: Frydenlund, Arvid
Publié: (2025) -
Resolving Action Bottleneck: Agentic Reinforcement Learning Informed by Token-Level Energy
par: He, Langzhou, et autres
Publié: (2026) -
Assisting humans in complex comparisons: automated information comparison at scale
par: Yuen, Truman, et autres
Publié: (2024) -
REVOLVE: Optimizing AI Systems by Tracking Response Evolution in Textual Optimization
par: Zhang, Peiyan, et autres
Publié: (2024) -
Dynamic Policy Induction for Adaptive Prompt Optimization: Bridging the Efficiency-Accuracy Gap via Lightweight Reinforcement Learning
par: Xu, Jiexi
Publié: (2025)