The Context Gathering Decision Process: A POMDP Framework for Agentic Search
Fuente:
arXiv
Salvato in:
| Autori principali: | Kausik, Chinmaya, Swaminathan, Adith, Kallus, Nathan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
A Theoretical Framework for Partially Observed Reward-States in RLHF
di: Kausik, Chinmaya, et al.
Pubblicazione: (2024)
di: Kausik, Chinmaya, et al.
Pubblicazione: (2024)
Leveraging Offline Data in Linear Latent Contextual Bandits
di: Kausik, Chinmaya, et al.
Pubblicazione: (2024)
di: Kausik, Chinmaya, et al.
Pubblicazione: (2024)
Trace is the Next AutoDiff: Generative Optimization with Rich Feedback, Execution Traces, and LLMs
di: Cheng, Ching-An, et al.
Pubblicazione: (2024)
di: Cheng, Ching-An, et al.
Pubblicazione: (2024)
Efficient and Sharp Off-Policy Evaluation in Robust Markov Decision Processes
di: Bennett, Andrew, et al.
Pubblicazione: (2024)
di: Bennett, Andrew, et al.
Pubblicazione: (2024)
Semiparametric Preference Optimization: Your Language Model is Secretly a Single-Index Model
di: Kallus, Nathan
Pubblicazione: (2025)
di: Kallus, Nathan
Pubblicazione: (2025)
Low-Rank MDPs with Continuous Action Spaces
di: Bennett, Andrew, et al.
Pubblicazione: (2023)
di: Bennett, Andrew, et al.
Pubblicazione: (2023)
Reasoning about Reasoning: BAPO Bounds on Chain-of-Thought Token Complexity in LLMs
di: Tomlinson, Kiran, et al.
Pubblicazione: (2026)
di: Tomlinson, Kiran, et al.
Pubblicazione: (2026)
On Overcoming Miscalibrated Conversational Priors in LLM-based Chatbots
di: Herlihy, Christine, et al.
Pubblicazione: (2024)
di: Herlihy, Christine, et al.
Pubblicazione: (2024)
Lost in Transmission: When and Why LLMs Fail to Reason Globally
di: Schnabel, Tobias, et al.
Pubblicazione: (2025)
di: Schnabel, Tobias, et al.
Pubblicazione: (2025)
Combining Open-box Simulation and Importance Sampling for Tuning Large-Scale Recommenders
di: Paneri, Kaushal, et al.
Pubblicazione: (2024)
di: Paneri, Kaushal, et al.
Pubblicazione: (2024)
Adjusting Regression Models for Conditional Uncertainty Calibration
di: Gao, Ruijiang, et al.
Pubblicazione: (2024)
di: Gao, Ruijiang, et al.
Pubblicazione: (2024)
Rao-Blackwellized POMDP Planning
di: Lee, Jiho, et al.
Pubblicazione: (2024)
di: Lee, Jiho, et al.
Pubblicazione: (2024)
Deep Belief Markov Models for POMDP Inference
di: Arcieri, Giacomo, et al.
Pubblicazione: (2025)
di: Arcieri, Giacomo, et al.
Pubblicazione: (2025)
DiFFPO: Training Diffusion LLMs to Reason Fast and Furious via Reinforcement Learning
di: Zhao, Hanyang, et al.
Pubblicazione: (2025)
di: Zhao, Hanyang, et al.
Pubblicazione: (2025)
Value-Guided Search for Efficient Chain-of-Thought Reasoning
di: Wang, Kaiwen, et al.
Pubblicazione: (2025)
di: Wang, Kaiwen, et al.
Pubblicazione: (2025)
Explanation through Reward Model Reconciliation using POMDP Tree Search
di: Kraske, Benjamin D., et al.
Pubblicazione: (2023)
di: Kraske, Benjamin D., et al.
Pubblicazione: (2023)
Expert-Guided POMDP Learning for Data-Efficient Modeling in Healthcare
di: Locatelli, Marco, et al.
Pubblicazione: (2025)
di: Locatelli, Marco, et al.
Pubblicazione: (2025)
GCA Framework: A GCC Countries-Grounded Dataset and Agentic Pipeline for Climate Decision Support
di: Sheikh, Muhammad Umer, et al.
Pubblicazione: (2026)
di: Sheikh, Muhammad Umer, et al.
Pubblicazione: (2026)
Transformer-Gather, Fuzzy-Reconsider: A Scalable Hybrid Framework for Entity Resolution
di: Sharifi, Mohammadreza, et al.
Pubblicazione: (2025)
di: Sharifi, Mohammadreza, et al.
Pubblicazione: (2025)
Anytime Incremental $ρ$POMDP Planning in Continuous Spaces
di: Benchetrit, Ron, et al.
Pubblicazione: (2025)
di: Benchetrit, Ron, et al.
Pubblicazione: (2025)
Deep Reinforcement Multi-agent Learning framework for Information Gathering with Local Gaussian Processes for Water Monitoring
di: Luis, Samuel Yanes, et al.
Pubblicazione: (2024)
di: Luis, Samuel Yanes, et al.
Pubblicazione: (2024)
Learning Optimal Defender Strategies for CAGE-2 using a POMDP Model
di: Le, Duc Huy, et al.
Pubblicazione: (2025)
di: Le, Duc Huy, et al.
Pubblicazione: (2025)
SOAP-RL: Sequential Option Advantage Propagation for Reinforcement Learning in POMDP Environments
di: Ishida, Shu, et al.
Pubblicazione: (2024)
di: Ishida, Shu, et al.
Pubblicazione: (2024)
On Identifying Why and When Foundation Models Perform Well on Time-Series Forecasting Using Automated Explanations and Rating
di: Widener, Michael, et al.
Pubblicazione: (2025)
di: Widener, Michael, et al.
Pubblicazione: (2025)
Smooth Non-Stationary Bandits
di: Jia, Su, et al.
Pubblicazione: (2023)
di: Jia, Su, et al.
Pubblicazione: (2023)
Optimal Decision Tree Policies for Markov Decision Processes
di: Vos, Daniël, et al.
Pubblicazione: (2023)
di: Vos, Daniël, et al.
Pubblicazione: (2023)
Learning Explainable and Better Performing Representations of POMDP Strategies
di: Bork, Alexander, et al.
Pubblicazione: (2024)
di: Bork, Alexander, et al.
Pubblicazione: (2024)
Double Descent and Overfitting under Noisy Inputs and Distribution Shift for Linear Denoisers
di: Kausik, Chinmaya, et al.
Pubblicazione: (2023)
di: Kausik, Chinmaya, et al.
Pubblicazione: (2023)
Understanding the Challenges in Iterative Generative Optimization with LLMs
di: Nie, Allen, et al.
Pubblicazione: (2026)
di: Nie, Allen, et al.
Pubblicazione: (2026)
Markov Decision Processes under External Temporal Processes
di: Ayyagari, Ranga Shaarad, et al.
Pubblicazione: (2023)
di: Ayyagari, Ranga Shaarad, et al.
Pubblicazione: (2023)
Levin Tree Search with Context Models
di: Orseau, Laurent, et al.
Pubblicazione: (2023)
di: Orseau, Laurent, et al.
Pubblicazione: (2023)
STX-Search: Explanation Search for Continuous Dynamic Spatio-Temporal Models
di: Anwar, Saif, et al.
Pubblicazione: (2025)
di: Anwar, Saif, et al.
Pubblicazione: (2025)
Scaling Agentic Capabilities, Not Context: Efficient Reinforcement Finetuning for Large Toolspaces
di: Gupta, Karan, et al.
Pubblicazione: (2026)
di: Gupta, Karan, et al.
Pubblicazione: (2026)
Understanding the Skill Gap in Recurrent Language Models: The Role of the Gather-and-Aggregate Mechanism
di: Bick, Aviv, et al.
Pubblicazione: (2025)
di: Bick, Aviv, et al.
Pubblicazione: (2025)
SPAARS: Safer RL Policy Alignment through Abstract Exploration and Refined Exploitation of Action Space
di: K, Swaminathan S, et al.
Pubblicazione: (2026)
di: K, Swaminathan S, et al.
Pubblicazione: (2026)
In Search of Trees: Decision-Tree Policy Synthesis for Black-Box Systems via Search
di: Demirović, Emir, et al.
Pubblicazione: (2024)
di: Demirović, Emir, et al.
Pubblicazione: (2024)
Context, Reasoning, and Hierarchy: A Cost-Performance Study of Compound LLM Agent Design in an Adversarial POMDP
di: Bogdanov, Igor, et al.
Pubblicazione: (2026)
di: Bogdanov, Igor, et al.
Pubblicazione: (2026)
Beneficial Reasoning Behaviors in Agentic Search and Effective Post-training to Obtain Them
di: Jin, Jiahe, et al.
Pubblicazione: (2025)
di: Jin, Jiahe, et al.
Pubblicazione: (2025)
Hierarchical Object-Oriented POMDP Planning for Object Rearrangement
di: Mangannavar, Rajesh, et al.
Pubblicazione: (2024)
di: Mangannavar, Rajesh, et al.
Pubblicazione: (2024)
Policy Gradient for Robust Markov Decision Processes
di: Wang, Qiuhao, et al.
Pubblicazione: (2024)
di: Wang, Qiuhao, et al.
Pubblicazione: (2024)
Documenti analoghi
-
A Theoretical Framework for Partially Observed Reward-States in RLHF
di: Kausik, Chinmaya, et al.
Pubblicazione: (2024) -
Leveraging Offline Data in Linear Latent Contextual Bandits
di: Kausik, Chinmaya, et al.
Pubblicazione: (2024) -
Trace is the Next AutoDiff: Generative Optimization with Rich Feedback, Execution Traces, and LLMs
di: Cheng, Ching-An, et al.
Pubblicazione: (2024) -
Efficient and Sharp Off-Policy Evaluation in Robust Markov Decision Processes
di: Bennett, Andrew, et al.
Pubblicazione: (2024) -
Semiparametric Preference Optimization: Your Language Model is Secretly a Single-Index Model
di: Kallus, Nathan
Pubblicazione: (2025)