Strategist: Self-improvement of LLM Decision Making via Bi-Level Tree Search
Fuente:
arXiv
Saved in:
| Main Authors: | Light, Jonathan, Cai, Min, Chen, Weiqin, Wang, Guanzhi, Chen, Xiusi, Cheng, Wei, Yue, Yisong, Hu, Ziniu |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
PIANIST: Learning Partially Observable World Models with LLMs for Multi-Agent Decision Making
by: Light, Jonathan, et al.
Published: (2024)
by: Light, Jonathan, et al.
Published: (2024)
TDRM: Smooth Reward Models with Temporal Difference for LLM RL and Inference
by: Zhang, Dan, et al.
Published: (2025)
by: Zhang, Dan, et al.
Published: (2025)
ReST-MCTS*: LLM Self-Training via Process Reward Guided Tree Search
by: Zhang, Dan, et al.
Published: (2024)
by: Zhang, Dan, et al.
Published: (2024)
Dataset Distillation for Offline Reinforcement Learning
by: Light, Jonathan, et al.
Published: (2024)
by: Light, Jonathan, et al.
Published: (2024)
Self-Control of LLM Behaviors by Compressing Suffix Gradient into Prefix Controller
by: Cai, Min, et al.
Published: (2024)
by: Cai, Min, et al.
Published: (2024)
Scattered Forest Search: Smarter Code Space Exploration with LLMs
by: Light, Jonathan, et al.
Published: (2024)
by: Light, Jonathan, et al.
Published: (2024)
DISC: Dynamic Decomposition Improves LLM Inference Scaling
by: Light, Jonathan, et al.
Published: (2025)
by: Light, Jonathan, et al.
Published: (2025)
DataSciBench: An LLM Agent Benchmark for Data Science
by: Zhang, Dan, et al.
Published: (2025)
by: Zhang, Dan, et al.
Published: (2025)
Unifying and Optimizing Data Values for Selection via Sequential Decision-Making
by: Chi, Hongliang, et al.
Published: (2025)
by: Chi, Hongliang, et al.
Published: (2025)
Self-Evolving Visual Concept Library using Vision-Language Critics
by: Sehgal, Atharva, et al.
Published: (2025)
by: Sehgal, Atharva, et al.
Published: (2025)
PlayBest: Professional Basketball Player Behavior Synthesis via Planning with Diffusion
by: Chen, Xiusi, et al.
Published: (2023)
by: Chen, Xiusi, et al.
Published: (2023)
TreeRL: LLM Reinforcement Learning with On-Policy Tree Search
by: Hou, Zhenyu, et al.
Published: (2025)
by: Hou, Zhenyu, et al.
Published: (2025)
Rx Strategist: Prescription Verification using LLM Agents System
by: Van, Phuc Phan, et al.
Published: (2024)
by: Van, Phuc Phan, et al.
Published: (2024)
DecisionFlow: Advancing Large Language Model as Principled Decision Maker
by: Chen, Xiusi, et al.
Published: (2025)
by: Chen, Xiusi, et al.
Published: (2025)
The Librarian as a Media Strategist.
by: Wilson, R.E.
Published: (1969)
by: Wilson, R.E.
Published: (1969)
SceneCraft: An LLM Agent for Synthesizing 3D Scene as Blender Code
by: Hu, Ziniu, et al.
Published: (2024)
by: Hu, Ziniu, et al.
Published: (2024)
VLM as Strategist: Adaptive Generation of Safety-critical Testing Scenarios via Guided Diffusion
by: Wu, Xinzheng, et al.
Published: (2025)
by: Wu, Xinzheng, et al.
Published: (2025)
Actor-Curator: Co-adaptive Curriculum Learning via Policy-Improvement Bandits for RL Post-Training
by: Gu, Zhengyao, et al.
Published: (2026)
by: Gu, Zhengyao, et al.
Published: (2026)
Enhancing Decision-Making for LLM Agents via Step-Level Q-Value Models
by: Zhai, Yuanzhao, et al.
Published: (2024)
by: Zhai, Yuanzhao, et al.
Published: (2024)
Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning
by: Hu, Zican, et al.
Published: (2025)
by: Hu, Zican, et al.
Published: (2025)
SafeSwitch: Steering Unsafe LLM Behavior via Internal Activation Signals
by: Han, Peixuan, et al.
Published: (2025)
by: Han, Peixuan, et al.
Published: (2025)
On the Effect of Sampling Diversity in Scaling LLM Inference
by: Wang, Tianchun, et al.
Published: (2025)
by: Wang, Tianchun, et al.
Published: (2025)
Why Reasoning Fails to Plan: A Planning-Centric Analysis of Long-Horizon Decision Making in LLM Agents
by: Wang, Zehong, et al.
Published: (2026)
by: Wang, Zehong, et al.
Published: (2026)
Beyond Sample-Level Feedback: Using Reference-Level Feedback to Guide Data Synthesis
by: Mehri, Shuhaib, et al.
Published: (2025)
by: Mehri, Shuhaib, et al.
Published: (2025)
SciInstruct: a Self-Reflective Instruction Annotated Dataset for Training Scientific Language Models
by: Zhang, Dan, et al.
Published: (2024)
by: Zhang, Dan, et al.
Published: (2024)
STRUX: An LLM for Decision-Making with Structured Explanations
by: Lu, Yiming, et al.
Published: (2024)
by: Lu, Yiming, et al.
Published: (2024)
Learning Time-Scale Invariant Population-Level Neural Representations
by: Patel, Eshani, et al.
Published: (2025)
by: Patel, Eshani, et al.
Published: (2025)
BiRQ: Bi-Level Self-Labeling Random Quantization for Self-Supervised Speech Recognition
by: Jiang, Liuyuan, et al.
Published: (2025)
by: Jiang, Liuyuan, et al.
Published: (2025)
GPTree: Towards Explainable Decision-Making via LLM-powered Decision Trees
by: Xiong, Sichao, et al.
Published: (2024)
by: Xiong, Sichao, et al.
Published: (2024)
PSG-Nav: Probabilistic Scene Graph Navigation via Multiverse Decision Making
by: Chen, Rufeng, et al.
Published: (2026)
by: Chen, Rufeng, et al.
Published: (2026)
HAZARD Challenge: Embodied Decision Making in Dynamically Changing Environments
by: Zhou, Qinhong, et al.
Published: (2024)
by: Zhou, Qinhong, et al.
Published: (2024)
Bi-Level Decision-Focused Causal Learning for Large-Scale Marketing Optimization: Bridging Observational and Experimental Data
by: Zhang, Shuli, et al.
Published: (2025)
by: Zhang, Shuli, et al.
Published: (2025)
Feedforward 3D Editing via Text-Steerable Image-to-3D
by: Ma, Ziqi, et al.
Published: (2025)
by: Ma, Ziqi, et al.
Published: (2025)
Self-Adaptive Cognitive Debiasing for Large Language Models in Decision-Making
by: Lyu, Yougang, et al.
Published: (2025)
by: Lyu, Yougang, et al.
Published: (2025)
Human Decision-Making with Persuasive and Narrative LLM Explanations
by: Marusich, Laura R., et al.
Published: (2026)
by: Marusich, Laura R., et al.
Published: (2026)
SolverLLM: Leveraging Test-Time Scaling for Optimization Problem via LLM-Guided Search
by: Li, Dong, et al.
Published: (2025)
by: Li, Dong, et al.
Published: (2025)
Random Policy Enables In-Context Reinforcement Learning within Trust Horizons
by: Chen, Weiqin, et al.
Published: (2024)
by: Chen, Weiqin, et al.
Published: (2024)
SkillGen: Learning Domain Skills for In-Context Sequential Decision Making
by: Ding, Ruomeng, et al.
Published: (2025)
by: Ding, Ruomeng, et al.
Published: (2025)
Strategic Decision-Making Under Uncertainty through Bi-Level Game Theory and Distributionally Robust Optimization
by: Shen, Jiachen, et al.
Published: (2025)
by: Shen, Jiachen, et al.
Published: (2025)
PEARL: Self-Evolving Assistant for Time Management with Reinforcement Learning
by: Li, Bingxuan, et al.
Published: (2026)
by: Li, Bingxuan, et al.
Published: (2026)
Similar Items
-
PIANIST: Learning Partially Observable World Models with LLMs for Multi-Agent Decision Making
by: Light, Jonathan, et al.
Published: (2024) -
TDRM: Smooth Reward Models with Temporal Difference for LLM RL and Inference
by: Zhang, Dan, et al.
Published: (2025) -
ReST-MCTS*: LLM Self-Training via Process Reward Guided Tree Search
by: Zhang, Dan, et al.
Published: (2024) -
Dataset Distillation for Offline Reinforcement Learning
by: Light, Jonathan, et al.
Published: (2024) -
Self-Control of LLM Behaviors by Compressing Suffix Gradient into Prefix Controller
by: Cai, Min, et al.
Published: (2024)