Enhancing Decision-Making for LLM Agents via Step-Level Q-Value Models
Fuente:
arXiv
Saved in:
| Main Authors: | Zhai, Yuanzhao, Yang, Tingkai, Xu, Kele, Dawei, Feng, Yang, Cheng, Ding, Bo, Wang, Huaimin |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
AutoFeedback: An LLM-based Framework for Efficient and Accurate API Request Generation
by: Liu, Huanxi, et al.
Published: (2024)
by: Liu, Huanxi, et al.
Published: (2024)
Online Self-Preferring Language Models
by: Zhai, Yuanzhao, et al.
Published: (2024)
by: Zhai, Yuanzhao, et al.
Published: (2024)
Pay More Attention to the Robustness of Prompt for Instruction Data Mining
by: Wang, Qiang, et al.
Published: (2025)
by: Wang, Qiang, et al.
Published: (2025)
Optimistic Model Rollouts for Pessimistic Offline Policy Optimization
by: Zhai, Yuanzhao, et al.
Published: (2024)
by: Zhai, Yuanzhao, et al.
Published: (2024)
Uncertainty-Penalized Reinforcement Learning from Human Feedback with Diverse Reward LoRA Ensembles
by: Zhai, Yuanzhao, et al.
Published: (2023)
by: Zhai, Yuanzhao, et al.
Published: (2023)
Scaffold-Conditioned Preference Triplets for Controllable Molecular Optimization with Large Language Models
by: Xiong, Yi, et al.
Published: (2026)
by: Xiong, Yi, et al.
Published: (2026)
Hierarchical Reinforcement Learning with Augmented Step-Level Transitions for LLM Agents
by: Zhen, Shuai, et al.
Published: (2026)
by: Zhen, Shuai, et al.
Published: (2026)
TRAD: Enhancing LLM Agents with Step-Wise Thought Retrieval and Aligned Decision
by: Zhou, Ruiwen, et al.
Published: (2024)
by: Zhou, Ruiwen, et al.
Published: (2024)
Think Fast and Slow: Step-Level Cognitive Depth Adaptation for LLM Agents
by: Yang, Ruihan, et al.
Published: (2026)
by: Yang, Ruihan, et al.
Published: (2026)
MAny: Merge Anything for Multimodal Continual Instruction Tuning
by: Gao, Zijian, et al.
Published: (2026)
by: Gao, Zijian, et al.
Published: (2026)
Token-Level Uncertainty-Aware Objective for Language Model Post-Training
by: Liu, Tingkai, et al.
Published: (2025)
by: Liu, Tingkai, et al.
Published: (2025)
Making Slow Thinking Faster: Compressing LLM Chain-of-Thought via Step Entropy
by: Li, Zeju, et al.
Published: (2025)
by: Li, Zeju, et al.
Published: (2025)
Strategist: Self-improvement of LLM Decision Making via Bi-Level Tree Search
by: Light, Jonathan, et al.
Published: (2024)
by: Light, Jonathan, et al.
Published: (2024)
MAVEN: Multi-Agent Verification-Elaboration Network with In-Step Epistemic Auditing
by: Yao, Yinsheng, et al.
Published: (2026)
by: Yao, Yinsheng, et al.
Published: (2026)
Watch Every Step! LLM Agent Learning via Iterative Step-Level Process Refinement
by: Xiong, Weimin, et al.
Published: (2024)
by: Xiong, Weimin, et al.
Published: (2024)
Reinforcement Learning-Augmented LLM Agents for Collaborative Decision Making and Performance Optimization
by: Qiu, Dong, et al.
Published: (2025)
by: Qiu, Dong, et al.
Published: (2025)
Stephanie2: Thinking, Waiting, and Making Decisions Like Humans in Step-by-Step AI Social Chat
by: Yang, Hao, et al.
Published: (2026)
by: Yang, Hao, et al.
Published: (2026)
Reflecting with Two Voices: A Co-Adaptive Dual-Strategy Framework for LLM-Based Agent Decision Making
by: Zhang, Wentao, et al.
Published: (2025)
by: Zhang, Wentao, et al.
Published: (2025)
ValuePilot: A Two-Phase Framework for Value-Driven Decision-Making
by: Luo, Yitong, et al.
Published: (2025)
by: Luo, Yitong, et al.
Published: (2025)
CoFlow: Coordinated Few-Step Flow for Offline Multi-Agent Decision Making
by: Zou, Guowei, et al.
Published: (2026)
by: Zou, Guowei, et al.
Published: (2026)
Feedback-Induced Performance Decline in LLM-Based Decision-Making
by: Yang, Xiao, et al.
Published: (2025)
by: Yang, Xiao, et al.
Published: (2025)
ValuePilot: A Two-Phase Framework for Value-Driven Decision-Making
by: Luo, Yitong, et al.
Published: (2025)
by: Luo, Yitong, et al.
Published: (2025)
Beyond Scores: Diagnostic LLM Evaluation via Fine-Grained Abilities
by: Zhang, Xu, et al.
Published: (2026)
by: Zhang, Xu, et al.
Published: (2026)
DLM: Unified Decision Language Models for Offline Multi-Agent Sequential Decision Making
by: Zhang, Zhuohui, et al.
Published: (2026)
by: Zhang, Zhuohui, et al.
Published: (2026)
Think Twice, Act Once: A Co-Evolution Framework of LLM and RL for Large-Scale Decision Making
by: Wan, Xu, et al.
Published: (2025)
by: Wan, Xu, et al.
Published: (2025)
Long-Horizon Q-Learning: Accurate Value Learning via n-Step Inequalities
by: Abraham, Armaan A., et al.
Published: (2026)
by: Abraham, Armaan A., et al.
Published: (2026)
LLM-Based World Models Can Make Decisions Solely, But Rigorous Evaluations are Needed
by: Yang, Chang, et al.
Published: (2024)
by: Yang, Chang, et al.
Published: (2024)
Ten Principles of AI Agent Economics
by: Yang, Ke, et al.
Published: (2025)
by: Yang, Ke, et al.
Published: (2025)
Unifying and Optimizing Data Values for Selection via Sequential Decision-Making
by: Chi, Hongliang, et al.
Published: (2025)
by: Chi, Hongliang, et al.
Published: (2025)
DSGBench: A Diverse Strategic Game Benchmark for Evaluating LLM-based Agents in Complex Decision-Making Environments
by: Tang, Wenjie, et al.
Published: (2025)
by: Tang, Wenjie, et al.
Published: (2025)
AgentProcessBench: Diagnosing Step-Level Process Quality in Tool-Using Agents
by: Fan, Shengda, et al.
Published: (2026)
by: Fan, Shengda, et al.
Published: (2026)
MF-LLM: Simulating Population Decision Dynamics via a Mean-Field Large Language Model Framework
by: Mi, Qirui, et al.
Published: (2025)
by: Mi, Qirui, et al.
Published: (2025)
AgentOCR: Reimagining Agent History via Optical Self-Compression
by: Feng, Lang, et al.
Published: (2026)
by: Feng, Lang, et al.
Published: (2026)
WebGen-Agent: Enhancing Interactive Website Generation with Multi-Level Feedback and Step-Level Reinforcement Learning
by: Lu, Zimu, et al.
Published: (2025)
by: Lu, Zimu, et al.
Published: (2025)
ToMPO: Training LLM Strategic Decision Making from a Multi-Agent Perspective
by: Zhang, Yiwen, et al.
Published: (2025)
by: Zhang, Yiwen, et al.
Published: (2025)
LLM-Enhanced Rapid-Reflex Async-Reflect Embodied Agent for Real-Time Decision-Making in Dynamically Changing Environments
by: Zheng, Yangqing, et al.
Published: (2025)
by: Zheng, Yangqing, et al.
Published: (2025)
Conformal Prediction and Human Decision Making
by: Hullman, Jessica, et al.
Published: (2025)
by: Hullman, Jessica, et al.
Published: (2025)
OLIVIA: Online Learning via Inference-time Action Adaptation for Decision Making in LLM ReAct Agents
by: Yu, Sheldon, et al.
Published: (2026)
by: Yu, Sheldon, et al.
Published: (2026)
AgentCDM: Enhancing Multi-Agent Collaborative Decision-Making via ACH-Inspired Structured Reasoning
by: Zhao, Xuyang, et al.
Published: (2025)
by: Zhao, Xuyang, et al.
Published: (2025)
TORQ: Two-Level Orthogonal Rotation for MXFP4 Quantization
by: Xu, Zukang, et al.
Published: (2026)
by: Xu, Zukang, et al.
Published: (2026)
Similar Items
-
AutoFeedback: An LLM-based Framework for Efficient and Accurate API Request Generation
by: Liu, Huanxi, et al.
Published: (2024) -
Online Self-Preferring Language Models
by: Zhai, Yuanzhao, et al.
Published: (2024) -
Pay More Attention to the Robustness of Prompt for Instruction Data Mining
by: Wang, Qiang, et al.
Published: (2025) -
Optimistic Model Rollouts for Pessimistic Offline Policy Optimization
by: Zhai, Yuanzhao, et al.
Published: (2024) -
Uncertainty-Penalized Reinforcement Learning from Human Feedback with Diverse Reward LoRA Ensembles
by: Zhai, Yuanzhao, et al.
Published: (2023)