Think Twice, Act Once: A Co-Evolution Framework of LLM and RL for Large-Scale Decision Making
Fuente:
arXiv
Saved in:
| Main Authors: | Wan, Xu, Xu, Wenyue, Yang, Chao, Sun, Mingyang |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Think Twice, Act Once: Verifier-Guided Action Selection For Embodied Agents
by: Singhi, Nishad, et al.
Published: (2026)
by: Singhi, Nishad, et al.
Published: (2026)
AdapThink: Adaptive Thinking Preferences for Reasoning Language Model
by: Wan, Xu, et al.
Published: (2025)
by: Wan, Xu, et al.
Published: (2025)
Think Twice, Generate Once: Safeguarding by Progressive Self-Reflection
by: Phan, Hoang, et al.
Published: (2025)
by: Phan, Hoang, et al.
Published: (2025)
Think Twice, Click Once: Enhancing GUI Grounding via Fast and Slow Systems
by: Tang, Fei, et al.
Published: (2025)
by: Tang, Fei, et al.
Published: (2025)
ThinkTwice: Jointly Optimizing Large Language Models for Reasoning and Self-Refinement
by: Jiao, Difan, et al.
Published: (2026)
by: Jiao, Difan, et al.
Published: (2026)
Reflecting with Two Voices: A Co-Adaptive Dual-Strategy Framework for LLM-Based Agent Decision Making
by: Zhang, Wentao, et al.
Published: (2025)
by: Zhang, Wentao, et al.
Published: (2025)
Buffer Matters: Unleashing the Power of Off-Policy Reinforcement Learning in Large Language Model Reasoning
by: Wan, Xu, et al.
Published: (2026)
by: Wan, Xu, et al.
Published: (2026)
Don't Make the LLM Read the Graph: Make the Graph Think
by: Sun, Yuqi, et al.
Published: (2026)
by: Sun, Yuqi, et al.
Published: (2026)
Tracing LLM Reasoning Processes with Strategic Games: A Framework for Planning, Revision, and Resource-Constrained Decision Making
by: Yuan, Xiaopeng, et al.
Published: (2025)
by: Yuan, Xiaopeng, et al.
Published: (2025)
MolAct: An Agentic RL Framework for Molecular Editing and Property Optimization
by: Yang, Zhuo, et al.
Published: (2025)
by: Yang, Zhuo, et al.
Published: (2025)
Think Twice Before You Write -- an Entropy-based Decoding Strategy to Enhance LLM Reasoning
by: He, Jiashu, et al.
Published: (2026)
by: He, Jiashu, et al.
Published: (2026)
Controlling Large Language Model-based Agents for Large-Scale Decision-Making: An Actor-Critic Approach
by: Zhang, Bin, et al.
Published: (2023)
by: Zhang, Bin, et al.
Published: (2023)
HighwayLLM: Decision-Making and Navigation in Highway Driving with RL-Informed Language Model
by: Yildirim, Mustafa, et al.
Published: (2024)
by: Yildirim, Mustafa, et al.
Published: (2024)
AuctionNet: A Novel Benchmark for Decision-Making in Large-Scale Games
by: Su, Kefan, et al.
Published: (2024)
by: Su, Kefan, et al.
Published: (2024)
Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding
by: Wang, Wenkai, et al.
Published: (2026)
by: Wang, Wenkai, et al.
Published: (2026)
SrSv: Integrating Sequential Rollouts with Sequential Value Estimation for Multi-agent Reinforcement Learning
by: Wan, Xu, et al.
Published: (2025)
by: Wan, Xu, et al.
Published: (2025)
Don't Think Twice! Over-Reasoning Impairs Confidence Calibration
by: Lacombe, Romain, et al.
Published: (2025)
by: Lacombe, Romain, et al.
Published: (2025)
Making Slow Thinking Faster: Compressing LLM Chain-of-Thought via Step Entropy
by: Li, Zeju, et al.
Published: (2025)
by: Li, Zeju, et al.
Published: (2025)
Reason--Imagine--Act: Closed-Loop LLM Decision Making with World Models for Autonomous Driving
by: Sun, Zhengqi, et al.
Published: (2026)
by: Sun, Zhengqi, et al.
Published: (2026)
OLIVIA: Online Learning via Inference-time Action Adaptation for Decision Making in LLM ReAct Agents
by: Yu, Sheldon, et al.
Published: (2026)
by: Yu, Sheldon, et al.
Published: (2026)
Reinforcement Learning-Augmented LLM Agents for Collaborative Decision Making and Performance Optimization
by: Qiu, Dong, et al.
Published: (2025)
by: Qiu, Dong, et al.
Published: (2025)
Enhancing Decision-Making for LLM Agents via Step-Level Q-Value Models
by: Zhai, Yuanzhao, et al.
Published: (2024)
by: Zhai, Yuanzhao, et al.
Published: (2024)
DSADF: Thinking Fast and Slow for Decision Making
by: Dou, Zhihao, et al.
Published: (2025)
by: Dou, Zhihao, et al.
Published: (2025)
Stepwise Think-Critique: A Unified Framework for Robust and Interpretable LLM Reasoning
by: Xu, Jiaqi, et al.
Published: (2025)
by: Xu, Jiaqi, et al.
Published: (2025)
Think Before You Act: Decision Transformers with Working Memory
by: Kang, Jikun, et al.
Published: (2023)
by: Kang, Jikun, et al.
Published: (2023)
Act as You Learn: Adaptive Decision-Making in Non-Stationary Markov Decision Processes
by: Luo, Baiting, et al.
Published: (2024)
by: Luo, Baiting, et al.
Published: (2024)
Multimodal Agricultural Agent Architecture (MA3): A New Paradigm for Intelligent Agricultural Decision-Making
by: Xu, Zhuoning, et al.
Published: (2025)
by: Xu, Zhuoning, et al.
Published: (2025)
ReflAct: World-Grounded Decision Making in LLM Agents via Goal-State Reflection
by: Kim, Jeonghye, et al.
Published: (2025)
by: Kim, Jeonghye, et al.
Published: (2025)
Think Twice: Measuring the Efficiency of Eliminating Prediction Shortcuts of Question Answering Models
by: Mikula, Lukáš, et al.
Published: (2023)
by: Mikula, Lukáš, et al.
Published: (2023)
DecisionLLM: Large Language Models for Long Sequence Decision Exploration
by: Lv, Xiaowei, et al.
Published: (2026)
by: Lv, Xiaowei, et al.
Published: (2026)
Stephanie2: Thinking, Waiting, and Making Decisions Like Humans in Step-by-Step AI Social Chat
by: Yang, Hao, et al.
Published: (2026)
by: Yang, Hao, et al.
Published: (2026)
Feedback-Induced Performance Decline in LLM-Based Decision-Making
by: Yang, Xiao, et al.
Published: (2025)
by: Yang, Xiao, et al.
Published: (2025)
Think Twice to See More: Iterative Visual Reasoning in Medical VLMs
by: Chen, Kaitao, et al.
Published: (2025)
by: Chen, Kaitao, et al.
Published: (2025)
Vocabulary Dropout for Curriculum Diversity in LLM Co-Evolution
by: Dineen, Jacob, et al.
Published: (2026)
by: Dineen, Jacob, et al.
Published: (2026)
On the Decision-Making Abilities in Role-Playing using Large Language Models
by: Shen, Chenglei, et al.
Published: (2024)
by: Shen, Chenglei, et al.
Published: (2024)
Agent^2 RL-Bench: Can LLM Agents Engineer Agentic RL Post-Training?
by: Chen, Wanyi, et al.
Published: (2026)
by: Chen, Wanyi, et al.
Published: (2026)
MCCE: A Framework for Multi-LLM Collaborative Co-Evolution
by: Ran, Nian, et al.
Published: (2025)
by: Ran, Nian, et al.
Published: (2025)
UniPlanner: A Unified Motion Planning Framework for Autonomous Vehicle Decision-Making Systems via Multi-Dataset Integration
by: Yang, Xin, et al.
Published: (2025)
by: Yang, Xin, et al.
Published: (2025)
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning
by: Xi, Zhiheng, et al.
Published: (2025)
by: Xi, Zhiheng, et al.
Published: (2025)
LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training
by: Wu, Bo, et al.
Published: (2025)
by: Wu, Bo, et al.
Published: (2025)
Similar Items
-
Think Twice, Act Once: Verifier-Guided Action Selection For Embodied Agents
by: Singhi, Nishad, et al.
Published: (2026) -
AdapThink: Adaptive Thinking Preferences for Reasoning Language Model
by: Wan, Xu, et al.
Published: (2025) -
Think Twice, Generate Once: Safeguarding by Progressive Self-Reflection
by: Phan, Hoang, et al.
Published: (2025) -
Think Twice, Click Once: Enhancing GUI Grounding via Fast and Slow Systems
by: Tang, Fei, et al.
Published: (2025) -
ThinkTwice: Jointly Optimizing Large Language Models for Reasoning and Self-Refinement
by: Jiao, Difan, et al.
Published: (2026)