Think Twice, Act Once: A Co-Evolution Framework of LLM and RL for Large-Scale Decision Making
Fuente:
arXiv
Salvato in:
| Autori principali: | Wan, Xu, Xu, Wenyue, Yang, Chao, Sun, Mingyang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Think Twice, Act Once: Verifier-Guided Action Selection For Embodied Agents
di: Singhi, Nishad, et al.
Pubblicazione: (2026)
di: Singhi, Nishad, et al.
Pubblicazione: (2026)
AdapThink: Adaptive Thinking Preferences for Reasoning Language Model
di: Wan, Xu, et al.
Pubblicazione: (2025)
di: Wan, Xu, et al.
Pubblicazione: (2025)
Think Twice, Generate Once: Safeguarding by Progressive Self-Reflection
di: Phan, Hoang, et al.
Pubblicazione: (2025)
di: Phan, Hoang, et al.
Pubblicazione: (2025)
Think Twice, Click Once: Enhancing GUI Grounding via Fast and Slow Systems
di: Tang, Fei, et al.
Pubblicazione: (2025)
di: Tang, Fei, et al.
Pubblicazione: (2025)
ThinkTwice: Jointly Optimizing Large Language Models for Reasoning and Self-Refinement
di: Jiao, Difan, et al.
Pubblicazione: (2026)
di: Jiao, Difan, et al.
Pubblicazione: (2026)
Reflecting with Two Voices: A Co-Adaptive Dual-Strategy Framework for LLM-Based Agent Decision Making
di: Zhang, Wentao, et al.
Pubblicazione: (2025)
di: Zhang, Wentao, et al.
Pubblicazione: (2025)
Buffer Matters: Unleashing the Power of Off-Policy Reinforcement Learning in Large Language Model Reasoning
di: Wan, Xu, et al.
Pubblicazione: (2026)
di: Wan, Xu, et al.
Pubblicazione: (2026)
Don't Make the LLM Read the Graph: Make the Graph Think
di: Sun, Yuqi, et al.
Pubblicazione: (2026)
di: Sun, Yuqi, et al.
Pubblicazione: (2026)
Tracing LLM Reasoning Processes with Strategic Games: A Framework for Planning, Revision, and Resource-Constrained Decision Making
di: Yuan, Xiaopeng, et al.
Pubblicazione: (2025)
di: Yuan, Xiaopeng, et al.
Pubblicazione: (2025)
MolAct: An Agentic RL Framework for Molecular Editing and Property Optimization
di: Yang, Zhuo, et al.
Pubblicazione: (2025)
di: Yang, Zhuo, et al.
Pubblicazione: (2025)
Think Twice Before You Write -- an Entropy-based Decoding Strategy to Enhance LLM Reasoning
di: He, Jiashu, et al.
Pubblicazione: (2026)
di: He, Jiashu, et al.
Pubblicazione: (2026)
Controlling Large Language Model-based Agents for Large-Scale Decision-Making: An Actor-Critic Approach
di: Zhang, Bin, et al.
Pubblicazione: (2023)
di: Zhang, Bin, et al.
Pubblicazione: (2023)
HighwayLLM: Decision-Making and Navigation in Highway Driving with RL-Informed Language Model
di: Yildirim, Mustafa, et al.
Pubblicazione: (2024)
di: Yildirim, Mustafa, et al.
Pubblicazione: (2024)
AuctionNet: A Novel Benchmark for Decision-Making in Large-Scale Games
di: Su, Kefan, et al.
Pubblicazione: (2024)
di: Su, Kefan, et al.
Pubblicazione: (2024)
Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding
di: Wang, Wenkai, et al.
Pubblicazione: (2026)
di: Wang, Wenkai, et al.
Pubblicazione: (2026)
SrSv: Integrating Sequential Rollouts with Sequential Value Estimation for Multi-agent Reinforcement Learning
di: Wan, Xu, et al.
Pubblicazione: (2025)
di: Wan, Xu, et al.
Pubblicazione: (2025)
Don't Think Twice! Over-Reasoning Impairs Confidence Calibration
di: Lacombe, Romain, et al.
Pubblicazione: (2025)
di: Lacombe, Romain, et al.
Pubblicazione: (2025)
Making Slow Thinking Faster: Compressing LLM Chain-of-Thought via Step Entropy
di: Li, Zeju, et al.
Pubblicazione: (2025)
di: Li, Zeju, et al.
Pubblicazione: (2025)
Reason--Imagine--Act: Closed-Loop LLM Decision Making with World Models for Autonomous Driving
di: Sun, Zhengqi, et al.
Pubblicazione: (2026)
di: Sun, Zhengqi, et al.
Pubblicazione: (2026)
OLIVIA: Online Learning via Inference-time Action Adaptation for Decision Making in LLM ReAct Agents
di: Yu, Sheldon, et al.
Pubblicazione: (2026)
di: Yu, Sheldon, et al.
Pubblicazione: (2026)
Reinforcement Learning-Augmented LLM Agents for Collaborative Decision Making and Performance Optimization
di: Qiu, Dong, et al.
Pubblicazione: (2025)
di: Qiu, Dong, et al.
Pubblicazione: (2025)
Enhancing Decision-Making for LLM Agents via Step-Level Q-Value Models
di: Zhai, Yuanzhao, et al.
Pubblicazione: (2024)
di: Zhai, Yuanzhao, et al.
Pubblicazione: (2024)
DSADF: Thinking Fast and Slow for Decision Making
di: Dou, Zhihao, et al.
Pubblicazione: (2025)
di: Dou, Zhihao, et al.
Pubblicazione: (2025)
Stepwise Think-Critique: A Unified Framework for Robust and Interpretable LLM Reasoning
di: Xu, Jiaqi, et al.
Pubblicazione: (2025)
di: Xu, Jiaqi, et al.
Pubblicazione: (2025)
Think Before You Act: Decision Transformers with Working Memory
di: Kang, Jikun, et al.
Pubblicazione: (2023)
di: Kang, Jikun, et al.
Pubblicazione: (2023)
Act as You Learn: Adaptive Decision-Making in Non-Stationary Markov Decision Processes
di: Luo, Baiting, et al.
Pubblicazione: (2024)
di: Luo, Baiting, et al.
Pubblicazione: (2024)
Multimodal Agricultural Agent Architecture (MA3): A New Paradigm for Intelligent Agricultural Decision-Making
di: Xu, Zhuoning, et al.
Pubblicazione: (2025)
di: Xu, Zhuoning, et al.
Pubblicazione: (2025)
ReflAct: World-Grounded Decision Making in LLM Agents via Goal-State Reflection
di: Kim, Jeonghye, et al.
Pubblicazione: (2025)
di: Kim, Jeonghye, et al.
Pubblicazione: (2025)
Think Twice: Measuring the Efficiency of Eliminating Prediction Shortcuts of Question Answering Models
di: Mikula, Lukáš, et al.
Pubblicazione: (2023)
di: Mikula, Lukáš, et al.
Pubblicazione: (2023)
DecisionLLM: Large Language Models for Long Sequence Decision Exploration
di: Lv, Xiaowei, et al.
Pubblicazione: (2026)
di: Lv, Xiaowei, et al.
Pubblicazione: (2026)
Stephanie2: Thinking, Waiting, and Making Decisions Like Humans in Step-by-Step AI Social Chat
di: Yang, Hao, et al.
Pubblicazione: (2026)
di: Yang, Hao, et al.
Pubblicazione: (2026)
Feedback-Induced Performance Decline in LLM-Based Decision-Making
di: Yang, Xiao, et al.
Pubblicazione: (2025)
di: Yang, Xiao, et al.
Pubblicazione: (2025)
Think Twice to See More: Iterative Visual Reasoning in Medical VLMs
di: Chen, Kaitao, et al.
Pubblicazione: (2025)
di: Chen, Kaitao, et al.
Pubblicazione: (2025)
Vocabulary Dropout for Curriculum Diversity in LLM Co-Evolution
di: Dineen, Jacob, et al.
Pubblicazione: (2026)
di: Dineen, Jacob, et al.
Pubblicazione: (2026)
On the Decision-Making Abilities in Role-Playing using Large Language Models
di: Shen, Chenglei, et al.
Pubblicazione: (2024)
di: Shen, Chenglei, et al.
Pubblicazione: (2024)
Agent^2 RL-Bench: Can LLM Agents Engineer Agentic RL Post-Training?
di: Chen, Wanyi, et al.
Pubblicazione: (2026)
di: Chen, Wanyi, et al.
Pubblicazione: (2026)
MCCE: A Framework for Multi-LLM Collaborative Co-Evolution
di: Ran, Nian, et al.
Pubblicazione: (2025)
di: Ran, Nian, et al.
Pubblicazione: (2025)
UniPlanner: A Unified Motion Planning Framework for Autonomous Vehicle Decision-Making Systems via Multi-Dataset Integration
di: Yang, Xin, et al.
Pubblicazione: (2025)
di: Yang, Xin, et al.
Pubblicazione: (2025)
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning
di: Xi, Zhiheng, et al.
Pubblicazione: (2025)
di: Xi, Zhiheng, et al.
Pubblicazione: (2025)
LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training
di: Wu, Bo, et al.
Pubblicazione: (2025)
di: Wu, Bo, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Think Twice, Act Once: Verifier-Guided Action Selection For Embodied Agents
di: Singhi, Nishad, et al.
Pubblicazione: (2026) -
AdapThink: Adaptive Thinking Preferences for Reasoning Language Model
di: Wan, Xu, et al.
Pubblicazione: (2025) -
Think Twice, Generate Once: Safeguarding by Progressive Self-Reflection
di: Phan, Hoang, et al.
Pubblicazione: (2025) -
Think Twice, Click Once: Enhancing GUI Grounding via Fast and Slow Systems
di: Tang, Fei, et al.
Pubblicazione: (2025) -
ThinkTwice: Jointly Optimizing Large Language Models for Reasoning and Self-Refinement
di: Jiao, Difan, et al.
Pubblicazione: (2026)