Q*: Improving Multi-step Reasoning for LLMs with Deliberative Planning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Chaojie, Deng, Yanchen, Lyu, Zhiyi, Zeng, Liang, He, Jujie, Yan, Shuicheng, An, Bo |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Skywork-Reward: Bag of Tricks for Reward Modeling in LLMs
par: Liu, Chris Yuhao, et autres
Publié: (2024)
par: Liu, Chris Yuhao, et autres
Publié: (2024)
Mars-PO: Multi-Agent Reasoning System Preference Optimization
par: Lou, Xiaoxuan, et autres
Publié: (2024)
par: Lou, Xiaoxuan, et autres
Publié: (2024)
Improving Multi-Step Reasoning Abilities of Large Language Models with Direct Advantage Policy Optimization
par: Liu, Jiacai, et autres
Publié: (2024)
par: Liu, Jiacai, et autres
Publié: (2024)
Skywork-Math: Data Scaling Laws for Mathematical Reasoning in Large Language Models -- The Story Goes On
par: Zeng, Liang, et autres
Publié: (2024)
par: Zeng, Liang, et autres
Publié: (2024)
GDBA Revisited: Unleashing the Power of Guided Local Search for Distributed Constraint Optimization
par: Deng, Yanchen, et autres
Publié: (2025)
par: Deng, Yanchen, et autres
Publié: (2025)
Skywork Open Reasoner 1 Technical Report
par: He, Jujie, et autres
Publié: (2025)
par: He, Jujie, et autres
Publié: (2025)
Deliberative Searcher: Improving LLM Reliability via Reinforcement Learning with constraints
par: Yin, Zhenyun, et autres
Publié: (2025)
par: Yin, Zhenyun, et autres
Publié: (2025)
Mission Impossible: Feedback-Guided Dynamic Interactive Planning for Improving Reasoning on LLMs
par: Yan, Dong, et autres
Publié: (2025)
par: Yan, Dong, et autres
Publié: (2025)
Skywork-SWE: Unveiling Data Scaling Laws for Software Engineering in LLMs
par: Zeng, Liang, et autres
Publié: (2025)
par: Zeng, Liang, et autres
Publié: (2025)
Trade-offs in Large Reasoning Models: An Empirical Analysis of Deliberative and Adaptive Reasoning over Foundational Capabilities
par: Zhao, Weixiang, et autres
Publié: (2025)
par: Zhao, Weixiang, et autres
Publié: (2025)
Skywork-Reward-V2: Scaling Preference Data Curation via Human-AI Synergy
par: Liu, Chris Yuhao, et autres
Publié: (2025)
par: Liu, Chris Yuhao, et autres
Publié: (2025)
Nondeterministic Polynomial-time Problem Challenge: An Ever-Scaling Reasoning Benchmark for LLMs
par: Yang, Chang, et autres
Publié: (2025)
par: Yang, Chang, et autres
Publié: (2025)
Reason-to-Transmit: Deliberative Adaptive Communication for Cooperative Perception
par: Bansal, Aayam, et autres
Publié: (2026)
par: Bansal, Aayam, et autres
Publié: (2026)
Incentivizing LLMs to Self-Verify Their Answers
par: Zhang, Fuxiang, et autres
Publié: (2025)
par: Zhang, Fuxiang, et autres
Publié: (2025)
D-Artemis: A Deliberative Cognitive Framework for Mobile GUI Multi-Agents
par: Mi, Hongze, et autres
Publié: (2025)
par: Mi, Hongze, et autres
Publié: (2025)
MIND-Skill: Quality-Guaranteed Skill Generation via Multi-Agent Induction and Deduction
par: Li, Yixuan, et autres
Publié: (2026)
par: Li, Yixuan, et autres
Publié: (2026)
MoH: Multi-Head Attention as Mixture-of-Head Attention
par: Jin, Peng, et autres
Publié: (2024)
par: Jin, Peng, et autres
Publié: (2024)
RAG-Star: Enhancing Deliberative Reasoning with Retrieval Augmented Verification and Refinement
par: Jiang, Jinhao, et autres
Publié: (2024)
par: Jiang, Jinhao, et autres
Publié: (2024)
Deliberative Reasoning Network: An Uncertainty-Driven Paradigm for Belief-Tracked Inference with Pretrained Language Models
par: Xu, Anran, et autres
Publié: (2025)
par: Xu, Anran, et autres
Publié: (2025)
LBM: Hierarchical Large Auto-Bidding Model via Reasoning and Acting
par: Li, Yewen, et autres
Publié: (2026)
par: Li, Yewen, et autres
Publié: (2026)
PlanU: Large Language Model Reasoning through Planning under Uncertainty
par: Deng, Ziwei, et autres
Publié: (2025)
par: Deng, Ziwei, et autres
Publié: (2025)
From Perception to Planning: Evolving Ego-Centric Task-Oriented Spatiotemporal Reasoning via Curriculum Learning
par: Yang, Xiaoda, et autres
Publié: (2026)
par: Yang, Xiaoda, et autres
Publié: (2026)
Strat-Reasoner: Reinforcing Strategic Reasoning of LLMs in Multi-Agent Games
par: He, Yidong, et autres
Publié: (2026)
par: He, Yidong, et autres
Publié: (2026)
Audio-Reasoner: Improving Reasoning Capability in Large Audio Language Models
par: Xie, Zhifei, et autres
Publié: (2025)
par: Xie, Zhifei, et autres
Publié: (2025)
MAR:Multi-Agent Reflexion Improves Reasoning Abilities in LLMs
par: Ozer, Onat, et autres
Publié: (2025)
par: Ozer, Onat, et autres
Publié: (2025)
AgentStudio: A Toolkit for Building General Virtual Agents
par: Zheng, Longtao, et autres
Publié: (2024)
par: Zheng, Longtao, et autres
Publié: (2024)
MoE++: Accelerating Mixture-of-Experts Methods with Zero-Computation Experts
par: Jin, Peng, et autres
Publié: (2024)
par: Jin, Peng, et autres
Publié: (2024)
Closed-loop Multi-step Planning
par: Lafratta, Giulia, et autres
Publié: (2024)
par: Lafratta, Giulia, et autres
Publié: (2024)
Reinforcement Learning for Hybrid Charging Stations Planning and Operation Considering Fixed and Mobile Chargers
par: Zhu, Yanchen, et autres
Publié: (2025)
par: Zhu, Yanchen, et autres
Publié: (2025)
Circular Reasoning: Understanding Self-Reinforcing Loops in Large Reasoning Models
par: Duan, Zenghao, et autres
Publié: (2026)
par: Duan, Zenghao, et autres
Publié: (2026)
Entropy-based Exploration Conduction for Multi-step Reasoning
par: Zhang, Jinghan, et autres
Publié: (2025)
par: Zhang, Jinghan, et autres
Publié: (2025)
Do LLMs Really Think Step-by-step In Implicit Reasoning?
par: Yu, Yijiong
Publié: (2024)
par: Yu, Yijiong
Publié: (2024)
Pre-Act: Multi-Step Planning and Reasoning Improves Acting in LLM Agents
par: Rawat, Mrinal, et autres
Publié: (2025)
par: Rawat, Mrinal, et autres
Publié: (2025)
Stacked from One: Multi-Scale Self-Injection for Context Window Extension
par: Han, Wei, et autres
Publié: (2026)
par: Han, Wei, et autres
Publié: (2026)
Reasoning over Precedents Alongside Statutes: Case-Augmented Deliberative Alignment for LLM Safety
par: Jin, Can, et autres
Publié: (2026)
par: Jin, Can, et autres
Publié: (2026)
Multi-Agent Learning Path Planning via LLMs
par: Xu, Haoxin, et autres
Publié: (2026)
par: Xu, Haoxin, et autres
Publié: (2026)
RLAP: A Reinforcement Learning Enhanced Adaptive Planning Framework for Multi-step NLP Task Solving
par: Ding, Zepeng, et autres
Publié: (2025)
par: Ding, Zepeng, et autres
Publié: (2025)
Deliberative Alignment: Reasoning Enables Safer Language Models
par: Guan, Melody Y., et autres
Publié: (2024)
par: Guan, Melody Y., et autres
Publié: (2024)
Let's Revise Step-by-Step: A Unified Local Search Framework for Code Generation with LLMs
par: Lyu, Zhiyi, et autres
Publié: (2025)
par: Lyu, Zhiyi, et autres
Publié: (2025)
ConCISE: Confidence-guided Compression in Step-by-step Efficient Reasoning
par: Qiao, Ziqing, et autres
Publié: (2025)
par: Qiao, Ziqing, et autres
Publié: (2025)
Documents similaires
-
Skywork-Reward: Bag of Tricks for Reward Modeling in LLMs
par: Liu, Chris Yuhao, et autres
Publié: (2024) -
Mars-PO: Multi-Agent Reasoning System Preference Optimization
par: Lou, Xiaoxuan, et autres
Publié: (2024) -
Improving Multi-Step Reasoning Abilities of Large Language Models with Direct Advantage Policy Optimization
par: Liu, Jiacai, et autres
Publié: (2024) -
Skywork-Math: Data Scaling Laws for Mathematical Reasoning in Large Language Models -- The Story Goes On
par: Zeng, Liang, et autres
Publié: (2024) -
GDBA Revisited: Unleashing the Power of Guided Local Search for Distributed Constraint Optimization
par: Deng, Yanchen, et autres
Publié: (2025)