Training LLMs for Divide-and-Conquer Reasoning Elevates Test-Time Scalability
Fuente:
arXiv
Salvato in:
| Autori principali: | Liang, Xiao, Li, Zhong-Zhi, Lin, Zhenghao, Jiang, Eric Hancheng, Zhang, Hengyuan, Shen, Yelong, Chang, Kai-Wei, Wu, Ying Nian, Gong, Yeyun, Chen, Weizhu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning
di: Liang, Xiao, et al.
Pubblicazione: (2025)
di: Liang, Xiao, et al.
Pubblicazione: (2025)
Beyond Pass@1: Self-Play with Variational Problem Synthesis Sustains RLVR
di: Liang, Xiao, et al.
Pubblicazione: (2025)
di: Liang, Xiao, et al.
Pubblicazione: (2025)
Exploring the Mystery of Influential Data for Mathematical Reasoning
di: Ni, Xinzhe, et al.
Pubblicazione: (2024)
di: Ni, Xinzhe, et al.
Pubblicazione: (2024)
Key-Point-Driven Data Synthesis with its Enhancement on Mathematical Reasoning
di: Huang, Yiming, et al.
Pubblicazione: (2024)
di: Huang, Yiming, et al.
Pubblicazione: (2024)
Gold-Medal-Level Olympiad Geometry Solving with Efficient Heuristic Auxiliary Constructions
di: Duan, Boyan, et al.
Pubblicazione: (2025)
di: Duan, Boyan, et al.
Pubblicazione: (2025)
ToRA: A Tool-Integrated Reasoning Agent for Mathematical Problem Solving
di: Gou, Zhibin, et al.
Pubblicazione: (2023)
di: Gou, Zhibin, et al.
Pubblicazione: (2023)
CRITIC: Large Language Models Can Self-Correct with Tool-Interactive Critiquing
di: Gou, Zhibin, et al.
Pubblicazione: (2023)
di: Gou, Zhibin, et al.
Pubblicazione: (2023)
Competition-Level Problems are Effective LLM Evaluators
di: Huang, Yiming, et al.
Pubblicazione: (2023)
di: Huang, Yiming, et al.
Pubblicazione: (2023)
Rho-1: Not All Tokens Are What You Need
di: Lin, Zhenghao, et al.
Pubblicazione: (2024)
di: Lin, Zhenghao, et al.
Pubblicazione: (2024)
DCR: Divide-and-Conquer Reasoning for Multi-choice Question Answering with LLMs
di: Meng, Zijie, et al.
Pubblicazione: (2024)
di: Meng, Zijie, et al.
Pubblicazione: (2024)
Mixture of Neuron Experts
di: Cheng, Runxi, et al.
Pubblicazione: (2025)
di: Cheng, Runxi, et al.
Pubblicazione: (2025)
Training Matryoshka Mixture-of-Experts for Elastic Inference-Time Expert Utilization
di: Wang, Yaoxiang, et al.
Pubblicazione: (2025)
di: Wang, Yaoxiang, et al.
Pubblicazione: (2025)
Accurate and Scalable Matrix Mechanisms via Divide and Conquer
di: He, Guanlin, et al.
Pubblicazione: (2026)
di: He, Guanlin, et al.
Pubblicazione: (2026)
Control Large Language Models via Divide and Conquer
di: Li, Bingxuan, et al.
Pubblicazione: (2024)
di: Li, Bingxuan, et al.
Pubblicazione: (2024)
Rethinking Language Model Scaling under Transferable Hypersphere Optimization
di: Ren, Liliang, et al.
Pubblicazione: (2026)
di: Ren, Liliang, et al.
Pubblicazione: (2026)
GraphDC: A Divide-and-Conquer Multi-Agent System for Scalable Graph Algorithm Reasoning
di: Li, Wenjin, et al.
Pubblicazione: (2026)
di: Li, Wenjin, et al.
Pubblicazione: (2026)
DC-TTA: Divide-and-Conquer Framework for Test-Time Adaptation of Interactive Segmentation
di: Kim, Jihun, et al.
Pubblicazione: (2025)
di: Kim, Jihun, et al.
Pubblicazione: (2025)
Recursive Decomposition with Dependencies for Generic Divide-and-Conquer Reasoning
di: Hernández-Gutiérrez, Sergio, et al.
Pubblicazione: (2025)
di: Hernández-Gutiérrez, Sergio, et al.
Pubblicazione: (2025)
Adapting LLM Agents with Universal Feedback in Communication
di: Wang, Kuan, et al.
Pubblicazione: (2023)
di: Wang, Kuan, et al.
Pubblicazione: (2023)
Visual Para-Thinker: Divide-and-Conquer Reasoning for Visual Comprehension
di: Xu, Haoran, et al.
Pubblicazione: (2026)
di: Xu, Haoran, et al.
Pubblicazione: (2026)
Divide and Conquer: Rethinking the Training Paradigm of Neural Radiance Fields
di: Ma, Rongkai, et al.
Pubblicazione: (2024)
di: Ma, Rongkai, et al.
Pubblicazione: (2024)
Divide-and-Conquer Posterior Sampling for Denoising Diffusion Priors
di: Janati, Yazid, et al.
Pubblicazione: (2024)
di: Janati, Yazid, et al.
Pubblicazione: (2024)
Samba: Simple Hybrid State Space Models for Efficient Unlimited Context Language Modeling
di: Ren, Liliang, et al.
Pubblicazione: (2024)
di: Ren, Liliang, et al.
Pubblicazione: (2024)
Shuffle the Context: RoPE-Perturbed Self-Distillation for Long-Context Adaptation
di: Li, Zichong, et al.
Pubblicazione: (2026)
di: Li, Zichong, et al.
Pubblicazione: (2026)
COSMOS: A Hybrid Adaptive Optimizer for Memory-Efficient Training of LLMs
di: Liu, Liming, et al.
Pubblicazione: (2025)
di: Liu, Liming, et al.
Pubblicazione: (2025)
RLBR: Reinforcement Learning with Biasing Rewards for Contextual Speech Large Language Models
di: Ren, Bo, et al.
Pubblicazione: (2026)
di: Ren, Bo, et al.
Pubblicazione: (2026)
DCA: Dividing and Conquering Amnesia in Incremental Object Detection
di: Zhang, Aoting, et al.
Pubblicazione: (2025)
di: Zhang, Aoting, et al.
Pubblicazione: (2025)
Improving Data and Reward Design for Scientific Reasoning in Large Language Models
di: Chen, Zijie, et al.
Pubblicazione: (2026)
di: Chen, Zijie, et al.
Pubblicazione: (2026)
Ensuring Safe and High-Quality Outputs: A Guideline Library Approach for Language Models
di: Luo, Yi, et al.
Pubblicazione: (2024)
di: Luo, Yi, et al.
Pubblicazione: (2024)
Divide-Conquer-and-Merge: Memory- and Time-Efficient Holographic Displays
di: Dong, Zhenxing, et al.
Pubblicazione: (2024)
di: Dong, Zhenxing, et al.
Pubblicazione: (2024)
Divide-and-Conquer: Dual-Hierarchical Optimization for Semantic 4D Gaussian Spatting
di: Yan, Zhiying, et al.
Pubblicazione: (2025)
di: Yan, Zhiying, et al.
Pubblicazione: (2025)
Divide-and-Conquer CoT: RL for Reducing Latency via Parallel Reasoning
di: Mahankali, Arvind, et al.
Pubblicazione: (2026)
di: Mahankali, Arvind, et al.
Pubblicazione: (2026)
Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning
di: Hu, Zican, et al.
Pubblicazione: (2025)
di: Hu, Zican, et al.
Pubblicazione: (2025)
Divide, Conquer and Combine: A Training-Free Framework for High-Resolution Image Perception in Multimodal Large Language Models
di: Wang, Wenbin, et al.
Pubblicazione: (2024)
di: Wang, Wenbin, et al.
Pubblicazione: (2024)
Enhancing Chain-of-Thoughts Prompting with Iterative Bootstrapping in Large Language Models
di: Sun, Jiashuo, et al.
Pubblicazione: (2023)
di: Sun, Jiashuo, et al.
Pubblicazione: (2023)
Dividing and Conquering the Van Vleck Catastrophe
di: Simon, Sophia, et al.
Pubblicazione: (2025)
di: Simon, Sophia, et al.
Pubblicazione: (2025)
Try, Check and Retry: A Divide-and-Conquer Framework for Boosting Long-context Tool-Calling Performance of LLMs
di: Chen, Kunfeng, et al.
Pubblicazione: (2026)
di: Chen, Kunfeng, et al.
Pubblicazione: (2026)
Memory Consistency Guided Divide-and-Conquer Learning for Generalized Category Discovery
di: Tu, Yuanpeng, et al.
Pubblicazione: (2024)
di: Tu, Yuanpeng, et al.
Pubblicazione: (2024)
Test-time Recursive Thinking: Self-Improvement without External Feedback
di: Zhuang, Yufan, et al.
Pubblicazione: (2026)
di: Zhuang, Yufan, et al.
Pubblicazione: (2026)
Ethereal: Divide and Conquer Network Load Balancing in Large-Scale Distributed Training
di: Addanki, Vamsi, et al.
Pubblicazione: (2024)
di: Addanki, Vamsi, et al.
Pubblicazione: (2024)
Documenti analoghi
-
SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning
di: Liang, Xiao, et al.
Pubblicazione: (2025) -
Beyond Pass@1: Self-Play with Variational Problem Synthesis Sustains RLVR
di: Liang, Xiao, et al.
Pubblicazione: (2025) -
Exploring the Mystery of Influential Data for Mathematical Reasoning
di: Ni, Xinzhe, et al.
Pubblicazione: (2024) -
Key-Point-Driven Data Synthesis with its Enhancement on Mathematical Reasoning
di: Huang, Yiming, et al.
Pubblicazione: (2024) -
Gold-Medal-Level Olympiad Geometry Solving with Efficient Heuristic Auxiliary Constructions
di: Duan, Boyan, et al.
Pubblicazione: (2025)