Training Large Reasoning Models Efficiently via Progressive Thought Encoding
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Zeliang, Liu, Xiaodong, Cheng, Hao, Sun, Hao, Xu, Chenliang, Gao, Jianfeng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Diversifying the Expert Knowledge for Task-Agnostic Pruning in Sparse Mixture-of-Experts
di: Zhang, Zeliang, et al.
Pubblicazione: (2024)
di: Zhang, Zeliang, et al.
Pubblicazione: (2024)
ReEval: Automatic Hallucination Evaluation for Retrieval-Augmented Large Language Models via Transferable Adversarial Attacks
di: Yu, Xiaodong, et al.
Pubblicazione: (2023)
di: Yu, Xiaodong, et al.
Pubblicazione: (2023)
SmartThinker: Progressive Chain-of-Thought Length Calibration for Efficient Large Language Model Reasoning
di: Hu, Chenzhi, et al.
Pubblicazione: (2026)
di: Hu, Chenzhi, et al.
Pubblicazione: (2026)
Reinforcement Learning for Reasoning in Large Language Models with One Training Example
di: Wang, Yiping, et al.
Pubblicazione: (2025)
di: Wang, Yiping, et al.
Pubblicazione: (2025)
Decoder-Hybrid-Decoder Architecture for Efficient Reasoning with Long Generation
di: Ren, Liliang, et al.
Pubblicazione: (2025)
di: Ren, Liliang, et al.
Pubblicazione: (2025)
Generative Adapter: Contextualizing Language Models in Parameters with A Single Forward Pass
di: Chen, Tong, et al.
Pubblicazione: (2024)
di: Chen, Tong, et al.
Pubblicazione: (2024)
Iterative Self-Tuning LLMs for Enhanced Jailbreaking Capabilities
di: Sun, Chung-En, et al.
Pubblicazione: (2024)
di: Sun, Chung-En, et al.
Pubblicazione: (2024)
Constraint-Rectified Training for Efficient Chain-of-Thought
di: Wu, Qinhang, et al.
Pubblicazione: (2026)
di: Wu, Qinhang, et al.
Pubblicazione: (2026)
Dyna-Think: Synergizing Reasoning, Acting, and World Model Simulation in AI Agents
di: Yu, Xiao, et al.
Pubblicazione: (2025)
di: Yu, Xiao, et al.
Pubblicazione: (2025)
Value-Guided Search for Efficient Chain-of-Thought Reasoning
di: Wang, Kaiwen, et al.
Pubblicazione: (2025)
di: Wang, Kaiwen, et al.
Pubblicazione: (2025)
$T^2$ of Thoughts: Temperature Tree Elicits Reasoning in Large Language Models
di: Cai, Chengkun, et al.
Pubblicazione: (2024)
di: Cai, Chengkun, et al.
Pubblicazione: (2024)
Linear Dynamics in the RLVR Training of Large Language Models
di: Wang, Tianle, et al.
Pubblicazione: (2026)
di: Wang, Tianle, et al.
Pubblicazione: (2026)
Synergy-of-Thoughts: Eliciting Efficient Reasoning in Hybrid Language Models
di: Shang, Yu, et al.
Pubblicazione: (2024)
di: Shang, Yu, et al.
Pubblicazione: (2024)
Progressive-Hint Prompting Improves Reasoning in Large Language Models
di: Zheng, Chuanyang, et al.
Pubblicazione: (2023)
di: Zheng, Chuanyang, et al.
Pubblicazione: (2023)
Stepwise Perplexity-Guided Refinement for Efficient Chain-of-Thought Reasoning in Large Language Models
di: Cui, Yingqian, et al.
Pubblicazione: (2025)
di: Cui, Yingqian, et al.
Pubblicazione: (2025)
Chain of Preference Optimization: Improving Chain-of-Thought Reasoning in LLMs
di: Zhang, Xuan, et al.
Pubblicazione: (2024)
di: Zhang, Xuan, et al.
Pubblicazione: (2024)
GUI-Libra: Training Native GUI Agents to Reason and Act with Action-aware Supervision and Partially Verifiable RL
di: Yang, Rui, et al.
Pubblicazione: (2026)
di: Yang, Rui, et al.
Pubblicazione: (2026)
Optimizing Chain-of-Thought Reasoners via Gradient Variance Minimization in Rejection Sampling and RL
di: Yao, Jiarui, et al.
Pubblicazione: (2025)
di: Yao, Jiarui, et al.
Pubblicazione: (2025)
Stabilizing Efficient Reasoning with Step-Level Advantage Selection
di: Wang, Han, et al.
Pubblicazione: (2026)
di: Wang, Han, et al.
Pubblicazione: (2026)
Tell Your Model Where to Attend: Post-hoc Attention Steering for LLMs
di: Zhang, Qingru, et al.
Pubblicazione: (2023)
di: Zhang, Qingru, et al.
Pubblicazione: (2023)
Training Language Models to Reason Efficiently
di: Arora, Daman, et al.
Pubblicazione: (2025)
di: Arora, Daman, et al.
Pubblicazione: (2025)
EfficientQAT: Efficient Quantization-Aware Training for Large Language Models
di: Chen, Mengzhao, et al.
Pubblicazione: (2024)
di: Chen, Mengzhao, et al.
Pubblicazione: (2024)
Training Nonlinear Transformers for Chain-of-Thought Inference: A Theoretical Generalization Analysis
di: Li, Hongkang, et al.
Pubblicazione: (2024)
di: Li, Hongkang, et al.
Pubblicazione: (2024)
Synthetic Computers at Scale for Long-Horizon Productivity Simulation
di: Ge, Tao, et al.
Pubblicazione: (2026)
di: Ge, Tao, et al.
Pubblicazione: (2026)
Stepwise Penalization for Length-Efficient Chain-of-Thought Reasoning
di: Li, Xintong, et al.
Pubblicazione: (2026)
di: Li, Xintong, et al.
Pubblicazione: (2026)
MM-Verify: Enhancing Multimodal Reasoning with Chain-of-Thought Verification
di: Sun, Linzhuang, et al.
Pubblicazione: (2025)
di: Sun, Linzhuang, et al.
Pubblicazione: (2025)
Reasoning-preserved Efficient Distillation of Large Language Models via Activation-aware Initialization
di: He, Junlin, et al.
Pubblicazione: (2026)
di: He, Junlin, et al.
Pubblicazione: (2026)
Faithfulness as Information Flow: Evaluating and Training Faithful Chain-of-Thought Reasoning
di: Jia, Jinghan, et al.
Pubblicazione: (2026)
di: Jia, Jinghan, et al.
Pubblicazione: (2026)
Diffusion of Thoughts: Chain-of-Thought Reasoning in Diffusion Language Models
di: Ye, Jiacheng, et al.
Pubblicazione: (2024)
di: Ye, Jiacheng, et al.
Pubblicazione: (2024)
Graph Chain-of-Thought: Augmenting Large Language Models by Reasoning on Graphs
di: Jin, Bowen, et al.
Pubblicazione: (2024)
di: Jin, Bowen, et al.
Pubblicazione: (2024)
Min-K%++: Improved Baseline for Detecting Pre-Training Data from Large Language Models
di: Zhang, Jingyang, et al.
Pubblicazione: (2024)
di: Zhang, Jingyang, et al.
Pubblicazione: (2024)
Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities
di: Sun, Hao, et al.
Pubblicazione: (2025)
di: Sun, Hao, et al.
Pubblicazione: (2025)
Vision-Language Models Can Self-Improve Reasoning via Reflection
di: Cheng, Kanzhi, et al.
Pubblicazione: (2024)
di: Cheng, Kanzhi, et al.
Pubblicazione: (2024)
Scalable Chain of Thoughts via Elastic Reasoning
di: Xu, Yuhui, et al.
Pubblicazione: (2025)
di: Xu, Yuhui, et al.
Pubblicazione: (2025)
Learning While Staying Curious: Entropy-Preserving Supervised Fine-Tuning via Adaptive Self-Distillation for Large Reasoning Models
di: Wang, Hao, et al.
Pubblicazione: (2026)
di: Wang, Hao, et al.
Pubblicazione: (2026)
ORION: Teaching Language Models to Reason Efficiently in the Language of Thought
di: Tanmay, Kumar, et al.
Pubblicazione: (2025)
di: Tanmay, Kumar, et al.
Pubblicazione: (2025)
Feature Extraction and Steering for Enhanced Chain-of-Thought Reasoning in Language Models
di: Li, Zihao, et al.
Pubblicazione: (2025)
di: Li, Zihao, et al.
Pubblicazione: (2025)
HyperAdaLoRA: Accelerating LoRA Rank Allocation During Training via Hypernetworks without Sacrificing Performance
di: Zhang, Hao, et al.
Pubblicazione: (2025)
di: Zhang, Hao, et al.
Pubblicazione: (2025)
Reasoning Models Generate Societies of Thought
di: Kim, Junsol, et al.
Pubblicazione: (2026)
di: Kim, Junsol, et al.
Pubblicazione: (2026)
Toward Adaptive Reasoning in Large Language Models with Thought Rollback
di: Chen, Sijia, et al.
Pubblicazione: (2024)
di: Chen, Sijia, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Diversifying the Expert Knowledge for Task-Agnostic Pruning in Sparse Mixture-of-Experts
di: Zhang, Zeliang, et al.
Pubblicazione: (2024) -
ReEval: Automatic Hallucination Evaluation for Retrieval-Augmented Large Language Models via Transferable Adversarial Attacks
di: Yu, Xiaodong, et al.
Pubblicazione: (2023) -
SmartThinker: Progressive Chain-of-Thought Length Calibration for Efficient Large Language Model Reasoning
di: Hu, Chenzhi, et al.
Pubblicazione: (2026) -
Reinforcement Learning for Reasoning in Large Language Models with One Training Example
di: Wang, Yiping, et al.
Pubblicazione: (2025) -
Decoder-Hybrid-Decoder Architecture for Efficient Reasoning with Long Generation
di: Ren, Liliang, et al.
Pubblicazione: (2025)