Learning from Peers in Reasoning Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Luo, Tongxu, Du, Wenyu, Bi, Jiaxi, Chung, Stephen, Tang, Zhengyang, Yang, Hao, Zhang, Min, Wang, Benyou |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Cut Your Losses! Learning to Prune Paths Early for Efficient Parallel Reasoning
par: Bi, Jiaxi, et autres
Publié: (2026)
par: Bi, Jiaxi, et autres
Publié: (2026)
MathScale: Scaling Instruction Tuning for Mathematical Reasoning
par: Tang, Zhengyang, et autres
Publié: (2024)
par: Tang, Zhengyang, et autres
Publié: (2024)
Learning from Failures in Multi-Attempt Reinforcement Learning
par: Chung, Stephen, et autres
Publié: (2025)
par: Chung, Stephen, et autres
Publié: (2025)
CRPO: Character-centric Group Relative Policy Optimization for Role-aware Reasoning in Role-playing Agents
par: Tang, Yihong, et autres
Publié: (2026)
par: Tang, Yihong, et autres
Publié: (2026)
Unlocking Continual Learning Abilities in Language Models
par: Du, Wenyu, et autres
Publié: (2024)
par: Du, Wenyu, et autres
Publié: (2024)
Stacking Your Transformers: A Closer Look at Model Growth for Efficient LLM Pre-Training
par: Du, Wenyu, et autres
Publié: (2024)
par: Du, Wenyu, et autres
Publié: (2024)
Teaching Language Models to Reason with Tools
par: Li, Chengpeng, et autres
Publié: (2025)
par: Li, Chengpeng, et autres
Publié: (2025)
Character-R1: Enhancing Role-Aware Reasoning in Role-Playing Agents via RLVR
par: Tang, Yihong, et autres
Publié: (2026)
par: Tang, Yihong, et autres
Publié: (2026)
Robust Search with Uncertainty-Aware Value Models for Language Model Reasoning
par: Yu, Fei, et autres
Publié: (2025)
par: Yu, Fei, et autres
Publié: (2025)
OVM, Outcome-supervised Value Models for Planning in Mathematical Reasoning
par: Yu, Fei, et autres
Publié: (2023)
par: Yu, Fei, et autres
Publié: (2023)
Thinker: Learning to Think Fast and Slow
par: Chung, Stephen, et autres
Publié: (2025)
par: Chung, Stephen, et autres
Publié: (2025)
Scaling Flaws of Verifier-Guided Search in Mathematical Reasoning
par: Yu, Fei, et autres
Publié: (2025)
par: Yu, Fei, et autres
Publié: (2025)
Towards Understanding Fine-Tuning Mechanisms of LLMs via Circuit Analysis
par: Wang, Xu, et autres
Publié: (2025)
par: Wang, Xu, et autres
Publié: (2025)
QFFT, Question-Free Fine-Tuning for Adaptive Reasoning
par: Liu, Wanlong, et autres
Publié: (2025)
par: Liu, Wanlong, et autres
Publié: (2025)
Do Phone-Use Agents Respect Your Privacy?
par: Tang, Zhengyang, et autres
Publié: (2026)
par: Tang, Zhengyang, et autres
Publié: (2026)
CALM Before the STORM: Unlocking Native Reasoning for Optimization Modeling
par: Tang, Zhengyang, et autres
Publié: (2025)
par: Tang, Zhengyang, et autres
Publié: (2025)
MoELoRA: Contrastive Learning Guided Mixture of Experts on Parameter-Efficient Fine-Tuning for Large Language Models
par: Luo, Tongxu, et autres
Publié: (2024)
par: Luo, Tongxu, et autres
Publié: (2024)
ORLM: A Customizable Framework in Training Large Models for Automated Optimization Modeling
par: Huang, Chenyu, et autres
Publié: (2024)
par: Huang, Chenyu, et autres
Publié: (2024)
CoRT: Code-integrated Reasoning within Thinking
par: Li, Chengpeng, et autres
Publié: (2025)
par: Li, Chengpeng, et autres
Publié: (2025)
Neeko: Leveraging Dynamic LoRA for Efficient Multi-Character Role-Playing Agent
par: Yu, Xiaoyan, et autres
Publié: (2024)
par: Yu, Xiaoyan, et autres
Publié: (2024)
Iterative Forward Tuning Boosts In-Context Learning in Language Models
par: Yang, Jiaxi, et autres
Publié: (2023)
par: Yang, Jiaxi, et autres
Publié: (2023)
Training with Harnesses: On-Policy Harness Self-Distillation for Complex Reasoning
par: Zhao, Zhengyang, et autres
Publié: (2026)
par: Zhao, Zhengyang, et autres
Publié: (2026)
Marathon: A Race Through the Realm of Long Context with Large Language Models
par: Zhang, Lei, et autres
Publié: (2023)
par: Zhang, Lei, et autres
Publié: (2023)
Peer-Predictive Self-Training for Language Model Reasoning
par: Feng, Shi, et autres
Publié: (2026)
par: Feng, Shi, et autres
Publié: (2026)
Disentangling Memory and Reasoning Ability in Large Language Models
par: Jin, Mingyu, et autres
Publié: (2024)
par: Jin, Mingyu, et autres
Publié: (2024)
RAG-Instruct: Boosting LLMs with Diverse Retrieval-Augmented Instructions
par: Liu, Wanlong, et autres
Publié: (2024)
par: Liu, Wanlong, et autres
Publié: (2024)
Smurfs: Multi-Agent System using Context-Efficient DFSDT for Tool Planning
par: Chen, Junzhi, et autres
Publié: (2024)
par: Chen, Junzhi, et autres
Publié: (2024)
Learning to Reason Across Parallel Samples for LLM Reasoning
par: Qi, Jianing, et autres
Publié: (2025)
par: Qi, Jianing, et autres
Publié: (2025)
Online Training of Large Language Models: Learn while chatting
par: Liang, Juhao, et autres
Publié: (2024)
par: Liang, Juhao, et autres
Publié: (2024)
Through the Valley: Path to Effective Long CoT Training for Small Language Models
par: Luo, Renjie, et autres
Publié: (2025)
par: Luo, Renjie, et autres
Publié: (2025)
Synthesizing Text-to-SQL Data from Weak and Strong LLMs
par: Yang, Jiaxi, et autres
Publié: (2024)
par: Yang, Jiaxi, et autres
Publié: (2024)
Dependency Structure Augmented Contextual Scoping Framework for Multimodal Aspect-Based Sentiment Analysis
par: Liu, Hao, et autres
Publié: (2025)
par: Liu, Hao, et autres
Publié: (2025)
START: Self-taught Reasoner with Tools
par: Li, Chengpeng, et autres
Publié: (2025)
par: Li, Chengpeng, et autres
Publié: (2025)
Learning Coarse-to-Fine Osteoarthritis Representations under Noisy Hierarchical Labels
par: Zhang, Tongxu
Publié: (2026)
par: Zhang, Tongxu
Publié: (2026)
Learning from Committee: Reasoning Distillation from a Mixture of Teachers with Peer-Review
par: Li, Zhuochun, et autres
Publié: (2024)
par: Li, Zhuochun, et autres
Publié: (2024)
Commitment Checklist: Auditing Author Commitments in Peer Review
par: Chen, Chung-Chi, et autres
Publié: (2026)
par: Chen, Chung-Chi, et autres
Publié: (2026)
FG-PRM: Fine-grained Hallucination Detection and Mitigation in Language Model Mathematical Reasoning
par: Li, Ruosen, et autres
Publié: (2024)
par: Li, Ruosen, et autres
Publié: (2024)
Self-Evolving Critique Abilities in Large Language Models
par: Tang, Zhengyang, et autres
Publié: (2025)
par: Tang, Zhengyang, et autres
Publié: (2025)
Learning a Structural Causal Model for Intuition Reasoning in Conversation
par: Chen, Hang, et autres
Publié: (2023)
par: Chen, Hang, et autres
Publié: (2023)
Synthetic Data (Almost) from Scratch: Generalized Instruction Tuning for Language Models
par: Li, Haoran, et autres
Publié: (2024)
par: Li, Haoran, et autres
Publié: (2024)
Documents similaires
-
Cut Your Losses! Learning to Prune Paths Early for Efficient Parallel Reasoning
par: Bi, Jiaxi, et autres
Publié: (2026) -
MathScale: Scaling Instruction Tuning for Mathematical Reasoning
par: Tang, Zhengyang, et autres
Publié: (2024) -
Learning from Failures in Multi-Attempt Reinforcement Learning
par: Chung, Stephen, et autres
Publié: (2025) -
CRPO: Character-centric Group Relative Policy Optimization for Role-aware Reasoning in Role-playing Agents
par: Tang, Yihong, et autres
Publié: (2026) -
Unlocking Continual Learning Abilities in Language Models
par: Du, Wenyu, et autres
Publié: (2024)