Offline Exploration-Aware Fine-Tuning for Long-Chain Mathematical Reasoning
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Mu, Yongyu, Zeng, Jiali, Meng, Fandong, Zhu, JingBo, Xiao, Tong |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Dissecting Long-Chain-of-Thought Reasoning Models: An Empirical Study
von: Mu, Yongyu, et al.
Veröffentlicht: (2025)
von: Mu, Yongyu, et al.
Veröffentlicht: (2025)
GRAM-R$^2$: Self-Training Generative Foundation Reward Models for Reward Reasoning
von: Wang, Chenglong, et al.
Veröffentlicht: (2025)
von: Wang, Chenglong, et al.
Veröffentlicht: (2025)
Demystifying Long Chain-of-Thought Reasoning in LLMs
von: Yeo, Edward, et al.
Veröffentlicht: (2025)
von: Yeo, Edward, et al.
Veröffentlicht: (2025)
Offline RL by Reward-Weighted Fine-Tuning for Conversation Optimization
von: Mukherjee, Subhojyoti, et al.
Veröffentlicht: (2025)
von: Mukherjee, Subhojyoti, et al.
Veröffentlicht: (2025)
ConCISE: Confidence-guided Compression in Step-by-step Efficient Reasoning
von: Qiao, Ziqing, et al.
Veröffentlicht: (2025)
von: Qiao, Ziqing, et al.
Veröffentlicht: (2025)
BIASEDTALES-ML: A Multilingual Dataset for Analyzing Narrative Attribute Distributions in LLM-Generated Stories
von: Ouyang, Yuxuan, et al.
Veröffentlicht: (2026)
von: Ouyang, Yuxuan, et al.
Veröffentlicht: (2026)
Long-Document QA with Chain-of-Structured-Thought and Fine-Tuned SLMs
von: Liang, Zhuowen, et al.
Veröffentlicht: (2026)
von: Liang, Zhuowen, et al.
Veröffentlicht: (2026)
Outcome-Grounded Advantage Reshaping for Fine-Grained Credit Assignment in Mathematical Reasoning
von: Li, Ziheng, et al.
Veröffentlicht: (2026)
von: Li, Ziheng, et al.
Veröffentlicht: (2026)
Multilingual OCR-Aware Fine-Tuning and Prompt-Guided Chain-of-Thought Reasoning for Multimodal Large Language Models
von: Xu, Qinwu, et al.
Veröffentlicht: (2026)
von: Xu, Qinwu, et al.
Veröffentlicht: (2026)
Long-Context Reasoning Through Proxy-Based Chain-of-Thought Tuning
von: Li, Miao, et al.
Veröffentlicht: (2026)
von: Li, Miao, et al.
Veröffentlicht: (2026)
OCEAN: Offline Chain-of-thought Evaluation and Alignment in Large Language Models
von: Wu, Junda, et al.
Veröffentlicht: (2024)
von: Wu, Junda, et al.
Veröffentlicht: (2024)
CoMAT: Chain of Mathematically Annotated Thought Improves Mathematical Reasoning
von: Leang, Joshua Ong Jun, et al.
Veröffentlicht: (2024)
von: Leang, Joshua Ong Jun, et al.
Veröffentlicht: (2024)
Ignore the KL Penalty! Boosting Exploration on Critical Tokens to Enhance RL Fine-Tuning
von: Vassoyan, Jean, et al.
Veröffentlicht: (2025)
von: Vassoyan, Jean, et al.
Veröffentlicht: (2025)
Language Generation with Strictly Proper Scoring Rules
von: Shao, Chenze, et al.
Veröffentlicht: (2024)
von: Shao, Chenze, et al.
Veröffentlicht: (2024)
MathScale: Scaling Instruction Tuning for Mathematical Reasoning
von: Tang, Zhengyang, et al.
Veröffentlicht: (2024)
von: Tang, Zhengyang, et al.
Veröffentlicht: (2024)
Anchored Supervised Fine-Tuning
von: Zhu, He, et al.
Veröffentlicht: (2025)
von: Zhu, He, et al.
Veröffentlicht: (2025)
RAGognizer: Hallucination-Aware Fine-Tuning via Detection Head Integration
von: Ridder, Fabian, et al.
Veröffentlicht: (2026)
von: Ridder, Fabian, et al.
Veröffentlicht: (2026)
SAFT: Structure-Aware Fine-Tuning of LLMs for AMR-to-Text Generation
von: Kamel, Rafiq, et al.
Veröffentlicht: (2025)
von: Kamel, Rafiq, et al.
Veröffentlicht: (2025)
Beyond Next Token Prediction: Patch-Level Training for Large Language Models
von: Shao, Chenze, et al.
Veröffentlicht: (2024)
von: Shao, Chenze, et al.
Veröffentlicht: (2024)
Parameter-Efficient Fine-Tuning of State Space Models
von: Galim, Kevin, et al.
Veröffentlicht: (2024)
von: Galim, Kevin, et al.
Veröffentlicht: (2024)
From Accuracy to Robustness: A Study of Rule- and Model-based Verifiers in Mathematical Reasoning
von: Huang, Yuzhen, et al.
Veröffentlicht: (2025)
von: Huang, Yuzhen, et al.
Veröffentlicht: (2025)
Semantic-Space Exploration and Exploitation in RLVR for LLM Reasoning
von: Huang, Fanding, et al.
Veröffentlicht: (2025)
von: Huang, Fanding, et al.
Veröffentlicht: (2025)
Dissecting Fine-Tuning Unlearning in Large Language Models
von: Hong, Yihuai, et al.
Veröffentlicht: (2024)
von: Hong, Yihuai, et al.
Veröffentlicht: (2024)
Cheaper, Better, Faster, Stronger: Robust Text-to-SQL without Chain-of-Thought or Fine-Tuning
von: Dönder, Yusuf Denizay, et al.
Veröffentlicht: (2025)
von: Dönder, Yusuf Denizay, et al.
Veröffentlicht: (2025)
Improve Mathematical Reasoning in Language Models by Automated Process Supervision
von: Luo, Liangchen, et al.
Veröffentlicht: (2024)
von: Luo, Liangchen, et al.
Veröffentlicht: (2024)
Inference-Aware Fine-Tuning for Best-of-N Sampling in Large Language Models
von: Chow, Yinlam, et al.
Veröffentlicht: (2024)
von: Chow, Yinlam, et al.
Veröffentlicht: (2024)
RewardAnything: Generalizable Principle-Following Reward Models
von: Yu, Zhuohao, et al.
Veröffentlicht: (2025)
von: Yu, Zhuohao, et al.
Veröffentlicht: (2025)
Can Language Models Perform Robust Reasoning in Chain-of-thought Prompting with Noisy Rationales?
von: Zhou, Zhanke, et al.
Veröffentlicht: (2024)
von: Zhou, Zhanke, et al.
Veröffentlicht: (2024)
Cross-layer Attention Sharing for Pre-trained Large Language Models
von: Mu, Yongyu, et al.
Veröffentlicht: (2024)
von: Mu, Yongyu, et al.
Veröffentlicht: (2024)
Reassessing the Role of Supervised Fine-Tuning: An Empirical Study in VLM Reasoning
von: Yu, Yongcan, et al.
Veröffentlicht: (2025)
von: Yu, Yongcan, et al.
Veröffentlicht: (2025)
Unleashing the Reasoning Potential of Pre-trained LLMs by Critique Fine-Tuning on One Problem
von: Wang, Yubo, et al.
Veröffentlicht: (2025)
von: Wang, Yubo, et al.
Veröffentlicht: (2025)
ScoNe: Benchmarking Negation Reasoning in Language Models With Fine-Tuning and In-Context Learning
von: She, Jingyuan Selena, et al.
Veröffentlicht: (2023)
von: She, Jingyuan Selena, et al.
Veröffentlicht: (2023)
Long Chain-of-Thought Reasoning Across Languages
von: Barua, Josh, et al.
Veröffentlicht: (2025)
von: Barua, Josh, et al.
Veröffentlicht: (2025)
SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning
von: Fu, Yuqian, et al.
Veröffentlicht: (2025)
von: Fu, Yuqian, et al.
Veröffentlicht: (2025)
HiFT: A Hierarchical Full Parameter Fine-Tuning Strategy
von: Liu, Yongkang, et al.
Veröffentlicht: (2024)
von: Liu, Yongkang, et al.
Veröffentlicht: (2024)
DRT: Deep Reasoning Translation via Long Chain-of-Thought
von: Wang, Jiaan, et al.
Veröffentlicht: (2024)
von: Wang, Jiaan, et al.
Veröffentlicht: (2024)
AF Adapter: Continual Pretraining for Building Chinese Biomedical Language Model
von: Yan, Yongyu, et al.
Veröffentlicht: (2022)
von: Yan, Yongyu, et al.
Veröffentlicht: (2022)
L4Q: Parameter Efficient Quantization-Aware Fine-Tuning on Large Language Models
von: Jeon, Hyesung, et al.
Veröffentlicht: (2024)
von: Jeon, Hyesung, et al.
Veröffentlicht: (2024)
A Semantic-Aware Layer-Freezing Approach to Computation-Efficient Fine-Tuning of Language Models
von: Gu, Jian, et al.
Veröffentlicht: (2024)
von: Gu, Jian, et al.
Veröffentlicht: (2024)
Unlocking Efficient, Scalable, and Continual Knowledge Editing with Basis-Level Representation Fine-Tuning
von: Liu, Tianci, et al.
Veröffentlicht: (2025)
von: Liu, Tianci, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Dissecting Long-Chain-of-Thought Reasoning Models: An Empirical Study
von: Mu, Yongyu, et al.
Veröffentlicht: (2025) -
GRAM-R$^2$: Self-Training Generative Foundation Reward Models for Reward Reasoning
von: Wang, Chenglong, et al.
Veröffentlicht: (2025) -
Demystifying Long Chain-of-Thought Reasoning in LLMs
von: Yeo, Edward, et al.
Veröffentlicht: (2025) -
Offline RL by Reward-Weighted Fine-Tuning for Conversation Optimization
von: Mukherjee, Subhojyoti, et al.
Veröffentlicht: (2025) -
ConCISE: Confidence-guided Compression in Step-by-step Efficient Reasoning
von: Qiao, Ziqing, et al.
Veröffentlicht: (2025)