TinyR1-32B-Preview: Boosting Accuracy with Branch-Merge Distillation
Fuente:
arXiv
Salvato in:
| Autori principali: | Sun, Lin, Zhao, Guangxiang, Jian, Xiaoqi, Wu, Yuhan, Lin, Weihong, Zhu, Yongfu, Shi, Qilong, Jia, Change, Yuan, Aomufei, Tian, Yuxuan, Zhang, Linglin, Wu, Jinzhu, Ran, Junfeng, Hu, Sai-er, Jiang, Zihan, Zhou, Junting, Liu, Wenrui, Xiao, Xusen, Cui, Bin, Yang, Tong, Zhang, Xiangzheng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Evaluation is All You Need: Strategic Overclaiming of LLM Reasoning Capabilities Through Evaluation Design
di: Sun, Lin, et al.
Pubblicazione: (2025)
di: Sun, Lin, et al.
Pubblicazione: (2025)
Beyond Parameter Arithmetic: Sparse Complementary Fusion for Distribution-Aware Model Merging
di: Lin, Weihong, et al.
Pubblicazione: (2026)
di: Lin, Weihong, et al.
Pubblicazione: (2026)
Large Language Models Badly Generalize across Option Length, Problem Types, and Irrelevant Noun Replacements
di: Zhao, Guangxiang, et al.
Pubblicazione: (2025)
di: Zhao, Guangxiang, et al.
Pubblicazione: (2025)
Uncertainty Under the Curve: A Sequence-Level Entropy Area Metric for Reasoning LLM
di: Zhu, Yongfu, et al.
Pubblicazione: (2025)
di: Zhu, Yongfu, et al.
Pubblicazione: (2025)
Thinking with Reasoning Skills: Fewer Tokens, More Accuracy
di: Zhao, Guangxiang, et al.
Pubblicazione: (2026)
di: Zhao, Guangxiang, et al.
Pubblicazione: (2026)
BEAR: Budgeted Evidence Allocation for Multi-Document Reasoning
di: Sun, Lin, et al.
Pubblicazione: (2026)
di: Sun, Lin, et al.
Pubblicazione: (2026)
A Primer in Post-Training Reasoning Data: What We Know About How It Works
di: Li, Yaoming, et al.
Pubblicazione: (2026)
di: Li, Yaoming, et al.
Pubblicazione: (2026)
When Good OCR Is Not Enough: Benchmarking OCR Robustness for Retrieval-Augmented Generation
di: Sun, Lin, et al.
Pubblicazione: (2026)
di: Sun, Lin, et al.
Pubblicazione: (2026)
Router Upcycling: Leveraging Mixture-of-Routers in Mixture-of-Experts Upcycling
di: Ran, Junfeng, et al.
Pubblicazione: (2025)
di: Ran, Junfeng, et al.
Pubblicazione: (2025)
Beyond Static Alignment: Hierarchical Policy Control for LLM Safety via Risk-Aware Chain-of-Thought
di: Si, Jianfeng, et al.
Pubblicazione: (2026)
di: Si, Jianfeng, et al.
Pubblicazione: (2026)
Chain-of-Thought Matters: Improving Long-Context Language Models with Reasoning Path Supervision
di: Zhu, Dawei, et al.
Pubblicazione: (2025)
di: Zhu, Dawei, et al.
Pubblicazione: (2025)
Light-IF: Endowing LLMs with Generalizable Reasoning via Preview and Self-Checking for Complex Instruction Following
di: Wang, Chenyang, et al.
Pubblicazione: (2025)
di: Wang, Chenyang, et al.
Pubblicazione: (2025)
Noise Aggregation Analysis Driven by Small-Noise Injection: Efficient Membership Inference for Diffusion Models
di: Li, Guo, et al.
Pubblicazione: (2025)
di: Li, Guo, et al.
Pubblicazione: (2025)
DiffusionBrowser: Interactive Diffusion Previews via Multi-Branch Decoders
di: Hong, Susung, et al.
Pubblicazione: (2025)
di: Hong, Susung, et al.
Pubblicazione: (2025)
UMM-RM: An Upcycle-and-Merge MoE Reward Model for Mitigating Reward Hacking
di: Fu, Lingling, et al.
Pubblicazione: (2025)
di: Fu, Lingling, et al.
Pubblicazione: (2025)
Time‐Resolved Mapping of Interface Charge Transfer for Real‐Time Observation of Microscopic Chemical Reactions
di: Jinyang Zhang, et al.
Pubblicazione: (2026)
di: Jinyang Zhang, et al.
Pubblicazione: (2026)
Time‐Resolved Mapping of Interface Charge Transfer for Real‐Time Observation of Microscopic Chemical Reactions
di: Jinyang Zhang, et al.
Pubblicazione: (2026)
di: Jinyang Zhang, et al.
Pubblicazione: (2026)
TPMM-DPO: Trajectory-aware Preference-guided Model Merging for Iterative Direct Preference Optimization
di: Fu, Lingling, et al.
Pubblicazione: (2026)
di: Fu, Lingling, et al.
Pubblicazione: (2026)
LongAttn: Selecting Long-context Training Data via Token-level Attention
di: Wu, Longyun, et al.
Pubblicazione: (2025)
di: Wu, Longyun, et al.
Pubblicazione: (2025)
Exercise Attenuates Skeletal Muscle Atrophy in Senescent SAMP8 Mice: Metabolic Insights from NMR-Based Metabolomics.
di: Wu, Wenfang, et al.
Pubblicazione: (2025)
di: Wu, Wenfang, et al.
Pubblicazione: (2025)
Efficient Switchable Safety Control in LLMs via Magic-Token-Guided Co-Training
di: Si, Jianfeng, et al.
Pubblicazione: (2025)
di: Si, Jianfeng, et al.
Pubblicazione: (2025)
A remark on $Λ^2$-enlargeable manifolds
di: Su, Guangxiang
Pubblicazione: (2025)
di: Su, Guangxiang
Pubblicazione: (2025)
KVReviver: Reversible KV Cache Compression with Sketch-Based Token Reconstruction
di: Yuan, Aomufei, et al.
Pubblicazione: (2025)
di: Yuan, Aomufei, et al.
Pubblicazione: (2025)
Classic4Children: Adapting Chinese Literary Classics for Children with Large Language Model
di: Chen, Jiali, et al.
Pubblicazione: (2025)
di: Chen, Jiali, et al.
Pubblicazione: (2025)
LookCloser: Frequency-aware Radiance Field for Tiny-Detail Scene
di: Zhang, Xiaoyu, et al.
Pubblicazione: (2025)
di: Zhang, Xiaoyu, et al.
Pubblicazione: (2025)
TinyChart: Efficient Chart Understanding with Visual Token Merging and Program-of-Thoughts Learning
di: Zhang, Liang, et al.
Pubblicazione: (2024)
di: Zhang, Liang, et al.
Pubblicazione: (2024)
How to Weight Multitask Finetuning? Fast Previews via Bayesian Model-Merging
di: Maldonado, Hugo Monzón, et al.
Pubblicazione: (2024)
di: Maldonado, Hugo Monzón, et al.
Pubblicazione: (2024)
Risk of malignancy of cytologic categories and post‐biopsy clinical management of renal oncocytic neoplasms
di: Xiaoqi Lin
Pubblicazione: (2025)
di: Xiaoqi Lin
Pubblicazione: (2025)
Observer‐Based Finite‐Time Preview Control of Nonlinear Discrete‐Time Systems
di: Li Li, et al.
Pubblicazione: (2025)
di: Li Li, et al.
Pubblicazione: (2025)
The weak Galerkin finite element method for Stokes interface problems with curved interface
di: Yang, Lin, et al.
Pubblicazione: (2022)
di: Yang, Lin, et al.
Pubblicazione: (2022)
Scalable Co-Clustering for Large-Scale Data through Dynamic Partitioning and Hierarchical Merging
di: Wu, Zihan, et al.
Pubblicazione: (2024)
di: Wu, Zihan, et al.
Pubblicazione: (2024)
DiFaR: Enhancing Multimodal Misinformation Detection with Diverse, Factual, and Relevant Rationales
di: Wan, Herun, et al.
Pubblicazione: (2025)
di: Wan, Herun, et al.
Pubblicazione: (2025)
WizardMerge -- Save Us From Merging Without Any Clues
di: Zhang, Qingyu, et al.
Pubblicazione: (2024)
di: Zhang, Qingyu, et al.
Pubblicazione: (2024)
Nocturnal Hypoxemia and Daytime Sleepiness in Epilepsy With Obstructive Sleep Apnea‐Hypopnea Syndrome: A Case–Control Polysomnography Study
di: Meina Wu, et al.
Pubblicazione: (2025)
di: Meina Wu, et al.
Pubblicazione: (2025)
BD-Merging: Bias-Aware Dynamic Model Merging with Evidence-Guided Contrastive Learning
di: Xie, Yuhan, et al.
Pubblicazione: (2026)
di: Xie, Yuhan, et al.
Pubblicazione: (2026)
MRS-YOLO Railroad Transmission Line Foreign Object Detection Based on Improved YOLO11 and Channel Pruning
di: Liu, Siyuan, et al.
Pubblicazione: (2025)
di: Liu, Siyuan, et al.
Pubblicazione: (2025)
The Immersed Discontinuous Galerkin Method for Elliptic Interface Problems
di: Yang, Lin, et al.
Pubblicazione: (2026)
di: Yang, Lin, et al.
Pubblicazione: (2026)
The Immersed Skeletal Finite Element Method for Elliptic Interface Problems
di: Yang, Lin, et al.
Pubblicazione: (2024)
di: Yang, Lin, et al.
Pubblicazione: (2024)
From Manipulation to Mistrust: Explaining Diverse Micro-Video Misinformation for Robust Debunking in the Wild
di: Zeng, Zhi, et al.
Pubblicazione: (2026)
di: Zeng, Zhi, et al.
Pubblicazione: (2026)
Automated Lane Merging via Game Theory and Branch Model Predictive Control
di: Zhang, Luyao, et al.
Pubblicazione: (2023)
di: Zhang, Luyao, et al.
Pubblicazione: (2023)
Documenti analoghi
-
Evaluation is All You Need: Strategic Overclaiming of LLM Reasoning Capabilities Through Evaluation Design
di: Sun, Lin, et al.
Pubblicazione: (2025) -
Beyond Parameter Arithmetic: Sparse Complementary Fusion for Distribution-Aware Model Merging
di: Lin, Weihong, et al.
Pubblicazione: (2026) -
Large Language Models Badly Generalize across Option Length, Problem Types, and Irrelevant Noun Replacements
di: Zhao, Guangxiang, et al.
Pubblicazione: (2025) -
Uncertainty Under the Curve: A Sequence-Level Entropy Area Metric for Reasoning LLM
di: Zhu, Yongfu, et al.
Pubblicazione: (2025) -
Thinking with Reasoning Skills: Fewer Tokens, More Accuracy
di: Zhao, Guangxiang, et al.
Pubblicazione: (2026)