R2R: Efficiently Navigating Divergent Reasoning Paths with Small-Large Model Token Routing
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Fu, Tianyu, Ge, Yi, You, Yichen, Liu, Enshu, Yuan, Zhihang, Dai, Guohao, Yan, Shengen, Yang, Huazhong, Wang, Yu |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Think-at-Hard: Selective Latent Iterations to Improve Reasoning Language Models
par: Fu, Tianyu, et autres
Publié: (2025)
par: Fu, Tianyu, et autres
Publié: (2025)
FrameFusion: Combining Similarity and Importance for Video Token Reduction on Large Vision Language Models
par: Fu, Tianyu, et autres
Publié: (2024)
par: Fu, Tianyu, et autres
Publié: (2024)
When Is the Same Model Not the Same Service? A Measurement Study of Hosted Open-Weight LLM APIs
par: Li, Haorui, et autres
Publié: (2026)
par: Li, Haorui, et autres
Publié: (2026)
Mixture of Attention Spans: Optimizing LLM Inference Efficiency with Heterogeneous Sliding-Window Lengths
par: Fu, Tianyu, et autres
Publié: (2024)
par: Fu, Tianyu, et autres
Publié: (2024)
OrbitFlow: SLO-Aware Long-Context LLM Serving with Fine-Grained KV Cache Reconfiguration
par: Ma, Xinyue, et autres
Publié: (2026)
par: Ma, Xinyue, et autres
Publié: (2026)
A Performance Evaluation of a Quantized Large Language Model on Various Smartphones
par: Çöplü, Tolga, et autres
Publié: (2023)
par: Çöplü, Tolga, et autres
Publié: (2023)
StreamIndex: Memory-Bounded Compressed Sparse Attention via Streaming Top-k
par: Jaber, Jaber, et autres
Publié: (2026)
par: Jaber, Jaber, et autres
Publié: (2026)
R-Genie: Reasoning-Guided Generative Image Editing
par: Zhang, Dong, et autres
Publié: (2025)
par: Zhang, Dong, et autres
Publié: (2025)
Rotary GPU: Exploring Local Execution Paths for Large Mixture-of-Experts Models Under Limited GPU Memory
par: Jo, Myeong Jun
Publié: (2026)
par: Jo, Myeong Jun
Publié: (2026)
Protection Is (Nearly) All You Need: Structural Protection Dominates Scoring in Globally Capped KV Eviction
par: Garcia, Gabriel
Publié: (2026)
par: Garcia, Gabriel
Publié: (2026)
Fast Quiet-STaR: Thinking Without Thought Tokens
par: Huang, Wei, et autres
Publié: (2025)
par: Huang, Wei, et autres
Publié: (2025)
D-COT: Disciplined Chain-of-Thought Learning for Efficient Reasoning in Small Language Models
par: Ubukata, Shunsuke
Publié: (2026)
par: Ubukata, Shunsuke
Publié: (2026)
Token Arena: A Continuous Benchmark Unifying Energy and Cognition in AI Inference
par: Gao, Yuxuan, et autres
Publié: (2026)
par: Gao, Yuxuan, et autres
Publié: (2026)
Why Models Know But Don't Say: Chain-of-Thought Faithfulness Divergence Between Thinking Tokens and Answers in Open-Weight Reasoning Models
par: Young, Richard J.
Publié: (2026)
par: Young, Richard J.
Publié: (2026)
Parallelization Strategies for Dense LLM Deployment: Navigating Through Application-Specific Tradeoffs and Bottlenecks
par: Topcu, Burak, et autres
Publié: (2026)
par: Topcu, Burak, et autres
Publié: (2026)
Towards Building Private LLMs: Exploring Multi-Node Expert Parallelism on Apple Silicon for Mixture-of-Experts Large Language Model
par: Chen, Mu-Chi, et autres
Publié: (2025)
par: Chen, Mu-Chi, et autres
Publié: (2025)
Reasoning-Based AI for Startup Evaluation (R.A.I.S.E.): A Memory-Augmented, Multi-Step Decision Framework
par: Preuveneers, Jack, et autres
Publié: (2025)
par: Preuveneers, Jack, et autres
Publié: (2025)
Beyond Token Length: Step Pruner for Efficient and Accurate Reasoning in Large Language Models
par: Wu, Canhui, et autres
Publié: (2025)
par: Wu, Canhui, et autres
Publié: (2025)
Just Pass Twice: Efficient Token Classification with LLMs for Zero-Shot NER
par: Ewais, Ahmed, et autres
Publié: (2026)
par: Ewais, Ahmed, et autres
Publié: (2026)
Comparative Analysis of Large Language Model Inference Serving Systems: A Performance Study of vLLM and HuggingFace TGI
par: Kolluru, Saicharan
Publié: (2025)
par: Kolluru, Saicharan
Publié: (2025)
Physics-R1: An Audited Olympiad Corpus and Recipe for Visual Physics Reasoning
par: Yang, Shan
Publié: (2026)
par: Yang, Shan
Publié: (2026)
Enhancing the Reasoning Capabilities of Small Language Models via Solution Guidance Fine-Tuning
par: Bi, Jing, et autres
Publié: (2024)
par: Bi, Jing, et autres
Publié: (2024)
Search-R3: Unifying Reasoning and Embedding in Large Language Models
par: Gui, Yuntao, et autres
Publié: (2025)
par: Gui, Yuntao, et autres
Publié: (2025)
Surprise Calibration for Better In-Context Learning
par: Tan, Zhihang, et autres
Publié: (2025)
par: Tan, Zhihang, et autres
Publié: (2025)
LaTIM: Measuring Latent Token-to-Token Interactions in Mamba Models
par: Pitorro, Hugo, et autres
Publié: (2025)
par: Pitorro, Hugo, et autres
Publié: (2025)
Efficient Aspect-Based Summarization of Climate Change Reports with Small Language Models
par: Ghinassi, Iacopo, et autres
Publié: (2024)
par: Ghinassi, Iacopo, et autres
Publié: (2024)
Luth: Efficient French Specialization for Small Language Models and Cross-Lingual Transfer
par: Lasbordes, Maxence, et autres
Publié: (2025)
par: Lasbordes, Maxence, et autres
Publié: (2025)
CRISP: Persistent Concept Unlearning via Sparse Autoencoders
par: Ashuach, Tomer, et autres
Publié: (2025)
par: Ashuach, Tomer, et autres
Publié: (2025)
Cache-to-Cache: Direct Semantic Communication Between Large Language Models
par: Fu, Tianyu, et autres
Publié: (2025)
par: Fu, Tianyu, et autres
Publié: (2025)
SCULPT: Constraint-Guided Pruned MCTS that Carves Efficient Paths for Mathematical Reasoning
par: Fang, Qitong, et autres
Publié: (2026)
par: Fang, Qitong, et autres
Publié: (2026)
Efficient Reasoning via Thought-Training and Thought-Free Inference
par: Wu, Canhui, et autres
Publié: (2025)
par: Wu, Canhui, et autres
Publié: (2025)
PathBench: Speech Intelligibility Benchmark for Automatic Pathological Speech Assessment
par: Halpern, Bence Mark, et autres
Publié: (2026)
par: Halpern, Bence Mark, et autres
Publié: (2026)
SUBLLM: A Novel Efficient Architecture with Token Sequence Subsampling for LLM
par: Wang, Quandong, et autres
Publié: (2024)
par: Wang, Quandong, et autres
Publié: (2024)
Steer-MoE: Efficient Audio-Language Alignment with a Mixture-of-Experts Steering Module
par: Feng, Ruitao, et autres
Publié: (2025)
par: Feng, Ruitao, et autres
Publié: (2025)
SAGE: Hierarchical LLM-Based Literary Evaluation through Ontology-Grounded Interpretive Dimensions
par: Wang, Tianyu, et autres
Publié: (2026)
par: Wang, Tianyu, et autres
Publié: (2026)
All for One: LLMs Solve Mental Math at the Last Token With Information Transferred From Other Tokens
par: Mamidanna, Siddarth, et autres
Publié: (2025)
par: Mamidanna, Siddarth, et autres
Publié: (2025)
MAS-Attention: Memory-Aware Stream Processing for Attention Acceleration on Resource-Constrained Edge Devices
par: Shakerdargah, Mohammadali, et autres
Publié: (2024)
par: Shakerdargah, Mohammadali, et autres
Publié: (2024)
PerCoR: Evaluating Commonsense Reasoning in Persian via Multiple-Choice Sentence Completion
par: Alikhani, Morteza, et autres
Publié: (2025)
par: Alikhani, Morteza, et autres
Publié: (2025)
PromptSAM+: Malware Detection based on Prompt Segment Anything Model
par: Wei, Xingyuan, et autres
Publié: (2024)
par: Wei, Xingyuan, et autres
Publié: (2024)
Overclocking LLM Reasoning: Monitoring and Controlling Thinking Path Lengths in LLMs
par: Eisenstadt, Roy, et autres
Publié: (2025)
par: Eisenstadt, Roy, et autres
Publié: (2025)
Documents similaires
-
Think-at-Hard: Selective Latent Iterations to Improve Reasoning Language Models
par: Fu, Tianyu, et autres
Publié: (2025) -
FrameFusion: Combining Similarity and Importance for Video Token Reduction on Large Vision Language Models
par: Fu, Tianyu, et autres
Publié: (2024) -
When Is the Same Model Not the Same Service? A Measurement Study of Hosted Open-Weight LLM APIs
par: Li, Haorui, et autres
Publié: (2026) -
Mixture of Attention Spans: Optimizing LLM Inference Efficiency with Heterogeneous Sliding-Window Lengths
par: Fu, Tianyu, et autres
Publié: (2024) -
OrbitFlow: SLO-Aware Long-Context LLM Serving with Fine-Grained KV Cache Reconfiguration
par: Ma, Xinyue, et autres
Publié: (2026)