Making Small Language Models Efficient Reasoners: Intervention, Supervision, Reinforcement
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Xuechen, Huang, Zijian, Ni, Chenshun, Xiong, Ziyang, Chen, Jiasi, Oymak, Samet |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
BREAD: Branched Rollouts from Expert Anchors Bridge SFT & RL for Reasoning
por: Zhang, Xuechen, et al.
Publicado: (2025)
por: Zhang, Xuechen, et al.
Publicado: (2025)
VSPO: Vector-Steered Policy Optimization for Behavioral Control
por: Zhang, Xuechen, et al.
Publicado: (2026)
por: Zhang, Xuechen, et al.
Publicado: (2026)
Efficient Contextual LLM Cascades through Budget-Constrained Policy Learning
por: Zhang, Xuechen, et al.
Publicado: (2024)
por: Zhang, Xuechen, et al.
Publicado: (2024)
SmartChunk Retrieval: Query-Aware Chunk Compression with Planning for Efficient Document RAG
por: Zhang, Xuechen, et al.
Publicado: (2025)
por: Zhang, Xuechen, et al.
Publicado: (2025)
Class-attribute Priors: Adapting Optimization to Heterogeneity and Fairness Objective
por: Zhang, Xuechen, et al.
Publicado: (2024)
por: Zhang, Xuechen, et al.
Publicado: (2024)
Selective Attention: Enhancing Transformer through Principled Context Control
por: Zhang, Xuechen, et al.
Publicado: (2024)
por: Zhang, Xuechen, et al.
Publicado: (2024)
On the Power of Convolution Augmented Transformer
por: Li, Mingchen, et al.
Publicado: (2024)
por: Li, Mingchen, et al.
Publicado: (2024)
Continuous Chain of Thought Enables Parallel Exploration and Reasoning
por: Gozeten, Halil Alperen, et al.
Publicado: (2025)
por: Gozeten, Halil Alperen, et al.
Publicado: (2025)
Latent Chain-of-Thought Improves Structured-Data Transformers
por: Dudley, Carson, et al.
Publicado: (2026)
por: Dudley, Carson, et al.
Publicado: (2026)
Covariance-Aware Transformers for Quadratic Programming and Decision Making
por: Tire, Kutay, et al.
Publicado: (2026)
por: Tire, Kutay, et al.
Publicado: (2026)
L3GS: Layered 3D Gaussian Splats for Efficient 3D Scene Delivery
por: Tsai, Yi-Zhen, et al.
Publicado: (2025)
por: Tsai, Yi-Zhen, et al.
Publicado: (2025)
Test-Time Training Provably Improves Transformers as In-context Learners
por: Gozeten, Halil Alperen, et al.
Publicado: (2025)
por: Gozeten, Halil Alperen, et al.
Publicado: (2025)
Evolutionary Multi-Task Optimization for LLM-Guided Program Discovery
por: Gozeten, Halil Alperen, et al.
Publicado: (2026)
por: Gozeten, Halil Alperen, et al.
Publicado: (2026)
PaperGuide: Making Small Language-Model Paper-Reading Agents More Efficient
por: Wang, Zijian, et al.
Publicado: (2026)
por: Wang, Zijian, et al.
Publicado: (2026)
Learning to Bet for Horizon-Aware Anytime-Valid Testing
por: Taga, Ege Onur, et al.
Publicado: (2026)
por: Taga, Ege Onur, et al.
Publicado: (2026)
Learning to Correct: Calibrated Reinforcement Learning for Multi-Attempt Chain-of-Thought
por: Ildiz, Muhammed Emrullah, et al.
Publicado: (2026)
por: Ildiz, Muhammed Emrullah, et al.
Publicado: (2026)
Attention with Trained Embeddings Provably Selects Important Tokens
por: Wu, Diyuan, et al.
Publicado: (2025)
por: Wu, Diyuan, et al.
Publicado: (2025)
TimePFN: Effective Multivariate Time Series Forecasting with Synthetic Data
por: Taga, Ege Onur, et al.
Publicado: (2025)
por: Taga, Ege Onur, et al.
Publicado: (2025)
In-Context Learning Under Regime Change
por: Dudley, Carson, et al.
Publicado: (2026)
por: Dudley, Carson, et al.
Publicado: (2026)
Fine-grained Analysis of In-context Linear Estimation: Data, Architecture, and Beyond
por: Li, Yingcong, et al.
Publicado: (2024)
por: Li, Yingcong, et al.
Publicado: (2024)
Can Transformers Learn Optimal Filtering for Unknown Systems?
por: Balim, Haldun, et al.
Publicado: (2023)
por: Balim, Haldun, et al.
Publicado: (2023)
From Self-Attention to Markov Models: Unveiling the Dynamics of Generative Transformers
por: Ildiz, M. Emrullah, et al.
Publicado: (2024)
por: Ildiz, M. Emrullah, et al.
Publicado: (2024)
RAPID: An Efficient Reinforcement Learning Algorithm for Small Language Models
por: Huang, Lianghuan, et al.
Publicado: (2025)
por: Huang, Lianghuan, et al.
Publicado: (2025)
Retrieval Augmented Time Series Forecasting
por: Tire, Kutay, et al.
Publicado: (2024)
por: Tire, Kutay, et al.
Publicado: (2024)
Good Reasoning Makes Good Demonstrations: Implicit Reasoning Quality Supervision via In-Context Reinforcement Learning
por: Mei, Tiehua, et al.
Publicado: (2026)
por: Mei, Tiehua, et al.
Publicado: (2026)
Can Mamba Learn How to Learn? A Comparative Study on In-Context Learning Tasks
por: Park, Jongho, et al.
Publicado: (2024)
por: Park, Jongho, et al.
Publicado: (2024)
Transformers as Support Vector Machines
por: Tarzanagh, Davoud Ataee, et al.
Publicado: (2023)
por: Tarzanagh, Davoud Ataee, et al.
Publicado: (2023)
Internalizing Outcome Supervision into Process Supervision: A New Paradigm for Reinforcement Learning for Reasoning
por: Ding, Fei, et al.
Publicado: (2026)
por: Ding, Fei, et al.
Publicado: (2026)
High-dimensional Analysis of Knowledge Distillation: Weak-to-Strong Generalization and Scaling Laws
por: Ildiz, M. Emrullah, et al.
Publicado: (2024)
por: Ildiz, M. Emrullah, et al.
Publicado: (2024)
Mechanics of Next Token Prediction with Self-Attention
por: Li, Yingcong, et al.
Publicado: (2024)
por: Li, Yingcong, et al.
Publicado: (2024)
VeriThinker: Learning to Verify Makes Reasoning Model Efficient
por: Chen, Zigeng, et al.
Publicado: (2025)
por: Chen, Zigeng, et al.
Publicado: (2025)
Identifying Trustworthiness Challenges in Deep Learning Models for Continental-Scale Water Quality Prediction
por: Xia, Xiaobo, et al.
Publicado: (2025)
por: Xia, Xiaobo, et al.
Publicado: (2025)
RoiRL: Efficient, Self-Supervised Reasoning with Offline Iterative Reinforcement Learning
por: Arzhantsev, Aleksei, et al.
Publicado: (2025)
por: Arzhantsev, Aleksei, et al.
Publicado: (2025)
Efficient Sequential Decision Making with Large Language Models
por: Chen, Dingyang, et al.
Publicado: (2024)
por: Chen, Dingyang, et al.
Publicado: (2024)
CONTRAST: Continual Multi-source Adaptation to Dynamic Distributions
por: Ahmed, Sk Miraj, et al.
Publicado: (2024)
por: Ahmed, Sk Miraj, et al.
Publicado: (2024)
Identification and Adaptive Control of Markov Jump Systems: Sample Complexity and Regret Bounds
por: Sattar, Yahya, et al.
Publicado: (2021)
por: Sattar, Yahya, et al.
Publicado: (2021)
Gating is Weighting: Understanding Gated Linear Attention through In-context Learning
por: Li, Yingcong, et al.
Publicado: (2025)
por: Li, Yingcong, et al.
Publicado: (2025)
Self-Supervised On-Policy Distillation for Reasoning Language Models
por: Tan, Zhiquan, et al.
Publicado: (2026)
por: Tan, Zhiquan, et al.
Publicado: (2026)
RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents
por: Zhang, Zijing, et al.
Publicado: (2025)
por: Zhang, Zijing, et al.
Publicado: (2025)
RSAT: Structured Attribution Makes Small Language Models Faithful Table Reasoners
por: Gajjar, Jugal, et al.
Publicado: (2026)
por: Gajjar, Jugal, et al.
Publicado: (2026)
Ejemplares similares
-
BREAD: Branched Rollouts from Expert Anchors Bridge SFT & RL for Reasoning
por: Zhang, Xuechen, et al.
Publicado: (2025) -
VSPO: Vector-Steered Policy Optimization for Behavioral Control
por: Zhang, Xuechen, et al.
Publicado: (2026) -
Efficient Contextual LLM Cascades through Budget-Constrained Policy Learning
por: Zhang, Xuechen, et al.
Publicado: (2024) -
SmartChunk Retrieval: Query-Aware Chunk Compression with Planning for Efficient Document RAG
por: Zhang, Xuechen, et al.
Publicado: (2025) -
Class-attribute Priors: Adapting Optimization to Heterogeneity and Fairness Objective
por: Zhang, Xuechen, et al.
Publicado: (2024)