BREAD: Branched Rollouts from Expert Anchors Bridge SFT & RL for Reasoning
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Xuechen, Huang, Zijian, Li, Yingcong, Ni, Chenshun, Chen, Jiasi, Oymak, Samet |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Making Small Language Models Efficient Reasoners: Intervention, Supervision, Reinforcement
por: Zhang, Xuechen, et al.
Publicado: (2025)
por: Zhang, Xuechen, et al.
Publicado: (2025)
VSPO: Vector-Steered Policy Optimization for Behavioral Control
por: Zhang, Xuechen, et al.
Publicado: (2026)
por: Zhang, Xuechen, et al.
Publicado: (2026)
Class-attribute Priors: Adapting Optimization to Heterogeneity and Fairness Objective
por: Zhang, Xuechen, et al.
Publicado: (2024)
por: Zhang, Xuechen, et al.
Publicado: (2024)
Efficient Contextual LLM Cascades through Budget-Constrained Policy Learning
por: Zhang, Xuechen, et al.
Publicado: (2024)
por: Zhang, Xuechen, et al.
Publicado: (2024)
SmartChunk Retrieval: Query-Aware Chunk Compression with Planning for Efficient Document RAG
por: Zhang, Xuechen, et al.
Publicado: (2025)
por: Zhang, Xuechen, et al.
Publicado: (2025)
Selective Attention: Enhancing Transformer through Principled Context Control
por: Zhang, Xuechen, et al.
Publicado: (2024)
por: Zhang, Xuechen, et al.
Publicado: (2024)
On the Power of Convolution Augmented Transformer
por: Li, Mingchen, et al.
Publicado: (2024)
por: Li, Mingchen, et al.
Publicado: (2024)
Fine-grained Analysis of In-context Linear Estimation: Data, Architecture, and Beyond
por: Li, Yingcong, et al.
Publicado: (2024)
por: Li, Yingcong, et al.
Publicado: (2024)
Transformers as Support Vector Machines
por: Tarzanagh, Davoud Ataee, et al.
Publicado: (2023)
por: Tarzanagh, Davoud Ataee, et al.
Publicado: (2023)
Bridging SFT and RL: Dynamic Policy Optimization for Robust Reasoning
por: Zhu, Taojie, et al.
Publicado: (2026)
por: Zhu, Taojie, et al.
Publicado: (2026)
Continuous Chain of Thought Enables Parallel Exploration and Reasoning
por: Gozeten, Halil Alperen, et al.
Publicado: (2025)
por: Gozeten, Halil Alperen, et al.
Publicado: (2025)
From Self-Attention to Markov Models: Unveiling the Dynamics of Generative Transformers
por: Ildiz, M. Emrullah, et al.
Publicado: (2024)
por: Ildiz, M. Emrullah, et al.
Publicado: (2024)
Latent Chain-of-Thought Improves Structured-Data Transformers
por: Dudley, Carson, et al.
Publicado: (2026)
por: Dudley, Carson, et al.
Publicado: (2026)
Mechanics of Next Token Prediction with Self-Attention
por: Li, Yingcong, et al.
Publicado: (2024)
por: Li, Yingcong, et al.
Publicado: (2024)
Gating is Weighting: Understanding Gated Linear Attention through In-context Learning
por: Li, Yingcong, et al.
Publicado: (2025)
por: Li, Yingcong, et al.
Publicado: (2025)
Test-Time Training Provably Improves Transformers as In-context Learners
por: Gozeten, Halil Alperen, et al.
Publicado: (2025)
por: Gozeten, Halil Alperen, et al.
Publicado: (2025)
Evolutionary Multi-Task Optimization for LLM-Guided Program Discovery
por: Gozeten, Halil Alperen, et al.
Publicado: (2026)
por: Gozeten, Halil Alperen, et al.
Publicado: (2026)
When and How Unlabeled Data Provably Improve In-Context Learning
por: Li, Yingcong, et al.
Publicado: (2025)
por: Li, Yingcong, et al.
Publicado: (2025)
L3GS: Layered 3D Gaussian Splats for Efficient 3D Scene Delivery
por: Tsai, Yi-Zhen, et al.
Publicado: (2025)
por: Tsai, Yi-Zhen, et al.
Publicado: (2025)
Learning to Bet for Horizon-Aware Anytime-Valid Testing
por: Taga, Ege Onur, et al.
Publicado: (2026)
por: Taga, Ege Onur, et al.
Publicado: (2026)
RL Fine-Tuning Heals OOD Forgetting in SFT
por: Jin, Hangzhan, et al.
Publicado: (2025)
por: Jin, Hangzhan, et al.
Publicado: (2025)
Covariance-Aware Transformers for Quadratic Programming and Decision Making
por: Tire, Kutay, et al.
Publicado: (2026)
por: Tire, Kutay, et al.
Publicado: (2026)
SFT-then-RL Outperforms Mixed-Policy Methods for LLM Reasoning
por: Limozin, Alexis, et al.
Publicado: (2026)
por: Limozin, Alexis, et al.
Publicado: (2026)
QuRL: Efficient Reinforcement Learning with Quantized Rollout
por: Li, Yuhang, et al.
Publicado: (2026)
por: Li, Yuhang, et al.
Publicado: (2026)
Attention with Trained Embeddings Provably Selects Important Tokens
por: Wu, Diyuan, et al.
Publicado: (2025)
por: Wu, Diyuan, et al.
Publicado: (2025)
TimePFN: Effective Multivariate Time Series Forecasting with Synthetic Data
por: Taga, Ege Onur, et al.
Publicado: (2025)
por: Taga, Ege Onur, et al.
Publicado: (2025)
In-Context Learning Under Regime Change
por: Dudley, Carson, et al.
Publicado: (2026)
por: Dudley, Carson, et al.
Publicado: (2026)
Stable and Efficient Single-Rollout RL for Multimodal Reasoning
por: Liu, Rui, et al.
Publicado: (2025)
por: Liu, Rui, et al.
Publicado: (2025)
AceReason-Nemotron 1.1: Advancing Math and Code Reasoning through SFT and RL Synergy
por: Liu, Zihan, et al.
Publicado: (2025)
por: Liu, Zihan, et al.
Publicado: (2025)
Heddle: A Distributed Orchestration System for Agentic RL Rollout
por: Zhang, Zili, et al.
Publicado: (2026)
por: Zhang, Zili, et al.
Publicado: (2026)
Can Transformers Learn Optimal Filtering for Unknown Systems?
por: Balim, Haldun, et al.
Publicado: (2023)
por: Balim, Haldun, et al.
Publicado: (2023)
EchoRL: Reinforcement Learning via Rollout Echoing
por: Bi, Jinhe, et al.
Publicado: (2026)
por: Bi, Jinhe, et al.
Publicado: (2026)
Metis-RISE: RL Incentivizes and SFT Enhances Multimodal Reasoning Model Learning
por: Qiu, Haibo, et al.
Publicado: (2025)
por: Qiu, Haibo, et al.
Publicado: (2025)
Retrieval Augmented Time Series Forecasting
por: Tire, Kutay, et al.
Publicado: (2024)
por: Tire, Kutay, et al.
Publicado: (2024)
RL makes MLLMs see better than SFT
por: Song, Junha, et al.
Publicado: (2025)
por: Song, Junha, et al.
Publicado: (2025)
Quagmires in SFT-RL Post-Training: When High SFT Scores Mislead and What to Use Instead
por: Kang, Feiyang, et al.
Publicado: (2025)
por: Kang, Feiyang, et al.
Publicado: (2025)
SPEC-RL: Accelerating On-Policy Reinforcement Learning with Speculative Rollouts
por: Liu, Bingshuai, et al.
Publicado: (2025)
por: Liu, Bingshuai, et al.
Publicado: (2025)
Selective Rollout: Mid-Trajectory Termination for Multi-Sample Agent RL
por: Zhai, Zhiyuan, et al.
Publicado: (2026)
por: Zhai, Zhiyuan, et al.
Publicado: (2026)
Patch the Distribution Mismatch: RL Rewriting Agent for Stable Off-Policy SFT
por: Wang, Jiacheng, et al.
Publicado: (2026)
por: Wang, Jiacheng, et al.
Publicado: (2026)
GAC: Noise-Aware Adaptive Mixing for Hybrid SFT-RL Post-Training
por: Hu, Yuelin, et al.
Publicado: (2026)
por: Hu, Yuelin, et al.
Publicado: (2026)
Ejemplares similares
-
Making Small Language Models Efficient Reasoners: Intervention, Supervision, Reinforcement
por: Zhang, Xuechen, et al.
Publicado: (2025) -
VSPO: Vector-Steered Policy Optimization for Behavioral Control
por: Zhang, Xuechen, et al.
Publicado: (2026) -
Class-attribute Priors: Adapting Optimization to Heterogeneity and Fairness Objective
por: Zhang, Xuechen, et al.
Publicado: (2024) -
Efficient Contextual LLM Cascades through Budget-Constrained Policy Learning
por: Zhang, Xuechen, et al.
Publicado: (2024) -
SmartChunk Retrieval: Query-Aware Chunk Compression with Planning for Efficient Document RAG
por: Zhang, Xuechen, et al.
Publicado: (2025)