How Fast Should a Model Commit to Supervision? Training Reasoning Models on the Tsallis Loss Continuum
Fuente:
arXiv
Guardado en:
| Autores principales: | Lin, Chu-Cheng, Ie, Eugene |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Type-Compliant Adaptation Cascades: Adapting Programmatic LM Workflows to Data
por: Lin, Chu-Cheng, et al.
Publicado: (2025)
por: Lin, Chu-Cheng, et al.
Publicado: (2025)
On Surprising Effectiveness of Masking Updates in Adaptive Optimizers
por: Joo, Taejong, et al.
Publicado: (2026)
por: Joo, Taejong, et al.
Publicado: (2026)
SCPL: Enhancing Neural Network Training Throughput with Decoupled Local Losses and Model Parallelism
por: Ho, Ming-Yao, et al.
Publicado: (2026)
por: Ho, Ming-Yao, et al.
Publicado: (2026)
Entropy-Guided Data-Efficient Training for Multimodal Reasoning Reward Models
por: Yang, Shidong, et al.
Publicado: (2026)
por: Yang, Shidong, et al.
Publicado: (2026)
Beyond Markovian: Reflective Exploration via Bayes-Adaptive RL for LLM Reasoning
por: Zhang, Shenao, et al.
Publicado: (2025)
por: Zhang, Shenao, et al.
Publicado: (2025)
BigMac: A Communication-Efficient Mixture-of-Experts Model Structure for Fast Training and Inference
por: Jin, Zewen, et al.
Publicado: (2025)
por: Jin, Zewen, et al.
Publicado: (2025)
Fast Adversarial Training against Sparse Attacks Requires Loss Smoothing
por: Zhong, Xuyang, et al.
Publicado: (2025)
por: Zhong, Xuyang, et al.
Publicado: (2025)
How Should We Represent History in Interpretable Models of Clinical Policies?
por: Matsson, Anton, et al.
Publicado: (2024)
por: Matsson, Anton, et al.
Publicado: (2024)
Native Reasoning Models: Training Language Models to Reason on Unverifiable Data
por: Wang, Yuanfu, et al.
Publicado: (2026)
por: Wang, Yuanfu, et al.
Publicado: (2026)
Simple, Good, Fast: Self-Supervised World Models Free of Baggage
por: Robine, Jan, et al.
Publicado: (2025)
por: Robine, Jan, et al.
Publicado: (2025)
ADORA: Training Reasoning Models with Dynamic Advantage Estimation on Reinforcement Learning
por: Ren, Qingnan, et al.
Publicado: (2026)
por: Ren, Qingnan, et al.
Publicado: (2026)
Enhancing LLM Reasoning via Critique Models with Test-Time and Training-Time Supervision
por: Xi, Zhiheng, et al.
Publicado: (2024)
por: Xi, Zhiheng, et al.
Publicado: (2024)
Simulating Environments with Reasoning Models for Agent Training
por: Li, Yuetai, et al.
Publicado: (2025)
por: Li, Yuetai, et al.
Publicado: (2025)
When Reasoning Meets Compression: Understanding the Effects of LLMs Compression on Large Reasoning Models
por: Zhang, Nan, et al.
Publicado: (2025)
por: Zhang, Nan, et al.
Publicado: (2025)
Fast-DataShapley: Neural Modeling for Training Data Valuation
por: Sun, Haifeng, et al.
Publicado: (2025)
por: Sun, Haifeng, et al.
Publicado: (2025)
Base Models Know How to Reason, Thinking Models Learn When
por: Venhoff, Constantin, et al.
Publicado: (2025)
por: Venhoff, Constantin, et al.
Publicado: (2025)
Chain of Execution Supervision Promotes General Reasoning in Large Language Models
por: Chen, Nuo, et al.
Publicado: (2025)
por: Chen, Nuo, et al.
Publicado: (2025)
Supervised Contrastive Learning based Dual-Mixer Model for Remaining Useful Life Prediction
por: Fu, En, et al.
Publicado: (2024)
por: Fu, En, et al.
Publicado: (2024)
How Should We Meta-Learn Reinforcement Learning Algorithms?
por: Goldie, Alexander David, et al.
Publicado: (2025)
por: Goldie, Alexander David, et al.
Publicado: (2025)
Generalized Munchausen Reinforcement Learning using Tsallis KL Divergence
por: Zhu, Lingwei, et al.
Publicado: (2023)
por: Zhu, Lingwei, et al.
Publicado: (2023)
How Well Do Multimodal Models Reason on ECG Signals?
por: Xu, Maxwell A., et al.
Publicado: (2026)
por: Xu, Maxwell A., et al.
Publicado: (2026)
SSPO: Self-traced Step-wise Preference Optimization for Process Supervision and Reasoning Compression
por: Xu, Yuyang, et al.
Publicado: (2025)
por: Xu, Yuyang, et al.
Publicado: (2025)
DiFFPO: Training Diffusion LLMs to Reason Fast and Furious via Reinforcement Learning
por: Zhao, Hanyang, et al.
Publicado: (2025)
por: Zhao, Hanyang, et al.
Publicado: (2025)
How to Weight Multitask Finetuning? Fast Previews via Bayesian Model-Merging
por: Maldonado, Hugo Monzón, et al.
Publicado: (2024)
por: Maldonado, Hugo Monzón, et al.
Publicado: (2024)
When Does a Language Model Commit? A Finite-Answer Theory of Pre-Verbalization Commitment
por: Zhang, Long, et al.
Publicado: (2026)
por: Zhang, Long, et al.
Publicado: (2026)
QuantLRM: Quantization of Large Reasoning Models via Fine-Tuning Signals
por: Zhang, Nan, et al.
Publicado: (2026)
por: Zhang, Nan, et al.
Publicado: (2026)
Token Reduction Should Go Beyond Efficiency in Generative Models -- From Vision, Language to Multimodality
por: Kong, Zhenglun, et al.
Publicado: (2025)
por: Kong, Zhenglun, et al.
Publicado: (2025)
GPG: A Simple and Strong Reinforcement Learning Baseline for Model Reasoning
por: Chu, Xiangxiang, et al.
Publicado: (2025)
por: Chu, Xiangxiang, et al.
Publicado: (2025)
Training Large Language Models to Reason via EM Policy Gradient
por: Xu, Tianbing
Publicado: (2025)
por: Xu, Tianbing
Publicado: (2025)
For How Long Should We Be Punching? Learning Action Duration in Fighting Games
por: Nguyen, Hoang Hai, et al.
Publicado: (2026)
por: Nguyen, Hoang Hai, et al.
Publicado: (2026)
STaR-DRO: Stateful Tsallis Reweighting for Group-Robust Structured Prediction
por: Fodeh, Samah, et al.
Publicado: (2026)
por: Fodeh, Samah, et al.
Publicado: (2026)
Training Implicit Generative Models via an Invariant Statistical Loss
por: de Frutos, José Manuel, et al.
Publicado: (2024)
por: de Frutos, José Manuel, et al.
Publicado: (2024)
Train at Moving Edge: Online-Verified Prompt Selection for Efficient RL Training of Large Reasoning Model
por: Wu, Jiahao, et al.
Publicado: (2026)
por: Wu, Jiahao, et al.
Publicado: (2026)
Quadratic Direct Forecast for Training Multi-Step Time-Series Forecast Models
por: Wang, Hao, et al.
Publicado: (2025)
por: Wang, Hao, et al.
Publicado: (2025)
FastBUS: A Fast Bayesian Framework for Unified Weakly-Supervised Learning
por: Wang, Ziquan, et al.
Publicado: (2026)
por: Wang, Ziquan, et al.
Publicado: (2026)
How Reasoning Evolves from Post-Training Data: An Empirical Study Using Chess
por: Dionisopoulos, Lucas, et al.
Publicado: (2026)
por: Dionisopoulos, Lucas, et al.
Publicado: (2026)
Zipping the Thought: When and How Compressed Reasoning Data Works in LLM Post-Training
por: Matsutani, Kohsei, et al.
Publicado: (2026)
por: Matsutani, Kohsei, et al.
Publicado: (2026)
From Entropy to Calibrated Uncertainty: Training Language Models to Reason About Uncertainty
por: Jenane, Azza, et al.
Publicado: (2026)
por: Jenane, Azza, et al.
Publicado: (2026)
Post-Training as Reweighting: A Stochastic View of Reasoning Trajectories in Language Models
por: Bu, Dake, et al.
Publicado: (2025)
por: Bu, Dake, et al.
Publicado: (2025)
Downstream Task-Oriented Generative Model Selections on Synthetic Data Training for Fraud Detection Models
por: Cheng, Yinan, et al.
Publicado: (2024)
por: Cheng, Yinan, et al.
Publicado: (2024)
Ejemplares similares
-
Type-Compliant Adaptation Cascades: Adapting Programmatic LM Workflows to Data
por: Lin, Chu-Cheng, et al.
Publicado: (2025) -
On Surprising Effectiveness of Masking Updates in Adaptive Optimizers
por: Joo, Taejong, et al.
Publicado: (2026) -
SCPL: Enhancing Neural Network Training Throughput with Decoupled Local Losses and Model Parallelism
por: Ho, Ming-Yao, et al.
Publicado: (2026) -
Entropy-Guided Data-Efficient Training for Multimodal Reasoning Reward Models
por: Yang, Shidong, et al.
Publicado: (2026) -
Beyond Markovian: Reflective Exploration via Bayes-Adaptive RL for LLM Reasoning
por: Zhang, Shenao, et al.
Publicado: (2025)