Self-Hinting Language Models Enhance Reinforcement Learning
Fuente:
arXiv
Guardado en:
| Autores principales: | Liao, Baohao, Dong, Hanze, Xu, Xinxing, Monz, Christof, Bian, Jiang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Reinforce-Ada: An Adaptive Sampling Framework under Non-linear RL Objectives
por: Xiong, Wei, et al.
Publicado: (2025)
por: Xiong, Wei, et al.
Publicado: (2025)
3-in-1: 2D Rotary Adaptation for Efficient Finetuning, Efficient Batching and Composability
por: Liao, Baohao, et al.
Publicado: (2024)
por: Liao, Baohao, et al.
Publicado: (2024)
Fractured Chain-of-Thought Reasoning
por: Liao, Baohao, et al.
Publicado: (2025)
por: Liao, Baohao, et al.
Publicado: (2025)
LiveMathematicianBench: A Live Benchmark for Mathematician-Level Reasoning with Proof Sketches
por: He, Linyang, et al.
Publicado: (2026)
por: He, Linyang, et al.
Publicado: (2026)
Is It a Free Lunch for Removing Outliers during Pretraining?
por: Liao, Baohao, et al.
Publicado: (2024)
por: Liao, Baohao, et al.
Publicado: (2024)
ApiQ: Finetuning of 2-Bit Quantized Large Language Model
por: Liao, Baohao, et al.
Publicado: (2024)
por: Liao, Baohao, et al.
Publicado: (2024)
Analyzing the Evaluation of Cross-Lingual Knowledge Transfer in Multilingual Language Models
por: Rajaee, Sara, et al.
Publicado: (2024)
por: Rajaee, Sara, et al.
Publicado: (2024)
Reward-Guided Speculative Decoding for Efficient LLM Reasoning
por: Liao, Baohao, et al.
Publicado: (2025)
por: Liao, Baohao, et al.
Publicado: (2025)
Learning to Hint for Reinforcement Learning
por: Xia, Yu, et al.
Publicado: (2026)
por: Xia, Yu, et al.
Publicado: (2026)
Disentangling the Roles of Target-Side Transfer and Regularization in Multilingual Machine Translation
por: Meng, Yan, et al.
Publicado: (2024)
por: Meng, Yan, et al.
Publicado: (2024)
StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason
por: Zhang, Kaiyi, et al.
Publicado: (2025)
por: Zhang, Kaiyi, et al.
Publicado: (2025)
ClusComp: A Simple Paradigm for Model Compression and Efficient Finetuning
por: Liao, Baohao, et al.
Publicado: (2025)
por: Liao, Baohao, et al.
Publicado: (2025)
Offline Reinforcement Learning for LLM Multi-Step Reasoning
por: Wang, Huaijie, et al.
Publicado: (2024)
por: Wang, Huaijie, et al.
Publicado: (2024)
Reward Models Identify Consistency, Not Causality
por: Xu, Yuhui, et al.
Publicado: (2025)
por: Xu, Yuhui, et al.
Publicado: (2025)
Control the Temperature: Selective Sampling for Diverse and High-Quality LLM Outputs
por: Troshin, Sergey, et al.
Publicado: (2025)
por: Troshin, Sergey, et al.
Publicado: (2025)
A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce
por: Xiong, Wei, et al.
Publicado: (2025)
por: Xiong, Wei, et al.
Publicado: (2025)
Do Language Models Reason Across Languages?
por: Meng, Yan, et al.
Publicado: (2026)
por: Meng, Yan, et al.
Publicado: (2026)
Unilogit: Robust Machine Unlearning for LLMs Using Uniform-Target Self-Distillation
por: Vasilev, Stefan, et al.
Publicado: (2025)
por: Vasilev, Stefan, et al.
Publicado: (2025)
MoE-Pruner: Pruning Mixture-of-Experts Large Language Model using the Hints from Its Router
por: Xie, Yanyue, et al.
Publicado: (2024)
por: Xie, Yanyue, et al.
Publicado: (2024)
Mitigating Distribution Sharpening in Math RLVR via Distribution-Aligned Hint Synthesis and Backward Hint Annealing
por: Xie, Pei-Xi, et al.
Publicado: (2026)
por: Xie, Pei-Xi, et al.
Publicado: (2026)
How to Learn in a Noisy World? Self-Correcting the Real-World Data Noise in Machine Translation
por: Meng, Yan, et al.
Publicado: (2024)
por: Meng, Yan, et al.
Publicado: (2024)
Scalable Chain of Thoughts via Elastic Reasoning
por: Xu, Yuhui, et al.
Publicado: (2025)
por: Xu, Yuhui, et al.
Publicado: (2025)
Teaching Language Models to Critique via Reinforcement Learning
por: Xie, Zhihui, et al.
Publicado: (2025)
por: Xie, Zhihui, et al.
Publicado: (2025)
Automatic Curriculum Expert Iteration for Reliable LLM Reasoning
por: Zhao, Zirui, et al.
Publicado: (2024)
por: Zhao, Zirui, et al.
Publicado: (2024)
Optimizing Chain-of-Thought Reasoners via Gradient Variance Minimization in Rejection Sampling and RL
por: Yao, Jiarui, et al.
Publicado: (2025)
por: Yao, Jiarui, et al.
Publicado: (2025)
Beyond Shared Vocabulary: Increasing Representational Word Similarities across Languages for Multilingual Machine Translation
por: Wu, Di, et al.
Publicado: (2023)
por: Wu, Di, et al.
Publicado: (2023)
Self-Exploring Language Models for Explainable Link Forecasting on Temporal Graphs via Reinforcement Learning
por: Ding, Zifeng, et al.
Publicado: (2025)
por: Ding, Zifeng, et al.
Publicado: (2025)
STARLING: Self-supervised Training of Text-based Reinforcement Learning Agent with Large Language Models
por: Basavatia, Shreyas, et al.
Publicado: (2024)
por: Basavatia, Shreyas, et al.
Publicado: (2024)
Mitigating Reversal Curse in Large Language Models via Semantic-aware Permutation Training
por: Guo, Qingyan, et al.
Publicado: (2024)
por: Guo, Qingyan, et al.
Publicado: (2024)
DISPO: Enhancing Training Efficiency and Stability in Reinforcement Learning for Large Language Model Mathematical Reasoning
por: Karaman, Batuhan K., et al.
Publicado: (2026)
por: Karaman, Batuhan K., et al.
Publicado: (2026)
RLHF Workflow: From Reward Modeling to Online RLHF
por: Dong, Hanze, et al.
Publicado: (2024)
por: Dong, Hanze, et al.
Publicado: (2024)
BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning
por: Zhong, Han, et al.
Publicado: (2025)
por: Zhong, Han, et al.
Publicado: (2025)
Benefits and Pitfalls of Reinforcement Learning for Language Model Planning: A Theoretical Perspective
por: Wang, Siwei, et al.
Publicado: (2025)
por: Wang, Siwei, et al.
Publicado: (2025)
Combee: Scaling Prompt Learning for Self-Improving Language Model Agents
por: Li, Hanchen, et al.
Publicado: (2026)
por: Li, Hanchen, et al.
Publicado: (2026)
Detecting Data Contamination from Reinforcement Learning Post-training for Large Language Models
por: Tao, Yongding, et al.
Publicado: (2025)
por: Tao, Yongding, et al.
Publicado: (2025)
Using Large Language Models to Automate and Expedite Reinforcement Learning with Reward Machine
por: Alsadat, Shayan Meshkat, et al.
Publicado: (2024)
por: Alsadat, Shayan Meshkat, et al.
Publicado: (2024)
CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models
por: Dai, Runpeng, et al.
Publicado: (2025)
por: Dai, Runpeng, et al.
Publicado: (2025)
Scaling Inference-Efficient Language Models
por: Bian, Song, et al.
Publicado: (2025)
por: Bian, Song, et al.
Publicado: (2025)
Survey on Large Language Model-Enhanced Reinforcement Learning: Concept, Taxonomy, and Methods
por: Cao, Yuji, et al.
Publicado: (2024)
por: Cao, Yuji, et al.
Publicado: (2024)
Self-Distilled Agentic Reinforcement Learning
por: Lu, Zhengxi, et al.
Publicado: (2026)
por: Lu, Zhengxi, et al.
Publicado: (2026)
Ejemplares similares
-
Reinforce-Ada: An Adaptive Sampling Framework under Non-linear RL Objectives
por: Xiong, Wei, et al.
Publicado: (2025) -
3-in-1: 2D Rotary Adaptation for Efficient Finetuning, Efficient Batching and Composability
por: Liao, Baohao, et al.
Publicado: (2024) -
Fractured Chain-of-Thought Reasoning
por: Liao, Baohao, et al.
Publicado: (2025) -
LiveMathematicianBench: A Live Benchmark for Mathematician-Level Reasoning with Proof Sketches
por: He, Linyang, et al.
Publicado: (2026) -
Is It a Free Lunch for Removing Outliers during Pretraining?
por: Liao, Baohao, et al.
Publicado: (2024)