Learning to Hint for Reinforcement Learning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Xia, Yu, Xu, Canwen, Yao, Zhewei, McAuley, Julian, He, Yuxiong |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Agent World Model: Infinity Synthetic Environments for Agentic Reinforcement Learning
par: Wang, Zhaoyang, et autres
Publié: (2026)
par: Wang, Zhaoyang, et autres
Publié: (2026)
ExCoT: Optimizing Reasoning for Text-to-SQL with Execution Feedback
par: Zhai, Bohan, et autres
Publié: (2025)
par: Zhai, Bohan, et autres
Publié: (2025)
Learning to Self-Evolve
par: Chen, Xiaoyin, et autres
Publié: (2026)
par: Chen, Xiaoyin, et autres
Publié: (2026)
SwiftKV: Fast Prefill-Optimized Inference with Knowledge-Preserving Model Transformation
par: Qiao, Aurick, et autres
Publié: (2024)
par: Qiao, Aurick, et autres
Publié: (2024)
BiasEdit: Debiasing Stereotyped Language Models via Model Editing
par: Xu, Xin, et autres
Publié: (2025)
par: Xu, Xin, et autres
Publié: (2025)
Automatic Pair Construction for Contrastive Post-training
par: Xu, Canwen, et autres
Publié: (2023)
par: Xu, Canwen, et autres
Publié: (2023)
ThinkRouter: Efficient Reasoning via Routing Thinking between Latent and Discrete Spaces
par: Xu, Xin, et autres
Publié: (2026)
par: Xu, Xin, et autres
Publié: (2026)
BiasFreeBench: a Benchmark for Mitigating Bias in Large Language Model Responses
par: Xu, Xin, et autres
Publié: (2025)
par: Xu, Xin, et autres
Publié: (2025)
Self-Hinting Language Models Enhance Reinforcement Learning
par: Liao, Baohao, et autres
Publié: (2026)
par: Liao, Baohao, et autres
Publié: (2026)
StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason
par: Zhang, Kaiyi, et autres
Publié: (2025)
par: Zhang, Kaiyi, et autres
Publié: (2025)
Reinforcement Learning for Generative AI: A Survey
par: Cao, Yuanjiang, et autres
Publié: (2023)
par: Cao, Yuanjiang, et autres
Publié: (2023)
Evaluating Memory in LLM Agents via Incremental Multi-Turn Interactions
par: Hu, Yuanzhe, et autres
Publié: (2025)
par: Hu, Yuanzhe, et autres
Publié: (2025)
Mitigating Distribution Sharpening in Math RLVR via Distribution-Aligned Hint Synthesis and Backward Hint Annealing
par: Xie, Pei-Xi, et autres
Publié: (2026)
par: Xie, Pei-Xi, et autres
Publié: (2026)
Cognitive Bias in Decision-Making with LLMs
par: Echterhoff, Jessica, et autres
Publié: (2024)
par: Echterhoff, Jessica, et autres
Publié: (2024)
CSyMR: Benchmarking Compositional Music Information Retrieval in Symbolic Music Reasoning
par: Wang, Boyang, et autres
Publié: (2025)
par: Wang, Boyang, et autres
Publié: (2025)
How to Train Data-Efficient LLMs
par: Sachdeva, Noveen, et autres
Publié: (2024)
par: Sachdeva, Noveen, et autres
Publié: (2024)
Position: The Turing-Completeness of Autoregressive Transformers Relies Heavily on Context Management
par: Cui, Guanyu, et autres
Publié: (2026)
par: Cui, Guanyu, et autres
Publié: (2026)
Extending Input Contexts of Language Models through Training on Segmented Sequences
par: Karypis, Petros, et autres
Publié: (2023)
par: Karypis, Petros, et autres
Publié: (2023)
Embedding-Informed Adaptive Retrieval-Augmented Generation of Large Language Models
par: Huang, Chengkai, et autres
Publié: (2024)
par: Huang, Chengkai, et autres
Publié: (2024)
Response-Level Rewards Are All You Need for Online Reinforcement Learning in LLMs: A Mathematical Perspective
par: He, Shenghua, et autres
Publié: (2025)
par: He, Shenghua, et autres
Publié: (2025)
How do Language Models Generate Slang: A Systematic Comparison between Human and Machine-Generated Slang Usages
par: Wu, Siyang, et autres
Publié: (2025)
par: Wu, Siyang, et autres
Publié: (2025)
Reinforcement Learning with Conditional Expectation Reward
par: Xiao, Changyi, et autres
Publié: (2026)
par: Xiao, Changyi, et autres
Publié: (2026)
Merge, Then Compress: Demystify Efficient SMoE with Hints from Its Routing Policy
par: Li, Pingzhi, et autres
Publié: (2023)
par: Li, Pingzhi, et autres
Publié: (2023)
P1: Mastering Physics Olympiads with Reinforcement Learning
par: Chen, Jiacheng, et autres
Publié: (2025)
par: Chen, Jiacheng, et autres
Publié: (2025)
On the Relation between Sensitivity and Accuracy in In-context Learning
par: Chen, Yanda, et autres
Publié: (2022)
par: Chen, Yanda, et autres
Publié: (2022)
Understanding and Mitigating Spurious Signal Amplification in Test-Time Reinforcement Learning for Math Reasoning
par: Yu, Yongcan, et autres
Publié: (2026)
par: Yu, Yongcan, et autres
Publié: (2026)
Dr. Kernel: Reinforcement Learning Done Right for Triton Kernel Generations
par: Liu, Wei, et autres
Publié: (2026)
par: Liu, Wei, et autres
Publié: (2026)
SPEC-RL: Accelerating On-Policy Reinforcement Learning with Speculative Rollouts
par: Liu, Bingshuai, et autres
Publié: (2025)
par: Liu, Bingshuai, et autres
Publié: (2025)
Scalable Best-of-N Selection for Large Language Models via Self-Certainty
par: Kang, Zhewei, et autres
Publié: (2025)
par: Kang, Zhewei, et autres
Publié: (2025)
Incentivizing Agentic Reasoning in LLM Judges via Tool-Integrated Reinforcement Learning
par: Xu, Ran, et autres
Publié: (2025)
par: Xu, Ran, et autres
Publié: (2025)
Self-Distilled Agentic Reinforcement Learning
par: Lu, Zhengxi, et autres
Publié: (2026)
par: Lu, Zhengxi, et autres
Publié: (2026)
Experience Sharing in Mutual Reinforcement Learning for Heterogeneous Language Models
par: Liu, Xiaoze, et autres
Publié: (2026)
par: Liu, Xiaoze, et autres
Publié: (2026)
DeepSpeed Data Efficiency: Improving Deep Learning Model Quality and Training Efficiency via Efficient Data Sampling and Routing
par: Li, Conglong, et autres
Publié: (2022)
par: Li, Conglong, et autres
Publié: (2022)
PCL-Reasoner-V1.5: Advancing Math Reasoning with Offline Reinforcement Learning
par: Lu, Yao, et autres
Publié: (2026)
par: Lu, Yao, et autres
Publié: (2026)
OUTLINEFORGE: Hierarchical Reinforcement Learning with Explicit States for Scientific Writing
par: Bao, Yilin, et autres
Publié: (2026)
par: Bao, Yilin, et autres
Publié: (2026)
Code to Think, Think to Code: A Survey on Code-Enhanced Reasoning and Reasoning-Driven Code Intelligence in LLMs
par: Yang, Dayu, et autres
Publié: (2025)
par: Yang, Dayu, et autres
Publié: (2025)
Parallel Structures in Pre-training Data Yield In-Context Learning
par: Chen, Yanda, et autres
Publié: (2024)
par: Chen, Yanda, et autres
Publié: (2024)
Reinforcement Learning on Pre-Training Data
par: Li, Siheng, et autres
Publié: (2025)
par: Li, Siheng, et autres
Publié: (2025)
ReCrit: Transition-Aware Reinforcement Learning for Scientific Critic Reasoning
par: Xu, Wanghan, et autres
Publié: (2026)
par: Xu, Wanghan, et autres
Publié: (2026)
Reinforcement Learning with Rubric Anchors
par: Huang, Zenan, et autres
Publié: (2025)
par: Huang, Zenan, et autres
Publié: (2025)
Documents similaires
-
Agent World Model: Infinity Synthetic Environments for Agentic Reinforcement Learning
par: Wang, Zhaoyang, et autres
Publié: (2026) -
ExCoT: Optimizing Reasoning for Text-to-SQL with Execution Feedback
par: Zhai, Bohan, et autres
Publié: (2025) -
Learning to Self-Evolve
par: Chen, Xiaoyin, et autres
Publié: (2026) -
SwiftKV: Fast Prefill-Optimized Inference with Knowledge-Preserving Model Transformation
par: Qiao, Aurick, et autres
Publié: (2024) -
BiasEdit: Debiasing Stereotyped Language Models via Model Editing
par: Xu, Xin, et autres
Publié: (2025)