The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lv, Ang, Xie, Ruobing, Sun, Xingwu, Kang, Zhanhui, Yan, Rui |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Language Models "Grok" to Copy
par: Lv, Ang, et autres
Publié: (2024)
par: Lv, Ang, et autres
Publié: (2024)
Autonomy-of-Experts Models
par: Lv, Ang, et autres
Publié: (2025)
par: Lv, Ang, et autres
Publié: (2025)
More Expressive Attention with Negative Weights
par: Lv, Ang, et autres
Publié: (2024)
par: Lv, Ang, et autres
Publié: (2024)
Exploring Forgetting in Large Language Model Pre-Training
par: Liao, Chonghua, et autres
Publié: (2024)
par: Liao, Chonghua, et autres
Publié: (2024)
Continuous Speech Tokenizer in Text To Speech
par: Li, Yixing, et autres
Publié: (2024)
par: Li, Yixing, et autres
Publié: (2024)
Mitigating Hallucination in Multimodal Large Language Model via Hallucination-targeted Direct Preference Optimization
par: Fu, Yuhan, et autres
Publié: (2024)
par: Fu, Yuhan, et autres
Publié: (2024)
Lossless KV Cache Compression to 2%
par: Yang, Zhen, et autres
Publié: (2024)
par: Yang, Zhen, et autres
Publié: (2024)
Magnifier Prompt: Tackling Multimodal Hallucination via Extremely Simple Instructions
par: Fu, Yuhan, et autres
Publié: (2024)
par: Fu, Yuhan, et autres
Publié: (2024)
Large Language Model Empowered Recommendation Meets All-domain Continual Pre-Training
par: Ma, Haokai, et autres
Publié: (2025)
par: Ma, Haokai, et autres
Publié: (2025)
Enhancing Contrastive Learning Inspired by the Philosophy of "The Blind Men and the Elephant"
par: Zhang, Yudong, et autres
Publié: (2024)
par: Zhang, Yudong, et autres
Publié: (2024)
Mind Your Theory: Theory of Mind Goes Deeper Than Reasoning
par: Wagner, Eitan, et autres
Publié: (2024)
par: Wagner, Eitan, et autres
Publié: (2024)
Can Deception Detection Go Deeper? Dataset, Evaluation, and Benchmark for Deception Reasoning
par: Chen, Kang, et autres
Publié: (2024)
par: Chen, Kang, et autres
Publié: (2024)
Proximal Supervised Fine-Tuning
par: Zhu, Wenhong, et autres
Publié: (2025)
par: Zhu, Wenhong, et autres
Publié: (2025)
QAVA: Query-Agnostic Visual Attack to Large Vision-Language Models
par: Zhang, Yudong, et autres
Publié: (2025)
par: Zhang, Yudong, et autres
Publié: (2025)
Self-Distillation for Multi-Token Prediction
par: Zhao, Guoliang, et autres
Publié: (2026)
par: Zhao, Guoliang, et autres
Publié: (2026)
Diverse and Fine-Grained Instruction-Following Ability Exploration with Synthetic Data
par: Gu, Zihui, et autres
Publié: (2024)
par: Gu, Zihui, et autres
Publié: (2024)
R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning
par: Zhao, Qingfei, et autres
Publié: (2025)
par: Zhao, Qingfei, et autres
Publié: (2025)
HMoE: Heterogeneous Mixture of Experts for Language Modeling
par: Wang, An, et autres
Publié: (2024)
par: Wang, An, et autres
Publié: (2024)
Truth Forest: Toward Multi-Scale Truthfulness in Large Language Models through Intervention without Tuning
par: Chen, Zhongzhi, et autres
Publié: (2023)
par: Chen, Zhongzhi, et autres
Publié: (2023)
The Elephant in the Room: Rethinking the Usage of Pre-trained Language Model in Sequential Recommendation
par: Qu, Zekai, et autres
Publié: (2024)
par: Qu, Zekai, et autres
Publié: (2024)
Hybrid-Tower: Fine-grained Pseudo-query Interaction and Generation for Text-to-Video Retrieval
par: Lan, Bangxiang, et autres
Publié: (2025)
par: Lan, Bangxiang, et autres
Publié: (2025)
ConceptCarve: Dynamic Realization of Evidence
par: Caplan, Eylon, et autres
Publié: (2025)
par: Caplan, Eylon, et autres
Publié: (2025)
Reward Modeling with Ordinal Feedback: Wisdom of the Crowd
par: Liu, Shang, et autres
Publié: (2024)
par: Liu, Shang, et autres
Publié: (2024)
PhD: A ChatGPT-Prompted Visual hallucination Evaluation Dataset
par: Liu, Jiazhen, et autres
Publié: (2024)
par: Liu, Jiazhen, et autres
Publié: (2024)
Checklists Are Better Than Reward Models For Aligning Language Models
par: Viswanathan, Vijay, et autres
Publié: (2025)
par: Viswanathan, Vijay, et autres
Publié: (2025)
Learning to Reason without External Rewards
par: Zhao, Xuandong, et autres
Publié: (2025)
par: Zhao, Xuandong, et autres
Publié: (2025)
Learning beyond Teacher: Generalized On-Policy Distillation with Reward Extrapolation
par: Yang, Wenkai, et autres
Publié: (2026)
par: Yang, Wenkai, et autres
Publié: (2026)
StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason
par: Zhang, Kaiyi, et autres
Publié: (2025)
par: Zhang, Kaiyi, et autres
Publié: (2025)
Fighting Fire with Fire (F3): A Training-free and Efficient Visual Adversarial Example Purification Method in LVLMs
par: Zhang, Yudong, et autres
Publié: (2025)
par: Zhang, Yudong, et autres
Publié: (2025)
DHCP: Detecting Hallucinations by Cross-modal Attention Pattern in Large Vision-Language Models
par: Zhang, Yudong, et autres
Publié: (2024)
par: Zhang, Yudong, et autres
Publié: (2024)
Scaling Laws for Floating Point Quantization Training
par: Sun, Xingwu, et autres
Publié: (2025)
par: Sun, Xingwu, et autres
Publié: (2025)
In-Context Learning with Noisy Labels
par: Kang, Junyong, et autres
Publié: (2024)
par: Kang, Junyong, et autres
Publié: (2024)
LaSeR: Reinforcement Learning with Last-Token Self-Rewarding
par: Yang, Wenkai, et autres
Publié: (2025)
par: Yang, Wenkai, et autres
Publié: (2025)
LongBench v2: Towards Deeper Understanding and Reasoning on Realistic Long-context Multitasks
par: Bai, Yushi, et autres
Publié: (2024)
par: Bai, Yushi, et autres
Publié: (2024)
Batch-ICL: Effective, Efficient, and Order-Agnostic In-Context Learning
par: Zhang, Kaiyi, et autres
Publié: (2024)
par: Zhang, Kaiyi, et autres
Publié: (2024)
Think Longer to Explore Deeper: Learn to Explore In-Context via Length-Incentivized Reinforcement Learning
par: Wang, Futing, et autres
Publié: (2026)
par: Wang, Futing, et autres
Publié: (2026)
Flexible Realignment of Language Models
par: Zhu, Wenhong, et autres
Publié: (2025)
par: Zhu, Wenhong, et autres
Publié: (2025)
Hybrid Policy Distillation for LLMs
par: Zhu, Wenhong, et autres
Publié: (2026)
par: Zhu, Wenhong, et autres
Publié: (2026)
Masked Thought: Simply Masking Partial Reasoning Steps Can Improve Mathematical Reasoning Learning of Language Models
par: Chen, Changyu, et autres
Publié: (2024)
par: Chen, Changyu, et autres
Publié: (2024)
Climbing the Ladder of Reasoning: What LLMs Can-and Still Can't-Solve after SFT?
par: Sun, Yiyou, et autres
Publié: (2025)
par: Sun, Yiyou, et autres
Publié: (2025)
Documents similaires
-
Language Models "Grok" to Copy
par: Lv, Ang, et autres
Publié: (2024) -
Autonomy-of-Experts Models
par: Lv, Ang, et autres
Publié: (2025) -
More Expressive Attention with Negative Weights
par: Lv, Ang, et autres
Publié: (2024) -
Exploring Forgetting in Large Language Model Pre-Training
par: Liao, Chonghua, et autres
Publié: (2024) -
Continuous Speech Tokenizer in Text To Speech
par: Li, Yixing, et autres
Publié: (2024)