Reasoning or Memorization? Unreliable Results of Reinforcement Learning Due to Data Contamination
Fuente:
arXiv
Salvato in:
| Autori principali: | Wu, Mingqi, Zhang, Zhihao, Dong, Qiaole, Xi, Zhiheng, Zhao, Jun, Jin, Senjie, Fan, Xiaoran, Zhou, Yuhao, Lv, Huijie, Zhang, Ming, Fu, Yanwei, Liu, Qin, Zhang, Songyang, Zhang, Qi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Why Reinforcement Fine-Tuning Enables MLLMs Preserve Prior Knowledge Better: A Data Perspective
di: Zhang, Zhihao, et al.
Pubblicazione: (2025)
di: Zhang, Zhihao, et al.
Pubblicazione: (2025)
Self-Polish: Enhance Reasoning in Large Language Models via Problem Refinement
di: Xi, Zhiheng, et al.
Pubblicazione: (2023)
di: Xi, Zhiheng, et al.
Pubblicazione: (2023)
EliteKV: Scalable KV Cache Compression via RoPE Frequency Selection and Joint Low-Rank Projection
di: Zhou, Yuhao, et al.
Pubblicazione: (2025)
di: Zhou, Yuhao, et al.
Pubblicazione: (2025)
MemFlow: Optical Flow Estimation and Prediction with Memory
di: Dong, Qiaole, et al.
Pubblicazione: (2024)
di: Dong, Qiaole, et al.
Pubblicazione: (2024)
Online Dense Point Tracking with Streaming Memory
di: Dong, Qiaole, et al.
Pubblicazione: (2025)
di: Dong, Qiaole, et al.
Pubblicazione: (2025)
Inverse-Q*: Token Level Reinforcement Learning for Aligning Large Language Models Without Preference Data
di: Xia, Han, et al.
Pubblicazione: (2024)
di: Xia, Han, et al.
Pubblicazione: (2024)
Enhancing Video Inpainting with Aligned Frame Interval Guidance
di: Xie, Ming, et al.
Pubblicazione: (2025)
di: Xie, Ming, et al.
Pubblicazione: (2025)
Training Large Language Models for Reasoning through Reverse Curriculum Reinforcement Learning
di: Xi, Zhiheng, et al.
Pubblicazione: (2024)
di: Xi, Zhiheng, et al.
Pubblicazione: (2024)
Parrot: A Training Pipeline Enhances Both Program CoT and Natural Language CoT for Reasoning
di: Jin, Senjie, et al.
Pubblicazione: (2025)
di: Jin, Senjie, et al.
Pubblicazione: (2025)
Multi-Aircraft Scheduling Optimization in Urban Environments
di: Zhang, Jin, et al.
Pubblicazione: (2024)
di: Zhang, Jin, et al.
Pubblicazione: (2024)
Distill Visual Chart Reasoning Ability from LLMs to MLLMs
di: He, Wei, et al.
Pubblicazione: (2024)
di: He, Wei, et al.
Pubblicazione: (2024)
LeftRefill: Filling Right Canvas based on Left Reference through Generalized Text-to-Image Diffusion Model
di: Cao, Chenjie, et al.
Pubblicazione: (2023)
di: Cao, Chenjie, et al.
Pubblicazione: (2023)
Benchmarking Chinese Commonsense Reasoning of LLMs: From Chinese-Specifics to Reasoning-Memorization Correlations
di: Sun, Jiaxing, et al.
Pubblicazione: (2024)
di: Sun, Jiaxing, et al.
Pubblicazione: (2024)
Self Adaptive Threshold Pseudo-labeling and Unreliable Sample Contrastive Loss for Semi-supervised Image Classification
di: Zhang, Xuerong, et al.
Pubblicazione: (2024)
di: Zhang, Xuerong, et al.
Pubblicazione: (2024)
PPMStereo: Pick-and-Play Memory Construction for Consistent Dynamic Stereo Matching
di: Wang, Yun, et al.
Pubblicazione: (2025)
di: Wang, Yun, et al.
Pubblicazione: (2025)
Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation
di: Liu, Ming, et al.
Pubblicazione: (2025)
di: Liu, Ming, et al.
Pubblicazione: (2025)
A Closer Look at Model Collapse: From a Generalization-to-Memorization Perspective
di: Shi, Lianghe, et al.
Pubblicazione: (2025)
di: Shi, Lianghe, et al.
Pubblicazione: (2025)
Repositioning the Subject within Image
di: Wang, Yikai, et al.
Pubblicazione: (2024)
di: Wang, Yikai, et al.
Pubblicazione: (2024)
Initialization is Critical to Whether Transformers Fit Composite Functions by Reasoning or Memorizing
di: Zhang, Zhongwang, et al.
Pubblicazione: (2024)
di: Zhang, Zhongwang, et al.
Pubblicazione: (2024)
AgentPRM: Process Reward Models for LLM Agents via Step-Wise Promise and Progress
di: Xi, Zhiheng, et al.
Pubblicazione: (2025)
di: Xi, Zhiheng, et al.
Pubblicazione: (2025)
Amino‐Functionalized Copper‐Triazolate Metal–Organic Frameworks for Enhanced Adsorption of Pharmaceutical Contaminants in Aqueous Solution
di: Shang Lv, et al.
Pubblicazione: (2026)
di: Shang Lv, et al.
Pubblicazione: (2026)
RLEP: Reinforcement Learning with Experience Replay for LLM Reasoning
di: Zhang, Hongzhi, et al.
Pubblicazione: (2025)
di: Zhang, Hongzhi, et al.
Pubblicazione: (2025)
Optimal Pricing with Unreliable Signals
di: Tang, Zhihao Gavin, et al.
Pubblicazione: (2026)
di: Tang, Zhihao Gavin, et al.
Pubblicazione: (2026)
What Makes a Good Speech Tokenizer for LLM-Centric Speech Generation? A Systematic Study
di: Fan, Xiaoran, et al.
Pubblicazione: (2025)
di: Fan, Xiaoran, et al.
Pubblicazione: (2025)
Credit Where It is Due: Cross-Modality Connectivity Drives Precise Reinforcement Learning for MLLM Reasoning
di: Jiao, Zhengbo, et al.
Pubblicazione: (2026)
di: Jiao, Zhengbo, et al.
Pubblicazione: (2026)
Subspace Defense: Discarding Adversarial Perturbations by Learning a Subspace for Clean Signals
di: Zheng, Rui, et al.
Pubblicazione: (2024)
di: Zheng, Rui, et al.
Pubblicazione: (2024)
Adjusting auxiliary variables under approximate neighborhood interference
di: Lu, Xin, et al.
Pubblicazione: (2024)
di: Lu, Xin, et al.
Pubblicazione: (2024)
The Role of Entropy in Visual Grounding: Analysis and Optimization
di: Li, Shuo, et al.
Pubblicazione: (2025)
di: Li, Shuo, et al.
Pubblicazione: (2025)
Indirect Synthesis of Zeolitic Imidazolate Framework‐8‐Derived Cu–Pd Alloy Nanoparticles with Enhanced Surface Desorption of Glycerol for Promoting Oxidative Carbonylation Reactions
di: Zhihao Lv, et al.
Pubblicazione: (2025)
di: Zhihao Lv, et al.
Pubblicazione: (2025)
LoRAMoE: Alleviate World Knowledge Forgetting in Large Language Models via MoE-Style Plugin
di: Dou, Shihan, et al.
Pubblicazione: (2023)
di: Dou, Shihan, et al.
Pubblicazione: (2023)
Soundwave: Less is More for Speech-Text Alignment in LLMs
di: Zhang, Yuhao, et al.
Pubblicazione: (2025)
di: Zhang, Yuhao, et al.
Pubblicazione: (2025)
Hierarchical Matching and Reasoning for Multi-Query Image Retrieval
di: Ji, Zhong, et al.
Pubblicazione: (2023)
di: Ji, Zhong, et al.
Pubblicazione: (2023)
JFTA-Bench: Evaluate LLM's Ability of Tracking and Analyzing Malfunctions Using Fault Trees
di: Wang, Yuhui, et al.
Pubblicazione: (2026)
di: Wang, Yuhui, et al.
Pubblicazione: (2026)
ReFT: Reasoning with Reinforced Fine-Tuning
di: Luong, Trung Quoc, et al.
Pubblicazione: (2024)
di: Luong, Trung Quoc, et al.
Pubblicazione: (2024)
Are Your LLMs Capable of Stable Reasoning?
di: Liu, Junnan, et al.
Pubblicazione: (2024)
di: Liu, Junnan, et al.
Pubblicazione: (2024)
Memorization in deep learning: A survey
di: Wei, Jiaheng, et al.
Pubblicazione: (2024)
di: Wei, Jiaheng, et al.
Pubblicazione: (2024)
StepCoder: Improve Code Generation with Reinforcement Learning from Compiler Feedback
di: Dou, Shihan, et al.
Pubblicazione: (2024)
di: Dou, Shihan, et al.
Pubblicazione: (2024)
The p. Arg 1800 His Mutation of Factor VIII Results in Moderate Hemophilia A Due to Defective Processing and Stability of Functional Protein
di: Han Wang, et al.
Pubblicazione: (2026)
di: Han Wang, et al.
Pubblicazione: (2026)
VRPO: Rethinking Value Modeling for Robust RL Training under Noisy Supervision
di: Zhu, Dingwei, et al.
Pubblicazione: (2025)
di: Zhu, Dingwei, et al.
Pubblicazione: (2025)
Using Unreliable Pseudo-Labels for Label-Efficient Semantic Segmentation
di: Wang, Haochen, et al.
Pubblicazione: (2023)
di: Wang, Haochen, et al.
Pubblicazione: (2023)
Documenti analoghi
-
Why Reinforcement Fine-Tuning Enables MLLMs Preserve Prior Knowledge Better: A Data Perspective
di: Zhang, Zhihao, et al.
Pubblicazione: (2025) -
Self-Polish: Enhance Reasoning in Large Language Models via Problem Refinement
di: Xi, Zhiheng, et al.
Pubblicazione: (2023) -
EliteKV: Scalable KV Cache Compression via RoPE Frequency Selection and Joint Low-Rank Projection
di: Zhou, Yuhao, et al.
Pubblicazione: (2025) -
MemFlow: Optical Flow Estimation and Prediction with Memory
di: Dong, Qiaole, et al.
Pubblicazione: (2024) -
Online Dense Point Tracking with Streaming Memory
di: Dong, Qiaole, et al.
Pubblicazione: (2025)