Explore Data Left Behind in Reinforcement Learning for Reasoning Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liu, Chenxi, Liang, Junjie, Jia, Yuqi, Cao, Bochuan, Bai, Yang, Huang, Heng, Chen, Xun |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
No Preference Left Behind: Group Distributional Preference Optimization
par: Yao, Binwei, et autres
Publié: (2024)
par: Yao, Binwei, et autres
Publié: (2024)
Stealthy and Persistent Unalignment on Large Language Models via Backdoor Injections
par: Cao, Yuanpu, et autres
Publié: (2023)
par: Cao, Yuanpu, et autres
Publié: (2023)
Learning from Self-Debate: Preparing Reasoning Models for Multi-Agent Debate
par: Liu, Chenxi, et autres
Publié: (2026)
par: Liu, Chenxi, et autres
Publié: (2026)
Reasoning-Table: Exploring Reinforcement Learning for Table Reasoning
par: Lei, Fangyu, et autres
Publié: (2025)
par: Lei, Fangyu, et autres
Publié: (2025)
No Language Data Left Behind: A Comparative Study of CJK Language Datasets in the Hugging Face Ecosystem
par: Choi, Dasol, et autres
Publié: (2025)
par: Choi, Dasol, et autres
Publié: (2025)
A Watermark for Order-Agnostic Language Models
par: Chen, Ruibo, et autres
Publié: (2024)
par: Chen, Ruibo, et autres
Publié: (2024)
Left Behind: Cross-Lingual Transfer as a Bridge for Low-Resource Languages in Large Language Models
par: Beibitkhan, Abdul-Salem
Publié: (2026)
par: Beibitkhan, Abdul-Salem
Publié: (2026)
OThink-SRR1: Search, Refine and Reasoning with Reinforced Learning for Large Language Models
par: Liang, Haijian, et autres
Publié: (2026)
par: Liang, Haijian, et autres
Publié: (2026)
JoPA:Explaining Large Language Model's Generation via Joint Prompt Attribution
par: Chang, Yurui, et autres
Publié: (2024)
par: Chang, Yurui, et autres
Publié: (2024)
DELTA: Deliberative Multi-Agent Reasoning with Reinforcement Learning for Multimodal Psychological Counseling
par: Yang, Jiangnan, et autres
Publié: (2026)
par: Yang, Jiangnan, et autres
Publié: (2026)
Your Vision-Language Model Itself Is a Strong Filter: Towards High-Quality Instruction Tuning with Data Selection
par: Chen, Ruibo, et autres
Publié: (2024)
par: Chen, Ruibo, et autres
Publié: (2024)
Beyond SFT: Reinforcement Learning for Safer Large Reasoning Models with Better Reasoning Ability
par: Jia, Jinghan, et autres
Publié: (2025)
par: Jia, Jinghan, et autres
Publié: (2025)
Native Parallel Reasoner: Reasoning in Parallelism via Self-Distilled Reinforcement Learning
par: Wu, Tong, et autres
Publié: (2025)
par: Wu, Tong, et autres
Publié: (2025)
No Prompt Left Behind: Exploiting Zero-Variance Prompts in LLM Reinforcement Learning via Entropy-Guided Advantage Shaping
par: Le, Thanh-Long V., et autres
Publié: (2025)
par: Le, Thanh-Long V., et autres
Publié: (2025)
Personalized Steering of Large Language Models: Versatile Steering Vectors Through Bi-directional Preference Optimization
par: Cao, Yuanpu, et autres
Publié: (2024)
par: Cao, Yuanpu, et autres
Publié: (2024)
SOUP: Token-level Single-sample Mix-policy Reinforcement Learning for Large Language Models
par: Yang, Lei, et autres
Publié: (2026)
par: Yang, Lei, et autres
Publié: (2026)
Monitoring Decoding: Mitigating Hallucination via Evaluating the Factuality of Partial Response during Generation
par: Chang, Yurui, et autres
Publié: (2025)
par: Chang, Yurui, et autres
Publié: (2025)
Revisiting Entropy in Reinforcement Learning for Large Reasoning Models
par: Jin, Renren, et autres
Publié: (2025)
par: Jin, Renren, et autres
Publié: (2025)
The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models
par: Cui, Ganqu, et autres
Publié: (2025)
par: Cui, Ganqu, et autres
Publié: (2025)
Composition-RL: Compose Your Verifiable Prompts for Reinforcement Learning of Large Language Models
par: Xu, Xin, et autres
Publié: (2026)
par: Xu, Xin, et autres
Publié: (2026)
Towards Copyright Protection for Knowledge Bases of Retrieval-augmented Language Models via Reasoning
par: Guo, Junfeng, et autres
Publié: (2025)
par: Guo, Junfeng, et autres
Publié: (2025)
TruthFlow: Truthful LLM Generation via Representation Flow Correction
par: Wang, Hanyu, et autres
Publié: (2025)
par: Wang, Hanyu, et autres
Publié: (2025)
Languages Still Left Behind: Toward a Better Multilingual Machine Translation Benchmark
par: Taguchi, Chihiro, et autres
Publié: (2025)
par: Taguchi, Chihiro, et autres
Publié: (2025)
On the Convergence of Moral Self-Correction in Large Language Models
par: Liu, Guangliang, et autres
Publié: (2025)
par: Liu, Guangliang, et autres
Publié: (2025)
Graph Reasoning Paradigm: Structured and Symbolic Reasoning with Topology-Aware Reinforcement Learning for Large Language Models
par: Liu, Runxuan, et autres
Publié: (2026)
par: Liu, Runxuan, et autres
Publié: (2026)
Concise and Organized Perception Facilitates Reasoning in Large Language Models
par: Liu, Junjie, et autres
Publié: (2023)
par: Liu, Junjie, et autres
Publié: (2023)
LoopRPT: Reinforcement Pre-Training for Looped Language Models
par: Tang, Guo, et autres
Publié: (2026)
par: Tang, Guo, et autres
Publié: (2026)
Defending Against Alignment-Breaking Attacks via Robustly Aligned LLM
par: Cao, Bochuan, et autres
Publié: (2023)
par: Cao, Bochuan, et autres
Publié: (2023)
UloRL:An Ultra-Long Output Reinforcement Learning Approach for Advancing Large Language Models' Reasoning Abilities
par: Du, Dong, et autres
Publié: (2025)
par: Du, Dong, et autres
Publié: (2025)
Exploring the Translation Mechanism of Large Language Models
par: Zhang, Hongbin, et autres
Publié: (2025)
par: Zhang, Hongbin, et autres
Publié: (2025)
PsyDraw: A Multi-Agent Multimodal System for Mental Health Screening in Left-Behind Children
par: Zhang, Yiqun, et autres
Publié: (2024)
par: Zhang, Yiqun, et autres
Publié: (2024)
Agentic Society: Merging skeleton from real world and texture from Large Language Model
par: Bai, Yuqi, et autres
Publié: (2024)
par: Bai, Yuqi, et autres
Publié: (2024)
SpeakRL: Synergizing Reasoning, Speaking, and Acting in Language Models with Reinforcement Learning
par: Acikgoz, Emre Can, et autres
Publié: (2025)
par: Acikgoz, Emre Can, et autres
Publié: (2025)
Fin-R1: A Large Language Model for Financial Reasoning through Reinforcement Learning
par: Liu, Zhaowei, et autres
Publié: (2025)
par: Liu, Zhaowei, et autres
Publié: (2025)
Formality is Favored: Unraveling the Learning Preferences of Large Language Models on Data with Conflicting Knowledge
par: Li, Jiahuan, et autres
Publié: (2024)
par: Li, Jiahuan, et autres
Publié: (2024)
No Reader Left Behind: Multi-Agent Summaries Everyone Can Understand
par: Jung, Jimin, et autres
Publié: (2026)
par: Jung, Jimin, et autres
Publié: (2026)
Tagging the Thought: Unlocking Personalization Reasoning via Reinforcement Learning
par: Jin, Song, et autres
Publié: (2025)
par: Jin, Song, et autres
Publié: (2025)
Incorporating Self-Rewriting into Large Language Model Reasoning Reinforcement
par: Yao, Jiashu, et autres
Publié: (2025)
par: Yao, Jiashu, et autres
Publié: (2025)
Computation Mechanism Behind LLM Position Generalization
par: Han, Chi, et autres
Publié: (2025)
par: Han, Chi, et autres
Publié: (2025)
Interleaved Reasoning for Large Language Models via Reinforcement Learning
par: Xie, Roy, et autres
Publié: (2025)
par: Xie, Roy, et autres
Publié: (2025)
Documents similaires
-
No Preference Left Behind: Group Distributional Preference Optimization
par: Yao, Binwei, et autres
Publié: (2024) -
Stealthy and Persistent Unalignment on Large Language Models via Backdoor Injections
par: Cao, Yuanpu, et autres
Publié: (2023) -
Learning from Self-Debate: Preparing Reasoning Models for Multi-Agent Debate
par: Liu, Chenxi, et autres
Publié: (2026) -
Reasoning-Table: Exploring Reinforcement Learning for Table Reasoning
par: Lei, Fangyu, et autres
Publié: (2025) -
No Language Data Left Behind: A Comparative Study of CJK Language Datasets in the Hugging Face Ecosystem
par: Choi, Dasol, et autres
Publié: (2025)