OPSD Compresses What RLVR Teaches: A Post-RL Compaction Stage for Reasoning Models
Fuente:
arXiv
Saved in:
| Main Authors: | Kim, Jaehoon, Lee, Dongha |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Persona2Web: Benchmarking Personalized Web Agents for Contextual Reasoning with User History
by: Kim, Serin, et al.
Published: (2026)
by: Kim, Serin, et al.
Published: (2026)
KnowRL: Teaching Language Models to Know What They Know
by: Kale, Sahil, et al.
Published: (2025)
by: Kale, Sahil, et al.
Published: (2025)
In Their Own Words: Reasoning Traces Tailored for Small Models Make Them Better Reasoners
by: Kim, Jaehoon, et al.
Published: (2025)
by: Kim, Jaehoon, et al.
Published: (2025)
Beyond the Final Answer: Evaluating the Reasoning Trajectories of Tool-Augmented Agents
by: Kim, Wonjoong, et al.
Published: (2025)
by: Kim, Wonjoong, et al.
Published: (2025)
OPSD: an Offensive Persian Social media Dataset and its baseline evaluations
by: Safayani, Mehran, et al.
Published: (2024)
by: Safayani, Mehran, et al.
Published: (2024)
Beyond Ontology in Dialogue State Tracking for Goal-Oriented Chatbot
by: Lee, Sejin, et al.
Published: (2024)
by: Lee, Sejin, et al.
Published: (2024)
MoCoRP: Modeling Consistent Relations between Persona and Response for Persona-based Dialogue
by: Lee, Kyungro, et al.
Published: (2025)
by: Lee, Kyungro, et al.
Published: (2025)
Region4Web: Rethinking Observation Space Granularity for Web Agents
by: Kwon, Donguk, et al.
Published: (2026)
by: Kwon, Donguk, et al.
Published: (2026)
Detecting RLVR Training Data via Structural Convergence of Reasoning
by: Zhang, Hongbo, et al.
Published: (2026)
by: Zhang, Hongbo, et al.
Published: (2026)
Can RL Teach Long-Horizon Reasoning to LLMs? Expressiveness Is Key
by: Wang, Tianle, et al.
Published: (2026)
by: Wang, Tianle, et al.
Published: (2026)
Evaluating Robustness of Reward Models for Mathematical Reasoning
by: Kim, Sunghwan, et al.
Published: (2024)
by: Kim, Sunghwan, et al.
Published: (2024)
Personalizing Large Language Models using Retrieval Augmented Generation and Knowledge Graph
by: Prahlad, Deeksha, et al.
Published: (2025)
by: Prahlad, Deeksha, et al.
Published: (2025)
A State-of-the-Art SQL Reasoning Model using RLVR
by: Ali, Alnur, et al.
Published: (2025)
by: Ali, Alnur, et al.
Published: (2025)
CONDESION-BENCH: Conditional Decision-Making of Large Language Models in Compositional Action Space
by: Hwang, Yeonjun, et al.
Published: (2026)
by: Hwang, Yeonjun, et al.
Published: (2026)
SMILE-Next: Teaching Large Language Models to Detect, Classify, and Reason about Laughter
by: Jung-Mok, Lee, et al.
Published: (2026)
by: Jung-Mok, Lee, et al.
Published: (2026)
Reasoning Depth and Environment Complexity: A Controlled Study of RLVR Data Allocation across Logical Reasoning Tasks
by: Zhu, Yihua, et al.
Published: (2026)
by: Zhu, Yihua, et al.
Published: (2026)
Generalization of RLVR Using Causal Reasoning as a Testbed
by: Lu, Brian, et al.
Published: (2025)
by: Lu, Brian, et al.
Published: (2025)
Decomposing Elements of Problem Solving: What "Math" Does RL Teach?
by: Qin, Tian, et al.
Published: (2025)
by: Qin, Tian, et al.
Published: (2025)
Large Language Models are Clinical Reasoners: Reasoning-Aware Diagnosis Framework with Prompt-Generated Rationales
by: Kwon, Taeyoon, et al.
Published: (2023)
by: Kwon, Taeyoon, et al.
Published: (2023)
Infinite Mask Diffusion for Few-Step Distillation
by: Yoo, Jaehoon, et al.
Published: (2026)
by: Yoo, Jaehoon, et al.
Published: (2026)
JudgeRLVR: Judge First, Generate Second for Efficient Reasoning
by: Duo, Jiangshan, et al.
Published: (2026)
by: Duo, Jiangshan, et al.
Published: (2026)
Nudging Beyond the Comfort Zone: Efficient Strategy-Guided Exploration for RLVR
by: Lee, Chanuk, et al.
Published: (2026)
by: Lee, Chanuk, et al.
Published: (2026)
Commonsense-augmented Memory Construction and Management in Long-term Conversations via Context-aware Persona Refinement
by: Kim, Hana, et al.
Published: (2024)
by: Kim, Hana, et al.
Published: (2024)
ASTRO: Teaching Language Models to Reason by Reflecting and Backtracking In-Context
by: Kim, Joongwon, et al.
Published: (2025)
by: Kim, Joongwon, et al.
Published: (2025)
Bayesian Teaching Enables Probabilistic Reasoning in Large Language Models
by: Qiu, Linlu, et al.
Published: (2025)
by: Qiu, Linlu, et al.
Published: (2025)
PerMix-RLVR: Preserving Persona Expressivity under Verifiable-Reward Alignment
by: Oh, Jihwan, et al.
Published: (2026)
by: Oh, Jihwan, et al.
Published: (2026)
Unlocking Fine-Grained and Within-Utterance Speaking Style Control in Prompt-Based Text-to-Speech Models
by: Kang, Jaehoon, et al.
Published: (2026)
by: Kang, Jaehoon, et al.
Published: (2026)
Critique-RL: Training Language Models for Critiquing through Two-Stage Reinforcement Learning
by: Xi, Zhiheng, et al.
Published: (2025)
by: Xi, Zhiheng, et al.
Published: (2025)
Teaching Language Models to Reason with Tools
by: Li, Chengpeng, et al.
Published: (2025)
by: Li, Chengpeng, et al.
Published: (2025)
COCOA: CBT-based Conversational Counseling Agent using Memory Specialized in Cognitive Distortions and Dynamic Prompt
by: Lee, Suyeon, et al.
Published: (2024)
by: Lee, Suyeon, et al.
Published: (2024)
SAGE: Shaping Anchors for Guided Exploration in RLVR of LLMs
by: Lee, Chanuk, et al.
Published: (2026)
by: Lee, Chanuk, et al.
Published: (2026)
Med-RLVR: Emerging Medical Reasoning from a 3B base model via reinforcement Learning
by: Zhang, Sheng, et al.
Published: (2025)
by: Zhang, Sheng, et al.
Published: (2025)
Eliciting Instruction-tuned Code Language Models' Capabilities to Utilize Auxiliary Function for Code Generation
by: Lee, Seonghyeon, et al.
Published: (2024)
by: Lee, Seonghyeon, et al.
Published: (2024)
Reaching Beyond the Mode: RL for Distributional Reasoning in Language Models
by: Puri, Isha, et al.
Published: (2026)
by: Puri, Isha, et al.
Published: (2026)
LMM-R1: Empowering 3B LMMs with Strong Reasoning Abilities Through Two-Stage Rule-Based RL
by: Peng, Yingzhe, et al.
Published: (2025)
by: Peng, Yingzhe, et al.
Published: (2025)
Reasoning Core: A Scalable RL Environment for LLM Symbolic Reasoning
by: Lacombe, Valentin, et al.
Published: (2025)
by: Lacombe, Valentin, et al.
Published: (2025)
A Primer in Post-Training Reasoning Data: What We Know About How It Works
by: Li, Yaoming, et al.
Published: (2026)
by: Li, Yaoming, et al.
Published: (2026)
WAND: Windowed Attention and Knowledge Distillation for Efficient Autoregressive Text-to-Speech Models
by: Lee, Hanna, et al.
Published: (2026)
by: Lee, Hanna, et al.
Published: (2026)
How Diversely Can Language Models Solve Problems? Exploring the Algorithmic Diversity of Model-Generated Code
by: Lee, Seonghyeon, et al.
Published: (2025)
by: Lee, Seonghyeon, et al.
Published: (2025)
Aggressive Post-Training Compression on Extremely Large Language Models
by: Zhang, Zining, et al.
Published: (2024)
by: Zhang, Zining, et al.
Published: (2024)
Similar Items
-
Persona2Web: Benchmarking Personalized Web Agents for Contextual Reasoning with User History
by: Kim, Serin, et al.
Published: (2026) -
KnowRL: Teaching Language Models to Know What They Know
by: Kale, Sahil, et al.
Published: (2025) -
In Their Own Words: Reasoning Traces Tailored for Small Models Make Them Better Reasoners
by: Kim, Jaehoon, et al.
Published: (2025) -
Beyond the Final Answer: Evaluating the Reasoning Trajectories of Tool-Augmented Agents
by: Kim, Wonjoong, et al.
Published: (2025) -
OPSD: an Offensive Persian Social media Dataset and its baseline evaluations
by: Safayani, Mehran, et al.
Published: (2024)