DisCO: Reinforcing Large Reasoning Models with Discriminative Constrained Optimization
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Gang, Lin, Ming, Galanti, Tomer, Tu, Zhengzhong, Yang, Tianbao |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
DRPO: Efficient Reasoning via Decoupled Reward Policy Optimization
di: Li, Gang, et al.
Pubblicazione: (2025)
di: Li, Gang, et al.
Pubblicazione: (2025)
The Fair Language Model Paradox
di: Pinto, Andrea, et al.
Pubblicazione: (2024)
di: Pinto, Andrea, et al.
Pubblicazione: (2024)
Directional Neural Collapse Explains Few-Shot Transfer in Self-Supervised Learning
di: Luthra, Achleshwar, et al.
Pubblicazione: (2026)
di: Luthra, Achleshwar, et al.
Pubblicazione: (2026)
Self-Supervised Contrastive Learning is Approximately Supervised Contrastive Learning
di: Luthra, Achleshwar, et al.
Pubblicazione: (2025)
di: Luthra, Achleshwar, et al.
Pubblicazione: (2025)
Multi-Output Distributional Fairness via Post-Processing
di: Li, Gang, et al.
Pubblicazione: (2024)
di: Li, Gang, et al.
Pubblicazione: (2024)
Harness as an Asset: Enforcing Determinism via the Convergent AI Agent Framework (CAAF)
di: Zhang, Tianbao
Pubblicazione: (2026)
di: Zhang, Tianbao
Pubblicazione: (2026)
ERPO: Token-Level Entropy-Regulated Policy Optimization for Large Reasoning Models
di: Yu, Song, et al.
Pubblicazione: (2026)
di: Yu, Song, et al.
Pubblicazione: (2026)
Adaptive Preference Scaling for Reinforcement Learning with Human Feedback
di: Hong, Ilgee, et al.
Pubblicazione: (2024)
di: Hong, Ilgee, et al.
Pubblicazione: (2024)
A Retention-Centric Framework for Continual Learning with Guaranteed Model Developmental Safety
di: Li, Gang, et al.
Pubblicazione: (2024)
di: Li, Gang, et al.
Pubblicazione: (2024)
Rethinking Large Language Model Distillation: A Constrained Markov Decision Process Perspective
di: Zimmer, Matthieu, et al.
Pubblicazione: (2025)
di: Zimmer, Matthieu, et al.
Pubblicazione: (2025)
Non-Smooth Weakly-Convex Finite-sum Coupled Compositional Optimization
di: Hu, Quanqi, et al.
Pubblicazione: (2023)
di: Hu, Quanqi, et al.
Pubblicazione: (2023)
Large Scale Constrained Clustering With Reinforcement Learning
di: Schesch, Benedikt, et al.
Pubblicazione: (2024)
di: Schesch, Benedikt, et al.
Pubblicazione: (2024)
LEPO: Latent Reasoning Policy Optimization for Large Language Models
di: Zhou, Yuyan, et al.
Pubblicazione: (2026)
di: Zhou, Yuyan, et al.
Pubblicazione: (2026)
Safe and Balanced: A Framework for Constrained Multi-Objective Reinforcement Learning
di: Gu, Shangding, et al.
Pubblicazione: (2024)
di: Gu, Shangding, et al.
Pubblicazione: (2024)
RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents
di: Zhang, Zijing, et al.
Pubblicazione: (2025)
di: Zhang, Zijing, et al.
Pubblicazione: (2025)
Simulating the Unseen: Crash Prediction Must Learn from What Did Not Happen
di: Li, Zihao, et al.
Pubblicazione: (2025)
di: Li, Zihao, et al.
Pubblicazione: (2025)
Fine-Tuning Diffusion Models for Molecular Generation via Reinforcement Learning and Fast Sampling
di: Lin, Guang, et al.
Pubblicazione: (2026)
di: Lin, Guang, et al.
Pubblicazione: (2026)
Reinforcement-aware Knowledge Distillation for LLM Reasoning
di: Zhang, Zhaoyang, et al.
Pubblicazione: (2026)
di: Zhang, Zhaoyang, et al.
Pubblicazione: (2026)
An Optimal Discriminator Weighted Imitation Perspective for Reinforcement Learning
di: Xu, Haoran, et al.
Pubblicazione: (2025)
di: Xu, Haoran, et al.
Pubblicazione: (2025)
BackSlash: Rate Constrained Optimized Training of Large Language Models
di: Wu, Jun, et al.
Pubblicazione: (2025)
di: Wu, Jun, et al.
Pubblicazione: (2025)
Incentivizing Safer Actions in Policy Optimization for Constrained Reinforcement Learning
di: Hazra, Somnath, et al.
Pubblicazione: (2025)
di: Hazra, Somnath, et al.
Pubblicazione: (2025)
Gradient Aligned Regression via Pairwise Losses
di: Zhu, Dixian, et al.
Pubblicazione: (2024)
di: Zhu, Dixian, et al.
Pubblicazione: (2024)
RPO:Reinforcement Fine-Tuning with Partial Reasoning Optimization
di: Yi, Hongzhu, et al.
Pubblicazione: (2026)
di: Yi, Hongzhu, et al.
Pubblicazione: (2026)
Model Ensembling for Constrained Optimization
di: Globus-Harris, Ira, et al.
Pubblicazione: (2024)
di: Globus-Harris, Ira, et al.
Pubblicazione: (2024)
An Advantage-based Optimization Method for Reinforcement Learning in Large Action Space
di: Lin, Hai, et al.
Pubblicazione: (2024)
di: Lin, Hai, et al.
Pubblicazione: (2024)
A Survey of Reinforcement Learning for Large Reasoning Models
di: Zhang, Kaiyan, et al.
Pubblicazione: (2025)
di: Zhang, Kaiyan, et al.
Pubblicazione: (2025)
ADORA: Training Reasoning Models with Dynamic Advantage Estimation on Reinforcement Learning
di: Ren, Qingnan, et al.
Pubblicazione: (2026)
di: Ren, Qingnan, et al.
Pubblicazione: (2026)
Meta-Reasoner: Dynamic Guidance for Optimized Inference-time Reasoning in Large Language Models
di: Sui, Yuan, et al.
Pubblicazione: (2025)
di: Sui, Yuan, et al.
Pubblicazione: (2025)
Can Large Language Models Reason and Optimize Under Constraints?
di: Bernier, Fabien, et al.
Pubblicazione: (2026)
di: Bernier, Fabien, et al.
Pubblicazione: (2026)
Online Preference-based Reinforcement Learning with Self-augmented Feedback from Large Language Model
di: Tu, Songjun, et al.
Pubblicazione: (2024)
di: Tu, Songjun, et al.
Pubblicazione: (2024)
Mitigating Overthinking in Large Reasoning Models via Difficulty-aware Reinforcement Learning
di: Wan, Qian, et al.
Pubblicazione: (2026)
di: Wan, Qian, et al.
Pubblicazione: (2026)
RL4CO: an Extensive Reinforcement Learning for Combinatorial Optimization Benchmark
di: Berto, Federico, et al.
Pubblicazione: (2023)
di: Berto, Federico, et al.
Pubblicazione: (2023)
An Offline Adaptation Framework for Constrained Multi-Objective Reinforcement Learning
di: Lin, Qian, et al.
Pubblicazione: (2024)
di: Lin, Qian, et al.
Pubblicazione: (2024)
S-GRPO: Early Exit via Reinforcement Learning in Reasoning Models
di: Dai, Muzhi, et al.
Pubblicazione: (2025)
di: Dai, Muzhi, et al.
Pubblicazione: (2025)
Myna: Masking-Based Contrastive Learning of Musical Representations
di: Yonay, Ori, et al.
Pubblicazione: (2025)
di: Yonay, Ori, et al.
Pubblicazione: (2025)
MoE-DisCo:Low Economy Cost Training Mixture-of-Experts Models
di: Ye, Xin, et al.
Pubblicazione: (2026)
di: Ye, Xin, et al.
Pubblicazione: (2026)
Systematic Optimization of Open Source Large Language Models for Mathematical Reasoning
di: Pawar, Pranav, et al.
Pubblicazione: (2025)
di: Pawar, Pranav, et al.
Pubblicazione: (2025)
How Does Controllability Emerge In Language Models During Pretraining?
di: She, Jianshu, et al.
Pubblicazione: (2025)
di: She, Jianshu, et al.
Pubblicazione: (2025)
Provably Efficient Exploration in Inverse Constrained Reinforcement Learning
di: Yue, Bo, et al.
Pubblicazione: (2024)
di: Yue, Bo, et al.
Pubblicazione: (2024)
Revisiting Entropy in Reinforcement Learning for Large Reasoning Models
di: Jin, Renren, et al.
Pubblicazione: (2025)
di: Jin, Renren, et al.
Pubblicazione: (2025)
Documenti analoghi
-
DRPO: Efficient Reasoning via Decoupled Reward Policy Optimization
di: Li, Gang, et al.
Pubblicazione: (2025) -
The Fair Language Model Paradox
di: Pinto, Andrea, et al.
Pubblicazione: (2024) -
Directional Neural Collapse Explains Few-Shot Transfer in Self-Supervised Learning
di: Luthra, Achleshwar, et al.
Pubblicazione: (2026) -
Self-Supervised Contrastive Learning is Approximately Supervised Contrastive Learning
di: Luthra, Achleshwar, et al.
Pubblicazione: (2025) -
Multi-Output Distributional Fairness via Post-Processing
di: Li, Gang, et al.
Pubblicazione: (2024)