Limits of Difficulty Scaling: Hard Samples Yield Diminishing Returns in GRPO-Tuned SLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yadav, Suraj, Yadav, Siddharth, Goyal, Parth |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Diminishing Return of Value Expansion Methods
par: Palenicek, Daniel, et autres
Publié: (2024)
par: Palenicek, Daniel, et autres
Publié: (2024)
Diminishing Returns in Expanding Generative Models and Godel-Tarski-Lob Limits
par: Majumdar, Angshul
Publié: (2026)
par: Majumdar, Angshul
Publié: (2026)
Hardware Scaling Trends and Diminishing Returns in Large-Scale Distributed Training
par: Fernandez, Jared, et autres
Publié: (2024)
par: Fernandez, Jared, et autres
Publié: (2024)
On the Diminishing Returns of Width for Continual Learning
par: Guha, Etash, et autres
Publié: (2024)
par: Guha, Etash, et autres
Publié: (2024)
R2V Agent: Teaching SLMs When to Ask for Help
par: Hemadri, Raghu Vamshi, et autres
Publié: (2026)
par: Hemadri, Raghu Vamshi, et autres
Publié: (2026)
Unveiling Implicit Advantage Symmetry: Why GRPO Struggles with Exploration and Difficulty Adaptation
par: Yu, Zhiqi, et autres
Publié: (2026)
par: Yu, Zhiqi, et autres
Publié: (2026)
Long-Document QA with Chain-of-Structured-Thought and Fine-Tuned SLMs
par: Liang, Zhuowen, et autres
Publié: (2026)
par: Liang, Zhuowen, et autres
Publié: (2026)
GanitLLM: Difficulty-Aware Bengali Mathematical Reasoning through Curriculum-GRPO
par: Dipta, Shubhashis Roy, et autres
Publié: (2026)
par: Dipta, Shubhashis Roy, et autres
Publié: (2026)
On the Relationship Between Representation Geometry and Generalization in Deep Neural Networks
par: Yadav, Sumit
Publié: (2026)
par: Yadav, Sumit
Publié: (2026)
Open-Weight LLM Fine-Tuning Defenses are Susceptible to Simple Attacks
par: Kuo, Kevin, et autres
Publié: (2026)
par: Kuo, Kevin, et autres
Publié: (2026)
FedProxy: Federated Fine-Tuning of LLMs via Proxy SLMs and Heterogeneity-Aware Fusion
par: Fan, Tao, et autres
Publié: (2026)
par: Fan, Tao, et autres
Publié: (2026)
GRPO-RM: Fine-Tuning Representation Models via GRPO-Driven Reinforcement Learning
par: Xu, Yanchen, et autres
Publié: (2025)
par: Xu, Yanchen, et autres
Publié: (2025)
D3: Diversity, Difficulty, and Dependability-Aware Data Selection for Sample-Efficient LLM Instruction Tuning
par: Zhang, Jia, et autres
Publié: (2025)
par: Zhang, Jia, et autres
Publié: (2025)
HardSATGEN: Understanding the Difficulty of Hard SAT Formula Generation and A Strong Structure-Hardness-Aware Baseline
par: Li, Yang, et autres
Publié: (2023)
par: Li, Yang, et autres
Publié: (2023)
Heavy-Tailed and Long-Range Dependent Noise in Stochastic Approximation: A Finite-Time Analysis
par: Chandak, Siddharth, et autres
Publié: (2026)
par: Chandak, Siddharth, et autres
Publié: (2026)
Think Smart, Not Hard: Difficulty Adaptive Reasoning for Large Audio Language Models
par: Sheng, Zhichao, et autres
Publié: (2025)
par: Sheng, Zhichao, et autres
Publié: (2025)
A Toolbox, Not a Hammer -- Multi-TAG: Scaling Math Reasoning with Multi-Tool Aggregation
par: Yao, Bohan, et autres
Publié: (2025)
par: Yao, Bohan, et autres
Publié: (2025)
Understanding and Improving Noisy Embedding Techniques in Instruction Finetuning
par: Yadav, Abhay
Publié: (2026)
par: Yadav, Abhay
Publié: (2026)
Sign-Aware Multistate Jaccard Kernels and Geometry for Real and Complex-Valued Signals
par: Yadav, Vineet
Publié: (2025)
par: Yadav, Vineet
Publié: (2025)
A Concise Review of Hallucinations in LLMs and their Mitigation
par: Pulkundwar, Parth, et autres
Publié: (2025)
par: Pulkundwar, Parth, et autres
Publié: (2025)
Compress the Easy, Explore the Hard: Difficulty-Aware Entropy Regularization for Efficient LLM Reasoning
par: Luo, Qin-Wen, et autres
Publié: (2026)
par: Luo, Qin-Wen, et autres
Publié: (2026)
GRPO-TTA: Test-Time Visual Tuning for Vision-Language Models via GRPO-Driven Reinforcement Learning
par: Li, Yujun, et autres
Publié: (2026)
par: Li, Yujun, et autres
Publié: (2026)
Bayesian Optimization under Uncertainty for Training a Scale Parameter in Stochastic Models
par: Yadav, Akash, et autres
Publié: (2025)
par: Yadav, Akash, et autres
Publié: (2025)
Hard Examples Are All You Need: Maximizing GRPO Post-Training Under Annotation Budgets
par: Pikus, Benjamin, et autres
Publié: (2025)
par: Pikus, Benjamin, et autres
Publié: (2025)
Predictive Scaling Laws for Efficient GRPO Training of Large Reasoning Models
par: Nimmaturi, Datta, et autres
Publié: (2025)
par: Nimmaturi, Datta, et autres
Publié: (2025)
Rebalancing the Scales: A Systematic Mapping Study of Generative Adversarial Networks (GANs) in Addressing Data Imbalance
par: Yadav, Pankaj, et autres
Publié: (2025)
par: Yadav, Pankaj, et autres
Publié: (2025)
The Hardness of Achieving Impact in AI for Social Impact Research: A Ground-Level View of Challenges & Opportunities
par: Majumdar, Aditya, et autres
Publié: (2025)
par: Majumdar, Aditya, et autres
Publié: (2025)
Reinforcement Learning in Non-Markovian Environments
par: Chandak, Siddharth, et autres
Publié: (2022)
par: Chandak, Siddharth, et autres
Publié: (2022)
Failure Modes of Time Series Interpretability Algorithms for Critical Care Applications and Potential Solutions
par: Yadav, Shashank, et autres
Publié: (2025)
par: Yadav, Shashank, et autres
Publié: (2025)
Misam: Using ML in Dataflow Selection of Sparse-Sparse Matrix Multiplication
par: Yadav, Sanjali, et autres
Publié: (2024)
par: Yadav, Sanjali, et autres
Publié: (2024)
Differential Machine Learning for Time Series Prediction
par: Yadav, Akash, et autres
Publié: (2025)
par: Yadav, Akash, et autres
Publié: (2025)
DGLight: DQN-Guided GRPO Fine-Tuning of Large Language Models for Traffic Signal Control
par: Yu, Chenbo
Publié: (2026)
par: Yu, Chenbo
Publié: (2026)
A Structure-Agnostic Co-Tuning Framework for LLMs and SLMs in Cloud-Edge Systems
par: Liu, Yuze, et autres
Publié: (2025)
par: Liu, Yuze, et autres
Publié: (2025)
Learning to Translate from Soft to Hard LLM Prompts
par: Kongsomjit, Pitipat, et autres
Publié: (2026)
par: Kongsomjit, Pitipat, et autres
Publié: (2026)
Fine-Tuning Small Language Models (SLMs) for Autonomous Web-based Geographical Information Systems (AWebGIS)
par: Ashani, Mahdi Nazari, et autres
Publié: (2025)
par: Ashani, Mahdi Nazari, et autres
Publié: (2025)
LithoGRPO: Fast Inverse Lithography via GRPO Reinforced Flow Matching
par: Lai, Yao, et autres
Publié: (2026)
par: Lai, Yao, et autres
Publié: (2026)
Audio Question Answering with GRPO-Based Fine-Tuning and Calibrated Segment-Level Predictions
par: Gibier, Marcel, et autres
Publié: (2025)
par: Gibier, Marcel, et autres
Publié: (2025)
Comparative Analysis and Parametric Tuning of PPO, GRPO, and DAPO for LLM Reasoning Enhancement
par: Lian, Yongsheng
Publié: (2025)
par: Lian, Yongsheng
Publié: (2025)
GIFT: Group-Relative Implicit Fine-Tuning Integrates GRPO with DPO and UNA
par: Wang, Zhichao
Publié: (2025)
par: Wang, Zhichao
Publié: (2025)
AMIR-GRPO: Inducing Implicit Preference Signals into GRPO
par: Yari, Amir Hossein, et autres
Publié: (2026)
par: Yari, Amir Hossein, et autres
Publié: (2026)
Documents similaires
-
Diminishing Return of Value Expansion Methods
par: Palenicek, Daniel, et autres
Publié: (2024) -
Diminishing Returns in Expanding Generative Models and Godel-Tarski-Lob Limits
par: Majumdar, Angshul
Publié: (2026) -
Hardware Scaling Trends and Diminishing Returns in Large-Scale Distributed Training
par: Fernandez, Jared, et autres
Publié: (2024) -
On the Diminishing Returns of Width for Continual Learning
par: Guha, Etash, et autres
Publié: (2024) -
R2V Agent: Teaching SLMs When to Ask for Help
par: Hemadri, Raghu Vamshi, et autres
Publié: (2026)