RAPID: An Efficient Reinforcement Learning Algorithm for Small Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Huang, Lianghuan, Anupam, Sagnik, Lee, Insup, Li, Shuo, Bastani, Osbert |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Effective Reinforcement Learning for Reasoning in Language Models
par: Huang, Lianghuan, et autres
Publié: (2025)
par: Huang, Lianghuan, et autres
Publié: (2025)
LLM Program Optimization via Retrieval Augmented Search
par: Anupam, Sagnik, et autres
Publié: (2025)
par: Anupam, Sagnik, et autres
Publié: (2025)
Conformal Constrained Policy Optimization for Cost-Effective LLM Agents
par: Si, Wenwen, et autres
Publié: (2025)
par: Si, Wenwen, et autres
Publié: (2025)
BrowserArena: Evaluating LLM Agents on Real-World Web Navigation Tasks
par: Anupam, Sagnik, et autres
Publié: (2025)
par: Anupam, Sagnik, et autres
Publié: (2025)
Uncertainty in Language Models: Assessment through Rank-Calibration
par: Huang, Xinmeng, et autres
Publié: (2024)
par: Huang, Xinmeng, et autres
Publié: (2024)
Rethinking Algorithmic Fairness for Human-AI Collaboration
par: Ge, Haosen, et autres
Publié: (2023)
par: Ge, Haosen, et autres
Publié: (2023)
Asymptotic Normality of Generalized Low-Rank Matrix Sensing via Riemannian Geometry
par: Bastani, Osbert
Publié: (2024)
par: Bastani, Osbert
Publié: (2024)
WST: Weak-to-Strong Knowledge Transfer via Reinforcement Learning
par: Ge, Haosen, et autres
Publié: (2025)
par: Ge, Haosen, et autres
Publié: (2025)
Improving Human Sequential Decision-Making with Reinforcement Learning
par: Bastani, Hamsa, et autres
Publié: (2021)
par: Bastani, Hamsa, et autres
Publié: (2021)
Conformal Structured Prediction
par: Zhang, Botong, et autres
Publié: (2024)
par: Zhang, Botong, et autres
Publié: (2024)
SeekerGym: A Benchmark for Reliable Information Seeking
par: Kim, Remy, et autres
Publié: (2026)
par: Kim, Remy, et autres
Publié: (2026)
Stochastic Online Conformal Prediction with Semi-Bandit Feedback
par: Ge, Haosen, et autres
Publié: (2024)
par: Ge, Haosen, et autres
Publié: (2024)
Policy-Guided Stepwise Model Routing for Cost-Effective Reasoning
par: Si, Wenwen, et autres
Publié: (2026)
par: Si, Wenwen, et autres
Publié: (2026)
Group-Sparse Matrix Factorization for Transfer Learning of Word Embeddings
par: Xu, Kan, et autres
Publié: (2021)
par: Xu, Kan, et autres
Publié: (2021)
TRAQ: Trustworthy Retrieval Augmented Question Answering via Conformal Prediction
par: Li, Shuo, et autres
Publié: (2023)
par: Li, Shuo, et autres
Publié: (2023)
Beating the Winner's Curse via Inference-Aware Policy Optimization
par: Bastani, Hamsa, et autres
Publié: (2025)
par: Bastani, Hamsa, et autres
Publié: (2025)
Winner's Curse Drives False Promises in Data-Driven Decisions: A Case Study in Refugee Matching
par: Bastani, Hamsa, et autres
Publié: (2026)
par: Bastani, Hamsa, et autres
Publié: (2026)
One-Shot Safety Alignment for Large Language Models via Optimal Dualization
par: Huang, Xinmeng, et autres
Publié: (2024)
par: Huang, Xinmeng, et autres
Publié: (2024)
SPARLING: Learning Latent Representations with Extremely Sparse Activations
par: Gupta, Kavi, et autres
Publié: (2023)
par: Gupta, Kavi, et autres
Publié: (2023)
Stochastic Bandits with ReLU Neural Networks
par: Xu, Kan, et autres
Publié: (2024)
par: Xu, Kan, et autres
Publié: (2024)
Diversity By Design: Leveraging Distribution Matching for Offline Model-Based Optimization
par: Yao, Michael S., et autres
Publié: (2025)
par: Yao, Michael S., et autres
Publié: (2025)
Reinforcement Learning Finetunes Small Subnetworks in Large Language Models
par: Mukherjee, Sagnik, et autres
Publié: (2025)
par: Mukherjee, Sagnik, et autres
Publié: (2025)
Uncertainty Quantification for Neurosymbolic Programs via Compositional Conformal Prediction
par: Ramalingam, Ramya, et autres
Publié: (2024)
par: Ramalingam, Ramya, et autres
Publié: (2024)
Prior-Agnostic Incentive-Compatible Exploration
par: Ramalingam, Ramya, et autres
Publié: (2026)
par: Ramalingam, Ramya, et autres
Publié: (2026)
Generative Adversarial Model-Based Optimization via Source Critic Regularization
par: Yao, Michael S., et autres
Publié: (2024)
par: Yao, Michael S., et autres
Publié: (2024)
Knowledgeable Language Models as Black-Box Optimizers for Personalized Medicine
par: Yao, Michael S., et autres
Publié: (2025)
par: Yao, Michael S., et autres
Publié: (2025)
Causality $\neq$ Decodability, and Vice Versa: Lessons from Interpreting Counting ViTs
par: Huang, Lianghuan, et autres
Publié: (2025)
par: Huang, Lianghuan, et autres
Publié: (2025)
Improving Structural Diversity of Blackbox LLMs via Chain-of-Specification Prompting
par: Young, Halley, et autres
Publié: (2024)
par: Young, Halley, et autres
Publié: (2024)
Alignment of large language models with constrained learning
par: Zhang, Botong, et autres
Publié: (2025)
par: Zhang, Botong, et autres
Publié: (2025)
Monitor and Recover: A Paradigm for Future Research on Distribution Shift in Learning-Enabled Cyber-Physical Systems
par: Lin, Vivian, et autres
Publié: (2025)
par: Lin, Vivian, et autres
Publié: (2025)
Eurekaverse: Environment Curriculum Generation via Large Language Models
par: Liang, William, et autres
Publié: (2024)
par: Liang, William, et autres
Publié: (2024)
A Fast, Reliable, and Secure Programming Language for LLM Agents with Code Actions
par: Mell, Stephen, et autres
Publié: (2025)
par: Mell, Stephen, et autres
Publié: (2025)
Quantifying and Improving Adaptivity in Conformal Prediction through Input Transformations
par: Jang, Sooyong, et autres
Publié: (2025)
par: Jang, Sooyong, et autres
Publié: (2025)
Eureka: Human-Level Reward Design via Coding Large Language Models
par: Ma, Yecheng Jason, et autres
Publié: (2023)
par: Ma, Yecheng Jason, et autres
Publié: (2023)
Making Small Language Models Efficient Reasoners: Intervention, Supervision, Reinforcement
par: Zhang, Xuechen, et autres
Publié: (2025)
par: Zhang, Xuechen, et autres
Publié: (2025)
DrEureka: Language Model Guided Sim-To-Real Transfer
par: Ma, Yecheng Jason, et autres
Publié: (2024)
par: Ma, Yecheng Jason, et autres
Publié: (2024)
MathDSL: A Domain-Specific Language for Concise Mathematical Solutions Via Program Synthesis
par: Anupam, Sagnik, et autres
Publié: (2024)
par: Anupam, Sagnik, et autres
Publié: (2024)
IBCL: Zero-shot Model Generation under Stability-Plasticity Trade-offs
par: Lu, Pengyuan, et autres
Publié: (2023)
par: Lu, Pengyuan, et autres
Publié: (2023)
Pattern-Guided Diffusion Models
par: Lin, Vivian, et autres
Publié: (2025)
par: Lin, Vivian, et autres
Publié: (2025)
Evidence Is All You Need: Ordering Imaging Studies via Language Model Alignment with the ACR Appropriateness Criteria
par: Yao, Michael S., et autres
Publié: (2024)
par: Yao, Michael S., et autres
Publié: (2024)
Documents similaires
-
Effective Reinforcement Learning for Reasoning in Language Models
par: Huang, Lianghuan, et autres
Publié: (2025) -
LLM Program Optimization via Retrieval Augmented Search
par: Anupam, Sagnik, et autres
Publié: (2025) -
Conformal Constrained Policy Optimization for Cost-Effective LLM Agents
par: Si, Wenwen, et autres
Publié: (2025) -
BrowserArena: Evaluating LLM Agents on Real-World Web Navigation Tasks
par: Anupam, Sagnik, et autres
Publié: (2025) -
Uncertainty in Language Models: Assessment through Rank-Calibration
par: Huang, Xinmeng, et autres
Publié: (2024)