Salvato in:
| Autori principali: | Khosravi, Hamed, Huo, Xiaoming |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2605.20270 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Catching a Moving Subspace: Low-Rank Bandits Beyond Stationarity
di: Khosravi, Hamed, et al.
Pubblicazione: (2026)
di: Khosravi, Hamed, et al.
Pubblicazione: (2026)
Selective Conformal Risk Control
di: Xu, Yunpeng, et al.
Pubblicazione: (2025)
di: Xu, Yunpeng, et al.
Pubblicazione: (2025)
Anytime-Valid Conformal Risk Control
di: Hultberg, Bror, et al.
Pubblicazione: (2026)
di: Hultberg, Bror, et al.
Pubblicazione: (2026)
Towards Anytime-Valid Statistical Watermarking
di: Huang, Baihe, et al.
Pubblicazione: (2026)
di: Huang, Baihe, et al.
Pubblicazione: (2026)
LLMs Uncertainty Quantification via Adaptive Conformal Semantic Entropy
di: Karimi, Hamed, et al.
Pubblicazione: (2026)
di: Karimi, Hamed, et al.
Pubblicazione: (2026)
Spurious Rewards: Rethinking Training Signals in RLVR
di: Shao, Rulin, et al.
Pubblicazione: (2025)
di: Shao, Rulin, et al.
Pubblicazione: (2025)
RLVR-World: Training World Models with Reinforcement Learning
di: Wu, Jialong, et al.
Pubblicazione: (2025)
di: Wu, Jialong, et al.
Pubblicazione: (2025)
Local Coherence or Global Validity? Investigating RLVR Traces in Math Domains
di: Samineni, Soumya Rani, et al.
Pubblicazione: (2025)
di: Samineni, Soumya Rani, et al.
Pubblicazione: (2025)
LLMs Gaming Verifiers: RLVR can Lead to Reward Hacking
di: Helff, Lukas, et al.
Pubblicazione: (2026)
di: Helff, Lukas, et al.
Pubblicazione: (2026)
Anytime Training with Schedule-Free Spectral Optimization
di: Apte, Anuj, et al.
Pubblicazione: (2026)
di: Apte, Anuj, et al.
Pubblicazione: (2026)
Beyond Uniform Credit Assignment: Selective Eligibility Traces for RLVR
di: Mou, Chaoli, et al.
Pubblicazione: (2026)
di: Mou, Chaoli, et al.
Pubblicazione: (2026)
Decision Theoretic Foundations for Conformal Prediction: Optimal Uncertainty Quantification for Risk-Averse Agents
di: Kiyani, Shayan, et al.
Pubblicazione: (2025)
di: Kiyani, Shayan, et al.
Pubblicazione: (2025)
The Path Not Taken: RLVR Provably Learns Off the Principals
di: Zhu, Hanqing, et al.
Pubblicazione: (2025)
di: Zhu, Hanqing, et al.
Pubblicazione: (2025)
Anytime-Valid Answer Sufficiency Certificates for LLM Generation via Sequential Information Lift
di: Akter, Sanjeda, et al.
Pubblicazione: (2025)
di: Akter, Sanjeda, et al.
Pubblicazione: (2025)
Part II: ROLL Flash -- Accelerating RLVR and Agentic Training with Asynchrony
di: Lu, Han, et al.
Pubblicazione: (2025)
di: Lu, Han, et al.
Pubblicazione: (2025)
Automatically Adaptive Conformal Risk Control
di: Blot, Vincent, et al.
Pubblicazione: (2024)
di: Blot, Vincent, et al.
Pubblicazione: (2024)
SAGE: Shaping Anchors for Guided Exploration in RLVR of LLMs
di: Lee, Chanuk, et al.
Pubblicazione: (2026)
di: Lee, Chanuk, et al.
Pubblicazione: (2026)
Valid Selection among Conformal Sets
di: Hegazy, Mahmoud, et al.
Pubblicazione: (2025)
di: Hegazy, Mahmoud, et al.
Pubblicazione: (2025)
Controllable Exploration in Hybrid-Policy RLVR for Multi-Modal Reasoning
di: Huang, Zhuoxu, et al.
Pubblicazione: (2026)
di: Huang, Zhuoxu, et al.
Pubblicazione: (2026)
CITE: Anytime-Valid Statistical Inference in LLM Self-Consistency
di: Ota, Hirofumi, et al.
Pubblicazione: (2026)
di: Ota, Hirofumi, et al.
Pubblicazione: (2026)
Conformal Prediction with Learned Features
di: Kiyani, Shayan, et al.
Pubblicazione: (2024)
di: Kiyani, Shayan, et al.
Pubblicazione: (2024)
Conformal Risk Control
di: Angelopoulos, Anastasios N., et al.
Pubblicazione: (2022)
di: Angelopoulos, Anastasios N., et al.
Pubblicazione: (2022)
Binary Gaussian Copula Synthesis: A Novel Data Augmentation Technique to Advance ML-based Clinical Decision Support Systems for Early Prediction of Dialysis Among CKD Patients
di: Khosravi, Hamed, et al.
Pubblicazione: (2024)
di: Khosravi, Hamed, et al.
Pubblicazione: (2024)
Open-Medical-R1: How to Choose Data for RLVR Training at Medicine Domain
di: Qiu, Zhongxi, et al.
Pubblicazione: (2025)
di: Qiu, Zhongxi, et al.
Pubblicazione: (2025)
IRDS: Interpretable RLVR Data Selection via Verifier-Coupled Sparse Autoencoder Coverage
di: Li, Yuhan, et al.
Pubblicazione: (2026)
di: Li, Yuhan, et al.
Pubblicazione: (2026)
Length Optimization in Conformal Prediction
di: Kiyani, Shayan, et al.
Pubblicazione: (2024)
di: Kiyani, Shayan, et al.
Pubblicazione: (2024)
RL in the Wild: Characterizing RLVR Training in LLM Deployment
di: Zhou, Jiecheng, et al.
Pubblicazione: (2025)
di: Zhou, Jiecheng, et al.
Pubblicazione: (2025)
Conformal Thinking: Risk Control for Reasoning on a Compute Budget
di: Wang, Xi, et al.
Pubblicazione: (2026)
di: Wang, Xi, et al.
Pubblicazione: (2026)
Flexible Entropy Control in RLVR with a Gradient-Preserving Perspective
di: Chen, Kun, et al.
Pubblicazione: (2026)
di: Chen, Kun, et al.
Pubblicazione: (2026)
LNUCB-TA: Linear-nonlinear Hybrid Bandit Learning with Temporal Attention
di: Khosravi, Hamed, et al.
Pubblicazione: (2025)
di: Khosravi, Hamed, et al.
Pubblicazione: (2025)
Quantifying Empirical Compute-Supervision Tradeoffs in RLVR
di: Mitsuhashi, Ryo, et al.
Pubblicazione: (2026)
di: Mitsuhashi, Ryo, et al.
Pubblicazione: (2026)
VL Norm: Rethink Loss Aggregation in RLVR
di: He, Zhiyuan, et al.
Pubblicazione: (2025)
di: He, Zhiyuan, et al.
Pubblicazione: (2025)
Conditional Factuality Controlled LLMs with Generalization Certificates via Conformal Sampling
di: Ye, Kai, et al.
Pubblicazione: (2026)
di: Ye, Kai, et al.
Pubblicazione: (2026)
Efficiently Deploying LLMs with Controlled Risk
di: Zellinger, Michael J., et al.
Pubblicazione: (2024)
di: Zellinger, Michael J., et al.
Pubblicazione: (2024)
CORA: Conformal Risk-Controlled Agents for Safeguarded Mobile GUI Automation
di: Feng, Yushi, et al.
Pubblicazione: (2026)
di: Feng, Yushi, et al.
Pubblicazione: (2026)
Anytime Optimal Decision Tree Learning with Continuous Features
di: Kiossou, Harold, et al.
Pubblicazione: (2026)
di: Kiossou, Harold, et al.
Pubblicazione: (2026)
Anytime Sequential Halving in Monte-Carlo Tree Search
di: Sagers, Dominic, et al.
Pubblicazione: (2024)
di: Sagers, Dominic, et al.
Pubblicazione: (2024)
An Optimistic Algorithm for online CMDPS with Anytime Adversarial Constraints
di: Zhu, Jiahui, et al.
Pubblicazione: (2025)
di: Zhu, Jiahui, et al.
Pubblicazione: (2025)
On the Direction of RLVR Updates for LLM Reasoning: Identification and Exploitation
di: Huang, Kexin, et al.
Pubblicazione: (2026)
di: Huang, Kexin, et al.
Pubblicazione: (2026)
On the Implicit Reward Overfitting and the Low-rank Dynamics in RLVR
di: Ye, Hao, et al.
Pubblicazione: (2026)
di: Ye, Hao, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Catching a Moving Subspace: Low-Rank Bandits Beyond Stationarity
di: Khosravi, Hamed, et al.
Pubblicazione: (2026) -
Selective Conformal Risk Control
di: Xu, Yunpeng, et al.
Pubblicazione: (2025) -
Anytime-Valid Conformal Risk Control
di: Hultberg, Bror, et al.
Pubblicazione: (2026) -
Towards Anytime-Valid Statistical Watermarking
di: Huang, Baihe, et al.
Pubblicazione: (2026) -
LLMs Uncertainty Quantification via Adaptive Conformal Semantic Entropy
di: Karimi, Hamed, et al.
Pubblicazione: (2026)