Saved in:
| Main Author: | Song, Kevin |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2603.18642 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Oracle-Guided Masked Contrastive Reinforcement Learning for Visuomotor Policies
by: Zhang, Yuhang, et al.
Published: (2025)
by: Zhang, Yuhang, et al.
Published: (2025)
Learning to Play Blackjack: A Curriculum Learning Perspective
by: Alasti, Amirreza, et al.
Published: (2026)
by: Alasti, Amirreza, et al.
Published: (2026)
LFPO: Likelihood-Free Policy Optimization for Masked Diffusion Models
by: Wei, Chenxing, et al.
Published: (2026)
by: Wei, Chenxing, et al.
Published: (2026)
What Exactly Does Guidance Do in Masked Discrete Diffusion Models
by: Ye, He, et al.
Published: (2025)
by: Ye, He, et al.
Published: (2025)
Model-Based Reinforcement Learning with Double Oracle Efficiency in Policy Optimization and Offline Estimation
by: Hu, Haichen, et al.
Published: (2026)
by: Hu, Haichen, et al.
Published: (2026)
Client Selection for Federated Policy Optimization with Environment Heterogeneity
by: Xie, Zhijie, et al.
Published: (2023)
by: Xie, Zhijie, et al.
Published: (2023)
DUEL: Exact Likelihood for Masked Diffusion via Deterministic Unmasking
by: Turok, Gilad, et al.
Published: (2026)
by: Turok, Gilad, et al.
Published: (2026)
OFAL: An Oracle-Free Active Learning Framework
by: Khorsand, Hadi, et al.
Published: (2025)
by: Khorsand, Hadi, et al.
Published: (2025)
Diffusion-State Policy Optimization for Masked Diffusion Language Models
by: Oba, Daisuke, et al.
Published: (2026)
by: Oba, Daisuke, et al.
Published: (2026)
Action-Free Offline-to-Online RL via Discretised State Policies
by: Neggatu, Natinael Solomon, et al.
Published: (2026)
by: Neggatu, Natinael Solomon, et al.
Published: (2026)
Proximal Oracles for Optimization and Sampling
by: Liang, Jiaming, et al.
Published: (2024)
by: Liang, Jiaming, et al.
Published: (2024)
Reinforcing Language Agents via Policy Optimization with Action Decomposition
by: Wen, Muning, et al.
Published: (2024)
by: Wen, Muning, et al.
Published: (2024)
Clipping-Free Policy Optimization for Large Language Models
by: Çağatan, Ömer Veysel, et al.
Published: (2026)
by: Çağatan, Ömer Veysel, et al.
Published: (2026)
Exact Unlearning of Finetuning Data via Model Merging at Scale
by: Kuo, Kevin, et al.
Published: (2025)
by: Kuo, Kevin, et al.
Published: (2025)
Action Robust Reinforcement Learning via Optimal Adversary Aware Policy Optimization
by: Nie, Buqing, et al.
Published: (2025)
by: Nie, Buqing, et al.
Published: (2025)
Off-Policy Evaluation of Slate Bandit Policies via Optimizing Abstraction
by: Kiyohara, Haruka, et al.
Published: (2024)
by: Kiyohara, Haruka, et al.
Published: (2024)
Short-Long Policy Evaluation with Novel Actions
by: Nam, Hyunji Alex, et al.
Published: (2024)
by: Nam, Hyunji Alex, et al.
Published: (2024)
Masked Hard-Attention Transformers Recognize Exactly the Star-Free Languages
by: Yang, Andy, et al.
Published: (2023)
by: Yang, Andy, et al.
Published: (2023)
Value-Free Policy Optimization via Reward Partitioning
by: Faye, Bilal, et al.
Published: (2025)
by: Faye, Bilal, et al.
Published: (2025)
Safe Reinforcement Learning using Action Projection: Safeguard the Policy or the Environment?
by: Markgraf, Hannah, et al.
Published: (2025)
by: Markgraf, Hannah, et al.
Published: (2025)
Improving Reasoning for Diffusion Language Models via Group Diffusion Policy Optimization
by: Rojas, Kevin, et al.
Published: (2025)
by: Rojas, Kevin, et al.
Published: (2025)
FedAVOT: Exact Distribution Alignment in Federated Learning via Masked Optimal Transport
by: Herlock, et al.
Published: (2025)
by: Herlock, et al.
Published: (2025)
Evaluating Blackjack Strategy Models.
by: Mir Ihrar ali
Published: (2025)
by: Mir Ihrar ali
Published: (2025)
UnMaskFork: Test-Time Scaling for Masked Diffusion via Deterministic Action Branching
by: Misaki, Kou, et al.
Published: (2026)
by: Misaki, Kou, et al.
Published: (2026)
Optimal Inference Schedules for Masked Diffusion Models
by: Chen, Sitan, et al.
Published: (2025)
by: Chen, Sitan, et al.
Published: (2025)
Quantile Reward Policy Optimization: Alignment with Pointwise Regression and Exact Partition Functions
by: Matrenok, Simon, et al.
Published: (2025)
by: Matrenok, Simon, et al.
Published: (2025)
Active Policy Improvement from Multiple Black-box Oracles
by: Liu, Xuefeng, et al.
Published: (2023)
by: Liu, Xuefeng, et al.
Published: (2023)
Online Convex Optimization with a Separation Oracle
by: Mhammedi, Zakaria
Published: (2024)
by: Mhammedi, Zakaria
Published: (2024)
Learning Action Embeddings for Off-Policy Evaluation
by: Cief, Matej, et al.
Published: (2023)
by: Cief, Matej, et al.
Published: (2023)
Learning Real-World Action-Video Dynamics with Heterogeneous Masked Autoregression
by: Wang, Lirui, et al.
Published: (2025)
by: Wang, Lirui, et al.
Published: (2025)
Continuum-armed Bandit Optimization with Batch Pairwise Comparison Oracles
by: Chang, Xiangyu, et al.
Published: (2025)
by: Chang, Xiangyu, et al.
Published: (2025)
Real-Time Execution of Action Chunking Flow Policies
by: Black, Kevin, et al.
Published: (2025)
by: Black, Kevin, et al.
Published: (2025)
Co-GRPO: Co-Optimized Group Relative Policy Optimization for Masked Diffusion Model
by: Zhou, Renping, et al.
Published: (2025)
by: Zhou, Renping, et al.
Published: (2025)
Is Oracle Pruning the True Oracle?
by: Feng, Sicheng, et al.
Published: (2024)
by: Feng, Sicheng, et al.
Published: (2024)
Local LMO: Constrained Gradient Optimization via a Local Linear Minimization Oracle
by: Richtárik, Peter, et al.
Published: (2026)
by: Richtárik, Peter, et al.
Published: (2026)
Zeroth-Order Optimization Meets Human Feedback: Provable Learning via Ranking Oracles
by: Tang, Zhiwei, et al.
Published: (2023)
by: Tang, Zhiwei, et al.
Published: (2023)
Imitate Optimal Policy: Prevail and Induce Action Collapse in Policy Gradient
by: Zhou, Zhongzhu, et al.
Published: (2025)
by: Zhou, Zhongzhu, et al.
Published: (2025)
Omni-Masked Gradient Descent: Memory-Efficient Optimization via Mask Traversal with Improved Convergence
by: Yang, Hui, et al.
Published: (2026)
by: Yang, Hui, et al.
Published: (2026)
Training-Free Self-Correction for Multimodal Masked Diffusion Models
by: Ouyang, Yidong, et al.
Published: (2026)
by: Ouyang, Yidong, et al.
Published: (2026)
Learning Interpretable Models Using Uncertainty Oracles
by: Ghose, Abhishek, et al.
Published: (2019)
by: Ghose, Abhishek, et al.
Published: (2019)
Similar Items
-
Oracle-Guided Masked Contrastive Reinforcement Learning for Visuomotor Policies
by: Zhang, Yuhang, et al.
Published: (2025) -
Learning to Play Blackjack: A Curriculum Learning Perspective
by: Alasti, Amirreza, et al.
Published: (2026) -
LFPO: Likelihood-Free Policy Optimization for Masked Diffusion Models
by: Wei, Chenxing, et al.
Published: (2026) -
What Exactly Does Guidance Do in Masked Discrete Diffusion Models
by: Ye, He, et al.
Published: (2025) -
Model-Based Reinforcement Learning with Double Oracle Efficiency in Policy Optimization and Offline Estimation
by: Hu, Haichen, et al.
Published: (2026)