Evaluating Model-Free Policy Optimization in Masked-Action Environments via an Exact Blackjack Oracle
Fuente:
arXiv
Guardado en:
| Autor principal: | Song, Kevin |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Oracle-Guided Masked Contrastive Reinforcement Learning for Visuomotor Policies
por: Zhang, Yuhang, et al.
Publicado: (2025)
por: Zhang, Yuhang, et al.
Publicado: (2025)
LFPO: Likelihood-Free Policy Optimization for Masked Diffusion Models
por: Wei, Chenxing, et al.
Publicado: (2026)
por: Wei, Chenxing, et al.
Publicado: (2026)
Learning to Play Blackjack: A Curriculum Learning Perspective
por: Alasti, Amirreza, et al.
Publicado: (2026)
por: Alasti, Amirreza, et al.
Publicado: (2026)
What Exactly Does Guidance Do in Masked Discrete Diffusion Models
por: Ye, He, et al.
Publicado: (2025)
por: Ye, He, et al.
Publicado: (2025)
Model-Based Reinforcement Learning with Double Oracle Efficiency in Policy Optimization and Offline Estimation
por: Hu, Haichen, et al.
Publicado: (2026)
por: Hu, Haichen, et al.
Publicado: (2026)
Client Selection for Federated Policy Optimization with Environment Heterogeneity
por: Xie, Zhijie, et al.
Publicado: (2023)
por: Xie, Zhijie, et al.
Publicado: (2023)
DUEL: Exact Likelihood for Masked Diffusion via Deterministic Unmasking
por: Turok, Gilad, et al.
Publicado: (2026)
por: Turok, Gilad, et al.
Publicado: (2026)
OFAL: An Oracle-Free Active Learning Framework
por: Khorsand, Hadi, et al.
Publicado: (2025)
por: Khorsand, Hadi, et al.
Publicado: (2025)
Diffusion-State Policy Optimization for Masked Diffusion Language Models
por: Oba, Daisuke, et al.
Publicado: (2026)
por: Oba, Daisuke, et al.
Publicado: (2026)
Action-Free Offline-to-Online RL via Discretised State Policies
por: Neggatu, Natinael Solomon, et al.
Publicado: (2026)
por: Neggatu, Natinael Solomon, et al.
Publicado: (2026)
Clipping-Free Policy Optimization for Large Language Models
por: Çağatan, Ömer Veysel, et al.
Publicado: (2026)
por: Çağatan, Ömer Veysel, et al.
Publicado: (2026)
Proximal Oracles for Optimization and Sampling
por: Liang, Jiaming, et al.
Publicado: (2024)
por: Liang, Jiaming, et al.
Publicado: (2024)
Action Robust Reinforcement Learning via Optimal Adversary Aware Policy Optimization
por: Nie, Buqing, et al.
Publicado: (2025)
por: Nie, Buqing, et al.
Publicado: (2025)
Exact Unlearning of Finetuning Data via Model Merging at Scale
por: Kuo, Kevin, et al.
Publicado: (2025)
por: Kuo, Kevin, et al.
Publicado: (2025)
Off-Policy Evaluation of Slate Bandit Policies via Optimizing Abstraction
por: Kiyohara, Haruka, et al.
Publicado: (2024)
por: Kiyohara, Haruka, et al.
Publicado: (2024)
Reinforcing Language Agents via Policy Optimization with Action Decomposition
por: Wen, Muning, et al.
Publicado: (2024)
por: Wen, Muning, et al.
Publicado: (2024)
Short-Long Policy Evaluation with Novel Actions
por: Nam, Hyunji Alex, et al.
Publicado: (2024)
por: Nam, Hyunji Alex, et al.
Publicado: (2024)
Safe Reinforcement Learning using Action Projection: Safeguard the Policy or the Environment?
por: Markgraf, Hannah, et al.
Publicado: (2025)
por: Markgraf, Hannah, et al.
Publicado: (2025)
FedAVOT: Exact Distribution Alignment in Federated Learning via Masked Optimal Transport
por: Herlock, et al.
Publicado: (2025)
por: Herlock, et al.
Publicado: (2025)
Value-Free Policy Optimization via Reward Partitioning
por: Faye, Bilal, et al.
Publicado: (2025)
por: Faye, Bilal, et al.
Publicado: (2025)
Improving Reasoning for Diffusion Language Models via Group Diffusion Policy Optimization
por: Rojas, Kevin, et al.
Publicado: (2025)
por: Rojas, Kevin, et al.
Publicado: (2025)
Quantile Reward Policy Optimization: Alignment with Pointwise Regression and Exact Partition Functions
por: Matrenok, Simon, et al.
Publicado: (2025)
por: Matrenok, Simon, et al.
Publicado: (2025)
Masked Hard-Attention Transformers Recognize Exactly the Star-Free Languages
por: Yang, Andy, et al.
Publicado: (2023)
por: Yang, Andy, et al.
Publicado: (2023)
Optimal Inference Schedules for Masked Diffusion Models
por: Chen, Sitan, et al.
Publicado: (2025)
por: Chen, Sitan, et al.
Publicado: (2025)
UnMaskFork: Test-Time Scaling for Masked Diffusion via Deterministic Action Branching
por: Misaki, Kou, et al.
Publicado: (2026)
por: Misaki, Kou, et al.
Publicado: (2026)
Continuum-armed Bandit Optimization with Batch Pairwise Comparison Oracles
por: Chang, Xiangyu, et al.
Publicado: (2025)
por: Chang, Xiangyu, et al.
Publicado: (2025)
Active Policy Improvement from Multiple Black-box Oracles
por: Liu, Xuefeng, et al.
Publicado: (2023)
por: Liu, Xuefeng, et al.
Publicado: (2023)
Online Convex Optimization with a Separation Oracle
por: Mhammedi, Zakaria
Publicado: (2024)
por: Mhammedi, Zakaria
Publicado: (2024)
Learning Action Embeddings for Off-Policy Evaluation
por: Cief, Matej, et al.
Publicado: (2023)
por: Cief, Matej, et al.
Publicado: (2023)
Training-Free Self-Correction for Multimodal Masked Diffusion Models
por: Ouyang, Yidong, et al.
Publicado: (2026)
por: Ouyang, Yidong, et al.
Publicado: (2026)
Omni-Masked Gradient Descent: Memory-Efficient Optimization via Mask Traversal with Improved Convergence
por: Yang, Hui, et al.
Publicado: (2026)
por: Yang, Hui, et al.
Publicado: (2026)
Evaluating Blackjack Strategy Models.
por: Mir Ihrar ali
Publicado: (2025)
por: Mir Ihrar ali
Publicado: (2025)
Graph Generative Models Evaluation with Masked Autoencoder
por: Wang, Chengen, et al.
Publicado: (2025)
por: Wang, Chengen, et al.
Publicado: (2025)
Beyond Masked and Unmasked: Discrete Diffusion Models via Partial Masking
por: Chao, Chen-Hao, et al.
Publicado: (2025)
por: Chao, Chen-Hao, et al.
Publicado: (2025)
Learning Interpretable Models Using Uncertainty Oracles
por: Ghose, Abhishek, et al.
Publicado: (2019)
por: Ghose, Abhishek, et al.
Publicado: (2019)
Local LMO: Constrained Gradient Optimization via a Local Linear Minimization Oracle
por: Richtárik, Peter, et al.
Publicado: (2026)
por: Richtárik, Peter, et al.
Publicado: (2026)
Zeroth-Order Optimization Meets Human Feedback: Provable Learning via Ranking Oracles
por: Tang, Zhiwei, et al.
Publicado: (2023)
por: Tang, Zhiwei, et al.
Publicado: (2023)
Imitate Optimal Policy: Prevail and Induce Action Collapse in Policy Gradient
por: Zhou, Zhongzhu, et al.
Publicado: (2025)
por: Zhou, Zhongzhu, et al.
Publicado: (2025)
Context-Action Embedding Learning for Off-Policy Evaluation in Contextual Bandits
por: Chandak, Kushagra, et al.
Publicado: (2025)
por: Chandak, Kushagra, et al.
Publicado: (2025)
Learning Real-World Action-Video Dynamics with Heterogeneous Masked Autoregression
por: Wang, Lirui, et al.
Publicado: (2025)
por: Wang, Lirui, et al.
Publicado: (2025)
Ejemplares similares
-
Oracle-Guided Masked Contrastive Reinforcement Learning for Visuomotor Policies
por: Zhang, Yuhang, et al.
Publicado: (2025) -
LFPO: Likelihood-Free Policy Optimization for Masked Diffusion Models
por: Wei, Chenxing, et al.
Publicado: (2026) -
Learning to Play Blackjack: A Curriculum Learning Perspective
por: Alasti, Amirreza, et al.
Publicado: (2026) -
What Exactly Does Guidance Do in Masked Discrete Diffusion Models
por: Ye, He, et al.
Publicado: (2025) -
Model-Based Reinforcement Learning with Double Oracle Efficiency in Policy Optimization and Offline Estimation
por: Hu, Haichen, et al.
Publicado: (2026)