Zero-Shot Off-Policy Learning
Fuente:
arXiv
Salvato in:
| Autori principali: | Asadulaev, Arip, Bobrin, Maksim, Lahlou, Salem, Dylov, Dmitry, Karray, Fakhri, Takac, Martin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Latent Reasoning in TRMs is Secretly a Policy Improvement Operator
di: Asadulaev, Arip, et al.
Pubblicazione: (2025)
di: Asadulaev, Arip, et al.
Pubblicazione: (2025)
Expert or not? assessing data quality in offline reinforcement learning
di: Asadulaev, Arip, et al.
Pubblicazione: (2025)
di: Asadulaev, Arip, et al.
Pubblicazione: (2025)
Y-Shaped Generative Flows
di: Asadulaev, Arip, et al.
Pubblicazione: (2025)
di: Asadulaev, Arip, et al.
Pubblicazione: (2025)
Convex Compositional Reasoning Models
di: Roketlishvili, Meir, et al.
Pubblicazione: (2026)
di: Roketlishvili, Meir, et al.
Pubblicazione: (2026)
ENOT: Expectile Regularization for Fast and Accurate Training of Neural Optimal Transport
di: Buzun, Nazar, et al.
Pubblicazione: (2024)
di: Buzun, Nazar, et al.
Pubblicazione: (2024)
Align Your Intents: Offline Imitation Learning via Optimal Transport
di: Bobrin, Maksim, et al.
Pubblicazione: (2024)
di: Bobrin, Maksim, et al.
Pubblicazione: (2024)
Zero-Shot Adaptation of Behavioral Foundation Models to Unseen Dynamics
di: Bobrin, Maksim, et al.
Pubblicazione: (2025)
di: Bobrin, Maksim, et al.
Pubblicazione: (2025)
Zero-shot adaptation to order book dynamics
di: Asadulaev, Arip
Pubblicazione: (2026)
di: Asadulaev, Arip
Pubblicazione: (2026)
HOTA: Hamiltonian framework for Optimal Transport Advection
di: Buzun, Nazar, et al.
Pubblicazione: (2025)
di: Buzun, Nazar, et al.
Pubblicazione: (2025)
Enhance Hyperbolic Representation Learning via Second-order Pooling
di: Song, Kun, et al.
Pubblicazione: (2024)
di: Song, Kun, et al.
Pubblicazione: (2024)
Inverse Entropic Optimal Transport Solves Semi-supervised Learning via Data Likelihood Maximization
di: Persiianov, Mikhail, et al.
Pubblicazione: (2024)
di: Persiianov, Mikhail, et al.
Pubblicazione: (2024)
Plan, Don't Pose: Long Composite Motion Generation with Text-Aligned BFM
di: Shvetsov, Nikolay, et al.
Pubblicazione: (2026)
di: Shvetsov, Nikolay, et al.
Pubblicazione: (2026)
SVRPBench: A Realistic Benchmark for Stochastic Vehicle Routing Problem
di: Heakl, Ahmed, et al.
Pubblicazione: (2025)
di: Heakl, Ahmed, et al.
Pubblicazione: (2025)
On the Privacy Risks of Spiking Neural Networks: A Membership Inference Analysis
di: Guan, Junyi, et al.
Pubblicazione: (2025)
di: Guan, Junyi, et al.
Pubblicazione: (2025)
Vision Language Models for Dynamic Human Activity Recognition in Healthcare Settings
di: Abid, Abderrazek, et al.
Pubblicazione: (2025)
di: Abid, Abderrazek, et al.
Pubblicazione: (2025)
Improved Exploration in GFlownets via Enhanced Epistemic Neural Networks
di: Muhammad, Sajan, et al.
Pubblicazione: (2025)
di: Muhammad, Sajan, et al.
Pubblicazione: (2025)
Noise-corrected GRPO: From Noisy Rewards to Unbiased Gradients
di: Mansouri, Omar El, et al.
Pubblicazione: (2025)
di: Mansouri, Omar El, et al.
Pubblicazione: (2025)
On Zero-Shot Reinforcement Learning
di: Jeen, Scott
Pubblicazione: (2025)
di: Jeen, Scott
Pubblicazione: (2025)
CORE: Collaborative Reasoning via Cross Teaching
di: Mishra, Kshitij, et al.
Pubblicazione: (2026)
di: Mishra, Kshitij, et al.
Pubblicazione: (2026)
REMONI: An Autonomous System Integrating Wearables and Multimodal Large Language Models for Enhanced Remote Health Monitoring
di: Ho, Thanh Cong, et al.
Pubblicazione: (2025)
di: Ho, Thanh Cong, et al.
Pubblicazione: (2025)
GFlowNet Foundations
di: Bengio, Yoshua, et al.
Pubblicazione: (2021)
di: Bengio, Yoshua, et al.
Pubblicazione: (2021)
Zero-Shot Robustification of Zero-Shot Models
di: Adila, Dyah, et al.
Pubblicazione: (2023)
di: Adila, Dyah, et al.
Pubblicazione: (2023)
Light Unbalanced Optimal Transport
di: Gazdieva, Milena, et al.
Pubblicazione: (2023)
di: Gazdieva, Milena, et al.
Pubblicazione: (2023)
SafeAdapt: Provably Safe Policy Updates in Deep Reinforcement Learning
di: Anisimov, Maksim, et al.
Pubblicazione: (2026)
di: Anisimov, Maksim, et al.
Pubblicazione: (2026)
Learning Action Embeddings for Off-Policy Evaluation
di: Cief, Matej, et al.
Pubblicazione: (2023)
di: Cief, Matej, et al.
Pubblicazione: (2023)
Towards Off-Policy Reinforcement Learning for Ranking Policies with Human Feedback
di: Xiao, Teng, et al.
Pubblicazione: (2024)
di: Xiao, Teng, et al.
Pubblicazione: (2024)
FusionEnsemble-Net: An Attention-Based Ensemble of Spatiotemporal Networks for Multimodal Sign Language Recognition
di: Islam, Md. Milon, et al.
Pubblicazione: (2025)
di: Islam, Md. Milon, et al.
Pubblicazione: (2025)
Policy Learning for Off-Dynamics RL with Deficient Support
di: Van, Linh Le Pham, et al.
Pubblicazione: (2024)
di: Van, Linh Le Pham, et al.
Pubblicazione: (2024)
Soft Sequence Policy Optimization
di: Glazyrina, Svetlana, et al.
Pubblicazione: (2026)
di: Glazyrina, Svetlana, et al.
Pubblicazione: (2026)
Kernel Metric Learning for In-Sample Off-Policy Evaluation of Deterministic RL Policies
di: Lee, Haanvid, et al.
Pubblicazione: (2024)
di: Lee, Haanvid, et al.
Pubblicazione: (2024)
Off-OAB: Off-Policy Policy Gradient Method with Optimal Action-Dependent Baseline
di: Meng, Wenjia, et al.
Pubblicazione: (2024)
di: Meng, Wenjia, et al.
Pubblicazione: (2024)
Low-Rank Adaptation for Critic Learning in Off-Policy Reinforcement Learning
di: Zhuang, Yuan, et al.
Pubblicazione: (2026)
di: Zhuang, Yuan, et al.
Pubblicazione: (2026)
Zero-Shot Reinforcement Learning via Function Encoders
di: Ingebrand, Tyler, et al.
Pubblicazione: (2024)
di: Ingebrand, Tyler, et al.
Pubblicazione: (2024)
Semantic-Inductive Attribute Selection for Zero-Shot Learning
di: Herrera-Aranda, Juan Jose, et al.
Pubblicazione: (2025)
di: Herrera-Aranda, Juan Jose, et al.
Pubblicazione: (2025)
Provable Zero-Shot Generalization in Offline Reinforcement Learning
di: Wang, Zhiyong, et al.
Pubblicazione: (2025)
di: Wang, Zhiyong, et al.
Pubblicazione: (2025)
Zero-Shot Reinforcement Learning Under Partial Observability
di: Jeen, Scott, et al.
Pubblicazione: (2025)
di: Jeen, Scott, et al.
Pubblicazione: (2025)
Mitigating Societal Cognitive Overload in the Age of AI: Challenges and Directions
di: Lahlou, Salem
Pubblicazione: (2025)
di: Lahlou, Salem
Pubblicazione: (2025)
Effective Off-Policy Evaluation and Learning in Contextual Combinatorial Bandits
di: Shimizu, Tatsuhiro, et al.
Pubblicazione: (2024)
di: Shimizu, Tatsuhiro, et al.
Pubblicazione: (2024)
Off-Policy Evaluation and Learning for the Future under Non-Stationarity
di: Shimizu, Tatsuhiro, et al.
Pubblicazione: (2025)
di: Shimizu, Tatsuhiro, et al.
Pubblicazione: (2025)
Bayesian Off-Policy Evaluation and Learning for Large Action Spaces
di: Aouali, Imad, et al.
Pubblicazione: (2024)
di: Aouali, Imad, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Latent Reasoning in TRMs is Secretly a Policy Improvement Operator
di: Asadulaev, Arip, et al.
Pubblicazione: (2025) -
Expert or not? assessing data quality in offline reinforcement learning
di: Asadulaev, Arip, et al.
Pubblicazione: (2025) -
Y-Shaped Generative Flows
di: Asadulaev, Arip, et al.
Pubblicazione: (2025) -
Convex Compositional Reasoning Models
di: Roketlishvili, Meir, et al.
Pubblicazione: (2026) -
ENOT: Expectile Regularization for Fast and Accurate Training of Neural Optimal Transport
di: Buzun, Nazar, et al.
Pubblicazione: (2024)