Learning in complex action spaces without policy gradients
Fuente:
arXiv
Salvato in:
| Autori principali: | Tavakoli, Arash, Ghiassian, Sina, Rakićević, Nemanja |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
In-context Exploration-Exploitation for Reinforcement Learning
di: Dai, Zhenwen, et al.
Pubblicazione: (2024)
di: Dai, Zhenwen, et al.
Pubblicazione: (2024)
Soft Preference Optimization: Aligning Language Models to Expert Distributions
di: Sharifnassab, Arsalan, et al.
Pubblicazione: (2024)
di: Sharifnassab, Arsalan, et al.
Pubblicazione: (2024)
Auxiliary task discovery through generate-and-test
di: Rafiee, Banafsheh, et al.
Pubblicazione: (2022)
di: Rafiee, Banafsheh, et al.
Pubblicazione: (2022)
Convergence and sample complexity of natural policy gradient primal-dual methods for constrained MDPs
di: Ding, Dongsheng, et al.
Pubblicazione: (2022)
di: Ding, Dongsheng, et al.
Pubblicazione: (2022)
Generalizing soft actor-critic algorithms to discrete action spaces
di: Zhang, Le, et al.
Pubblicazione: (2024)
di: Zhang, Le, et al.
Pubblicazione: (2024)
Combining LLM decision and RL action selection to improve RL policy for adaptive interventions
di: Karine, Karine, et al.
Pubblicazione: (2025)
di: Karine, Karine, et al.
Pubblicazione: (2025)
Active Inference and Reinforcement Learning: A unified inference on continuous state and action spaces under partial observability
di: Malekzadeh, Parvin, et al.
Pubblicazione: (2022)
di: Malekzadeh, Parvin, et al.
Pubblicazione: (2022)
Hallucination Detection on a Budget: Efficient Bayesian Estimation of Semantic Entropy
di: Ciosek, Kamil, et al.
Pubblicazione: (2025)
di: Ciosek, Kamil, et al.
Pubblicazione: (2025)
Boosting Hierarchical Reinforcement Learning with Meta-Learning for Complex Task Adaptation
di: Khajooeinejad, Arash, et al.
Pubblicazione: (2024)
di: Khajooeinejad, Arash, et al.
Pubblicazione: (2024)
Decoding Funded Research: Comparative Analysis of Topic Models and Uncovering the Effect of Gender and Geographic Location
di: Kafiabad, Shirin Tavakoli, et al.
Pubblicazione: (2025)
di: Kafiabad, Shirin Tavakoli, et al.
Pubblicazione: (2025)
Finding Optimal Trading History in Reinforcement Learning for Stock Market Trading
di: Montazeri, Sina, et al.
Pubblicazione: (2025)
di: Montazeri, Sina, et al.
Pubblicazione: (2025)
Large Language Models for Sequential Decision-Making: Improving In-Context Learning via Supervised Fine-Tuning
di: Zhang, Minmin, et al.
Pubblicazione: (2026)
di: Zhang, Minmin, et al.
Pubblicazione: (2026)
Learning to Act without Actions
di: Schmidt, Dominik, et al.
Pubblicazione: (2023)
di: Schmidt, Dominik, et al.
Pubblicazione: (2023)
Exploiting Expertise of Non-Expert and Diverse Agents in Social Bandit Learning: A Free Energy Approach
di: Mirzaei, Erfan, et al.
Pubblicazione: (2026)
di: Mirzaei, Erfan, et al.
Pubblicazione: (2026)
Learning with Conflicts of Interest
di: Aryal, Nischal, et al.
Pubblicazione: (2026)
di: Aryal, Nischal, et al.
Pubblicazione: (2026)
Deep deterministic policy gradient with symmetric data augmentation for lateral attitude tracking control of a fixed-wing aircraft
di: Li, Yifei, et al.
Pubblicazione: (2024)
di: Li, Yifei, et al.
Pubblicazione: (2024)
Edge-DIRECT: A Deep Reinforcement Learning-based Method for Solving Heterogeneous Electric Vehicle Routing Problem with Time Window Constraints
di: Mozhdehi, Arash, et al.
Pubblicazione: (2024)
di: Mozhdehi, Arash, et al.
Pubblicazione: (2024)
Softmax gradient policy for variance minimization and risk-averse multi armed bandits
di: Turinici, Gabriel
Pubblicazione: (2026)
di: Turinici, Gabriel
Pubblicazione: (2026)
Bilevel reinforcement learning via the development of hyper-gradient without lower-level convexity
di: Yang, Yan, et al.
Pubblicazione: (2024)
di: Yang, Yan, et al.
Pubblicazione: (2024)
Using the Path of Least Resistance to Explain Deep Networks
di: Salek, Sina, et al.
Pubblicazione: (2025)
di: Salek, Sina, et al.
Pubblicazione: (2025)
Streaming Flow Policy: Simplifying diffusion/flow-matching policies by treating action trajectories as flow trajectories
di: Jiang, Sunshine, et al.
Pubblicazione: (2025)
di: Jiang, Sunshine, et al.
Pubblicazione: (2025)
Learning with Logical Constraints but without Shortcut Satisfaction
di: Li, Zenan, et al.
Pubblicazione: (2024)
di: Li, Zenan, et al.
Pubblicazione: (2024)
Safe-Support Q-Learning: Learning without Unsafe Exploration
di: Lim, Yeeun, et al.
Pubblicazione: (2026)
di: Lim, Yeeun, et al.
Pubblicazione: (2026)
SED2AM: Solving Multi-Trip Time-Dependent Vehicle Routing Problem using Deep Reinforcement Learning
di: Mozhdehi, Arash, et al.
Pubblicazione: (2025)
di: Mozhdehi, Arash, et al.
Pubblicazione: (2025)
Contrastive Preference Learning: Learning from Human Feedback without RL
di: Hejna, Joey, et al.
Pubblicazione: (2023)
di: Hejna, Joey, et al.
Pubblicazione: (2023)
Class-Imbalanced Graph Learning without Class Rebalancing
di: Liu, Zhining, et al.
Pubblicazione: (2023)
di: Liu, Zhining, et al.
Pubblicazione: (2023)
Learning Relational Tabular Data without Shared Features
di: Wu, Zhaomin, et al.
Pubblicazione: (2025)
di: Wu, Zhaomin, et al.
Pubblicazione: (2025)
Learning Over Dirty Data with Minimal Repairs
di: Zhen, Cheng, et al.
Pubblicazione: (2025)
di: Zhen, Cheng, et al.
Pubblicazione: (2025)
Augmenting the action space with conventions to improve multi-agent cooperation in Hanabi
di: Bredell, F., et al.
Pubblicazione: (2024)
di: Bredell, F., et al.
Pubblicazione: (2024)
RL-GPT: Integrating Reinforcement Learning and Code-as-policy
di: Liu, Shaoteng, et al.
Pubblicazione: (2024)
di: Liu, Shaoteng, et al.
Pubblicazione: (2024)
Learning without Global Backpropagation via Synergistic Information Distillation
di: Ye, Chenhao, et al.
Pubblicazione: (2025)
di: Ye, Chenhao, et al.
Pubblicazione: (2025)
Online Reinforcement Learning in Non-Stationary Context-Driven Environments
di: Hamadanian, Pouya, et al.
Pubblicazione: (2023)
di: Hamadanian, Pouya, et al.
Pubblicazione: (2023)
Graph Neural Thompson Sampling
di: Wu, Shuang, et al.
Pubblicazione: (2024)
di: Wu, Shuang, et al.
Pubblicazione: (2024)
Vertex-Softmax: Tight Transformer Verification via Exact Softmax Optimization
di: Rezazadeh, Navid, et al.
Pubblicazione: (2026)
di: Rezazadeh, Navid, et al.
Pubblicazione: (2026)
SimMerge: Learning to Select Merge Operators from Similarity Signals
di: Bolton, Oliver, et al.
Pubblicazione: (2026)
di: Bolton, Oliver, et al.
Pubblicazione: (2026)
State-space models can learn in-context by gradient descent
di: Sushma, Neeraj Mohan, et al.
Pubblicazione: (2024)
di: Sushma, Neeraj Mohan, et al.
Pubblicazione: (2024)
Complex behavior from intrinsic motivation to occupy action-state path space
di: Ramírez-Ruiz, Jorge, et al.
Pubblicazione: (2022)
di: Ramírez-Ruiz, Jorge, et al.
Pubblicazione: (2022)
Residual Q-Learning: Offline and Online Policy Customization without Value
di: Li, Chenran, et al.
Pubblicazione: (2023)
di: Li, Chenran, et al.
Pubblicazione: (2023)
Learning from the Undesirable: Robust Adaptation of Language Models without Forgetting
di: Nam, Yunhun, et al.
Pubblicazione: (2025)
di: Nam, Yunhun, et al.
Pubblicazione: (2025)
Automatic generation of insights from workers' actions in industrial workflows with explainable Machine Learning
di: de Arriba-Pérez, Francisco, et al.
Pubblicazione: (2024)
di: de Arriba-Pérez, Francisco, et al.
Pubblicazione: (2024)
Documenti analoghi
-
In-context Exploration-Exploitation for Reinforcement Learning
di: Dai, Zhenwen, et al.
Pubblicazione: (2024) -
Soft Preference Optimization: Aligning Language Models to Expert Distributions
di: Sharifnassab, Arsalan, et al.
Pubblicazione: (2024) -
Auxiliary task discovery through generate-and-test
di: Rafiee, Banafsheh, et al.
Pubblicazione: (2022) -
Convergence and sample complexity of natural policy gradient primal-dual methods for constrained MDPs
di: Ding, Dongsheng, et al.
Pubblicazione: (2022) -
Generalizing soft actor-critic algorithms to discrete action spaces
di: Zhang, Le, et al.
Pubblicazione: (2024)