EVAL: EigenVector-based Average-reward Learning
Fuente:
arXiv
Guardado en:
| Autores principales: | Adamczyk, Jacob, Makarenko, Volodymyr, Tiomkin, Stas, Kulkarni, Rahul V. |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Average-Reward Soft Actor-Critic
por: Adamczyk, Jacob, et al.
Publicado: (2025)
por: Adamczyk, Jacob, et al.
Publicado: (2025)
Boosting Soft Q-Learning by Bounding
por: Adamczyk, Jacob, et al.
Publicado: (2024)
por: Adamczyk, Jacob, et al.
Publicado: (2024)
Bootstrapped Reward Shaping
por: Adamczyk, Jacob, et al.
Publicado: (2025)
por: Adamczyk, Jacob, et al.
Publicado: (2025)
Thermodynamics of Reinforcement Learning Curricula
por: Adamczyk, Jacob, et al.
Publicado: (2026)
por: Adamczyk, Jacob, et al.
Publicado: (2026)
Maximum Entropy Exploration Without the Rollouts
por: Adamczyk, Jacob, et al.
Publicado: (2026)
por: Adamczyk, Jacob, et al.
Publicado: (2026)
Multi-Resolution Diffusion for Privacy-Sensitive Recommender Systems
por: Lilienthal, Derek, et al.
Publicado: (2023)
por: Lilienthal, Derek, et al.
Publicado: (2023)
Learning telic-controllable state representations
por: Amir, Nadav, et al.
Publicado: (2024)
por: Amir, Nadav, et al.
Publicado: (2024)
Exploration Behavior of Untrained Policies
por: Adamczyk, Jacob
Publicado: (2025)
por: Adamczyk, Jacob
Publicado: (2025)
Inferring Transition Dynamics from Value Functions
por: Adamczyk, Jacob
Publicado: (2025)
por: Adamczyk, Jacob
Publicado: (2025)
Emergence of Physical Intelligence via Controllable Information Production
por: Shah, Tristan, et al.
Publicado: (2026)
por: Shah, Tristan, et al.
Publicado: (2026)
SuPLE: Robot Learning with Lyapunov Rewards
por: Nguyen, Phu, et al.
Publicado: (2024)
por: Nguyen, Phu, et al.
Publicado: (2024)
Provably Adaptive Average Reward Reinforcement Learning for Metric Spaces
por: Kar, Avik, et al.
Publicado: (2024)
por: Kar, Avik, et al.
Publicado: (2024)
Noise-based reward-modulated learning
por: Fernández, Jesús García, et al.
Publicado: (2025)
por: Fernández, Jesús García, et al.
Publicado: (2025)
Goals and the Structure of Experience
por: Amir, Nadav, et al.
Publicado: (2025)
por: Amir, Nadav, et al.
Publicado: (2025)
Decentralized Traffic Flow Optimization Through Intrinsic Motivation
por: Papala, Himaja, et al.
Publicado: (2025)
por: Papala, Himaja, et al.
Publicado: (2025)
The impact of intrinsic rewards on exploration in Reinforcement Learning
por: Kayal, Aya, et al.
Publicado: (2025)
por: Kayal, Aya, et al.
Publicado: (2025)
Episodic Reinforcement Learning with Expanded State-reward Space
por: Liang, Dayang, et al.
Publicado: (2024)
por: Liang, Dayang, et al.
Publicado: (2024)
Benchmarking Pretrained Molecular Embedding Models For Molecular Representation Learning
por: Praski, Mateusz, et al.
Publicado: (2025)
por: Praski, Mateusz, et al.
Publicado: (2025)
ACPO: A Policy Optimization Algorithm for Average MDPs with Constraints
por: Agnihotri, Akhil, et al.
Publicado: (2023)
por: Agnihotri, Akhil, et al.
Publicado: (2023)
Self-rewarding correction for mathematical reasoning
por: Xiong, Wei, et al.
Publicado: (2025)
por: Xiong, Wei, et al.
Publicado: (2025)
Active teacher selection for reward learning
por: Freedman, Rachel, et al.
Publicado: (2023)
por: Freedman, Rachel, et al.
Publicado: (2023)
Eigen-Value: Efficient Domain-Robust Data Valuation via Eigenvalue-Based Approach
por: Choi, Youngjun, et al.
Publicado: (2025)
por: Choi, Youngjun, et al.
Publicado: (2025)
Streaming Looking Ahead with Token-level Self-reward
por: Zhang, Hongming, et al.
Publicado: (2025)
por: Zhang, Hongming, et al.
Publicado: (2025)
Evaluating machine learning models for predicting pesticide toxicity to honey bees
por: Adamczyk, Jakub, et al.
Publicado: (2025)
por: Adamczyk, Jakub, et al.
Publicado: (2025)
GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization
por: Liu, Shih-Yang, et al.
Publicado: (2026)
por: Liu, Shih-Yang, et al.
Publicado: (2026)
EigenLoRAx: Recycling Adapters to Find Principal Subspaces for Resource-Efficient Adaptation and Inference
por: Kaushik, Prakhar, et al.
Publicado: (2025)
por: Kaushik, Prakhar, et al.
Publicado: (2025)
VRAIL: Vectorized Reward-based Attribution for Interpretable Learning
por: Kim, Jina, et al.
Publicado: (2025)
por: Kim, Jina, et al.
Publicado: (2025)
Risk-averse Total-reward MDPs with ERM and EVaR
por: Su, Xihong, et al.
Publicado: (2024)
por: Su, Xihong, et al.
Publicado: (2024)
reward-lens: A Mechanistic Interpretability Library for Reward Models
por: Nadaf, Mohammed Suhail B
Publicado: (2026)
por: Nadaf, Mohammed Suhail B
Publicado: (2026)
One-shot Optimized Steering Vectors Mediate Safety-relevant Behaviors in LLMs
por: Dunefsky, Jacob, et al.
Publicado: (2025)
por: Dunefsky, Jacob, et al.
Publicado: (2025)
Support Vector Boosting Machine (SVBM): Enhancing Classification Performance with AdaBoost and Residual Connections
por: Lian, Junbo Jacob
Publicado: (2024)
por: Lian, Junbo Jacob
Publicado: (2024)
Eigen Attention: Attention in Low-Rank Space for KV Cache Compression
por: Saxena, Utkarsh, et al.
Publicado: (2024)
por: Saxena, Utkarsh, et al.
Publicado: (2024)
Multi-Agent Empowerment and Emergence of Complex Behavior in Groups
por: Shah, Tristan, et al.
Publicado: (2026)
por: Shah, Tristan, et al.
Publicado: (2026)
Zero-Incentive Dynamics: a look at reward sparsity through the lens of unrewarded subgoals
por: Molinghen, Yannick, et al.
Publicado: (2025)
por: Molinghen, Yannick, et al.
Publicado: (2025)
Balance Equation-based Distributionally Robust Offline Imitation Learning
por: Agrawal, Rishabh, et al.
Publicado: (2025)
por: Agrawal, Rishabh, et al.
Publicado: (2025)
Acoustic Wave Manipulation Through Sparse Robotic Actuation
por: Shah, Tristan, et al.
Publicado: (2025)
por: Shah, Tristan, et al.
Publicado: (2025)
Leveraging LLMs for reward function design in reinforcement learning control tasks
por: Cardenoso, Franklin, et al.
Publicado: (2025)
por: Cardenoso, Franklin, et al.
Publicado: (2025)
Understanding and Improving Model Averaging in Federated Learning on Heterogeneous Data
por: Zhou, Tailin, et al.
Publicado: (2023)
por: Zhou, Tailin, et al.
Publicado: (2023)
EigenBench: A Comparative Behavioral Measure of Value Alignment
por: Chang, Jonathn, et al.
Publicado: (2025)
por: Chang, Jonathn, et al.
Publicado: (2025)
Efficient $Q$-Learning and Actor-Critic Methods for Robust Average Reward Reinforcement Learning
por: Xu, Yang, et al.
Publicado: (2025)
por: Xu, Yang, et al.
Publicado: (2025)
Ejemplares similares
-
Average-Reward Soft Actor-Critic
por: Adamczyk, Jacob, et al.
Publicado: (2025) -
Boosting Soft Q-Learning by Bounding
por: Adamczyk, Jacob, et al.
Publicado: (2024) -
Bootstrapped Reward Shaping
por: Adamczyk, Jacob, et al.
Publicado: (2025) -
Thermodynamics of Reinforcement Learning Curricula
por: Adamczyk, Jacob, et al.
Publicado: (2026) -
Maximum Entropy Exploration Without the Rollouts
por: Adamczyk, Jacob, et al.
Publicado: (2026)