MDPs with a State Sensing Cost
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Kapoor, Vansh, Nair, Jayakrishnan |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Capacity Provisioning Motivated Online Non-Convex Optimization Problem with Memory and Switching Cost
par: Vaze, Rahul, et autres
Publié: (2024)
par: Vaze, Rahul, et autres
Publié: (2024)
Influence of Recommender Systems on Users: A Dynamical Systems Analysis
par: Lankireddy, Prabhat, et autres
Publié: (2024)
par: Lankireddy, Prabhat, et autres
Publié: (2024)
Representative Arm Identification: A fixed confidence approach to identify cluster representatives
par: Gharat, Sarvesh, et autres
Publié: (2024)
par: Gharat, Sarvesh, et autres
Publié: (2024)
Primal-Only Actor Critic Algorithm for Robust Constrained Average Cost MDPs
par: Satheesh, Anirudh, et autres
Publié: (2025)
par: Satheesh, Anirudh, et autres
Publié: (2025)
TRIM: Hybrid Inference via Targeted Stepwise Routing in Multi-Step Reasoning Tasks
par: Kapoor, Vansh, et autres
Publié: (2026)
par: Kapoor, Vansh, et autres
Publié: (2026)
Convergence of Natural Policy Gradient for a Family of Infinite-State Queueing MDPs
par: Grosof, Isaac, et autres
Publié: (2024)
par: Grosof, Isaac, et autres
Publié: (2024)
Score-Guided Proximal Projection: A Unified Geometric Framework for Rectified Flow Editing
par: Bansal, Vansh, et autres
Publié: (2026)
par: Bansal, Vansh, et autres
Publié: (2026)
A Reliable Knowledge Processing Framework for Combustion Science using Foundation Models
par: Sharma, Vansh, et autres
Publié: (2023)
par: Sharma, Vansh, et autres
Publié: (2023)
Adaptive Multi-Scale Goodness Aggregation for Forward-Forward Learning
par: Beigzad, Salar, et autres
Publié: (2026)
par: Beigzad, Salar, et autres
Publié: (2026)
A Machine Learning Based Approach for Statistical Analysis of Detonation Cells from Soot Foils
par: Sharma, Vansh, et autres
Publié: (2024)
par: Sharma, Vansh, et autres
Publié: (2024)
Time-Constrained Robust MDPs
par: Zouitine, Adil, et autres
Publié: (2024)
par: Zouitine, Adil, et autres
Publié: (2024)
On the Optimizer Dependence of Neural Scaling Laws
par: Ramani, Vansh, et autres
Publié: (2026)
par: Ramani, Vansh, et autres
Publié: (2026)
Reinforcement Learning for Infinite-Horizon Average-Reward Linear MDPs via Approximation by Discounted-Reward MDPs
par: Hong, Kihyuk, et autres
Publié: (2024)
par: Hong, Kihyuk, et autres
Publié: (2024)
Landscape of Policy Optimization for Finite Horizon MDPs with General State and Action
par: Chen, Xin, et autres
Publié: (2024)
par: Chen, Xin, et autres
Publié: (2024)
On Value Iteration Convergence in Connected MDPs
par: Mustafin, Arsenii, et autres
Publié: (2024)
par: Mustafin, Arsenii, et autres
Publié: (2024)
Robust Parameter Learning for Uncertain MDPs
par: Schnitzer, Yannik, et autres
Publié: (2026)
par: Schnitzer, Yannik, et autres
Publié: (2026)
Truly No-Regret Learning in Constrained MDPs
par: Müller, Adrian, et autres
Publié: (2024)
par: Müller, Adrian, et autres
Publié: (2024)
Conformal C2ST: Turning weak classifiers into strong two-sample tests
par: Bansal, Vansh, et autres
Publié: (2025)
par: Bansal, Vansh, et autres
Publié: (2025)
CoLT: The conditional localization test for assessing the accuracy of neural posterior estimates
par: Chen, Tianyu, et autres
Publié: (2025)
par: Chen, Tianyu, et autres
Publié: (2025)
Offline Bayesian Aleatoric and Epistemic Uncertainty Quantification and Posterior Value Optimisation in Finite-State MDPs
par: Valdettaro, Filippo, et autres
Publié: (2024)
par: Valdettaro, Filippo, et autres
Publié: (2024)
Soft Robust MDPs and Risk-Sensitive MDPs: Equivalence, Policy Gradient, and Sample Complexity
par: Zhang, Runyu, et autres
Publié: (2023)
par: Zhang, Runyu, et autres
Publié: (2023)
Learning Adversarial MDPs with Stochastic Hard Constraints
par: Stradi, Francesco Emanuele, et autres
Publié: (2024)
par: Stradi, Francesco Emanuele, et autres
Publié: (2024)
Solving Robust MDPs through No-Regret Dynamics
par: Guha, Etash Kumar
Publié: (2023)
par: Guha, Etash Kumar
Publié: (2023)
Eluder-based Regret for Stochastic Contextual MDPs
par: Levy, Orin, et autres
Publié: (2022)
par: Levy, Orin, et autres
Publié: (2022)
Sample Complexity Characterization for Linear Contextual MDPs
par: Deng, Junze, et autres
Publié: (2024)
par: Deng, Junze, et autres
Publié: (2024)
Solving robust MDPs as a sequence of static RL problems
par: Zouitine, Adil, et autres
Publié: (2024)
par: Zouitine, Adil, et autres
Publié: (2024)
On the Convergence and Straightness of Rectified Flow
par: Bansal, Vansh, et autres
Publié: (2024)
par: Bansal, Vansh, et autres
Publié: (2024)
Prospect-Theory Behavior from Bellman Optimality in MDPs with Catastrophic States
par: Chen, Yujiao
Publié: (2026)
par: Chen, Yujiao
Publié: (2026)
Efficiently Solving Discounted MDPs with Predictions on Transition Matrices
par: Lyu, Lixing, et autres
Publié: (2025)
par: Lyu, Lixing, et autres
Publié: (2025)
Reinforcement Learning from Adversarial Preferences in Tabular MDPs
par: Tsuchiya, Taira, et autres
Publié: (2025)
par: Tsuchiya, Taira, et autres
Publié: (2025)
Demystifying Linear MDPs and Novel Dynamics Aggregation Framework
par: Lee, Joongkyu, et autres
Publié: (2024)
par: Lee, Joongkyu, et autres
Publié: (2024)
Policy Gradient in Robust MDPs with Global Convergence Guarantee
par: Wang, Qiuhao, et autres
Publié: (2022)
par: Wang, Qiuhao, et autres
Publié: (2022)
Near-Optimal Sample Complexity for Online Constrained MDPs
par: Liu, Chang, et autres
Publié: (2026)
par: Liu, Chang, et autres
Publié: (2026)
Online Learning in MDPs with Partially Adversarial Transitions and Losses
par: Schlisselberg, Ofir, et autres
Publié: (2026)
par: Schlisselberg, Ofir, et autres
Publié: (2026)
Sample Complexity Bounds for Linear Constrained MDPs with a Generative Model
par: Liu, Xingtu, et autres
Publié: (2025)
par: Liu, Xingtu, et autres
Publié: (2025)
Position: Graph Condensation Needs a Reset -- Move Beyond Full-dataset Training and Model-Dependence
par: Gupta, Mridul, et autres
Publié: (2026)
par: Gupta, Mridul, et autres
Publié: (2026)
No-Regret Reinforcement Learning in Smooth MDPs
par: Maran, Davide, et autres
Publié: (2024)
par: Maran, Davide, et autres
Publié: (2024)
Runtime Monitoring of Perception-Based Autonomous Systems via Embedding Temporal Logic
par: Kapoor, Parv, et autres
Publié: (2026)
par: Kapoor, Parv, et autres
Publié: (2026)
Augmented Lagrangian Method for Last-Iterate Convergence for Constrained MDPs
par: Lu, Michael, et autres
Publié: (2026)
par: Lu, Michael, et autres
Publié: (2026)
Data- and Variance-dependent Regret Bounds for Online Tabular MDPs
par: Li, Mingyi, et autres
Publié: (2026)
par: Li, Mingyi, et autres
Publié: (2026)
Documents similaires
-
Capacity Provisioning Motivated Online Non-Convex Optimization Problem with Memory and Switching Cost
par: Vaze, Rahul, et autres
Publié: (2024) -
Influence of Recommender Systems on Users: A Dynamical Systems Analysis
par: Lankireddy, Prabhat, et autres
Publié: (2024) -
Representative Arm Identification: A fixed confidence approach to identify cluster representatives
par: Gharat, Sarvesh, et autres
Publié: (2024) -
Primal-Only Actor Critic Algorithm for Robust Constrained Average Cost MDPs
par: Satheesh, Anirudh, et autres
Publié: (2025) -
TRIM: Hybrid Inference via Targeted Stepwise Routing in Multi-Step Reasoning Tasks
par: Kapoor, Vansh, et autres
Publié: (2026)