Enregistré dans:
| Auteurs principaux: | Lu, Runyu, Shi, Ruochuan, Zhu, Yuanheng, Zhao, Dongbin |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2511.17367 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ARAC: Adaptive Regularized Multi-Agent Soft Actor-Critic in Graph-Structured Adversarial Games
par: Shi, Ruochuan, et autres
Publié: (2025)
par: Shi, Ruochuan, et autres
Publié: (2025)
Equilibrium Policy Generalization: A Reinforcement Learning Framework for Cross-Graph Zero-Shot Generalization in Pursuit-Evasion Games
par: Lu, Runyu, et autres
Publié: (2025)
par: Lu, Runyu, et autres
Publié: (2025)
Discretizing Continuous Action Space with Unimodal Probability Distributions for On-Policy Reinforcement Learning
par: Zhu, Yuanyang, et autres
Publié: (2024)
par: Zhu, Yuanyang, et autres
Publié: (2024)
Meta-DT: Offline Meta-RL as Conditional Sequence Modeling with World Model Disentanglement
par: Wang, Zhi, et autres
Publié: (2024)
par: Wang, Zhi, et autres
Publié: (2024)
Streaming Reinforcement Learning under Partial Observability with Real-Time Recurrent Learning
par: Farr, Noah, et autres
Publié: (2026)
par: Farr, Noah, et autres
Publié: (2026)
DipLLM: Fine-Tuning LLM for Strategic Decision-making in Diplomacy
par: Xu, Kaixuan, et autres
Publié: (2025)
par: Xu, Kaixuan, et autres
Publié: (2025)
Guided Policy Optimization under Partial Observability
par: Li, Yueheng, et autres
Publié: (2025)
par: Li, Yueheng, et autres
Publié: (2025)
RLAE: Reinforcement Learning-Assisted Ensemble for LLMs
par: Fu, Yuqian, et autres
Publié: (2025)
par: Fu, Yuqian, et autres
Publié: (2025)
Revisiting On-Policy Distillation: Empirical Failure Modes and Simple Fixes
par: Fu, Yuqian, et autres
Publié: (2026)
par: Fu, Yuqian, et autres
Publié: (2026)
Learning Robust Penetration-Testing Policies under Partial Observability: A systematic evaluation
par: Simon, Raphael, et autres
Publié: (2025)
par: Simon, Raphael, et autres
Publié: (2025)
Belief-State RWKV for Reinforcement Learning under Partial Observability
par: Xiao, Liu
Publié: (2026)
par: Xiao, Liu
Publié: (2026)
Towards the Worst-case Robustness of Large Language Models
par: Chen, Huanran, et autres
Publié: (2025)
par: Chen, Huanran, et autres
Publié: (2025)
Distributionally Robust Safety Verification of Neural Networks via Worst-Case CVaR
par: Kishida, Masako
Publié: (2025)
par: Kishida, Masako
Publié: (2025)
Near-Optimal Partially Observable Reinforcement Learning with Partial Online State Information
par: Shi, Ming, et autres
Publié: (2023)
par: Shi, Ming, et autres
Publié: (2023)
How Worst-Case Are Adversarial Attacks? Linking Adversarial and Perturbation Robustness
par: Rossolini, Giulio
Publié: (2026)
par: Rossolini, Giulio
Publié: (2026)
$π$-Play: Multi-Agent Self-Play via Privileged Self-Distillation without External Data
par: Zhang, Yaocheng, et autres
Publié: (2026)
par: Zhang, Yaocheng, et autres
Publié: (2026)
Adversarial Latent-State Training for Robust Policies in Partially Observable Domains
par: Ahuja, Angad Singh
Publié: (2026)
par: Ahuja, Angad Singh
Publié: (2026)
Linear Bandits with Partially Observable Features
par: Kim, Wonyoung, et autres
Publié: (2025)
par: Kim, Wonyoung, et autres
Publié: (2025)
Recurrent Deep Reinforcement Learning for Chemotherapy Control under Partial Observability
par: Kiram, Firas Mohamed Elamine, et autres
Publié: (2026)
par: Kiram, Firas Mohamed Elamine, et autres
Publié: (2026)
Adversarial Training for Robust Coverage Network under Worst-case Facility Losses
par: Miao, Changhao, et autres
Publié: (2026)
par: Miao, Changhao, et autres
Publié: (2026)
Explainable Clustering Beyond Worst-Case Guarantees
par: Fleissner, Maximilian, et autres
Publié: (2024)
par: Fleissner, Maximilian, et autres
Publié: (2024)
SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning
par: Fu, Yuqian, et autres
Publié: (2025)
par: Fu, Yuqian, et autres
Publié: (2025)
TCRL: Temporal-Coupled Adversarial Training for Robust Constrained Reinforcement Learning in Worst-Case Scenarios
par: Xu, Wentao, et autres
Publié: (2026)
par: Xu, Wentao, et autres
Publié: (2026)
Infra-Bayesian Reinforcement Learning Agents Outperform Classical RL For Worst-Case Robustness
par: Aryal, Manish, et autres
Publié: (2026)
par: Aryal, Manish, et autres
Publié: (2026)
Belief States for Cooperative Multi-Agent Reinforcement Learning under Partial Observability
par: Pritz, Paul J., et autres
Publié: (2025)
par: Pritz, Paul J., et autres
Publié: (2025)
A Convolution and Attention Based Encoder for Reinforcement Learning under Partial Observability
par: Wang, Wuhao, et autres
Publié: (2025)
par: Wang, Wuhao, et autres
Publié: (2025)
Partially Observable Reinforcement Learning with Memory Traces
par: Eberhard, Onno, et autres
Publié: (2025)
par: Eberhard, Onno, et autres
Publié: (2025)
Thompson Sampling in Partially Observable Contextual Bandits
par: Park, Hongju, et autres
Publié: (2024)
par: Park, Hongju, et autres
Publié: (2024)
Beyond Optimism: Exploration With Partially Observable Rewards
par: Parisi, Simone, et autres
Publié: (2024)
par: Parisi, Simone, et autres
Publié: (2024)
Partially Observable Contextual Bandits with Linear Payoffs
par: Zeng, Sihan, et autres
Publié: (2024)
par: Zeng, Sihan, et autres
Publié: (2024)
Contextual Decision-Making with Knapsacks Beyond the Worst Case
par: Chen, Zhaohua, et autres
Publié: (2022)
par: Chen, Zhaohua, et autres
Publié: (2022)
Decision-Focused Evaluation of Worst-Case Distribution Shift
par: Ren, Kevin, et autres
Publié: (2024)
par: Ren, Kevin, et autres
Publié: (2024)
Distribution Learning with Valid Outputs Beyond the Worst-Case
par: Rittler, Nick, et autres
Publié: (2024)
par: Rittler, Nick, et autres
Publié: (2024)
Short-Term-to-Long-Term Memory Transfer for Knowledge Graphs under Partial Observability
par: Kim, Taewoon, et autres
Publié: (2026)
par: Kim, Taewoon, et autres
Publié: (2026)
Uncertainty Representations in State-Space Layers for Deep Reinforcement Learning under Partial Observability
par: Luis, Carlos E., et autres
Publié: (2024)
par: Luis, Carlos E., et autres
Publié: (2024)
Robust Gaussian Processes via Relevance Pursuit
par: Ament, Sebastian, et autres
Publié: (2024)
par: Ament, Sebastian, et autres
Publié: (2024)
FieldSeer I: Physics-Guided World Models for Long-Horizon Electromagnetic Dynamics under Partial Observability
par: Guo, Ziheng, et autres
Publié: (2025)
par: Guo, Ziheng, et autres
Publié: (2025)
Improving the Worst-Case Bidirectional Communication Complexity for Nonconvex Distributed Optimization under Function Similarity
par: Gruntkowska, Kaja, et autres
Publié: (2024)
par: Gruntkowska, Kaja, et autres
Publié: (2024)
Learning Causal States Under Partial Observability and Perturbation
par: Li, Na, et autres
Publié: (2025)
par: Li, Na, et autres
Publié: (2025)
Provable Partially Observable Reinforcement Learning with Privileged Information
par: Cai, Yang, et autres
Publié: (2024)
par: Cai, Yang, et autres
Publié: (2024)
Documents similaires
-
ARAC: Adaptive Regularized Multi-Agent Soft Actor-Critic in Graph-Structured Adversarial Games
par: Shi, Ruochuan, et autres
Publié: (2025) -
Equilibrium Policy Generalization: A Reinforcement Learning Framework for Cross-Graph Zero-Shot Generalization in Pursuit-Evasion Games
par: Lu, Runyu, et autres
Publié: (2025) -
Discretizing Continuous Action Space with Unimodal Probability Distributions for On-Policy Reinforcement Learning
par: Zhu, Yuanyang, et autres
Publié: (2024) -
Meta-DT: Offline Meta-RL as Conditional Sequence Modeling with World Model Disentanglement
par: Wang, Zhi, et autres
Publié: (2024) -
Streaming Reinforcement Learning under Partial Observability with Real-Time Recurrent Learning
par: Farr, Noah, et autres
Publié: (2026)