A Safe Exploration Strategy for Model-free Task Adaptation in Safety-constrained Grid Environments
Fuente:
arXiv
Guardado en:
| Autores principales: | Entezami, Erfan, Sahebdel, Mahsa, Gupta, Dhawal |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
LLM Misalignment via Adversarial RLHF Platforms
por: Entezami, Erfan, et al.
Publicado: (2025)
por: Entezami, Erfan, et al.
Publicado: (2025)
Mitigating Preference Hacking in Policy Optimization with Pessimism
por: Gupta, Dhawal, et al.
Publicado: (2025)
por: Gupta, Dhawal, et al.
Publicado: (2025)
Exploration and Adaptation in Non-Stationary Tasks with Diffusion Policies
por: Baveja, Gunbir Singh
Publicado: (2025)
por: Baveja, Gunbir Singh
Publicado: (2025)
BeSafe-Bench: Unveiling Behavioral Safety Risks of Situated Agents in Functional Environments
por: Li, Yuxuan, et al.
Publicado: (2026)
por: Li, Yuxuan, et al.
Publicado: (2026)
SafePowerGraph: Safety-aware Evaluation of Graph Neural Networks for Transmission Power Grids
por: Ghamizi, Salah, et al.
Publicado: (2024)
por: Ghamizi, Salah, et al.
Publicado: (2024)
SafeGen-LLM: Enhancing Safety Generalization in Task Planning for Robotic Systems
por: Fan, Jialiang, et al.
Publicado: (2026)
por: Fan, Jialiang, et al.
Publicado: (2026)
AI-Driven Innovations in Volumetric Video Streaming: A Review
por: Entezami, Erfan, et al.
Publicado: (2024)
por: Entezami, Erfan, et al.
Publicado: (2024)
Multimodal Large Language Model Framework for Safe and Interpretable Grid-Integrated EVs
por: Carvalho, Jean Douglas, et al.
Publicado: (2025)
por: Carvalho, Jean Douglas, et al.
Publicado: (2025)
Revisiting Safe Exploration in Safe Reinforcement learning
por: Eckel, David, et al.
Publicado: (2024)
por: Eckel, David, et al.
Publicado: (2024)
Verification-Guided Falsification for Safe RL via Explainable Abstraction and Risk-Aware Exploration
por: Le, Tuan, et al.
Publicado: (2025)
por: Le, Tuan, et al.
Publicado: (2025)
SafeRBench: Dissecting the Reasoning Safety of Large Language Models
por: Gao, Xin, et al.
Publicado: (2025)
por: Gao, Xin, et al.
Publicado: (2025)
SciSafeEval: A Comprehensive Benchmark for Safety Alignment of Large Language Models in Scientific Tasks
por: Li, Tianhao, et al.
Publicado: (2024)
por: Li, Tianhao, et al.
Publicado: (2024)
Safe Pruning LoRA: Robust Distance-Guided Pruning for Safety Alignment in Adaptation of LLMs
por: Ao, Shuang, et al.
Publicado: (2025)
por: Ao, Shuang, et al.
Publicado: (2025)
Contextual Affordances for Safe Exploration in Robotic Scenarios
por: Ye, William Z., et al.
Publicado: (2024)
por: Ye, William Z., et al.
Publicado: (2024)
Reinforcement Learning by Guided Safe Exploration
por: Yang, Qisong, et al.
Publicado: (2023)
por: Yang, Qisong, et al.
Publicado: (2023)
Continually Learn to Map Visual Concepts to Large Language Models in Resource-constrained Environments
por: Rebillard, Clea, et al.
Publicado: (2024)
por: Rebillard, Clea, et al.
Publicado: (2024)
GridRoute: A Benchmark for LLM-Based Route Planning with Cardinal Movement in Grid Environments
por: Li, Kechen, et al.
Publicado: (2025)
por: Li, Kechen, et al.
Publicado: (2025)
A Survey on Computational Pathology Foundation Models: Datasets, Adaptation Strategies, and Evaluation Tasks
por: Li, Dong, et al.
Publicado: (2025)
por: Li, Dong, et al.
Publicado: (2025)
ClawSafety: "Safe" LLMs, Unsafe Agents
por: Wei, Bowen, et al.
Publicado: (2026)
por: Wei, Bowen, et al.
Publicado: (2026)
Easy Adaptation: An Efficient Task-Specific Knowledge Injection Method for Large Models in Resource-Constrained Environments
por: Chen, Dong, et al.
Publicado: (2025)
por: Chen, Dong, et al.
Publicado: (2025)
Safe Exploration Using Bayesian World Models and Log-Barrier Optimization
por: As, Yarden, et al.
Publicado: (2024)
por: As, Yarden, et al.
Publicado: (2024)
Safe Deep Policy Adaptation
por: Xiao, Wenli, et al.
Publicado: (2023)
por: Xiao, Wenli, et al.
Publicado: (2023)
Safe Exploration via Policy Priors
por: Wendl, Manuel, et al.
Publicado: (2026)
por: Wendl, Manuel, et al.
Publicado: (2026)
SafeSeek: Universal Attribution of Safety Circuits in Language Models
por: Yu, Miao, et al.
Publicado: (2026)
por: Yu, Miao, et al.
Publicado: (2026)
SafeMT: Multi-turn Safety for Multimodal Language Models
por: Zhu, Han, et al.
Publicado: (2025)
por: Zhu, Han, et al.
Publicado: (2025)
Comprehensive Modeling Approaches for Forecasting Bitcoin Transaction Fees: A Comparative Study
por: Ma, Jiangqin, et al.
Publicado: (2025)
por: Ma, Jiangqin, et al.
Publicado: (2025)
LinguaSafe: A Comprehensive Multilingual Safety Benchmark for Large Language Models
por: Ning, Zhiyuan, et al.
Publicado: (2025)
por: Ning, Zhiyuan, et al.
Publicado: (2025)
Conformal Reachability for Safe Control in Unknown Environments
por: Ma, Xinhang, et al.
Publicado: (2026)
por: Ma, Xinhang, et al.
Publicado: (2026)
SafePro: Evaluating the Safety of Professional-Level AI Agents
por: Zhou, Kaiwen, et al.
Publicado: (2026)
por: Zhou, Kaiwen, et al.
Publicado: (2026)
SafeDream: Safety World Model for Proactive Early Jailbreak Detection
por: Yan, Bo, et al.
Publicado: (2026)
por: Yan, Bo, et al.
Publicado: (2026)
Safe Multiagent Coordination via Entropic Exploration
por: Aydeniz, Ayhan Alp, et al.
Publicado: (2024)
por: Aydeniz, Ayhan Alp, et al.
Publicado: (2024)
SafeRedirect: Defeating Internal Safety Collapse via Task-Completion Redirection in Frontier LLMs
por: Pan, Chao, et al.
Publicado: (2026)
por: Pan, Chao, et al.
Publicado: (2026)
RxSafeBench: Identifying Medication Safety Issues of Large Language Models in Simulated Consultation
por: Zhao, Jiahao, et al.
Publicado: (2025)
por: Zhao, Jiahao, et al.
Publicado: (2025)
Safe Semantics, Unsafe Interpretations: Tackling Implicit Reasoning Safety in Large Vision-Language Models
por: Cai, Wei, et al.
Publicado: (2025)
por: Cai, Wei, et al.
Publicado: (2025)
SafeWorld: Geo-Diverse Safety Alignment
por: Yin, Da, et al.
Publicado: (2024)
por: Yin, Da, et al.
Publicado: (2024)
Exploring the In-Context Learning Capabilities of LLMs for Money Laundering Detection in Financial Graphs
por: Pirmorad, Erfan
Publicado: (2025)
por: Pirmorad, Erfan
Publicado: (2025)
Do LLMs Build Spatial World Models? Evidence from Grid-World Maze Tasks
por: Li, Weijiang, et al.
Publicado: (2026)
por: Li, Weijiang, et al.
Publicado: (2026)
NAVIX: Scaling MiniGrid Environments with JAX
por: Pignatelli, Eduardo, et al.
Publicado: (2024)
por: Pignatelli, Eduardo, et al.
Publicado: (2024)
SafeMind: Benchmarking and Mitigating Safety Risks in Embodied LLM Agents
por: Chen, Ruolin, et al.
Publicado: (2025)
por: Chen, Ruolin, et al.
Publicado: (2025)
Safety-Gymnasium: A Unified Safe Reinforcement Learning Benchmark
por: Ji, Jiaming, et al.
Publicado: (2023)
por: Ji, Jiaming, et al.
Publicado: (2023)
Ejemplares similares
-
LLM Misalignment via Adversarial RLHF Platforms
por: Entezami, Erfan, et al.
Publicado: (2025) -
Mitigating Preference Hacking in Policy Optimization with Pessimism
por: Gupta, Dhawal, et al.
Publicado: (2025) -
Exploration and Adaptation in Non-Stationary Tasks with Diffusion Policies
por: Baveja, Gunbir Singh
Publicado: (2025) -
BeSafe-Bench: Unveiling Behavioral Safety Risks of Situated Agents in Functional Environments
por: Li, Yuxuan, et al.
Publicado: (2026) -
SafePowerGraph: Safety-aware Evaluation of Graph Neural Networks for Transmission Power Grids
por: Ghamizi, Salah, et al.
Publicado: (2024)