Policy Disruption in Reinforcement Learning:Adversarial Attack with Large Language Models and Critical State Identification
Fuente:
arXiv
Guardado en:
| Autores principales: | Jiang, Junyong, Tian, Buwei, Xu, Chenxing, Li, Songze, Dong, Lu |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Rethinking Adversarial Attacks in Reinforcement Learning from Policy Distribution Perspective
por: Duan, Tianyang, et al.
Publicado: (2025)
por: Duan, Tianyang, et al.
Publicado: (2025)
Off-Policy Value-Based Reinforcement Learning for Large Language Models
por: Wang, Peng-Yuan, et al.
Publicado: (2026)
por: Wang, Peng-Yuan, et al.
Publicado: (2026)
TooBadRL: Trigger Optimization to Boost Effectiveness of Backdoor Attacks on Deep Reinforcement Learning
por: Zhang, Mingxuan, et al.
Publicado: (2025)
por: Zhang, Mingxuan, et al.
Publicado: (2025)
Dynamic Adversarial Reinforcement Learning for Robust Multimodal Large Language Models
por: Bao, Yicheng, et al.
Publicado: (2026)
por: Bao, Yicheng, et al.
Publicado: (2026)
Sampling-aware Adversarial Attacks Against Large Language Models
por: Beyer, Tim, et al.
Publicado: (2025)
por: Beyer, Tim, et al.
Publicado: (2025)
Towards Robust Policy: Enhancing Offline Reinforcement Learning with Adversarial Attacks and Defenses
por: Nguyen, Thanh, et al.
Publicado: (2024)
por: Nguyen, Thanh, et al.
Publicado: (2024)
Adversarial Reinforcement Learning for Large Language Model Agent Safety
por: Wang, Zizhao, et al.
Publicado: (2025)
por: Wang, Zizhao, et al.
Publicado: (2025)
Provably Invincible Adversarial Attacks on Reinforcement Learning Systems: A Rate-Distortion Information-Theoretic Approach
por: Lu, Ziqing, et al.
Publicado: (2025)
por: Lu, Ziqing, et al.
Publicado: (2025)
MSfusion: A Dynamic Model Splitting Approach for Resource-Constrained Machines to Collaboratively Train Larger Models
por: Xie, Jin, et al.
Publicado: (2024)
por: Xie, Jin, et al.
Publicado: (2024)
Reinforcement Learning with Promising Tokens for Large Language Models
por: Pang, Jing-Cheng, et al.
Publicado: (2026)
por: Pang, Jing-Cheng, et al.
Publicado: (2026)
Adversarial Contrastive Learning for LLM Quantization Attacks
por: Song, Dinghong, et al.
Publicado: (2026)
por: Song, Dinghong, et al.
Publicado: (2026)
TOP-ERL: Transformer-based Off-Policy Episodic Reinforcement Learning
por: Li, Ge, et al.
Publicado: (2024)
por: Li, Ge, et al.
Publicado: (2024)
The Resurgence of GCG Adversarial Attacks on Large Language Models
por: Tan, Yuting, et al.
Publicado: (2025)
por: Tan, Yuting, et al.
Publicado: (2025)
Constructing Adversarial Examples for Vertical Federated Learning: Optimal Client Corruption through Multi-Armed Bandit
por: Yao, Duanyi, et al.
Publicado: (2024)
por: Yao, Duanyi, et al.
Publicado: (2024)
Knowledge-Driven Multi-Turn Jailbreaking on Large Language Models
por: Li, Songze, et al.
Publicado: (2026)
por: Li, Songze, et al.
Publicado: (2026)
Noise as a Probe: Membership Inference Attacks on Diffusion Models Leveraging Initial Noise
por: Lian, Puwei, et al.
Publicado: (2026)
por: Lian, Puwei, et al.
Publicado: (2026)
Enhancing Membership Inference Attacks on Diffusion Models from a Frequency-Domain Perspective
por: Lian, Puwei, et al.
Publicado: (2025)
por: Lian, Puwei, et al.
Publicado: (2025)
DarkLLM: Learning Language-Driven Adversarial Attacks with Large Language Models
por: Sun, Ye, et al.
Publicado: (2026)
por: Sun, Ye, et al.
Publicado: (2026)
DiffPoGAN: Diffusion Policies with Generative Adversarial Networks for Offline Reinforcement Learning
por: Hu, Xuemin, et al.
Publicado: (2024)
por: Hu, Xuemin, et al.
Publicado: (2024)
URVFL: Undetectable Data Reconstruction Attack on Vertical Federated Learning
por: Yao, Duanyi, et al.
Publicado: (2024)
por: Yao, Duanyi, et al.
Publicado: (2024)
Adversarial Evasion Attack Efficiency against Large Language Models
por: Vitorino, João, et al.
Publicado: (2024)
por: Vitorino, João, et al.
Publicado: (2024)
Attacking Cooperative Multi-Agent Reinforcement Learning by Adversarial Minority Influence
por: Li, Simin, et al.
Publicado: (2023)
por: Li, Simin, et al.
Publicado: (2023)
Toward Evaluating Robustness of Reinforcement Learning with Adversarial Policy
por: Zheng, Xiang, et al.
Publicado: (2023)
por: Zheng, Xiang, et al.
Publicado: (2023)
Beyond Suffixes: Token Position in GCG Adversarial Attacks on Large Language Models
por: Eddoubi, Hicham, et al.
Publicado: (2026)
por: Eddoubi, Hicham, et al.
Publicado: (2026)
REINFORCE Adversarial Attacks on Large Language Models: An Adaptive, Distributional, and Semantic Objective
por: Geisler, Simon, et al.
Publicado: (2025)
por: Geisler, Simon, et al.
Publicado: (2025)
Adversarial Inception Backdoor Attacks against Reinforcement Learning
por: Rathbun, Ethan, et al.
Publicado: (2024)
por: Rathbun, Ethan, et al.
Publicado: (2024)
Universal and Transferable Adversarial Attack on Large Language Models Using Exponentiated Gradient Descent
por: Biswas, Sajib, et al.
Publicado: (2025)
por: Biswas, Sajib, et al.
Publicado: (2025)
TernaryLLM: Ternarized Large Language Model
por: Chen, Tianqi, et al.
Publicado: (2024)
por: Chen, Tianqi, et al.
Publicado: (2024)
Adversarially Trained Weighted Actor-Critic for Safe Offline Reinforcement Learning
por: Wei, Honghao, et al.
Publicado: (2024)
por: Wei, Honghao, et al.
Publicado: (2024)
Mildly Constrained Evaluation Policy for Offline Reinforcement Learning
por: Xu, Linjie, et al.
Publicado: (2023)
por: Xu, Linjie, et al.
Publicado: (2023)
ImagineBench: Evaluating Reinforcement Learning with Large Language Model Rollouts
por: Pang, Jing-Cheng, et al.
Publicado: (2025)
por: Pang, Jing-Cheng, et al.
Publicado: (2025)
Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic
por: Vo, Thanh Vinh, et al.
Publicado: (2025)
por: Vo, Thanh Vinh, et al.
Publicado: (2025)
ReMax: A Simple, Effective, and Efficient Reinforcement Learning Method for Aligning Large Language Models
por: Li, Ziniu, et al.
Publicado: (2023)
por: Li, Ziniu, et al.
Publicado: (2023)
POLAR: Policy-based Layerwise Reinforcement Learning Method for Stealthy Backdoor Attacks in Federated Learning
por: Yu, Kuai, et al.
Publicado: (2025)
por: Yu, Kuai, et al.
Publicado: (2025)
Towards Client Driven Federated Learning
por: Li, Songze, et al.
Publicado: (2024)
por: Li, Songze, et al.
Publicado: (2024)
FedMeS: Personalized Federated Continual Learning Leveraging Local Memory
por: Xie, Jin, et al.
Publicado: (2024)
por: Xie, Jin, et al.
Publicado: (2024)
Using Mechanistic Interpretability to Craft Adversarial Attacks against Large Language Models
por: Winninger, Thomas, et al.
Publicado: (2025)
por: Winninger, Thomas, et al.
Publicado: (2025)
Break the Visual Perception: Adversarial Attacks Targeting Encoded Visual Tokens of Large Vision-Language Models
por: Wang, Yubo, et al.
Publicado: (2024)
por: Wang, Yubo, et al.
Publicado: (2024)
AR$^2$: Adversarial Reinforcement Learning for Abstract Reasoning in Large Language Models
por: Yeh, Cheng-Kai, et al.
Publicado: (2025)
por: Yeh, Cheng-Kai, et al.
Publicado: (2025)
Box Thirding: Anytime Best Arm Identification under Insufficient Sampling
por: Hwang, Seohwa, et al.
Publicado: (2026)
por: Hwang, Seohwa, et al.
Publicado: (2026)
Ejemplares similares
-
Rethinking Adversarial Attacks in Reinforcement Learning from Policy Distribution Perspective
por: Duan, Tianyang, et al.
Publicado: (2025) -
Off-Policy Value-Based Reinforcement Learning for Large Language Models
por: Wang, Peng-Yuan, et al.
Publicado: (2026) -
TooBadRL: Trigger Optimization to Boost Effectiveness of Backdoor Attacks on Deep Reinforcement Learning
por: Zhang, Mingxuan, et al.
Publicado: (2025) -
Dynamic Adversarial Reinforcement Learning for Robust Multimodal Large Language Models
por: Bao, Yicheng, et al.
Publicado: (2026) -
Sampling-aware Adversarial Attacks Against Large Language Models
por: Beyer, Tim, et al.
Publicado: (2025)