Stop Fixating on Prompts: Reasoning Hijacking and Constraint Tightening for Red-Teaming LLM Agents
Fuente:
arXiv
Saved in:
| Main Authors: | Mao, Yanxu, Liu, Peipei, Cui, Tiehan, Liu, Congying, Xing, Mingzhe, You, Datao |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Low-Resource Fast Text Classification Based on Intra-Class and Inter-Class Distance Calculation
by: Mao, Yanxu, et al.
Published: (2024)
by: Mao, Yanxu, et al.
Published: (2024)
Divide and Conquer: A Hybrid Strategy Defeats Multimodal Large Language Models
by: Mao, Yanxu, et al.
Published: (2024)
by: Mao, Yanxu, et al.
Published: (2024)
NEXUS: Continual Learning of Symbolic Constraints for Safe and Robust Embodied Planning
by: Cui, Tiehan, et al.
Published: (2026)
by: Cui, Tiehan, et al.
Published: (2026)
Exploring Jailbreak Attacks on LLMs through Intent Concealment and Diversion
by: Cui, Tiehan, et al.
Published: (2025)
by: Cui, Tiehan, et al.
Published: (2025)
BioMedSearch: A Multi-Source Biomedical Retrieval Framework Based on LLMs
by: Liu, Congying, et al.
Published: (2025)
by: Liu, Congying, et al.
Published: (2025)
From LLMs to MLLMs to Agents: A Survey of Emerging Paradigms in Jailbreak Attacks and Defenses within LLM Ecosystem
by: Mao, Yanxu, et al.
Published: (2025)
by: Mao, Yanxu, et al.
Published: (2025)
ProtRLSearch: A Multi-Round Multimodal Protein Search Agent with Large Language Models Trained via Reinforcement Learning
by: Liu, Congying, et al.
Published: (2026)
by: Liu, Congying, et al.
Published: (2026)
GEGA: Graph Convolutional Networks and Evidence Retrieval Guided Attention for Enhanced Document-level Relation Extraction
by: Mao, Yanxu, et al.
Published: (2024)
by: Mao, Yanxu, et al.
Published: (2024)
RRTL: Red Teaming Reasoning Large Language Models in Tool Learning
by: Liu, Yifei, et al.
Published: (2025)
by: Liu, Yifei, et al.
Published: (2025)
Prompt Optimization and Evaluation for LLM Automated Red Teaming
by: Freenor, Michael, et al.
Published: (2025)
by: Freenor, Michael, et al.
Published: (2025)
Hybrid Multi-stage Decoding for Few-shot NER with Entity-aware Contrastive Learning
by: Liu, Congying, et al.
Published: (2024)
by: Liu, Congying, et al.
Published: (2024)
TroubleLLM: Align to Red Team Expert
by: Xu, Zhuoer, et al.
Published: (2024)
by: Xu, Zhuoer, et al.
Published: (2024)
Adaptive Stopping for Multi-Turn LLM Reasoning
by: Zhou, Xiaofan, et al.
Published: (2026)
by: Zhou, Xiaofan, et al.
Published: (2026)
SIRAJ: Diverse and Efficient Red-Teaming for LLM Agents via Distilled Structured Reasoning
by: Zhou, Kaiwen, et al.
Published: (2025)
by: Zhou, Kaiwen, et al.
Published: (2025)
SafeSearch: Automated Red-Teaming of LLM-Based Search Agents
by: Dong, Jianshuo, et al.
Published: (2025)
by: Dong, Jianshuo, et al.
Published: (2025)
AgentHallu: Benchmarking Automated Hallucination Attribution of LLM-based Agents
by: Liu, Xuannan, et al.
Published: (2026)
by: Liu, Xuannan, et al.
Published: (2026)
T^2Agent A Tool-augmented Multimodal Misinformation Detection Agent with Monte Carlo Tree Search
by: Cui, Xing, et al.
Published: (2025)
by: Cui, Xing, et al.
Published: (2025)
Efficient Universal Goal Hijacking with Semantics-guided Prompt Organization
by: Huang, Yihao, et al.
Published: (2024)
by: Huang, Yihao, et al.
Published: (2024)
AutoRed: A Free-form Adversarial Prompt Generation Framework for Automated Red Teaming
by: Diao, Muxi, et al.
Published: (2025)
by: Diao, Muxi, et al.
Published: (2025)
Be a Multitude to Itself: A Prompt Evolution Framework for Red Teaming
by: Li, Rui, et al.
Published: (2025)
by: Li, Rui, et al.
Published: (2025)
MIRAGE: Multimodal Immersive Reasoning and Guided Exploration for Red-Team Jailbreak Attacks
by: You, Wenhao, et al.
Published: (2025)
by: You, Wenhao, et al.
Published: (2025)
T-MAP: Red-Teaming LLM Agents with Trajectory-aware Evolutionary Search
by: Lee, Hyomin, et al.
Published: (2026)
by: Lee, Hyomin, et al.
Published: (2026)
RedDebate: Safer Responses Through Multi-Agent Red Teaming Debates
by: Asad, Ali, et al.
Published: (2025)
by: Asad, Ali, et al.
Published: (2025)
ASTPrompter: Preference-Aligned Automated Language Model Red-Teaming to Generate Low-Perplexity Unsafe Prompts
by: Hardy, Amelia F., et al.
Published: (2024)
by: Hardy, Amelia F., et al.
Published: (2024)
Answer Convergence as a Signal for Early Stopping in Reasoning
by: Liu, Xin, et al.
Published: (2025)
by: Liu, Xin, et al.
Published: (2025)
STAR-Teaming: A Strategy-Response Multiplex Network Approach to Automated LLM Red Teaming
by: Jung, MinJae, et al.
Published: (2026)
by: Jung, MinJae, et al.
Published: (2026)
Prompting4Debugging: Red-Teaming Text-to-Image Diffusion Models by Finding Problematic Prompts
by: Chin, Zhi-Yi, et al.
Published: (2023)
by: Chin, Zhi-Yi, et al.
Published: (2023)
Red Teaming Visual Language Models
by: Li, Mukai, et al.
Published: (2024)
by: Li, Mukai, et al.
Published: (2024)
Red Teaming Multimodal Language Models: Evaluating Harm Across Prompt Modalities and Models
by: Van Doren, Madison, et al.
Published: (2025)
by: Van Doren, Madison, et al.
Published: (2025)
RedTWIZ: Diverse LLM Red Teaming via Adaptive Attack Planning
by: Horal, Artur, et al.
Published: (2025)
by: Horal, Artur, et al.
Published: (2025)
Understanding Network Behaviors through Natural Language Question-Answering
by: Xing, Mingzhe, et al.
Published: (2025)
by: Xing, Mingzhe, et al.
Published: (2025)
LeechHijack: Covert Computational Resource Exploitation in Intelligent Agent Systems
by: Zhang, Yuanhe, et al.
Published: (2025)
by: Zhang, Yuanhe, et al.
Published: (2025)
PARASITE: Conditional System Prompt Poisoning to Hijack LLMs
by: Pham, Viet, et al.
Published: (2025)
by: Pham, Viet, et al.
Published: (2025)
Toxicity Red-Teaming: Benchmarking LLM Safety in Singapore's Low-Resource Languages
by: Hu, Yujia, et al.
Published: (2025)
by: Hu, Yujia, et al.
Published: (2025)
StockBench: Can LLM Agents Trade Stocks Profitably In Real-world Markets?
by: Chen, Yanxu, et al.
Published: (2025)
by: Chen, Yanxu, et al.
Published: (2025)
Stop When Enough: Adaptive Early-Stopping for Chain-of-Thought Reasoning
by: Sun, Renliang, et al.
Published: (2025)
by: Sun, Renliang, et al.
Published: (2025)
ReGenesis: LLMs can Grow into Reasoning Generalists via Self-Improvement
by: Peng, Xiangyu, et al.
Published: (2024)
by: Peng, Xiangyu, et al.
Published: (2024)
Red-Bandit: Test-Time Adaptation for LLM Red-Teaming via Bandit-Guided LoRA Experts
by: Ziakas, Christos, et al.
Published: (2025)
by: Ziakas, Christos, et al.
Published: (2025)
Tiny Refinements Elicit Resilience: Toward Efficient Prefix-Model Against LLM Red-Teaming
by: Liu, Jiaxu, et al.
Published: (2024)
by: Liu, Jiaxu, et al.
Published: (2024)
Embodied LLM Agents Learn to Cooperate in Organized Teams
by: Guo, Xudong, et al.
Published: (2024)
by: Guo, Xudong, et al.
Published: (2024)
Similar Items
-
Low-Resource Fast Text Classification Based on Intra-Class and Inter-Class Distance Calculation
by: Mao, Yanxu, et al.
Published: (2024) -
Divide and Conquer: A Hybrid Strategy Defeats Multimodal Large Language Models
by: Mao, Yanxu, et al.
Published: (2024) -
NEXUS: Continual Learning of Symbolic Constraints for Safe and Robust Embodied Planning
by: Cui, Tiehan, et al.
Published: (2026) -
Exploring Jailbreak Attacks on LLMs through Intent Concealment and Diversion
by: Cui, Tiehan, et al.
Published: (2025) -
BioMedSearch: A Multi-Source Biomedical Retrieval Framework Based on LLMs
by: Liu, Congying, et al.
Published: (2025)