When Search Goes Wrong: Red-Teaming Web-Augmented Large Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Ou, Haoran, Chen, Kangjie, Han, Xingshuo, Deng, Gelei, Zhang, Jie, Qiu, Han, Zhang, Tianwei |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
DECEIVE-AFC: Adversarial Claim Attacks against Search-Enabled LLM-based Fact-Checking Systems
por: Ou, Haoran, et al.
Publicado: (2026)
por: Ou, Haoran, et al.
Publicado: (2026)
Oedipus: LLM-enchanced Reasoning CAPTCHA Solver
por: Deng, Gelei, et al.
Publicado: (2024)
por: Deng, Gelei, et al.
Publicado: (2024)
IRCopilot: Automated Incident Response with Large Language Models
por: Lin, Xihuan, et al.
Publicado: (2025)
por: Lin, Xihuan, et al.
Publicado: (2025)
ART: Automatic Red-teaming for Text-to-Image Models to Protect Benign Users
por: Li, Guanlin, et al.
Publicado: (2024)
por: Li, Guanlin, et al.
Publicado: (2024)
SafeSearch: Automated Red-Teaming of LLM-Based Search Agents
por: Dong, Jianshuo, et al.
Publicado: (2025)
por: Dong, Jianshuo, et al.
Publicado: (2025)
Capacitive Touchscreens at Risk: A Practical Side-Channel Attack on Smartphones via Electromagnetic Emanations
por: Cheng, Yukun, et al.
Publicado: (2026)
por: Cheng, Yukun, et al.
Publicado: (2026)
Pandora: Jailbreak GPTs by Retrieval Augmented Generation Poisoning
por: Deng, Gelei, et al.
Publicado: (2024)
por: Deng, Gelei, et al.
Publicado: (2024)
Towards Action Hijacking of Large Language Model-based Agent
por: Zhang, Yuyang, et al.
Publicado: (2024)
por: Zhang, Yuyang, et al.
Publicado: (2024)
What Makes a Good LLM Agent for Real-world Penetration Testing?
por: Deng, Gelei, et al.
Publicado: (2026)
por: Deng, Gelei, et al.
Publicado: (2026)
MasterKey: Automated Jailbreak Across Multiple Large Language Model Chatbots
por: Deng, Gelei, et al.
Publicado: (2023)
por: Deng, Gelei, et al.
Publicado: (2023)
Resource Consumption Red-Teaming for Large Vision-Language Models
por: Gao, Haoran, et al.
Publicado: (2025)
por: Gao, Haoran, et al.
Publicado: (2025)
ObfusBFA: A Holistic Approach to Safeguarding DNNs from Different Types of Bit-Flip Attacks
por: Yan, Xiaobei, et al.
Publicado: (2025)
por: Yan, Xiaobei, et al.
Publicado: (2025)
SSD: A State-based Stealthy Backdoor Attack For Navigation System in UAV Route Planning
por: Wang, Zhaoxuan, et al.
Publicado: (2025)
por: Wang, Zhaoxuan, et al.
Publicado: (2025)
BitHydra: Towards Bit-flip Inference Cost Attack against Large Language Models
por: Yan, Xiaobei, et al.
Publicado: (2025)
por: Yan, Xiaobei, et al.
Publicado: (2025)
SwitchPatch: Physical Adversarial Attack Strategy with Switchable Adversarial Objectives
por: Jiang, Hanrui, et al.
Publicado: (2025)
por: Jiang, Hanrui, et al.
Publicado: (2025)
AutoEG: Exploiting Known Third-Party Vulnerabilities in Black-Box Web Applications
por: Yang, Ruozhao, et al.
Publicado: (2026)
por: Yang, Ruozhao, et al.
Publicado: (2026)
Enhancing Model Defense Against Jailbreaks with Proactive Safety Reasoning
por: Yang, Xianglin, et al.
Publicado: (2025)
por: Yang, Xianglin, et al.
Publicado: (2025)
BadLingual: A Novel Lingual-Backdoor Attack against Large Language Models
por: Wang, Zihan, et al.
Publicado: (2025)
por: Wang, Zihan, et al.
Publicado: (2025)
Learning-Based Automated Adversarial Red-Teaming for Robustness Evaluation of Large Language Models
por: Wei, Zhang, et al.
Publicado: (2025)
por: Wei, Zhang, et al.
Publicado: (2025)
Membership Inference Attacks Against Video Large Language Models
por: Song, Wei, et al.
Publicado: (2026)
por: Song, Wei, et al.
Publicado: (2026)
Character as a Latent Variable in Large Language Models: A Mechanistic Account of Emergent Misalignment and Conditional Safety Failures
por: Su, Yanghao, et al.
Publicado: (2026)
por: Su, Yanghao, et al.
Publicado: (2026)
InferDPT: Privacy-Preserving Inference for Closed-box Large Language Model
por: Tong, Meng, et al.
Publicado: (2023)
por: Tong, Meng, et al.
Publicado: (2023)
State-Dependent Safety Failures in Multi-Turn Language Model Interaction
por: Li, Pengcheng, et al.
Publicado: (2026)
por: Li, Pengcheng, et al.
Publicado: (2026)
DeepSweep: An Evaluation Framework for Mitigating DNN Backdoor Attacks using Data Augmentation
por: Qiu, Han, et al.
Publicado: (2020)
por: Qiu, Han, et al.
Publicado: (2020)
An Engorgio Prompt Makes Large Language Model Babble on
por: Dong, Jianshuo, et al.
Publicado: (2024)
por: Dong, Jianshuo, et al.
Publicado: (2024)
Trojan Activation Attack: Red-Teaming Large Language Models using Activation Steering for Safety-Alignment
por: Wang, Haoran, et al.
Publicado: (2023)
por: Wang, Haoran, et al.
Publicado: (2023)
Red Teaming Large Reasoning Models
por: Chen, Jiawei, et al.
Publicado: (2025)
por: Chen, Jiawei, et al.
Publicado: (2025)
SafeRedir: Prompt Embedding Redirection for Robust Unlearning in Image Generation Models
por: Liu, Renyang, et al.
Publicado: (2026)
por: Liu, Renyang, et al.
Publicado: (2026)
DREAM: Scalable Red Teaming for Text-to-Image Generative Systems via Distribution Modeling
por: Li, Boheng, et al.
Publicado: (2025)
por: Li, Boheng, et al.
Publicado: (2025)
PRIVMARK: Private Large Language Models Watermarking with MPC
por: Fargues, Thomas, et al.
Publicado: (2025)
por: Fargues, Thomas, et al.
Publicado: (2025)
Towards Effective Prompt Stealing Attack against Text-to-Image Diffusion Models
por: Zhao, Shiqian, et al.
Publicado: (2025)
por: Zhao, Shiqian, et al.
Publicado: (2025)
A Comprehensive Study of Jailbreak Attack versus Defense for Large Language Models
por: Xu, Zihao, et al.
Publicado: (2024)
por: Xu, Zihao, et al.
Publicado: (2024)
Digger: Detecting Copyright Content Mis-usage in Large Language Model Training
por: Li, Haodong, et al.
Publicado: (2024)
por: Li, Haodong, et al.
Publicado: (2024)
Image-Based Geolocation Using Large Vision-Language Models
por: Liu, Yi, et al.
Publicado: (2024)
por: Liu, Yi, et al.
Publicado: (2024)
RedAgent: Red Teaming Large Language Models with Context-aware Autonomous Language Agent
por: Xu, Huiyu, et al.
Publicado: (2024)
por: Xu, Huiyu, et al.
Publicado: (2024)
CORVUS: Red-Teaming Hallucination Detectors via Internal Signal Camouflage in Large Language Models
por: Min, Nay Myat, et al.
Publicado: (2026)
por: Min, Nay Myat, et al.
Publicado: (2026)
Turning Bias into Bugs: Bandit-Guided Style Manipulation Attacks on LLM Judges
por: Yang, Xianglin, et al.
Publicado: (2026)
por: Yang, Xianglin, et al.
Publicado: (2026)
When Scanners Lie: Evaluator Instability in LLM Red-Teaming
por: Erez, Lidor, et al.
Publicado: (2026)
por: Erez, Lidor, et al.
Publicado: (2026)
Auto-RT: Automatic Jailbreak Strategy Exploration for Red-Teaming Large Language Models
por: Liu, Yanjiang, et al.
Publicado: (2025)
por: Liu, Yanjiang, et al.
Publicado: (2025)
Red-Teaming LLM Multi-Agent Systems via Communication Attacks
por: He, Pengfei, et al.
Publicado: (2025)
por: He, Pengfei, et al.
Publicado: (2025)
Ejemplares similares
-
DECEIVE-AFC: Adversarial Claim Attacks against Search-Enabled LLM-based Fact-Checking Systems
por: Ou, Haoran, et al.
Publicado: (2026) -
Oedipus: LLM-enchanced Reasoning CAPTCHA Solver
por: Deng, Gelei, et al.
Publicado: (2024) -
IRCopilot: Automated Incident Response with Large Language Models
por: Lin, Xihuan, et al.
Publicado: (2025) -
ART: Automatic Red-teaming for Text-to-Image Models to Protect Benign Users
por: Li, Guanlin, et al.
Publicado: (2024) -
SafeSearch: Automated Red-Teaming of LLM-Based Search Agents
por: Dong, Jianshuo, et al.
Publicado: (2025)