Just Ask: Curious Code Agents Reveal System Prompts in Frontier LLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zheng, Xiang, Wu, Yutao, Huang, Hanxun, Li, Yige, Ma, Xingjun, Li, Bo, Jiang, Yu-Gang, Wang, Cong |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Internal Safety Collapse in Frontier Large Language Models
par: Wu, Yutao, et autres
Publié: (2026)
par: Wu, Yutao, et autres
Publié: (2026)
Expose Before You Defend: Unifying and Enhancing Backdoor Defenses via Exposed Models
par: Li, Yige, et autres
Publié: (2024)
par: Li, Yige, et autres
Publié: (2024)
Shortcuts Everywhere and Nowhere: Exploring Multi-Trigger Backdoor Attacks
par: Li, Yige, et autres
Publié: (2024)
par: Li, Yige, et autres
Publié: (2024)
Toward Universal and Transferable Jailbreak Attacks on Vision-Language Models
par: Cui, Kaiyuan, et autres
Publié: (2026)
par: Cui, Kaiyuan, et autres
Publié: (2026)
X-Transfer Attacks: Towards Super Transferable Adversarial Attacks on CLIP
par: Huang, Hanxun, et autres
Publié: (2025)
par: Huang, Hanxun, et autres
Publié: (2025)
Detecting Backdoor Samples in Contrastive Language Image Pretraining
par: Huang, Hanxun, et autres
Publié: (2025)
par: Huang, Hanxun, et autres
Publié: (2025)
BackdoorLLM: A Comprehensive Benchmark for Backdoor Attacks and Defenses on Large Language Models
par: Li, Yige, et autres
Publié: (2024)
par: Li, Yige, et autres
Publié: (2024)
Downstream Transfer Attack: Adversarial Attacks on Downstream Models with Pre-trained Vision Transformers
par: Zheng, Weijie, et autres
Publié: (2024)
par: Zheng, Weijie, et autres
Publié: (2024)
Backdoor4Good: Benchmarking Beneficial Uses of Backdoors in LLMs
par: Li, Yige, et autres
Publié: (2026)
par: Li, Yige, et autres
Publié: (2026)
PaperAsk: A Benchmark for Reliability Evaluation of LLMs in Paper Search and Reading
par: Wu, Yutao, et autres
Publié: (2025)
par: Wu, Yutao, et autres
Publié: (2025)
BackdoorVLM: A Benchmark for Backdoor Attacks on Vision-Language Models
par: Li, Juncheng, et autres
Publié: (2025)
par: Li, Juncheng, et autres
Publié: (2025)
AutoBackdoor: Automating Backdoor Attacks via LLM Agents
par: Li, Yige, et autres
Publié: (2025)
par: Li, Yige, et autres
Publié: (2025)
BackdoorAgent: A Unified Framework for Backdoor Attacks on LLM-based Agents
par: Feng, Yunhao, et autres
Publié: (2026)
par: Feng, Yunhao, et autres
Publié: (2026)
BlueSuffix: Reinforced Blue Teaming for Vision-Language Models Against Jailbreak Attacks
par: Zhao, Yunhan, et autres
Publié: (2024)
par: Zhao, Yunhan, et autres
Publié: (2024)
AttackVLA: Benchmarking Adversarial and Backdoor Attacks on Vision-Language-Action Models
par: Li, Jiayu, et autres
Publié: (2025)
par: Li, Jiayu, et autres
Publié: (2025)
T2UE: Generating Unlearnable Examples from Text Descriptions
par: Ma, Xingjun, et autres
Publié: (2025)
par: Ma, Xingjun, et autres
Publié: (2025)
Beyond Surface Judgments: Human-Grounded Risk Evaluation of LLM-Generated Disinformation
par: Xu, Zonghuan, et autres
Publié: (2026)
par: Xu, Zonghuan, et autres
Publié: (2026)
AgentHazard: A Benchmark for Evaluating Harmful Behavior in Computer-Use Agents
par: Feng, Yunhao, et autres
Publié: (2026)
par: Feng, Yunhao, et autres
Publié: (2026)
RedTopic: Toward Topic-Diverse Red Teaming of Large Language Models
par: Ding, Jiale, et autres
Publié: (2025)
par: Ding, Jiale, et autres
Publié: (2025)
Towards Million-Scale Adversarial Robustness Evaluation With Stronger Individual Attacks
par: Xie, Yong, et autres
Publié: (2024)
par: Xie, Yong, et autres
Publié: (2024)
Training Turn-by-Turn Verifiers for Dialogue Tutoring Agents: The Curious Case of LLMs as Your Coding Tutors
par: Wang, Jian, et autres
Publié: (2025)
par: Wang, Jian, et autres
Publié: (2025)
FedAPT: Federated Adversarial Prompt Tuning for Vision-Language Models
par: Zhai, Kun, et autres
Publié: (2025)
par: Zhai, Kun, et autres
Publié: (2025)
AIM: Additional Image Guided Generation of Transferable Adversarial Attacks
par: Li, Teng, et autres
Publié: (2025)
par: Li, Teng, et autres
Publié: (2025)
AgentAsk: Multi-Agent Systems Need to Ask
par: Lin, Bohan, et autres
Publié: (2025)
par: Lin, Bohan, et autres
Publié: (2025)
BraveGuard: From Open-World Threats to Safer Computer-Use Agents
par: Feng, Yunhao, et autres
Publié: (2026)
par: Feng, Yunhao, et autres
Publié: (2026)
GenBreak: Red Teaming Text-to-Image Generators Using Large Language Models
par: Wang, Zilong, et autres
Publié: (2025)
par: Wang, Zilong, et autres
Publié: (2025)
Just Ask for a Table: A Thirty-Token User Prompt Defeats Sponsored Recommendations in Twelve LLMs
par: Maier, Andreas, et autres
Publié: (2026)
par: Maier, Andreas, et autres
Publié: (2026)
End-to-End Anti-Backdoor Learning on Images and Time Series
par: Jiang, Yujing, et autres
Publié: (2024)
par: Jiang, Yujing, et autres
Publié: (2024)
DropVLA: An Action-Level Backdoor Attack on Vision-Language-Action Models
par: Xu, Zonghuan, et autres
Publié: (2025)
par: Xu, Zonghuan, et autres
Publié: (2025)
ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models
par: Zhao, Yunhan, et autres
Publié: (2026)
par: Zhao, Yunhan, et autres
Publié: (2026)
Constrained Intrinsic Motivation for Reinforcement Learning
par: Zheng, Xiang, et autres
Publié: (2024)
par: Zheng, Xiang, et autres
Publié: (2024)
Generative Data Refinement: Just Ask for Better Data
par: Jiang, Minqi, et autres
Publié: (2025)
par: Jiang, Minqi, et autres
Publié: (2025)
AudioMosaic: Contrastive Masked Audio Representation Learning
par: Huang, Hanxun, et autres
Publié: (2026)
par: Huang, Hanxun, et autres
Publié: (2026)
Adversarial Prompt Distillation for Vision-Language Models
par: Luo, Lin, et autres
Publié: (2024)
par: Luo, Lin, et autres
Publié: (2024)
BadPatch: Diffusion-Based Generation of Physical Adversarial Patches
par: Wang, Zhixiang, et autres
Publié: (2024)
par: Wang, Zhixiang, et autres
Publié: (2024)
RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming
par: Zheng, Xiang, et autres
Publié: (2025)
par: Zheng, Xiang, et autres
Publié: (2025)
NAP-Tuning: Neural Augmented Prompt Tuning for Adversarially Robust Vision-Language Models
par: Zhang, Jiaming, et autres
Publié: (2025)
par: Zhang, Jiaming, et autres
Publié: (2025)
AdvQDet: Detecting Query-Based Adversarial Attacks with Adversarial Contrastive Prompt Tuning
par: Wang, Xin, et autres
Publié: (2024)
par: Wang, Xin, et autres
Publié: (2024)
ADMIT: Few-shot Knowledge Poisoning Attacks on RAG-based Fact Checking
par: Wu, Yutao, et autres
Publié: (2025)
par: Wu, Yutao, et autres
Publié: (2025)
Adversarial Prompt Tuning for Vision-Language Models
par: Zhang, Jiaming, et autres
Publié: (2023)
par: Zhang, Jiaming, et autres
Publié: (2023)
Documents similaires
-
Internal Safety Collapse in Frontier Large Language Models
par: Wu, Yutao, et autres
Publié: (2026) -
Expose Before You Defend: Unifying and Enhancing Backdoor Defenses via Exposed Models
par: Li, Yige, et autres
Publié: (2024) -
Shortcuts Everywhere and Nowhere: Exploring Multi-Trigger Backdoor Attacks
par: Li, Yige, et autres
Publié: (2024) -
Toward Universal and Transferable Jailbreak Attacks on Vision-Language Models
par: Cui, Kaiyuan, et autres
Publié: (2026) -
X-Transfer Attacks: Towards Super Transferable Adversarial Attacks on CLIP
par: Huang, Hanxun, et autres
Publié: (2025)