Rubrics as an Attack Surface: Stealthy Preference Drift in LLM Judges
Fuente:
arXiv
Salvato in:
| Autori principali: | Ding, Ruomeng, Pang, Yifei, Sun, He, Wang, Yizhong, Wu, Zhiwei Steven, Deng, Zhun |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Unlearned but Not Forgotten: Data Extraction after Exact Unlearning in LLM
di: Wu, Xiaoyu, et al.
Pubblicazione: (2025)
di: Wu, Xiaoyu, et al.
Pubblicazione: (2025)
Stealthy Backdoor Attacks against LLMs Based on Natural Style Triggers
di: Wei, Jiali, et al.
Pubblicazione: (2026)
di: Wei, Jiali, et al.
Pubblicazione: (2026)
Graph of Attacks with Pruning: Optimizing Stealthy Jailbreak Prompt Generation for Enhanced LLM Content Moderation
di: Schwartz, Daniel, et al.
Pubblicazione: (2025)
di: Schwartz, Daniel, et al.
Pubblicazione: (2025)
BadJudge: Backdoor Vulnerabilities of LLM-as-a-Judge
di: Tong, Terry, et al.
Pubblicazione: (2025)
di: Tong, Terry, et al.
Pubblicazione: (2025)
WebSentinel: Detecting and Localizing Prompt Injection Attacks for Web Agents
di: Wang, Xilong, et al.
Pubblicazione: (2026)
di: Wang, Xilong, et al.
Pubblicazione: (2026)
A Reward-driven Automated Webshell Malicious-code Generator for Red-teaming
di: Ding, Yizhong
Pubblicazione: (2025)
di: Ding, Yizhong
Pubblicazione: (2025)
ShellForge: Adversarial Co-Evolution of Webshell Generation and Multi-View Detection for Robust Webshell Defense
di: Ding, Yizhong
Pubblicazione: (2026)
di: Ding, Yizhong
Pubblicazione: (2026)
Invisible to Humans, Triggered by Agents: Stealthy Jailbreak Attacks on Mobile Vision-Language Agents
di: Ding, Renhua, et al.
Pubblicazione: (2025)
di: Ding, Renhua, et al.
Pubblicazione: (2025)
SilentDrift: Exploiting Action Chunking for Stealthy Backdoor Attacks on Vision-Language-Action Models
di: Xu, Bingxin, et al.
Pubblicazione: (2026)
di: Xu, Bingxin, et al.
Pubblicazione: (2026)
Optimization-based Prompt Injection Attack to LLM-as-a-Judge
di: Shi, Jiawen, et al.
Pubblicazione: (2024)
di: Shi, Jiawen, et al.
Pubblicazione: (2024)
Winning the MIDST Challenge: New Membership Inference Attacks on Diffusion Models for Tabular Data Synthesis
di: Wu, Xiaoyu, et al.
Pubblicazione: (2025)
di: Wu, Xiaoyu, et al.
Pubblicazione: (2025)
SNEAKDOOR: Stealthy Backdoor Attacks against Distribution Matching-based Dataset Condensation
di: Yang, He, et al.
Pubblicazione: (2026)
di: Yang, He, et al.
Pubblicazione: (2026)
BadAgent: Inserting and Activating Backdoor Attacks in LLM Agents
di: Wang, Yifei, et al.
Pubblicazione: (2024)
di: Wang, Yifei, et al.
Pubblicazione: (2024)
Stealthy and Persistent Unalignment on Large Language Models via Backdoor Injections
di: Cao, Yuanpu, et al.
Pubblicazione: (2023)
di: Cao, Yuanpu, et al.
Pubblicazione: (2023)
Towards Effective, Stealthy, and Persistent Backdoor Attacks Targeting Graph Foundation Models
di: Luo, Jiayi, et al.
Pubblicazione: (2025)
di: Luo, Jiayi, et al.
Pubblicazione: (2025)
LoopLLM: Transferable Energy-Latency Attacks in LLMs via Repetitive Generation
di: Li, Xingyu, et al.
Pubblicazione: (2025)
di: Li, Xingyu, et al.
Pubblicazione: (2025)
Supply-Chain Poisoning Attacks Against LLM Coding Agent Skill Ecosystems
di: Qu, Yubin, et al.
Pubblicazione: (2026)
di: Qu, Yubin, et al.
Pubblicazione: (2026)
Learnable Linguistic Watermarks for Tracing Model Extraction Attacks on Large Language Models
di: Bai, Minhao, et al.
Pubblicazione: (2024)
di: Bai, Minhao, et al.
Pubblicazione: (2024)
GradingAttack: Exposing Security Vulnerabilities in LLM Based Educational Grading Agents
di: Li, Xueyi, et al.
Pubblicazione: (2026)
di: Li, Xueyi, et al.
Pubblicazione: (2026)
Stealthy Backdoor Attack to Real-world Models in Android Apps
di: Wei, Jiali, et al.
Pubblicazione: (2025)
di: Wei, Jiali, et al.
Pubblicazione: (2025)
Hiding in Plain Sight: A Steganographic Approach to Stealthy LLM Jailbreaks
di: Geng, Jianing, et al.
Pubblicazione: (2025)
di: Geng, Jianing, et al.
Pubblicazione: (2025)
Geneshift: Impact of different scenario shift on Jailbreaking LLM
di: Wu, Tianyi, et al.
Pubblicazione: (2025)
di: Wu, Tianyi, et al.
Pubblicazione: (2025)
IP Leakage Attacks Targeting LLM-Based Multi-Agent Systems
di: Wang, Liwen, et al.
Pubblicazione: (2025)
di: Wang, Liwen, et al.
Pubblicazione: (2025)
ADMIT: Few-shot Knowledge Poisoning Attacks on RAG-based Fact Checking
di: Wu, Yutao, et al.
Pubblicazione: (2025)
di: Wu, Yutao, et al.
Pubblicazione: (2025)
Hijacking Agent Memory: Stealthy Trojan Attacks Through Conversational Interaction
di: Wang, Hongtao, et al.
Pubblicazione: (2026)
di: Wang, Hongtao, et al.
Pubblicazione: (2026)
Eguard: Defending LLM Embeddings Against Inversion Attacks via Text Mutual Information Optimization
di: Liu, Tiantian, et al.
Pubblicazione: (2024)
di: Liu, Tiantian, et al.
Pubblicazione: (2024)
Shadowcast: Stealthy Data Poisoning Attacks Against Vision-Language Models
di: Xu, Yuancheng, et al.
Pubblicazione: (2024)
di: Xu, Yuancheng, et al.
Pubblicazione: (2024)
Reasoning-Style Poisoning of LLM Agents via Stealthy Style Transfer: Process-Level Attacks and Runtime Monitoring in RSV Space
di: Zhou, Xingfu, et al.
Pubblicazione: (2025)
di: Zhou, Xingfu, et al.
Pubblicazione: (2025)
Is Monitoring Enough? Strategic Agent Selection For Stealthy Attack in Multi-Agent Discussions
di: Xiang, Qiuchi, et al.
Pubblicazione: (2026)
di: Xiang, Qiuchi, et al.
Pubblicazione: (2026)
FlowMur: A Stealthy and Practical Audio Backdoor Attack with Limited Knowledge
di: Lan, Jiahe, et al.
Pubblicazione: (2023)
di: Lan, Jiahe, et al.
Pubblicazione: (2023)
LLM-Virus: Evolutionary Jailbreak Attack on Large Language Models
di: Yu, Miao, et al.
Pubblicazione: (2024)
di: Yu, Miao, et al.
Pubblicazione: (2024)
PBI-Attack: Prior-Guided Bimodal Interactive Black-Box Jailbreak Attack for Toxicity Maximization
di: Cheng, Ruoxi, et al.
Pubblicazione: (2024)
di: Cheng, Ruoxi, et al.
Pubblicazione: (2024)
DrAttack: Prompt Decomposition and Reconstruction Makes Powerful LLM Jailbreakers
di: Li, Xirui, et al.
Pubblicazione: (2024)
di: Li, Xirui, et al.
Pubblicazione: (2024)
Turning Bias into Bugs: Bandit-Guided Style Manipulation Attacks on LLM Judges
di: Yang, Xianglin, et al.
Pubblicazione: (2026)
di: Yang, Xianglin, et al.
Pubblicazione: (2026)
Hammering the Diagnosis: Rowhammer-Induced Stealthy Trojan Attacks on ViT-Based Medical Imaging
di: Latibari, Banafsheh Saber, et al.
Pubblicazione: (2025)
di: Latibari, Banafsheh Saber, et al.
Pubblicazione: (2025)
Beyond Max Tokens: Stealthy Resource Amplification via Tool Calling Chains in LLM Agents
di: Zhou, Kaiyu, et al.
Pubblicazione: (2026)
di: Zhou, Kaiyu, et al.
Pubblicazione: (2026)
Transferable & Stealthy Ensemble Attacks: A Black-Box Jailbreaking Framework for Large Language Models
di: Yang, Yiqi, et al.
Pubblicazione: (2024)
di: Yang, Yiqi, et al.
Pubblicazione: (2024)
A Spatiotemporal Stealthy Backdoor Attack against Cooperative Multi-Agent Deep Reinforcement Learning
di: Yu, Yinbo, et al.
Pubblicazione: (2024)
di: Yu, Yinbo, et al.
Pubblicazione: (2024)
Stealthy Dual-Trigger Backdoors: Attacking Prompt Tuning in LM-Empowered Graph Foundation Models
di: Xue, Xiaoyu, et al.
Pubblicazione: (2025)
di: Xue, Xiaoyu, et al.
Pubblicazione: (2025)
WebWeaver: Breaking Topology Confidentiality in LLM Multi-Agent Systems with Stealthy Context-Based Inference
di: Xiong, Zixun, et al.
Pubblicazione: (2026)
di: Xiong, Zixun, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Unlearned but Not Forgotten: Data Extraction after Exact Unlearning in LLM
di: Wu, Xiaoyu, et al.
Pubblicazione: (2025) -
Stealthy Backdoor Attacks against LLMs Based on Natural Style Triggers
di: Wei, Jiali, et al.
Pubblicazione: (2026) -
Graph of Attacks with Pruning: Optimizing Stealthy Jailbreak Prompt Generation for Enhanced LLM Content Moderation
di: Schwartz, Daniel, et al.
Pubblicazione: (2025) -
BadJudge: Backdoor Vulnerabilities of LLM-as-a-Judge
di: Tong, Terry, et al.
Pubblicazione: (2025) -
WebSentinel: Detecting and Localizing Prompt Injection Attacks for Web Agents
di: Wang, Xilong, et al.
Pubblicazione: (2026)