Sequential Behavioral Watermarking for LLM Agents
Fuente:
arXiv
Salvato in:
| Autori principali: | An, Hyeseon, Park, Shinwoo, Kim, Dongsu, Han, Yo-Sub |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
DITTO: A Spoofing Attack Framework on Watermarked LLMs via Knowledge Distillation
di: An, Hyeseon, et al.
Pubblicazione: (2025)
di: An, Hyeseon, et al.
Pubblicazione: (2025)
Marking Code Without Breaking It: Code Watermarking for Detecting LLM-Generated Code
di: Kim, Jungin, et al.
Pubblicazione: (2025)
di: Kim, Jungin, et al.
Pubblicazione: (2025)
Linguistics-Aware Non-Distortionary LLM Watermarking
di: Park, Shinwoo, et al.
Pubblicazione: (2026)
di: Park, Shinwoo, et al.
Pubblicazione: (2026)
A Linguistics-Aware LLM Watermarking via Syntactic Predictability
di: Park, Shinwoo, et al.
Pubblicazione: (2025)
di: Park, Shinwoo, et al.
Pubblicazione: (2025)
WaterMod: Modular Token-Rank Partitioning for Probability-Balanced LLM Watermarking
di: Park, Shinwoo, et al.
Pubblicazione: (2025)
di: Park, Shinwoo, et al.
Pubblicazione: (2025)
Steering Language Models Before They Speak: Logit-Level Interventions
di: An, Hyeseon, et al.
Pubblicazione: (2026)
di: An, Hyeseon, et al.
Pubblicazione: (2026)
AgentMark: Utility-Preserving Behavioral Watermarking for Agents
di: Huang, Kaibo, et al.
Pubblicazione: (2026)
di: Huang, Kaibo, et al.
Pubblicazione: (2026)
LLM Watermark Evasion via Bias Inversion
di: Hwang, Jeongyeon, et al.
Pubblicazione: (2025)
di: Hwang, Jeongyeon, et al.
Pubblicazione: (2025)
From Intuition to Calibrated Judgment: A Rubric-Based Expert-Panel Study of Human Detection of LLM-Generated Korean Text
di: Park, Shinwoo, et al.
Pubblicazione: (2026)
di: Park, Shinwoo, et al.
Pubblicazione: (2026)
Character-Level Perturbations Disrupt LLM Watermarks
di: Zhang, Zhaoxi, et al.
Pubblicazione: (2025)
di: Zhang, Zhaoxi, et al.
Pubblicazione: (2025)
RTLMarker: Protecting LLM-Generated RTL Copyright via a Hardware Watermarking Framework
di: Wang, Kun, et al.
Pubblicazione: (2025)
di: Wang, Kun, et al.
Pubblicazione: (2025)
DLM-SWAI: Steering Diffusion Language Models Before They Unmask
di: An, Hyeseon, et al.
Pubblicazione: (2026)
di: An, Hyeseon, et al.
Pubblicazione: (2026)
MirrorMark: Generalizable Mirrored Sampling for Multi-bit LLM Watermarking
di: Jiang, Ya, et al.
Pubblicazione: (2026)
di: Jiang, Ya, et al.
Pubblicazione: (2026)
Enhancing LLM Watermark Resilience Against Both Scrubbing and Spoofing Attacks
di: Shen, Huanming, et al.
Pubblicazione: (2025)
di: Shen, Huanming, et al.
Pubblicazione: (2025)
Every Bit, Everywhere, All at Once: A Binomial Multibit LLM Watermark
di: Gloaguen, Thibaud, et al.
Pubblicazione: (2026)
di: Gloaguen, Thibaud, et al.
Pubblicazione: (2026)
Blind PRNG Hijacking: An Undetectable Integrity-Preserving Attack Against LLM Watermarking
di: You, Ziyang, et al.
Pubblicazione: (2026)
di: You, Ziyang, et al.
Pubblicazione: (2026)
CyBiasBench: Benchmarking Bias in LLM Agents for Cyber-Attack Scenarios
di: Lim, Taein, et al.
Pubblicazione: (2026)
di: Lim, Taein, et al.
Pubblicazione: (2026)
On Google's SynthID-Text LLM Watermarking System: Theoretical Analysis and Empirical Validation
di: Omidi, Romina, et al.
Pubblicazione: (2026)
di: Omidi, Romina, et al.
Pubblicazione: (2026)
Modification and Generated-Text Detection: Achieving Dual Detection Capabilities for the Outputs of LLM by Watermark
di: Cai, Yuhang, et al.
Pubblicazione: (2025)
di: Cai, Yuhang, et al.
Pubblicazione: (2025)
SWAP: Towards Copyright Auditing of Soft Prompts via Sequential Watermarking
di: Yang, Wenyuan, et al.
Pubblicazione: (2025)
di: Yang, Wenyuan, et al.
Pubblicazione: (2025)
A Unified Framework for LLM Watermarks
di: Gloaguen, Thibaud, et al.
Pubblicazione: (2026)
di: Gloaguen, Thibaud, et al.
Pubblicazione: (2026)
SEAL: Entangled White-box Watermarks on Low-Rank Adaptation
di: Oh, Giyeong, et al.
Pubblicazione: (2025)
di: Oh, Giyeong, et al.
Pubblicazione: (2025)
Beyond A Fixed Seal: Adaptive Stealing Watermark in Large Language Models
di: Zhang, Shuhao, et al.
Pubblicazione: (2026)
di: Zhang, Shuhao, et al.
Pubblicazione: (2026)
CEFW: A Comprehensive Evaluation Framework for Watermark in Large Language Models
di: Zhang, Shuhao, et al.
Pubblicazione: (2025)
di: Zhang, Shuhao, et al.
Pubblicazione: (2025)
Your Semantic-Independent Watermark is Fragile: A Semantic Perturbation Attack against EaaS Watermark
di: Fei, Zekun, et al.
Pubblicazione: (2024)
di: Fei, Zekun, et al.
Pubblicazione: (2024)
When Developer Aid Becomes Security Debt: A Systematic Analysis of Insecure Behaviors in LLM Coding Agents
di: Kozak, Matous, et al.
Pubblicazione: (2025)
di: Kozak, Matous, et al.
Pubblicazione: (2025)
PASA: A Principled Embedding-Space Watermarking Approach for LLM-Generated Text under Semantic-Invariant Attacks
di: Ai, Zhenxin, et al.
Pubblicazione: (2026)
di: Ai, Zhenxin, et al.
Pubblicazione: (2026)
Learning to Watermark: A Selective Watermarking Framework for Large Language Models via Multi-Objective Optimization
di: Wang, Chenrui, et al.
Pubblicazione: (2025)
di: Wang, Chenrui, et al.
Pubblicazione: (2025)
RouteGuard: Internal-Signal Detection of Skill Poisoning in LLM Agents
di: Xiao, Wenjie, et al.
Pubblicazione: (2026)
di: Xiao, Wenjie, et al.
Pubblicazione: (2026)
Detecting Benchmark Contamination Through Watermarking
di: Sander, Tom, et al.
Pubblicazione: (2025)
di: Sander, Tom, et al.
Pubblicazione: (2025)
Probabilistically Robust Watermarking of Neural Networks
di: Pautov, Mikhail, et al.
Pubblicazione: (2024)
di: Pautov, Mikhail, et al.
Pubblicazione: (2024)
A Survey of Fragile Model Watermarking
di: Gao, Zhenzhe, et al.
Pubblicazione: (2024)
di: Gao, Zhenzhe, et al.
Pubblicazione: (2024)
CheatAgent: Attacking LLM-Empowered Recommender Systems via LLM Agent
di: Ning, Liang-bo, et al.
Pubblicazione: (2025)
di: Ning, Liang-bo, et al.
Pubblicazione: (2025)
TrajAD: Trajectory Anomaly Detection for Trustworthy LLM Agents
di: Liu, Yibing, et al.
Pubblicazione: (2026)
di: Liu, Yibing, et al.
Pubblicazione: (2026)
Enhancing LLM-based Autonomous Driving Agents to Mitigate Perception Attacks
di: Song, Ruoyu, et al.
Pubblicazione: (2024)
di: Song, Ruoyu, et al.
Pubblicazione: (2024)
SSG: Logit-Balanced Vocabulary Partitioning for LLM Watermarking
di: Gu, Chenxi, et al.
Pubblicazione: (2026)
di: Gu, Chenxi, et al.
Pubblicazione: (2026)
Asking Back: Interaction-Layer Antidistillation Watermarks
di: Yang, Guang, et al.
Pubblicazione: (2026)
di: Yang, Guang, et al.
Pubblicazione: (2026)
Functional Subspace Watermarking for Large Language Models
di: Ding, Zikang, et al.
Pubblicazione: (2026)
di: Ding, Zikang, et al.
Pubblicazione: (2026)
The Coding Limits of Robust Watermarking for Generative Models
di: Francati, Danilo, et al.
Pubblicazione: (2025)
di: Francati, Danilo, et al.
Pubblicazione: (2025)
Multi-Designated Detector Watermarking for Language Models
di: Huang, Zhengan, et al.
Pubblicazione: (2024)
di: Huang, Zhengan, et al.
Pubblicazione: (2024)
Documenti analoghi
-
DITTO: A Spoofing Attack Framework on Watermarked LLMs via Knowledge Distillation
di: An, Hyeseon, et al.
Pubblicazione: (2025) -
Marking Code Without Breaking It: Code Watermarking for Detecting LLM-Generated Code
di: Kim, Jungin, et al.
Pubblicazione: (2025) -
Linguistics-Aware Non-Distortionary LLM Watermarking
di: Park, Shinwoo, et al.
Pubblicazione: (2026) -
A Linguistics-Aware LLM Watermarking via Syntactic Predictability
di: Park, Shinwoo, et al.
Pubblicazione: (2025) -
WaterMod: Modular Token-Rank Partitioning for Probability-Balanced LLM Watermarking
di: Park, Shinwoo, et al.
Pubblicazione: (2025)