Two Birds with One Stone: Multi-Task Detection and Attribution of LLM-Generated Text
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Rao, Zixin, Mohamed, Youssef, Liu, Shang, Liu, Zeyan |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
On the Detectability of ChatGPT Content: Benchmarking, Methodology, and Evaluation through the Lens of Academic Writing
par: Liu, Zeyan, et autres
Publié: (2023)
par: Liu, Zeyan, et autres
Publié: (2023)
One Stone, Two Birds: Enhancing Adversarial Defense Through the Lens of Distributional Discrepancy
par: Zhang, Jiacheng, et autres
Publié: (2025)
par: Zhang, Jiacheng, et autres
Publié: (2025)
FreqMark: Frequency-Based Watermark for Sentence-Level Detection of LLM-Generated Text
par: Xu, Zhenyu, et autres
Publié: (2024)
par: Xu, Zhenyu, et autres
Publié: (2024)
The Canary's Echo: Auditing Privacy Risks of LLM-Generated Synthetic Text
par: Meeus, Matthieu, et autres
Publié: (2025)
par: Meeus, Matthieu, et autres
Publié: (2025)
IncogniText: Privacy-enhancing Conditional Text Anonymization via LLM-based Private Attribute Randomization
par: Frikha, Ahmed, et autres
Publié: (2024)
par: Frikha, Ahmed, et autres
Publié: (2024)
Humanizing Machine-Generated Content: Evading AI-Text Detection through Adversarial Attack
par: Zhou, Ying, et autres
Publié: (2024)
par: Zhou, Ying, et autres
Publié: (2024)
DP-MGTD: Privacy-Preserving Machine-Generated Text Detection via Adaptive Differentially Private Entity Sanitization
par: Wang, Lionel Z., et autres
Publié: (2026)
par: Wang, Lionel Z., et autres
Publié: (2026)
TextSeal: A Localized LLM Watermark for Provenance & Distillation Protection
par: Sander, Tom, et autres
Publié: (2026)
par: Sander, Tom, et autres
Publié: (2026)
Differentially Private Synthetic Text Generation for Retrieval-Augmented Generation (RAG)
par: Mori, Junki, et autres
Publié: (2025)
par: Mori, Junki, et autres
Publié: (2025)
MARAGE: Transferable Multi-Model Adversarial Attack for Retrieval-Augmented Generation Data Extraction
par: Hu, Xiao, et autres
Publié: (2025)
par: Hu, Xiao, et autres
Publié: (2025)
GRAID: Synthetic Data Generation with Geometric Constraints and Multi-Agentic Reflection for Harmful Content Detection
par: Rad, Melissa Kazemi, et autres
Publié: (2025)
par: Rad, Melissa Kazemi, et autres
Publié: (2025)
Beyond Indistinguishability: Measuring Extraction Risk in LLM APIs
par: Liu, Ruixuan, et autres
Publié: (2026)
par: Liu, Ruixuan, et autres
Publié: (2026)
Synthetic Data Can Mislead Evaluations: Membership Inference as Machine Text Detection
par: Naseh, Ali, et autres
Publié: (2025)
par: Naseh, Ali, et autres
Publié: (2025)
Differentially Private Knowledge Distillation via Synthetic Text Generation
par: Flemings, James, et autres
Publié: (2024)
par: Flemings, James, et autres
Publié: (2024)
De-Anonymization at Scale via Tournament-Style Attribution
par: Zhang, Lirui, et autres
Publié: (2026)
par: Zhang, Lirui, et autres
Publié: (2026)
MIA-Tuner: Adapting Large Language Models as Pre-training Text Detector
par: Fu, Wenjie, et autres
Publié: (2024)
par: Fu, Wenjie, et autres
Publié: (2024)
AutoDefense: Multi-Agent LLM Defense against Jailbreak Attacks
par: Zeng, Yifan, et autres
Publié: (2024)
par: Zeng, Yifan, et autres
Publié: (2024)
InvisibleInk: High-Utility and Low-Cost Text Generation with Differential Privacy
par: Vinod, Vishnu, et autres
Publié: (2025)
par: Vinod, Vishnu, et autres
Publié: (2025)
On Calibration of LLM-based Guard Models for Reliable Content Moderation
par: Liu, Hongfu, et autres
Publié: (2024)
par: Liu, Hongfu, et autres
Publié: (2024)
AdvJudge-Zero: Binary Decision Flips in LLM-as-a-Judge via Adversarial Control Tokens
par: Li, Tung-Ling, et autres
Publié: (2025)
par: Li, Tung-Ling, et autres
Publié: (2025)
Chain of Attack: a Semantic-Driven Contextual Multi-Turn attacker for LLM
par: Yang, Xikang, et autres
Publié: (2024)
par: Yang, Xikang, et autres
Publié: (2024)
Text-CRS: A Generalized Certified Robustness Framework against Textual Adversarial Attacks
par: Zhang, Xinyu, et autres
Publié: (2023)
par: Zhang, Xinyu, et autres
Publié: (2023)
Humanizing the Machine: Proxy Attacks to Mislead LLM Detectors
par: Wang, Tianchun, et autres
Publié: (2024)
par: Wang, Tianchun, et autres
Publié: (2024)
k-SemStamp: A Clustering-Based Semantic Watermark for Detection of Machine-Generated Text
par: Hou, Abe Bohan, et autres
Publié: (2024)
par: Hou, Abe Bohan, et autres
Publié: (2024)
ContinuousBench: Can Differentially Private Synthetic Text Improve Capabilities?
par: Liu, Peihan, et autres
Publié: (2026)
par: Liu, Peihan, et autres
Publié: (2026)
The Hidden Cost of Modeling P(X): Vulnerability to Membership Inference Attacks in Generative Text Classifiers
par: Makroo, Owais, et autres
Publié: (2025)
par: Makroo, Owais, et autres
Publié: (2025)
STAR: Detecting Inference-time Backdoors in LLM Reasoning via State-Transition Amplification Ratio
par: Park, Seong-Gyu, et autres
Publié: (2026)
par: Park, Seong-Gyu, et autres
Publié: (2026)
Steering Dialogue Dynamics for Robustness against Multi-turn Jailbreaking Attacks
par: Hu, Hanjiang, et autres
Publié: (2025)
par: Hu, Hanjiang, et autres
Publié: (2025)
Is poisoning a real threat to LLM alignment? Maybe more so than you think
par: Pathmanathan, Pankayaraj, et autres
Publié: (2024)
par: Pathmanathan, Pankayaraj, et autres
Publié: (2024)
Prompt2Fingerprint: Plug-and-Play LLM Fingerprinting via Text-to-Weight Generation
par: Chen, Sixu, et autres
Publié: (2026)
par: Chen, Sixu, et autres
Publié: (2026)
On Evaluating The Performance of Watermarked Machine-Generated Texts Under Adversarial Attacks
par: Liu, Zesen, et autres
Publié: (2024)
par: Liu, Zesen, et autres
Publié: (2024)
Can Federated Learning Safeguard Private Data in LLM Training? Vulnerabilities, Attacks, and Defense Evaluation
par: Guo, Wenkai, et autres
Publié: (2025)
par: Guo, Wenkai, et autres
Publié: (2025)
Digger: Detecting Copyright Content Mis-usage in Large Language Model Training
par: Li, Haodong, et autres
Publié: (2024)
par: Li, Haodong, et autres
Publié: (2024)
Detecting Pretraining Data from Large Language Models
par: Shi, Weijia, et autres
Publié: (2023)
par: Shi, Weijia, et autres
Publié: (2023)
Graded Suspiciousness of Adversarial Texts to Human
par: Tonni, Shakila Mahjabin, et autres
Publié: (2024)
par: Tonni, Shakila Mahjabin, et autres
Publié: (2024)
The Task Shield: Enforcing Task Alignment to Defend Against Indirect Prompt Injection in LLM Agents
par: Jia, Feiran, et autres
Publié: (2024)
par: Jia, Feiran, et autres
Publié: (2024)
Privacy-Preserving Transformers: SwiftKey's Differential Privacy Implementation
par: Abouelenin, Abdelrahman, et autres
Publié: (2025)
par: Abouelenin, Abdelrahman, et autres
Publié: (2025)
IDT: Dual-Task Adversarial Attacks for Privacy Protection
par: Faustini, Pedro, et autres
Publié: (2024)
par: Faustini, Pedro, et autres
Publié: (2024)
Mark Your LLM: Detecting the Misuse of Open-Source Large Language Models via Watermarking
par: Xu, Yijie, et autres
Publié: (2025)
par: Xu, Yijie, et autres
Publié: (2025)
Privacy-Preserving Synthetic Review Generation with Diverse Writing Styles Using LLMs
par: Atwal, Tevin, et autres
Publié: (2025)
par: Atwal, Tevin, et autres
Publié: (2025)
Documents similaires
-
On the Detectability of ChatGPT Content: Benchmarking, Methodology, and Evaluation through the Lens of Academic Writing
par: Liu, Zeyan, et autres
Publié: (2023) -
One Stone, Two Birds: Enhancing Adversarial Defense Through the Lens of Distributional Discrepancy
par: Zhang, Jiacheng, et autres
Publié: (2025) -
FreqMark: Frequency-Based Watermark for Sentence-Level Detection of LLM-Generated Text
par: Xu, Zhenyu, et autres
Publié: (2024) -
The Canary's Echo: Auditing Privacy Risks of LLM-Generated Synthetic Text
par: Meeus, Matthieu, et autres
Publié: (2025) -
IncogniText: Privacy-enhancing Conditional Text Anonymization via LLM-based Private Attribute Randomization
par: Frikha, Ahmed, et autres
Publié: (2024)