Navigating the Shadows: Unveiling Effective Disturbances for Modern AI Content Detectors
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhou, Ying, He, Ben, Sun, Le |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Humanizing Machine-Generated Content: Evading AI-Text Detection through Adversarial Attack
par: Zhou, Ying, et autres
Publié: (2024)
par: Zhou, Ying, et autres
Publié: (2024)
DiffLM: Controllable Synthetic Data Generation via Diffusion Language Models
par: Zhou, Ying, et autres
Publié: (2024)
par: Zhou, Ying, et autres
Publié: (2024)
Base Models Look Human To AI Detectors
par: Xu, Yixuan Even, et autres
Publié: (2026)
par: Xu, Yixuan Even, et autres
Publié: (2026)
IPAD: Inverse Prompt for AI Detection - A Robust and Interpretable LLM-Generated Text Detector
par: Chen, Zheng, et autres
Publié: (2025)
par: Chen, Zheng, et autres
Publié: (2025)
Exploring the Plausibility of Hate and Counter Speech Detectors with Explainable AI
par: Böck, Adrian Jaques, et autres
Publié: (2024)
par: Böck, Adrian Jaques, et autres
Publié: (2024)
Jailbreak-as-a-Service++: Unveiling Distributed AI-Driven Malicious Information Campaigns Powered by LLM Crowdsourcing
par: Yan, Yu, et autres
Publié: (2025)
par: Yan, Yu, et autres
Publié: (2025)
Amplifying, Not Learning: Fine-Tuned AI Text Detectors Amplify a Pretrained Direction
par: Smirnov, Alexander
Publié: (2026)
par: Smirnov, Alexander
Publié: (2026)
Navigating Cultural Chasms: Exploring and Unlocking the Cultural POV of Text-To-Image Models
par: Ventura, Mor, et autres
Publié: (2023)
par: Ventura, Mor, et autres
Publié: (2023)
Breach in the Shield: Unveiling the Vulnerabilities of Large Language Models
par: Dai, Runpeng, et autres
Publié: (2025)
par: Dai, Runpeng, et autres
Publié: (2025)
Unveiling and Addressing Pseudo Forgetting in Large Language Models
par: Sun, Huashan, et autres
Publié: (2024)
par: Sun, Huashan, et autres
Publié: (2024)
From Words to Actions: Unveiling the Theoretical Underpinnings of LLM-Driven Autonomous Systems
par: He, Jianliang, et autres
Publié: (2024)
par: He, Jianliang, et autres
Publié: (2024)
ALPINE: Unveiling the Planning Capability of Autoregressive Learning in Language Models
par: Wang, Siwei, et autres
Publié: (2024)
par: Wang, Siwei, et autres
Publié: (2024)
Hidding the Ghostwriters: An Adversarial Evaluation of AI-Generated Student Essay Detection
par: Peng, Xinlin, et autres
Publié: (2024)
par: Peng, Xinlin, et autres
Publié: (2024)
Unveiling Causal Reasoning in Large Language Models: Reality or Mirage?
par: Chi, Haoang, et autres
Publié: (2025)
par: Chi, Haoang, et autres
Publié: (2025)
ShadowLLM: Predictor-based Contextual Sparsity for Large Language Models
par: Akhauri, Yash, et autres
Publié: (2024)
par: Akhauri, Yash, et autres
Publié: (2024)
Rethinking Reward Model Evaluation: Are We Barking up the Wrong Tree?
par: Wen, Xueru, et autres
Publié: (2024)
par: Wen, Xueru, et autres
Publié: (2024)
AiraXiv: An AI-Driven Open-Access Platform for Human and AI Scientists
par: Pan, Junshu, et autres
Publié: (2026)
par: Pan, Junshu, et autres
Publié: (2026)
AutoMLGen: Navigating Fine-Grained Optimization for Coding Agents
par: Du, Shangheng, et autres
Publié: (2025)
par: Du, Shangheng, et autres
Publié: (2025)
Technologies on Effectiveness and Efficiency: A Survey of State Spaces Models
par: Lv, Xingtai, et autres
Publié: (2025)
par: Lv, Xingtai, et autres
Publié: (2025)
Search, Verify and Feedback: Towards Next Generation Post-training Paradigm of Foundation Models via Verifier Engineering
par: Guan, Xinyan, et autres
Publié: (2024)
par: Guan, Xinyan, et autres
Publié: (2024)
Decoding the AI Pen: Techniques and Challenges in Detecting AI-Generated Text
par: Abdali, Sara, et autres
Publié: (2024)
par: Abdali, Sara, et autres
Publié: (2024)
Residual Stream Duality in Modern Transformer Architectures
par: Zhang, Yifan
Publié: (2026)
par: Zhang, Yifan
Publié: (2026)
Patent Language Model Pretraining with ModernBERT
par: Yousefiramandi, Amirhossein, et autres
Publié: (2025)
par: Yousefiramandi, Amirhossein, et autres
Publié: (2025)
NoisyHate: Mining Online Human-Written Perturbations for Realistic Robustness Benchmarking of Content Moderation Models
par: Ye, Yiran, et autres
Publié: (2023)
par: Ye, Yiran, et autres
Publié: (2023)
A Simple and Effective Pruning Approach for Large Language Models
par: Sun, Mingjie, et autres
Publié: (2023)
par: Sun, Mingjie, et autres
Publié: (2023)
Verifying the Verifiers: Unveiling Pitfalls and Potentials in Fact Verifiers
par: Seo, Wooseok, et autres
Publié: (2025)
par: Seo, Wooseok, et autres
Publié: (2025)
On Designing Effective RL Reward at Training Time for LLM Reasoning
par: Gao, Jiaxuan, et autres
Publié: (2024)
par: Gao, Jiaxuan, et autres
Publié: (2024)
Tiny-Toxic-Detector: A compact transformer-based model for toxic content detection
par: Kamphuis, Michiel
Publié: (2024)
par: Kamphuis, Michiel
Publié: (2024)
Your Finetuned Large Language Model is Already a Powerful Out-of-distribution Detector
par: Zhang, Andi, et autres
Publié: (2024)
par: Zhang, Andi, et autres
Publié: (2024)
KGLens: Towards Efficient and Effective Knowledge Probing of Large Language Models with Knowledge Graphs
par: Zheng, Shangshang, et autres
Publié: (2023)
par: Zheng, Shangshang, et autres
Publié: (2023)
Towards Scalable Automated Alignment of LLMs: A Survey
par: Cao, Boxi, et autres
Publié: (2024)
par: Cao, Boxi, et autres
Publié: (2024)
Unveiling LLM Mechanisms Through Neural ODEs and Control Theory
par: Zhang, Yukun, et autres
Publié: (2024)
par: Zhang, Yukun, et autres
Publié: (2024)
Information Gain-based Policy Optimization: A Simple and Effective Approach for Multi-Turn Search Agents
par: Wang, Guoqing, et autres
Publié: (2025)
par: Wang, Guoqing, et autres
Publié: (2025)
Outliers and Calibration Sets have Diminishing Effect on Quantization of Modern LLMs
par: Paglieri, Davide, et autres
Publié: (2024)
par: Paglieri, Davide, et autres
Publié: (2024)
Clinical ModernBERT: An efficient and long context encoder for biomedical text
par: Lee, Simon A., et autres
Publié: (2025)
par: Lee, Simon A., et autres
Publié: (2025)
UltraFeedback: Boosting Language Models with Scaled AI Feedback
par: Cui, Ganqu, et autres
Publié: (2023)
par: Cui, Ganqu, et autres
Publié: (2023)
Resolving Conflicts in Lifelong Learning via Aligning Updates in Subspaces
par: Zhou, Yueer, et autres
Publié: (2025)
par: Zhou, Yueer, et autres
Publié: (2025)
Enhancing AI Assisted Writing with One-Shot Implicit Negative Feedback
par: Towle, Benjamin, et autres
Publié: (2024)
par: Towle, Benjamin, et autres
Publié: (2024)
Pretraining Data Exposure in Large Language Models: A Survey of Membership Inference, Data Contamination, and Security Implications
par: Tong, Ziyi, et autres
Publié: (2026)
par: Tong, Ziyi, et autres
Publié: (2026)
Language Models Optimized to Fool Detectors Still Have a Distinct Style (And How to Change It)
par: Soto, Rafael Rivera, et autres
Publié: (2025)
par: Soto, Rafael Rivera, et autres
Publié: (2025)
Documents similaires
-
Humanizing Machine-Generated Content: Evading AI-Text Detection through Adversarial Attack
par: Zhou, Ying, et autres
Publié: (2024) -
DiffLM: Controllable Synthetic Data Generation via Diffusion Language Models
par: Zhou, Ying, et autres
Publié: (2024) -
Base Models Look Human To AI Detectors
par: Xu, Yixuan Even, et autres
Publié: (2026) -
IPAD: Inverse Prompt for AI Detection - A Robust and Interpretable LLM-Generated Text Detector
par: Chen, Zheng, et autres
Publié: (2025) -
Exploring the Plausibility of Hate and Counter Speech Detectors with Explainable AI
par: Böck, Adrian Jaques, et autres
Publié: (2024)