Stumbling Blocks: Stress Testing the Robustness of Machine-Generated Text Detectors Under Attacks
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Yichen, Feng, Shangbin, Hou, Abe Bohan, Pu, Xiao, Shen, Chao, Liu, Xiaoming, Tsvetkov, Yulia, He, Tianxing |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SemStamp: A Semantic Watermark with Paraphrastic Robustness for Text Generation
di: Hou, Abe Bohan, et al.
Pubblicazione: (2023)
di: Hou, Abe Bohan, et al.
Pubblicazione: (2023)
k-SemStamp: A Clustering-Based Semantic Watermark for Detection of Machine-Generated Text
di: Hou, Abe Bohan, et al.
Pubblicazione: (2024)
di: Hou, Abe Bohan, et al.
Pubblicazione: (2024)
Knowledge Card: Filling LLMs' Knowledge Gaps with Plug-in Specialized Language Models
di: Feng, Shangbin, et al.
Pubblicazione: (2023)
di: Feng, Shangbin, et al.
Pubblicazione: (2023)
Can Language Models Solve Graph Problems in Natural Language?
di: Wang, Heng, et al.
Pubblicazione: (2023)
di: Wang, Heng, et al.
Pubblicazione: (2023)
Knowledge Crosswords: Geometric Knowledge Reasoning with Large Language Models
di: Ding, Wenxuan, et al.
Pubblicazione: (2023)
di: Ding, Wenxuan, et al.
Pubblicazione: (2023)
KGQuiz: Evaluating the Generalization of Encoded Knowledge in Large Language Models
di: Bai, Yuyang, et al.
Pubblicazione: (2023)
di: Bai, Yuyang, et al.
Pubblicazione: (2023)
Can LLM Graph Reasoning Generalize beyond Pattern Memorization?
di: Zhang, Yizhuo, et al.
Pubblicazione: (2024)
di: Zhang, Yizhuo, et al.
Pubblicazione: (2024)
Resolving Knowledge Conflicts in Large Language Models
di: Wang, Yike, et al.
Pubblicazione: (2023)
di: Wang, Yike, et al.
Pubblicazione: (2023)
FACTS&EVIDENCE: An Interactive Tool for Transparent Fine-Grained Factual Verification of Machine-Generated Text
di: Boonsanong, Varich, et al.
Pubblicazione: (2025)
di: Boonsanong, Varich, et al.
Pubblicazione: (2025)
Cognitive Load: A Stumbling Block in Successful Crowdfunding
di: Lifang Liao, et al.
Pubblicazione: (2025)
di: Lifang Liao, et al.
Pubblicazione: (2025)
Data Swarms: Optimizable Generation of Synthetic Evaluation Data
di: Feng, Shangbin, et al.
Pubblicazione: (2025)
di: Feng, Shangbin, et al.
Pubblicazione: (2025)
ScienceMeter: Tracking Scientific Knowledge Updates in Language Models
di: Wang, Yike, et al.
Pubblicazione: (2025)
di: Wang, Yike, et al.
Pubblicazione: (2025)
The Single-Multi Evolution Loop for Self-Improving Model Collaboration Systems
di: Feng, Shangbin, et al.
Pubblicazione: (2026)
di: Feng, Shangbin, et al.
Pubblicazione: (2026)
Among Us: Measuring and Mitigating Malicious Contributions in Model Collaboration Systems
di: Yang, Ziyuan, et al.
Pubblicazione: (2026)
di: Yang, Ziyuan, et al.
Pubblicazione: (2026)
SPARTA ALIGNMENT: Collectively Aligning Multiple Language Models through Combat
di: Jiang, Yuru, et al.
Pubblicazione: (2025)
di: Jiang, Yuru, et al.
Pubblicazione: (2025)
MentorCollab: Selective Large-to-Small Inference-Time Guidance for Efficient Reasoning
di: Wang, Haojin, et al.
Pubblicazione: (2026)
di: Wang, Haojin, et al.
Pubblicazione: (2026)
Small Reward Models via Backward Inference
di: Wang, Yike, et al.
Pubblicazione: (2026)
di: Wang, Yike, et al.
Pubblicazione: (2026)
Stumbling Blocks Before the Blind
di: Wheatley, Edward
Pubblicazione: (2022)
di: Wheatley, Edward
Pubblicazione: (2022)
Varying Shades of Wrong: Aligning LLMs with Wrong Answers Only
di: Yao, Jihan, et al.
Pubblicazione: (2024)
di: Yao, Jihan, et al.
Pubblicazione: (2024)
DELL: Generating Reactions and Explanations for LLM-Based Misinformation Detection
di: Wan, Herun, et al.
Pubblicazione: (2024)
di: Wan, Herun, et al.
Pubblicazione: (2024)
Generalizable LLM Learning of Graph Synthetic Data with Post-training Alignment
di: Zhang, Yizhuo, et al.
Pubblicazione: (2025)
di: Zhang, Yizhuo, et al.
Pubblicazione: (2025)
What Does the Bot Say? Opportunities and Risks of Large Language Models in Social Media Bot Detection
di: Feng, Shangbin, et al.
Pubblicazione: (2024)
di: Feng, Shangbin, et al.
Pubblicazione: (2024)
Don't Hallucinate, Abstain: Identifying LLM Knowledge Gaps via Multi-LLM Collaboration
di: Feng, Shangbin, et al.
Pubblicazione: (2024)
di: Feng, Shangbin, et al.
Pubblicazione: (2024)
Don't Throw Away Your Pretrained Model
di: Feng, Shangbin, et al.
Pubblicazione: (2025)
di: Feng, Shangbin, et al.
Pubblicazione: (2025)
GuessBench: Sensemaking Multimodal Creativity in the Wild
di: Zhu, Zifeng, et al.
Pubblicazione: (2025)
di: Zhu, Zifeng, et al.
Pubblicazione: (2025)
Can A Society of Generative Agents Simulate Human Behavior and Inform Public Health Policy? A Case Study on Vaccine Hesitancy
di: Hou, Abe Bohan, et al.
Pubblicazione: (2025)
di: Hou, Abe Bohan, et al.
Pubblicazione: (2025)
LatticeGen: A Cooperative Framework which Hides Generated Text in a Lattice for Privacy-Aware Generation on Cloud
di: Zhang, Mengke, et al.
Pubblicazione: (2023)
di: Zhang, Mengke, et al.
Pubblicazione: (2023)
MGTEVAL: An Interactive Platform for Systemtic Evaluation of Machine-Generated Text Detectors
di: Li, Yuanfan, et al.
Pubblicazione: (2026)
di: Li, Yuanfan, et al.
Pubblicazione: (2026)
Cornerstones or Stumbling Blocks? Deciphering the Rock Tokens in On-Policy Distillation
di: Jiang, Yuxuan, et al.
Pubblicazione: (2026)
di: Jiang, Yuxuan, et al.
Pubblicazione: (2026)
P^3SUM: Preserving Author's Perspective in News Summarization with Diffusion Language Models
di: Liu, Yuhan, et al.
Pubblicazione: (2023)
di: Liu, Yuhan, et al.
Pubblicazione: (2023)
Know Your Limits: A Survey of Abstention in Large Language Models
di: Wen, Bingbing, et al.
Pubblicazione: (2024)
di: Wen, Bingbing, et al.
Pubblicazione: (2024)
Modular Pluralism: Pluralistic Alignment via Multi-LLM Collaboration
di: Feng, Shangbin, et al.
Pubblicazione: (2024)
di: Feng, Shangbin, et al.
Pubblicazione: (2024)
Iron Sharpens Iron: Defending Against Attacks in Machine-Generated Text Detection with Adversarial Training
di: Li, Yuanfan, et al.
Pubblicazione: (2025)
di: Li, Yuanfan, et al.
Pubblicazione: (2025)
LLMs vs. Chinese Anime Enthusiasts: A Comparative Study on Emotionally Supportive Role-Playing
di: Qiu, Lanlan, et al.
Pubblicazione: (2025)
di: Qiu, Lanlan, et al.
Pubblicazione: (2025)
Stumbling into war
Pubblicazione: (1999)
Pubblicazione: (1999)
A Hidden Stumbling Block in Generalized Category Discovery: Distracted Attention
di: Xu, Qiyu, et al.
Pubblicazione: (2025)
di: Xu, Qiyu, et al.
Pubblicazione: (2025)
A Greying Faculty: Challenge or Stumbling Block to the Twenty-First Century.
di: Kreisman, Leonard T.
Pubblicazione: (1996)
di: Kreisman, Leonard T.
Pubblicazione: (1996)
Six Rules for Computers and Other Stumbling Blocks to Obtaining an Advanced Degree.
di: Cole, Barbara H., et al.
Pubblicazione: (1999)
di: Cole, Barbara H., et al.
Pubblicazione: (1999)
Machine Text Detectors are Membership Inference Attacks
di: Koike, Ryuto, et al.
Pubblicazione: (2025)
di: Koike, Ryuto, et al.
Pubblicazione: (2025)
Style-Compress: An LLM-Based Prompt Compression Framework Considering Task-Specific Styles
di: Pu, Xiao, et al.
Pubblicazione: (2024)
di: Pu, Xiao, et al.
Pubblicazione: (2024)
Documenti analoghi
-
SemStamp: A Semantic Watermark with Paraphrastic Robustness for Text Generation
di: Hou, Abe Bohan, et al.
Pubblicazione: (2023) -
k-SemStamp: A Clustering-Based Semantic Watermark for Detection of Machine-Generated Text
di: Hou, Abe Bohan, et al.
Pubblicazione: (2024) -
Knowledge Card: Filling LLMs' Knowledge Gaps with Plug-in Specialized Language Models
di: Feng, Shangbin, et al.
Pubblicazione: (2023) -
Can Language Models Solve Graph Problems in Natural Language?
di: Wang, Heng, et al.
Pubblicazione: (2023) -
Knowledge Crosswords: Geometric Knowledge Reasoning with Large Language Models
di: Ding, Wenxuan, et al.
Pubblicazione: (2023)