RAID: A Shared Benchmark for Robust Evaluation of Machine-Generated Text Detectors
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Dugan, Liam, Hwang, Alyssa, Trhlik, Filip, Ludan, Josh Magnus, Zhu, Andrew, Xu, Hainiu, Ippolito, Daphne, Callison-Burch, Chris |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ReDel: A Toolkit for LLM-Powered Recursive Multi-Agent Systems
par: Zhu, Andrew, et autres
Publié: (2024)
par: Zhu, Andrew, et autres
Publié: (2024)
Toward Beginner-Friendly LLMs for Language Learning: Controlling Difficulty in Conversation
par: Jin, Meiqing, et autres
Publié: (2025)
par: Jin, Meiqing, et autres
Publié: (2025)
GenAI Content Detection Task 3: Cross-Domain Machine-Generated Text Detection Challenge
par: Dugan, Liam, et autres
Publié: (2025)
par: Dugan, Liam, et autres
Publié: (2025)
FanOutQA: A Multi-Hop, Multi-Document Question Answering Benchmark for Large Language Models
par: Zhu, Andrew, et autres
Publié: (2024)
par: Zhu, Andrew, et autres
Publié: (2024)
Interpretable-by-Design Text Understanding with Iteratively Generated Concept Bottleneck
par: Ludan, Josh Magnus, et autres
Publié: (2023)
par: Ludan, Josh Magnus, et autres
Publié: (2023)
Learning Translations via Matrix Completion
par: Wijaya, Derry, et autres
Publié: (2024)
par: Wijaya, Derry, et autres
Publié: (2024)
Machine Text Detectors are Membership Inference Attacks
par: Koike, Ryuto, et autres
Publié: (2025)
par: Koike, Ryuto, et autres
Publié: (2025)
Understanding LLM Failures: A Multi-Tape Turing Machine Analysis of Systematic Errors in Language Model Reasoning
par: Boman, Magnus
Publié: (2026)
par: Boman, Magnus
Publié: (2026)
Recent Trends in Linear Text Segmentation: a Survey
par: Ghinassi, Iacopo, et autres
Publié: (2024)
par: Ghinassi, Iacopo, et autres
Publié: (2024)
Robustness of Large Language Models to Perturbations in Text
par: Singh, Ayush, et autres
Publié: (2024)
par: Singh, Ayush, et autres
Publié: (2024)
Universal-2-TF: Robust All-Neural Text Formatting for ASR
par: Khare, Yash, et autres
Publié: (2025)
par: Khare, Yash, et autres
Publié: (2025)
A Multi-Task Benchmark for Abusive Language Detection in Low-Resource Settings
par: Gaim, Fitsum, et autres
Publié: (2025)
par: Gaim, Fitsum, et autres
Publié: (2025)
LLM-Rubric: A Multidimensional, Calibrated Approach to Automated Evaluation of Natural Language Texts
par: Hashemi, Helia, et autres
Publié: (2024)
par: Hashemi, Helia, et autres
Publié: (2024)
Text-Based Approaches to Item Difficulty Modeling in Large-Scale Assessments: A Systematic Review
par: Peters, Sydney, et autres
Publié: (2025)
par: Peters, Sydney, et autres
Publié: (2025)
Identifying Bias in Machine-generated Text Detection
par: Stowe, Kevin, et autres
Publié: (2025)
par: Stowe, Kevin, et autres
Publié: (2025)
MASH: Evading Black-Box AI-Generated Text Detectors via Style Humanization
par: Gu, Yongtong, et autres
Publié: (2026)
par: Gu, Yongtong, et autres
Publié: (2026)
Spotlights and Blindspots: Evaluating Machine-Generated Text Detection
par: Stowe, Kevin, et autres
Publié: (2026)
par: Stowe, Kevin, et autres
Publié: (2026)
Introducing Three New Benchmark Datasets for Hierarchical Text Classification
par: Toit, Jaco du, et autres
Publié: (2024)
par: Toit, Jaco du, et autres
Publié: (2024)
Reducing Maintenance Burden in Behaviour-Driven Development: A Paraphrase-Robust Duplicate-Step Detector with a 1.1M-Step Open Benchmark
par: Mughal, Ali Hassaan, et autres
Publié: (2026)
par: Mughal, Ali Hassaan, et autres
Publié: (2026)
Cross-Lingual Generalization and Compression: From Language-Specific to Shared Neurons
par: Riemenschneider, Frederick, et autres
Publié: (2025)
par: Riemenschneider, Frederick, et autres
Publié: (2025)
Evaluating the Efficacy of Hybrid Deep Learning Models in Distinguishing AI-Generated Text
par: Oketunji, Abiodun Finbarrs
Publié: (2023)
par: Oketunji, Abiodun Finbarrs
Publié: (2023)
Robustness of Spatio-temporal Graph Neural Networks for Fault Location in Partially Observable Distribution Grids
par: Karabulut, Burak, et autres
Publié: (2026)
par: Karabulut, Burak, et autres
Publié: (2026)
From Benchmarking to Reasoning: A Dual-Aspect, Large-Scale Evaluation of LLMs on Vietnamese Legal Text
par: Le, Van-Truong
Publié: (2026)
par: Le, Van-Truong
Publié: (2026)
TrustAI at SemEval-2024 Task 8: A Comprehensive Analysis of Multi-domain Machine Generated Text Detection Techniques
par: Urlana, Ashok, et autres
Publié: (2024)
par: Urlana, Ashok, et autres
Publié: (2024)
Text2Model: Modeling Copilots for Text-to-Model Translation
par: Kadioglu, Serdar, et autres
Publié: (2026)
par: Kadioglu, Serdar, et autres
Publié: (2026)
Identifying Fairness Issues in Automatically Generated Testing Content
par: Stowe, Kevin, et autres
Publié: (2024)
par: Stowe, Kevin, et autres
Publié: (2024)
PSST: A Benchmark for Evaluation-driven Text Public-Speaking Style Transfer
par: Sun, Huashan, et autres
Publié: (2023)
par: Sun, Huashan, et autres
Publié: (2023)
SQLord: A Robust Enterprise Text-to-SQL Solution via Reverse Data Generation and Workflow Decomposition
par: Cheng, Song, et autres
Publié: (2025)
par: Cheng, Song, et autres
Publié: (2025)
Geist in the Machine: Simulating Recognition and Inner Dialogue in AI-Mediated Teaching and Research
par: Magee, Liam
Publié: (2026)
par: Magee, Liam
Publié: (2026)
On the Influence of Discourse Relations in Persuasive Texts
par: Turk, Nawar, et autres
Publié: (2025)
par: Turk, Nawar, et autres
Publié: (2025)
PathBench: Speech Intelligibility Benchmark for Automatic Pathological Speech Assessment
par: Halpern, Bence Mark, et autres
Publié: (2026)
par: Halpern, Bence Mark, et autres
Publié: (2026)
Layer-Aware Embedding Fusion for LLMs in Text Classifications
par: Gwak, Jiho, et autres
Publié: (2025)
par: Gwak, Jiho, et autres
Publié: (2025)
Towards Conditioning Clinical Text Generation for User Control
par: Koraş, Osman Alperen, et autres
Publié: (2025)
par: Koraş, Osman Alperen, et autres
Publié: (2025)
Chat-Driven Text Generation and Interaction for Person Retrieval
par: Xie, Zequn, et autres
Publié: (2025)
par: Xie, Zequn, et autres
Publié: (2025)
CRISP: Persistent Concept Unlearning via Sparse Autoencoders
par: Ashuach, Tomer, et autres
Publié: (2025)
par: Ashuach, Tomer, et autres
Publié: (2025)
Does Localization Inform Unlearning? A Rigorous Examination of Local Parameter Attribution for Knowledge Unlearning in Language Models
par: Lee, Hwiyeong, et autres
Publié: (2025)
par: Lee, Hwiyeong, et autres
Publié: (2025)
Semantic Convergence: Investigating Shared Representations Across Scaled LLMs
par: Son, Daniel, et autres
Publié: (2025)
par: Son, Daniel, et autres
Publié: (2025)
Evaluating the efficacy of LLM Safety Solutions : The Palit Benchmark Dataset
par: Palit, Sayon, et autres
Publié: (2025)
par: Palit, Sayon, et autres
Publié: (2025)
Text Summarization With Graph Attention Networks
par: Ardestani, Mohammadreza, et autres
Publié: (2026)
par: Ardestani, Mohammadreza, et autres
Publié: (2026)
XferBench: a Data-Driven Benchmark for Emergent Language
par: Boldt, Brendon, et autres
Publié: (2024)
par: Boldt, Brendon, et autres
Publié: (2024)
Documents similaires
-
ReDel: A Toolkit for LLM-Powered Recursive Multi-Agent Systems
par: Zhu, Andrew, et autres
Publié: (2024) -
Toward Beginner-Friendly LLMs for Language Learning: Controlling Difficulty in Conversation
par: Jin, Meiqing, et autres
Publié: (2025) -
GenAI Content Detection Task 3: Cross-Domain Machine-Generated Text Detection Challenge
par: Dugan, Liam, et autres
Publié: (2025) -
FanOutQA: A Multi-Hop, Multi-Document Question Answering Benchmark for Large Language Models
par: Zhu, Andrew, et autres
Publié: (2024) -
Interpretable-by-Design Text Understanding with Iteratively Generated Concept Bottleneck
par: Ludan, Josh Magnus, et autres
Publié: (2023)