To Err Is Human: Systematic Quantification of Errors in Published AI Papers via LLM Analysis
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Bianchi, Federico, Kwon, Yongchan, Izzo, Zachary, Zhang, Linjun, Zou, James |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Large Language Models are Vulnerable to Bait-and-Switch Attacks for Generating Harmful Content
par: Bianchi, Federico, et autres
Publié: (2024)
par: Bianchi, Federico, et autres
Publié: (2024)
Can AI Be as Creative as Humans?
par: Wang, Haonan, et autres
Publié: (2024)
par: Wang, Haonan, et autres
Publié: (2024)
Science Across Languages: Assessing LLM Multilingual Translation of Scientific Papers
par: Kleidermacher, Hannah Calzi, et autres
Publié: (2025)
par: Kleidermacher, Hannah Calzi, et autres
Publié: (2025)
The Role of Ambiguity in Error Prediction via Uncertainty Quantification
par: Staliūnaitė, Ieva Raminta, et autres
Publié: (2026)
par: Staliūnaitė, Ieva Raminta, et autres
Publié: (2026)
"Sorry, I Didn't Catch That": How Speech Models Miss What Matters Most
par: Zhou, Kaitlyn, et autres
Publié: (2026)
par: Zhou, Kaitlyn, et autres
Publié: (2026)
Answering the Unanswerable Is to Err Knowingly: Analyzing and Mitigating Abstention Failures in Large Reasoning Models
par: Liu, Yi, et autres
Publié: (2025)
par: Liu, Yi, et autres
Publié: (2025)
Voice "Cloning" is Style Transfer
par: Zhou, Kaitlyn, et autres
Publié: (2026)
par: Zhou, Kaitlyn, et autres
Publié: (2026)
What LLMs Think When You Don't Tell Them What to Think About?
par: Kwon, Yongchan, et autres
Publié: (2026)
par: Kwon, Yongchan, et autres
Publié: (2026)
ReasonIF: Large Reasoning Models Fail to Follow Instructions During Reasoning
par: Kwon, Yongchan, et autres
Publié: (2025)
par: Kwon, Yongchan, et autres
Publié: (2025)
Paper2Agent: Reimagining Research Papers As Interactive and Reliable AI Agents
par: Miao, Jiacheng, et autres
Publié: (2025)
par: Miao, Jiacheng, et autres
Publié: (2025)
Benchmark Profiling: Mechanistic Diagnosis of LLM Benchmarks
par: Kim, Dongjun, et autres
Publié: (2025)
par: Kim, Dongjun, et autres
Publié: (2025)
Automated Benchmark Auditing for AI Agents and Large Language Models
par: Wang, Junlin, et autres
Publié: (2026)
par: Wang, Junlin, et autres
Publié: (2026)
Spot the BlindSpots: Systematic Identification and Quantification of Fine-Grained LLM Biases in Contact Center Summaries
par: Mayilvaghanan, Kawin, et autres
Publié: (2025)
par: Mayilvaghanan, Kawin, et autres
Publié: (2025)
TextGrad: Automatic "Differentiation" via Text
par: Yuksekgonul, Mert, et autres
Publié: (2024)
par: Yuksekgonul, Mert, et autres
Publié: (2024)
How Well Can LLMs Negotiate? NegotiationArena Platform and Analysis
par: Bianchi, Federico, et autres
Publié: (2024)
par: Bianchi, Federico, et autres
Publié: (2024)
Can LLMs Truly Embody Human Personality? Analyzing AI and Human Behavior Alignment in Dispute Resolution
par: Kwon, Deuksin, et autres
Publié: (2026)
par: Kwon, Deuksin, et autres
Publié: (2026)
FactTest: Factuality Testing in Large Language Models with Finite-Sample and Distribution-Free Guarantees
par: Nie, Fan, et autres
Publié: (2024)
par: Nie, Fan, et autres
Publié: (2024)
Dropouts in Confidence: Moral Uncertainty in Human-LLM Alignment
par: Kwon, Jea, et autres
Publié: (2025)
par: Kwon, Jea, et autres
Publié: (2025)
SEAL: Systematic Error Analysis for Value ALignment
par: Revel, Manon, et autres
Publié: (2024)
par: Revel, Manon, et autres
Publié: (2024)
Is Your Paper Being Reviewed by an LLM? Benchmarking AI Text Detection in Peer Review
par: Yu, Sungduk, et autres
Publié: (2025)
par: Yu, Sungduk, et autres
Publié: (2025)
Is Your Paper Being Reviewed by an LLM? Investigating AI Text Detectability in Peer Review
par: Yu, Sungduk, et autres
Publié: (2024)
par: Yu, Sungduk, et autres
Publié: (2024)
Understanding Impact of Human Feedback via Influence Functions
par: Min, Taywon, et autres
Publié: (2025)
par: Min, Taywon, et autres
Publié: (2025)
PaperBench: Evaluating AI's Ability to Replicate AI Research
par: Starace, Giulio, et autres
Publié: (2025)
par: Starace, Giulio, et autres
Publié: (2025)
CLEAR: Error Analysis via LLM-as-a-Judge Made Easy
par: Yehudai, Asaf, et autres
Publié: (2025)
par: Yehudai, Asaf, et autres
Publié: (2025)
Impatient Users Confuse AI Agents: High-fidelity Simulations of Human Traits for Testing Agents
par: He, Muyu, et autres
Publié: (2025)
par: He, Muyu, et autres
Publié: (2025)
Leveraging LLM-Respondents for Item Evaluation: a Psychometric Analysis
par: Liu, Yunting, et autres
Publié: (2024)
par: Liu, Yunting, et autres
Publié: (2024)
ReasonOps: Operator Segmentation for LLM Reasoning Traces
par: Lee, Daniel, et autres
Publié: (2026)
par: Lee, Daniel, et autres
Publié: (2026)
CEC-Zero: Chinese Error Correction Solution Based on LLM
par: Zhang, Sophie, et autres
Publié: (2025)
par: Zhang, Sophie, et autres
Publié: (2025)
Systematic Analysis of LLM Contributions to Planning: Solver, Verifier, Heuristic
par: Li, Haoming, et autres
Publié: (2024)
par: Li, Haoming, et autres
Publié: (2024)
A Systematic Analysis of the Impact of Persona Steering on LLM Capabilities
par: Chen, Jiaqi, et autres
Publié: (2026)
par: Chen, Jiaqi, et autres
Publié: (2026)
SAFE: Stepwise Atomic Feedback for Error correction in Multi-hop Reasoning
par: Kwon, Daeyong, et autres
Publié: (2026)
par: Kwon, Daeyong, et autres
Publié: (2026)
Leveraging What's Overfixed: Post-Correction via LLM Grammatical Error Overcorrection
par: Park, Taehee, et autres
Publié: (2025)
par: Park, Taehee, et autres
Publié: (2025)
Belief in the Machine: Investigating Epistemological Blind Spots of Language Models
par: Suzgun, Mirac, et autres
Publié: (2024)
par: Suzgun, Mirac, et autres
Publié: (2024)
Enhancing LLM-Based Data Annotation with Error Decomposition
par: Xu, Zhen, et autres
Publié: (2026)
par: Xu, Zhen, et autres
Publié: (2026)
The Challenges of Evaluating LLM Applications: An Analysis of Automated, Human, and LLM-Based Approaches
par: Abeysinghe, Bhashithe, et autres
Publié: (2024)
par: Abeysinghe, Bhashithe, et autres
Publié: (2024)
ClashEval: Quantifying the tug-of-war between an LLM's internal prior and external evidence
par: Wu, Kevin, et autres
Publié: (2024)
par: Wu, Kevin, et autres
Publié: (2024)
Supporting Artifact Evaluation with LLMs: A Study with Published Security Research Papers
par: Heye, David, et autres
Publié: (2026)
par: Heye, David, et autres
Publié: (2026)
A Systematic Analysis of Large Language Models with RAG-enabled Dynamic Prompting for Medical Error Detection and Correction
par: Ahmed, Farzad, et autres
Publié: (2025)
par: Ahmed, Farzad, et autres
Publié: (2025)
Teaching People LLM's Errors and Getting it Right
par: Stringham, Nathan, et autres
Publié: (2025)
par: Stringham, Nathan, et autres
Publié: (2025)
Identifying Quantum Structure in AI Language: Evidence for Evolutionary Convergence of Human and Artificial Cognition
par: Aerts, Diederik, et autres
Publié: (2025)
par: Aerts, Diederik, et autres
Publié: (2025)
Documents similaires
-
Large Language Models are Vulnerable to Bait-and-Switch Attacks for Generating Harmful Content
par: Bianchi, Federico, et autres
Publié: (2024) -
Can AI Be as Creative as Humans?
par: Wang, Haonan, et autres
Publié: (2024) -
Science Across Languages: Assessing LLM Multilingual Translation of Scientific Papers
par: Kleidermacher, Hannah Calzi, et autres
Publié: (2025) -
The Role of Ambiguity in Error Prediction via Uncertainty Quantification
par: Staliūnaitė, Ieva Raminta, et autres
Publié: (2026) -
"Sorry, I Didn't Catch That": How Speech Models Miss What Matters Most
par: Zhou, Kaitlyn, et autres
Publié: (2026)