What Do Claim Verification Datasets Actually Test? A Reasoning Trace Analysis
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Rao, Delip, Callison-Burch, Chris |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ThinknCheck: Grounded Claim Verification with Compact, Reasoning-Driven, and Interpretable Models
par: Rao, Delip, et autres
Publié: (2026)
par: Rao, Delip, et autres
Publié: (2026)
When Verification Fails: How Compositionally Infeasible Claims Escape Rejection
par: Liu, Muxin, et autres
Publié: (2026)
par: Liu, Muxin, et autres
Publié: (2026)
Agreement Metrics for LLM-as-Judge Evaluation: What to Report and Why
par: Rao, Delip, et autres
Publié: (2026)
par: Rao, Delip, et autres
Publié: (2026)
Autorubric: Unifying Rubric-based LLM Evaluation
par: Rao, Delip, et autres
Publié: (2026)
par: Rao, Delip, et autres
Publié: (2026)
BibTeX Citation Hallucinations in Scientific Publishing Agents: Evaluation and Mitigation
par: Rao, Delip, et autres
Publié: (2026)
par: Rao, Delip, et autres
Publié: (2026)
NSF-SciFy: Mining the NSF Awards Database for Scientific Claims
par: Rao, Delip, et autres
Publié: (2025)
par: Rao, Delip, et autres
Publié: (2025)
Detecting and Correcting Reference Hallucinations in Commercial LLMs and Deep Research Agents
par: Rao, Delip, et autres
Publié: (2026)
par: Rao, Delip, et autres
Publié: (2026)
WithdrarXiv: A Large-Scale Dataset for Retraction Study
par: Rao, Delip, et autres
Publié: (2024)
par: Rao, Delip, et autres
Publié: (2024)
Probabilistic Soundness Guarantees in LLM Reasoning Chains
par: You, Weiqiu, et autres
Publié: (2025)
par: You, Weiqiu, et autres
Publié: (2025)
Overhearing LLM Agents: A Survey, Taxonomy, and Roadmap
par: Zhu, Andrew, et autres
Publié: (2025)
par: Zhu, Andrew, et autres
Publié: (2025)
Towards Faithful Model Explanation in NLP: A Survey
par: Lyu, Qing, et autres
Publié: (2022)
par: Lyu, Qing, et autres
Publié: (2022)
Uncovering Differences in Persuasive Language in Russian versus English Wikipedia
par: Li, Bryan, et autres
Publié: (2024)
par: Li, Bryan, et autres
Publié: (2024)
This Land is {Your, My} Land: Evaluating Geopolitical Biases in Language Models
par: Li, Bryan, et autres
Publié: (2023)
par: Li, Bryan, et autres
Publié: (2023)
Low-Resource Authorship Style Transfer: Can Non-Famous Authors Be Imitated?
par: Patel, Ajay, et autres
Publié: (2022)
par: Patel, Ajay, et autres
Publié: (2022)
OpenPI2.0: An Improved Dataset for Entity Tracking in Texts
par: Zhang, Li, et autres
Publié: (2023)
par: Zhang, Li, et autres
Publié: (2023)
DataDreamer: A Tool for Synthetic Data Generation and Reproducible LLM Workflows
par: Patel, Ajay, et autres
Publié: (2024)
par: Patel, Ajay, et autres
Publié: (2024)
First Steps Towards Overhearing LLM Agents: A Case Study With Dungeons & Dragons Gameplay
par: Zhu, Andrew, et autres
Publié: (2025)
par: Zhu, Andrew, et autres
Publié: (2025)
FineInstructions: Scaling Synthetic Instructions to Pre-Training Scale
par: Patel, Ajay, et autres
Publié: (2026)
par: Patel, Ajay, et autres
Publié: (2026)
You Have Thirteen Hours in Which to Solve the Labyrinth: Enhancing AI Game Masters with Function Calling
par: Song, Jaewoo, et autres
Publié: (2024)
par: Song, Jaewoo, et autres
Publié: (2024)
Toward Beginner-Friendly LLMs for Language Learning: Controlling Difficulty in Conversation
par: Jin, Meiqing, et autres
Publié: (2025)
par: Jin, Meiqing, et autres
Publié: (2025)
WHAT-IF: Exploring Branching Narratives by Meta-Prompting Large Language Models
par: Huang, Runsheng "Anson", et autres
Publié: (2024)
par: Huang, Runsheng "Anson", et autres
Publié: (2024)
ReDel: A Toolkit for LLM-Powered Recursive Multi-Agent Systems
par: Zhu, Andrew, et autres
Publié: (2024)
par: Zhu, Andrew, et autres
Publié: (2024)
FanOutQA: A Multi-Hop, Multi-Document Question Answering Benchmark for Large Language Models
par: Zhu, Andrew, et autres
Publié: (2024)
par: Zhu, Andrew, et autres
Publié: (2024)
MiRAGeNews: Multimodal Realistic AI-Generated News Detection
par: Huang, Runsheng, et autres
Publié: (2024)
par: Huang, Runsheng, et autres
Publié: (2024)
SciClaimHunt: A Large Dataset for Evidence-based Scientific Claim Verification
par: Kumar, Sujit, et autres
Publié: (2025)
par: Kumar, Sujit, et autres
Publié: (2025)
Atomic Reasoning for Scientific Table Claim Verification
par: Zhang, Yuji, et autres
Publié: (2025)
par: Zhang, Yuji, et autres
Publié: (2025)
CALYPSO: LLMs as Dungeon Masters' Assistants
par: Zhu, Andrew, et autres
Publié: (2023)
par: Zhu, Andrew, et autres
Publié: (2023)
Machine Text Detectors are Membership Inference Attacks
par: Koike, Ryuto, et autres
Publié: (2025)
par: Koike, Ryuto, et autres
Publié: (2025)
mStyleDistance: Multilingual Style Embeddings and their Evaluation
par: Qiu, Justin, et autres
Publié: (2025)
par: Qiu, Justin, et autres
Publié: (2025)
Decomposing the Delta: What Do Models Actually Learn from Preference Pairs?
par: Lee, Chia-Hsuan, et autres
Publié: (2026)
par: Lee, Chia-Hsuan, et autres
Publié: (2026)
PDDLEGO: Iterative Planning in Textual Environments
par: Zhang, Li, et autres
Publié: (2024)
par: Zhang, Li, et autres
Publié: (2024)
MuSciClaims: Multimodal Scientific Claim Verification
par: Lal, Yash Kumar, et autres
Publié: (2025)
par: Lal, Yash Kumar, et autres
Publié: (2025)
Think Right, Not More: Test-Time Scaling for Numerical Claim Verification
par: Chungkham, Primakov, et autres
Publié: (2025)
par: Chungkham, Primakov, et autres
Publié: (2025)
CRAVE: A Conflicting Reasoning Approach for Explainable Claim Verification Using LLMs
par: Zheng, Yingming, et autres
Publié: (2025)
par: Zheng, Yingming, et autres
Publié: (2025)
Assessing the Reasoning Capabilities of LLMs in the context of Evidence-based Claim Verification
par: Dougrez-Lewis, John, et autres
Publié: (2024)
par: Dougrez-Lewis, John, et autres
Publié: (2024)
ParaGuide: Guided Diffusion Paraphrasers for Plug-and-Play Textual Style Transfer
par: Horvitz, Zachary, et autres
Publié: (2023)
par: Horvitz, Zachary, et autres
Publié: (2023)
ClaimFlow: Tracing the Evolution of Scientific Claims in NLP
par: Pramanick, Aniket, et autres
Publié: (2026)
par: Pramanick, Aniket, et autres
Publié: (2026)
TinyStyler: Efficient Few-Shot Text Style Transfer with Authorship Embeddings
par: Horvitz, Zachary, et autres
Publié: (2024)
par: Horvitz, Zachary, et autres
Publié: (2024)
Interpretable-by-Design Text Understanding with Iteratively Generated Concept Bottleneck
par: Ludan, Josh Magnus, et autres
Publié: (2023)
par: Ludan, Josh Magnus, et autres
Publié: (2023)
A Textbook Remedy for Domain Shifts: Knowledge Priors for Medical Image Analysis
par: Yang, Yue, et autres
Publié: (2024)
par: Yang, Yue, et autres
Publié: (2024)
Documents similaires
-
ThinknCheck: Grounded Claim Verification with Compact, Reasoning-Driven, and Interpretable Models
par: Rao, Delip, et autres
Publié: (2026) -
When Verification Fails: How Compositionally Infeasible Claims Escape Rejection
par: Liu, Muxin, et autres
Publié: (2026) -
Agreement Metrics for LLM-as-Judge Evaluation: What to Report and Why
par: Rao, Delip, et autres
Publié: (2026) -
Autorubric: Unifying Rubric-based LLM Evaluation
par: Rao, Delip, et autres
Publié: (2026) -
BibTeX Citation Hallucinations in Scientific Publishing Agents: Evaluation and Mitigation
par: Rao, Delip, et autres
Publié: (2026)