Think Right, Not More: Test-Time Scaling for Numerical Claim Verification
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chungkham, Primakov, Venktesh, V, Setty, Vinay, Anand, Avishek |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
QuanTemp: A real-world open-domain benchmark for fact-checking numerical claims
par: V, Venktesh, et autres
Publié: (2024)
par: V, Venktesh, et autres
Publié: (2024)
Trust but Verify! A Survey on Verification Design for Test-time Scaling
par: Venktesh, V, et autres
Publié: (2025)
par: Venktesh, V, et autres
Publié: (2025)
A Benchmark for Open-Domain Numerical Fact-Checking Enhanced by Claim Decomposition
par: Venktesh, V, et autres
Publié: (2025)
par: Venktesh, V, et autres
Publié: (2025)
The CLEF-2026 CheckThat! Lab: Advancing Multilingual Fact-Checking
par: Struß, Julia Maria, et autres
Publié: (2026)
par: Struß, Julia Maria, et autres
Publié: (2026)
LiveFC: A System for Live Fact-Checking of Audio Streams
par: V, Venktesh, et autres
Publié: (2024)
par: V, Venktesh, et autres
Publié: (2024)
The Surprising Effectiveness of Rankers Trained on Expanded Queries
par: Anand, Abhijit, et autres
Publié: (2024)
par: Anand, Abhijit, et autres
Publié: (2024)
DEXTER: A Benchmark for open-domain Complex Question Answering using LLMs
par: Prabhu, Venktesh V. Deepali, et autres
Publié: (2024)
par: Prabhu, Venktesh V. Deepali, et autres
Publié: (2024)
Evaluating List Construction and Temporal Understanding capabilities of Large Language Models
par: Dumitru, Alexandru, et autres
Publié: (2025)
par: Dumitru, Alexandru, et autres
Publié: (2025)
DISCO: DISCovering Overfittings as Causal Rules for Text Classification Models
par: Zhang, Zijian, et autres
Publié: (2024)
par: Zhang, Zijian, et autres
Publié: (2024)
NumPert: Numerical Perturbations to Probe Language Models for Veracity Prediction
par: Aarnes, Peter Røysland, et autres
Publié: (2025)
par: Aarnes, Peter Røysland, et autres
Publié: (2025)
IAI Group at CheckThat! 2024: Transformer Models and Data Augmentation for Checkworthy Claim Detection
par: Aarnes, Peter Røysland, et autres
Publié: (2024)
par: Aarnes, Peter Røysland, et autres
Publié: (2024)
FactCheck Editor: Multilingual Text Editor with End-to-End fact-checking
par: Setty, Vinay
Publié: (2024)
par: Setty, Vinay
Publié: (2024)
Surprising Efficacy of Fine-Tuned Transformers for Fact-Checking over Larger Language Models
par: Setty, Vinay
Publié: (2024)
par: Setty, Vinay
Publié: (2024)
QuestGen: Effectiveness of Question Generation Methods for Fact-Checking Applications
par: Setty, Ritvik, et autres
Publié: (2024)
par: Setty, Ritvik, et autres
Publié: (2024)
FactIR: A Real-World Zero-shot Open-Domain Retrieval Benchmark for Fact-Checking
par: V, Venktesh, et autres
Publié: (2025)
par: V, Venktesh, et autres
Publié: (2025)
FlashCheck: Exploration of Efficient Evidence Retrieval for Fast Fact-Checking
par: Nanekhan, Kevin, et autres
Publié: (2025)
par: Nanekhan, Kevin, et autres
Publié: (2025)
ShortCheck: Checkworthiness Detection of Multilingual Short-Form Videos
par: Vatndal, Henrik, et autres
Publié: (2025)
par: Vatndal, Henrik, et autres
Publié: (2025)
When More Reformulations Hurt: Avoiding Drift using Ranker Feedback
par: Venktesh, V, et autres
Publié: (2026)
par: Venktesh, V, et autres
Publié: (2026)
Annotation Tool and Dataset for Fact-Checking Podcasts
par: Setty, Vinay, et autres
Publié: (2025)
par: Setty, Vinay, et autres
Publié: (2025)
Does Thinking More always Help? Mirage of Test-Time Scaling in Reasoning Models
par: Ghosal, Soumya Suvra, et autres
Publié: (2025)
par: Ghosal, Soumya Suvra, et autres
Publié: (2025)
The CLEF-2025 CheckThat! Lab: Subjectivity, Fact-Checking, Claim Normalization, and Retrieval
par: Alam, Firoj, et autres
Publié: (2025)
par: Alam, Firoj, et autres
Publié: (2025)
MuSciClaims: Multimodal Scientific Claim Verification
par: Lal, Yash Kumar, et autres
Publié: (2025)
par: Lal, Yash Kumar, et autres
Publié: (2025)
One LLM to Train Them All: Multi-Task Learning Framework for Fact-Checking
par: Larsson, Malin Astrid, et autres
Publié: (2026)
par: Larsson, Malin Astrid, et autres
Publié: (2026)
TaTToo: Tool-Grounded Thinking PRM for Test-Time Scaling in Tabular Reasoning
par: Zou, Jiaru, et autres
Publié: (2025)
par: Zou, Jiaru, et autres
Publié: (2025)
SciClaimEval: Cross-modal Claim Verification in Scientific Papers
par: Ho, Xanh, et autres
Publié: (2026)
par: Ho, Xanh, et autres
Publié: (2026)
What Do Claim Verification Datasets Actually Test? A Reasoning Trace Analysis
par: Rao, Delip, et autres
Publié: (2026)
par: Rao, Delip, et autres
Publié: (2026)
Proof-Carrying Numbers (PCN): A Protocol for Trustworthy Numeric Answers from LLMs via Claim Verification
par: Solatorio, Aivin V.
Publié: (2025)
par: Solatorio, Aivin V.
Publié: (2025)
Atomic Reasoning for Scientific Table Claim Verification
par: Zhang, Yuji, et autres
Publié: (2025)
par: Zhang, Yuji, et autres
Publié: (2025)
Minimal Evidence Group Identification for Claim Verification
par: Li, Xiangci, et autres
Publié: (2024)
par: Li, Xiangci, et autres
Publié: (2024)
Complex Claim Verification with Evidence Retrieved in the Wild
par: Chen, Jifan, et autres
Publié: (2023)
par: Chen, Jifan, et autres
Publié: (2023)
SciClaimHunt: A Large Dataset for Evidence-based Scientific Claim Verification
par: Kumar, Sujit, et autres
Publié: (2025)
par: Kumar, Sujit, et autres
Publié: (2025)
When Scale Meets Diversity: Evaluating Language Models on Fine-Grained Multilingual Claim Verification
par: Shcharbakova, Hanna, et autres
Publié: (2025)
par: Shcharbakova, Hanna, et autres
Publié: (2025)
Temporal Blind Spots in Large Language Models
par: Wallat, Jonas, et autres
Publié: (2024)
par: Wallat, Jonas, et autres
Publié: (2024)
Scaling Test-Time Compute Without Verification or RL is Suboptimal
par: Setlur, Amrith, et autres
Publié: (2025)
par: Setlur, Amrith, et autres
Publié: (2025)
Optimizing Decomposition for Optimal Claim Verification
par: Lu, Yining, et autres
Publié: (2025)
par: Lu, Yining, et autres
Publié: (2025)
A Multi-Agent Approach for Claim Verification from Tabular Data Documents
par: Saha, Rudra Ranajee, et autres
Publié: (2026)
par: Saha, Rudra Ranajee, et autres
Publié: (2026)
SUNAR: Semantic Uncertainty based Neighborhood Aware Retrieval for Complex QA
par: Venktesh, V, et autres
Publié: (2025)
par: Venktesh, V, et autres
Publié: (2025)
SynClaimEval: A Framework for Evaluating the Utility of Synthetic Data in Long-Context Claim Verification
par: Elaraby, Mohamed, et autres
Publié: (2025)
par: Elaraby, Mohamed, et autres
Publié: (2025)
Learning a Continue-Thinking Token for Enhanced Test-Time Scaling
par: Ringel, Liran, et autres
Publié: (2025)
par: Ringel, Liran, et autres
Publié: (2025)
MatryoshkaThinking: Recursive Test-Time Scaling Enables Efficient Reasoning
par: Chen, Hongwei, et autres
Publié: (2025)
par: Chen, Hongwei, et autres
Publié: (2025)
Documents similaires
-
QuanTemp: A real-world open-domain benchmark for fact-checking numerical claims
par: V, Venktesh, et autres
Publié: (2024) -
Trust but Verify! A Survey on Verification Design for Test-time Scaling
par: Venktesh, V, et autres
Publié: (2025) -
A Benchmark for Open-Domain Numerical Fact-Checking Enhanced by Claim Decomposition
par: Venktesh, V, et autres
Publié: (2025) -
The CLEF-2026 CheckThat! Lab: Advancing Multilingual Fact-Checking
par: Struß, Julia Maria, et autres
Publié: (2026) -
LiveFC: A System for Live Fact-Checking of Audio Streams
par: V, Venktesh, et autres
Publié: (2024)