SUCEA: Reasoning-Intensive Retrieval for Adversarial Fact-checking through Claim Decomposition and Editing
Fuente:
arXiv
Salvato in:
| Autori principali: | Liu, Hongjun, Zhao, Yilun, Cohan, Arman, Zhao, Chen |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
PuzzlePlex: Benchmarking Foundation Models on Reasoning and Planning with Puzzles
di: Long, Yitao, et al.
Pubblicazione: (2025)
di: Long, Yitao, et al.
Pubblicazione: (2025)
FinanceMath: Knowledge-Intensive Math Reasoning in Finance Domains
di: Zhao, Yilun, et al.
Pubblicazione: (2023)
di: Zhao, Yilun, et al.
Pubblicazione: (2023)
Rethinking Reasoning-Intensive Retrieval: Evaluating and Advancing Retrievers in Agentic Search Systems
di: Zhao, Yilun, et al.
Pubblicazione: (2026)
di: Zhao, Yilun, et al.
Pubblicazione: (2026)
fact check AI at SemEval-2025 Task 7: Multilingual and Crosslingual Fact-checked Claim Retrieval
di: Rastogi, Pranshu
Pubblicazione: (2025)
di: Rastogi, Pranshu
Pubblicazione: (2025)
Semi-automated Fact-checking in Portuguese: Corpora Enrichment using Retrieval with Claim extraction
di: Gomes, Juliana Resplande Sant'anna, et al.
Pubblicazione: (2025)
di: Gomes, Juliana Resplande Sant'anna, et al.
Pubblicazione: (2025)
SciMDR: Advancing Scientific Multimodal Document Reasoning
di: Chen, Ziyu, et al.
Pubblicazione: (2026)
di: Chen, Ziyu, et al.
Pubblicazione: (2026)
Investigating Data Contamination in Modern Benchmarks for Large Language Models
di: Deng, Chunyuan, et al.
Pubblicazione: (2023)
di: Deng, Chunyuan, et al.
Pubblicazione: (2023)
M3SciQA: A Multi-Modal Multi-Document Scientific QA Benchmark for Evaluating Foundation Models
di: Li, Chuhan, et al.
Pubblicazione: (2024)
di: Li, Chuhan, et al.
Pubblicazione: (2024)
LimRank: Less is More for Reasoning-Intensive Information Reranking
di: Song, Tingyu, et al.
Pubblicazione: (2025)
di: Song, Tingyu, et al.
Pubblicazione: (2025)
MedAgents: Large Language Models as Collaborators for Zero-shot Medical Reasoning
di: Tang, Xiangru, et al.
Pubblicazione: (2023)
di: Tang, Xiangru, et al.
Pubblicazione: (2023)
TOMATO: Assessing Visual Temporal Reasoning Capabilities in Multimodal Foundation Models
di: Shangguan, Ziyao, et al.
Pubblicazione: (2024)
di: Shangguan, Ziyao, et al.
Pubblicazione: (2024)
Zero-shot and Few-shot Learning with Instruction-following LLMs for Claim Matching in Automated Fact-checking
di: Pisarevskaya, Dina, et al.
Pubblicazione: (2025)
di: Pisarevskaya, Dina, et al.
Pubblicazione: (2025)
AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research
di: Zhao, Yilun, et al.
Pubblicazione: (2025)
di: Zhao, Yilun, et al.
Pubblicazione: (2025)
RbtAct: Rebuttal as Supervision for Actionable Review Feedback Generation
di: Wu, Sihong, et al.
Pubblicazione: (2026)
di: Wu, Sihong, et al.
Pubblicazione: (2026)
FIRE: Fact-checking with Iterative Retrieval and Verification
di: Xie, Zhuohan, et al.
Pubblicazione: (2024)
di: Xie, Zhuohan, et al.
Pubblicazione: (2024)
Decomposition Dilemmas: Does Claim Decomposition Boost or Burden Fact-Checking Performance?
di: Hu, Qisheng, et al.
Pubblicazione: (2024)
di: Hu, Qisheng, et al.
Pubblicazione: (2024)
MCTS-RAG: Enhancing Retrieval-Augmented Generation with Monte Carlo Tree Search
di: Hu, Yunhai, et al.
Pubblicazione: (2025)
di: Hu, Yunhai, et al.
Pubblicazione: (2025)
Step-by-Step Fact Verification System for Medical Claims with Explainable Reasoning
di: Vladika, Juraj, et al.
Pubblicazione: (2025)
di: Vladika, Juraj, et al.
Pubblicazione: (2025)
Can AI Be a Good Peer Reviewer? A Survey of Peer Review Process, Evaluation, and the Future
di: Wu, Sihong, et al.
Pubblicazione: (2026)
di: Wu, Sihong, et al.
Pubblicazione: (2026)
MIMIR: A Streamlined Platform for Personalized Agent Tuning in Domain Expertise
di: Deng, Chunyuan, et al.
Pubblicazione: (2024)
di: Deng, Chunyuan, et al.
Pubblicazione: (2024)
MedAgentsBench: Benchmarking Thinking Models and Agent Frameworks for Complex Medical Reasoning
di: Tang, Xiangru, et al.
Pubblicazione: (2025)
di: Tang, Xiangru, et al.
Pubblicazione: (2025)
Evaluating Legal Reasoning Traces with Legal Issue Tree Rubrics
di: Lee, Jinu, et al.
Pubblicazione: (2025)
di: Lee, Jinu, et al.
Pubblicazione: (2025)
KG-CRAFT: Knowledge Graph-based Contrastive Reasoning with LLMs for Enhancing Automated Fact-checking
di: Lourenço, Vítor N., et al.
Pubblicazione: (2026)
di: Lourenço, Vítor N., et al.
Pubblicazione: (2026)
SciVer: Evaluating Foundation Models for Multimodal Scientific Claim Verification
di: Wang, Chengye, et al.
Pubblicazione: (2025)
di: Wang, Chengye, et al.
Pubblicazione: (2025)
On the Benefits of Fine-Grained Loss Truncation: A Case Study on Factuality in Summarization
di: Flores, Lorenzo Jaime Yu, et al.
Pubblicazione: (2024)
di: Flores, Lorenzo Jaime Yu, et al.
Pubblicazione: (2024)
On Evaluating LLM Alignment by Evaluating LLMs as Judges
di: Liu, Yixin, et al.
Pubblicazione: (2025)
di: Liu, Yixin, et al.
Pubblicazione: (2025)
Table-R1: Inference-Time Scaling for Table Reasoning
di: Yang, Zheyuan, et al.
Pubblicazione: (2025)
di: Yang, Zheyuan, et al.
Pubblicazione: (2025)
ChemAgent: Self-updating Library in Large Language Models Improves Chemical Reasoning
di: Tang, Xiangru, et al.
Pubblicazione: (2025)
di: Tang, Xiangru, et al.
Pubblicazione: (2025)
Step-Back Profiling: Distilling User History for Personalized Scientific Writing
di: Tang, Xiangru, et al.
Pubblicazione: (2024)
di: Tang, Xiangru, et al.
Pubblicazione: (2024)
Robust Claim Verification Through Fact Detection
di: Jafari, Nazanin, et al.
Pubblicazione: (2024)
di: Jafari, Nazanin, et al.
Pubblicazione: (2024)
MIR: Methodology Inspiration Retrieval for Scientific Research Problems
di: Garikaparthi, Aniketh, et al.
Pubblicazione: (2025)
di: Garikaparthi, Aniketh, et al.
Pubblicazione: (2025)
Attacks by Content: Automated Fact-checking is an AI Security Issue
di: Schlichtkrull, Michael
Pubblicazione: (2025)
di: Schlichtkrull, Michael
Pubblicazione: (2025)
P-FOLIO: Evaluating and Improving Logical Reasoning with Abundant Human-Written Reasoning Chains
di: Han, Simeng, et al.
Pubblicazione: (2024)
di: Han, Simeng, et al.
Pubblicazione: (2024)
Has this Fact been Edited? Detecting Knowledge Edits in Language Models
di: Youssef, Paul, et al.
Pubblicazione: (2024)
di: Youssef, Paul, et al.
Pubblicazione: (2024)
Retro*: Optimizing LLMs for Reasoning-Intensive Document Retrieval
di: Lan, Junwei, et al.
Pubblicazione: (2025)
di: Lan, Junwei, et al.
Pubblicazione: (2025)
FinDVer: Explainable Claim Verification over Long and Hybrid-Content Financial Documents
di: Zhao, Yilun, et al.
Pubblicazione: (2024)
di: Zhao, Yilun, et al.
Pubblicazione: (2024)
SAGE: Benchmarking and Improving Retrieval for Deep Research Agents
di: Hu, Tiansheng, et al.
Pubblicazione: (2026)
di: Hu, Tiansheng, et al.
Pubblicazione: (2026)
Learning to Generate and Evaluate Fact-checking Explanations with Transformers
di: Feher, Darius, et al.
Pubblicazione: (2024)
di: Feher, Darius, et al.
Pubblicazione: (2024)
ReIFE: Re-evaluating Instruction-Following Evaluation
di: Liu, Yixin, et al.
Pubblicazione: (2024)
di: Liu, Yixin, et al.
Pubblicazione: (2024)
Bayesian Calibration of Win Rate Estimation with LLM Evaluators
di: Gao, Yicheng, et al.
Pubblicazione: (2024)
di: Gao, Yicheng, et al.
Pubblicazione: (2024)
Documenti analoghi
-
PuzzlePlex: Benchmarking Foundation Models on Reasoning and Planning with Puzzles
di: Long, Yitao, et al.
Pubblicazione: (2025) -
FinanceMath: Knowledge-Intensive Math Reasoning in Finance Domains
di: Zhao, Yilun, et al.
Pubblicazione: (2023) -
Rethinking Reasoning-Intensive Retrieval: Evaluating and Advancing Retrievers in Agentic Search Systems
di: Zhao, Yilun, et al.
Pubblicazione: (2026) -
fact check AI at SemEval-2025 Task 7: Multilingual and Crosslingual Fact-checked Claim Retrieval
di: Rastogi, Pranshu
Pubblicazione: (2025) -
Semi-automated Fact-checking in Portuguese: Corpora Enrichment using Retrieval with Claim extraction
di: Gomes, Juliana Resplande Sant'anna, et al.
Pubblicazione: (2025)