MedScore: Generalizable Factuality Evaluation of Free-Form Medical Answers by Domain-adapted Claim Decomposition and Verification
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Huang, Heyuan, DeLucia, Alexandra, Tiyyala, Vijay Murari, Dredze, Mark |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Can one size fit all?: Measuring Failure in Multi-Document Summarization Domain Transfer
par: DeLucia, Alexandra, et autres
Publié: (2025)
par: DeLucia, Alexandra, et autres
Publié: (2025)
Same Verdict, Different Reasons: LLM-as-a-Judge and Clinician Disagreement on Medical Chatbot Completeness
par: DeLucia, Alexandra, et autres
Publié: (2026)
par: DeLucia, Alexandra, et autres
Publié: (2026)
DnDScore: Decontextualization and Decomposition for Factuality Verification in Long-Form Text Generation
par: Wanner, Miriam, et autres
Publié: (2024)
par: Wanner, Miriam, et autres
Publié: (2024)
A Closer Look at Claim Decomposition
par: Wanner, Miriam, et autres
Publié: (2024)
par: Wanner, Miriam, et autres
Publié: (2024)
A Claim Decomposition Benchmark for Long-form Answer Verification
par: Zhang, Zhihao, et autres
Publié: (2024)
par: Zhang, Zhihao, et autres
Publié: (2024)
DecMetrics: Structured Claim Decomposition Scoring for Factually Consistent LLM Outputs
par: Huang, Minghui
Publié: (2025)
par: Huang, Minghui
Publié: (2025)
Characterizing public comments via Regulations.gov in response to proposed cannabis rescheduling in the United States
par: Vijay M. Tiyyala, et autres
Publié: (2026)
par: Vijay M. Tiyyala, et autres
Publié: (2026)
Anti-LM Decoding for Zero-shot In-context Machine Translation
par: Sia, Suzanna, et autres
Publié: (2023)
par: Sia, Suzanna, et autres
Publié: (2023)
Optimizing Decomposition for Optimal Claim Verification
par: Lu, Yining, et autres
Publié: (2025)
par: Lu, Yining, et autres
Publié: (2025)
Using Natural Language Inference to Improve Persona Extraction from Dialogue in a New Domain
par: DeLucia, Alexandra, et autres
Publié: (2024)
par: DeLucia, Alexandra, et autres
Publié: (2024)
Towards Effective Extraction and Evaluation of Factual Claims
par: Metropolitansky, Dasha, et autres
Publié: (2025)
par: Metropolitansky, Dasha, et autres
Publié: (2025)
Distill and Align Decomposition for Enhanced Claim Verification
par: Magomere, Jabez, et autres
Publié: (2026)
par: Magomere, Jabez, et autres
Publié: (2026)
The Alignment Bottleneck in Decomposition-Based Claim Verification
par: Akhter, Mahmud Elahi, et autres
Publié: (2026)
par: Akhter, Mahmud Elahi, et autres
Publié: (2026)
Merging Facts, Crafting Fallacies: Evaluating the Contradictory Nature of Aggregated Factual Claims in Long-Form Generations
par: Chiang, Cheng-Han, et autres
Publié: (2024)
par: Chiang, Cheng-Han, et autres
Publié: (2024)
MedRAGChecker: Claim-Level Verification for Biomedical Retrieval-Augmented Generation
par: Ji, Yuelyu, et autres
Publié: (2026)
par: Ji, Yuelyu, et autres
Publié: (2026)
Evaluating the Evaluators: Are readability metrics good measures of readability?
par: Cachola, Isabel, et autres
Publié: (2025)
par: Cachola, Isabel, et autres
Publié: (2025)
The Curious Case of Factual (Mis)Alignment between LLMs' Short- and Long-Form Answers
par: Islam, Saad Obaid ul, et autres
Publié: (2025)
par: Islam, Saad Obaid ul, et autres
Publié: (2025)
Evaluating Reliability Asymmetries in Chinese Factual Search and AI Answers
par: Liu, Geng, et autres
Publié: (2025)
par: Liu, Geng, et autres
Publié: (2025)
Evaluating Implicit Biases in LLM Reasoning through Logic Grid Puzzles
par: Jahara, Fatima, et autres
Publié: (2025)
par: Jahara, Fatima, et autres
Publié: (2025)
ProofNet++: A Neuro-Symbolic System for Formal Proof Verification with Self-Correction
par: Ambati, Murari
Publié: (2025)
par: Ambati, Murari
Publié: (2025)
ClaimHack: A Benchmark Dataset of Check-worthy Factual Claims
par: Rayapet Madhusudhan, Akshay Kumar, et autres
Publié: (2025)
par: Rayapet Madhusudhan, Akshay Kumar, et autres
Publié: (2025)
Benchmarking Large Language Models on Answering and Explaining Challenging Medical Questions
par: Chen, Hanjie, et autres
Publié: (2024)
par: Chen, Hanjie, et autres
Publié: (2024)
Style Content Decomposition-based Data Augmentation for Domain Generalizable Medical Image Segmentation
par: Shen, Zhiqiang, et autres
Publié: (2025)
par: Shen, Zhiqiang, et autres
Publié: (2025)
Transferring Fairness using Multi-Task Learning with Limited Demographic Information
par: Aguirre, Carlos, et autres
Publié: (2023)
par: Aguirre, Carlos, et autres
Publié: (2023)
Amuro and Char: Analyzing the Relationship between Pre-Training and Fine-Tuning of Large Language Models
par: Sun, Kaiser, et autres
Publié: (2024)
par: Sun, Kaiser, et autres
Publié: (2024)
MedReason: Eliciting Factual Medical Reasoning Steps in LLMs via Knowledge Graphs
par: Wu, Juncheng, et autres
Publié: (2025)
par: Wu, Juncheng, et autres
Publié: (2025)
FENICE: Factuality Evaluation of summarization based on Natural language Inference and Claim Extraction
par: Scirè, Alessandro, et autres
Publié: (2024)
par: Scirè, Alessandro, et autres
Publié: (2024)
Comparing Knowledge Sources for Open-Domain Scientific Claim Verification
par: Vladika, Juraj, et autres
Publié: (2024)
par: Vladika, Juraj, et autres
Publié: (2024)
All Claims Are Equal, but Some Claims Are More Equal Than Others: Importance-Sensitive Factuality Evaluation of LLM Generations
par: Wanner, Miriam, et autres
Publié: (2025)
par: Wanner, Miriam, et autres
Publié: (2025)
Demo: Statistically Significant Results On Biases and Errors of LLMs Do Not Guarantee Generalizable Results
par: Liu, Jonathan, et autres
Publié: (2025)
par: Liu, Jonathan, et autres
Publié: (2025)
MedSEBA: Synthesizing Evidence-Based Answers Grounded in Evolving Medical Literature
par: Vladika, Juraj, et autres
Publié: (2025)
par: Vladika, Juraj, et autres
Publié: (2025)
MedFactEval and MedAgentBrief: A Framework and Workflow for Generating and Evaluating Factual Clinical Summaries
par: Grolleau, François, et autres
Publié: (2025)
par: Grolleau, François, et autres
Publié: (2025)
Step-by-Step Fact Verification System for Medical Claims with Explainable Reasoning
par: Vladika, Juraj, et autres
Publié: (2025)
par: Vladika, Juraj, et autres
Publié: (2025)
MedFact-R1: Towards Factual Medical Reasoning via Pseudo-Label Augmentation
par: Li, Gengliang, et autres
Publié: (2025)
par: Li, Gengliang, et autres
Publié: (2025)
FECT: Factuality Evaluation of Interpretive AI-Generated Claims in Contact Center Conversation Transcripts
par: Shin, Hagyeong, et autres
Publié: (2025)
par: Shin, Hagyeong, et autres
Publié: (2025)
Pelican: Correcting Hallucination in Vision-LLMs via Claim Decomposition and Program of Thought Verification
par: Sahu, Pritish, et autres
Publié: (2024)
par: Sahu, Pritish, et autres
Publié: (2024)
RAG LLMs are Not Safer: A Safety Analysis of Retrieval-Augmented Generation for Large Language Models
par: An, Bang, et autres
Publié: (2025)
par: An, Bang, et autres
Publié: (2025)
Proof-Carrying Numbers (PCN): A Protocol for Trustworthy Numeric Answers from LLMs via Claim Verification
par: Solatorio, Aivin V.
Publié: (2025)
par: Solatorio, Aivin V.
Publié: (2025)
Evaluating Factual Density in Multi-Source RAG: A Study in Medical AI Accuracy
par: DeMarco, Michael R.
Publié: (2026)
par: DeMarco, Michael R.
Publié: (2026)
MuSciClaims: Multimodal Scientific Claim Verification
par: Lal, Yash Kumar, et autres
Publié: (2025)
par: Lal, Yash Kumar, et autres
Publié: (2025)
Documents similaires
-
Can one size fit all?: Measuring Failure in Multi-Document Summarization Domain Transfer
par: DeLucia, Alexandra, et autres
Publié: (2025) -
Same Verdict, Different Reasons: LLM-as-a-Judge and Clinician Disagreement on Medical Chatbot Completeness
par: DeLucia, Alexandra, et autres
Publié: (2026) -
DnDScore: Decontextualization and Decomposition for Factuality Verification in Long-Form Text Generation
par: Wanner, Miriam, et autres
Publié: (2024) -
A Closer Look at Claim Decomposition
par: Wanner, Miriam, et autres
Publié: (2024) -
A Claim Decomposition Benchmark for Long-form Answer Verification
par: Zhang, Zhihao, et autres
Publié: (2024)