MedScore: Generalizable Factuality Evaluation of Free-Form Medical Answers by Domain-adapted Claim Decomposition and Verification
Fuente:
arXiv
Guardado en:
| Autores principales: | Huang, Heyuan, DeLucia, Alexandra, Tiyyala, Vijay Murari, Dredze, Mark |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Can one size fit all?: Measuring Failure in Multi-Document Summarization Domain Transfer
por: DeLucia, Alexandra, et al.
Publicado: (2025)
por: DeLucia, Alexandra, et al.
Publicado: (2025)
Same Verdict, Different Reasons: LLM-as-a-Judge and Clinician Disagreement on Medical Chatbot Completeness
por: DeLucia, Alexandra, et al.
Publicado: (2026)
por: DeLucia, Alexandra, et al.
Publicado: (2026)
DnDScore: Decontextualization and Decomposition for Factuality Verification in Long-Form Text Generation
por: Wanner, Miriam, et al.
Publicado: (2024)
por: Wanner, Miriam, et al.
Publicado: (2024)
A Closer Look at Claim Decomposition
por: Wanner, Miriam, et al.
Publicado: (2024)
por: Wanner, Miriam, et al.
Publicado: (2024)
A Claim Decomposition Benchmark for Long-form Answer Verification
por: Zhang, Zhihao, et al.
Publicado: (2024)
por: Zhang, Zhihao, et al.
Publicado: (2024)
DecMetrics: Structured Claim Decomposition Scoring for Factually Consistent LLM Outputs
por: Huang, Minghui
Publicado: (2025)
por: Huang, Minghui
Publicado: (2025)
Characterizing public comments via Regulations.gov in response to proposed cannabis rescheduling in the United States
por: Vijay M. Tiyyala, et al.
Publicado: (2026)
por: Vijay M. Tiyyala, et al.
Publicado: (2026)
Anti-LM Decoding for Zero-shot In-context Machine Translation
por: Sia, Suzanna, et al.
Publicado: (2023)
por: Sia, Suzanna, et al.
Publicado: (2023)
Optimizing Decomposition for Optimal Claim Verification
por: Lu, Yining, et al.
Publicado: (2025)
por: Lu, Yining, et al.
Publicado: (2025)
Using Natural Language Inference to Improve Persona Extraction from Dialogue in a New Domain
por: DeLucia, Alexandra, et al.
Publicado: (2024)
por: DeLucia, Alexandra, et al.
Publicado: (2024)
Towards Effective Extraction and Evaluation of Factual Claims
por: Metropolitansky, Dasha, et al.
Publicado: (2025)
por: Metropolitansky, Dasha, et al.
Publicado: (2025)
Distill and Align Decomposition for Enhanced Claim Verification
por: Magomere, Jabez, et al.
Publicado: (2026)
por: Magomere, Jabez, et al.
Publicado: (2026)
The Alignment Bottleneck in Decomposition-Based Claim Verification
por: Akhter, Mahmud Elahi, et al.
Publicado: (2026)
por: Akhter, Mahmud Elahi, et al.
Publicado: (2026)
Merging Facts, Crafting Fallacies: Evaluating the Contradictory Nature of Aggregated Factual Claims in Long-Form Generations
por: Chiang, Cheng-Han, et al.
Publicado: (2024)
por: Chiang, Cheng-Han, et al.
Publicado: (2024)
MedRAGChecker: Claim-Level Verification for Biomedical Retrieval-Augmented Generation
por: Ji, Yuelyu, et al.
Publicado: (2026)
por: Ji, Yuelyu, et al.
Publicado: (2026)
Evaluating the Evaluators: Are readability metrics good measures of readability?
por: Cachola, Isabel, et al.
Publicado: (2025)
por: Cachola, Isabel, et al.
Publicado: (2025)
The Curious Case of Factual (Mis)Alignment between LLMs' Short- and Long-Form Answers
por: Islam, Saad Obaid ul, et al.
Publicado: (2025)
por: Islam, Saad Obaid ul, et al.
Publicado: (2025)
Evaluating Reliability Asymmetries in Chinese Factual Search and AI Answers
por: Liu, Geng, et al.
Publicado: (2025)
por: Liu, Geng, et al.
Publicado: (2025)
Evaluating Implicit Biases in LLM Reasoning through Logic Grid Puzzles
por: Jahara, Fatima, et al.
Publicado: (2025)
por: Jahara, Fatima, et al.
Publicado: (2025)
ProofNet++: A Neuro-Symbolic System for Formal Proof Verification with Self-Correction
por: Ambati, Murari
Publicado: (2025)
por: Ambati, Murari
Publicado: (2025)
ClaimHack: A Benchmark Dataset of Check-worthy Factual Claims
por: Rayapet Madhusudhan, Akshay Kumar, et al.
Publicado: (2025)
por: Rayapet Madhusudhan, Akshay Kumar, et al.
Publicado: (2025)
Benchmarking Large Language Models on Answering and Explaining Challenging Medical Questions
por: Chen, Hanjie, et al.
Publicado: (2024)
por: Chen, Hanjie, et al.
Publicado: (2024)
Style Content Decomposition-based Data Augmentation for Domain Generalizable Medical Image Segmentation
por: Shen, Zhiqiang, et al.
Publicado: (2025)
por: Shen, Zhiqiang, et al.
Publicado: (2025)
Transferring Fairness using Multi-Task Learning with Limited Demographic Information
por: Aguirre, Carlos, et al.
Publicado: (2023)
por: Aguirre, Carlos, et al.
Publicado: (2023)
Amuro and Char: Analyzing the Relationship between Pre-Training and Fine-Tuning of Large Language Models
por: Sun, Kaiser, et al.
Publicado: (2024)
por: Sun, Kaiser, et al.
Publicado: (2024)
MedReason: Eliciting Factual Medical Reasoning Steps in LLMs via Knowledge Graphs
por: Wu, Juncheng, et al.
Publicado: (2025)
por: Wu, Juncheng, et al.
Publicado: (2025)
FENICE: Factuality Evaluation of summarization based on Natural language Inference and Claim Extraction
por: Scirè, Alessandro, et al.
Publicado: (2024)
por: Scirè, Alessandro, et al.
Publicado: (2024)
Comparing Knowledge Sources for Open-Domain Scientific Claim Verification
por: Vladika, Juraj, et al.
Publicado: (2024)
por: Vladika, Juraj, et al.
Publicado: (2024)
All Claims Are Equal, but Some Claims Are More Equal Than Others: Importance-Sensitive Factuality Evaluation of LLM Generations
por: Wanner, Miriam, et al.
Publicado: (2025)
por: Wanner, Miriam, et al.
Publicado: (2025)
Demo: Statistically Significant Results On Biases and Errors of LLMs Do Not Guarantee Generalizable Results
por: Liu, Jonathan, et al.
Publicado: (2025)
por: Liu, Jonathan, et al.
Publicado: (2025)
MedSEBA: Synthesizing Evidence-Based Answers Grounded in Evolving Medical Literature
por: Vladika, Juraj, et al.
Publicado: (2025)
por: Vladika, Juraj, et al.
Publicado: (2025)
MedFactEval and MedAgentBrief: A Framework and Workflow for Generating and Evaluating Factual Clinical Summaries
por: Grolleau, François, et al.
Publicado: (2025)
por: Grolleau, François, et al.
Publicado: (2025)
Step-by-Step Fact Verification System for Medical Claims with Explainable Reasoning
por: Vladika, Juraj, et al.
Publicado: (2025)
por: Vladika, Juraj, et al.
Publicado: (2025)
MedFact-R1: Towards Factual Medical Reasoning via Pseudo-Label Augmentation
por: Li, Gengliang, et al.
Publicado: (2025)
por: Li, Gengliang, et al.
Publicado: (2025)
FECT: Factuality Evaluation of Interpretive AI-Generated Claims in Contact Center Conversation Transcripts
por: Shin, Hagyeong, et al.
Publicado: (2025)
por: Shin, Hagyeong, et al.
Publicado: (2025)
Pelican: Correcting Hallucination in Vision-LLMs via Claim Decomposition and Program of Thought Verification
por: Sahu, Pritish, et al.
Publicado: (2024)
por: Sahu, Pritish, et al.
Publicado: (2024)
RAG LLMs are Not Safer: A Safety Analysis of Retrieval-Augmented Generation for Large Language Models
por: An, Bang, et al.
Publicado: (2025)
por: An, Bang, et al.
Publicado: (2025)
Proof-Carrying Numbers (PCN): A Protocol for Trustworthy Numeric Answers from LLMs via Claim Verification
por: Solatorio, Aivin V.
Publicado: (2025)
por: Solatorio, Aivin V.
Publicado: (2025)
Evaluating Factual Density in Multi-Source RAG: A Study in Medical AI Accuracy
por: DeMarco, Michael R.
Publicado: (2026)
por: DeMarco, Michael R.
Publicado: (2026)
MuSciClaims: Multimodal Scientific Claim Verification
por: Lal, Yash Kumar, et al.
Publicado: (2025)
por: Lal, Yash Kumar, et al.
Publicado: (2025)
Ejemplares similares
-
Can one size fit all?: Measuring Failure in Multi-Document Summarization Domain Transfer
por: DeLucia, Alexandra, et al.
Publicado: (2025) -
Same Verdict, Different Reasons: LLM-as-a-Judge and Clinician Disagreement on Medical Chatbot Completeness
por: DeLucia, Alexandra, et al.
Publicado: (2026) -
DnDScore: Decontextualization and Decomposition for Factuality Verification in Long-Form Text Generation
por: Wanner, Miriam, et al.
Publicado: (2024) -
A Closer Look at Claim Decomposition
por: Wanner, Miriam, et al.
Publicado: (2024) -
A Claim Decomposition Benchmark for Long-form Answer Verification
por: Zhang, Zhihao, et al.
Publicado: (2024)