MAD-Fact: A Multi-Agent Debate Framework for Long-Form Factuality Evaluation in LLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ning, Yucheng, Lin, Xixun, Fang, Fang, Cao, Yanan |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Do LLMs Know Tool Irrelevance? Demystifying Structural Alignment Bias in Tool Invocations
par: Liu, Yilong, et autres
Publié: (2026)
par: Liu, Yilong, et autres
Publié: (2026)
Knowledge-Level Consistency Reinforcement Learning: Dual-Fact Alignment for Long-Form Factuality
par: Li, Junliang, et autres
Publié: (2025)
par: Li, Junliang, et autres
Publié: (2025)
Should we be going MAD? A Look at Multi-Agent Debate Strategies for LLMs
par: Smit, Andries, et autres
Publié: (2023)
par: Smit, Andries, et autres
Publié: (2023)
OpenFactCheck: A Unified Framework for Factuality Evaluation of LLMs
par: Iqbal, Hasan, et autres
Publié: (2024)
par: Iqbal, Hasan, et autres
Publié: (2024)
FactReasoner: A Probabilistic Approach to Long-Form Factuality Assessment for Large Language Models
par: Marinescu, Radu, et autres
Publié: (2025)
par: Marinescu, Radu, et autres
Publié: (2025)
M-MAD: Multidimensional Multi-Agent Debate for Advanced Machine Translation Evaluation
par: Feng, Zhaopeng, et autres
Publié: (2024)
par: Feng, Zhaopeng, et autres
Publié: (2024)
FactCorrector: A Graph-Inspired Approach to Long-Form Factuality Correction of Large Language Models
par: Carnerero-Cano, Javier, et autres
Publié: (2026)
par: Carnerero-Cano, Javier, et autres
Publié: (2026)
FaStfact: Faster, Stronger Long-Form Factuality Evaluations in LLMs
par: Wan, Yingjia, et autres
Publié: (2025)
par: Wan, Yingjia, et autres
Publié: (2025)
Argument Collapse: LLMs Flatten Long-Form Public Debate
par: Kim, Yekyung, et autres
Publié: (2026)
par: Kim, Yekyung, et autres
Publié: (2026)
S$^2$-MAD: Breaking the Token Barrier to Enhance Multi-Agent Debate Efficiency
par: Zeng, Yuting, et autres
Publié: (2025)
par: Zeng, Yuting, et autres
Publié: (2025)
The Curious Case of Factual (Mis)Alignment between LLMs' Short- and Long-Form Answers
par: Islam, Saad Obaid ul, et autres
Publié: (2025)
par: Islam, Saad Obaid ul, et autres
Publié: (2025)
FactAlign: Long-form Factuality Alignment of Large Language Models
par: Huang, Chao-Wei, et autres
Publié: (2024)
par: Huang, Chao-Wei, et autres
Publié: (2024)
MAD-OPD: Breaking the Ceiling in On-Policy Distillation via Multi-Agent Debate
par: Wang, Jianze, et autres
Publié: (2026)
par: Wang, Jianze, et autres
Publié: (2026)
Enhancing Large Language Model for Knowledge Graph Completion via Structure-Aware Alignment-Tuning
par: Liu, Yu, et autres
Publié: (2025)
par: Liu, Yu, et autres
Publié: (2025)
FactGuard: Leveraging Multi-Agent Systems to Generate Answerable and Unanswerable Questions for Enhanced Long-Context LLM Extraction
par: Zhang, Qian-Wen, et autres
Publié: (2025)
par: Zhang, Qian-Wen, et autres
Publié: (2025)
Long-Form Information Alignment Evaluation Beyond Atomic Facts
par: Zheng, Danna, et autres
Publié: (2025)
par: Zheng, Danna, et autres
Publié: (2025)
iMAD: Intelligent Multi-Agent Debate for Efficient and Accurate LLM Inference
par: Fan, Wei, et autres
Publié: (2025)
par: Fan, Wei, et autres
Publié: (2025)
Is Factuality Enhancement a Free Lunch For LLMs? Better Factuality Can Lead to Worse Context-Faithfulness
par: Bi, Baolong, et autres
Publié: (2024)
par: Bi, Baolong, et autres
Publié: (2024)
FACTORY: A Challenging Human-Verified Prompt Set for Long-Form Factuality
par: Chen, Mingda, et autres
Publié: (2025)
par: Chen, Mingda, et autres
Publié: (2025)
WildHallucinations: Evaluating Long-form Factuality in LLMs with Real-World Entity Queries
par: Zhao, Wenting, et autres
Publié: (2024)
par: Zhao, Wenting, et autres
Publié: (2024)
LEAF: Learning and Evaluation Augmented by Fact-Checking to Improve Factualness in Large Language Models
par: Tran, Hieu, et autres
Publié: (2024)
par: Tran, Hieu, et autres
Publié: (2024)
InFact: Informativeness Alignment for Improved LLM Factuality
par: Cohen, Roi, et autres
Publié: (2025)
par: Cohen, Roi, et autres
Publié: (2025)
HGOT: Hierarchical Graph of Thoughts for Retrieval-Augmented In-Context Learning in Factuality Evaluation
par: Fang, Yihao, et autres
Publié: (2024)
par: Fang, Yihao, et autres
Publié: (2024)
Locomo-Plus: Beyond-Factual Cognitive Memory Evaluation Framework for LLM Agents
par: Li, Yifei, et autres
Publié: (2026)
par: Li, Yifei, et autres
Publié: (2026)
Dynamic Role Assignment for Multi-Agent Debate
par: Zhang, Miao, et autres
Publié: (2026)
par: Zhang, Miao, et autres
Publié: (2026)
FASTTRACK: Fast and Accurate Fact Tracing for LLMs
par: Chen, Si, et autres
Publié: (2024)
par: Chen, Si, et autres
Publié: (2024)
How Does Response Length Affect Long-Form Factuality
par: Zhao, James Xu, et autres
Publié: (2025)
par: Zhao, James Xu, et autres
Publié: (2025)
Hallucination to Truth: A Review of Fact-Checking and Factuality Evaluation in Large Language Models
par: Rahman, Subhey Sadi, et autres
Publié: (2025)
par: Rahman, Subhey Sadi, et autres
Publié: (2025)
Large Language Models for Planning: A Comprehensive and Systematic Survey
par: Cao, Pengfei, et autres
Publié: (2025)
par: Cao, Pengfei, et autres
Publié: (2025)
Beyond Factual QA: Mentorship-Oriented Question Answering over Long-Form Multilingual Content
par: Bhalerao, Parth, et autres
Publié: (2026)
par: Bhalerao, Parth, et autres
Publié: (2026)
Profiling News Media for Factuality and Bias Using LLMs and the Fact-Checking Methodology of Human Experts
par: Mujahid, Zain Muhammad, et autres
Publié: (2025)
par: Mujahid, Zain Muhammad, et autres
Publié: (2025)
Can Large Language Models be Trusted for Evaluation? Scalable Meta-Evaluation of LLMs as Evaluators via Agent Debate
par: Chern, Steffi, et autres
Publié: (2024)
par: Chern, Steffi, et autres
Publié: (2024)
Towards a Holistic Evaluation of LLMs on Factual Knowledge Recall
par: Yuan, Jiaqing, et autres
Publié: (2024)
par: Yuan, Jiaqing, et autres
Publié: (2024)
Self-Alignment for Factuality: Mitigating Hallucinations in LLMs via Self-Evaluation
par: Zhang, Xiaoying, et autres
Publié: (2024)
par: Zhang, Xiaoying, et autres
Publié: (2024)
Reliably Bounding False Positives: A Zero-Shot Machine-Generated Text Detection Framework via Multiscaled Conformal Prediction
par: Zhu, Xiaowei, et autres
Publié: (2025)
par: Zhu, Xiaowei, et autres
Publié: (2025)
Discourse-Driven Evaluation: Unveiling Factual Inconsistency in Long Document Summarization
par: Zhong, Yang, et autres
Publié: (2025)
par: Zhong, Yang, et autres
Publié: (2025)
Use of Retrieval-Augmented Large Language Model Agent for Long-Form COVID-19 Fact-Checking
par: Huang, Jingyi, et autres
Publié: (2025)
par: Huang, Jingyi, et autres
Publié: (2025)
Do Automatic Factuality Metrics Measure Factuality? A Critical Evaluation
par: Ramprasad, Sanjana, et autres
Publié: (2024)
par: Ramprasad, Sanjana, et autres
Publié: (2024)
Enhancing LLMs for Impression Generation in Radiology Reports through a Multi-Agent System
par: Zeng, Fang, et autres
Publié: (2024)
par: Zeng, Fang, et autres
Publié: (2024)
Debate-to-Write: A Persona-Driven Multi-Agent Framework for Diverse Argument Generation
par: Hu, Zhe, et autres
Publié: (2024)
par: Hu, Zhe, et autres
Publié: (2024)
Documents similaires
-
Do LLMs Know Tool Irrelevance? Demystifying Structural Alignment Bias in Tool Invocations
par: Liu, Yilong, et autres
Publié: (2026) -
Knowledge-Level Consistency Reinforcement Learning: Dual-Fact Alignment for Long-Form Factuality
par: Li, Junliang, et autres
Publié: (2025) -
Should we be going MAD? A Look at Multi-Agent Debate Strategies for LLMs
par: Smit, Andries, et autres
Publié: (2023) -
OpenFactCheck: A Unified Framework for Factuality Evaluation of LLMs
par: Iqbal, Hasan, et autres
Publié: (2024) -
FactReasoner: A Probabilistic Approach to Long-Form Factuality Assessment for Large Language Models
par: Marinescu, Radu, et autres
Publié: (2025)