FactTest: Factuality Testing in Large Language Models with Finite-Sample and Distribution-Free Guarantees
Fuente:
arXiv
Salvato in:
| Autori principali: | Nie, Fan, Hou, Xiaotian, Lin, Shuhang, Zou, James, Yao, Huaxiu, Zhang, Linjun |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
RULE: Reliable Multimodal RAG for Factuality in Medical Vision Language Models
di: Xia, Peng, et al.
Pubblicazione: (2024)
di: Xia, Peng, et al.
Pubblicazione: (2024)
FactCorrector: A Graph-Inspired Approach to Long-Form Factuality Correction of Large Language Models
di: Carnerero-Cano, Javier, et al.
Pubblicazione: (2026)
di: Carnerero-Cano, Javier, et al.
Pubblicazione: (2026)
FactReasoner: A Probabilistic Approach to Long-Form Factuality Assessment for Large Language Models
di: Marinescu, Radu, et al.
Pubblicazione: (2025)
di: Marinescu, Radu, et al.
Pubblicazione: (2025)
FactAlign: Long-form Factuality Alignment of Large Language Models
di: Huang, Chao-Wei, et al.
Pubblicazione: (2024)
di: Huang, Chao-Wei, et al.
Pubblicazione: (2024)
FaiREE: Fair Classification with Finite-Sample and Distribution-Free Guarantee
di: Li, Puheng, et al.
Pubblicazione: (2022)
di: Li, Puheng, et al.
Pubblicazione: (2022)
Language Models with Conformal Factuality Guarantees
di: Mohri, Christopher, et al.
Pubblicazione: (2024)
di: Mohri, Christopher, et al.
Pubblicazione: (2024)
LEAF: Learning and Evaluation Augmented by Fact-Checking to Improve Factualness in Large Language Models
di: Tran, Hieu, et al.
Pubblicazione: (2024)
di: Tran, Hieu, et al.
Pubblicazione: (2024)
Finite-Sample and Distribution-Free Fair Classification: Optimal Trade-off Between Excess Risk and Fairness, and the Cost of Group-Blindness
di: Hou, Xiaotian, et al.
Pubblicazione: (2024)
di: Hou, Xiaotian, et al.
Pubblicazione: (2024)
A Statistical Hypothesis Testing Framework for Data Misappropriation Detection in Large Language Models
di: Cai, Yinpeng, et al.
Pubblicazione: (2025)
di: Cai, Yinpeng, et al.
Pubblicazione: (2025)
Hallucination to Truth: A Review of Fact-Checking and Factuality Evaluation in Large Language Models
di: Rahman, Subhey Sadi, et al.
Pubblicazione: (2025)
di: Rahman, Subhey Sadi, et al.
Pubblicazione: (2025)
UQ: Assessing Language Models on Unsolved Questions
di: Nie, Fan, et al.
Pubblicazione: (2025)
di: Nie, Fan, et al.
Pubblicazione: (2025)
Ever: Mitigating Hallucination in Large Language Models through Real-Time Verification and Rectification
di: Kang, Haoqiang, et al.
Pubblicazione: (2023)
di: Kang, Haoqiang, et al.
Pubblicazione: (2023)
FLAME: Factuality-Aware Alignment for Large Language Models
di: Lin, Sheng-Chieh, et al.
Pubblicazione: (2024)
di: Lin, Sheng-Chieh, et al.
Pubblicazione: (2024)
Teaching Language Models to Check Grounded Claim Factuality with Human Test-Taking Strategies
di: Ye, Yuxuan, et al.
Pubblicazione: (2026)
di: Ye, Yuxuan, et al.
Pubblicazione: (2026)
Beyond Facts: Benchmarking Distributional Reading Comprehension in Large Language Models
di: Guo, Pei-Fu, et al.
Pubblicazione: (2026)
di: Guo, Pei-Fu, et al.
Pubblicazione: (2026)
Training-Free Test-Time Contrastive Learning for Large Language Models
di: Zheng, Kaiwen, et al.
Pubblicazione: (2026)
di: Zheng, Kaiwen, et al.
Pubblicazione: (2026)
Is the System Message Really Important to Jailbreaks in Large Language Models?
di: Zou, Xiaotian, et al.
Pubblicazione: (2024)
di: Zou, Xiaotian, et al.
Pubblicazione: (2024)
Factuality of Large Language Models: A Survey
di: Wang, Yuxia, et al.
Pubblicazione: (2024)
di: Wang, Yuxia, et al.
Pubblicazione: (2024)
InFact: Informativeness Alignment for Improved LLM Factuality
di: Cohen, Roi, et al.
Pubblicazione: (2025)
di: Cohen, Roi, et al.
Pubblicazione: (2025)
Editing Factual Knowledge and Explanatory Ability of Medical Large Language Models
di: Xu, Derong, et al.
Pubblicazione: (2024)
di: Xu, Derong, et al.
Pubblicazione: (2024)
MAD-Fact: A Multi-Agent Debate Framework for Long-Form Factuality Evaluation in LLMs
di: Ning, Yucheng, et al.
Pubblicazione: (2025)
di: Ning, Yucheng, et al.
Pubblicazione: (2025)
Factuality Challenges in the Era of Large Language Models
di: Augenstein, Isabelle, et al.
Pubblicazione: (2023)
di: Augenstein, Isabelle, et al.
Pubblicazione: (2023)
Give Us the Facts: Enhancing Large Language Models with Knowledge Graphs for Fact-aware Language Modeling
di: Yang, Linyao, et al.
Pubblicazione: (2023)
di: Yang, Linyao, et al.
Pubblicazione: (2023)
Are Large Language Models Table-based Fact-Checkers?
di: Zhang, Hanwen, et al.
Pubblicazione: (2024)
di: Zhang, Hanwen, et al.
Pubblicazione: (2024)
Reasoning Factual Knowledge in Structured Data with Large Language Models
di: Huang, Sirui, et al.
Pubblicazione: (2024)
di: Huang, Sirui, et al.
Pubblicazione: (2024)
Stress Testing Factual Consistency Metrics for Long-Document Summarization
di: Mujahid, Zain Muhammad, et al.
Pubblicazione: (2025)
di: Mujahid, Zain Muhammad, et al.
Pubblicazione: (2025)
Are the Hidden States Hiding Something? Testing the Limits of Factuality-Encoding Capabilities in LLMs
di: Servedio, Giovanni, et al.
Pubblicazione: (2025)
di: Servedio, Giovanni, et al.
Pubblicazione: (2025)
Test-Time Fairness and Robustness in Large Language Models
di: Cotta, Leonardo, et al.
Pubblicazione: (2024)
di: Cotta, Leonardo, et al.
Pubblicazione: (2024)
DoLa: Decoding by Contrasting Layers Improves Factuality in Large Language Models
di: Chuang, Yung-Sung, et al.
Pubblicazione: (2023)
di: Chuang, Yung-Sung, et al.
Pubblicazione: (2023)
The FACTS Leaderboard: A Comprehensive Benchmark for Large Language Model Factuality
di: Cheng, Aileen, et al.
Pubblicazione: (2025)
di: Cheng, Aileen, et al.
Pubblicazione: (2025)
When and How Much to Imagine: Adaptive Test-Time Scaling with World Models for Visual Spatial Reasoning
di: Yu, Shoubin, et al.
Pubblicazione: (2026)
di: Yu, Shoubin, et al.
Pubblicazione: (2026)
The Factuality of Large Language Models in the Legal Domain
di: Hamdani, Rajaa El, et al.
Pubblicazione: (2024)
di: Hamdani, Rajaa El, et al.
Pubblicazione: (2024)
MedFact: Benchmarking the Fact-Checking Capabilities of Large Language Models on Chinese Medical Texts
di: He, Jiayi, et al.
Pubblicazione: (2025)
di: He, Jiayi, et al.
Pubblicazione: (2025)
Language Models' Factuality Depends on the Language of Inquiry
di: Aggarwal, Tushar, et al.
Pubblicazione: (2025)
di: Aggarwal, Tushar, et al.
Pubblicazione: (2025)
Test-Time Learning for Large Language Models
di: Hu, Jinwu, et al.
Pubblicazione: (2025)
di: Hu, Jinwu, et al.
Pubblicazione: (2025)
SLOT: Sample-specific Language Model Optimization at Test-time
di: Hu, Yang, et al.
Pubblicazione: (2025)
di: Hu, Yang, et al.
Pubblicazione: (2025)
Efficient Long CoT Reasoning in Small Language Models
di: Wang, Zhaoyang, et al.
Pubblicazione: (2025)
di: Wang, Zhaoyang, et al.
Pubblicazione: (2025)
Unveiling Factual Recall Behaviors of Large Language Models through Knowledge Neurons
di: Wang, Yifei, et al.
Pubblicazione: (2024)
di: Wang, Yifei, et al.
Pubblicazione: (2024)
RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking
di: Yang, Shuo, et al.
Pubblicazione: (2025)
di: Yang, Shuo, et al.
Pubblicazione: (2025)
Beyond Facts: Evaluating Intent Hallucination in Large Language Models
di: Hao, Yijie, et al.
Pubblicazione: (2025)
di: Hao, Yijie, et al.
Pubblicazione: (2025)
Documenti analoghi
-
RULE: Reliable Multimodal RAG for Factuality in Medical Vision Language Models
di: Xia, Peng, et al.
Pubblicazione: (2024) -
FactCorrector: A Graph-Inspired Approach to Long-Form Factuality Correction of Large Language Models
di: Carnerero-Cano, Javier, et al.
Pubblicazione: (2026) -
FactReasoner: A Probabilistic Approach to Long-Form Factuality Assessment for Large Language Models
di: Marinescu, Radu, et al.
Pubblicazione: (2025) -
FactAlign: Long-form Factuality Alignment of Large Language Models
di: Huang, Chao-Wei, et al.
Pubblicazione: (2024) -
FaiREE: Fair Classification with Finite-Sample and Distribution-Free Guarantee
di: Li, Puheng, et al.
Pubblicazione: (2022)