UFO: a Unified and Flexible Framework for Evaluating Factuality of Large Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Huang, Zhaoheng, Dou, Zhicheng, Zhu, Yutao, Wen, Ji-rong |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
One Token Can Help! Learning Scalable and Pluggable Virtual Tokens for Retrieval-Augmented Large Language Models
von: Zhu, Yutao, et al.
Veröffentlicht: (2024)
von: Zhu, Yutao, et al.
Veröffentlicht: (2024)
DemoRank: Selecting Effective Demonstrations for Large Language Models in Ranking Task
von: Liu, Wenhan, et al.
Veröffentlicht: (2024)
von: Liu, Wenhan, et al.
Veröffentlicht: (2024)
Single LLM, Multiple Roles: A Unified Retrieval-Augmented Generation Framework Using Role-Specific Token Optimization
von: Zhu, Yutao, et al.
Veröffentlicht: (2025)
von: Zhu, Yutao, et al.
Veröffentlicht: (2025)
Query-oriented Data Augmentation for Session Search
von: Chen, Haonan, et al.
Veröffentlicht: (2024)
von: Chen, Haonan, et al.
Veröffentlicht: (2024)
INTERS: Unlocking the Power of Large Language Models in Search with Instruction Tuning
von: Zhu, Yutao, et al.
Veröffentlicht: (2024)
von: Zhu, Yutao, et al.
Veröffentlicht: (2024)
Small Models, Big Insights: Leveraging Slim Proxy Models To Decide When and What to Retrieve for LLMs
von: Tan, Jiejun, et al.
Veröffentlicht: (2024)
von: Tan, Jiejun, et al.
Veröffentlicht: (2024)
SimpleVQA: Multimodal Factuality Evaluation for Multimodal Large Language Models
von: Cheng, Xianfu, et al.
Veröffentlicht: (2025)
von: Cheng, Xianfu, et al.
Veröffentlicht: (2025)
Large Language Models for Information Retrieval: A Survey
von: Zhu, Yutao, et al.
Veröffentlicht: (2023)
von: Zhu, Yutao, et al.
Veröffentlicht: (2023)
Chinese SimpleQA: A Chinese Factuality Evaluation for Large Language Models
von: He, Yancheng, et al.
Veröffentlicht: (2024)
von: He, Yancheng, et al.
Veröffentlicht: (2024)
Sliding Windows Are Not the End: Exploring Full Ranking with Long-Context Large Language Models
von: Liu, Wenhan, et al.
Veröffentlicht: (2024)
von: Liu, Wenhan, et al.
Veröffentlicht: (2024)
BIDER: Bridging Knowledge Inconsistency for Efficient Retrieval-Augmented LLMs via Key Supporting Evidence
von: Jin, Jiajie, et al.
Veröffentlicht: (2024)
von: Jin, Jiajie, et al.
Veröffentlicht: (2024)
WebThinker: Empowering Large Reasoning Models with Deep Research Capability
von: Li, Xiaoxi, et al.
Veröffentlicht: (2025)
von: Li, Xiaoxi, et al.
Veröffentlicht: (2025)
OmniEval: An Omnidirectional and Automatic RAG Evaluation Benchmark in Financial Domain
von: Wang, Shuting, et al.
Veröffentlicht: (2024)
von: Wang, Shuting, et al.
Veröffentlicht: (2024)
CorpusLM: Towards a Unified Language Model on Corpus for Knowledge-Intensive Tasks
von: Li, Xiaoxi, et al.
Veröffentlicht: (2024)
von: Li, Xiaoxi, et al.
Veröffentlicht: (2024)
Understand What LLM Needs: Dual Preference Alignment for Retrieval-Augmented Generation
von: Dong, Guanting, et al.
Veröffentlicht: (2024)
von: Dong, Guanting, et al.
Veröffentlicht: (2024)
The Dawn After the Dark: An Empirical Study on Factuality Hallucination in Large Language Models
von: Li, Junyi, et al.
Veröffentlicht: (2024)
von: Li, Junyi, et al.
Veröffentlicht: (2024)
EnvScaler: Scaling Tool-Interactive Environments for LLM Agent via Programmatic Synthesis
von: Song, Xiaoshuai, et al.
Veröffentlicht: (2026)
von: Song, Xiaoshuai, et al.
Veröffentlicht: (2026)
Progressive Multimodal Reasoning via Active Retrieval
von: Dong, Guanting, et al.
Veröffentlicht: (2024)
von: Dong, Guanting, et al.
Veröffentlicht: (2024)
"See the World, Discover Knowledge": A Chinese Factuality Evaluation for Large Vision Language Models
von: Gu, Jihao, et al.
Veröffentlicht: (2025)
von: Gu, Jihao, et al.
Veröffentlicht: (2025)
Memory Matters More: Event-Centric Memory as a Logic Map for Agent Searching and Reasoning
von: Hu, Yuyang, et al.
Veröffentlicht: (2026)
von: Hu, Yuyang, et al.
Veröffentlicht: (2026)
Evaluating Contextually Mediated Factual Recall in Multilingual Large Language Models
von: Liu, Yihong, et al.
Veröffentlicht: (2026)
von: Liu, Yihong, et al.
Veröffentlicht: (2026)
Toward General Instruction-Following Alignment for Retrieval-Augmented Generation
von: Dong, Guanting, et al.
Veröffentlicht: (2024)
von: Dong, Guanting, et al.
Veröffentlicht: (2024)
Co-occurrence is not Factual Association in Language Models
von: Zhang, Xiao, et al.
Veröffentlicht: (2024)
von: Zhang, Xiao, et al.
Veröffentlicht: (2024)
Investigating the Factual Knowledge Boundary of Large Language Models with Retrieval Augmentation
von: Ren, Ruiyang, et al.
Veröffentlicht: (2023)
von: Ren, Ruiyang, et al.
Veröffentlicht: (2023)
Exploring the Factual Consistency in Dialogue Comprehension of Large Language Models
von: She, Shuaijie, et al.
Veröffentlicht: (2023)
von: She, Shuaijie, et al.
Veröffentlicht: (2023)
FLAME: Factuality-Aware Alignment for Large Language Models
von: Lin, Sheng-Chieh, et al.
Veröffentlicht: (2024)
von: Lin, Sheng-Chieh, et al.
Veröffentlicht: (2024)
An Extensive Evaluation of Factual Consistency in Large Language Models for Data-to-Text Generation
von: Mahapatra, Joy, et al.
Veröffentlicht: (2024)
von: Mahapatra, Joy, et al.
Veröffentlicht: (2024)
From Novice to Expert: LLM Agent Policy Optimization via Step-wise Reinforcement Learning
von: Deng, Zhirui, et al.
Veröffentlicht: (2024)
von: Deng, Zhirui, et al.
Veröffentlicht: (2024)
LEAF: Learning and Evaluation Augmented by Fact-Checking to Improve Factualness in Large Language Models
von: Tran, Hieu, et al.
Veröffentlicht: (2024)
von: Tran, Hieu, et al.
Veröffentlicht: (2024)
CoRanking: Collaborative Ranking with Small and Large Ranking Agents
von: Liu, Wenhan, et al.
Veröffentlicht: (2025)
von: Liu, Wenhan, et al.
Veröffentlicht: (2025)
AssistRAG: Boosting the Potential of Large Language Models with an Intelligent Information Assistant
von: Zhou, Yujia, et al.
Veröffentlicht: (2024)
von: Zhou, Yujia, et al.
Veröffentlicht: (2024)
RichRAG: Crafting Rich Responses for Multi-faceted Queries in Retrieval-Augmented Generation
von: Wang, Shuting, et al.
Veröffentlicht: (2024)
von: Wang, Shuting, et al.
Veröffentlicht: (2024)
When Benchmarks Age: Temporal Misalignment through Large Language Model Factuality Evaluation
von: Jiang, Xunyi, et al.
Veröffentlicht: (2025)
von: Jiang, Xunyi, et al.
Veröffentlicht: (2025)
UAlign: Leveraging Uncertainty Estimations for Factuality Alignment on Large Language Models
von: Xue, Boyang, et al.
Veröffentlicht: (2024)
von: Xue, Boyang, et al.
Veröffentlicht: (2024)
EasyJailbreak: A Unified Framework for Jailbreaking Large Language Models
von: Zhou, Weikang, et al.
Veröffentlicht: (2024)
von: Zhou, Weikang, et al.
Veröffentlicht: (2024)
Search-o1: Agentic Search-Enhanced Large Reasoning Models
von: Li, Xiaoxi, et al.
Veröffentlicht: (2025)
von: Li, Xiaoxi, et al.
Veröffentlicht: (2025)
Factuality Challenges in the Era of Large Language Models
von: Augenstein, Isabelle, et al.
Veröffentlicht: (2023)
von: Augenstein, Isabelle, et al.
Veröffentlicht: (2023)
Reasoning Factual Knowledge in Structured Data with Large Language Models
von: Huang, Sirui, et al.
Veröffentlicht: (2024)
von: Huang, Sirui, et al.
Veröffentlicht: (2024)
FactAlign: Long-form Factuality Alignment of Large Language Models
von: Huang, Chao-Wei, et al.
Veröffentlicht: (2024)
von: Huang, Chao-Wei, et al.
Veröffentlicht: (2024)
Metacognitive Retrieval-Augmented Large Language Models
von: Zhou, Yujia, et al.
Veröffentlicht: (2024)
von: Zhou, Yujia, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
One Token Can Help! Learning Scalable and Pluggable Virtual Tokens for Retrieval-Augmented Large Language Models
von: Zhu, Yutao, et al.
Veröffentlicht: (2024) -
DemoRank: Selecting Effective Demonstrations for Large Language Models in Ranking Task
von: Liu, Wenhan, et al.
Veröffentlicht: (2024) -
Single LLM, Multiple Roles: A Unified Retrieval-Augmented Generation Framework Using Role-Specific Token Optimization
von: Zhu, Yutao, et al.
Veröffentlicht: (2025) -
Query-oriented Data Augmentation for Session Search
von: Chen, Haonan, et al.
Veröffentlicht: (2024) -
INTERS: Unlocking the Power of Large Language Models in Search with Instruction Tuning
von: Zhu, Yutao, et al.
Veröffentlicht: (2024)