Towards Verifiable Generation: A Benchmark for Knowledge-aware Language Model Attribution
Fuente:
arXiv
Saved in:
| Main Authors: | Li, Xinze, Cao, Yixin, Pan, Liangming, Ma, Yubo, Sun, Aixin |
|---|---|
| Format: | Preprint |
| Published: |
2023
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Long Context vs. RAG for LLMs: An Evaluation and Revisits
by: Li, Xinze, et al.
Published: (2024)
by: Li, Xinze, et al.
Published: (2024)
EMemBench: Interactive Benchmarking of Episodic Memory for VLM Agents
by: Li, Xinze, et al.
Published: (2026)
by: Li, Xinze, et al.
Published: (2026)
Skill-as-Pseudocode: Refactoring Skill Libraries to Pseudocode for LLM Agents
by: Li, Xinze, et al.
Published: (2026)
by: Li, Xinze, et al.
Published: (2026)
Large Language Model Is Not a Good Few-shot Information Extractor, but a Good Reranker for Hard Samples!
by: Ma, Yubo, et al.
Published: (2023)
by: Ma, Yubo, et al.
Published: (2023)
SciAgent: Tool-augmented Language Models for Scientific Reasoning
by: Ma, Yubo, et al.
Published: (2024)
by: Ma, Yubo, et al.
Published: (2024)
MMLongBench-Doc: Benchmarking Long-context Document Understanding with Visualizations
by: Ma, Yubo, et al.
Published: (2024)
by: Ma, Yubo, et al.
Published: (2024)
Benchmarking and Rethinking Knowledge Editing for Large Language Models
by: He, Guoxiu, et al.
Published: (2025)
by: He, Guoxiu, et al.
Published: (2025)
SeaKR: Self-aware Knowledge Retrieval for Adaptive Retrieval Augmented Generation
by: Yao, Zijun, et al.
Published: (2024)
by: Yao, Zijun, et al.
Published: (2024)
Towards Storage-Efficient Visual Document Retrieval: An Empirical Study on Reducing Patch-Level Embeddings
by: Ma, Yubo, et al.
Published: (2025)
by: Ma, Yubo, et al.
Published: (2025)
The Knowledge Alignment Problem: Bridging Human and External Knowledge for Large Language Models
by: Zhang, Shuo, et al.
Published: (2023)
by: Zhang, Shuo, et al.
Published: (2023)
Knowledge of Knowledge: Exploring Known-Unknowns Uncertainty with Large Language Models
by: Amayuelas, Alfonso, et al.
Published: (2023)
by: Amayuelas, Alfonso, et al.
Published: (2023)
Toward Generalizable Evaluation in the LLM Era: A Survey Beyond Benchmarks
by: Cao, Yixin, et al.
Published: (2025)
by: Cao, Yixin, et al.
Published: (2025)
Understanding the Interplay between Parametric and Contextual Knowledge for Large Language Models
by: Cheng, Sitao, et al.
Published: (2024)
by: Cheng, Sitao, et al.
Published: (2024)
TART: An Open-Source Tool-Augmented Framework for Explainable Table-based Reasoning
by: Lu, Xinyuan, et al.
Published: (2024)
by: Lu, Xinyuan, et al.
Published: (2024)
Mechanistic Data Attribution: Tracing the Training Origins of Interpretable LLM Units
by: Chen, Jianhui, et al.
Published: (2026)
by: Chen, Jianhui, et al.
Published: (2026)
AntiLeakBench: Preventing Data Contamination by Automatically Constructing Benchmarks with Updated Real-World Knowledge
by: Wu, Xiaobao, et al.
Published: (2024)
by: Wu, Xiaobao, et al.
Published: (2024)
Knowledge Updating? No More Model Editing! Just Selective Contextual Reasoning
by: He, Guoxiu, et al.
Published: (2025)
by: He, Guoxiu, et al.
Published: (2025)
Cultural Value Differences of LLMs: Prompt, Language, and Model Size
by: Zhong, Qishuai, et al.
Published: (2024)
by: Zhong, Qishuai, et al.
Published: (2024)
Towards Intrinsic Interpretability of Large Language Models:A Survey of Design Principles and Architectures
by: Gao, Yutong, et al.
Published: (2026)
by: Gao, Yutong, et al.
Published: (2026)
EffiEval: Efficient and Generalizable Model Evaluation via Capability Coverage Maximization
by: Wang, Yaoning, et al.
Published: (2025)
by: Wang, Yaoning, et al.
Published: (2025)
Knowledge in Superposition: Unveiling the Failures of Lifelong Knowledge Editing for Large Language Models
by: Hu, Chenhui, et al.
Published: (2024)
by: Hu, Chenhui, et al.
Published: (2024)
GCRE-GPT: A Generative Model for Comparative Relation Extraction
by: Wang, Yequan, et al.
Published: (2023)
by: Wang, Yequan, et al.
Published: (2023)
DATE-LM: Benchmarking Data Attribution Evaluation for Large Language Models
by: Jiao, Cathy, et al.
Published: (2025)
by: Jiao, Cathy, et al.
Published: (2025)
RM-Bench: Benchmarking Reward Models of Language Models with Subtlety and Style
by: Liu, Yantao, et al.
Published: (2024)
by: Liu, Yantao, et al.
Published: (2024)
MARS: Enabling Autoregressive Models Multi-Token Generation
by: Jin, Ziqi, et al.
Published: (2026)
by: Jin, Ziqi, et al.
Published: (2026)
RWKU: Benchmarking Real-World Knowledge Unlearning for Large Language Models
by: Jin, Zhuoran, et al.
Published: (2024)
by: Jin, Zhuoran, et al.
Published: (2024)
On Context Utilization in Summarization with Large Language Models
by: Ravaut, Mathieu, et al.
Published: (2023)
by: Ravaut, Mathieu, et al.
Published: (2023)
Open-domain Implicit Format Control for Large Language Model Generation
by: Yao, Yiqun, et al.
Published: (2024)
by: Yao, Yiqun, et al.
Published: (2024)
CausalEval: Towards Better Causal Reasoning in Language Models
by: Yu, Longxuan, et al.
Published: (2024)
by: Yu, Longxuan, et al.
Published: (2024)
Towards Atoms of Large Language Models
by: Hu, Chenhui, et al.
Published: (2025)
by: Hu, Chenhui, et al.
Published: (2025)
CLIMB: A Benchmark of Clinical Bias in Large Language Models
by: Zhang, Yubo, et al.
Published: (2024)
by: Zhang, Yubo, et al.
Published: (2024)
PGMEL: Policy Gradient-based Generative Adversarial Network for Multimodal Entity Linking
by: Pooja, KM, et al.
Published: (2025)
by: Pooja, KM, et al.
Published: (2025)
Navigating the Nuances: A Fine-grained Evaluation of Vision-Language Navigation
by: Wang, Zehao, et al.
Published: (2024)
by: Wang, Zehao, et al.
Published: (2024)
One Mind, Many Tongues: A Deep Dive into Language-Agnostic Knowledge Neurons in Large Language Models
by: Cao, Pengfei, et al.
Published: (2024)
by: Cao, Pengfei, et al.
Published: (2024)
AKEW: Assessing Knowledge Editing in the Wild
by: Wu, Xiaobao, et al.
Published: (2024)
by: Wu, Xiaobao, et al.
Published: (2024)
Analyzing Temporal Complex Events with Large Language Models? A Benchmark towards Temporal, Long Context Understanding
by: Zhang, Zhihan, et al.
Published: (2024)
by: Zhang, Zhihan, et al.
Published: (2024)
Beyond Benchmarks: Understanding Mixture-of-Experts Models through Internal Mechanisms
by: Ying, Jiahao, et al.
Published: (2025)
by: Ying, Jiahao, et al.
Published: (2025)
Cracking Factual Knowledge: A Comprehensive Analysis of Degenerate Knowledge Neurons in Large Language Models
by: Chen, Yuheng, et al.
Published: (2024)
by: Chen, Yuheng, et al.
Published: (2024)
Beyond Correctness: Benchmarking Multi-dimensional Code Generation for Large Language Models
by: Zheng, Jiasheng, et al.
Published: (2024)
by: Zheng, Jiasheng, et al.
Published: (2024)
GDLLM: A Global Distance-aware Modeling Approach Based on Large Language Models for Event Temporal Relation Extraction
by: Zhao, Jie, et al.
Published: (2025)
by: Zhao, Jie, et al.
Published: (2025)
Similar Items
-
Long Context vs. RAG for LLMs: An Evaluation and Revisits
by: Li, Xinze, et al.
Published: (2024) -
EMemBench: Interactive Benchmarking of Episodic Memory for VLM Agents
by: Li, Xinze, et al.
Published: (2026) -
Skill-as-Pseudocode: Refactoring Skill Libraries to Pseudocode for LLM Agents
by: Li, Xinze, et al.
Published: (2026) -
Large Language Model Is Not a Good Few-shot Information Extractor, but a Good Reranker for Hard Samples!
by: Ma, Yubo, et al.
Published: (2023) -
SciAgent: Tool-augmented Language Models for Scientific Reasoning
by: Ma, Yubo, et al.
Published: (2024)