When Benchmarks Age: Temporal Misalignment through Large Language Model Factuality Evaluation
Fuente:
arXiv
Salvato in:
| Autori principali: | Jiang, Xunyi, Chang, Dingyi, McAuley, Julian, Xu, Xin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
CSyMR: Benchmarking Compositional Music Information Retrieval in Symbolic Music Reasoning
di: Wang, Boyang, et al.
Pubblicazione: (2025)
di: Wang, Boyang, et al.
Pubblicazione: (2025)
Extending Input Contexts of Language Models through Training on Segmented Sequences
di: Karypis, Petros, et al.
Pubblicazione: (2023)
di: Karypis, Petros, et al.
Pubblicazione: (2023)
BiasFreeBench: a Benchmark for Mitigating Bias in Large Language Model Responses
di: Xu, Xin, et al.
Pubblicazione: (2025)
di: Xu, Xin, et al.
Pubblicazione: (2025)
BiasEdit: Debiasing Stereotyped Language Models via Model Editing
di: Xu, Xin, et al.
Pubblicazione: (2025)
di: Xu, Xin, et al.
Pubblicazione: (2025)
Evaluating Large Language Models as Generative User Simulators for Conversational Recommendation
di: Yoon, Se-eun, et al.
Pubblicazione: (2024)
di: Yoon, Se-eun, et al.
Pubblicazione: (2024)
Evaluating Memory in LLM Agents via Incremental Multi-Turn Interactions
di: Hu, Yuanzhe, et al.
Pubblicazione: (2025)
di: Hu, Yuanzhe, et al.
Pubblicazione: (2025)
Self-Updatable Large Language Models by Integrating Context into Model Parameters
di: Wang, Yu, et al.
Pubblicazione: (2024)
di: Wang, Yu, et al.
Pubblicazione: (2024)
CAMELoT: Towards Large Language Models with Training-Free Consolidated Associative Memory
di: He, Zexue, et al.
Pubblicazione: (2024)
di: He, Zexue, et al.
Pubblicazione: (2024)
InstructGraph: Boosting Large Language Models via Graph-centric Instruction Tuning and Preference Alignment
di: Wang, Jianing, et al.
Pubblicazione: (2024)
di: Wang, Jianing, et al.
Pubblicazione: (2024)
Large Language Models are Zero-Shot Rankers for Recommender Systems
di: Hou, Yupeng, et al.
Pubblicazione: (2023)
di: Hou, Yupeng, et al.
Pubblicazione: (2023)
Large Scale Knowledge Washing
di: Wang, Yu, et al.
Pubblicazione: (2024)
di: Wang, Yu, et al.
Pubblicazione: (2024)
Embedding-Informed Adaptive Retrieval-Augmented Generation of Large Language Models
di: Huang, Chengkai, et al.
Pubblicazione: (2024)
di: Huang, Chengkai, et al.
Pubblicazione: (2024)
Unlocking Decoding-time Controllability: Gradient-Free Multi-Objective Alignment with Contrastive Prompts
di: Fu, Tingchen, et al.
Pubblicazione: (2024)
di: Fu, Tingchen, et al.
Pubblicazione: (2024)
WildScore: Benchmarking MLLMs in-the-Wild Symbolic Music Reasoning
di: Mundada, Gagan, et al.
Pubblicazione: (2025)
di: Mundada, Gagan, et al.
Pubblicazione: (2025)
Reindex-Then-Adapt: Improving Large Language Models for Conversational Recommendation
di: He, Zhankui, et al.
Pubblicazione: (2024)
di: He, Zhankui, et al.
Pubblicazione: (2024)
Knowledge-Aware Query Expansion with Large Language Models for Textual and Relational Retrieval
di: Xia, Yu, et al.
Pubblicazione: (2024)
di: Xia, Yu, et al.
Pubblicazione: (2024)
LVCHAT: Facilitating Long Video Comprehension
di: Wang, Yu, et al.
Pubblicazione: (2024)
di: Wang, Yu, et al.
Pubblicazione: (2024)
Purely Semantic Indexing for LLM-based Generative Recommendation and Retrieval
di: Zhang, Ruohan, et al.
Pubblicazione: (2025)
di: Zhang, Ruohan, et al.
Pubblicazione: (2025)
Composer Vector: Style-steering Symbolic Music Generation in a Latent Space
di: Jiang, Xunyi, et al.
Pubblicazione: (2026)
di: Jiang, Xunyi, et al.
Pubblicazione: (2026)
MEMORYLLM: Towards Self-Updatable Large Language Models
di: Wang, Yu, et al.
Pubblicazione: (2024)
di: Wang, Yu, et al.
Pubblicazione: (2024)
Generating Benchmarks for Factuality Evaluation of Language Models
di: Muhlgay, Dor, et al.
Pubblicazione: (2023)
di: Muhlgay, Dor, et al.
Pubblicazione: (2023)
OCEAN: Offline Chain-of-thought Evaluation and Alignment in Large Language Models
di: Wu, Junda, et al.
Pubblicazione: (2024)
di: Wu, Junda, et al.
Pubblicazione: (2024)
FERA: Uncertainty-Aware Federated Reasoning for Large Language Models
di: Wang, Ruhan, et al.
Pubblicazione: (2026)
di: Wang, Ruhan, et al.
Pubblicazione: (2026)
Improving In-Context Learning with Reasoning Distillation
di: Sadeq, Nafis, et al.
Pubblicazione: (2025)
di: Sadeq, Nafis, et al.
Pubblicazione: (2025)
A Survey on Personalized and Pluralistic Preference Alignment in Large Language Models
di: Xie, Zhouhang, et al.
Pubblicazione: (2025)
di: Xie, Zhouhang, et al.
Pubblicazione: (2025)
Temporally Consistent Factuality Probing for Large Language Models
di: Bajpai, Ashutosh, et al.
Pubblicazione: (2024)
di: Bajpai, Ashutosh, et al.
Pubblicazione: (2024)
ThinkRouter: Efficient Reasoning via Routing Thinking between Latent and Discrete Spaces
di: Xu, Xin, et al.
Pubblicazione: (2026)
di: Xu, Xin, et al.
Pubblicazione: (2026)
A Survey on Large Language Models for Critical Societal Domains: Finance, Healthcare, and Law
di: Chen, Zhiyu Zoey, et al.
Pubblicazione: (2024)
di: Chen, Zhiyu Zoey, et al.
Pubblicazione: (2024)
Learning to Hint for Reinforcement Learning
di: Xia, Yu, et al.
Pubblicazione: (2026)
di: Xia, Yu, et al.
Pubblicazione: (2026)
Harnessing Temporal Databases for Systematic Evaluation of Factual Time-Sensitive Question-Answering in Large Language Models
di: Kim, Soyeon, et al.
Pubblicazione: (2025)
di: Kim, Soyeon, et al.
Pubblicazione: (2025)
Cognitive Bias in Decision-Making with LLMs
di: Echterhoff, Jessica, et al.
Pubblicazione: (2024)
di: Echterhoff, Jessica, et al.
Pubblicazione: (2024)
Beyond Probabilities: Unveiling the Misalignment in Evaluating Large Language Models
di: Lyu, Chenyang, et al.
Pubblicazione: (2024)
di: Lyu, Chenyang, et al.
Pubblicazione: (2024)
FactBench: A Dynamic Benchmark for In-the-Wild Language Model Factuality Evaluation
di: Bayat, Farima Fatahi, et al.
Pubblicazione: (2024)
di: Bayat, Farima Fatahi, et al.
Pubblicazione: (2024)
Mitigating Hallucination in Fictional Character Role-Play
di: Sadeq, Nafis, et al.
Pubblicazione: (2024)
di: Sadeq, Nafis, et al.
Pubblicazione: (2024)
When Language Models Lose Their Mind: The Consequences of Brain Misalignment
di: Merlin, Gabriele, et al.
Pubblicazione: (2026)
di: Merlin, Gabriele, et al.
Pubblicazione: (2026)
MuseCPBench: an Empirical Study of Music Editing Methods through Music Context Preservation
di: Vishe, Yash, et al.
Pubblicazione: (2025)
di: Vishe, Yash, et al.
Pubblicazione: (2025)
The FACTS Leaderboard: A Comprehensive Benchmark for Large Language Model Factuality
di: Cheng, Aileen, et al.
Pubblicazione: (2025)
di: Cheng, Aileen, et al.
Pubblicazione: (2025)
Large Language Models and Causal Inference in Collaboration: A Survey
di: Liu, Xiaoyu, et al.
Pubblicazione: (2024)
di: Liu, Xiaoyu, et al.
Pubblicazione: (2024)
Auto-Dreamer: Learning Offline Memory Consolidation for Language Agents
di: Ye, Chongrui, et al.
Pubblicazione: (2026)
di: Ye, Chongrui, et al.
Pubblicazione: (2026)
Multi-Agent Collaborative Filtering: Orchestrating Users and Items for Agentic Recommendations
di: Xia, Yu, et al.
Pubblicazione: (2025)
di: Xia, Yu, et al.
Pubblicazione: (2025)
Documenti analoghi
-
CSyMR: Benchmarking Compositional Music Information Retrieval in Symbolic Music Reasoning
di: Wang, Boyang, et al.
Pubblicazione: (2025) -
Extending Input Contexts of Language Models through Training on Segmented Sequences
di: Karypis, Petros, et al.
Pubblicazione: (2023) -
BiasFreeBench: a Benchmark for Mitigating Bias in Large Language Model Responses
di: Xu, Xin, et al.
Pubblicazione: (2025) -
BiasEdit: Debiasing Stereotyped Language Models via Model Editing
di: Xu, Xin, et al.
Pubblicazione: (2025) -
Evaluating Large Language Models as Generative User Simulators for Conversational Recommendation
di: Yoon, Se-eun, et al.
Pubblicazione: (2024)