StressEval: Failure-Driven Dynamic Benchmarking for Knowledge-Intensive Reasoning in Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Chen, Yongrui, Ma, Yangyang, Huang, Xiaoying, Zhang, Shenyu, Chen, Huajun, Wang, Haofen, Qi, Guilin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
OneEval: Benchmarking LLM Knowledge-intensive Reasoning over Diverse Knowledge Bases
di: Chen, Yongrui, et al.
Pubblicazione: (2025)
di: Chen, Yongrui, et al.
Pubblicazione: (2025)
K-DeCore: Facilitating Knowledge Transfer in Continual Structured Knowledge Reasoning via Knowledge Decoupling
di: Chen, Yongrui, et al.
Pubblicazione: (2025)
di: Chen, Yongrui, et al.
Pubblicazione: (2025)
Pandora: A Code-Driven Large Language Model Agent for Unified Reasoning Across Diverse Structured Knowledge
di: Chen, Yongrui, et al.
Pubblicazione: (2025)
di: Chen, Yongrui, et al.
Pubblicazione: (2025)
Large Language Models Meet Knowledge Graphs for Question Answering: Synthesis and Opportunities
di: Ma, Chuangtao, et al.
Pubblicazione: (2025)
di: Ma, Chuangtao, et al.
Pubblicazione: (2025)
Magic Mushroom: A Customizable Benchmark for Fine-grained Analysis of Retrieval Noise Erosion in RAG Systems
di: Zhang, Yuxin, et al.
Pubblicazione: (2025)
di: Zhang, Yuxin, et al.
Pubblicazione: (2025)
DEE: Dual-stage Explainable Evaluation Method for Text Generation
di: Zhang, Shenyu, et al.
Pubblicazione: (2024)
di: Zhang, Shenyu, et al.
Pubblicazione: (2024)
Pandora: Leveraging Code-driven Knowledge Transfer for Unified Structured Knowledge Reasoning
di: Chen, Yongrui, et al.
Pubblicazione: (2025)
di: Chen, Yongrui, et al.
Pubblicazione: (2025)
MATEval: A Multi-Agent Discussion Framework for Advancing Open-Ended Text Evaluation
di: Li, Yu, et al.
Pubblicazione: (2024)
di: Li, Yu, et al.
Pubblicazione: (2024)
Large Knowledge Model: Perspectives and Challenges
di: Chen, Huajun
Pubblicazione: (2023)
di: Chen, Huajun
Pubblicazione: (2023)
DoG-Instruct: Towards Premium Instruction-Tuning Data via Text-Grounded Instruction Wrapping
di: Chen, Yongrui, et al.
Pubblicazione: (2023)
di: Chen, Yongrui, et al.
Pubblicazione: (2023)
Can LLMs Evaluate Complex Attribution in QA? Automatic Benchmarking using Knowledge Graphs
di: Hu, Nan, et al.
Pubblicazione: (2024)
di: Hu, Nan, et al.
Pubblicazione: (2024)
FinEval-KR: A Financial Domain Evaluation Framework for Large Language Models' Knowledge and Reasoning
di: Dou, Shaoyu, et al.
Pubblicazione: (2025)
di: Dou, Shaoyu, et al.
Pubblicazione: (2025)
After Retrieval, Before Generation: Enhancing the Trustworthiness of Large Language Models in Retrieval-Augmented Generation
di: Dai, Xinbang, et al.
Pubblicazione: (2025)
di: Dai, Xinbang, et al.
Pubblicazione: (2025)
Reasoning in Action: MCTS-Driven Knowledge Retrieval for Large Language Models
di: Liu, Shuqi, et al.
Pubblicazione: (2025)
di: Liu, Shuqi, et al.
Pubblicazione: (2025)
MIKE: A New Benchmark for Fine-grained Multimodal Entity Knowledge Editing
di: Li, Jiaqi, et al.
Pubblicazione: (2024)
di: Li, Jiaqi, et al.
Pubblicazione: (2024)
Table-r1: Self-supervised and Reinforcement Learning for Program-based Table Reasoning in Small Language Models
di: Jin, Rihui, et al.
Pubblicazione: (2025)
di: Jin, Rihui, et al.
Pubblicazione: (2025)
FinEval: A Chinese Financial Domain Knowledge Evaluation Benchmark for Large Language Models
di: Guo, Xin, et al.
Pubblicazione: (2023)
di: Guo, Xin, et al.
Pubblicazione: (2023)
SciSafeEval: A Comprehensive Benchmark for Safety Alignment of Large Language Models in Scientific Tasks
di: Li, Tianhao, et al.
Pubblicazione: (2024)
di: Li, Tianhao, et al.
Pubblicazione: (2024)
AECBench: A Hierarchical Benchmark for Knowledge Evaluation of Large Language Models in the AEC Field
di: Liang, Chen, et al.
Pubblicazione: (2025)
di: Liang, Chen, et al.
Pubblicazione: (2025)
Large Language Model Enhanced Knowledge Representation Learning: A Survey
di: Wang, Xin, et al.
Pubblicazione: (2024)
di: Wang, Xin, et al.
Pubblicazione: (2024)
SciEval: A Multi-Level Large Language Model Evaluation Benchmark for Scientific Research
di: Sun, Liangtai, et al.
Pubblicazione: (2023)
di: Sun, Liangtai, et al.
Pubblicazione: (2023)
Making Large Language Models Perform Better in Knowledge Graph Completion
di: Zhang, Yichi, et al.
Pubblicazione: (2023)
di: Zhang, Yichi, et al.
Pubblicazione: (2023)
Question Answering Over Spatio-Temporal Knowledge Graph
di: Dai, Xinbang, et al.
Pubblicazione: (2024)
di: Dai, Xinbang, et al.
Pubblicazione: (2024)
NPHardEval: Dynamic Benchmark on Reasoning Ability of Large Language Models via Complexity Classes
di: Fan, Lizhou, et al.
Pubblicazione: (2023)
di: Fan, Lizhou, et al.
Pubblicazione: (2023)
Dissecting Failure Dynamics in Large Language Model Reasoning
di: Zhu, Wei, et al.
Pubblicazione: (2026)
di: Zhu, Wei, et al.
Pubblicazione: (2026)
HeGTa: Leveraging Heterogeneous Graph-enhanced Large Language Models for Few-shot Complex Table Understanding
di: Jin, Rihui, et al.
Pubblicazione: (2024)
di: Jin, Rihui, et al.
Pubblicazione: (2024)
AgriEval: A Comprehensive Chinese Agricultural Benchmark for Large Language Models
di: Yan, Lian, et al.
Pubblicazione: (2025)
di: Yan, Lian, et al.
Pubblicazione: (2025)
QuantEval: A Benchmark for Financial Quantitative Tasks in Large Language Models
di: Kang, Zhaolu, et al.
Pubblicazione: (2026)
di: Kang, Zhaolu, et al.
Pubblicazione: (2026)
Knowledge in Superposition: Unveiling the Failures of Lifelong Knowledge Editing for Large Language Models
di: Hu, Chenhui, et al.
Pubblicazione: (2024)
di: Hu, Chenhui, et al.
Pubblicazione: (2024)
CriticEval: Evaluating Large Language Model as Critic
di: Lan, Tian, et al.
Pubblicazione: (2024)
di: Lan, Tian, et al.
Pubblicazione: (2024)
LexEval: A Comprehensive Chinese Legal Benchmark for Evaluating Large Language Models
di: Li, Haitao, et al.
Pubblicazione: (2024)
di: Li, Haitao, et al.
Pubblicazione: (2024)
Large Language Models are Limited in Out-of-Context Knowledge Reasoning
di: Hu, Peng, et al.
Pubblicazione: (2024)
di: Hu, Peng, et al.
Pubblicazione: (2024)
StatEval: A Comprehensive Benchmark for Large Language Models in Statistics
di: Lu, Yuchen, et al.
Pubblicazione: (2025)
di: Lu, Yuchen, et al.
Pubblicazione: (2025)
VisEval: A Benchmark for Data Visualization in the Era of Large Language Models
di: Chen, Nan, et al.
Pubblicazione: (2024)
di: Chen, Nan, et al.
Pubblicazione: (2024)
CLaw: Benchmarking Chinese Legal Knowledge in Large Language Models - A Fine-grained Corpus and Reasoning Analysis
di: Xu, Xinzhe, et al.
Pubblicazione: (2025)
di: Xu, Xinzhe, et al.
Pubblicazione: (2025)
ClinDEF: A Dynamic Evaluation Framework for Large Language Models in Clinical Reasoning
di: Tang, Yuqi, et al.
Pubblicazione: (2025)
di: Tang, Yuqi, et al.
Pubblicazione: (2025)
K-ON: Stacking Knowledge On the Head Layer of Large Language Model
di: Guo, Lingbing, et al.
Pubblicazione: (2025)
di: Guo, Lingbing, et al.
Pubblicazione: (2025)
LogEval: A Comprehensive Benchmark Suite for Large Language Models In Log Analysis
di: Cui, Tianyu, et al.
Pubblicazione: (2024)
di: Cui, Tianyu, et al.
Pubblicazione: (2024)
Unveiling the Pitfalls of Knowledge Editing for Large Language Models
di: Li, Zhoubo, et al.
Pubblicazione: (2023)
di: Li, Zhoubo, et al.
Pubblicazione: (2023)
Unbiased Reasoning for Knowledge-Intensive Tasks in Large Language Models via Conditional Front-Door Adjustment
di: Zhao, Bo, et al.
Pubblicazione: (2025)
di: Zhao, Bo, et al.
Pubblicazione: (2025)
Documenti analoghi
-
OneEval: Benchmarking LLM Knowledge-intensive Reasoning over Diverse Knowledge Bases
di: Chen, Yongrui, et al.
Pubblicazione: (2025) -
K-DeCore: Facilitating Knowledge Transfer in Continual Structured Knowledge Reasoning via Knowledge Decoupling
di: Chen, Yongrui, et al.
Pubblicazione: (2025) -
Pandora: A Code-Driven Large Language Model Agent for Unified Reasoning Across Diverse Structured Knowledge
di: Chen, Yongrui, et al.
Pubblicazione: (2025) -
Large Language Models Meet Knowledge Graphs for Question Answering: Synthesis and Opportunities
di: Ma, Chuangtao, et al.
Pubblicazione: (2025) -
Magic Mushroom: A Customizable Benchmark for Fine-grained Analysis of Retrieval Noise Erosion in RAG Systems
di: Zhang, Yuxin, et al.
Pubblicazione: (2025)