OneEval: Benchmarking LLM Knowledge-intensive Reasoning over Diverse Knowledge Bases
Fuente:
arXiv
Salvato in:
| Autori principali: | Chen, Yongrui, Liu, Zhiqiang, Yu, Jing, Ren, Lin, Hu, Nan, Dai, Xinbang, Liu, Jiajun, Kang, Jiazhen, Zhang, Shenyu, Wang, Xinda, Ding, Keyan, Shen, Pengfei, Zhu, Haolei, Deng, Hongjie, Wang, Yisong, Wu, Tongtong, Bi, Sheng, Zhang, Wen, Wu, Tianxing, Ji, Qiu, Wang, Haofen, Chen, Wenliang, Chen, Huajun, Qi, Guilin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
StressEval: Failure-Driven Dynamic Benchmarking for Knowledge-Intensive Reasoning in Large Language Models
di: Chen, Yongrui, et al.
Pubblicazione: (2026)
di: Chen, Yongrui, et al.
Pubblicazione: (2026)
K-DeCore: Facilitating Knowledge Transfer in Continual Structured Knowledge Reasoning via Knowledge Decoupling
di: Chen, Yongrui, et al.
Pubblicazione: (2025)
di: Chen, Yongrui, et al.
Pubblicazione: (2025)
Large Language Models Meet Knowledge Graphs for Question Answering: Synthesis and Opportunities
di: Ma, Chuangtao, et al.
Pubblicazione: (2025)
di: Ma, Chuangtao, et al.
Pubblicazione: (2025)
Pandora: Leveraging Code-driven Knowledge Transfer for Unified Structured Knowledge Reasoning
di: Chen, Yongrui, et al.
Pubblicazione: (2025)
di: Chen, Yongrui, et al.
Pubblicazione: (2025)
Magic Mushroom: A Customizable Benchmark for Fine-grained Analysis of Retrieval Noise Erosion in RAG Systems
di: Zhang, Yuxin, et al.
Pubblicazione: (2025)
di: Zhang, Yuxin, et al.
Pubblicazione: (2025)
Pandora: A Code-Driven Large Language Model Agent for Unified Reasoning Across Diverse Structured Knowledge
di: Chen, Yongrui, et al.
Pubblicazione: (2025)
di: Chen, Yongrui, et al.
Pubblicazione: (2025)
Uncertain Knowledge Graph Completion via Semi-Supervised Confidence Distribution Learning
di: Wu, Tianxing, et al.
Pubblicazione: (2025)
di: Wu, Tianxing, et al.
Pubblicazione: (2025)
Question Answering Over Spatio-Temporal Knowledge Graph
di: Dai, Xinbang, et al.
Pubblicazione: (2024)
di: Dai, Xinbang, et al.
Pubblicazione: (2024)
Large Language Models Can Better Understand Knowledge Graphs Than We Thought
di: Dai, Xinbang, et al.
Pubblicazione: (2024)
di: Dai, Xinbang, et al.
Pubblicazione: (2024)
KGroot: Enhancing Root Cause Analysis through Knowledge Graphs and Graph Convolutional Neural Networks
di: Wang, Tingting, et al.
Pubblicazione: (2024)
di: Wang, Tingting, et al.
Pubblicazione: (2024)
Embedding Ontologies via Incorporating Extensional and Intensional Knowledge
di: Wang, Keyu, et al.
Pubblicazione: (2024)
di: Wang, Keyu, et al.
Pubblicazione: (2024)
Continual Multimodal Knowledge Graph Construction
di: Chen, Xiang, et al.
Pubblicazione: (2023)
di: Chen, Xiang, et al.
Pubblicazione: (2023)
Can LLMs Evaluate Complex Attribution in QA? Automatic Benchmarking using Knowledge Graphs
di: Hu, Nan, et al.
Pubblicazione: (2024)
di: Hu, Nan, et al.
Pubblicazione: (2024)
KCoEvo: A Knowledge Graph Augmented Framework for Evolutionary Code Generation
di: Kang, Jiazhen, et al.
Pubblicazione: (2026)
di: Kang, Jiazhen, et al.
Pubblicazione: (2026)
Table-r1: Self-supervised and Reinforcement Learning for Program-based Table Reasoning in Small Language Models
di: Jin, Rihui, et al.
Pubblicazione: (2025)
di: Jin, Rihui, et al.
Pubblicazione: (2025)
DEE: Dual-stage Explainable Evaluation Method for Text Generation
di: Zhang, Shenyu, et al.
Pubblicazione: (2024)
di: Zhang, Shenyu, et al.
Pubblicazione: (2024)
InnoEval: On Research Idea Evaluation as a Knowledge-Grounded, Multi-Perspective Reasoning Problem
di: Qiao, Shuofei, et al.
Pubblicazione: (2026)
di: Qiao, Shuofei, et al.
Pubblicazione: (2026)
Croppable Knowledge Graph Embedding
di: Zhu, Yushan, et al.
Pubblicazione: (2024)
di: Zhu, Yushan, et al.
Pubblicazione: (2024)
MATEval: A Multi-Agent Discussion Framework for Advancing Open-Ended Text Evaluation
di: Li, Yu, et al.
Pubblicazione: (2024)
di: Li, Yu, et al.
Pubblicazione: (2024)
Harnessing Diverse Perspectives: A Multi-Agent Framework for Enhanced Error Detection in Knowledge Graphs
di: Li, Yu, et al.
Pubblicazione: (2025)
di: Li, Yu, et al.
Pubblicazione: (2025)
Enhancing Safe and Controllable Protein Generation via Knowledge Preference Optimization
di: Wang, Yuhao, et al.
Pubblicazione: (2025)
di: Wang, Yuhao, et al.
Pubblicazione: (2025)
SAFER: Advancing Safety Alignment via Efficient Ex-Ante Reasoning
di: Feng, Kehua, et al.
Pubblicazione: (2025)
di: Feng, Kehua, et al.
Pubblicazione: (2025)
Large Knowledge Model: Perspectives and Challenges
di: Chen, Huajun
Pubblicazione: (2023)
di: Chen, Huajun
Pubblicazione: (2023)
OneKE: A Dockerized Schema-Guided LLM Agent-based Knowledge Extraction System
di: Luo, Yujie, et al.
Pubblicazione: (2024)
di: Luo, Yujie, et al.
Pubblicazione: (2024)
SciToolAgent: A Knowledge Graph-Driven Scientific Agent for Multi-Tool Integration
di: Ding, Keyan, et al.
Pubblicazione: (2025)
di: Ding, Keyan, et al.
Pubblicazione: (2025)
StratMem-Bench: Evaluating Strategic Memory Use in Virtual Character Conversation Beyond Factual Recall
di: Wu, Yerong, et al.
Pubblicazione: (2026)
di: Wu, Yerong, et al.
Pubblicazione: (2026)
After Retrieval, Before Generation: Enhancing the Trustworthiness of Large Language Models in Retrieval-Augmented Generation
di: Dai, Xinbang, et al.
Pubblicazione: (2025)
di: Dai, Xinbang, et al.
Pubblicazione: (2025)
SciAtlas: A Large-Scale Knowledge Graph for Automated Scientific Research
di: Qiao, Shuofei, et al.
Pubblicazione: (2026)
di: Qiao, Shuofei, et al.
Pubblicazione: (2026)
Enhancing Environmental Robustness in Few-shot Learning via Conditional Representation Learning
di: Guo, Qianyu, et al.
Pubblicazione: (2025)
di: Guo, Qianyu, et al.
Pubblicazione: (2025)
ELAIPBench: A Benchmark for Expert-Level Artificial Intelligence Paper Understanding
di: Dai, Xinbang, et al.
Pubblicazione: (2025)
di: Dai, Xinbang, et al.
Pubblicazione: (2025)
MultifacetEval: Multifaceted Evaluation to Probe LLMs in Mastering Medical Knowledge
di: Zhou, Yuxuan, et al.
Pubblicazione: (2024)
di: Zhou, Yuxuan, et al.
Pubblicazione: (2024)
RTQA : Recursive Thinking for Complex Temporal Knowledge Graph Question Answering with Large Language Models
di: Gong, Zhaoyan, et al.
Pubblicazione: (2025)
di: Gong, Zhaoyan, et al.
Pubblicazione: (2025)
SciKnowEval: Evaluating Multi-level Scientific Knowledge of Large Language Models
di: Feng, Kehua, et al.
Pubblicazione: (2024)
di: Feng, Kehua, et al.
Pubblicazione: (2024)
Boosting LLM's Molecular Structure Elucidation with Knowledge Enhanced Tree Search Reasoning
di: Zhuang, Xiang, et al.
Pubblicazione: (2025)
di: Zhuang, Xiang, et al.
Pubblicazione: (2025)
K-ON: Stacking Knowledge On the Head Layer of Large Language Model
di: Guo, Lingbing, et al.
Pubblicazione: (2025)
di: Guo, Lingbing, et al.
Pubblicazione: (2025)
Unveiling the Pitfalls of Knowledge Editing for Large Language Models
di: Li, Zhoubo, et al.
Pubblicazione: (2023)
di: Li, Zhoubo, et al.
Pubblicazione: (2023)
Knowledge-Augmented Long-CoT Generation for Complex Biomolecular Reasoning
di: Lyu, Tianwen, et al.
Pubblicazione: (2025)
di: Lyu, Tianwen, et al.
Pubblicazione: (2025)
KADEL: Knowledge-Aware Denoising Learning for Commit Message Generation
di: Tao, Wei, et al.
Pubblicazione: (2024)
di: Tao, Wei, et al.
Pubblicazione: (2024)
Multi-modal Knowledge Graph Generation with Semantics-enriched Prompts
di: Xu, Yajing, et al.
Pubblicazione: (2025)
di: Xu, Yajing, et al.
Pubblicazione: (2025)
Multi-domain Knowledge Graph Collaborative Pre-training and Prompt Tuning for Diverse Downstream Tasks
di: Zhang, Yichi, et al.
Pubblicazione: (2024)
di: Zhang, Yichi, et al.
Pubblicazione: (2024)
Documenti analoghi
-
StressEval: Failure-Driven Dynamic Benchmarking for Knowledge-Intensive Reasoning in Large Language Models
di: Chen, Yongrui, et al.
Pubblicazione: (2026) -
K-DeCore: Facilitating Knowledge Transfer in Continual Structured Knowledge Reasoning via Knowledge Decoupling
di: Chen, Yongrui, et al.
Pubblicazione: (2025) -
Large Language Models Meet Knowledge Graphs for Question Answering: Synthesis and Opportunities
di: Ma, Chuangtao, et al.
Pubblicazione: (2025) -
Pandora: Leveraging Code-driven Knowledge Transfer for Unified Structured Knowledge Reasoning
di: Chen, Yongrui, et al.
Pubblicazione: (2025) -
Magic Mushroom: A Customizable Benchmark for Fine-grained Analysis of Retrieval Noise Erosion in RAG Systems
di: Zhang, Yuxin, et al.
Pubblicazione: (2025)