Encyclo-K: Evaluating LLMs with Dynamically Composed Knowledge Statements
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liang, Yiming, Li, Yizhi, Du, Yantao, Zhang, Ge, Zhou, Jiayi, Wu, Yuchen, Piao, Yinzhu, Cao, Denghui, Sun, Tong, Li, Ziniu, Du, Li, Lei, Bo, Liu, Jiaheng, Lin, Chenghua, Zhang, Zhaoxiang, Huang, Wenhao, Zhang, Jiajun |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
The Molecular Structure of Thought: Mapping the Topology of Long Chain-of-Thought Reasoning
par: Chen, Qiguang, et autres
Publié: (2026)
par: Chen, Qiguang, et autres
Publié: (2026)
I-SHEEP: Self-Alignment of LLM from Scratch through an Iterative Self-Enhancement Paradigm
par: Liang, Yiming, et autres
Publié: (2024)
par: Liang, Yiming, et autres
Publié: (2024)
Overview of the NLPCC 2024 Shared Task on Chinese Metaphor Generation
par: Qu, Xingwei, et autres
Publié: (2024)
par: Qu, Xingwei, et autres
Publié: (2024)
Overview of the NLPCC 2025 Shared Task: Gender Bias Mitigation Challenge
par: Li, Yizhi, et autres
Publié: (2025)
par: Li, Yizhi, et autres
Publié: (2025)
Automating Financial Statement Audits with Large Language Models
par: Wang, Rushi, et autres
Publié: (2025)
par: Wang, Rushi, et autres
Publié: (2025)
ComposerX: Multi-Agent Symbolic Music Composition with LLMs
par: Deng, Qixin, et autres
Publié: (2024)
par: Deng, Qixin, et autres
Publié: (2024)
Aligning Instruction Tuning with Pre-training
par: Liang, Yiming, et autres
Publié: (2025)
par: Liang, Yiming, et autres
Publié: (2025)
Knapsack RL: Unlocking Exploration of LLMs via Optimizing Budget Allocation
par: Li, Ziniu, et autres
Publié: (2025)
par: Li, Ziniu, et autres
Publié: (2025)
CoTJudger: A Graph-Driven Framework for Automatic Evaluation of Chain-of-Thought Efficiency and Redundancy in LRMs
par: Li, Siyi, et autres
Publié: (2026)
par: Li, Siyi, et autres
Publié: (2026)
Do LLMs Know to Respect Copyright Notice?
par: Xu, Jialiang, et autres
Publié: (2024)
par: Xu, Jialiang, et autres
Publié: (2024)
Reviewing the Reviewer: Graph-Enhanced LLMs for E-commerce Appeal Adjudication
par: Du, Yuchen, et autres
Publié: (2026)
par: Du, Yuchen, et autres
Publié: (2026)
A Comparative Study on Reasoning Patterns of OpenAI's o1 Model
par: Wu, Siwei, et autres
Publié: (2024)
par: Wu, Siwei, et autres
Publié: (2024)
Lagrangian Flow Matching: A Least-Action Framework for Principled Path Design
par: Du, Shukai, et autres
Publié: (2026)
par: Du, Shukai, et autres
Publié: (2026)
ReCoVR: Closing the Loop in Interactive Composed Video Retrieval
par: Zhang, Bingqing, et autres
Publié: (2026)
par: Zhang, Bingqing, et autres
Publié: (2026)
OmniBench: Towards The Future of Universal Omni-Language Models
par: Li, Yizhi, et autres
Publié: (2024)
par: Li, Yizhi, et autres
Publié: (2024)
MIO: A Foundation Model on Multimodal Tokens
par: Wang, Zekun, et autres
Publié: (2024)
par: Wang, Zekun, et autres
Publié: (2024)
TreePO: Bridging the Gap of Policy Optimization and Efficacy and Inference Efficiency with Heuristic Tree-based Modeling
par: Li, Yizhi, et autres
Publié: (2025)
par: Li, Yizhi, et autres
Publié: (2025)
A Note on Hybrid Online Reinforcement and Imitation Learning for LLMs: Formulations and Algorithms
par: Li, Yingru, et autres
Publié: (2025)
par: Li, Yingru, et autres
Publié: (2025)
SAGA: Summarization-Guided Assert Statement Generation
par: Zhang, Yuwei, et autres
Publié: (2023)
par: Zhang, Yuwei, et autres
Publié: (2023)
KOR-Bench: Benchmarking Language Models on Knowledge-Orthogonal Reasoning Tasks
par: Ma, Kaijing, et autres
Publié: (2024)
par: Ma, Kaijing, et autres
Publié: (2024)
Dynamics Within Latent Chain-of-Thought: An Empirical Study of Causal Structure
par: Li, Zirui, et autres
Publié: (2026)
par: Li, Zirui, et autres
Publié: (2026)
Evaluating the Generalizability of LLMs in Automated Program Repair
par: Li, Fengjie, et autres
Publié: (2025)
par: Li, Fengjie, et autres
Publié: (2025)
A Prüfer Angle Approach to Dependence of Eigenvalue for Sturm‐Liouville Problem With Distributional Potentials
par: Gaofeng Du, et autres
Publié: (2026)
par: Gaofeng Du, et autres
Publié: (2026)
FraudShield: Knowledge Graph Empowered Defense for LLMs against Fraud Attacks
par: Xu, Naen, et autres
Publié: (2026)
par: Xu, Naen, et autres
Publié: (2026)
SciMMIR: Benchmarking Scientific Multi-modal Information Retrieval
par: Wu, Siwei, et autres
Publié: (2024)
par: Wu, Siwei, et autres
Publié: (2024)
Agentic AutoSurvey: Let LLMs Survey LLMs
par: Liu, Yixin, et autres
Publié: (2025)
par: Liu, Yixin, et autres
Publié: (2025)
MMRA: A Benchmark for Evaluating Multi-Granularity and Multi-Image Relational Association Capabilities in Large Visual Language Models
par: Wu, Siwei, et autres
Publié: (2024)
par: Wu, Siwei, et autres
Publié: (2024)
Generalized i-boson model and boxed BUC plane partitions
par: Zhang, Shengyu, et autres
Publié: (2026)
par: Zhang, Shengyu, et autres
Publié: (2026)
Aubry–Mather Sets of the Breathing Circle Billiard
par: Xiaoming Zhang, et autres
Publié: (2025)
par: Xiaoming Zhang, et autres
Publié: (2025)
CIF-Bench: A Chinese Instruction-Following Benchmark for Evaluating the Generalizability of Large Language Models
par: LI, Yizhi, et autres
Publié: (2024)
par: LI, Yizhi, et autres
Publié: (2024)
MOSAIC: Composable Safety Alignment with Modular Control Tokens
par: Peng, Jingyu, et autres
Publié: (2026)
par: Peng, Jingyu, et autres
Publié: (2026)
LongIns: A Challenging Long-context Instruction-based Exam for LLMs
par: Gavin, Shawn, et autres
Publié: (2024)
par: Gavin, Shawn, et autres
Publié: (2024)
VideoRouter: Query-Adaptive Dual Routing for Efficient Long-Video Understanding
par: Lin, Kuanwei, et autres
Publié: (2026)
par: Lin, Kuanwei, et autres
Publié: (2026)
Dual-Path Knowledge-Augmented Contrastive Alignment Network for Spatially Resolved Transcriptomics
par: Zhang, Wei, et autres
Publié: (2025)
par: Zhang, Wei, et autres
Publié: (2025)
DocMMIR: A Framework for Document Multi-modal Information Retrieval
par: Li, Zirui, et autres
Publié: (2025)
par: Li, Zirui, et autres
Publié: (2025)
MUBen: Benchmarking the Uncertainty of Molecular Representation Models
par: Li, Yinghao, et autres
Publié: (2023)
par: Li, Yinghao, et autres
Publié: (2023)
Structural Entropy Guided Agent for Detecting and Repairing Knowledge Deficiencies in LLMs
par: Wei, Yifan, et autres
Publié: (2025)
par: Wei, Yifan, et autres
Publié: (2025)
MMTE: Corpus and Metrics for Evaluating Machine Translation Quality of Metaphorical Language
par: Wang, Shun, et autres
Publié: (2024)
par: Wang, Shun, et autres
Publié: (2024)
CriticLean: Critic-Guided Reinforcement Learning for Mathematical Formalization
par: Peng, Zhongyuan, et autres
Publié: (2025)
par: Peng, Zhongyuan, et autres
Publié: (2025)
Ventriculoperitoneal Shunt Malfunction: The Importance of Topogram Image Observation
par: Yantao Du, et autres
Publié: (2026)
par: Yantao Du, et autres
Publié: (2026)
Documents similaires
-
The Molecular Structure of Thought: Mapping the Topology of Long Chain-of-Thought Reasoning
par: Chen, Qiguang, et autres
Publié: (2026) -
I-SHEEP: Self-Alignment of LLM from Scratch through an Iterative Self-Enhancement Paradigm
par: Liang, Yiming, et autres
Publié: (2024) -
Overview of the NLPCC 2024 Shared Task on Chinese Metaphor Generation
par: Qu, Xingwei, et autres
Publié: (2024) -
Overview of the NLPCC 2025 Shared Task: Gender Bias Mitigation Challenge
par: Li, Yizhi, et autres
Publié: (2025) -
Automating Financial Statement Audits with Large Language Models
par: Wang, Rushi, et autres
Publié: (2025)