League of LLMs: A Benchmark-Free Paradigm for Mutual Evaluation of Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Guo, Qianhong, Xie, Wei, Cai, Xiaofang, Wang, Enze, Ma, Shuoyoucheng, Sun, Xiaobing, Xia, Tian, Chen, Kai, Wang, Xiaofeng, Wang, Baosheng |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Do Large Language Models Truly Grasp Mathematics? An Empirical Exploration From Cognitive Psychology
by: Xie, Wei, et al.
Published: (2024)
by: Xie, Wei, et al.
Published: (2024)
AIPsychoBench: Understanding the Psychometric Differences between LLMs and Humans
by: Xie, Wei, et al.
Published: (2025)
by: Xie, Wei, et al.
Published: (2025)
Foot In The Door: Understanding Large Language Model Jailbreaking via Cognitive Psychology
by: Wang, Zhenhua, et al.
Published: (2024)
by: Wang, Zhenhua, et al.
Published: (2024)
AIPsychoBench: Understanding the Psychometric Differences Between LLMs and Humans
by: Wei Xie, et al.
Published: (2026)
by: Wei Xie, et al.
Published: (2026)
MM-Eval: A Hierarchical Benchmark for Modern Mongolian Evaluation in LLMs
by: Zhang, Mengyuan, et al.
Published: (2024)
by: Zhang, Mengyuan, et al.
Published: (2024)
Towards Reliable Medical LLMs: Benchmarking and Enhancing Confidence Estimation of Large Language Models in Medical Consultation
by: Ren, Zhiyao, et al.
Published: (2026)
by: Ren, Zhiyao, et al.
Published: (2026)
Thermoelastic diffusion model based on new C–V fractional heat–mass transport model and transient dynamic responses of laminated sandwich copper–metallic composites
by: Qianhong Bao, et al.
Published: (2026)
by: Qianhong Bao, et al.
Published: (2026)
Graphene Oxide‐Carbon Nanotube Hybrid Membranes for High‐Pressure and High‐Flux Nanofiltration
by: Xuyao Zhu, et al.
Published: (2025)
by: Xuyao Zhu, et al.
Published: (2025)
Evaluating the Test Adequacy of Benchmarks for LLMs on Code Generation
by: Xiangyue Liu, et al.
Published: (2025)
by: Xiangyue Liu, et al.
Published: (2025)
Uncovering Intrinsic Capabilities: A Paradigm for Data Curation in Vision-Language Models
by: Li, Junjie, et al.
Published: (2025)
by: Li, Junjie, et al.
Published: (2025)
WARBENCH: A Comprehensive Benchmark for Evaluating LLMs in Military Decision-Making
by: Li, Zongjie, et al.
Published: (2026)
by: Li, Zongjie, et al.
Published: (2026)
Tape: A Cellular Automata Benchmark for Evaluating Rule-Shift Generalization in Reinforcement Learning
by: Pan, Enze
Published: (2026)
by: Pan, Enze
Published: (2026)
SpecX: A Large-Scale Benchmark for Multi-Modal Spectroscopy and Cross-Paradigm Evaluation
by: Xiang, Chengrui, et al.
Published: (2026)
by: Xiang, Chengrui, et al.
Published: (2026)
Instruction Learning Paradigms: A Dual Perspective on White-box and Black-box LLMs
by: Ren, Yanwei, et al.
Published: (2025)
by: Ren, Yanwei, et al.
Published: (2025)
EffiVLM-BENCH: A Comprehensive Benchmark for Evaluating Training-Free Acceleration in Large Vision-Language Models
by: Wang, Zekun, et al.
Published: (2025)
by: Wang, Zekun, et al.
Published: (2025)
NotaGen: Advancing Musicality in Symbolic Music Generation with Large Language Model Training Paradigms
by: Wang, Yashan, et al.
Published: (2025)
by: Wang, Yashan, et al.
Published: (2025)
Mask Is What DLLM Needs: A Masked Data Training Paradigm for Diffusion LLMs
by: Ma, Linrui, et al.
Published: (2026)
by: Ma, Linrui, et al.
Published: (2026)
SafeToolBench: Pioneering a Prospective Benchmark to Evaluating Tool Utilization Safety in LLMs
by: Xia, Hongfei, et al.
Published: (2025)
by: Xia, Hongfei, et al.
Published: (2025)
Invariant-based Robust Weights Watermark for Large Language Models
by: Guo, Qingxiao, et al.
Published: (2025)
by: Guo, Qingxiao, et al.
Published: (2025)
Potential Mechanism of Qiju Dihuang Pill in Treating Primary Sjogren's Syndrome Revealed by Network Pharmacology and Experimental Verification
by: Huiying Wang, et al.
Published: (2025)
by: Huiying Wang, et al.
Published: (2025)
Towards Human-AI Mutual Learning: A New Research Paradigm
by: Wang, Xiaomei, et al.
Published: (2024)
by: Wang, Xiaomei, et al.
Published: (2024)
TCMBench: A Comprehensive Benchmark for Evaluating Large Language Models in Traditional Chinese Medicine
by: Yue, Wenjing, et al.
Published: (2024)
by: Yue, Wenjing, et al.
Published: (2024)
Beyond Benchmarking: A New Paradigm for Evaluation and Assessment of Large Language Models
by: Liu, Jin, et al.
Published: (2024)
by: Liu, Jin, et al.
Published: (2024)
A User-Centric Multi-Intent Benchmark for Evaluating Large Language Models
by: Wang, Jiayin, et al.
Published: (2024)
by: Wang, Jiayin, et al.
Published: (2024)
In vitro fertilization and pregnancy outcomes of women with X chromosome abnormality: A case series
by: Ruohan Wang, et al.
Published: (2024)
by: Ruohan Wang, et al.
Published: (2024)
DDFAV: Remote Sensing Large Vision Language Models Dataset and Evaluation Benchmark
by: Li, Haodong, et al.
Published: (2024)
by: Li, Haodong, et al.
Published: (2024)
ISA-Bench: Benchmarking Instruction Sensitivity for Large Audio Language Models
by: Li, Bohan, et al.
Published: (2025)
by: Li, Bohan, et al.
Published: (2025)
OccScene: Semantic Occupancy-based Cross-task Mutual Learning for 3D Scene Generation
by: Li, Bohan, et al.
Published: (2024)
by: Li, Bohan, et al.
Published: (2024)
Towards a Unified Paradigm: Integrating Recommendation Systems as a New Language in Large Models
by: Zheng, Kai, et al.
Published: (2024)
by: Zheng, Kai, et al.
Published: (2024)
DHP Benchmark: Are LLMs Good NLG Evaluators?
by: Wang, Yicheng, et al.
Published: (2024)
by: Wang, Yicheng, et al.
Published: (2024)
A Survey on Medical Competence Evaluation Benchmarks for Large Language Models
by: Qiting Wang, et al.
Published: (2026)
by: Qiting Wang, et al.
Published: (2026)
AnesSuite: A Comprehensive Benchmark and Dataset Suite for Anesthesiology Reasoning in LLMs
by: Feng, Xiang, et al.
Published: (2025)
by: Feng, Xiang, et al.
Published: (2025)
OphthBench: A Comprehensive Benchmark for Evaluating Large Language Models in Chinese Ophthalmology
by: Zhou, Chengfeng, et al.
Published: (2025)
by: Zhou, Chengfeng, et al.
Published: (2025)
InfoPO: On Mutual Information Maximization for Large Language Model Alignment
by: Xiao, Teng, et al.
Published: (2025)
by: Xiao, Teng, et al.
Published: (2025)
UniEdit: A Unified Knowledge Editing Benchmark for Large Language Models
by: Chen, Qizhou, et al.
Published: (2025)
by: Chen, Qizhou, et al.
Published: (2025)
From Solving to Verifying: A Unified Objective for Robust Reasoning in LLMs
by: Wang, Xiaoxuan, et al.
Published: (2025)
by: Wang, Xiaoxuan, et al.
Published: (2025)
TextBlockV2: Towards Precise-Detection-Free Scene Text Spotting with Pre-trained Language Model
by: Lyu, Jiahao, et al.
Published: (2024)
by: Lyu, Jiahao, et al.
Published: (2024)
InsQABench: Benchmarking Chinese Insurance Domain Question Answering with Large Language Models
by: Ding, Jing, et al.
Published: (2025)
by: Ding, Jing, et al.
Published: (2025)
CEB: Compositional Evaluation Benchmark for Fairness in Large Language Models
by: Wang, Song, et al.
Published: (2024)
by: Wang, Song, et al.
Published: (2024)
A Discrete-Time Least-Squares Adaptive State Tracking Control Scheme with A Mobile-Robot System Study
by: Zhao, Qianhong, et al.
Published: (2024)
by: Zhao, Qianhong, et al.
Published: (2024)
Similar Items
-
Do Large Language Models Truly Grasp Mathematics? An Empirical Exploration From Cognitive Psychology
by: Xie, Wei, et al.
Published: (2024) -
AIPsychoBench: Understanding the Psychometric Differences between LLMs and Humans
by: Xie, Wei, et al.
Published: (2025) -
Foot In The Door: Understanding Large Language Model Jailbreaking via Cognitive Psychology
by: Wang, Zhenhua, et al.
Published: (2024) -
AIPsychoBench: Understanding the Psychometric Differences Between LLMs and Humans
by: Wei Xie, et al.
Published: (2026) -
MM-Eval: A Hierarchical Benchmark for Modern Mongolian Evaluation in LLMs
by: Zhang, Mengyuan, et al.
Published: (2024)