DEP: A Decentralized Large Language Model Evaluation Protocol
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Peng, Jianxiang, Li, Junhao, Wang, Hongxiang, Lyu, Haocheng, Guo, Hui, Hao, Siyi, Wang, Zhen, Liu, Chuang, Zhang, Shaowei, Xiong, Bojian, Chen, Yue, Han, Zhuowen, Shi, Ling, Dong, Tianyu, Xiao, Juesi, Yang, Lei, Ren, Yuqi, Xiong, Deyi |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
From Curated Data to Scalable Models: Continual Pre-training of Dense and MoE Large Language Models for Tibetan
par: Yang, Lei, et autres
Publié: (2025)
par: Yang, Lei, et autres
Publié: (2025)
LHMKE: A Large-scale Holistic Multi-subject Knowledge Evaluation Benchmark for Chinese Large Language Models
par: Liu, Chuang, et autres
Publié: (2024)
par: Liu, Chuang, et autres
Publié: (2024)
DVMap: Fine-Grained Pluralistic Value Alignment via High-Consensus Demographic-Value Mapping
par: Zhu, Pengyun, et autres
Publié: (2026)
par: Zhu, Pengyun, et autres
Publié: (2026)
ProBench: Benchmarking Large Language Models in Competitive Programming
par: Yang, Lei, et autres
Publié: (2025)
par: Yang, Lei, et autres
Publié: (2025)
Do Large Language Models Mirror Cognitive Language Processing?
par: Ren, Yuqi, et autres
Publié: (2024)
par: Ren, Yuqi, et autres
Publié: (2024)
CRiskEval: A Chinese Multi-Level Risk Evaluation Benchmark Dataset for Large Language Models
par: Shi, Ling, et autres
Publié: (2024)
par: Shi, Ling, et autres
Publié: (2024)
DCIS: Efficient Length Extrapolation of LLMs via Divide-and-Conquer Scaling Factor Search
par: Yang, Lei, et autres
Publié: (2024)
par: Yang, Lei, et autres
Publié: (2024)
Revisiting Entropy in Reinforcement Learning for Large Reasoning Models
par: Jin, Renren, et autres
Publié: (2025)
par: Jin, Renren, et autres
Publié: (2025)
Automated Progressive Red Teaming
par: Jiang, Bojian, et autres
Publié: (2024)
par: Jiang, Bojian, et autres
Publié: (2024)
Watermarking Conditional Text Generation for AI Detection: Unveiling Challenges and a Semantic-Aware Watermark Remedy
par: Fu, Yu, et autres
Publié: (2023)
par: Fu, Yu, et autres
Publié: (2023)
Mix-MoE: Improving Multilingual Machine Translation of Large Language Models through Mixed MoEs
par: Li, Bo, et autres
Publié: (2026)
par: Li, Bo, et autres
Publié: (2026)
FuxiMT: Sparsifying Large Language Models for Chinese-Centric Multilingual Machine Translation
par: Zhu, Shaolin, et autres
Publié: (2025)
par: Zhu, Shaolin, et autres
Publié: (2025)
FuxiTranyu: A Multilingual Large Language Model Trained with Balanced Data
par: Sun, Haoran, et autres
Publié: (2024)
par: Sun, Haoran, et autres
Publié: (2024)
A Local Perturbation Theory for Cross-Domain Interference and Recovery in Multi-Domain RL
par: Yang, Lei, et autres
Publié: (2026)
par: Yang, Lei, et autres
Publié: (2026)
Towards Understanding Multi-Task Learning (Generalization) of LLMs via Detecting and Exploring Task-Specific Neurons
par: Leng, Yongqi, et autres
Publié: (2024)
par: Leng, Yongqi, et autres
Publié: (2024)
AdaST: Dynamically Adapting Encoder States in the Decoder for End-to-End Speech-to-Text Translation
par: Huang, Wuwei, et autres
Publié: (2025)
par: Huang, Wuwei, et autres
Publié: (2025)
Why Does Reinforcement Learning Generalize? A Feature-Level Mechanistic Study of Post-Training in Large Language Models
par: Shi, Dan, et autres
Publié: (2026)
par: Shi, Dan, et autres
Publié: (2026)
DecEx-RAG: Boosting Agentic Retrieval-Augmented Generation with Decision and Execution Optimization via Process Supervision
par: Leng, Yongqi, et autres
Publié: (2025)
par: Leng, Yongqi, et autres
Publié: (2025)
An Empirical Study on the Robustness of Massively Multilingual Neural Machine Translation
par: Supryadi, et autres
Publié: (2024)
par: Supryadi, et autres
Publié: (2024)
The Box is in the Pen: Evaluating Commonsense Reasoning in Neural Machine Translation
par: He, Jie, et autres
Publié: (2025)
par: He, Jie, et autres
Publié: (2025)
CLM-Bench: Benchmarking and Analyzing Cross-lingual Misalignment of LLMs in Knowledge Editing
par: Hu, Yucheng, et autres
Publié: (2026)
par: Hu, Yucheng, et autres
Publié: (2026)
Large Language Model Safety: A Holistic Survey
par: Shi, Dan, et autres
Publié: (2024)
par: Shi, Dan, et autres
Publié: (2024)
Evaluating Discourse Cohesion in Pre-trained Language Models
par: He, Jie, et autres
Publié: (2025)
par: He, Jie, et autres
Publié: (2025)
LFED: A Literary Fiction Evaluation Dataset for Large Language Models
par: Yu, Linhao, et autres
Publié: (2024)
par: Yu, Linhao, et autres
Publié: (2024)
Preparation, optimization, and modification of urea‐formaldehyde resin for used as a plugging agent in fractured and caved oil and gas reservoirs
par: Zhang Bojian, et autres
Publié: (2024)
par: Zhang Bojian, et autres
Publié: (2024)
FineMath: A Fine-Grained Mathematical Evaluation Benchmark for Chinese Large Language Models
par: Liu, Yan, et autres
Publié: (2024)
par: Liu, Yan, et autres
Publié: (2024)
Finding the Translation Switch: Discovering and Exploiting the Task-Initiation Features in LLMs
par: Wu, Xinwei, et autres
Publié: (2026)
par: Wu, Xinwei, et autres
Publié: (2026)
Graphs of Research: Citation Evolution Graphs as Supervision for Research Idea Generation
par: Gao, Songyang, et autres
Publié: (2026)
par: Gao, Songyang, et autres
Publié: (2026)
GoalfyMax: A Protocol-Driven Multi-Agent System for Intelligent Experience Entities
par: Wu, Siyi, et autres
Publié: (2025)
par: Wu, Siyi, et autres
Publié: (2025)
Soft Tail-dropping for Adaptive Visual Tokenization
par: Chen, Zeyuan, et autres
Publié: (2026)
par: Chen, Zeyuan, et autres
Publié: (2026)
Data Mixing for Large Language Models Pretraining: A Survey and Outlook
par: Chen, Zhuo, et autres
Publié: (2026)
par: Chen, Zhuo, et autres
Publié: (2026)
SOUP: Token-level Single-sample Mix-policy Reinforcement Learning for Large Language Models
par: Yang, Lei, et autres
Publié: (2026)
par: Yang, Lei, et autres
Publié: (2026)
Non-Stationary Time Series Forecasting Based on Fourier Analysis and Cross Attention Mechanism
par: Xiong, Yuqi, et autres
Publié: (2025)
par: Xiong, Yuqi, et autres
Publié: (2025)
Fast Decentralized State Estimation for Legged Robot Locomotion via EKF and MHE
par: Kang, Jiarong, et autres
Publié: (2024)
par: Kang, Jiarong, et autres
Publié: (2024)
Why rejection sensitivity leads to adolescents' loneliness: Differential exposure, reactivity, and exposure‐reactivity models
par: Muhua Lyu, et autres
Publié: (2024)
par: Muhua Lyu, et autres
Publié: (2024)
A Whole-Body Motion Imitation Framework from Human Data for Full-Size Humanoid Robot
par: Chen, Zhenghan, et autres
Publié: (2025)
par: Chen, Zhenghan, et autres
Publié: (2025)
Efficiently Exploring Large Language Models for Document-Level Machine Translation with In-context Learning
par: Cui, Menglong, et autres
Publié: (2024)
par: Cui, Menglong, et autres
Publié: (2024)
Self-Pluralising Culture Alignment for Large Language Models
par: Xu, Shaoyang, et autres
Publié: (2024)
par: Xu, Shaoyang, et autres
Publié: (2024)
LANDeRMT: Detecting and Routing Language-Aware Neurons for Selectively Finetuning LLMs to Machine Translation
par: Zhu, Shaolin, et autres
Publié: (2024)
par: Zhu, Shaolin, et autres
Publié: (2024)
RoleEval: A Bilingual Role Evaluation Benchmark for Large Language Models
par: Shen, Tianhao, et autres
Publié: (2023)
par: Shen, Tianhao, et autres
Publié: (2023)
Documents similaires
-
From Curated Data to Scalable Models: Continual Pre-training of Dense and MoE Large Language Models for Tibetan
par: Yang, Lei, et autres
Publié: (2025) -
LHMKE: A Large-scale Holistic Multi-subject Knowledge Evaluation Benchmark for Chinese Large Language Models
par: Liu, Chuang, et autres
Publié: (2024) -
DVMap: Fine-Grained Pluralistic Value Alignment via High-Consensus Demographic-Value Mapping
par: Zhu, Pengyun, et autres
Publié: (2026) -
ProBench: Benchmarking Large Language Models in Competitive Programming
par: Yang, Lei, et autres
Publié: (2025) -
Do Large Language Models Mirror Cognitive Language Processing?
par: Ren, Yuqi, et autres
Publié: (2024)