DEP: A Decentralized Large Language Model Evaluation Protocol
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Peng, Jianxiang, Li, Junhao, Wang, Hongxiang, Lyu, Haocheng, Guo, Hui, Hao, Siyi, Wang, Zhen, Liu, Chuang, Zhang, Shaowei, Xiong, Bojian, Chen, Yue, Han, Zhuowen, Shi, Ling, Dong, Tianyu, Xiao, Juesi, Yang, Lei, Ren, Yuqi, Xiong, Deyi |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
From Curated Data to Scalable Models: Continual Pre-training of Dense and MoE Large Language Models for Tibetan
von: Yang, Lei, et al.
Veröffentlicht: (2025)
von: Yang, Lei, et al.
Veröffentlicht: (2025)
LHMKE: A Large-scale Holistic Multi-subject Knowledge Evaluation Benchmark for Chinese Large Language Models
von: Liu, Chuang, et al.
Veröffentlicht: (2024)
von: Liu, Chuang, et al.
Veröffentlicht: (2024)
DVMap: Fine-Grained Pluralistic Value Alignment via High-Consensus Demographic-Value Mapping
von: Zhu, Pengyun, et al.
Veröffentlicht: (2026)
von: Zhu, Pengyun, et al.
Veröffentlicht: (2026)
ProBench: Benchmarking Large Language Models in Competitive Programming
von: Yang, Lei, et al.
Veröffentlicht: (2025)
von: Yang, Lei, et al.
Veröffentlicht: (2025)
Do Large Language Models Mirror Cognitive Language Processing?
von: Ren, Yuqi, et al.
Veröffentlicht: (2024)
von: Ren, Yuqi, et al.
Veröffentlicht: (2024)
CRiskEval: A Chinese Multi-Level Risk Evaluation Benchmark Dataset for Large Language Models
von: Shi, Ling, et al.
Veröffentlicht: (2024)
von: Shi, Ling, et al.
Veröffentlicht: (2024)
DCIS: Efficient Length Extrapolation of LLMs via Divide-and-Conquer Scaling Factor Search
von: Yang, Lei, et al.
Veröffentlicht: (2024)
von: Yang, Lei, et al.
Veröffentlicht: (2024)
Revisiting Entropy in Reinforcement Learning for Large Reasoning Models
von: Jin, Renren, et al.
Veröffentlicht: (2025)
von: Jin, Renren, et al.
Veröffentlicht: (2025)
Automated Progressive Red Teaming
von: Jiang, Bojian, et al.
Veröffentlicht: (2024)
von: Jiang, Bojian, et al.
Veröffentlicht: (2024)
Watermarking Conditional Text Generation for AI Detection: Unveiling Challenges and a Semantic-Aware Watermark Remedy
von: Fu, Yu, et al.
Veröffentlicht: (2023)
von: Fu, Yu, et al.
Veröffentlicht: (2023)
Mix-MoE: Improving Multilingual Machine Translation of Large Language Models through Mixed MoEs
von: Li, Bo, et al.
Veröffentlicht: (2026)
von: Li, Bo, et al.
Veröffentlicht: (2026)
FuxiMT: Sparsifying Large Language Models for Chinese-Centric Multilingual Machine Translation
von: Zhu, Shaolin, et al.
Veröffentlicht: (2025)
von: Zhu, Shaolin, et al.
Veröffentlicht: (2025)
FuxiTranyu: A Multilingual Large Language Model Trained with Balanced Data
von: Sun, Haoran, et al.
Veröffentlicht: (2024)
von: Sun, Haoran, et al.
Veröffentlicht: (2024)
A Local Perturbation Theory for Cross-Domain Interference and Recovery in Multi-Domain RL
von: Yang, Lei, et al.
Veröffentlicht: (2026)
von: Yang, Lei, et al.
Veröffentlicht: (2026)
Towards Understanding Multi-Task Learning (Generalization) of LLMs via Detecting and Exploring Task-Specific Neurons
von: Leng, Yongqi, et al.
Veröffentlicht: (2024)
von: Leng, Yongqi, et al.
Veröffentlicht: (2024)
AdaST: Dynamically Adapting Encoder States in the Decoder for End-to-End Speech-to-Text Translation
von: Huang, Wuwei, et al.
Veröffentlicht: (2025)
von: Huang, Wuwei, et al.
Veröffentlicht: (2025)
Why Does Reinforcement Learning Generalize? A Feature-Level Mechanistic Study of Post-Training in Large Language Models
von: Shi, Dan, et al.
Veröffentlicht: (2026)
von: Shi, Dan, et al.
Veröffentlicht: (2026)
DecEx-RAG: Boosting Agentic Retrieval-Augmented Generation with Decision and Execution Optimization via Process Supervision
von: Leng, Yongqi, et al.
Veröffentlicht: (2025)
von: Leng, Yongqi, et al.
Veröffentlicht: (2025)
An Empirical Study on the Robustness of Massively Multilingual Neural Machine Translation
von: Supryadi, et al.
Veröffentlicht: (2024)
von: Supryadi, et al.
Veröffentlicht: (2024)
The Box is in the Pen: Evaluating Commonsense Reasoning in Neural Machine Translation
von: He, Jie, et al.
Veröffentlicht: (2025)
von: He, Jie, et al.
Veröffentlicht: (2025)
CLM-Bench: Benchmarking and Analyzing Cross-lingual Misalignment of LLMs in Knowledge Editing
von: Hu, Yucheng, et al.
Veröffentlicht: (2026)
von: Hu, Yucheng, et al.
Veröffentlicht: (2026)
Large Language Model Safety: A Holistic Survey
von: Shi, Dan, et al.
Veröffentlicht: (2024)
von: Shi, Dan, et al.
Veröffentlicht: (2024)
Evaluating Discourse Cohesion in Pre-trained Language Models
von: He, Jie, et al.
Veröffentlicht: (2025)
von: He, Jie, et al.
Veröffentlicht: (2025)
LFED: A Literary Fiction Evaluation Dataset for Large Language Models
von: Yu, Linhao, et al.
Veröffentlicht: (2024)
von: Yu, Linhao, et al.
Veröffentlicht: (2024)
Preparation, optimization, and modification of urea‐formaldehyde resin for used as a plugging agent in fractured and caved oil and gas reservoirs
von: Zhang Bojian, et al.
Veröffentlicht: (2024)
von: Zhang Bojian, et al.
Veröffentlicht: (2024)
FineMath: A Fine-Grained Mathematical Evaluation Benchmark for Chinese Large Language Models
von: Liu, Yan, et al.
Veröffentlicht: (2024)
von: Liu, Yan, et al.
Veröffentlicht: (2024)
Finding the Translation Switch: Discovering and Exploiting the Task-Initiation Features in LLMs
von: Wu, Xinwei, et al.
Veröffentlicht: (2026)
von: Wu, Xinwei, et al.
Veröffentlicht: (2026)
Graphs of Research: Citation Evolution Graphs as Supervision for Research Idea Generation
von: Gao, Songyang, et al.
Veröffentlicht: (2026)
von: Gao, Songyang, et al.
Veröffentlicht: (2026)
GoalfyMax: A Protocol-Driven Multi-Agent System for Intelligent Experience Entities
von: Wu, Siyi, et al.
Veröffentlicht: (2025)
von: Wu, Siyi, et al.
Veröffentlicht: (2025)
Soft Tail-dropping for Adaptive Visual Tokenization
von: Chen, Zeyuan, et al.
Veröffentlicht: (2026)
von: Chen, Zeyuan, et al.
Veröffentlicht: (2026)
Data Mixing for Large Language Models Pretraining: A Survey and Outlook
von: Chen, Zhuo, et al.
Veröffentlicht: (2026)
von: Chen, Zhuo, et al.
Veröffentlicht: (2026)
SOUP: Token-level Single-sample Mix-policy Reinforcement Learning for Large Language Models
von: Yang, Lei, et al.
Veröffentlicht: (2026)
von: Yang, Lei, et al.
Veröffentlicht: (2026)
Non-Stationary Time Series Forecasting Based on Fourier Analysis and Cross Attention Mechanism
von: Xiong, Yuqi, et al.
Veröffentlicht: (2025)
von: Xiong, Yuqi, et al.
Veröffentlicht: (2025)
Fast Decentralized State Estimation for Legged Robot Locomotion via EKF and MHE
von: Kang, Jiarong, et al.
Veröffentlicht: (2024)
von: Kang, Jiarong, et al.
Veröffentlicht: (2024)
Why rejection sensitivity leads to adolescents' loneliness: Differential exposure, reactivity, and exposure‐reactivity models
von: Muhua Lyu, et al.
Veröffentlicht: (2024)
von: Muhua Lyu, et al.
Veröffentlicht: (2024)
A Whole-Body Motion Imitation Framework from Human Data for Full-Size Humanoid Robot
von: Chen, Zhenghan, et al.
Veröffentlicht: (2025)
von: Chen, Zhenghan, et al.
Veröffentlicht: (2025)
Efficiently Exploring Large Language Models for Document-Level Machine Translation with In-context Learning
von: Cui, Menglong, et al.
Veröffentlicht: (2024)
von: Cui, Menglong, et al.
Veröffentlicht: (2024)
Self-Pluralising Culture Alignment for Large Language Models
von: Xu, Shaoyang, et al.
Veröffentlicht: (2024)
von: Xu, Shaoyang, et al.
Veröffentlicht: (2024)
LANDeRMT: Detecting and Routing Language-Aware Neurons for Selectively Finetuning LLMs to Machine Translation
von: Zhu, Shaolin, et al.
Veröffentlicht: (2024)
von: Zhu, Shaolin, et al.
Veröffentlicht: (2024)
RoleEval: A Bilingual Role Evaluation Benchmark for Large Language Models
von: Shen, Tianhao, et al.
Veröffentlicht: (2023)
von: Shen, Tianhao, et al.
Veröffentlicht: (2023)
Ähnliche Einträge
-
From Curated Data to Scalable Models: Continual Pre-training of Dense and MoE Large Language Models for Tibetan
von: Yang, Lei, et al.
Veröffentlicht: (2025) -
LHMKE: A Large-scale Holistic Multi-subject Knowledge Evaluation Benchmark for Chinese Large Language Models
von: Liu, Chuang, et al.
Veröffentlicht: (2024) -
DVMap: Fine-Grained Pluralistic Value Alignment via High-Consensus Demographic-Value Mapping
von: Zhu, Pengyun, et al.
Veröffentlicht: (2026) -
ProBench: Benchmarking Large Language Models in Competitive Programming
von: Yang, Lei, et al.
Veröffentlicht: (2025) -
Do Large Language Models Mirror Cognitive Language Processing?
von: Ren, Yuqi, et al.
Veröffentlicht: (2024)