ProBench: Benchmarking Large Language Models in Competitive Programming
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Yang, Lei, Jin, Renren, Shi, Ling, Peng, Jianxiang, Chen, Yue, Xiong, Deyi |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
FineMath: A Fine-Grained Mathematical Evaluation Benchmark for Chinese Large Language Models
von: Liu, Yan, et al.
Veröffentlicht: (2024)
von: Liu, Yan, et al.
Veröffentlicht: (2024)
LHMKE: A Large-scale Holistic Multi-subject Knowledge Evaluation Benchmark for Chinese Large Language Models
von: Liu, Chuang, et al.
Veröffentlicht: (2024)
von: Liu, Chuang, et al.
Veröffentlicht: (2024)
SOUP: Token-level Single-sample Mix-policy Reinforcement Learning for Large Language Models
von: Yang, Lei, et al.
Veröffentlicht: (2026)
von: Yang, Lei, et al.
Veröffentlicht: (2026)
Do Large Language Models Mirror Cognitive Language Processing?
von: Ren, Yuqi, et al.
Veröffentlicht: (2024)
von: Ren, Yuqi, et al.
Veröffentlicht: (2024)
CRiskEval: A Chinese Multi-Level Risk Evaluation Benchmark Dataset for Large Language Models
von: Shi, Ling, et al.
Veröffentlicht: (2024)
von: Shi, Ling, et al.
Veröffentlicht: (2024)
From Curated Data to Scalable Models: Continual Pre-training of Dense and MoE Large Language Models for Tibetan
von: Yang, Lei, et al.
Veröffentlicht: (2025)
von: Yang, Lei, et al.
Veröffentlicht: (2025)
Why Does Reinforcement Learning Generalize? A Feature-Level Mechanistic Study of Post-Training in Large Language Models
von: Shi, Dan, et al.
Veröffentlicht: (2026)
von: Shi, Dan, et al.
Veröffentlicht: (2026)
FuxiTranyu: A Multilingual Large Language Model Trained with Balanced Data
von: Sun, Haoran, et al.
Veröffentlicht: (2024)
von: Sun, Haoran, et al.
Veröffentlicht: (2024)
A Comprehensive Evaluation of Quantization Strategies for Large Language Models
von: Jin, Renren, et al.
Veröffentlicht: (2024)
von: Jin, Renren, et al.
Veröffentlicht: (2024)
DCIS: Efficient Length Extrapolation of LLMs via Divide-and-Conquer Scaling Factor Search
von: Yang, Lei, et al.
Veröffentlicht: (2024)
von: Yang, Lei, et al.
Veröffentlicht: (2024)
ConTrans: Weak-to-Strong Alignment Engineering via Concept Transplantation
von: Dong, Weilong, et al.
Veröffentlicht: (2024)
von: Dong, Weilong, et al.
Veröffentlicht: (2024)
Multilingual Large Language Models: A Systematic Survey
von: Zhu, Shaolin, et al.
Veröffentlicht: (2024)
von: Zhu, Shaolin, et al.
Veröffentlicht: (2024)
Large Language Model Safety: A Holistic Survey
von: Shi, Dan, et al.
Veröffentlicht: (2024)
von: Shi, Dan, et al.
Veröffentlicht: (2024)
DEP: A Decentralized Large Language Model Evaluation Protocol
von: Peng, Jianxiang, et al.
Veröffentlicht: (2026)
von: Peng, Jianxiang, et al.
Veröffentlicht: (2026)
ProBench: Benchmarking GUI Agents with Accurate Process Information
von: Yang, Leyang, et al.
Veröffentlicht: (2025)
von: Yang, Leyang, et al.
Veröffentlicht: (2025)
IRCAN: Mitigating Knowledge Conflicts in LLM Generation via Identifying and Reweighting Context-Aware Neurons
von: Shi, Dan, et al.
Veröffentlicht: (2024)
von: Shi, Dan, et al.
Veröffentlicht: (2024)
C$^{3}$Bench: A Comprehensive Classical Chinese Understanding Benchmark for Large Language Models
von: Cao, Jiahuan, et al.
Veröffentlicht: (2024)
von: Cao, Jiahuan, et al.
Veröffentlicht: (2024)
RoleEval: A Bilingual Role Evaluation Benchmark for Large Language Models
von: Shen, Tianhao, et al.
Veröffentlicht: (2023)
von: Shen, Tianhao, et al.
Veröffentlicht: (2023)
ProBench: Judging Multimodal Foundation Models on Open-ended Multi-domain Expert Tasks
von: Yang, Yan, et al.
Veröffentlicht: (2025)
von: Yang, Yan, et al.
Veröffentlicht: (2025)
Data Mixing for Large Language Models Pretraining: A Survey and Outlook
von: Chen, Zhuo, et al.
Veröffentlicht: (2026)
von: Chen, Zhuo, et al.
Veröffentlicht: (2026)
LFED: A Literary Fiction Evaluation Dataset for Large Language Models
von: Yu, Linhao, et al.
Veröffentlicht: (2024)
von: Yu, Linhao, et al.
Veröffentlicht: (2024)
Revisiting Entropy in Reinforcement Learning for Large Reasoning Models
von: Jin, Renren, et al.
Veröffentlicht: (2025)
von: Jin, Renren, et al.
Veröffentlicht: (2025)
Joint Training And Decoding for Multilingual End-to-End Simultaneous Speech Translation
von: Huang, Wuwei, et al.
Veröffentlicht: (2025)
von: Huang, Wuwei, et al.
Veröffentlicht: (2025)
OpenEval: Benchmarking Chinese LLMs across Capability, Alignment and Safety
von: Liu, Chuang, et al.
Veröffentlicht: (2024)
von: Liu, Chuang, et al.
Veröffentlicht: (2024)
Self-Pluralising Culture Alignment for Large Language Models
von: Xu, Shaoyang, et al.
Veröffentlicht: (2024)
von: Xu, Shaoyang, et al.
Veröffentlicht: (2024)
CharacterBench: Benchmarking Character Customization of Large Language Models
von: Zhou, Jinfeng, et al.
Veröffentlicht: (2024)
von: Zhou, Jinfeng, et al.
Veröffentlicht: (2024)
Star-Agents: Automatic Data Optimization with LLM Agents for Instruction Tuning
von: Zhou, Hang, et al.
Veröffentlicht: (2024)
von: Zhou, Hang, et al.
Veröffentlicht: (2024)
Efficiently Exploring Large Language Models for Document-Level Machine Translation with In-context Learning
von: Cui, Menglong, et al.
Veröffentlicht: (2024)
von: Cui, Menglong, et al.
Veröffentlicht: (2024)
Evaluating Discourse Cohesion in Pre-trained Language Models
von: He, Jie, et al.
Veröffentlicht: (2025)
von: He, Jie, et al.
Veröffentlicht: (2025)
OJBench: A Competition Level Code Benchmark For Large Language Models
von: Wang, Zhexu, et al.
Veröffentlicht: (2025)
von: Wang, Zhexu, et al.
Veröffentlicht: (2025)
MiniLongBench: The Low-cost Long Context Understanding Benchmark for Large Language Models
von: Huang, Zhongzhan, et al.
Veröffentlicht: (2025)
von: Huang, Zhongzhan, et al.
Veröffentlicht: (2025)
StableToolBench: Towards Stable Large-Scale Benchmarking on Tool Learning of Large Language Models
von: Guo, Zhicheng, et al.
Veröffentlicht: (2024)
von: Guo, Zhicheng, et al.
Veröffentlicht: (2024)
Evaluating and Improving Graph to Text Generation with Large Language Models
von: He, Jie, et al.
Veröffentlicht: (2025)
von: He, Jie, et al.
Veröffentlicht: (2025)
A Local Perturbation Theory for Cross-Domain Interference and Recovery in Multi-Domain RL
von: Yang, Lei, et al.
Veröffentlicht: (2026)
von: Yang, Lei, et al.
Veröffentlicht: (2026)
FuxiMT: Sparsifying Large Language Models for Chinese-Centric Multilingual Machine Translation
von: Zhu, Shaolin, et al.
Veröffentlicht: (2025)
von: Zhu, Shaolin, et al.
Veröffentlicht: (2025)
Exploring Multilingual Concepts of Human Value in Large Language Models: Is Value Alignment Consistent, Transferable and Controllable across Languages?
von: Xu, Shaoyang, et al.
Veröffentlicht: (2024)
von: Xu, Shaoyang, et al.
Veröffentlicht: (2024)
EquiBench: Benchmarking Large Language Models' Reasoning about Program Semantics via Equivalence Checking
von: Wei, Anjiang, et al.
Veröffentlicht: (2025)
von: Wei, Anjiang, et al.
Veröffentlicht: (2025)
LLM-ProS: Analyzing Large Language Models' Performance in Competitive Problem Solving
von: Hossain, Md Sifat, et al.
Veröffentlicht: (2025)
von: Hossain, Md Sifat, et al.
Veröffentlicht: (2025)
FormosanBench: Benchmarking Low-Resource Austronesian Languages in the Era of Large Language Models
von: Lin, Kaiying Kevin, et al.
Veröffentlicht: (2025)
von: Lin, Kaiying Kevin, et al.
Veröffentlicht: (2025)
MMLU-ProX: A Multilingual Benchmark for Advanced Large Language Model Evaluation
von: Xuan, Weihao, et al.
Veröffentlicht: (2025)
von: Xuan, Weihao, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
FineMath: A Fine-Grained Mathematical Evaluation Benchmark for Chinese Large Language Models
von: Liu, Yan, et al.
Veröffentlicht: (2024) -
LHMKE: A Large-scale Holistic Multi-subject Knowledge Evaluation Benchmark for Chinese Large Language Models
von: Liu, Chuang, et al.
Veröffentlicht: (2024) -
SOUP: Token-level Single-sample Mix-policy Reinforcement Learning for Large Language Models
von: Yang, Lei, et al.
Veröffentlicht: (2026) -
Do Large Language Models Mirror Cognitive Language Processing?
von: Ren, Yuqi, et al.
Veröffentlicht: (2024) -
CRiskEval: A Chinese Multi-Level Risk Evaluation Benchmark Dataset for Large Language Models
von: Shi, Ling, et al.
Veröffentlicht: (2024)