P-MMEval: A Parallel Multilingual Multitask Benchmark for Consistent Evaluation of LLMs
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Yidan, Wan, Yu, Deng, Boyi, Yang, Baosong, Wei, Haoran, Huang, Fei, Yu, Bowen, Lin, Junyang, Zhou, Jingren |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
SASFT: Sparse Autoencoder-guided Supervised Finetuning to Mitigate Unexpected Code-Switching in LLMs
por: Deng, Boyi, et al.
Publicado: (2025)
por: Deng, Boyi, et al.
Publicado: (2025)
Unveiling Language-Specific Features in Large Language Models via Sparse Autoencoders
por: Deng, Boyi, et al.
Publicado: (2025)
por: Deng, Boyi, et al.
Publicado: (2025)
PolyMath: Evaluating Mathematical Reasoning in Multilingual Contexts
por: Wang, Yiming, et al.
Publicado: (2025)
por: Wang, Yiming, et al.
Publicado: (2025)
RMTBench: Benchmarking LLMs Through Multi-Turn User-Centric Role-Playing
por: Xiang, Hao, et al.
Publicado: (2025)
por: Xiang, Hao, et al.
Publicado: (2025)
Towards Cross-lingual Values Judgment: A Consensus-Pluralism Perspective
por: Chen, Yukun, et al.
Publicado: (2026)
por: Chen, Yukun, et al.
Publicado: (2026)
PART: Progressive Alignment Representation Training for Multilingual Speech-To-Text with LLMs
por: Zhang, Pei, et al.
Publicado: (2025)
por: Zhang, Pei, et al.
Publicado: (2025)
MMEvalPro: Calibrating Multimodal Benchmarks Towards Trustworthy and Efficient Evaluation
por: Huang, Jinsheng, et al.
Publicado: (2024)
por: Huang, Jinsheng, et al.
Publicado: (2024)
The CLEF-2026 FinMMEval Lab: Multilingual and Multimodal Evaluation of Financial AI Systems
por: Xie, Zhuohan, et al.
Publicado: (2026)
por: Xie, Zhuohan, et al.
Publicado: (2026)
Qwen-Scope: Turning Sparse Features into Development Tools for Large Language Models
por: Deng, Boyi, et al.
Publicado: (2026)
por: Deng, Boyi, et al.
Publicado: (2026)
Qwen3 Embedding: Advancing Text Embedding and Reranking Through Foundation Models
por: Zhang, Yanzhao, et al.
Publicado: (2025)
por: Zhang, Yanzhao, et al.
Publicado: (2025)
CodeScope: An Execution-based Multilingual Multitask Multidimensional Benchmark for Evaluating LLMs on Code Understanding and Generation
por: Yan, Weixiang, et al.
Publicado: (2023)
por: Yan, Weixiang, et al.
Publicado: (2023)
Enhancing LLM Language Adaption through Cross-lingual In-Context Pre-training
por: Wu, Linjuan, et al.
Publicado: (2025)
por: Wu, Linjuan, et al.
Publicado: (2025)
Predicting Rewards Alongside Tokens: Non-disruptive Parameter Insertion for Efficient Inference Intervention in Large Language Model
por: Yuan, Chenhan, et al.
Publicado: (2024)
por: Yuan, Chenhan, et al.
Publicado: (2024)
AutoLogi: Automated Generation of Logic Puzzles for Evaluating Reasoning Abilities of Large Language Models
por: Zhu, Qin, et al.
Publicado: (2025)
por: Zhu, Qin, et al.
Publicado: (2025)
LongWeave: A Long-Form Generation Benchmark Bridging Real-World Relevance and Verifiability
por: Xiao, Zikai, et al.
Publicado: (2025)
por: Xiao, Zikai, et al.
Publicado: (2025)
CultureSynth: A Hierarchical Taxonomy-Guided and Retrieval-Augmented Framework for Cultural Question-Answer Synthesis
por: Zhang, Xinyu, et al.
Publicado: (2025)
por: Zhang, Xinyu, et al.
Publicado: (2025)
CreoleVal: Multilingual Multitask Benchmarks for Creoles
por: Lent, Heather, et al.
Publicado: (2023)
por: Lent, Heather, et al.
Publicado: (2023)
Language Confusion Gate: Language-Aware Decoding Through Model Self-Distillation
por: Zhang, Collin, et al.
Publicado: (2025)
por: Zhang, Collin, et al.
Publicado: (2025)
AI Hospital: Benchmarking Large Language Models in a Multi-agent Medical Interaction Simulator
por: Fan, Zhihao, et al.
Publicado: (2024)
por: Fan, Zhihao, et al.
Publicado: (2024)
M$^{3}$D: A Multimodal, Multilingual and Multitask Dataset for Grounded Document-level Information Extraction
por: Liu, Jiang, et al.
Publicado: (2024)
por: Liu, Jiang, et al.
Publicado: (2024)
Consistency Matters: Explore LLMs Consistency From a Black-Box Perspective
por: Zhao, Fufangchen, et al.
Publicado: (2024)
por: Zhao, Fufangchen, et al.
Publicado: (2024)
Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free
por: Qiu, Zihan, et al.
Publicado: (2025)
por: Qiu, Zihan, et al.
Publicado: (2025)
A Data-Efficient Path to Multilingual LLMs: Language Expansion via Post-training PARAM$Δ$ Integration into Upcycled MoE
por: Zhou, Hao, et al.
Publicado: (2026)
por: Zhou, Hao, et al.
Publicado: (2026)
Stabilizing Reinforcement Learning with LLMs: Formulation and Practices
por: Zheng, Chujie, et al.
Publicado: (2025)
por: Zheng, Chujie, et al.
Publicado: (2025)
Extend Model Merging from Fine-Tuned to Pre-Trained Large Language Models via Weight Disentanglement
por: Yu, Le, et al.
Publicado: (2024)
por: Yu, Le, et al.
Publicado: (2024)
Large Language Models are Superpositions of All Characters: Attaining Arbitrary Role-play via Self-Alignment
por: Lu, Keming, et al.
Publicado: (2024)
por: Lu, Keming, et al.
Publicado: (2024)
MMAFFBen: A Multilingual and Multimodal Affective Analysis Benchmark for Evaluating LLMs and VLMs
por: Liu, Zhiwei, et al.
Publicado: (2025)
por: Liu, Zhiwei, et al.
Publicado: (2025)
Multilingual Synopses of Movie Narratives: A Dataset for Vision-Language Story Understanding
por: Sun, Yidan, et al.
Publicado: (2024)
por: Sun, Yidan, et al.
Publicado: (2024)
CVLUE: A New Benchmark Dataset for Chinese Vision-Language Understanding Evaluation
por: Wang, Yuxuan, et al.
Publicado: (2024)
por: Wang, Yuxuan, et al.
Publicado: (2024)
Self-Steering Optimization: Autonomous Preference Optimization for Large Language Models
por: Xiang, Hao, et al.
Publicado: (2024)
por: Xiang, Hao, et al.
Publicado: (2024)
Language Models are Super Mario: Absorbing Abilities from Homologous Models as a Free Lunch
por: Yu, Le, et al.
Publicado: (2023)
por: Yu, Le, et al.
Publicado: (2023)
ProcessBench: Identifying Process Errors in Mathematical Reasoning
por: Zheng, Chujie, et al.
Publicado: (2024)
por: Zheng, Chujie, et al.
Publicado: (2024)
The Lessons of Developing Process Reward Models in Mathematical Reasoning
por: Zhang, Zhenru, et al.
Publicado: (2025)
por: Zhang, Zhenru, et al.
Publicado: (2025)
Language Models can Self-Lengthen to Generate Long Texts
por: Quan, Shanghaoran, et al.
Publicado: (2024)
por: Quan, Shanghaoran, et al.
Publicado: (2024)
Online Merging Optimizers for Boosting Rewards and Mitigating Tax in Alignment
por: Lu, Keming, et al.
Publicado: (2024)
por: Lu, Keming, et al.
Publicado: (2024)
LoraxBench: A Multitask, Multilingual Benchmark Suite for 20 Indonesian Languages
por: Aji, Alham Fikri, et al.
Publicado: (2025)
por: Aji, Alham Fikri, et al.
Publicado: (2025)
BenchMAX: A Comprehensive Multilingual Evaluation Suite for Large Language Models
por: Huang, Xu, et al.
Publicado: (2025)
por: Huang, Xu, et al.
Publicado: (2025)
RealCritic: Towards Effectiveness-Driven Evaluation of Language Model Critiques
por: Tang, Zhengyang, et al.
Publicado: (2025)
por: Tang, Zhengyang, et al.
Publicado: (2025)
WorldPM: Scaling Human Preference Modeling
por: Wang, Binghai, et al.
Publicado: (2025)
por: Wang, Binghai, et al.
Publicado: (2025)
Multilingual Non-Autoregressive Machine Translation without Knowledge Distillation
por: Huang, Chenyang, et al.
Publicado: (2025)
por: Huang, Chenyang, et al.
Publicado: (2025)
Ejemplares similares
-
SASFT: Sparse Autoencoder-guided Supervised Finetuning to Mitigate Unexpected Code-Switching in LLMs
por: Deng, Boyi, et al.
Publicado: (2025) -
Unveiling Language-Specific Features in Large Language Models via Sparse Autoencoders
por: Deng, Boyi, et al.
Publicado: (2025) -
PolyMath: Evaluating Mathematical Reasoning in Multilingual Contexts
por: Wang, Yiming, et al.
Publicado: (2025) -
RMTBench: Benchmarking LLMs Through Multi-Turn User-Centric Role-Playing
por: Xiang, Hao, et al.
Publicado: (2025) -
Towards Cross-lingual Values Judgment: A Consensus-Pluralism Perspective
por: Chen, Yukun, et al.
Publicado: (2026)