ArenaBencher: Automatic Benchmark Evolution via Multi-Model Competitive Evaluation
Fuente:
arXiv
Guardado en:
| Autores principales: | Liu, Qin, Dineen, Jacob, Huang, Yuxi, Zhang, Sheng, Poon, Hoifung, Zhou, Ben, Chen, Muhao |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
UniversalNER: Targeted Distillation from Large Language Models for Open Named Entity Recognition
por: Zhou, Wenxuan, et al.
Publicado: (2023)
por: Zhou, Wenxuan, et al.
Publicado: (2023)
Be My Eyes: Extending Large Language Models to New Modalities Through Multi-Agent Collaboration
por: Huang, James Y., et al.
Publicado: (2025)
por: Huang, James Y., et al.
Publicado: (2025)
From Introspection to Best Practices: Principled Analysis of Demonstrations in Multimodal In-Context Learning
por: Xu, Nan, et al.
Publicado: (2024)
por: Xu, Nan, et al.
Publicado: (2024)
Offset Unlearning for Large Language Models
por: Huang, James Y., et al.
Publicado: (2024)
por: Huang, James Y., et al.
Publicado: (2024)
Semantic-Clipping: Efficient Vision-Language Modeling with Semantic-Guidedd Visual Selection
por: Li, Bangzheng, et al.
Publicado: (2025)
por: Li, Bangzheng, et al.
Publicado: (2025)
MetaScale: Test-Time Scaling with Evolving Meta-Thoughts
por: Liu, Qin, et al.
Publicado: (2025)
por: Liu, Qin, et al.
Publicado: (2025)
OmniStruct: Universal Text-to-Structure Generation across Diverse Schemas
por: Huang, James Y., et al.
Publicado: (2025)
por: Huang, James Y., et al.
Publicado: (2025)
mDPO: Conditional Preference Optimization for Multimodal Large Language Models
por: Wang, Fei, et al.
Publicado: (2024)
por: Wang, Fei, et al.
Publicado: (2024)
AutoBencher: Towards Declarative Benchmark Construction
por: Li, Xiang Lisa, et al.
Publicado: (2024)
por: Li, Xiang Lisa, et al.
Publicado: (2024)
Med-RLVR: Emerging Medical Reasoning from a 3B base model via reinforcement Learning
por: Zhang, Sheng, et al.
Publicado: (2025)
por: Zhang, Sheng, et al.
Publicado: (2025)
Vocabulary Dropout for Curriculum Diversity in LLM Co-Evolution
por: Dineen, Jacob, et al.
Publicado: (2026)
por: Dineen, Jacob, et al.
Publicado: (2026)
Exploring Scaling Laws for EHR Foundation Models
por: Zhang, Sheng, et al.
Publicado: (2025)
por: Zhang, Sheng, et al.
Publicado: (2025)
QA-LIGN: Aligning LLMs through Constitutionally Decomposed QA
por: Dineen, Jacob, et al.
Publicado: (2025)
por: Dineen, Jacob, et al.
Publicado: (2025)
DocLens: Multi-aspect Fine-grained Evaluation for Medical Text Generation
por: Xie, Yiqing, et al.
Publicado: (2023)
por: Xie, Yiqing, et al.
Publicado: (2023)
Evaluating Medical LLMs by Levels of Autonomy: A Survey Moving from Benchmarks to Applications
por: Ye, Xiao, et al.
Publicado: (2025)
por: Ye, Xiao, et al.
Publicado: (2025)
Two Heads are Better than One: Nested PoE for Robust Defense Against Multi-Backdoors
por: Graf, Victoria, et al.
Publicado: (2024)
por: Graf, Victoria, et al.
Publicado: (2024)
Pareto Optimal Learning for Estimating Large Language Model Errors
por: Zhao, Theodore, et al.
Publicado: (2023)
por: Zhao, Theodore, et al.
Publicado: (2023)
BOW: Reinforcement Learning for Bottlenecked Next Word Prediction
por: Shen, Ming, et al.
Publicado: (2025)
por: Shen, Ming, et al.
Publicado: (2025)
Decentralized Arena: Towards Democratic and Scalable Automatic Evaluation of Language Models
por: Yin, Yanbin, et al.
Publicado: (2025)
por: Yin, Yanbin, et al.
Publicado: (2025)
Familiarity-Aware Evidence Compression for Retrieval-Augmented Generation
por: Jung, Dongwon, et al.
Publicado: (2024)
por: Jung, Dongwon, et al.
Publicado: (2024)
T-Rex: Text-assisted Retrosynthesis Prediction
por: Liu, Yifeng, et al.
Publicado: (2024)
por: Liu, Yifeng, et al.
Publicado: (2024)
MuirBench: A Comprehensive Benchmark for Robust Multi-image Understanding
por: Wang, Fei, et al.
Publicado: (2024)
por: Wang, Fei, et al.
Publicado: (2024)
Securing Multi-turn Conversational Language Models From Distributed Backdoor Triggers
por: Tong, Terry, et al.
Publicado: (2024)
por: Tong, Terry, et al.
Publicado: (2024)
SwingArena: Competitive Programming Arena for Long-context GitHub Issue Solving
por: Xu, Wendong, et al.
Publicado: (2025)
por: Xu, Wendong, et al.
Publicado: (2025)
MathArena: Evaluating LLMs on Uncontaminated Math Competitions
por: Balunović, Mislav, et al.
Publicado: (2025)
por: Balunović, Mislav, et al.
Publicado: (2025)
Attribute Structuring Improves LLM-Based Evaluation of Clinical Text Summaries
por: Gero, Zelalem, et al.
Publicado: (2024)
por: Gero, Zelalem, et al.
Publicado: (2024)
MTalk-Bench: Evaluating Speech-to-Speech Models in Multi-Turn Dialogues via Arena-style and Rubrics Protocols
por: Du, Yuhao, et al.
Publicado: (2025)
por: Du, Yuhao, et al.
Publicado: (2025)
DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models
por: Zhu, Yakun, et al.
Publicado: (2025)
por: Zhu, Yakun, et al.
Publicado: (2025)
OlympicArena: Benchmarking Multi-discipline Cognitive Reasoning for Superintelligent AI
por: Huang, Zhen, et al.
Publicado: (2024)
por: Huang, Zhen, et al.
Publicado: (2024)
Taming Extreme Tokens: Covariance-Aware GRPO with Gaussian-Kernel Advantage Reweighting
por: Wang, Cheng, et al.
Publicado: (2026)
por: Wang, Cheng, et al.
Publicado: (2026)
OdysseyArena: Benchmarking Large Language Models For Long-Horizon, Active and Inductive Interactions
por: Xu, Fangzhi, et al.
Publicado: (2026)
por: Xu, Fangzhi, et al.
Publicado: (2026)
Video Models Can Reason with Verifiable Rewards
por: Zhu, Tinghui, et al.
Publicado: (2026)
por: Zhu, Tinghui, et al.
Publicado: (2026)
RECAP: Transparent Inference-Time Emotion Alignment for Medical Dialogue Systems
por: Srinivasan, Adarsh, et al.
Publicado: (2025)
por: Srinivasan, Adarsh, et al.
Publicado: (2025)
MIRAGE-Bench: Automatic Multilingual Benchmark Arena for Retrieval-Augmented Generation Systems
por: Thakur, Nandan, et al.
Publicado: (2024)
por: Thakur, Nandan, et al.
Publicado: (2024)
ToW: Thoughts of Words Improve Reasoning in Large Language Models
por: Xu, Zhikun, et al.
Publicado: (2024)
por: Xu, Zhikun, et al.
Publicado: (2024)
False Sense of Security: Why Probing-based Malicious Input Detection Fails to Generalize
por: Wang, Cheng, et al.
Publicado: (2025)
por: Wang, Cheng, et al.
Publicado: (2025)
Beyond Benchmarks: MathArena as an Evaluation Platform for Mathematics with LLMs
por: Dekoninck, Jasper, et al.
Publicado: (2026)
por: Dekoninck, Jasper, et al.
Publicado: (2026)
Benchmarking LLM-as-a-Judge for Long-Form Output Evaluation
por: Chen, Junjie, et al.
Publicado: (2026)
por: Chen, Junjie, et al.
Publicado: (2026)
SudoLM: Learning Access Control of Parametric Knowledge with Authorization Alignment
por: Liu, Qin, et al.
Publicado: (2024)
por: Liu, Qin, et al.
Publicado: (2024)
Bencher: Simple and Reproducible Benchmarking for Black-Box Optimization
por: Papenmeier, Leonard, et al.
Publicado: (2025)
por: Papenmeier, Leonard, et al.
Publicado: (2025)
Ejemplares similares
-
UniversalNER: Targeted Distillation from Large Language Models for Open Named Entity Recognition
por: Zhou, Wenxuan, et al.
Publicado: (2023) -
Be My Eyes: Extending Large Language Models to New Modalities Through Multi-Agent Collaboration
por: Huang, James Y., et al.
Publicado: (2025) -
From Introspection to Best Practices: Principled Analysis of Demonstrations in Multimodal In-Context Learning
por: Xu, Nan, et al.
Publicado: (2024) -
Offset Unlearning for Large Language Models
por: Huang, James Y., et al.
Publicado: (2024) -
Semantic-Clipping: Efficient Vision-Language Modeling with Semantic-Guidedd Visual Selection
por: Li, Bangzheng, et al.
Publicado: (2025)