Arena-Lite: Efficient and Reliable Large Language Model Evaluation via Tournament-Based Direct Comparisons
Fuente:
arXiv
Saved in:
| Main Authors: | Son, Seonil, Oh, Ju-Min, Jin, Heegon, Jang, Cheolhun, Jeong, Jeongbeom, Kim, Kuntae |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Align-to-Distill: Trainable Attention Alignment for Knowledge Distillation in Neural Machine Translation
by: Jin, Heegon, et al.
Published: (2024)
by: Jin, Heegon, et al.
Published: (2024)
Modulated Intervention Preference Optimization (MIPO): Keep the Easy, Refine the Difficult
by: Jang, Cheolhun
Published: (2024)
by: Jang, Cheolhun
Published: (2024)
How Much Heavy Lifting Can an Agent Harness Do?: Measuring the LLM's Residual Role in a Planning Agent
by: Jung, Sungwoo, et al.
Published: (2026)
by: Jung, Sungwoo, et al.
Published: (2026)
Detecting AI-Generated Images via Contextual Anomaly Estimation in Masked AutoEncoders
by: Jang, Minsuk, et al.
Published: (2025)
by: Jang, Minsuk, et al.
Published: (2025)
HumorRank: A Tournament-Based Leaderboard for Evaluating Humor Generation in Large Language Models
by: Ajayi, Edward, et al.
Published: (2026)
by: Ajayi, Edward, et al.
Published: (2026)
Multi‐Level Optical Physical Unclonable Function Based on Random Surface Scattering for Hierarchical Cryptographic Protocols
by: Jeong Jin Kim, et al.
Published: (2025)
by: Jeong Jin Kim, et al.
Published: (2025)
ArenaRL: Scaling RL for Open-Ended Agents via Tournament-based Relative Ranking
by: Zhang, Qiang, et al.
Published: (2026)
by: Zhang, Qiang, et al.
Published: (2026)
Immersions of Directed Graphs in Tournaments
by: António Girão, et al.
Published: (2024)
by: António Girão, et al.
Published: (2024)
Towards Direct Evaluation of Harness Optimizers via Priority Ranking
by: Ong, Kai Tzu-iunn, et al.
Published: (2026)
by: Ong, Kai Tzu-iunn, et al.
Published: (2026)
ALFRED: Ask a Large-language model For Reliable ECG Diagnosis
by: Yu, Jin, et al.
Published: (2025)
by: Yu, Jin, et al.
Published: (2025)
Systemic Thrombolytic Resistance in Antithrombin III Deficiency Rescued by Catheter‐Directed Thrombolysis: A Case Report
by: Byeng‐Ju Son, et al.
Published: (2026)
by: Byeng‐Ju Son, et al.
Published: (2026)
LiteGPT: Large Vision-Language Model for Joint Chest X-ray Localization and Classification Task
by: Le-Duc, Khai, et al.
Published: (2024)
by: Le-Duc, Khai, et al.
Published: (2024)
Tournament Auctions
by: Anderlini, Luca, et al.
Published: (2024)
by: Anderlini, Luca, et al.
Published: (2024)
RDMM: Fine-Tuned LLM Models for On-Device Robotic Decision Making with Enhanced Contextual Awareness in Specific Domains
by: Nasrat, Shady, et al.
Published: (2025)
by: Nasrat, Shady, et al.
Published: (2025)
A Multi-Agent Pokemon Tournament for Evaluating Strategic Reasoning of Large Language Models
by: Yashwanth, Tadisetty Sai, et al.
Published: (2025)
by: Yashwanth, Tadisetty Sai, et al.
Published: (2025)
FastAV: Efficient Token Pruning for Audio-Visual Large Language Model Inference
by: Jung, Chaeyoung, et al.
Published: (2026)
by: Jung, Chaeyoung, et al.
Published: (2026)
Perovskite Quantum Dot‐Enhanced Silicon Photodetectors for High‐Performance Infrared Sensing
by: Dohun Baek, et al.
Published: (2025)
by: Dohun Baek, et al.
Published: (2025)
SAGEO Arena: A Realistic Environment for Evaluating Search-Augmented Generative Engine Optimization
by: Kim, Sunghwan, et al.
Published: (2026)
by: Kim, Sunghwan, et al.
Published: (2026)
Highly Reliable and Ultra‐Flexible Wearable OLEDs Enabled by Environmentally and Mechanically Robust Hybrid Multibarrier Encapsulation Layers
by: Sun‐Woo Lee, et al.
Published: (2024)
by: Sun‐Woo Lee, et al.
Published: (2024)
Social Bias Benchmark for Generation: A Comparison of Generation and QA-Based Evaluations
by: Jin, Jiho, et al.
Published: (2025)
by: Jin, Jiho, et al.
Published: (2025)
Directing Ultramicropore Architecture in Carbon Molecular Sieve Membranes with Lanthanum for High‐Fidelity Gas Separation
by: Hyeokjun Seo, et al.
Published: (2026)
by: Hyeokjun Seo, et al.
Published: (2026)
MUG-Eval: A Proxy Evaluation Framework for Multilingual Generation Capabilities in Any Language
by: Song, Seyoung, et al.
Published: (2025)
by: Song, Seyoung, et al.
Published: (2025)
Transurethral Fulguration of Hunner Lesion Was Effective for Primary Management of Pelvic Pain in Patients With Interstitial Cystitis: A Long‐Term Follow‐Up Study
by: Hyun Ju Jeong, et al.
Published: (2025)
by: Hyun Ju Jeong, et al.
Published: (2025)
Constructing a Portfolio Optimization Benchmark Framework for Evaluating Large Language Models
by: Cho, Hanyong, et al.
Published: (2026)
by: Cho, Hanyong, et al.
Published: (2026)
ScaleDiff: Higher-Resolution Image Synthesis via Efficient and Model-Agnostic Diffusion
by: Koh, Sungho, et al.
Published: (2025)
by: Koh, Sungho, et al.
Published: (2025)
Conjugated Polymer‐Driven Compact Crystal Packing and Efficient Charge Transport in Perovskite Quantum Dot Solar Cells
by: Tae Oh Yoon, et al.
Published: (2025)
by: Tae Oh Yoon, et al.
Published: (2025)
d ‐Pinitol Rescues Osteoblast Differentiation From Tumor Necrosis Factor‐Alpha‐Mediated Suppression via β‐Galactoside α‐2,6‐Sialyltransferase 1 Induction
by: Kyeong‐Min Kim, et al.
Published: (2026)
by: Kyeong‐Min Kim, et al.
Published: (2026)
BAPO: Base-Anchored Preference Optimization for Overcoming Forgetting in Large Language Models Personalization
by: Lee, Gihun, et al.
Published: (2024)
by: Lee, Gihun, et al.
Published: (2024)
Characterizing Large Clique Number in Tournaments
by: Crew, Logan, et al.
Published: (2026)
by: Crew, Logan, et al.
Published: (2026)
Tournament Robustness via Redundancy
by: Efremenko, Klim, et al.
Published: (2025)
by: Efremenko, Klim, et al.
Published: (2025)
GraphArena: Evaluating and Exploring Large Language Models on Graph Computation
by: Tang, Jianheng, et al.
Published: (2024)
by: Tang, Jianheng, et al.
Published: (2024)
Conjugated Polymer‐Driven Compact Crystal Packing and Efficient Charge Transport in Perovskite Quantum Dot Solar Cells (Small 39/2025)
by: Tae Oh Yoon, et al.
Published: (2025)
by: Tae Oh Yoon, et al.
Published: (2025)
K-Sort Arena: Efficient and Reliable Benchmarking for Generative Models via K-wise Human Preferences
by: Li, Zhikai, et al.
Published: (2024)
by: Li, Zhikai, et al.
Published: (2024)
Multi-Task Inference: Can Large Language Models Follow Multiple Instructions at Once?
by: Son, Guijin, et al.
Published: (2024)
by: Son, Guijin, et al.
Published: (2024)
CATArena: Evaluating Evolutionary Capabilities of Code Agents via Iterative Tournaments
by: Fu, Lingyue, et al.
Published: (2025)
by: Fu, Lingyue, et al.
Published: (2025)
Evaluating Large Language Models for Fair and Reliable Organ Allocation
by: Kim, Brian Hyeongseok, et al.
Published: (2025)
by: Kim, Brian Hyeongseok, et al.
Published: (2025)
CANVAS: A Benchmark for Vision-Language Models on Tool-Based User Interface Design
by: Jeong, Daeheon, et al.
Published: (2025)
by: Jeong, Daeheon, et al.
Published: (2025)
Efficient and Effective Vocabulary Expansion Towards Multilingual Large Language Models
by: Kim, Seungduk, et al.
Published: (2024)
by: Kim, Seungduk, et al.
Published: (2024)
AVCD: Mitigating Hallucinations in Audio-Visual Large Language Models through Contrastive Decoding
by: Jung, Chaeyoung, et al.
Published: (2025)
by: Jung, Chaeyoung, et al.
Published: (2025)
Economics Arena for Large Language Models
by: Guo, Shangmin, et al.
Published: (2024)
by: Guo, Shangmin, et al.
Published: (2024)
Similar Items
-
Align-to-Distill: Trainable Attention Alignment for Knowledge Distillation in Neural Machine Translation
by: Jin, Heegon, et al.
Published: (2024) -
Modulated Intervention Preference Optimization (MIPO): Keep the Easy, Refine the Difficult
by: Jang, Cheolhun
Published: (2024) -
How Much Heavy Lifting Can an Agent Harness Do?: Measuring the LLM's Residual Role in a Planning Agent
by: Jung, Sungwoo, et al.
Published: (2026) -
Detecting AI-Generated Images via Contextual Anomaly Estimation in Masked AutoEncoders
by: Jang, Minsuk, et al.
Published: (2025) -
HumorRank: A Tournament-Based Leaderboard for Evaluating Humor Generation in Large Language Models
by: Ajayi, Edward, et al.
Published: (2026)