Arena-Lite: Efficient and Reliable Large Language Model Evaluation via Tournament-Based Direct Comparisons
Fuente:
arXiv
Salvato in:
| Autori principali: | Son, Seonil, Oh, Ju-Min, Jin, Heegon, Jang, Cheolhun, Jeong, Jeongbeom, Kim, Kuntae |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Align-to-Distill: Trainable Attention Alignment for Knowledge Distillation in Neural Machine Translation
di: Jin, Heegon, et al.
Pubblicazione: (2024)
di: Jin, Heegon, et al.
Pubblicazione: (2024)
Modulated Intervention Preference Optimization (MIPO): Keep the Easy, Refine the Difficult
di: Jang, Cheolhun
Pubblicazione: (2024)
di: Jang, Cheolhun
Pubblicazione: (2024)
How Much Heavy Lifting Can an Agent Harness Do?: Measuring the LLM's Residual Role in a Planning Agent
di: Jung, Sungwoo, et al.
Pubblicazione: (2026)
di: Jung, Sungwoo, et al.
Pubblicazione: (2026)
Detecting AI-Generated Images via Contextual Anomaly Estimation in Masked AutoEncoders
di: Jang, Minsuk, et al.
Pubblicazione: (2025)
di: Jang, Minsuk, et al.
Pubblicazione: (2025)
HumorRank: A Tournament-Based Leaderboard for Evaluating Humor Generation in Large Language Models
di: Ajayi, Edward, et al.
Pubblicazione: (2026)
di: Ajayi, Edward, et al.
Pubblicazione: (2026)
Multi‐Level Optical Physical Unclonable Function Based on Random Surface Scattering for Hierarchical Cryptographic Protocols
di: Jeong Jin Kim, et al.
Pubblicazione: (2025)
di: Jeong Jin Kim, et al.
Pubblicazione: (2025)
ArenaRL: Scaling RL for Open-Ended Agents via Tournament-based Relative Ranking
di: Zhang, Qiang, et al.
Pubblicazione: (2026)
di: Zhang, Qiang, et al.
Pubblicazione: (2026)
Immersions of Directed Graphs in Tournaments
di: António Girão, et al.
Pubblicazione: (2024)
di: António Girão, et al.
Pubblicazione: (2024)
Towards Direct Evaluation of Harness Optimizers via Priority Ranking
di: Ong, Kai Tzu-iunn, et al.
Pubblicazione: (2026)
di: Ong, Kai Tzu-iunn, et al.
Pubblicazione: (2026)
ALFRED: Ask a Large-language model For Reliable ECG Diagnosis
di: Yu, Jin, et al.
Pubblicazione: (2025)
di: Yu, Jin, et al.
Pubblicazione: (2025)
Systemic Thrombolytic Resistance in Antithrombin III Deficiency Rescued by Catheter‐Directed Thrombolysis: A Case Report
di: Byeng‐Ju Son, et al.
Pubblicazione: (2026)
di: Byeng‐Ju Son, et al.
Pubblicazione: (2026)
LiteGPT: Large Vision-Language Model for Joint Chest X-ray Localization and Classification Task
di: Le-Duc, Khai, et al.
Pubblicazione: (2024)
di: Le-Duc, Khai, et al.
Pubblicazione: (2024)
Tournament Auctions
di: Anderlini, Luca, et al.
Pubblicazione: (2024)
di: Anderlini, Luca, et al.
Pubblicazione: (2024)
RDMM: Fine-Tuned LLM Models for On-Device Robotic Decision Making with Enhanced Contextual Awareness in Specific Domains
di: Nasrat, Shady, et al.
Pubblicazione: (2025)
di: Nasrat, Shady, et al.
Pubblicazione: (2025)
A Multi-Agent Pokemon Tournament for Evaluating Strategic Reasoning of Large Language Models
di: Yashwanth, Tadisetty Sai, et al.
Pubblicazione: (2025)
di: Yashwanth, Tadisetty Sai, et al.
Pubblicazione: (2025)
FastAV: Efficient Token Pruning for Audio-Visual Large Language Model Inference
di: Jung, Chaeyoung, et al.
Pubblicazione: (2026)
di: Jung, Chaeyoung, et al.
Pubblicazione: (2026)
Perovskite Quantum Dot‐Enhanced Silicon Photodetectors for High‐Performance Infrared Sensing
di: Dohun Baek, et al.
Pubblicazione: (2025)
di: Dohun Baek, et al.
Pubblicazione: (2025)
SAGEO Arena: A Realistic Environment for Evaluating Search-Augmented Generative Engine Optimization
di: Kim, Sunghwan, et al.
Pubblicazione: (2026)
di: Kim, Sunghwan, et al.
Pubblicazione: (2026)
Highly Reliable and Ultra‐Flexible Wearable OLEDs Enabled by Environmentally and Mechanically Robust Hybrid Multibarrier Encapsulation Layers
di: Sun‐Woo Lee, et al.
Pubblicazione: (2024)
di: Sun‐Woo Lee, et al.
Pubblicazione: (2024)
Social Bias Benchmark for Generation: A Comparison of Generation and QA-Based Evaluations
di: Jin, Jiho, et al.
Pubblicazione: (2025)
di: Jin, Jiho, et al.
Pubblicazione: (2025)
Directing Ultramicropore Architecture in Carbon Molecular Sieve Membranes with Lanthanum for High‐Fidelity Gas Separation
di: Hyeokjun Seo, et al.
Pubblicazione: (2026)
di: Hyeokjun Seo, et al.
Pubblicazione: (2026)
MUG-Eval: A Proxy Evaluation Framework for Multilingual Generation Capabilities in Any Language
di: Song, Seyoung, et al.
Pubblicazione: (2025)
di: Song, Seyoung, et al.
Pubblicazione: (2025)
Transurethral Fulguration of Hunner Lesion Was Effective for Primary Management of Pelvic Pain in Patients With Interstitial Cystitis: A Long‐Term Follow‐Up Study
di: Hyun Ju Jeong, et al.
Pubblicazione: (2025)
di: Hyun Ju Jeong, et al.
Pubblicazione: (2025)
Constructing a Portfolio Optimization Benchmark Framework for Evaluating Large Language Models
di: Cho, Hanyong, et al.
Pubblicazione: (2026)
di: Cho, Hanyong, et al.
Pubblicazione: (2026)
ScaleDiff: Higher-Resolution Image Synthesis via Efficient and Model-Agnostic Diffusion
di: Koh, Sungho, et al.
Pubblicazione: (2025)
di: Koh, Sungho, et al.
Pubblicazione: (2025)
Conjugated Polymer‐Driven Compact Crystal Packing and Efficient Charge Transport in Perovskite Quantum Dot Solar Cells
di: Tae Oh Yoon, et al.
Pubblicazione: (2025)
di: Tae Oh Yoon, et al.
Pubblicazione: (2025)
d ‐Pinitol Rescues Osteoblast Differentiation From Tumor Necrosis Factor‐Alpha‐Mediated Suppression via β‐Galactoside α‐2,6‐Sialyltransferase 1 Induction
di: Kyeong‐Min Kim, et al.
Pubblicazione: (2026)
di: Kyeong‐Min Kim, et al.
Pubblicazione: (2026)
BAPO: Base-Anchored Preference Optimization for Overcoming Forgetting in Large Language Models Personalization
di: Lee, Gihun, et al.
Pubblicazione: (2024)
di: Lee, Gihun, et al.
Pubblicazione: (2024)
Characterizing Large Clique Number in Tournaments
di: Crew, Logan, et al.
Pubblicazione: (2026)
di: Crew, Logan, et al.
Pubblicazione: (2026)
Tournament Robustness via Redundancy
di: Efremenko, Klim, et al.
Pubblicazione: (2025)
di: Efremenko, Klim, et al.
Pubblicazione: (2025)
GraphArena: Evaluating and Exploring Large Language Models on Graph Computation
di: Tang, Jianheng, et al.
Pubblicazione: (2024)
di: Tang, Jianheng, et al.
Pubblicazione: (2024)
Conjugated Polymer‐Driven Compact Crystal Packing and Efficient Charge Transport in Perovskite Quantum Dot Solar Cells (Small 39/2025)
di: Tae Oh Yoon, et al.
Pubblicazione: (2025)
di: Tae Oh Yoon, et al.
Pubblicazione: (2025)
K-Sort Arena: Efficient and Reliable Benchmarking for Generative Models via K-wise Human Preferences
di: Li, Zhikai, et al.
Pubblicazione: (2024)
di: Li, Zhikai, et al.
Pubblicazione: (2024)
Multi-Task Inference: Can Large Language Models Follow Multiple Instructions at Once?
di: Son, Guijin, et al.
Pubblicazione: (2024)
di: Son, Guijin, et al.
Pubblicazione: (2024)
CATArena: Evaluating Evolutionary Capabilities of Code Agents via Iterative Tournaments
di: Fu, Lingyue, et al.
Pubblicazione: (2025)
di: Fu, Lingyue, et al.
Pubblicazione: (2025)
Evaluating Large Language Models for Fair and Reliable Organ Allocation
di: Kim, Brian Hyeongseok, et al.
Pubblicazione: (2025)
di: Kim, Brian Hyeongseok, et al.
Pubblicazione: (2025)
CANVAS: A Benchmark for Vision-Language Models on Tool-Based User Interface Design
di: Jeong, Daeheon, et al.
Pubblicazione: (2025)
di: Jeong, Daeheon, et al.
Pubblicazione: (2025)
Efficient and Effective Vocabulary Expansion Towards Multilingual Large Language Models
di: Kim, Seungduk, et al.
Pubblicazione: (2024)
di: Kim, Seungduk, et al.
Pubblicazione: (2024)
AVCD: Mitigating Hallucinations in Audio-Visual Large Language Models through Contrastive Decoding
di: Jung, Chaeyoung, et al.
Pubblicazione: (2025)
di: Jung, Chaeyoung, et al.
Pubblicazione: (2025)
Economics Arena for Large Language Models
di: Guo, Shangmin, et al.
Pubblicazione: (2024)
di: Guo, Shangmin, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Align-to-Distill: Trainable Attention Alignment for Knowledge Distillation in Neural Machine Translation
di: Jin, Heegon, et al.
Pubblicazione: (2024) -
Modulated Intervention Preference Optimization (MIPO): Keep the Easy, Refine the Difficult
di: Jang, Cheolhun
Pubblicazione: (2024) -
How Much Heavy Lifting Can an Agent Harness Do?: Measuring the LLM's Residual Role in a Planning Agent
di: Jung, Sungwoo, et al.
Pubblicazione: (2026) -
Detecting AI-Generated Images via Contextual Anomaly Estimation in Masked AutoEncoders
di: Jang, Minsuk, et al.
Pubblicazione: (2025) -
HumorRank: A Tournament-Based Leaderboard for Evaluating Humor Generation in Large Language Models
di: Ajayi, Edward, et al.
Pubblicazione: (2026)