Evalverse: Unified and Accessible Library for Large Language Model Evaluation
Fuente:
arXiv
Salvato in:
| Autori principali: | Kim, Jihoo, Song, Wonho, Kim, Dahyun, Kim, Yunsu, Kim, Yungi, Park, Chanjun |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
sDPO: Don't Use Your Data All at Once
di: Kim, Dahyun, et al.
Pubblicazione: (2024)
di: Kim, Dahyun, et al.
Pubblicazione: (2024)
Open Ko-LLM Leaderboard2: Bridging Foundational and Practical Evaluation for Korean LLMs
di: Kim, Hyeonwoo, et al.
Pubblicazione: (2024)
di: Kim, Hyeonwoo, et al.
Pubblicazione: (2024)
1 Trillion Token (1TT) Platform: A Novel Framework for Efficient Data Sharing and Compensation in Large Language Models
di: Park, Chanjun, et al.
Pubblicazione: (2024)
di: Park, Chanjun, et al.
Pubblicazione: (2024)
Representing the Under-Represented: Cultural and Core Capability Benchmarks for Developing Thai Large Language Models
di: Kim, Dahyun, et al.
Pubblicazione: (2024)
di: Kim, Dahyun, et al.
Pubblicazione: (2024)
SAAS: Solving Ability Amplification Strategy for Enhanced Mathematical Reasoning in Large Language Models
di: Kim, Hyeonwoo, et al.
Pubblicazione: (2024)
di: Kim, Hyeonwoo, et al.
Pubblicazione: (2024)
LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models
di: Kim, Yungi, et al.
Pubblicazione: (2024)
di: Kim, Yungi, et al.
Pubblicazione: (2024)
Dataverse: Open-Source ETL (Extract, Transform, Load) Pipeline for Large Language Models
di: Park, Hyunbyung, et al.
Pubblicazione: (2024)
di: Park, Hyunbyung, et al.
Pubblicazione: (2024)
Rethinking KenLM: Good and Bad Model Ensembles for Efficient Text Quality Filtering in Large Web Corpora
di: Kim, Yungi, et al.
Pubblicazione: (2024)
di: Kim, Yungi, et al.
Pubblicazione: (2024)
Open Ko-LLM Leaderboard: Evaluating Large Language Models in Korean with Ko-H5 Benchmark
di: Park, Chanjun, et al.
Pubblicazione: (2024)
di: Park, Chanjun, et al.
Pubblicazione: (2024)
SOLAR 10.7B: Scaling Large Language Models with Simple yet Effective Depth Up-Scaling
di: Kim, Dahyun, et al.
Pubblicazione: (2023)
di: Kim, Dahyun, et al.
Pubblicazione: (2023)
InstaTrans: An Instruction-Aware Translation Framework for Non-English Instruction Datasets
di: Kim, Yungi, et al.
Pubblicazione: (2024)
di: Kim, Yungi, et al.
Pubblicazione: (2024)
Model-Based Data-Centric AI: Bridging the Divide Between Academic Ideals and Industrial Pragmatism
di: Park, Chanjun, et al.
Pubblicazione: (2024)
di: Park, Chanjun, et al.
Pubblicazione: (2024)
KITE: A Benchmark for Evaluating Korean Instruction-Following Abilities in Large Language Models
di: Kim, Dongjun, et al.
Pubblicazione: (2025)
di: Kim, Dongjun, et al.
Pubblicazione: (2025)
FLEX: A Benchmark for Evaluating Robustness of Fairness in Large Language Models
di: Jung, Dahyun, et al.
Pubblicazione: (2025)
di: Jung, Dahyun, et al.
Pubblicazione: (2025)
Understanding LLM Development Through Longitudinal Study: Insights from the Open Ko-LLM Leaderboard
di: Park, Chanjun, et al.
Pubblicazione: (2024)
di: Park, Chanjun, et al.
Pubblicazione: (2024)
Exploring Iterative Controllable Summarization with Large Language Models
di: Ryu, Sangwon, et al.
Pubblicazione: (2024)
di: Ryu, Sangwon, et al.
Pubblicazione: (2024)
KVoiceBench, KOpenAudioBench, and KMMAU: Agent-Driven Korean Speech Benchmarks for Evaluating SpeechLMs
di: Kim, Haechan, et al.
Pubblicazione: (2026)
di: Kim, Haechan, et al.
Pubblicazione: (2026)
CoME: An Unlearning-based Approach to Conflict-free Model Editing
di: Jung, Dahyun, et al.
Pubblicazione: (2025)
di: Jung, Dahyun, et al.
Pubblicazione: (2025)
GAIA-v2-LILT: Multilingual Adaptation of Agent Benchmark beyond Translation
di: Kim, Yunsu, et al.
Pubblicazione: (2026)
di: Kim, Yunsu, et al.
Pubblicazione: (2026)
Dynin-Omni: Omnimodal Unified Large Diffusion Language Model
di: Kim, Jaeik, et al.
Pubblicazione: (2026)
di: Kim, Jaeik, et al.
Pubblicazione: (2026)
Benchmark Profiling: Mechanistic Diagnosis of LLM Benchmarks
di: Kim, Dongjun, et al.
Pubblicazione: (2025)
di: Kim, Dongjun, et al.
Pubblicazione: (2025)
Alternative Speech: Complementary Method to Counter-Narrative for Better Discourse
di: Lee, Seungyoon, et al.
Pubblicazione: (2024)
di: Lee, Seungyoon, et al.
Pubblicazione: (2024)
Autoregressive Score Generation for Multi-trait Essay Scoring
di: Do, Heejin, et al.
Pubblicazione: (2024)
di: Do, Heejin, et al.
Pubblicazione: (2024)
EXAONE 4.0: Unified Large Language Models Integrating Non-reasoning and Reasoning Modes
di: Bae, Kyunghoon, et al.
Pubblicazione: (2025)
di: Bae, Kyunghoon, et al.
Pubblicazione: (2025)
When Is Enough Not Enough? Illusory Completion in Search Agents
di: Ko, Dayoon, et al.
Pubblicazione: (2026)
di: Ko, Dayoon, et al.
Pubblicazione: (2026)
Leveraging Large Language Models for Active Merchant Non-player Characters
di: Kim, Byungjun, et al.
Pubblicazione: (2024)
di: Kim, Byungjun, et al.
Pubblicazione: (2024)
Self-HarmLLM: Can Large Language Model Harm Itself?
di: Kim, Heehwan, et al.
Pubblicazione: (2025)
di: Kim, Heehwan, et al.
Pubblicazione: (2025)
EvalLM: Interactive Evaluation of Large Language Model Prompts on User-Defined Criteria
di: Kim, Tae Soo, et al.
Pubblicazione: (2023)
di: Kim, Tae Soo, et al.
Pubblicazione: (2023)
DETAIL Matters: Measuring the Impact of Prompt Specificity on Reasoning in Large Language Models
di: Kim, Olivia
Pubblicazione: (2025)
di: Kim, Olivia
Pubblicazione: (2025)
Denoising Table-Text Retrieval for Open-Domain Question Answering
di: Kang, Deokhyung, et al.
Pubblicazione: (2024)
di: Kang, Deokhyung, et al.
Pubblicazione: (2024)
Cross-lingual Back-Parsing: Utterance Synthesis from Meaning Representation for Zero-Resource Semantic Parsing
di: Kang, Deokhyung, et al.
Pubblicazione: (2024)
di: Kang, Deokhyung, et al.
Pubblicazione: (2024)
SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models
di: Jeong, Wonjun, et al.
Pubblicazione: (2025)
di: Jeong, Wonjun, et al.
Pubblicazione: (2025)
Evalet: Evaluating Large Language Models through Functional Fragmentation
di: Kim, Tae Soo, et al.
Pubblicazione: (2025)
di: Kim, Tae Soo, et al.
Pubblicazione: (2025)
FLASK: Fine-grained Language Model Evaluation based on Alignment Skill Sets
di: Ye, Seonghyeon, et al.
Pubblicazione: (2023)
di: Ye, Seonghyeon, et al.
Pubblicazione: (2023)
MedBioRAG: Semantic Search and Retrieval-Augmented Generation with Large Language Models for Medical and Biological QA
di: Kim, Seonok
Pubblicazione: (2025)
di: Kim, Seonok
Pubblicazione: (2025)
Non-linear Interventions on Large Language Models
di: Kim, Sangwoo
Pubblicazione: (2026)
di: Kim, Sangwoo
Pubblicazione: (2026)
Bounded Hyperbolic Tangent: A Stable and Efficient Alternative to Pre-Layer Normalization in Large Language Models
di: Byun, Hoyoon, et al.
Pubblicazione: (2025)
di: Byun, Hoyoon, et al.
Pubblicazione: (2025)
MacroBench: A Novel Testbed for Web Automation Scripts via Large Language Models
di: Kim, Hyunjun, et al.
Pubblicazione: (2025)
di: Kim, Hyunjun, et al.
Pubblicazione: (2025)
MedBioLM: Optimizing Medical and Biological QA with Fine-Tuned Large Language Models and Retrieval-Augmented Generation
di: Kim, Seonok
Pubblicazione: (2025)
di: Kim, Seonok
Pubblicazione: (2025)
Nevermind: Instruction Override and Moderation in Large Language Models
di: Kim, Edward
Pubblicazione: (2024)
di: Kim, Edward
Pubblicazione: (2024)
Documenti analoghi
-
sDPO: Don't Use Your Data All at Once
di: Kim, Dahyun, et al.
Pubblicazione: (2024) -
Open Ko-LLM Leaderboard2: Bridging Foundational and Practical Evaluation for Korean LLMs
di: Kim, Hyeonwoo, et al.
Pubblicazione: (2024) -
1 Trillion Token (1TT) Platform: A Novel Framework for Efficient Data Sharing and Compensation in Large Language Models
di: Park, Chanjun, et al.
Pubblicazione: (2024) -
Representing the Under-Represented: Cultural and Core Capability Benchmarks for Developing Thai Large Language Models
di: Kim, Dahyun, et al.
Pubblicazione: (2024) -
SAAS: Solving Ability Amplification Strategy for Enhanced Mathematical Reasoning in Large Language Models
di: Kim, Hyeonwoo, et al.
Pubblicazione: (2024)