MultiPragEval: Multilingual Pragmatic Evaluation of Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Park, Dojun, Lee, Jiwoo, Park, Seohyun, Jeong, Hyeyun, Koo, Youngeun, Hwang, Soonha, Park, Seonwoo, Lee, Sungeun |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Pragmatic Competence Evaluation of Large Language Models for the Korean Language
by: Park, Dojun, et al.
Published: (2024)
by: Park, Dojun, et al.
Published: (2024)
Evaluating Large language models on Understanding Korean indirect Speech acts
by: Koo, Youngeun, et al.
Published: (2025)
by: Koo, Youngeun, et al.
Published: (2025)
Exploring Multimodal Perception in Large Language Models Through Perceptual Strength Ratings
by: Lee, Jonghyun, et al.
Published: (2025)
by: Lee, Jonghyun, et al.
Published: (2025)
Multi-Dimensional Machine Translation Evaluation: Model Evaluation and Resource for Korean
by: Park, Dojun, et al.
Published: (2024)
by: Park, Dojun, et al.
Published: (2024)
Investigating Language Preference of Multilingual RAG Systems
by: Park, Jeonghyun, et al.
Published: (2025)
by: Park, Jeonghyun, et al.
Published: (2025)
Low-Resource Cross-Lingual Summarization through Few-Shot Learning with Large Language Models
by: Park, Gyutae, et al.
Published: (2024)
by: Park, Gyutae, et al.
Published: (2024)
Enhancing Multilingual RAG Systems with Debiased Language Preference-Guided Query Fusion
by: Park, Jeonghyun, et al.
Published: (2026)
by: Park, Jeonghyun, et al.
Published: (2026)
Language over Content: Tracing Cultural Understanding in Multilingual Large Language Models
by: Cho, Seungho, et al.
Published: (2025)
by: Cho, Seungho, et al.
Published: (2025)
Teaching Language Models to Think in Code
by: Hwang, Hyeon, et al.
Published: (2026)
by: Hwang, Hyeon, et al.
Published: (2026)
Thunder-DeID: Accurate and Efficient De-identification Framework for Korean Court Judgments
by: Hahm, Sungeun, et al.
Published: (2025)
by: Hahm, Sungeun, et al.
Published: (2025)
Developing a Pragmatic Benchmark for Assessing Korean Legal Language Understanding in Large Language Models
by: Kim, Yeeun, et al.
Published: (2024)
by: Kim, Yeeun, et al.
Published: (2024)
PairEval: Open-domain Dialogue Evaluation with Pairwise Comparison
by: Park, ChaeHun, et al.
Published: (2024)
by: Park, ChaeHun, et al.
Published: (2024)
SCALE: Upscaled Continual Learning of Large Language Models
by: Lee, Jin-woo, et al.
Published: (2025)
by: Lee, Jin-woo, et al.
Published: (2025)
Optimizing Language Augmentation for Multilingual Large Language Models: A Case Study on Korean
by: Choi, ChangSu, et al.
Published: (2024)
by: Choi, ChangSu, et al.
Published: (2024)
Benchmarking Cognitive Biases in Large Language Models as Evaluators
by: Koo, Ryan, et al.
Published: (2023)
by: Koo, Ryan, et al.
Published: (2023)
Small Language Models Learn Enhanced Reasoning Skills from Medical Textbooks
by: Kim, Hyunjae, et al.
Published: (2024)
by: Kim, Hyunjae, et al.
Published: (2024)
Anchoring LLM Gender Bias to Human Baselines: A Cross-Lingual Audit
by: Choi, Jiwoo, et al.
Published: (2026)
by: Choi, Jiwoo, et al.
Published: (2026)
CONDESION-BENCH: Conditional Decision-Making of Large Language Models in Compositional Action Space
by: Hwang, Yeonjun, et al.
Published: (2026)
by: Hwang, Yeonjun, et al.
Published: (2026)
Eka-Eval: An Evaluation Framework for Low-Resource Multilingual Large Language Models
by: Sinha, Samridhi Raj, et al.
Published: (2025)
by: Sinha, Samridhi Raj, et al.
Published: (2025)
MAS-LitEval : Multi-Agent System for Literary Translation Quality Assessment
by: Kim, Junghwan, et al.
Published: (2025)
by: Kim, Junghwan, et al.
Published: (2025)
ODPG: Outfitting Diffusion with Pose Guided Condition
by: Lee, Seohyun, et al.
Published: (2025)
by: Lee, Seohyun, et al.
Published: (2025)
Prompt-based Depth Pruning of Large Language Models
by: Wee, Juyun, et al.
Published: (2025)
by: Wee, Juyun, et al.
Published: (2025)
CIRF: Tokenizing Chain-of-Thoughts into Reusable Functional Units for Efficient Latent Reasoning in Large Language Models
by: Lee, Yukyung, et al.
Published: (2026)
by: Lee, Yukyung, et al.
Published: (2026)
ChroKnowledge: Unveiling Chronological Knowledge of Language Models in Multiple Domains
by: Park, Yein, et al.
Published: (2024)
by: Park, Yein, et al.
Published: (2024)
Adaptive Task Vectors for Large Language Models
by: Kang, Joonseong, et al.
Published: (2025)
by: Kang, Joonseong, et al.
Published: (2025)
Finding Answers in Thought Matters: Revisiting Evaluation on Large Language Models with Reasoning
by: Jo, Hwiyeol, et al.
Published: (2025)
by: Jo, Hwiyeol, et al.
Published: (2025)
Smoothie-Qwen: Post-Hoc Smoothing to Reduce Language Bias in Multilingual LLMs
by: Ji, SeungWon, et al.
Published: (2025)
by: Ji, SeungWon, et al.
Published: (2025)
ELO: Efficient Layer-Specific Optimization for Continual Pretraining of Multilingual LLMs
by: Yoo, HanGyeol, et al.
Published: (2026)
by: Yoo, HanGyeol, et al.
Published: (2026)
Modeling Layered Consciousness with Multi-Agent Large Language Models
by: Kim, Sang Hun, et al.
Published: (2025)
by: Kim, Sang Hun, et al.
Published: (2025)
Weighted Multi-Prompt Learning with Description-free Large Language Model Distillation
by: Lee, Sua, et al.
Published: (2025)
by: Lee, Sua, et al.
Published: (2025)
GlotEval: A Test Suite for Massively Multilingual Evaluation of Large Language Models
by: Luo, Hengyu, et al.
Published: (2025)
by: Luo, Hengyu, et al.
Published: (2025)
FeRG-LLM : Feature Engineering by Reason Generation Large Language Models
by: Ko, Jeonghyun, et al.
Published: (2025)
by: Ko, Jeonghyun, et al.
Published: (2025)
Rethinking Pruning Large Language Models: Benefits and Pitfalls of Reconstruction Error Minimization
by: Shin, Sungbin, et al.
Published: (2024)
by: Shin, Sungbin, et al.
Published: (2024)
Outlier-Safe Pre-Training for Robust 4-Bit Quantization of Large Language Models
by: Park, Jungwoo, et al.
Published: (2025)
by: Park, Jungwoo, et al.
Published: (2025)
FLEX: A Benchmark for Evaluating Robustness of Fairness in Large Language Models
by: Jung, Dahyun, et al.
Published: (2025)
by: Jung, Dahyun, et al.
Published: (2025)
Models Know Models Best: Evaluation via Model-Preferred Formats
by: Lee, Joonhak, et al.
Published: (2026)
by: Lee, Joonhak, et al.
Published: (2026)
Right at My Level: A Unified Multilingual Framework for Proficiency-Aware Text Simplification
by: Jeong, Jinhong, et al.
Published: (2026)
by: Jeong, Jinhong, et al.
Published: (2026)
KITE: A Benchmark for Evaluating Korean Instruction-Following Abilities in Large Language Models
by: Kim, Dongjun, et al.
Published: (2025)
by: Kim, Dongjun, et al.
Published: (2025)
Benchmarking Direct Preference Optimization for Medical Large Vision-Language Models
by: Kim, Dain, et al.
Published: (2026)
by: Kim, Dain, et al.
Published: (2026)
OPAL: Outlier-Preserved Microscaling Quantization Accelerator for Generative Large Language Models
by: Koo, Jahyun, et al.
Published: (2024)
by: Koo, Jahyun, et al.
Published: (2024)
Similar Items
-
Pragmatic Competence Evaluation of Large Language Models for the Korean Language
by: Park, Dojun, et al.
Published: (2024) -
Evaluating Large language models on Understanding Korean indirect Speech acts
by: Koo, Youngeun, et al.
Published: (2025) -
Exploring Multimodal Perception in Large Language Models Through Perceptual Strength Ratings
by: Lee, Jonghyun, et al.
Published: (2025) -
Multi-Dimensional Machine Translation Evaluation: Model Evaluation and Resource for Korean
by: Park, Dojun, et al.
Published: (2024) -
Investigating Language Preference of Multilingual RAG Systems
by: Park, Jeonghyun, et al.
Published: (2025)