Medal Matters: Probing LLMs' Failure Cases Through Olympic Rankings
Fuente:
arXiv
Saved in:
| Main Authors: | Choi, Juhwan, Yu, Seunguk, Yun, JungMin, Kim, YoungBin |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
UniGen: Universal Domain Generalization for Sentiment Classification via Zero-shot Dataset Generation
by: Choi, Juhwan, et al.
Published: (2024)
by: Choi, Juhwan, et al.
Published: (2024)
VolDoGer: LLM-assisted Datasets for Domain Generalization in Vision-Language Tasks
by: Choi, Juhwan, et al.
Published: (2024)
by: Choi, Juhwan, et al.
Published: (2024)
Beyond Single-User Dialogue: Assessing Multi-User Dialogue State Tracking Capabilities of Large Language Models
by: Song, Sangmin, et al.
Published: (2025)
by: Song, Sangmin, et al.
Published: (2025)
Adverb Is the Key: Simple Text Data Augmentation with Adverb Deletion
by: Choi, Juhwan, et al.
Published: (2024)
by: Choi, Juhwan, et al.
Published: (2024)
Multi-News+: Cost-efficient Dataset Cleansing via LLM-based Data Annotation
by: Choi, Juhwan, et al.
Published: (2024)
by: Choi, Juhwan, et al.
Published: (2024)
SUMMPILOT: Bridging Efficiency and Customization for Interactive Summarization System
by: Yun, JungMin, et al.
Published: (2026)
by: Yun, JungMin, et al.
Published: (2026)
GPTs Are Multilingual Annotators for Sequence Generation Tasks
by: Choi, Juhwan, et al.
Published: (2024)
by: Choi, Juhwan, et al.
Published: (2024)
Erase Persona, Forget Lore: Benchmarking Multimodal Copyright Unlearning in Large Vision Language Models
by: Kwon, JuneHyoung, et al.
Published: (2026)
by: Kwon, JuneHyoung, et al.
Published: (2026)
Colorful Cutout: Enhancing Image Data Augmentation with Curriculum Learning
by: Choi, Juhwan, et al.
Published: (2024)
by: Choi, Juhwan, et al.
Published: (2024)
VG-CoT: Towards Trustworthy Visual Reasoning via Grounded Chain-of-Thought
by: Lim, Byeonggeuk, et al.
Published: (2026)
by: Lim, Byeonggeuk, et al.
Published: (2026)
Plug-in and Fine-tuning: Bridging the Gap between Small Language Models and Large Language Models
by: Kim, Kyeonghyun, et al.
Published: (2025)
by: Kim, Kyeonghyun, et al.
Published: (2025)
Position on LLM-Assisted Peer Review: Addressing Reviewer Gap through Mentoring and Feedback
by: Yun, JungMin, et al.
Published: (2026)
by: Yun, JungMin, et al.
Published: (2026)
Before Forgetting, Learn to Remember: Revisiting Foundational Learning Failures in LVLM Unlearning Benchmarks
by: Kwon, JuneHyoung, et al.
Published: (2026)
by: Kwon, JuneHyoung, et al.
Published: (2026)
OlympicArena Medal Ranks: Who Is the Most Intelligent AI So Far?
by: Huang, Zhen, et al.
Published: (2024)
by: Huang, Zhen, et al.
Published: (2024)
Aligning with Your Own Voice: Self-Corrected Preference Learning for Hallucination Mitigation in LVLMs
by: Lim, Byeonggeuk, et al.
Published: (2026)
by: Lim, Byeonggeuk, et al.
Published: (2026)
Query, Decompose, Compress: Structured Query Expansion for Efficient Multi-Hop Retrieval
by: Yun, JungMin, et al.
Published: (2026)
by: Yun, JungMin, et al.
Published: (2026)
Delving into Multilingual Ethical Bias: The MSQAD with Statistical Hypothesis Tests for Large Language Models
by: Yu, Seunguk, et al.
Published: (2025)
by: Yu, Seunguk, et al.
Published: (2025)
Don't be a Fool: Pooling Strategies in Offensive Language Detection from User-Intended Adversarial Attacks
by: Yu, Seunguk, et al.
Published: (2024)
by: Yu, Seunguk, et al.
Published: (2024)
CoBA: Counterbias Text Augmentation for Mitigating Various Spurious Correlations via Semantic Triples
by: Jin, Kyohoon, et al.
Published: (2025)
by: Jin, Kyohoon, et al.
Published: (2025)
Control Token with Dense Passage Retrieval
by: Lee, Juhwan, et al.
Published: (2024)
by: Lee, Juhwan, et al.
Published: (2024)
Strategic Data Ordering: Enhancing Large Language Model Performance through Curriculum Learning
by: Kim, Jisu, et al.
Published: (2024)
by: Kim, Jisu, et al.
Published: (2024)
SoftEDA: Rethinking Rule-Based Data Augmentation with Soft Labels
by: Choi, Juhwan, et al.
Published: (2024)
by: Choi, Juhwan, et al.
Published: (2024)
AutoAugment Is What You Need: Enhancing Rule-based Augmentation Methods in Low-resource Regimes
by: Choi, Juhwan, et al.
Published: (2024)
by: Choi, Juhwan, et al.
Published: (2024)
Rank-O-ToM: Unlocking Emotional Nuance Ranking to Enhance Affective Theory-of-Mind
by: Kim, JiHyun, et al.
Published: (2025)
by: Kim, JiHyun, et al.
Published: (2025)
FairQE: Multi-Agent Framework for Mitigating Gender Bias in Translation Quality Estimation
by: Jang, Jinhee, et al.
Published: (2026)
by: Jang, Jinhee, et al.
Published: (2026)
Achieving Gold-Medal-Level Olympiad Reasoning via Simple and Unified Scaling
by: Li, Yafu, et al.
Published: (2026)
by: Li, Yafu, et al.
Published: (2026)
Narrative Landscape: Mapping Narrative Dispositions Across LLMs
by: Jung, Donghoon, et al.
Published: (2026)
by: Jung, Donghoon, et al.
Published: (2026)
Enhancing Effectiveness and Robustness in a Low-Resource Regime via Decision-Boundary-aware Data Augmentation
by: Jin, Kyohoon, et al.
Published: (2024)
by: Jin, Kyohoon, et al.
Published: (2024)
Ranking LLMs by compression
by: Guo, Peijia, et al.
Published: (2024)
by: Guo, Peijia, et al.
Published: (2024)
Format Inertia: A Failure Mechanism of LLMs in Medical Pre-Consultation
by: Lim, Seungseop, et al.
Published: (2025)
by: Lim, Seungseop, et al.
Published: (2025)
RankLLM: Weighted Ranking of LLMs by Quantifying Question Difficulty
by: Zhang, Ziqian, et al.
Published: (2026)
by: Zhang, Ziqian, et al.
Published: (2026)
Correct-Detect: Balancing Performance and Ambiguity Through the Lens of Coreference Resolution in LLMs
by: Shore, Amber, et al.
Published: (2025)
by: Shore, Amber, et al.
Published: (2025)
OlympicArena: Benchmarking Multi-discipline Cognitive Reasoning for Superintelligent AI
by: Huang, Zhen, et al.
Published: (2024)
by: Huang, Zhen, et al.
Published: (2024)
Towards Unbiased Evaluation of Detecting Unanswerable Questions in EHRSQL
by: Yang, Yongjin, et al.
Published: (2024)
by: Yang, Yongjin, et al.
Published: (2024)
Trans-EnV: A Framework for Evaluating the Linguistic Robustness of LLMs Against English Varieties
by: Lee, Jiyoung, et al.
Published: (2025)
by: Lee, Jiyoung, et al.
Published: (2025)
Activations as Features: Probing LLMs for Generalizable Essay Scoring Representations
by: Chi, Jinwei, et al.
Published: (2025)
by: Chi, Jinwei, et al.
Published: (2025)
Belief in Authority: Impact of Authority in Multi-Agent Evaluation Framework
by: Choi, Junhyuk, et al.
Published: (2026)
by: Choi, Junhyuk, et al.
Published: (2026)
Contrastive and Consistency Learning for Neural Noisy-Channel Model in Spoken Language Understanding
by: Kim, Suyoung, et al.
Published: (2024)
by: Kim, Suyoung, et al.
Published: (2024)
Nuance Matters: Probing Epistemic Consistency in Causal Reasoning
by: Cui, Shaobo, et al.
Published: (2024)
by: Cui, Shaobo, et al.
Published: (2024)
Making Sense of Korean Sentences: A Comprehensive Evaluation of LLMs through KoSEnd Dataset
by: Yu, Seunguk, et al.
Published: (2025)
by: Yu, Seunguk, et al.
Published: (2025)
Similar Items
-
UniGen: Universal Domain Generalization for Sentiment Classification via Zero-shot Dataset Generation
by: Choi, Juhwan, et al.
Published: (2024) -
VolDoGer: LLM-assisted Datasets for Domain Generalization in Vision-Language Tasks
by: Choi, Juhwan, et al.
Published: (2024) -
Beyond Single-User Dialogue: Assessing Multi-User Dialogue State Tracking Capabilities of Large Language Models
by: Song, Sangmin, et al.
Published: (2025) -
Adverb Is the Key: Simple Text Data Augmentation with Adverb Deletion
by: Choi, Juhwan, et al.
Published: (2024) -
Multi-News+: Cost-efficient Dataset Cleansing via LLM-based Data Annotation
by: Choi, Juhwan, et al.
Published: (2024)