ETHIC: Evaluating Large Language Models on Long-Context Tasks with High Information Coverage
Fuente:
arXiv
Saved in:
| Main Authors: | Lee, Taewhoo, Yoon, Chanwoong, Jang, Kyochul, Lee, Donghyeon, Song, Minju, Kim, Hyunjae, Kang, Jaewoo |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
The Curious Case of Analogies: Investigating Analogical Reasoning in Large Language Models
by: Lee, Taewhoo, et al.
Published: (2025)
by: Lee, Taewhoo, et al.
Published: (2025)
DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues
by: Jang, Kyochul, et al.
Published: (2025)
by: Jang, Kyochul, et al.
Published: (2025)
Outlier-Safe Pre-Training for Robust 4-Bit Quantization of Large Language Models
by: Park, Jungwoo, et al.
Published: (2025)
by: Park, Jungwoo, et al.
Published: (2025)
OLAPH: Improving Factuality in Biomedical Long-form Question Answering
by: Jeong, Minbyul, et al.
Published: (2024)
by: Jeong, Minbyul, et al.
Published: (2024)
Small Language Models Learn Enhanced Reasoning Skills from Medical Textbooks
by: Kim, Hyunjae, et al.
Published: (2024)
by: Kim, Hyunjae, et al.
Published: (2024)
CompAct: Compressing Retrieved Documents Actively for Question Answering
by: Yoon, Chanwoong, et al.
Published: (2024)
by: Yoon, Chanwoong, et al.
Published: (2024)
ChroKnowledge: Unveiling Chronological Knowledge of Language Models in Multiple Domains
by: Park, Yein, et al.
Published: (2024)
by: Park, Yein, et al.
Published: (2024)
Ask Optimal Questions: Aligning Large Language Models with Retriever's Preference in Conversation
by: Yoon, Chanwoong, et al.
Published: (2024)
by: Yoon, Chanwoong, et al.
Published: (2024)
Assessing LLM Reasoning Steps via Principal Knowledge Grounding
by: Hwang, Hyeon, et al.
Published: (2025)
by: Hwang, Hyeon, et al.
Published: (2025)
LAPIS: Language Model-Augmented Police Investigation System
by: Kim, Heedou, et al.
Published: (2024)
by: Kim, Heedou, et al.
Published: (2024)
Does Time Have Its Place? Temporal Heads: Where Language Models Recall Time-specific Information
by: Park, Yein, et al.
Published: (2025)
by: Park, Yein, et al.
Published: (2025)
Rationale-Guided Retrieval Augmented Generation for Medical Question Answering
by: Sohn, Jiwoong, et al.
Published: (2024)
by: Sohn, Jiwoong, et al.
Published: (2024)
KU-DMIS at EHRSQL 2024:Generating SQL query via question templatization in EHR
by: Kim, Hajung, et al.
Published: (2024)
by: Kim, Hajung, et al.
Published: (2024)
Culinary Class Wars: Evaluating LLMs using ASH in Cuisine Transfer Task
by: Lee, Hoonick, et al.
Published: (2024)
by: Lee, Hoonick, et al.
Published: (2024)
Benchmarking Direct Preference Optimization for Medical Large Vision-Language Models
by: Kim, Dain, et al.
Published: (2026)
by: Kim, Dain, et al.
Published: (2026)
CookingSense: A Culinary Knowledgebase with Multidisciplinary Assertions
by: Choi, Donghee, et al.
Published: (2024)
by: Choi, Donghee, et al.
Published: (2024)
Learning from Negative Samples in Biomedical Generative Entity Linking
by: Kim, Chanhwi, et al.
Published: (2024)
by: Kim, Chanhwi, et al.
Published: (2024)
Leveraging Language Models and RAG for Efficient Knowledge Discovery in Clinical Environments
by: Ko, Seokhwan, et al.
Published: (2025)
by: Ko, Seokhwan, et al.
Published: (2025)
ROSAQ: Rotation-based Saliency-Aware Weight Quantization for Efficiently Compressing Large Language Models
by: Yoon, Junho, et al.
Published: (2025)
by: Yoon, Junho, et al.
Published: (2025)
Teaching Language Models to Think in Code
by: Hwang, Hyeon, et al.
Published: (2026)
by: Hwang, Hyeon, et al.
Published: (2026)
Adaptive Task Vectors for Large Language Models
by: Kang, Joonseong, et al.
Published: (2025)
by: Kang, Joonseong, et al.
Published: (2025)
TimeChara: Evaluating Point-in-Time Character Hallucination of Role-Playing Large Language Models
by: Ahn, Jaewoo, et al.
Published: (2024)
by: Ahn, Jaewoo, et al.
Published: (2024)
K-BrowseComp: A Web Browsing Agent Benchmark Grounded in Korean Contexts
by: Lee, Nahyun, et al.
Published: (2026)
by: Lee, Nahyun, et al.
Published: (2026)
Unleashing Multi-Hop Reasoning Potential in Large Language Models through Repetition of Misordered Context
by: Yu, Sangwon, et al.
Published: (2024)
by: Yu, Sangwon, et al.
Published: (2024)
SGuard-v1: Safety Guardrail for Large Language Models
by: Lee, JoonHo, et al.
Published: (2025)
by: Lee, JoonHo, et al.
Published: (2025)
CONDESION-BENCH: Conditional Decision-Making of Large Language Models in Compositional Action Space
by: Hwang, Yeonjun, et al.
Published: (2026)
by: Hwang, Yeonjun, et al.
Published: (2026)
ReviewScore: Misinformed Peer Review Detection with Large Language Models
by: Ryu, Hyun, et al.
Published: (2025)
by: Ryu, Hyun, et al.
Published: (2025)
CLAG: Adaptive Memory Organization via Agent-Driven Clustering for Small Language Model Agents
by: Roh, Taeyun, et al.
Published: (2026)
by: Roh, Taeyun, et al.
Published: (2026)
Leveraging Large Language Models for Active Merchant Non-player Characters
by: Kim, Byungjun, et al.
Published: (2024)
by: Kim, Byungjun, et al.
Published: (2024)
VLind-Bench: Measuring Language Priors in Large Vision-Language Models
by: Lee, Kang-il, et al.
Published: (2024)
by: Lee, Kang-il, et al.
Published: (2024)
Chain of Agents: Large Language Models Collaborating on Long-Context Tasks
by: Zhang, Yusen, et al.
Published: (2024)
by: Zhang, Yusen, et al.
Published: (2024)
RPM: Reasoning-Level Personalization for Black-Box Large Language Models
by: Kim, Jieyong, et al.
Published: (2025)
by: Kim, Jieyong, et al.
Published: (2025)
CoTox: Chain-of-Thought-Based Molecular Toxicity Reasoning and Prediction
by: Park, Jueon, et al.
Published: (2025)
by: Park, Jueon, et al.
Published: (2025)
OpenLearnLM Benchmark: A Unified Framework for Evaluating Knowledge, Skill, and Attitude in Educational Large Language Models
by: Lee, Unggi, et al.
Published: (2026)
by: Lee, Unggi, et al.
Published: (2026)
LG AI Research & KAIST at EHRSQL 2024: Self-Training Large Language Models with Pseudo-Labeled Unanswerable Questions for a Reliable Text-to-SQL System on EHRs
by: Jo, Yongrae, et al.
Published: (2024)
by: Jo, Yongrae, et al.
Published: (2024)
M3-SLU: Evaluating Speaker-Attributed Reasoning in Multimodal Large Language Models
by: Kwon, Yejin, et al.
Published: (2025)
by: Kwon, Yejin, et al.
Published: (2025)
Enhancing Building Semantics Preservation in AI Model Training with Large Language Model Encodings
by: Jang, Suhyung, et al.
Published: (2026)
by: Jang, Suhyung, et al.
Published: (2026)
Is a Peeled Apple Still Red? Evaluating LLMs' Ability for Conceptual Combination with Property Type
by: Song, Seokwon, et al.
Published: (2025)
by: Song, Seokwon, et al.
Published: (2025)
LongSafety: Evaluating Long-Context Safety of Large Language Models
by: Lu, Yida, et al.
Published: (2025)
by: Lu, Yida, et al.
Published: (2025)
Learning to Explore and Select for Coverage-Conditioned Retrieval-Augmented Generation
by: Kim, Takyoung, et al.
Published: (2024)
by: Kim, Takyoung, et al.
Published: (2024)
Similar Items
-
The Curious Case of Analogies: Investigating Analogical Reasoning in Large Language Models
by: Lee, Taewhoo, et al.
Published: (2025) -
DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues
by: Jang, Kyochul, et al.
Published: (2025) -
Outlier-Safe Pre-Training for Robust 4-Bit Quantization of Large Language Models
by: Park, Jungwoo, et al.
Published: (2025) -
OLAPH: Improving Factuality in Biomedical Long-form Question Answering
by: Jeong, Minbyul, et al.
Published: (2024) -
Small Language Models Learn Enhanced Reasoning Skills from Medical Textbooks
by: Kim, Hyunjae, et al.
Published: (2024)