CALRK-Bench: Evaluating Context-Aware Legal Reasoning in Korean Law
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Jung, JiHyeok, Yoon, TaeYoung, Cho, HyunSouk |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
IslamicLegalBench: Evaluating LLMs Knowledge and Reasoning of Islamic Law Across 1,200 Years of Islamic Pluralist Legal Traditions
par: Elmahjub, Ezieddin, et autres
Publié: (2026)
par: Elmahjub, Ezieddin, et autres
Publié: (2026)
LegalMidm: Use-Case-Driven Legal Domain Specialization for Korean Large Language Model
par: Jang, Youngjoon, et autres
Publié: (2026)
par: Jang, Youngjoon, et autres
Publié: (2026)
PILOT-Bench: A Benchmark for Legal Reasoning in the Patent Domain with IRAC-Aligned Classification Tasks
par: Jang, Yehoon, et autres
Publié: (2026)
par: Jang, Yehoon, et autres
Publié: (2026)
Theme-Explanation Structure for Table Summarization using Large Language Models: A Case Study on Korean Tabular Data
par: Kwack, TaeYoon, et autres
Publié: (2025)
par: Kwack, TaeYoon, et autres
Publié: (2025)
FunctionChat-Bench: Comprehensive Evaluation of Language Models' Generative Capabilities in Korean Tool-use Dialogs
par: Lee, Shinbok, et autres
Publié: (2024)
par: Lee, Shinbok, et autres
Publié: (2024)
EconCausal: A Context-Aware Economic Reasoning Benchmark for Large Language Models
par: Lee, Donggyu, et autres
Publié: (2025)
par: Lee, Donggyu, et autres
Publié: (2025)
LegalCiteBench: Evaluating Citation Reliability in Legal Language Models
par: Chen, Sijia, et autres
Publié: (2026)
par: Chen, Sijia, et autres
Publié: (2026)
KoALa-Bench: Evaluating Large Audio Language Models on Korean Speech Understanding and Faithfulness
par: Kim, Jinyoung, et autres
Publié: (2026)
par: Kim, Jinyoung, et autres
Publié: (2026)
CCQA: Generating Question from Solution Can Improve Inference-Time Reasoning in SLMs
par: Kim, Jin Young, et autres
Publié: (2025)
par: Kim, Jin Young, et autres
Publié: (2025)
SMILE-Next: Teaching Large Language Models to Detect, Classify, and Reason about Laughter
par: Jung-Mok, Lee, et autres
Publié: (2026)
par: Jung-Mok, Lee, et autres
Publié: (2026)
MASLegalBench: Benchmarking Multi-Agent Systems in Deductive Legal Reasoning
par: Jing, Huihao, et autres
Publié: (2025)
par: Jing, Huihao, et autres
Publié: (2025)
KVoiceBench, KOpenAudioBench, and KMMAU: Agent-Driven Korean Speech Benchmarks for Evaluating SpeechLMs
par: Kim, Haechan, et autres
Publié: (2026)
par: Kim, Haechan, et autres
Publié: (2026)
BenchPreS: A Benchmark for Context-Aware Personalized Preference Selectivity of Persistent-Memory LLMs
par: Yoon, Sangyeon, et autres
Publié: (2026)
par: Yoon, Sangyeon, et autres
Publié: (2026)
Developing a Pragmatic Benchmark for Assessing Korean Legal Language Understanding in Large Language Models
par: Kim, Yeeun, et autres
Publié: (2024)
par: Kim, Yeeun, et autres
Publié: (2024)
Magis-Bench: Evaluating LLMs on Magistrate-Level Legal Tasks
par: Pires, Ramon, et autres
Publié: (2026)
par: Pires, Ramon, et autres
Publié: (2026)
Evaluating Legal Reasoning Traces with Legal Issue Tree Rubrics
par: Lee, Jinu, et autres
Publié: (2025)
par: Lee, Jinu, et autres
Publié: (2025)
Nunchi-Bench: Benchmarking Language Models on Cultural Reasoning with a Focus on Korean Superstition
par: Kim, Kyuhee, et autres
Publié: (2025)
par: Kim, Kyuhee, et autres
Publié: (2025)
AI and the Law: Evaluating ChatGPT's Performance in Legal Classification
par: Weichbroth, Pawel
Publié: (2025)
par: Weichbroth, Pawel
Publié: (2025)
VLegal-Bench: Cognitively Grounded Benchmark for Vietnamese Legal Reasoning of Large Language Models
par: Dong, Nguyen Tien, et autres
Publié: (2025)
par: Dong, Nguyen Tien, et autres
Publié: (2025)
Designing and Evaluating Multi-Chatbot Interface for Human-AI Communication: Preliminary Findings from a Persuasion Task
par: Yoon, Sion, et autres
Publié: (2024)
par: Yoon, Sion, et autres
Publié: (2024)
Improving Multi-hop Logical Reasoning in Knowledge Graphs with Context-Aware Query Representation Learning
par: Kim, Jeonghoon, et autres
Publié: (2024)
par: Kim, Jeonghoon, et autres
Publié: (2024)
NESTLE: a No-Code Tool for Statistical Analysis of Legal Corpus
par: Cho, Kyoungyeon, et autres
Publié: (2023)
par: Cho, Kyoungyeon, et autres
Publié: (2023)
UKTA: Unified Korean Text Analyzer
par: Ahn, Seokho, et autres
Publié: (2025)
par: Ahn, Seokho, et autres
Publié: (2025)
LeMAJ (Legal LLM-as-a-Judge): Bridging Legal Reasoning and LLM Evaluation
par: Enguehard, Joseph, et autres
Publié: (2025)
par: Enguehard, Joseph, et autres
Publié: (2025)
BenGER: Benchmarking LLM Systems on Subsumption-Based Legal Reasoning in German Law
par: Nagl, Sebastian, et autres
Publié: (2026)
par: Nagl, Sebastian, et autres
Publié: (2026)
Flex-Judge: Text-Only Reasoning Unleashes Zero-Shot Multimodal Evaluators
par: Ko, Jongwoo, et autres
Publié: (2025)
par: Ko, Jongwoo, et autres
Publié: (2025)
Thunder-Tok: Minimizing Tokens per Word in Tokenizing Korean Texts for Generative Language Models
par: Cho, Gyeongje, et autres
Publié: (2025)
par: Cho, Gyeongje, et autres
Publié: (2025)
Logarithmic Scores, Power-Law Discoveries: Disentangling Measurement from Coverage in Agent-Based Evaluation
par: Jung, HyunJoon, et autres
Publié: (2026)
par: Jung, HyunJoon, et autres
Publié: (2026)
A Method for Detecting Legal Article Competition for Korean Criminal Law Using a Case-augmented Mention Graph
par: An, Seonho, et autres
Publié: (2024)
par: An, Seonho, et autres
Publié: (2024)
XCR-Bench: A Multi-Task Benchmark for Evaluating Cultural Reasoning in LLMs
par: Kabir, Mohsinul, et autres
Publié: (2026)
par: Kabir, Mohsinul, et autres
Publié: (2026)
UA-Legal-Bench: A Benchmark for Evaluating Large Language Models on Ukrainian Legal Reasoning
par: Ovcharov, Volodymyr
Publié: (2026)
par: Ovcharov, Volodymyr
Publié: (2026)
CASE-Bench: Context-Aware SafEty Benchmark for Large Language Models
par: Sun, Guangzhi, et autres
Publié: (2025)
par: Sun, Guangzhi, et autres
Publié: (2025)
KMI: A Dataset of Korean Motivational Interviewing Dialogues for Psychotherapy
par: Kim, Hyunjong, et autres
Publié: (2025)
par: Kim, Hyunjong, et autres
Publié: (2025)
GameBench: Evaluating Strategic Reasoning Abilities of LLM Agents
par: Costarelli, Anthony, et autres
Publié: (2024)
par: Costarelli, Anthony, et autres
Publié: (2024)
PersonaMatrix: A Recipe for Persona-Aware Evaluation of Legal Summarization
par: Pang, Tsz Fung, et autres
Publié: (2025)
par: Pang, Tsz Fung, et autres
Publié: (2025)
MoralBench: Moral Evaluation of LLMs
par: Ji, Jianchao, et autres
Publié: (2024)
par: Ji, Jianchao, et autres
Publié: (2024)
PersonalHomeBench: Evaluating Agents in Personalized Smart Homes
par: Bharadwaj, Manasa, et autres
Publié: (2026)
par: Bharadwaj, Manasa, et autres
Publié: (2026)
EXIT: Context-Aware Extractive Compression for Enhancing Retrieval-Augmented Generation
par: Hwang, Taeho, et autres
Publié: (2024)
par: Hwang, Taeho, et autres
Publié: (2024)
PLawBench: A Rubric-Based Benchmark for Evaluating LLMs in Real-World Legal Practice
par: Shi, Yuzhen, et autres
Publié: (2026)
par: Shi, Yuzhen, et autres
Publié: (2026)
LongCodeBench: Evaluating Coding LLMs at 1M Context Windows
par: Rando, Stefano, et autres
Publié: (2025)
par: Rando, Stefano, et autres
Publié: (2025)
Documents similaires
-
IslamicLegalBench: Evaluating LLMs Knowledge and Reasoning of Islamic Law Across 1,200 Years of Islamic Pluralist Legal Traditions
par: Elmahjub, Ezieddin, et autres
Publié: (2026) -
LegalMidm: Use-Case-Driven Legal Domain Specialization for Korean Large Language Model
par: Jang, Youngjoon, et autres
Publié: (2026) -
PILOT-Bench: A Benchmark for Legal Reasoning in the Patent Domain with IRAC-Aligned Classification Tasks
par: Jang, Yehoon, et autres
Publié: (2026) -
Theme-Explanation Structure for Table Summarization using Large Language Models: A Case Study on Korean Tabular Data
par: Kwack, TaeYoon, et autres
Publié: (2025) -
FunctionChat-Bench: Comprehensive Evaluation of Language Models' Generative Capabilities in Korean Tool-use Dialogs
par: Lee, Shinbok, et autres
Publié: (2024)