Evaluating the Limits of Large Language Models in Multilingual Legal Reasoning
Fuente:
arXiv
Saved in:
| Main Authors: | Ioannou, Antreas, Shiamishis, Andreas, Hollenstein, Nora, Gürel, Nezihe Merve |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Large Language Model Selection with Limited Annotations
by: Durmazkeser, Yavuz, et al.
Published: (2026)
by: Durmazkeser, Yavuz, et al.
Published: (2026)
Active Model Selection for Large Language Models
by: Durmazkeser, Yavuz, et al.
Published: (2025)
by: Durmazkeser, Yavuz, et al.
Published: (2025)
COLEP: Certifiably Robust Learning-Reasoning Conformal Prediction via Probabilistic Circuits
by: Kang, Mintong, et al.
Published: (2024)
by: Kang, Mintong, et al.
Published: (2024)
C-RAG: Certified Generation Risks for Retrieval-Augmented Language Models
by: Kang, Mintong, et al.
Published: (2024)
by: Kang, Mintong, et al.
Published: (2024)
Why Do Multilingual Reasoning Gaps Emerge in Reasoning Language Models?
by: Kang, Deokhyung, et al.
Published: (2025)
by: Kang, Deokhyung, et al.
Published: (2025)
Generative Evaluation of Complex Reasoning in Large Language Models
by: Lin, Haowei, et al.
Published: (2025)
by: Lin, Haowei, et al.
Published: (2025)
Evaluating the Robustness of Analogical Reasoning in Large Language Models
by: Lewis, Martha, et al.
Published: (2024)
by: Lewis, Martha, et al.
Published: (2024)
Unveiling Narrative Reasoning Limits of Large Language Models with Trope in Movie Synopses
by: Su, Hung-Ting, et al.
Published: (2024)
by: Su, Hung-Ting, et al.
Published: (2024)
Line Goes Up? Inherent Limitations of Benchmarks for Evaluating Large Language Models
by: Fodor, James
Published: (2025)
by: Fodor, James
Published: (2025)
EUROPA: A Legal Multilingual Keyphrase Generation Dataset
by: Salaün, Olivier, et al.
Published: (2024)
by: Salaün, Olivier, et al.
Published: (2024)
LOLA -- An Open-Source Massively Multilingual Large Language Model
by: Srivastava, Nikit, et al.
Published: (2024)
by: Srivastava, Nikit, et al.
Published: (2024)
Multilinguality of Large Language Models From a Structural Perspective
by: Sakajo, Haruki, et al.
Published: (2026)
by: Sakajo, Haruki, et al.
Published: (2026)
DyVal: Dynamic Evaluation of Large Language Models for Reasoning Tasks
by: Zhu, Kaijie, et al.
Published: (2023)
by: Zhu, Kaijie, et al.
Published: (2023)
Language over Content: Tracing Cultural Understanding in Multilingual Large Language Models
by: Cho, Seungho, et al.
Published: (2025)
by: Cho, Seungho, et al.
Published: (2025)
Exploring Multilingual Probing in Large Language Models: A Cross-Language Analysis
by: Li, Daoyang, et al.
Published: (2024)
by: Li, Daoyang, et al.
Published: (2024)
Evaluating Interventional Reasoning Capabilities of Large Language Models
by: Kasetty, Tejas, et al.
Published: (2024)
by: Kasetty, Tejas, et al.
Published: (2024)
Analyzing the Evaluation of Cross-Lingual Knowledge Transfer in Multilingual Language Models
by: Rajaee, Sara, et al.
Published: (2024)
by: Rajaee, Sara, et al.
Published: (2024)
Lost in Execution: On the Multilingual Robustness of Tool Calling in Large Language Models
by: Luo, Zheng, et al.
Published: (2026)
by: Luo, Zheng, et al.
Published: (2026)
One Law, Many Languages: Benchmarking Multilingual Legal Reasoning for Judicial Support
by: Stern, Ronja, et al.
Published: (2023)
by: Stern, Ronja, et al.
Published: (2023)
On the Limitations of Language Targeted Pruning: Investigating the Calibration Language Impact in Multilingual LLM Pruning
by: Kurz, Simon, et al.
Published: (2024)
by: Kurz, Simon, et al.
Published: (2024)
Towards Multilingual LLM Evaluation for European Languages
by: Thellmann, Klaudia, et al.
Published: (2024)
by: Thellmann, Klaudia, et al.
Published: (2024)
Large Language and Reasoning Models are Shallow Disjunctive Reasoners
by: Khalid, Irtaza, et al.
Published: (2025)
by: Khalid, Irtaza, et al.
Published: (2025)
A Systematic Survey and Critical Review on Evaluating Large Language Models: Challenges, Limitations, and Recommendations
by: Laskar, Md Tahmid Rahman, et al.
Published: (2024)
by: Laskar, Md Tahmid Rahman, et al.
Published: (2024)
Large Language Model Reasoning Failures
by: Song, Peiyang, et al.
Published: (2026)
by: Song, Peiyang, et al.
Published: (2026)
Evaluating Computational Accuracy of Large Language Models in Numerical Reasoning Tasks for Healthcare Applications
by: Malghan, Arjun R.
Published: (2025)
by: Malghan, Arjun R.
Published: (2025)
Evaluating Mathematical Reasoning of Large Language Models: A Focus on Error Identification and Correction
by: Li, Xiaoyuan, et al.
Published: (2024)
by: Li, Xiaoyuan, et al.
Published: (2024)
Omanic: Towards Step-wise Evaluation of Multi-hop Reasoning in Large Language Models
by: Gu, Xiaojie, et al.
Published: (2026)
by: Gu, Xiaojie, et al.
Published: (2026)
mCSQA: Multilingual Commonsense Reasoning Dataset with Unified Creation Strategy by Language Models and Humans
by: Sakai, Yusuke, et al.
Published: (2024)
by: Sakai, Yusuke, et al.
Published: (2024)
The Factuality of Large Language Models in the Legal Domain
by: Hamdani, Rajaa El, et al.
Published: (2024)
by: Hamdani, Rajaa El, et al.
Published: (2024)
Hallucination is Inevitable: An Innate Limitation of Large Language Models
by: Xu, Ziwei, et al.
Published: (2024)
by: Xu, Ziwei, et al.
Published: (2024)
The Limited Impact of Medical Adaptation of Large Language and Vision-Language Models
by: Jeong, Daniel P., et al.
Published: (2024)
by: Jeong, Daniel P., et al.
Published: (2024)
Compositional Causal Reasoning Evaluation in Language Models
by: Maasch, Jacqueline R. M. A., et al.
Published: (2025)
by: Maasch, Jacqueline R. M. A., et al.
Published: (2025)
Can Large Language Models Reason and Plan?
by: Kambhampati, Subbarao
Published: (2024)
by: Kambhampati, Subbarao
Published: (2024)
DivLogicEval: A Framework for Benchmarking Logical Reasoning Evaluation in Large Language Models
by: Chung, Tsz Ting, et al.
Published: (2025)
by: Chung, Tsz Ting, et al.
Published: (2025)
ThermoQA: A Three-Tier Benchmark for Evaluating Thermodynamic Reasoning in Large Language Models
by: Düzkar, Kemal
Published: (2026)
by: Düzkar, Kemal
Published: (2026)
Multilingual Prompt Engineering in Large Language Models: A Survey Across NLP Tasks
by: Vatsal, Shubham, et al.
Published: (2025)
by: Vatsal, Shubham, et al.
Published: (2025)
DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models
by: Shao, Zhihong, et al.
Published: (2024)
by: Shao, Zhihong, et al.
Published: (2024)
An Enigma of Artificial Reason: Investigating the Production-Evaluation Gap in Large Reasoning Models
by: Sun, Mingzhong, et al.
Published: (2026)
by: Sun, Mingzhong, et al.
Published: (2026)
A Multilingual Sentiment Lexicon for Low-Resource Language Translation using Large Languages Models and Explainable AI
by: Malinga, Melusi, et al.
Published: (2024)
by: Malinga, Melusi, et al.
Published: (2024)
M2Lingual: Enhancing Multilingual, Multi-Turn Instruction Alignment in Large Language Models
by: Maheshwary, Rishabh, et al.
Published: (2024)
by: Maheshwary, Rishabh, et al.
Published: (2024)
Similar Items
-
Large Language Model Selection with Limited Annotations
by: Durmazkeser, Yavuz, et al.
Published: (2026) -
Active Model Selection for Large Language Models
by: Durmazkeser, Yavuz, et al.
Published: (2025) -
COLEP: Certifiably Robust Learning-Reasoning Conformal Prediction via Probabilistic Circuits
by: Kang, Mintong, et al.
Published: (2024) -
C-RAG: Certified Generation Risks for Retrieval-Augmented Language Models
by: Kang, Mintong, et al.
Published: (2024) -
Why Do Multilingual Reasoning Gaps Emerge in Reasoning Language Models?
by: Kang, Deokhyung, et al.
Published: (2025)