LEXTREME: A Multi-Lingual and Multi-Task Benchmark for the Legal Domain
Fuente:
arXiv
Saved in:
| Main Authors: | Niklaus, Joel, Matoshi, Veton, Rani, Pooja, Galassi, Andrea, Stürmer, Matthias, Chalkidis, Ilias |
|---|---|
| Format: | Preprint |
| Published: |
2023
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
MultiLegalPile: A 689GB Multilingual Legal Corpus
by: Niklaus, Joel, et al.
Published: (2023)
by: Niklaus, Joel, et al.
Published: (2023)
One Law, Many Languages: Benchmarking Multilingual Legal Reasoning for Judicial Support
by: Stern, Ronja, et al.
Published: (2023)
by: Stern, Ronja, et al.
Published: (2023)
From Citations to Criticality: Predicting Legal Decision Influence in the Multilingual Swiss Jurisprudence
by: Stern, Ronja, et al.
Published: (2024)
by: Stern, Ronja, et al.
Published: (2024)
Towards Explainability and Fairness in Swiss Judgement Prediction: Benchmarking on a Multilingual Dataset
by: S, Santosh T. Y. S., et al.
Published: (2024)
by: S, Santosh T. Y. S., et al.
Published: (2024)
Anonymity at Risk? Assessing Re-Identification Capabilities of Large Language Models
by: Nyffenegger, Alex, et al.
Published: (2023)
by: Nyffenegger, Alex, et al.
Published: (2023)
Unlocking Legal Knowledge: A Multilingual Dataset for Judicial Summarization in Switzerland
by: Rolshoven, Luca, et al.
Published: (2024)
by: Rolshoven, Luca, et al.
Published: (2024)
LawInstruct: A Resource for Studying Language Model Adaptation to the Legal Domain
by: Niklaus, Joel, et al.
Published: (2024)
by: Niklaus, Joel, et al.
Published: (2024)
LEXam: Benchmarking Legal Reasoning on 340 Law Exams
by: Fan, Yu, et al.
Published: (2025)
by: Fan, Yu, et al.
Published: (2025)
SwiLTra-Bench: The Swiss Legal Translation Benchmark
by: Niklaus, Joel, et al.
Published: (2025)
by: Niklaus, Joel, et al.
Published: (2025)
HR-MultiWOZ: A Task Oriented Dialogue (TOD) Dataset for HR LLM Agent
by: Xu, Weijie, et al.
Published: (2024)
by: Xu, Weijie, et al.
Published: (2024)
Mitigating Manipulation and Enhancing Persuasion: A Reflective Multi-Agent Approach for Legal Argument Generation
by: Zhang, Li, et al.
Published: (2025)
by: Zhang, Li, et al.
Published: (2025)
Pretraining and Updates of Domain-Specific LLM: A Case Study in the Japanese Business Domain
by: Takahashi, Kosuke, et al.
Published: (2024)
by: Takahashi, Kosuke, et al.
Published: (2024)
Multi-Model Synthetic Training for Mission-Critical Small Language Models
by: Platt, Nolan, et al.
Published: (2025)
by: Platt, Nolan, et al.
Published: (2025)
MORABLES: A Benchmark for Assessing Abstract Moral Reasoning in LLMs with Fables
by: Marcuzzo, Matteo, et al.
Published: (2025)
by: Marcuzzo, Matteo, et al.
Published: (2025)
K-MetBench: A Multi-Dimensional Benchmark for Fine-Grained Evaluation of Expert Reasoning, Locality, and Multimodality in Meteorology
by: Kim, Soyeon, et al.
Published: (2026)
by: Kim, Soyeon, et al.
Published: (2026)
Multi-Task Contrastive Learning for 8192-Token Bilingual Text Embeddings
by: Mohr, Isabelle, et al.
Published: (2024)
by: Mohr, Isabelle, et al.
Published: (2024)
MetaCheckGPT -- A Multi-task Hallucination Detector Using LLM Uncertainty and Meta-models
by: Mehta, Rahul, et al.
Published: (2024)
by: Mehta, Rahul, et al.
Published: (2024)
RV-HATE: Reinforced Multi-Module Voting for Implicit Hate Speech Detection
by: Lee, Yejin, et al.
Published: (2025)
by: Lee, Yejin, et al.
Published: (2025)
Multi-chain Graph Refinement and Selection for Reliable Reasoning in Large Language Models
by: Yang, Yujiao, et al.
Published: (2025)
by: Yang, Yujiao, et al.
Published: (2025)
ADE: Adaptive Dictionary Embeddings -- Scaling Multi-Anchor Representations to Large Language Models
by: Demirci, Orhan, et al.
Published: (2026)
by: Demirci, Orhan, et al.
Published: (2026)
A Graph-based Approach for Multi-Modal Question Answering from Flowcharts in Telecom Documents
by: Soman, Sumit, et al.
Published: (2025)
by: Soman, Sumit, et al.
Published: (2025)
Prompting Encoder Models for Zero-Shot Classification: A Cross-Domain Study in Italian
by: Auriemma, Serena, et al.
Published: (2024)
by: Auriemma, Serena, et al.
Published: (2024)
Learning When to Think: Shaping Adaptive Reasoning in R1-Style Models via Multi-Stage RL
by: Tu, Songjun, et al.
Published: (2025)
by: Tu, Songjun, et al.
Published: (2025)
Raw Text is All you Need: Knowledge-intensive Multi-turn Instruction Tuning for Large Language Model
by: Hou, Xia, et al.
Published: (2024)
by: Hou, Xia, et al.
Published: (2024)
Task Complexity Matters: An Empirical Study of Reasoning in LLMs for Sentiment Analysis
by: Huang, Donghao, et al.
Published: (2026)
by: Huang, Donghao, et al.
Published: (2026)
One Agent to Serve All: a Lite-Adaptive Stylized AI Assistant for Millions of Multi-Style Official Accounts
by: Fan, Xingyu, et al.
Published: (2025)
by: Fan, Xingyu, et al.
Published: (2025)
Triad: A Framework Leveraging a Multi-Role LLM-based Agent to Solve Knowledge Base Question Answering
by: Zong, Chang, et al.
Published: (2024)
by: Zong, Chang, et al.
Published: (2024)
Prompt Tuned Embedding Classification for Multi-Label Industry Sector Allocation
by: Buchner, Valentin Leonhard, et al.
Published: (2023)
by: Buchner, Valentin Leonhard, et al.
Published: (2023)
lmfaoooo at SemEval-2026 Task 1: Humor Is an Audience. Preference Modeling for Constrained Humor Generation
by: Tikhonov, Alexey, et al.
Published: (2026)
by: Tikhonov, Alexey, et al.
Published: (2026)
LayerTracer: A Joint Task-Particle and Vulnerable-Layer Analysis framework for Arbitrary Large Language Model Architectures
by: Wu, Yuhang, et al.
Published: (2026)
by: Wu, Yuhang, et al.
Published: (2026)
ART: Adaptive Response Tuning Framework -- A Multi-Agent Tournament-Based Approach to LLM Response Optimization
by: Khan, Omer Jauhar
Published: (2025)
by: Khan, Omer Jauhar
Published: (2025)
Mitigating LLM Hallucinations through Domain-Grounded Tiered Retrieval
by: Haque, Md. Asraful, et al.
Published: (2026)
by: Haque, Md. Asraful, et al.
Published: (2026)
Unsolvability Ceiling in Multi-LLM Routing: An Empirical Study of Evaluation Artifacts
by: Garg, Saloni, et al.
Published: (2026)
by: Garg, Saloni, et al.
Published: (2026)
Pun Unintended: LLMs and the Illusion of Humor Understanding
by: Zangari, Alessandro, et al.
Published: (2025)
by: Zangari, Alessandro, et al.
Published: (2025)
The Illusion of Role Separation: Hidden Shortcuts in LLM Role Learning (and How to Fix Them)
by: Wang, Zihao, et al.
Published: (2025)
by: Wang, Zihao, et al.
Published: (2025)
Transforming and Combining Rewards for Aligning Large Language Models
by: Wang, Zihao, et al.
Published: (2024)
by: Wang, Zihao, et al.
Published: (2024)
Reasoning Promotes Robustness in Theory of Mind Tasks
by: de Haan, Ian B., et al.
Published: (2026)
by: de Haan, Ian B., et al.
Published: (2026)
TSDS: Data Selection for Task-Specific Model Finetuning
by: Liu, Zifan, et al.
Published: (2024)
by: Liu, Zifan, et al.
Published: (2024)
KIT-TIP-NLP at MultiPride: Continual Learning with Multilingual Foundation Model
by: HB, Barathi Ganesh, et al.
Published: (2026)
by: HB, Barathi Ganesh, et al.
Published: (2026)
Can Out-of-Distribution Evaluations Uncover Reliance on Shortcuts? A Case Study in Question Answering
by: Štefánik, Michal, et al.
Published: (2025)
by: Štefánik, Michal, et al.
Published: (2025)
Similar Items
-
MultiLegalPile: A 689GB Multilingual Legal Corpus
by: Niklaus, Joel, et al.
Published: (2023) -
One Law, Many Languages: Benchmarking Multilingual Legal Reasoning for Judicial Support
by: Stern, Ronja, et al.
Published: (2023) -
From Citations to Criticality: Predicting Legal Decision Influence in the Multilingual Swiss Jurisprudence
by: Stern, Ronja, et al.
Published: (2024) -
Towards Explainability and Fairness in Swiss Judgement Prediction: Benchmarking on a Multilingual Dataset
by: S, Santosh T. Y. S., et al.
Published: (2024) -
Anonymity at Risk? Assessing Re-Identification Capabilities of Large Language Models
by: Nyffenegger, Alex, et al.
Published: (2023)