UA-Legal-Bench: A Benchmark for Evaluating Large Language Models on Ukrainian Legal Reasoning
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Ovcharov, Volodymyr |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Predictive Simultaneous Interpretation: Harnessing Large Language Models for Democratizing Real-Time Multilingual Communication
par: Iida, Kurando, et autres
Publié: (2024)
par: Iida, Kurando, et autres
Publié: (2024)
Temporal Concept Drift in Legal Judgment Prediction: Neural Baselines Across Three Epochs of Ukrainian Court Decisions
par: Ovcharov, Volodymyr
Publié: (2026)
par: Ovcharov, Volodymyr
Publié: (2026)
Neural Machine Translation for Malayalam Paraphrase Generation
par: Varghese, Christeena, et autres
Publié: (2024)
par: Varghese, Christeena, et autres
Publié: (2024)
Is Our Chatbot Telling Lies? Assessing Correctness of an LLM-based Dutch Support Chatbot
par: Lassche, Herman, et autres
Publié: (2024)
par: Lassche, Herman, et autres
Publié: (2024)
On Explaining with Attention Matrices
par: Naim, Omar, et autres
Publié: (2024)
par: Naim, Omar, et autres
Publié: (2024)
Citation Grounding: Detecting and Reducing LLM Citation Hallucinations via Legal Citation Graphs
par: Ovcharov, Volodymyr
Publié: (2026)
par: Ovcharov, Volodymyr
Publié: (2026)
Semantic Decomposition and Selective Context Filtering -- Text Processing Techniques for Context-Aware NLP-Based Systems
par: Villardar, Karl John
Publié: (2025)
par: Villardar, Karl John
Publié: (2025)
Breaking the HISCO Barrier: Automatic Occupational Standardization with OccCANINE
par: Dahl, Christian Møller, et autres
Publié: (2024)
par: Dahl, Christian Møller, et autres
Publié: (2024)
Classification of descriptions and summary using multiple passes of statistical and natural language toolkits
par: Banthia, Saumya, et autres
Publié: (2020)
par: Banthia, Saumya, et autres
Publié: (2020)
Assessing Large Language Models on Islamic Legal Reasoning: Evidence from Inheritance Law Evaluation
par: Bouchekif, Abdessalam, et autres
Publié: (2025)
par: Bouchekif, Abdessalam, et autres
Publié: (2025)
LegalGuardian: A Privacy-Preserving Framework for Secure Integration of Large Language Models in Legal Practice
par: Demir, M. Mikail, et autres
Publié: (2025)
par: Demir, M. Mikail, et autres
Publié: (2025)
Can Large Language Models Grasp Legal Theories? Enhance Legal Reasoning with Insights from Multi-Agent Collaboration
par: Yuan, Weikang, et autres
Publié: (2024)
par: Yuan, Weikang, et autres
Publié: (2024)
From Benchmarking to Reasoning: A Dual-Aspect, Large-Scale Evaluation of LLMs on Vietnamese Legal Text
par: Le, Van-Truong
Publié: (2026)
par: Le, Van-Truong
Publié: (2026)
BabyReasoningBench: Generating Developmentally-Inspired Reasoning Tasks for Evaluating Baby Language Models
par: Dhole, Kaustubh D.
Publié: (2026)
par: Dhole, Kaustubh D.
Publié: (2026)
BLT: Can Large Language Models Handle Basic Legal Text?
par: Blair-Stanek, Andrew, et autres
Publié: (2023)
par: Blair-Stanek, Andrew, et autres
Publié: (2023)
Quo Vadis ChatGPT? From Large Language Models to Large Knowledge Models
par: Venkatasubramanian, Venkat, et autres
Publié: (2024)
par: Venkatasubramanian, Venkat, et autres
Publié: (2024)
Temporal Decay of Co-Citation Predictability: A 20-Year Statute Retrieval Benchmark from 396M Ukrainian Court Citations
par: Ovcharov, Volodymyr
Publié: (2026)
par: Ovcharov, Volodymyr
Publié: (2026)
Swiss-Bench SBP-002: A Frontier Model Comparison on Swiss Legal and Regulatory Tasks
par: Uenal, Fatih
Publié: (2026)
par: Uenal, Fatih
Publié: (2026)
LeCoDe: A Benchmark Dataset for Interactive Legal Consultation Dialogue Evaluation
par: Yuan, Weikang, et autres
Publié: (2025)
par: Yuan, Weikang, et autres
Publié: (2025)
EQ-Bench: An Emotional Intelligence Benchmark for Large Language Models
par: Paech, Samuel J.
Publié: (2023)
par: Paech, Samuel J.
Publié: (2023)
Text-Based Approaches to Item Difficulty Modeling in Large-Scale Assessments: A Systematic Review
par: Peters, Sydney, et autres
Publié: (2025)
par: Peters, Sydney, et autres
Publié: (2025)
LegalBench-BR: A Benchmark for Evaluating Large Language Models on Brazilian Legal Decision Classification
par: Neto, Pedro Barbosa de Carvalho
Publié: (2026)
par: Neto, Pedro Barbosa de Carvalho
Publié: (2026)
Synergy of Large Language Model and Model Driven Engineering for Automated Development of Centralized Vehicular Systems
par: Petrovic, Nenad, et autres
Publié: (2024)
par: Petrovic, Nenad, et autres
Publié: (2024)
MAWARITH: A Dataset and Benchmark for Legal Inheritance Reasoning with LLMs
par: Bouchekif, Abdessalam, et autres
Publié: (2026)
par: Bouchekif, Abdessalam, et autres
Publié: (2026)
Robustness of Large Language Models to Perturbations in Text
par: Singh, Ayush, et autres
Publié: (2024)
par: Singh, Ayush, et autres
Publié: (2024)
PrivacyBench: A Conversational Benchmark for Evaluating Privacy in Personalized AI
par: Mukhopadhyay, Srija, et autres
Publié: (2025)
par: Mukhopadhyay, Srija, et autres
Publié: (2025)
UrduBench: An Urdu Reasoning Benchmark using Contextually Ensembled Translations with Human-in-the-Loop
par: Shafique, Muhammad Ali, et autres
Publié: (2026)
par: Shafique, Muhammad Ali, et autres
Publié: (2026)
QuickSilver -- Speeding up LLM Inference through Dynamic Token Halting, KV Skipping, Contextual Token Fusion, and Adaptive Matryoshka Quantization
par: Khanna, Danush, et autres
Publié: (2025)
par: Khanna, Danush, et autres
Publié: (2025)
OpenAI Cribbed Our Tax Example, But Can GPT-4 Really Do Tax?
par: Blair-Stanek, Andrew, et autres
Publié: (2023)
par: Blair-Stanek, Andrew, et autres
Publié: (2023)
Automated MCQA Benchmarking at Scale: Evaluating Reasoning Traces as Retrieval Sources for Domain Adaptation of Small Language Models
par: Gokdemir, Ozan, et autres
Publié: (2025)
par: Gokdemir, Ozan, et autres
Publié: (2025)
ChemPro: A Progressive Chemistry Benchmark for Large Language Models
par: Baranwal, Aaditya, et autres
Publié: (2026)
par: Baranwal, Aaditya, et autres
Publié: (2026)
Exploiting LLM-as-a-Judge Disposition on Free Text Legal QA via Prompt Optimization
par: Elganayni, Mohamed Hesham, et autres
Publié: (2026)
par: Elganayni, Mohamed Hesham, et autres
Publié: (2026)
ConciseRL: Conciseness-Guided Reinforcement Learning for Efficient Reasoning Models
par: Dumitru, Razvan-Gabriel, et autres
Publié: (2025)
par: Dumitru, Razvan-Gabriel, et autres
Publié: (2025)
FIN-bench-v2: A Unified and Robust Benchmark Suite for Evaluating Finnish Large Language Models
par: Kytöniemi, Joona, et autres
Publié: (2025)
par: Kytöniemi, Joona, et autres
Publié: (2025)
RomanLens: The Role Of Latent Romanization In Multilinguality In LLMs
par: Saji, Alan, et autres
Publié: (2025)
par: Saji, Alan, et autres
Publié: (2025)
Large Language Model (LLM) Bias Index -- LLMBI
par: Oketunji, Abiodun Finbarrs, et autres
Publié: (2023)
par: Oketunji, Abiodun Finbarrs, et autres
Publié: (2023)
Evaluating the Efficacy of Hybrid Deep Learning Models in Distinguishing AI-Generated Text
par: Oketunji, Abiodun Finbarrs
Publié: (2023)
par: Oketunji, Abiodun Finbarrs
Publié: (2023)
Enigme: Generative Text Puzzles for Evaluating Reasoning in Language Models
par: Hawkins, John
Publié: (2025)
par: Hawkins, John
Publié: (2025)
Reasoning over Uncertain Text by Generative Large Language Models
par: Nafar, Aliakbar, et autres
Publié: (2024)
par: Nafar, Aliakbar, et autres
Publié: (2024)
Mining Large Language Models for Low-Resource Language Data: Comparing Elicitation Strategies for Hausa and Fongbe
par: Adjovi, Mahounan Pericles, et autres
Publié: (2026)
par: Adjovi, Mahounan Pericles, et autres
Publié: (2026)
Documents similaires
-
Predictive Simultaneous Interpretation: Harnessing Large Language Models for Democratizing Real-Time Multilingual Communication
par: Iida, Kurando, et autres
Publié: (2024) -
Temporal Concept Drift in Legal Judgment Prediction: Neural Baselines Across Three Epochs of Ukrainian Court Decisions
par: Ovcharov, Volodymyr
Publié: (2026) -
Neural Machine Translation for Malayalam Paraphrase Generation
par: Varghese, Christeena, et autres
Publié: (2024) -
Is Our Chatbot Telling Lies? Assessing Correctness of an LLM-based Dutch Support Chatbot
par: Lassche, Herman, et autres
Publié: (2024) -
On Explaining with Attention Matrices
par: Naim, Omar, et autres
Publié: (2024)