PILOT-Bench: A Benchmark for Legal Reasoning in the Patent Domain with IRAC-Aligned Classification Tasks
Fuente:
arXiv
Salvato in:
| Autori principali: | Jang, Yehoon, Lee, Chaewon, Min, Hyun-seok, Choi, Sungchul |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
CALRK-Bench: Evaluating Context-Aware Legal Reasoning in Korean Law
di: Jung, JiHyeok, et al.
Pubblicazione: (2026)
di: Jung, JiHyeok, et al.
Pubblicazione: (2026)
MASLegalBench: Benchmarking Multi-Agent Systems in Deductive Legal Reasoning
di: Jing, Huihao, et al.
Pubblicazione: (2025)
di: Jing, Huihao, et al.
Pubblicazione: (2025)
VLegal-Bench: Cognitively Grounded Benchmark for Vietnamese Legal Reasoning of Large Language Models
di: Dong, Nguyen Tien, et al.
Pubblicazione: (2025)
di: Dong, Nguyen Tien, et al.
Pubblicazione: (2025)
Magis-Bench: Evaluating LLMs on Magistrate-Level Legal Tasks
di: Pires, Ramon, et al.
Pubblicazione: (2026)
di: Pires, Ramon, et al.
Pubblicazione: (2026)
SOK-Bench: A Situated Video Reasoning Benchmark with Aligned Open-World Knowledge
di: Wang, Andong, et al.
Pubblicazione: (2024)
di: Wang, Andong, et al.
Pubblicazione: (2024)
Pedagogy-R1: Pedagogically-Aligned Reasoning Model with Balanced Educational Benchmark
di: Lee, Unggi, et al.
Pubblicazione: (2025)
di: Lee, Unggi, et al.
Pubblicazione: (2025)
XCR-Bench: A Multi-Task Benchmark for Evaluating Cultural Reasoning in LLMs
di: Kabir, Mohsinul, et al.
Pubblicazione: (2026)
di: Kabir, Mohsinul, et al.
Pubblicazione: (2026)
TaskBench: Benchmarking Large Language Models for Task Automation
di: Shen, Yongliang, et al.
Pubblicazione: (2023)
di: Shen, Yongliang, et al.
Pubblicazione: (2023)
A Survey of Classification Tasks and Approaches for Legal Contracts
di: Singh, Amrita, et al.
Pubblicazione: (2025)
di: Singh, Amrita, et al.
Pubblicazione: (2025)
WildBench: Benchmarking LLMs with Challenging Tasks from Real Users in the Wild
di: Lin, Bill Yuchen, et al.
Pubblicazione: (2024)
di: Lin, Bill Yuchen, et al.
Pubblicazione: (2024)
FDARxBench: Benchmarking Regulatory and Clinical Reasoning on FDA Generic Drug Assessment
di: Xiong, Betty, et al.
Pubblicazione: (2026)
di: Xiong, Betty, et al.
Pubblicazione: (2026)
Falkor-IRAC: Graph-Constrained Generation for Verified Legal Reasoning in Indian Judicial AI
di: Bose, Joy
Pubblicazione: (2026)
di: Bose, Joy
Pubblicazione: (2026)
ArgBench: Benchmarking LLMs on Computational Argumentation Tasks
di: Ajjour, Yamen, et al.
Pubblicazione: (2026)
di: Ajjour, Yamen, et al.
Pubblicazione: (2026)
Evaluation Ethics of LLMs in Legal Domain
di: Zhang, Ruizhe, et al.
Pubblicazione: (2024)
di: Zhang, Ruizhe, et al.
Pubblicazione: (2024)
LegalMidm: Use-Case-Driven Legal Domain Specialization for Korean Large Language Model
di: Jang, Youngjoon, et al.
Pubblicazione: (2026)
di: Jang, Youngjoon, et al.
Pubblicazione: (2026)
Evaluating Legal Reasoning Traces with Legal Issue Tree Rubrics
di: Lee, Jinu, et al.
Pubblicazione: (2025)
di: Lee, Jinu, et al.
Pubblicazione: (2025)
TopoBench: Benchmarking LLMs on Hard Topological Reasoning
di: Maniparambil, Mayug, et al.
Pubblicazione: (2026)
di: Maniparambil, Mayug, et al.
Pubblicazione: (2026)
Nunchi-Bench: Benchmarking Language Models on Cultural Reasoning with a Focus on Korean Superstition
di: Kim, Kyuhee, et al.
Pubblicazione: (2025)
di: Kim, Kyuhee, et al.
Pubblicazione: (2025)
PsychiatryBench: A Multi-Task Benchmark for LLMs in Psychiatry
di: Fouda, Aya E., et al.
Pubblicazione: (2025)
di: Fouda, Aya E., et al.
Pubblicazione: (2025)
UA-Legal-Bench: A Benchmark for Evaluating Large Language Models on Ukrainian Legal Reasoning
di: Ovcharov, Volodymyr
Pubblicazione: (2026)
di: Ovcharov, Volodymyr
Pubblicazione: (2026)
ECG-Reasoning-Benchmark: A Benchmark for Evaluating Clinical Reasoning Capabilities in ECG Interpretation
di: Oh, Jungwoo, et al.
Pubblicazione: (2026)
di: Oh, Jungwoo, et al.
Pubblicazione: (2026)
DALDALL: Data Augmentation for Lexical and Semantic Diverse in Legal Domain by leveraging LLM-Persona
di: Choi, Janghyeok, et al.
Pubblicazione: (2026)
di: Choi, Janghyeok, et al.
Pubblicazione: (2026)
LegalCiteBench: Evaluating Citation Reliability in Legal Language Models
di: Chen, Sijia, et al.
Pubblicazione: (2026)
di: Chen, Sijia, et al.
Pubblicazione: (2026)
IslamicLegalBench: Evaluating LLMs Knowledge and Reasoning of Islamic Law Across 1,200 Years of Islamic Pluralist Legal Traditions
di: Elmahjub, Ezieddin, et al.
Pubblicazione: (2026)
di: Elmahjub, Ezieddin, et al.
Pubblicazione: (2026)
Developing a Pragmatic Benchmark for Assessing Korean Legal Language Understanding in Large Language Models
di: Kim, Yeeun, et al.
Pubblicazione: (2024)
di: Kim, Yeeun, et al.
Pubblicazione: (2024)
Verbalized Confidence Triggers Self-Verification: Emergent Behavior Without Explicit Reasoning Supervision
di: Jang, Chaeyun, et al.
Pubblicazione: (2025)
di: Jang, Chaeyun, et al.
Pubblicazione: (2025)
AlignBench: Benchmarking Chinese Alignment of Large Language Models
di: Liu, Xiao, et al.
Pubblicazione: (2023)
di: Liu, Xiao, et al.
Pubblicazione: (2023)
HiBench: Benchmarking LLMs Capability on Hierarchical Structure Reasoning
di: Jiang, Zhuohang, et al.
Pubblicazione: (2025)
di: Jiang, Zhuohang, et al.
Pubblicazione: (2025)
FHIR-AgentBench: Benchmarking LLM Agents for Realistic Interoperable EHR Question Answering
di: Lee, Gyubok, et al.
Pubblicazione: (2025)
di: Lee, Gyubok, et al.
Pubblicazione: (2025)
Pap2Pat: Benchmarking Outline-Guided Long-Text Patent Generation with Patent-Paper Pairs
di: Knappich, Valentin, et al.
Pubblicazione: (2024)
di: Knappich, Valentin, et al.
Pubblicazione: (2024)
CodeJudgeBench: Benchmarking LLM-as-a-Judge for Coding Tasks
di: Jiang, Hongchao, et al.
Pubblicazione: (2025)
di: Jiang, Hongchao, et al.
Pubblicazione: (2025)
STELLAR: Scene Text Editor for Low-Resource Languages and Real-World Data
di: Seo, Yongdeuk, et al.
Pubblicazione: (2025)
di: Seo, Yongdeuk, et al.
Pubblicazione: (2025)
ALARB: An Arabic Legal Argument Reasoning Benchmark
di: Shairah, Harethah Abu, et al.
Pubblicazione: (2025)
di: Shairah, Harethah Abu, et al.
Pubblicazione: (2025)
PLawBench: A Rubric-Based Benchmark for Evaluating LLMs in Real-World Legal Practice
di: Shi, Yuzhen, et al.
Pubblicazione: (2026)
di: Shi, Yuzhen, et al.
Pubblicazione: (2026)
BhashaBench V1: A Comprehensive Benchmark for the Quadrant of Indic Domains
di: Devane, Vijay, et al.
Pubblicazione: (2025)
di: Devane, Vijay, et al.
Pubblicazione: (2025)
PatRe: A Full-Stage Office Action and Rebuttal Generation Benchmark for Patent Examination
di: Wang, Qiyao, et al.
Pubblicazione: (2026)
di: Wang, Qiyao, et al.
Pubblicazione: (2026)
GeoBenchX: Benchmarking LLMs in Agent Solving Multistep Geospatial Tasks
di: Krechetova, Varvara, et al.
Pubblicazione: (2025)
di: Krechetova, Varvara, et al.
Pubblicazione: (2025)
AutoPatent: A Multi-Agent Framework for Automatic Patent Generation
di: Wang, Qiyao, et al.
Pubblicazione: (2024)
di: Wang, Qiyao, et al.
Pubblicazione: (2024)
LastingBench: Defend Benchmarks Against Knowledge Leakage
di: Fang, Yixiong, et al.
Pubblicazione: (2025)
di: Fang, Yixiong, et al.
Pubblicazione: (2025)
LEXTREME: A Multi-Lingual and Multi-Task Benchmark for the Legal Domain
di: Niklaus, Joel, et al.
Pubblicazione: (2023)
di: Niklaus, Joel, et al.
Pubblicazione: (2023)
Documenti analoghi
-
CALRK-Bench: Evaluating Context-Aware Legal Reasoning in Korean Law
di: Jung, JiHyeok, et al.
Pubblicazione: (2026) -
MASLegalBench: Benchmarking Multi-Agent Systems in Deductive Legal Reasoning
di: Jing, Huihao, et al.
Pubblicazione: (2025) -
VLegal-Bench: Cognitively Grounded Benchmark for Vietnamese Legal Reasoning of Large Language Models
di: Dong, Nguyen Tien, et al.
Pubblicazione: (2025) -
Magis-Bench: Evaluating LLMs on Magistrate-Level Legal Tasks
di: Pires, Ramon, et al.
Pubblicazione: (2026) -
SOK-Bench: A Situated Video Reasoning Benchmark with Aligned Open-World Knowledge
di: Wang, Andong, et al.
Pubblicazione: (2024)