Expert Evaluation of LLM's Open-Ended Legal Reasoning on the Japanese Bar Exam Writing Task
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Choi, Jungmin, Sakaguchi, Keisuke, Yamada, Hiroaki |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
JADE: Expert-Grounded Dynamic Evaluation for Open-Ended Professional Tasks
par: Lin, Lanbo, et autres
Publié: (2026)
par: Lin, Lanbo, et autres
Publié: (2026)
Japanese Tort-case Dataset for Rationale-supported Legal Judgment Prediction
par: Yamada, Hiroaki, et autres
Publié: (2023)
par: Yamada, Hiroaki, et autres
Publié: (2023)
R2-Write: Reflection and Revision for Open-Ended Writing with Deep Reasoning
par: Liu, Wanlong, et autres
Publié: (2026)
par: Liu, Wanlong, et autres
Publié: (2026)
A Llama walks into the 'Bar': Efficient Supervised Fine-Tuning for Legal Reasoning in the Multi-state Bar Exam
par: Fernandes, Rean, et autres
Publié: (2025)
par: Fernandes, Rean, et autres
Publié: (2025)
AHP-Powered LLM Reasoning for Multi-Criteria Evaluation of Open-Ended Responses
par: Lu, Xiaotian, et autres
Publié: (2024)
par: Lu, Xiaotian, et autres
Publié: (2024)
JBE-QA: Japanese Bar Exam QA Dataset for Assessing Legal Domain Knowledge
par: Cao, Zhihan, et autres
Publié: (2025)
par: Cao, Zhihan, et autres
Publié: (2025)
A Mixture-of-Experts Approach to Few-Shot Task Transfer in Open-Ended Text Worlds
par: Cui, Christopher Z., et autres
Publié: (2024)
par: Cui, Christopher Z., et autres
Publié: (2024)
Self-Training Meets Consistency: Improving LLMs' Reasoning with Consistency-Driven Rationale Evaluation
par: Lee, Jaehyeok, et autres
Publié: (2024)
par: Lee, Jaehyeok, et autres
Publié: (2024)
ModeX: Evaluator-Free Best-of-N Selection for Open-Ended Generation
par: Choi, Hyeong Kyu, et autres
Publié: (2026)
par: Choi, Hyeong Kyu, et autres
Publié: (2026)
LLM Agents Beyond Utility: An Open-Ended Perspective
par: Nachkov, Asen, et autres
Publié: (2025)
par: Nachkov, Asen, et autres
Publié: (2025)
Reverse-Engineered Reasoning for Open-Ended Generation
par: Wang, Haozhe, et autres
Publié: (2025)
par: Wang, Haozhe, et autres
Publié: (2025)
IRLBench: A Multi-modal, Culturally Grounded, Parallel Irish-English Benchmark for Open-Ended LLM Reasoning Evaluation
par: Tran, Khanh-Tung, et autres
Publié: (2025)
par: Tran, Khanh-Tung, et autres
Publié: (2025)
GPTs and Language Barrier: A Cross-Lingual Legal QA Examination
par: Nguyen, Ha-Thanh, et autres
Publié: (2024)
par: Nguyen, Ha-Thanh, et autres
Publié: (2024)
On Creativity and Open-Endedness
par: Soros, L. B., et autres
Publié: (2024)
par: Soros, L. B., et autres
Publié: (2024)
Unlocking Prompt Infilling Capability for Diffusion Language Models
par: Fujinuma, Yoshinari, et autres
Publié: (2026)
par: Fujinuma, Yoshinari, et autres
Publié: (2026)
LeMAJ (Legal LLM-as-a-Judge): Bridging Legal Reasoning and LLM Evaluation
par: Enguehard, Joseph, et autres
Publié: (2025)
par: Enguehard, Joseph, et autres
Publié: (2025)
LegalScore: Development of a Benchmark for Evaluating AI Models in Legal Career Exams in Brazil
par: Caparroz, Roberto, et autres
Publié: (2025)
par: Caparroz, Roberto, et autres
Publié: (2025)
Extending RLVR to Open-Ended Tasks via Verifiable Multiple-Choice Reformulation
par: Zhang, Mengyu, et autres
Publié: (2025)
par: Zhang, Mengyu, et autres
Publié: (2025)
Automatic Legal Writing Evaluation of LLMs
par: Pires, Ramon, et autres
Publié: (2025)
par: Pires, Ramon, et autres
Publié: (2025)
LEXam: Benchmarking Legal Reasoning on 340 Law Exams
par: Fan, Yu, et autres
Publié: (2025)
par: Fan, Yu, et autres
Publié: (2025)
Performance Evaluation of Open-Source Large Language Models for Assisting Pathology Report Writing in Japanese
par: Kawai, Masataka, et autres
Publié: (2026)
par: Kawai, Masataka, et autres
Publié: (2026)
Do LLMs Exhibit Human-Like Reasoning? Evaluating Theory of Mind in LLMs for Open-Ended Responses
par: Amirizaniani, Maryam, et autres
Publié: (2024)
par: Amirizaniani, Maryam, et autres
Publié: (2024)
OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments
par: Xie, Tianbao, et autres
Publié: (2024)
par: Xie, Tianbao, et autres
Publié: (2024)
Generation Space Size: Understanding and Calibrating Open-Endedness of LLM Generations
par: Yu, Sunny, et autres
Publié: (2025)
par: Yu, Sunny, et autres
Publié: (2025)
Progressive Multimodal Search and Reasoning for Knowledge-Intensive Visual Question Answering
par: Choi, Changin, et autres
Publié: (2025)
par: Choi, Changin, et autres
Publié: (2025)
Multi-News+: Cost-efficient Dataset Cleansing via LLM-based Data Annotation
par: Choi, Juhwan, et autres
Publié: (2024)
par: Choi, Juhwan, et autres
Publié: (2024)
Pessimistic Verification for Open Ended Math Questions
par: Huang, Yanxing, et autres
Publié: (2025)
par: Huang, Yanxing, et autres
Publié: (2025)
Embodied World Models Emerge from Navigational Task in Open-Ended Environments
par: Jin, Li, et autres
Publié: (2025)
par: Jin, Li, et autres
Publié: (2025)
Open-Ended Task Discovery via Bayesian Optimization
par: Adachi, Masaki, et autres
Publié: (2026)
par: Adachi, Masaki, et autres
Publié: (2026)
Tru-POMDP: Task Planning Under Uncertainty via Tree of Hypotheses and Open-Ended POMDPs
par: Tang, Wenjing, et autres
Publié: (2025)
par: Tang, Wenjing, et autres
Publié: (2025)
Distributional Open-Ended Evaluation of LLM Cultural Value Alignment Based on Value Codebook
par: Lee, Jaehyeok, et autres
Publié: (2026)
par: Lee, Jaehyeok, et autres
Publié: (2026)
AI Gamestore: Scalable, Open-Ended Evaluation of Machine General Intelligence with Human Games
par: Ying, Lance, et autres
Publié: (2026)
par: Ying, Lance, et autres
Publié: (2026)
Assessing the Reliability of Large Language Models in the Bengali Legal Context: A Comparative Evaluation Using LLM-as-Judge and Legal Experts
par: Aftahee, Sabik, et autres
Publié: (2025)
par: Aftahee, Sabik, et autres
Publié: (2025)
Assessing Bias in Metric Models for LLM Open-Ended Generation Bias Benchmarks
par: Demchak, Nathaniel, et autres
Publié: (2024)
par: Demchak, Nathaniel, et autres
Publié: (2024)
PILOT-Bench: A Benchmark for Legal Reasoning in the Patent Domain with IRAC-Aligned Classification Tasks
par: Jang, Yehoon, et autres
Publié: (2026)
par: Jang, Yehoon, et autres
Publié: (2026)
Self-Rewarding Rubric-Based Reinforcement Learning for Open-Ended Reasoning
par: Ye, Zhiling, et autres
Publié: (2025)
par: Ye, Zhiling, et autres
Publié: (2025)
Open-Ended Multi-Modal Relational Reasoning for Video Question Answering
par: Luo, Haozheng, et autres
Publié: (2020)
par: Luo, Haozheng, et autres
Publié: (2020)
LLM-jp: A Cross-organizational Project for the Research and Development of Fully Open Japanese LLMs
par: LLM-jp, et autres
Publié: (2024)
par: LLM-jp, et autres
Publié: (2024)
DS-STAR: Data Science Agent for Solving Diverse Tasks across Heterogeneous Formats and Open-Ended Queries
par: Nam, Jaehyun, et autres
Publié: (2025)
par: Nam, Jaehyun, et autres
Publié: (2025)
Safety Must Precede the Deployment of Open-Ended AI
par: Sheth, Ivaxi, et autres
Publié: (2025)
par: Sheth, Ivaxi, et autres
Publié: (2025)
Documents similaires
-
JADE: Expert-Grounded Dynamic Evaluation for Open-Ended Professional Tasks
par: Lin, Lanbo, et autres
Publié: (2026) -
Japanese Tort-case Dataset for Rationale-supported Legal Judgment Prediction
par: Yamada, Hiroaki, et autres
Publié: (2023) -
R2-Write: Reflection and Revision for Open-Ended Writing with Deep Reasoning
par: Liu, Wanlong, et autres
Publié: (2026) -
A Llama walks into the 'Bar': Efficient Supervised Fine-Tuning for Legal Reasoning in the Multi-state Bar Exam
par: Fernandes, Rean, et autres
Publié: (2025) -
AHP-Powered LLM Reasoning for Multi-Criteria Evaluation of Open-Ended Responses
par: Lu, Xiaotian, et autres
Publié: (2024)