KokushiMD-10: Benchmark for Evaluating Large Language Models on Ten Japanese National Healthcare Licensing Examinations
Fuente:
arXiv
Saved in:
| Main Authors: | Liu, Junyu, Yan, Kaiqi, Wang, Tianyang, Niu, Qian, Nagai-Tanima, Momoko, Aoyama, Tomoki |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Japanese AI Agent System on Human Papillomavirus Vaccination: System Design
by: Liu, Junyu, et al.
Published: (2025)
by: Liu, Junyu, et al.
Published: (2025)
JMed48k: A Multi-Profession Japanese Medical Licensing Benchmark for Vision-Language Model Evaluation
by: Xun, Yue, et al.
Published: (2026)
by: Xun, Yue, et al.
Published: (2026)
JMedEthicBench: A Multi-Turn Conversational Benchmark for Evaluating Medical Safety in Japanese Large Language Models
by: Liu, Junyu, et al.
Published: (2026)
by: Liu, Junyu, et al.
Published: (2026)
KorMedMCQA: Multi-Choice Question Answering Benchmark for Korean Healthcare Professional Licensing Examinations
by: Kweon, Sunjun, et al.
Published: (2024)
by: Kweon, Sunjun, et al.
Published: (2024)
KorMedMCQA-V: A Multimodal Benchmark for Evaluating Vision-Language Models on the Korean Medical Licensing Examination
by: Choi, Byungjin, et al.
Published: (2026)
by: Choi, Byungjin, et al.
Published: (2026)
Ebisu: Benchmarking Large Language Models in Japanese Finance
by: Peng, Xueqing, et al.
Published: (2026)
by: Peng, Xueqing, et al.
Published: (2026)
Large Language Model Benchmarks in Medical Tasks
by: Yan, Lawrence K. Q., et al.
Published: (2024)
by: Yan, Lawrence K. Q., et al.
Published: (2024)
Thermodynamical Aspects of Some Cosmological Models
by: Duary, Tanima
Published: (2024)
by: Duary, Tanima
Published: (2024)
Image schematic analysis of Bangla postpositions
by: Tanima Bagchi
Published: (2018)
by: Tanima Bagchi
Published: (2018)
Assimilating in Alternative Spaces of Possibility: A Study of Suniti Namjoshi’s Select Works
by: Tanima Shome
Published: (2017)
by: Tanima Shome
Published: (2017)
JMedBench: A Benchmark for Evaluating Japanese Biomedical Large Language Models
by: Jiang, Junfeng, et al.
Published: (2024)
by: Jiang, Junfeng, et al.
Published: (2024)
Preventive effects of hochuekkito , a traditional Japanese herbal formula comprising Atractylodis rhizoma , on anti‐ PD ‐1 antibody‐induced intestinal mucositis through the elimination of self‐reactive T cells
by: Mari Endo, et al.
Published: (2025)
by: Mari Endo, et al.
Published: (2025)
PILOT: Command-line Interface Fuzzing via Path-Guided, Iterative Large Language Model Prompting
by: Shiraishi, Momoko, et al.
Published: (2025)
by: Shiraishi, Momoko, et al.
Published: (2025)
Comprehensive Evaluation of Large Language Models for Topic Modeling
by: Doi, Tomoki, et al.
Published: (2024)
by: Doi, Tomoki, et al.
Published: (2024)
The Structural Origin of Attention Sink: Variance Discrepancy, Super Neurons, and Dimension Disparity
by: Li, Siquan, et al.
Published: (2026)
by: Li, Siquan, et al.
Published: (2026)
SmartC2Rust: Iterative, Feedback-Driven C-to-Rust Translation via Large Language Models for Safety and Equivalence
by: Shiraishi, Momoko, et al.
Published: (2024)
by: Shiraishi, Momoko, et al.
Published: (2024)
Assessing Management Measures in Large‐Scale Residential Facilities: An SNS‐Driven Evaluative Approach
by: Long Fu, et al.
Published: (2025)
by: Long Fu, et al.
Published: (2025)
Property and Propriety in the Digital Environment: Towards an Examination Copy License.
by: Kahin, Brian
Published: (1988)
by: Kahin, Brian
Published: (1988)
Model-independent reconstruction of cosmic thermodynamics and dark energy dynamics
by: Maqsood, Afaq, et al.
Published: (2026)
by: Maqsood, Afaq, et al.
Published: (2026)
Construction of a Japanese Financial Benchmark for Large Language Models
by: Hirano, Masanori
Published: (2024)
by: Hirano, Masanori
Published: (2024)
SamLP: A Customized Segment Anything Model for License Plate Detection
by: Ding, Haoxuan, et al.
Published: (2024)
by: Ding, Haoxuan, et al.
Published: (2024)
AgriEval: A Comprehensive Chinese Agricultural Benchmark for Large Language Models
by: Yan, Lian, et al.
Published: (2025)
by: Yan, Lian, et al.
Published: (2025)
Heron-Bench: A Benchmark for Evaluating Vision Language Models in Japanese
by: Inoue, Yuichi, et al.
Published: (2024)
by: Inoue, Yuichi, et al.
Published: (2024)
MedBench-IT: A Comprehensive Benchmark for Evaluating Large Language Models on Italian Medical Entrance Examinations
by: Lazzaroni, Ruggero Marino, et al.
Published: (2025)
by: Lazzaroni, Ruggero Marino, et al.
Published: (2025)
A Training-Free Framework for Video License Plate Tracking and Recognition with Only One-Shot
by: Ding, Haoxuan, et al.
Published: (2024)
by: Ding, Haoxuan, et al.
Published: (2024)
WebUIBench: A Comprehensive Benchmark for Evaluating Multimodal Large Language Models in WebUI-to-Code
by: Lin, Zhiyu, et al.
Published: (2025)
by: Lin, Zhiyu, et al.
Published: (2025)
CartoMapQA: A Fundamental Benchmark Dataset Evaluating Vision-Language Models on Cartographic Map Understanding
by: Ung, Huy Quang, et al.
Published: (2025)
by: Ung, Huy Quang, et al.
Published: (2025)
BaziQA-Benchmark: Evaluating Symbolic and Temporally Compositional Reasoning in Large Language Models
by: Chen, Jiangxi, et al.
Published: (2026)
by: Chen, Jiangxi, et al.
Published: (2026)
Securing Large Language Models: Addressing Bias, Misinformation, and Prompt Attacks
by: Peng, Benji, et al.
Published: (2024)
by: Peng, Benji, et al.
Published: (2024)
A Japanese Language Model and Three New Evaluation Benchmarks for Pharmaceutical NLP
by: Ono, Shinnosuke, et al.
Published: (2025)
by: Ono, Shinnosuke, et al.
Published: (2025)
JBBQ: Japanese Bias Benchmark for Analyzing Social Biases in Large Language Models
by: Yanaka, Hitomi, et al.
Published: (2024)
by: Yanaka, Hitomi, et al.
Published: (2024)
Collab-Overcooked: Benchmarking and Evaluating Large Language Models as Collaborative Agents
by: Sun, Haochen, et al.
Published: (2025)
by: Sun, Haochen, et al.
Published: (2025)
Protecting Aboriginal Rights and Title in Canada: A Growing Space for the United Nations Declaration on the Rights of Indigenous Peoples
by: Fumiya Nagai
Published: (2021)
by: Fumiya Nagai
Published: (2021)
Beyond MD17: the reactive xxMD dataset
by: Pengmei, Zihan, et al.
Published: (2023)
by: Pengmei, Zihan, et al.
Published: (2023)
Pronunciation Assessment with Multi-modal Large Language Models
by: Fu, Kaiqi, et al.
Published: (2024)
by: Fu, Kaiqi, et al.
Published: (2024)
Assessing and Advancing Benchmarks for Evaluating Large Language Models in Software Engineering Tasks
by: Hu, Xing, et al.
Published: (2025)
by: Hu, Xing, et al.
Published: (2025)
An Exploratory Investigation into Code License Infringements in Large Language Model Training Datasets
by: Katzy, Jonathan, et al.
Published: (2024)
by: Katzy, Jonathan, et al.
Published: (2024)
Electrochemical quartz crystal microbalance study of underpotential deposition of mercury on iridium metal and iridium oxide
by: Tsukasa Nagai, et al.
Published: (2024)
by: Tsukasa Nagai, et al.
Published: (2024)
Evaluating Multimodal Large Language Models on Vertically Written Japanese Text
by: Sasagawa, Keito, et al.
Published: (2025)
by: Sasagawa, Keito, et al.
Published: (2025)
Evaluating Modern Large Language Models on Low-Resource and Morphologically Rich Languages:A Cross-Lingual Benchmark Across Cantonese, Japanese, and Turkish
by: Xia, Chengxuan, et al.
Published: (2025)
by: Xia, Chengxuan, et al.
Published: (2025)
Similar Items
-
Japanese AI Agent System on Human Papillomavirus Vaccination: System Design
by: Liu, Junyu, et al.
Published: (2025) -
JMed48k: A Multi-Profession Japanese Medical Licensing Benchmark for Vision-Language Model Evaluation
by: Xun, Yue, et al.
Published: (2026) -
JMedEthicBench: A Multi-Turn Conversational Benchmark for Evaluating Medical Safety in Japanese Large Language Models
by: Liu, Junyu, et al.
Published: (2026) -
KorMedMCQA: Multi-Choice Question Answering Benchmark for Korean Healthcare Professional Licensing Examinations
by: Kweon, Sunjun, et al.
Published: (2024) -
KorMedMCQA-V: A Multimodal Benchmark for Evaluating Vision-Language Models on the Korean Medical Licensing Examination
by: Choi, Byungjin, et al.
Published: (2026)