KokushiMD-10: Benchmark for Evaluating Large Language Models on Ten Japanese National Healthcare Licensing Examinations
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Liu, Junyu, Yan, Kaiqi, Wang, Tianyang, Niu, Qian, Nagai-Tanima, Momoko, Aoyama, Tomoki |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Japanese AI Agent System on Human Papillomavirus Vaccination: System Design
von: Liu, Junyu, et al.
Veröffentlicht: (2025)
von: Liu, Junyu, et al.
Veröffentlicht: (2025)
JMed48k: A Multi-Profession Japanese Medical Licensing Benchmark for Vision-Language Model Evaluation
von: Xun, Yue, et al.
Veröffentlicht: (2026)
von: Xun, Yue, et al.
Veröffentlicht: (2026)
JMedEthicBench: A Multi-Turn Conversational Benchmark for Evaluating Medical Safety in Japanese Large Language Models
von: Liu, Junyu, et al.
Veröffentlicht: (2026)
von: Liu, Junyu, et al.
Veröffentlicht: (2026)
KorMedMCQA: Multi-Choice Question Answering Benchmark for Korean Healthcare Professional Licensing Examinations
von: Kweon, Sunjun, et al.
Veröffentlicht: (2024)
von: Kweon, Sunjun, et al.
Veröffentlicht: (2024)
KorMedMCQA-V: A Multimodal Benchmark for Evaluating Vision-Language Models on the Korean Medical Licensing Examination
von: Choi, Byungjin, et al.
Veröffentlicht: (2026)
von: Choi, Byungjin, et al.
Veröffentlicht: (2026)
Ebisu: Benchmarking Large Language Models in Japanese Finance
von: Peng, Xueqing, et al.
Veröffentlicht: (2026)
von: Peng, Xueqing, et al.
Veröffentlicht: (2026)
Large Language Model Benchmarks in Medical Tasks
von: Yan, Lawrence K. Q., et al.
Veröffentlicht: (2024)
von: Yan, Lawrence K. Q., et al.
Veröffentlicht: (2024)
Thermodynamical Aspects of Some Cosmological Models
von: Duary, Tanima
Veröffentlicht: (2024)
von: Duary, Tanima
Veröffentlicht: (2024)
Image schematic analysis of Bangla postpositions
von: Tanima Bagchi
Veröffentlicht: (2018)
von: Tanima Bagchi
Veröffentlicht: (2018)
Assimilating in Alternative Spaces of Possibility: A Study of Suniti Namjoshi’s Select Works
von: Tanima Shome
Veröffentlicht: (2017)
von: Tanima Shome
Veröffentlicht: (2017)
JMedBench: A Benchmark for Evaluating Japanese Biomedical Large Language Models
von: Jiang, Junfeng, et al.
Veröffentlicht: (2024)
von: Jiang, Junfeng, et al.
Veröffentlicht: (2024)
Preventive effects of hochuekkito , a traditional Japanese herbal formula comprising Atractylodis rhizoma , on anti‐ PD ‐1 antibody‐induced intestinal mucositis through the elimination of self‐reactive T cells
von: Mari Endo, et al.
Veröffentlicht: (2025)
von: Mari Endo, et al.
Veröffentlicht: (2025)
PILOT: Command-line Interface Fuzzing via Path-Guided, Iterative Large Language Model Prompting
von: Shiraishi, Momoko, et al.
Veröffentlicht: (2025)
von: Shiraishi, Momoko, et al.
Veröffentlicht: (2025)
Comprehensive Evaluation of Large Language Models for Topic Modeling
von: Doi, Tomoki, et al.
Veröffentlicht: (2024)
von: Doi, Tomoki, et al.
Veröffentlicht: (2024)
The Structural Origin of Attention Sink: Variance Discrepancy, Super Neurons, and Dimension Disparity
von: Li, Siquan, et al.
Veröffentlicht: (2026)
von: Li, Siquan, et al.
Veröffentlicht: (2026)
SmartC2Rust: Iterative, Feedback-Driven C-to-Rust Translation via Large Language Models for Safety and Equivalence
von: Shiraishi, Momoko, et al.
Veröffentlicht: (2024)
von: Shiraishi, Momoko, et al.
Veröffentlicht: (2024)
Assessing Management Measures in Large‐Scale Residential Facilities: An SNS‐Driven Evaluative Approach
von: Long Fu, et al.
Veröffentlicht: (2025)
von: Long Fu, et al.
Veröffentlicht: (2025)
Property and Propriety in the Digital Environment: Towards an Examination Copy License.
von: Kahin, Brian
Veröffentlicht: (1988)
von: Kahin, Brian
Veröffentlicht: (1988)
Model-independent reconstruction of cosmic thermodynamics and dark energy dynamics
von: Maqsood, Afaq, et al.
Veröffentlicht: (2026)
von: Maqsood, Afaq, et al.
Veröffentlicht: (2026)
Construction of a Japanese Financial Benchmark for Large Language Models
von: Hirano, Masanori
Veröffentlicht: (2024)
von: Hirano, Masanori
Veröffentlicht: (2024)
SamLP: A Customized Segment Anything Model for License Plate Detection
von: Ding, Haoxuan, et al.
Veröffentlicht: (2024)
von: Ding, Haoxuan, et al.
Veröffentlicht: (2024)
AgriEval: A Comprehensive Chinese Agricultural Benchmark for Large Language Models
von: Yan, Lian, et al.
Veröffentlicht: (2025)
von: Yan, Lian, et al.
Veröffentlicht: (2025)
Heron-Bench: A Benchmark for Evaluating Vision Language Models in Japanese
von: Inoue, Yuichi, et al.
Veröffentlicht: (2024)
von: Inoue, Yuichi, et al.
Veröffentlicht: (2024)
MedBench-IT: A Comprehensive Benchmark for Evaluating Large Language Models on Italian Medical Entrance Examinations
von: Lazzaroni, Ruggero Marino, et al.
Veröffentlicht: (2025)
von: Lazzaroni, Ruggero Marino, et al.
Veröffentlicht: (2025)
A Training-Free Framework for Video License Plate Tracking and Recognition with Only One-Shot
von: Ding, Haoxuan, et al.
Veröffentlicht: (2024)
von: Ding, Haoxuan, et al.
Veröffentlicht: (2024)
WebUIBench: A Comprehensive Benchmark for Evaluating Multimodal Large Language Models in WebUI-to-Code
von: Lin, Zhiyu, et al.
Veröffentlicht: (2025)
von: Lin, Zhiyu, et al.
Veröffentlicht: (2025)
CartoMapQA: A Fundamental Benchmark Dataset Evaluating Vision-Language Models on Cartographic Map Understanding
von: Ung, Huy Quang, et al.
Veröffentlicht: (2025)
von: Ung, Huy Quang, et al.
Veröffentlicht: (2025)
BaziQA-Benchmark: Evaluating Symbolic and Temporally Compositional Reasoning in Large Language Models
von: Chen, Jiangxi, et al.
Veröffentlicht: (2026)
von: Chen, Jiangxi, et al.
Veröffentlicht: (2026)
Securing Large Language Models: Addressing Bias, Misinformation, and Prompt Attacks
von: Peng, Benji, et al.
Veröffentlicht: (2024)
von: Peng, Benji, et al.
Veröffentlicht: (2024)
A Japanese Language Model and Three New Evaluation Benchmarks for Pharmaceutical NLP
von: Ono, Shinnosuke, et al.
Veröffentlicht: (2025)
von: Ono, Shinnosuke, et al.
Veröffentlicht: (2025)
JBBQ: Japanese Bias Benchmark for Analyzing Social Biases in Large Language Models
von: Yanaka, Hitomi, et al.
Veröffentlicht: (2024)
von: Yanaka, Hitomi, et al.
Veröffentlicht: (2024)
Collab-Overcooked: Benchmarking and Evaluating Large Language Models as Collaborative Agents
von: Sun, Haochen, et al.
Veröffentlicht: (2025)
von: Sun, Haochen, et al.
Veröffentlicht: (2025)
Protecting Aboriginal Rights and Title in Canada: A Growing Space for the United Nations Declaration on the Rights of Indigenous Peoples
von: Fumiya Nagai
Veröffentlicht: (2021)
von: Fumiya Nagai
Veröffentlicht: (2021)
Beyond MD17: the reactive xxMD dataset
von: Pengmei, Zihan, et al.
Veröffentlicht: (2023)
von: Pengmei, Zihan, et al.
Veröffentlicht: (2023)
Pronunciation Assessment with Multi-modal Large Language Models
von: Fu, Kaiqi, et al.
Veröffentlicht: (2024)
von: Fu, Kaiqi, et al.
Veröffentlicht: (2024)
Assessing and Advancing Benchmarks for Evaluating Large Language Models in Software Engineering Tasks
von: Hu, Xing, et al.
Veröffentlicht: (2025)
von: Hu, Xing, et al.
Veröffentlicht: (2025)
An Exploratory Investigation into Code License Infringements in Large Language Model Training Datasets
von: Katzy, Jonathan, et al.
Veröffentlicht: (2024)
von: Katzy, Jonathan, et al.
Veröffentlicht: (2024)
Electrochemical quartz crystal microbalance study of underpotential deposition of mercury on iridium metal and iridium oxide
von: Tsukasa Nagai, et al.
Veröffentlicht: (2024)
von: Tsukasa Nagai, et al.
Veröffentlicht: (2024)
Evaluating Multimodal Large Language Models on Vertically Written Japanese Text
von: Sasagawa, Keito, et al.
Veröffentlicht: (2025)
von: Sasagawa, Keito, et al.
Veröffentlicht: (2025)
Evaluating Modern Large Language Models on Low-Resource and Morphologically Rich Languages:A Cross-Lingual Benchmark Across Cantonese, Japanese, and Turkish
von: Xia, Chengxuan, et al.
Veröffentlicht: (2025)
von: Xia, Chengxuan, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Japanese AI Agent System on Human Papillomavirus Vaccination: System Design
von: Liu, Junyu, et al.
Veröffentlicht: (2025) -
JMed48k: A Multi-Profession Japanese Medical Licensing Benchmark for Vision-Language Model Evaluation
von: Xun, Yue, et al.
Veröffentlicht: (2026) -
JMedEthicBench: A Multi-Turn Conversational Benchmark for Evaluating Medical Safety in Japanese Large Language Models
von: Liu, Junyu, et al.
Veröffentlicht: (2026) -
KorMedMCQA: Multi-Choice Question Answering Benchmark for Korean Healthcare Professional Licensing Examinations
von: Kweon, Sunjun, et al.
Veröffentlicht: (2024) -
KorMedMCQA-V: A Multimodal Benchmark for Evaluating Vision-Language Models on the Korean Medical Licensing Examination
von: Choi, Byungjin, et al.
Veröffentlicht: (2026)