ACE-$M^3$: Automatic Capability Evaluator for Multimodal Medical Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Xiechi, Zheng, Shunfan, Wang, Linlin, de Melo, Gerard, Cao, Zhu, Wang, Xiaoling, He, Liang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Hierarchical Divide-and-Conquer for Fine-Grained Alignment in LLM-Based Medical Evaluation
di: Zheng, Shunfan, et al.
Pubblicazione: (2025)
di: Zheng, Shunfan, et al.
Pubblicazione: (2025)
AutoMedEval: Harnessing Language Models for Automatic Medical Capability Evaluation
di: Zhang, Xiechi, et al.
Pubblicazione: (2025)
di: Zhang, Xiechi, et al.
Pubblicazione: (2025)
NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning
di: Yi, Xin, et al.
Pubblicazione: (2024)
di: Yi, Xin, et al.
Pubblicazione: (2024)
Benchmarking Egocentric Clinical Intent Understanding Capability for Medical Multimodal Large Language Models
di: Liu, Shaonan, et al.
Pubblicazione: (2026)
di: Liu, Shaonan, et al.
Pubblicazione: (2026)
LegalCiteBench: Evaluating Citation Reliability in Legal Language Models
di: Chen, Sijia, et al.
Pubblicazione: (2026)
di: Chen, Sijia, et al.
Pubblicazione: (2026)
A safety realignment framework via subspace-oriented model fusion for large language models
di: Yi, Xin, et al.
Pubblicazione: (2024)
di: Yi, Xin, et al.
Pubblicazione: (2024)
Capabilities of GPT-5 on Multimodal Medical Reasoning
di: Wang, Shansong, et al.
Pubblicazione: (2025)
di: Wang, Shansong, et al.
Pubblicazione: (2025)
Unified attacks to large language model watermarks: spoofing and scrubbing in unauthorized knowledge distillation
di: Yi, Xin, et al.
Pubblicazione: (2025)
di: Yi, Xin, et al.
Pubblicazione: (2025)
How Do Humans Write Code? Large Models Do It the Same Way Too
di: Li, Long, et al.
Pubblicazione: (2024)
di: Li, Long, et al.
Pubblicazione: (2024)
OpenToM: A Comprehensive Benchmark for Evaluating Theory-of-Mind Reasoning Capabilities of Large Language Models
di: Xu, Hainiu, et al.
Pubblicazione: (2024)
di: Xu, Hainiu, et al.
Pubblicazione: (2024)
From Construction to Injection: Edit-Based Fingerprints for Large Language Models
di: Li, Yue, et al.
Pubblicazione: (2025)
di: Li, Yue, et al.
Pubblicazione: (2025)
TCMBench: A Comprehensive Benchmark for Evaluating Large Language Models in Traditional Chinese Medicine
di: Yue, Wenjing, et al.
Pubblicazione: (2024)
di: Yue, Wenjing, et al.
Pubblicazione: (2024)
A Survey of Automatic Hallucination Evaluation on Natural Language Generation
di: Qi, Siya, et al.
Pubblicazione: (2024)
di: Qi, Siya, et al.
Pubblicazione: (2024)
MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities
di: Yu, Weihao, et al.
Pubblicazione: (2023)
di: Yu, Weihao, et al.
Pubblicazione: (2023)
Medical MLLM is Vulnerable: Cross-Modality Jailbreak and Mismatched Attacks on Medical Multimodal Large Language Models
di: Huang, Xijie, et al.
Pubblicazione: (2024)
di: Huang, Xijie, et al.
Pubblicazione: (2024)
MedFact: Benchmarking the Fact-Checking Capabilities of Large Language Models on Chinese Medical Texts
di: He, Jiayi, et al.
Pubblicazione: (2025)
di: He, Jiayi, et al.
Pubblicazione: (2025)
Advancing Multimodal Medical Capabilities of Gemini
di: Yang, Lin, et al.
Pubblicazione: (2024)
di: Yang, Lin, et al.
Pubblicazione: (2024)
Cross-Platform Evaluation of Reasoning Capabilities in Foundation Models
di: de Curtò, J., et al.
Pubblicazione: (2025)
di: de Curtò, J., et al.
Pubblicazione: (2025)
Self-Route: Automatic Mode Switching via Capability Estimation for Efficient Reasoning
di: He, Yang, et al.
Pubblicazione: (2025)
di: He, Yang, et al.
Pubblicazione: (2025)
Exploring the Capabilities of Large Multimodal Models on Dense Text
di: Zhang, Shuo, et al.
Pubblicazione: (2024)
di: Zhang, Shuo, et al.
Pubblicazione: (2024)
EmoBench-M: Benchmarking Emotional Intelligence for Multimodal Large Language Models
di: Hu, He, et al.
Pubblicazione: (2025)
di: Hu, He, et al.
Pubblicazione: (2025)
Distilling Mathematical Reasoning Capabilities into Small Language Models
di: Zhu, Xunyu, et al.
Pubblicazione: (2024)
di: Zhu, Xunyu, et al.
Pubblicazione: (2024)
IIMedGPT: Promoting Large Language Model Capabilities of Medical Tasks by Efficient Human Preference Alignment
di: Zhang, Yiming, et al.
Pubblicazione: (2025)
di: Zhang, Yiming, et al.
Pubblicazione: (2025)
M3-SLU: Evaluating Speaker-Attributed Reasoning in Multimodal Large Language Models
di: Kwon, Yejin, et al.
Pubblicazione: (2025)
di: Kwon, Yejin, et al.
Pubblicazione: (2025)
M3Kang: Evaluating Multilingual Multimodal Mathematical Reasoning in Vision-Language Models
di: Torres-Camps, Aleix, et al.
Pubblicazione: (2026)
di: Torres-Camps, Aleix, et al.
Pubblicazione: (2026)
RGAR: Recurrence Generation-augmented Retrieval for Factual-aware Medical Question Answering
di: Liang, Sichu, et al.
Pubblicazione: (2025)
di: Liang, Sichu, et al.
Pubblicazione: (2025)
Towards Evaluating Proactive Risk Awareness of Multimodal Language Models
di: Yuan, Youliang, et al.
Pubblicazione: (2025)
di: Yuan, Youliang, et al.
Pubblicazione: (2025)
MCPEval: Automatic MCP-based Deep Evaluation for AI Agent Models
di: Liu, Zhiwei, et al.
Pubblicazione: (2025)
di: Liu, Zhiwei, et al.
Pubblicazione: (2025)
Code-Vision: Evaluating Multimodal LLMs Logic Understanding and Code Generation Capabilities
di: Wang, Hanbin, et al.
Pubblicazione: (2025)
di: Wang, Hanbin, et al.
Pubblicazione: (2025)
EMRModel: A Large Language Model for Extracting Medical Consultation Dialogues into Structured Medical Records
di: Zhao, Shuguang, et al.
Pubblicazione: (2025)
di: Zhao, Shuguang, et al.
Pubblicazione: (2025)
MM-Vet v2: A Challenging Benchmark to Evaluate Large Multimodal Models for Integrated Capabilities
di: Yu, Weihao, et al.
Pubblicazione: (2024)
di: Yu, Weihao, et al.
Pubblicazione: (2024)
ToolACE-DEV: Self-Improving Tool Learning via Decomposition and EVolution
di: Huang, Xu, et al.
Pubblicazione: (2025)
di: Huang, Xu, et al.
Pubblicazione: (2025)
ToolACE-R: Model-aware Iterative Training and Adaptive Refinement for Tool Learning
di: Zeng, Xingshan, et al.
Pubblicazione: (2025)
di: Zeng, Xingshan, et al.
Pubblicazione: (2025)
PeFoMed: Parameter Efficient Fine-tuning of Multimodal Large Language Models for Medical Imaging
di: He, Jinlong, et al.
Pubblicazione: (2024)
di: He, Jinlong, et al.
Pubblicazione: (2024)
InFact: Informativeness Alignment for Improved LLM Factuality
di: Cohen, Roi, et al.
Pubblicazione: (2025)
di: Cohen, Roi, et al.
Pubblicazione: (2025)
Pretrained LLMs Learn Multiple Types of Uncertainty
di: Cohen, Roi, et al.
Pubblicazione: (2025)
di: Cohen, Roi, et al.
Pubblicazione: (2025)
CATArena: Evaluating Evolutionary Capabilities of Code Agents via Iterative Tournaments
di: Fu, Lingyue, et al.
Pubblicazione: (2025)
di: Fu, Lingyue, et al.
Pubblicazione: (2025)
Med-RewardBench: Benchmarking Reward Models and Judges for Medical Multimodal Large Language Models
di: Ding, Meidan, et al.
Pubblicazione: (2025)
di: Ding, Meidan, et al.
Pubblicazione: (2025)
When Metrics Disagree: Automatic Similarity vs. LLM-as-a-Judge for Clinical Dialogue Evaluation
di: Sun, Bian, et al.
Pubblicazione: (2026)
di: Sun, Bian, et al.
Pubblicazione: (2026)
Improving Mathematical Reasoning Capabilities of Small Language Models via Feedback-Driven Distillation
di: Zhu, Xunyu, et al.
Pubblicazione: (2024)
di: Zhu, Xunyu, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Hierarchical Divide-and-Conquer for Fine-Grained Alignment in LLM-Based Medical Evaluation
di: Zheng, Shunfan, et al.
Pubblicazione: (2025) -
AutoMedEval: Harnessing Language Models for Automatic Medical Capability Evaluation
di: Zhang, Xiechi, et al.
Pubblicazione: (2025) -
NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning
di: Yi, Xin, et al.
Pubblicazione: (2024) -
Benchmarking Egocentric Clinical Intent Understanding Capability for Medical Multimodal Large Language Models
di: Liu, Shaonan, et al.
Pubblicazione: (2026) -
LegalCiteBench: Evaluating Citation Reliability in Legal Language Models
di: Chen, Sijia, et al.
Pubblicazione: (2026)