MedOmni-45°: A Safety-Performance Benchmark for Reasoning-Oriented LLMs in Medicine
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ji, Kaiyuan, Guo, Yijin, Zhang, Zicheng, Zhu, Xiangyang, Tian, Yuan, Liu, Ning, Zhai, Guangtao |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
A$^3$: Towards Advertising Aesthetic Assessment
par: Ji, Kaiyuan, et autres
Publié: (2026)
par: Ji, Kaiyuan, et autres
Publié: (2026)
Free-VSC: Free Semantics from Visual Foundation Models for Unsupervised Video Semantic Compression
par: Tian, Yuan, et autres
Publié: (2024)
par: Tian, Yuan, et autres
Publié: (2024)
Towards All-in-One Medical Image Re-Identification
par: Tian, Yuan, et autres
Publié: (2025)
par: Tian, Yuan, et autres
Publié: (2025)
Q-Bench+: A Benchmark for Multi-modal Foundation Models on Low-level Vision from Single Images to Pairs
par: Zhang, Zicheng, et autres
Publié: (2024)
par: Zhang, Zicheng, et autres
Publié: (2024)
Embodied Image Compression
par: Li, Chunyi, et autres
Publié: (2025)
par: Li, Chunyi, et autres
Publié: (2025)
IllusionBench+: A Large-scale and Comprehensive Benchmark for Visual Illusion Understanding in Vision-Language Models
par: Zhang, Yiming, et autres
Publié: (2025)
par: Zhang, Yiming, et autres
Publié: (2025)
Omni$^2$: Unifying Omnidirectional Image Generation and Editing in an Omni Model
par: Yang, Liu, et autres
Publié: (2025)
par: Yang, Liu, et autres
Publié: (2025)
Envisioning Beyond the Pixels: Benchmarking Reasoning-Informed Visual Editing
par: Zhao, Xiangyu, et autres
Publié: (2025)
par: Zhao, Xiangyu, et autres
Publié: (2025)
Image Quality Assessment for Embodied AI
par: Li, Chunyi, et autres
Publié: (2025)
par: Li, Chunyi, et autres
Publié: (2025)
Medical Manifestation-Aware De-Identification
par: Tian, Yuan, et autres
Publié: (2024)
par: Tian, Yuan, et autres
Publié: (2024)
A Coding Framework and Benchmark towards Low-Bitrate Video Understanding
par: Tian, Yuan, et autres
Publié: (2022)
par: Tian, Yuan, et autres
Publié: (2022)
OmniSch: A Multimodal PCB Schematic Benchmark For Structured Diagram Visual Reasoning
par: Lu, Taiting, et autres
Publié: (2026)
par: Lu, Taiting, et autres
Publié: (2026)
GOBench: Benchmarking Geometric Optics Generation and Understanding of MLLMs
par: Zhu, Xiaorong, et autres
Publié: (2025)
par: Zhu, Xiaorong, et autres
Publié: (2025)
SDEval: Safety Dynamic Evaluation for Multimodal Large Language Models
par: Wang, Hanqing, et autres
Publié: (2025)
par: Wang, Hanqing, et autres
Publié: (2025)
OmniAlign-V: Towards Enhanced Alignment of MLLMs with Human Preference
par: Zhao, Xiangyu, et autres
Publié: (2025)
par: Zhao, Xiangyu, et autres
Publié: (2025)
DHQA-4D: Perceptual Quality Assessment of Dynamic 4D Digital Human
par: Li, Yunhao, et autres
Publié: (2025)
par: Li, Yunhao, et autres
Publié: (2025)
Teaching LMMs for Image Quality Scoring and Interpreting
par: Zhang, Zicheng, et autres
Publié: (2025)
par: Zhang, Zicheng, et autres
Publié: (2025)
VideoAesBench: Benchmarking the Video Aesthetics Perception Capabilities of Large Multimodal Models
par: Li, Yunhao, et autres
Publié: (2026)
par: Li, Yunhao, et autres
Publié: (2026)
Q-Bench-Portrait: Benchmarking Multimodal Large Language Models on Portrait Image Quality Perception
par: Wu, Sijing, et autres
Publié: (2026)
par: Wu, Sijing, et autres
Publié: (2026)
Subjective-Aligned Dataset and Metric for Text-to-Video Quality Assessment
par: Kou, Tengchuan, et autres
Publié: (2024)
par: Kou, Tengchuan, et autres
Publié: (2024)
MACEval: A Multi-Agent Continual Evaluation Network for Large Models
par: Chen, Zijian, et autres
Publié: (2025)
par: Chen, Zijian, et autres
Publié: (2025)
Mitigating Low-Level Visual Hallucinations Requires Self-Awareness: Database, Model and Training Strategy
par: Sun, Yinan, et autres
Publié: (2025)
par: Sun, Yinan, et autres
Publié: (2025)
SMC++: Masked Learning of Unsupervised Video Semantic Compression
par: Tian, Yuan, et autres
Publié: (2024)
par: Tian, Yuan, et autres
Publié: (2024)
GeoR-Bench: Evaluating Geoscience Visual Reasoning
par: Zheng, Yushuo, et autres
Publié: (2026)
par: Zheng, Yushuo, et autres
Publié: (2026)
Efficient Face Image Quality Assessment via Self-training and Knowledge Distillation
par: Sun, Wei, et autres
Publié: (2025)
par: Sun, Wei, et autres
Publié: (2025)
Just Noticeable Difference for Large Multimodal Models
par: Chen, Zijian, et autres
Publié: (2025)
par: Chen, Zijian, et autres
Publié: (2025)
Human-Activity AGV Quality Assessment: A Benchmark Dataset and an Objective Evaluation Metric
par: Zhang, Zhichao, et autres
Publié: (2024)
par: Zhang, Zhichao, et autres
Publié: (2024)
GeoX-Bench: Benchmarking Cross-View Geo-Localization and Pose Estimation Capabilities of Large Multimodal Models
par: Zheng, Yushuo, et autres
Publié: (2025)
par: Zheng, Yushuo, et autres
Publié: (2025)
MedXpertQA: Benchmarking Expert-Level Medical Reasoning and Understanding
par: Zuo, Yuxin, et autres
Publié: (2025)
par: Zuo, Yuxin, et autres
Publié: (2025)
Towards Explainable Partial-AIGC Image Quality Assessment
par: Qian, Jiaying, et autres
Publié: (2025)
par: Qian, Jiaying, et autres
Publié: (2025)
OmniMedVQA: A New Large-Scale Comprehensive Evaluation Benchmark for Medical LVLM
par: Hu, Yutao, et autres
Publié: (2024)
par: Hu, Yutao, et autres
Publié: (2024)
AU-IQA: A Benchmark Dataset for Perceptual Quality Assessment of AI-Enhanced User-Generated Content
par: Wang, Shushi, et autres
Publié: (2025)
par: Wang, Shushi, et autres
Publié: (2025)
DyCoRM: Dynamic Criterion-Aware Reward Modeling for Text-to-Image Generation
par: Qian, Jiaying, et autres
Publié: (2026)
par: Qian, Jiaying, et autres
Publié: (2026)
OmniJigsaw: Enhancing Omni-Modal Reasoning via Modality-Orchestrated Reordering
par: Jia, Yiduo, et autres
Publié: (2026)
par: Jia, Yiduo, et autres
Publié: (2026)
GAIA: Rethinking Action Quality Assessment for AI-Generated Videos
par: Chen, Zijian, et autres
Publié: (2024)
par: Chen, Zijian, et autres
Publié: (2024)
Q-Bench-Video: Benchmarking the Video Quality Understanding of LMMs
par: Zhang, Zicheng, et autres
Publié: (2024)
par: Zhang, Zicheng, et autres
Publié: (2024)
SafetyFlow: An Agent-Flow System for Automated LLM Safety Benchmarking
par: Zhu, Xiangyang, et autres
Publié: (2025)
par: Zhu, Xiangyang, et autres
Publié: (2025)
Semantics versus Identity: A Divide-and-Conquer Approach towards Adjustable Medical Image De-Identification
par: Tian, Yuan, et autres
Publié: (2025)
par: Tian, Yuan, et autres
Publié: (2025)
ThinkOmni: Lifting Textual Reasoning to Omni-modal Scenarios via Guidance Decoding
par: Guan, Yiran, et autres
Publié: (2026)
par: Guan, Yiran, et autres
Publié: (2026)
MedCAL-Bench: A Comprehensive Benchmark on Cold-Start Active Learning with Foundation Models for Medical Image Analysis
par: Zhu, Ning, et autres
Publié: (2025)
par: Zhu, Ning, et autres
Publié: (2025)
Documents similaires
-
A$^3$: Towards Advertising Aesthetic Assessment
par: Ji, Kaiyuan, et autres
Publié: (2026) -
Free-VSC: Free Semantics from Visual Foundation Models for Unsupervised Video Semantic Compression
par: Tian, Yuan, et autres
Publié: (2024) -
Towards All-in-One Medical Image Re-Identification
par: Tian, Yuan, et autres
Publié: (2025) -
Q-Bench+: A Benchmark for Multi-modal Foundation Models on Low-level Vision from Single Images to Pairs
par: Zhang, Zicheng, et autres
Publié: (2024) -
Embodied Image Compression
par: Li, Chunyi, et autres
Publié: (2025)