CARES: A Comprehensive Benchmark of Trustworthiness in Medical Vision Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Xia, Peng, Chen, Ze, Tian, Juanxi, Gong, Yangrui, Hou, Ruibo, Xu, Yue, Wu, Zhenbang, Fan, Zhiyuan, Zhou, Yiyang, Zhu, Kangyu, Zheng, Wenhao, Wang, Zhaoyang, Wang, Xiao, Zhang, Xuchao, Bansal, Chetan, Niethammer, Marc, Huang, Junzhou, Zhu, Hongtu, Li, Yun, Sun, Jimeng, Ge, Zongyuan, Li, Gang, Zou, James, Yao, Huaxiu |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Verifiable Format Control for Large Language Model Generations
par: Wang, Zhaoyang, et autres
Publié: (2025)
par: Wang, Zhaoyang, et autres
Publié: (2025)
MMedPO: Aligning Medical Vision-Language Models with Clinical-Aware Multimodal Preference Optimization
par: Zhu, Kangyu, et autres
Publié: (2024)
par: Zhu, Kangyu, et autres
Publié: (2024)
CREAM: Consistency Regularized Self-Rewarding Language Models
par: Wang, Zhaoyang, et autres
Publié: (2024)
par: Wang, Zhaoyang, et autres
Publié: (2024)
RULE: Reliable Multimodal RAG for Factuality in Medical Vision Language Models
par: Xia, Peng, et autres
Publié: (2024)
par: Xia, Peng, et autres
Publié: (2024)
Anyprefer: An Agentic Framework for Preference Data Synthesis
par: Zhou, Yiyang, et autres
Publié: (2025)
par: Zhou, Yiyang, et autres
Publié: (2025)
CARMO: Dynamic Criteria Generation for Context-Aware Reward Modelling
par: Gupta, Taneesh, et autres
Publié: (2024)
par: Gupta, Taneesh, et autres
Publié: (2024)
Multimodal Clinical Trial Outcome Prediction with Large Language Models
par: Zheng, Wenhao, et autres
Publié: (2024)
par: Zheng, Wenhao, et autres
Publié: (2024)
Training LLMs for EHR-Based Reasoning Tasks via Reinforcement Learning
par: Lin, Jiacheng, et autres
Publié: (2025)
par: Lin, Jiacheng, et autres
Publié: (2025)
SynthAgent: Adapting Web Agents with Synthetic Supervision
par: Wang, Zhaoyang, et autres
Publié: (2025)
par: Wang, Zhaoyang, et autres
Publié: (2025)
Generative Caching for Structurally Similar Prompts and Responses
par: Chakraborty, Sarthak, et autres
Publié: (2025)
par: Chakraborty, Sarthak, et autres
Publié: (2025)
Bridging the Reproducibility Divide: Open Source Software's Role in Standardizing Healthcare AI
par: Wu, John, et autres
Publié: (2026)
par: Wu, John, et autres
Publié: (2026)
MMed-RAG: Versatile Multimodal RAG System for Medical Vision Language Models
par: Xia, Peng, et autres
Publié: (2024)
par: Xia, Peng, et autres
Publié: (2024)
AMPO: Active Multi-Preference Optimization for Self-play Preference Selection
par: Gupta, Taneesh, et autres
Publié: (2025)
par: Gupta, Taneesh, et autres
Publié: (2025)
REFA: Reference Free Alignment for multi-preference optimization
par: Gupta, Taneesh, et autres
Publié: (2024)
par: Gupta, Taneesh, et autres
Publié: (2024)
Automated Root Causing of Cloud Incidents using In-Context Learning with GPT-4
par: Zhang, Xuchao, et autres
Publié: (2024)
par: Zhang, Xuchao, et autres
Publié: (2024)
Distribution-Free Fair Federated Learning with Small Samples
par: Yin, Qichuan, et autres
Publié: (2024)
par: Yin, Qichuan, et autres
Publié: (2024)
Drawing the Line: Enhancing Trustworthiness of MLLMs Through the Power of Refusal
par: Wang, Yuhao, et autres
Publié: (2024)
par: Wang, Yuhao, et autres
Publié: (2024)
MMIE: Massive Multimodal Interleaved Comprehension Benchmark for Large Vision-Language Models
par: Xia, Peng, et autres
Publié: (2024)
par: Xia, Peng, et autres
Publié: (2024)
Multi-Preference Optimization: Generalizing DPO via Set-Level Contrasts
par: Gupta, Taneesh, et autres
Publié: (2024)
par: Gupta, Taneesh, et autres
Publié: (2024)
WebXSkill: Skill Learning for Autonomous Web Agents
par: Wang, Zhaoyang, et autres
Publié: (2026)
par: Wang, Zhaoyang, et autres
Publié: (2026)
CARES: Comprehensive Evaluation of Safety and Adversarial Robustness in Medical LLMs
par: Chen, Sijia, et autres
Publié: (2025)
par: Chen, Sijia, et autres
Publié: (2025)
Rethinking Interactive Image Segmentation with Low Latency, High Quality, and Diverse Prompts
par: Liu, Qin, et autres
Publié: (2024)
par: Liu, Qin, et autres
Publié: (2024)
Analyzing and Mitigating Object Hallucination in Large Vision-Language Models
par: Zhou, Yiyang, et autres
Publié: (2023)
par: Zhou, Yiyang, et autres
Publié: (2023)
Calibrated Self-Rewarding Vision Language Models
par: Zhou, Yiyang, et autres
Publié: (2024)
par: Zhou, Yiyang, et autres
Publié: (2024)
Effectively Enhancing Vision Language Large Models by Prompt Augmentation and Caption Utilization
par: Zhao, Minyi, et autres
Publié: (2024)
par: Zhao, Minyi, et autres
Publié: (2024)
Generalizing to Unseen Domains in Diabetic Retinopathy with Disentangled Representations
par: Xia, Peng, et autres
Publié: (2024)
par: Xia, Peng, et autres
Publié: (2024)
Exploring LLM-based Agents for Root Cause Analysis
par: Roy, Devjeet, et autres
Publié: (2024)
par: Roy, Devjeet, et autres
Publié: (2024)
Knowing the Answer Isn't Enough: Fixing Reasoning Path Failures in LVLMs
par: Wang, Chaoyang, et autres
Publié: (2025)
par: Wang, Chaoyang, et autres
Publié: (2025)
Developmental trajectories of decision making and affective dynamics in large language models
par: Wang, Zhihao, et autres
Publié: (2025)
par: Wang, Zhihao, et autres
Publié: (2025)
Defect Detection of Prefabricated Building Components With Integrated YOLOv5s‐GhostNet
par: Xuchao Liu, et autres
Publié: (2025)
par: Xuchao Liu, et autres
Publié: (2025)
STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models
par: Liang, Yiming, et autres
Publié: (2026)
par: Liang, Yiming, et autres
Publié: (2026)
Aligning Modalities in Vision Large Language Models via Preference Fine-tuning
par: Zhou, Yiyang, et autres
Publié: (2024)
par: Zhou, Yiyang, et autres
Publié: (2024)
AI Agents and Hard Choices
par: Wang, Kangyu
Publié: (2025)
par: Wang, Kangyu
Publié: (2025)
RoboTrustBench: Benchmarking the Trustworthiness of Video World Models for Robotic Manipulation
par: Li, Huiqiong, et autres
Publié: (2026)
par: Li, Huiqiong, et autres
Publié: (2026)
Class Similarity-Based Multimodal Classification under Heterogeneous Category Sets
par: Zhu, Yangrui, et autres
Publié: (2025)
par: Zhu, Yangrui, et autres
Publié: (2025)
TrustRAG: Enhancing Robustness and Trustworthiness in Retrieval-Augmented Generation
par: Zhou, Huichi, et autres
Publié: (2025)
par: Zhou, Huichi, et autres
Publié: (2025)
Enhancing Visual-Language Modality Alignment in Large Vision Language Models via Self-Improvement
par: Wang, Xiyao, et autres
Publié: (2024)
par: Wang, Xiyao, et autres
Publié: (2024)
MMedAgent-RL: Optimizing Multi-Agent Collaboration for Multimodal Medical Reasoning
par: Xia, Peng, et autres
Publié: (2025)
par: Xia, Peng, et autres
Publié: (2025)
ReAgent-V: A Reward-Driven Multi-Agent Framework for Video Understanding
par: Zhou, Yiyang, et autres
Publié: (2025)
par: Zhou, Yiyang, et autres
Publié: (2025)
AutoTrust: Benchmarking Trustworthiness in Large Vision Language Models for Autonomous Driving
par: Xing, Shuo, et autres
Publié: (2024)
par: Xing, Shuo, et autres
Publié: (2024)
Documents similaires
-
Verifiable Format Control for Large Language Model Generations
par: Wang, Zhaoyang, et autres
Publié: (2025) -
MMedPO: Aligning Medical Vision-Language Models with Clinical-Aware Multimodal Preference Optimization
par: Zhu, Kangyu, et autres
Publié: (2024) -
CREAM: Consistency Regularized Self-Rewarding Language Models
par: Wang, Zhaoyang, et autres
Publié: (2024) -
RULE: Reliable Multimodal RAG for Factuality in Medical Vision Language Models
par: Xia, Peng, et autres
Publié: (2024) -
Anyprefer: An Agentic Framework for Preference Data Synthesis
par: Zhou, Yiyang, et autres
Publié: (2025)