EchoBench: Benchmarking Sycophancy in Medical Large Vision-Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Yuan, Botai, Zhou, Yutian, Wang, Yingjie, Huo, Fushuo, Jing, Yongcheng, Shen, Li, Wei, Ying, Shen, Zhiqi, Liu, Ziwei, Zhang, Tianwei, Yang, Jie, Tao, Dacheng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
On the Evolution of Federated Post-Training Large Language Models: A Model Accessibility View
di: Guo, Tao, et al.
Pubblicazione: (2025)
di: Guo, Tao, et al.
Pubblicazione: (2025)
Benchmarking Reasoning Robustness in Large Language Models
di: Yu, Tong, et al.
Pubblicazione: (2025)
di: Yu, Tong, et al.
Pubblicazione: (2025)
Benchmarking and Mitigating Sycophancy in Medical Vision Language Models
di: Xu, Juangui, et al.
Pubblicazione: (2025)
di: Xu, Juangui, et al.
Pubblicazione: (2025)
Towards Robust Multimodal Learning in the Open World
di: Huo, Fushuo
Pubblicazione: (2025)
di: Huo, Fushuo
Pubblicazione: (2025)
Erasing Without Remembering: Implicit Knowledge Forgetting in Large Language Models
di: Wang, Huazheng, et al.
Pubblicazione: (2025)
di: Wang, Huazheng, et al.
Pubblicazione: (2025)
MedCoG: Maximizing LLM Inference Density in Medical Reasoning via Meta-Cognitive Regulation
di: Zhao, Yu, et al.
Pubblicazione: (2026)
di: Zhao, Yu, et al.
Pubblicazione: (2026)
HRP: High-Rank Preheating for Superior LoRA Initialization
di: Chen, Yuzhu, et al.
Pubblicazione: (2025)
di: Chen, Yuzhu, et al.
Pubblicazione: (2025)
CoVeR: Conformal Calibration for Versatile and Reliable Autoregressive Next-Token Prediction
di: Chen, Yuzhu, et al.
Pubblicazione: (2025)
di: Chen, Yuzhu, et al.
Pubblicazione: (2025)
Graph-Augmented Reasoning: Evolving Step-by-Step Knowledge Graph Retrieval for LLM Reasoning
di: Wu, Wenjie, et al.
Pubblicazione: (2025)
di: Wu, Wenjie, et al.
Pubblicazione: (2025)
TimeGuard: Channel-wise Pool Training for Backdoor Defense in Time Series Forecasting
di: Nguyen, Quang Duc, et al.
Pubblicazione: (2026)
di: Nguyen, Quang Duc, et al.
Pubblicazione: (2026)
Self-Introspective Decoding: Alleviating Hallucinations for Large Vision-Language Models
di: Huo, Fushuo, et al.
Pubblicazione: (2024)
di: Huo, Fushuo, et al.
Pubblicazione: (2024)
REQA: Coarse-to-fine Assessment of Image Quality to Alleviate the Range Effect
di: Li, Bingheng, et al.
Pubblicazione: (2022)
di: Li, Bingheng, et al.
Pubblicazione: (2022)
MCP-SafetyBench: A Benchmark for Safety Evaluation of Large Language Models with Real-World MCP Servers
di: Zong, Xuanjun, et al.
Pubblicazione: (2025)
di: Zong, Xuanjun, et al.
Pubblicazione: (2025)
Retrieval-Augmented Perception: High-Resolution Image Perception Meets Visual RAG
di: Wang, Wenbin, et al.
Pubblicazione: (2025)
di: Wang, Wenbin, et al.
Pubblicazione: (2025)
Responsible Diffusion: A Comprehensive Survey on Safety, Ethics, and Trust in Diffusion Models
di: Wei, Kang, et al.
Pubblicazione: (2025)
di: Wei, Kang, et al.
Pubblicazione: (2025)
PoseBench: Benchmarking the Robustness of Pose Estimation Models under Corruptions
di: Ma, Sihan, et al.
Pubblicazione: (2024)
di: Ma, Sihan, et al.
Pubblicazione: (2024)
BadCLIP++: Stealthy and Persistent Backdoors in Multimodal Contrastive Learning
di: Liang, Siyuan, et al.
Pubblicazione: (2026)
di: Liang, Siyuan, et al.
Pubblicazione: (2026)
To Agree or To Be Right? The Grounding-Sycophancy Tradeoff in Medical Vision-Language Models
di: Aranya, OFM Riaz Rahman, et al.
Pubblicazione: (2026)
di: Aranya, OFM Riaz Rahman, et al.
Pubblicazione: (2026)
Distillation Traps and Guards: A Calibration Knob for LLM Distillability
di: Zhan, Weixiao, et al.
Pubblicazione: (2026)
di: Zhan, Weixiao, et al.
Pubblicazione: (2026)
EHRStruct: A Comprehensive Benchmark Framework for Evaluating Large Language Models on Structured Electronic Health Record Tasks
di: Yang, Xiao, et al.
Pubblicazione: (2025)
di: Yang, Xiao, et al.
Pubblicazione: (2025)
OOP: Object-Oriented Programming Evaluation Benchmark for Large Language Models
di: Wang, Shuai, et al.
Pubblicazione: (2024)
di: Wang, Shuai, et al.
Pubblicazione: (2024)
SteelDefectX: A Multi-Form Vision-Language Dataset and Benchmark for Steel Surface Defect Analysis
di: Zhao, Shuxian, et al.
Pubblicazione: (2026)
di: Zhao, Shuxian, et al.
Pubblicazione: (2026)
Moral Sycophancy in Vision Language Models
di: Rabby, Shadman, et al.
Pubblicazione: (2026)
di: Rabby, Shadman, et al.
Pubblicazione: (2026)
Towards Reliable Medical LLMs: Benchmarking and Enhancing Confidence Estimation of Large Language Models in Medical Consultation
di: Ren, Zhiyao, et al.
Pubblicazione: (2026)
di: Ren, Zhiyao, et al.
Pubblicazione: (2026)
ELBA-Bench: An Efficient Learning Backdoor Attacks Benchmark for Large Language Models
di: Liu, Xuxu, et al.
Pubblicazione: (2025)
di: Liu, Xuxu, et al.
Pubblicazione: (2025)
CFinBench: A Comprehensive Chinese Financial Benchmark for Large Language Models
di: Nie, Ying, et al.
Pubblicazione: (2024)
di: Nie, Ying, et al.
Pubblicazione: (2024)
VLBiasBench: A Comprehensive Benchmark for Evaluating Bias in Large Vision-Language Model
di: Wang, Sibo, et al.
Pubblicazione: (2024)
di: Wang, Sibo, et al.
Pubblicazione: (2024)
Review of Hallucination Understanding in Large Language and Vision Models
di: Ho, Zhengyi, et al.
Pubblicazione: (2025)
di: Ho, Zhengyi, et al.
Pubblicazione: (2025)
SimdBench: Benchmarking Large Language Models for SIMD-Intrinsic Code Generation
di: He, Yibo, et al.
Pubblicazione: (2025)
di: He, Yibo, et al.
Pubblicazione: (2025)
Not Your Typical Sycophant: The Elusive Nature of Sycophancy in Large Language Models
di: Natan, Shahar Ben, et al.
Pubblicazione: (2026)
di: Natan, Shahar Ben, et al.
Pubblicazione: (2026)
PENDULUM: A Benchmark for Assessing Sycophancy in Multimodal Large Language Models
di: Rahman, A. B. M. Ashikur, et al.
Pubblicazione: (2025)
di: Rahman, A. B. M. Ashikur, et al.
Pubblicazione: (2025)
CompareBench: A Benchmark for Visual Comparison Reasoning in Vision-Language Models
di: Cai, Jie, et al.
Pubblicazione: (2025)
di: Cai, Jie, et al.
Pubblicazione: (2025)
TaskBench: Benchmarking Large Language Models for Task Automation
di: Shen, Yongliang, et al.
Pubblicazione: (2023)
di: Shen, Yongliang, et al.
Pubblicazione: (2023)
ECG-Expert-QA: A Benchmark for Evaluating Medical Large Language Models in Heart Disease Diagnosis
di: Wang, Xu, et al.
Pubblicazione: (2025)
di: Wang, Xu, et al.
Pubblicazione: (2025)
Med-RewardBench: Benchmarking Reward Models and Judges for Medical Multimodal Large Language Models
di: Ding, Meidan, et al.
Pubblicazione: (2025)
di: Ding, Meidan, et al.
Pubblicazione: (2025)
FusionBench: A Unified Library and Comprehensive Benchmark for Deep Model Fusion
di: Tang, Anke, et al.
Pubblicazione: (2024)
di: Tang, Anke, et al.
Pubblicazione: (2024)
MFC-Bench: Benchmarking Multimodal Fact-Checking with Large Vision-Language Models
di: Wang, Shengkang, et al.
Pubblicazione: (2024)
di: Wang, Shengkang, et al.
Pubblicazione: (2024)
WebCoderBench: Benchmarking Web Application Generation with Comprehensive and Interpretable Evaluation Metrics
di: Liu, Chenxu, et al.
Pubblicazione: (2026)
di: Liu, Chenxu, et al.
Pubblicazione: (2026)
SafeBench: A Safety Evaluation Framework for Multimodal Large Language Models
di: Ying, Zonghao, et al.
Pubblicazione: (2024)
di: Ying, Zonghao, et al.
Pubblicazione: (2024)
Echo-α: Large Agentic Multimodal Reasoning Model for Ultrasound Interpretation
di: Zhang, Jing, et al.
Pubblicazione: (2026)
di: Zhang, Jing, et al.
Pubblicazione: (2026)
Documenti analoghi
-
On the Evolution of Federated Post-Training Large Language Models: A Model Accessibility View
di: Guo, Tao, et al.
Pubblicazione: (2025) -
Benchmarking Reasoning Robustness in Large Language Models
di: Yu, Tong, et al.
Pubblicazione: (2025) -
Benchmarking and Mitigating Sycophancy in Medical Vision Language Models
di: Xu, Juangui, et al.
Pubblicazione: (2025) -
Towards Robust Multimodal Learning in the Open World
di: Huo, Fushuo
Pubblicazione: (2025) -
Erasing Without Remembering: Implicit Knowledge Forgetting in Large Language Models
di: Wang, Huazheng, et al.
Pubblicazione: (2025)