CoMT: Chain-of-Medical-Thought Reduces Hallucination in Medical Report Generation
Fuente:
arXiv
Guardado en:
| Autores principales: | Jiang, Yue, Chen, Jiawei, Yang, Dingkang, Li, Mingcheng, Wang, Shunli, Wu, Tong, Li, Ke, Zhang, Lihua |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Detecting and Evaluating Medical Hallucinations in Large Vision Language Models
por: Chen, Jiawei, et al.
Publicado: (2024)
por: Chen, Jiawei, et al.
Publicado: (2024)
Can LLMs' Tuning Methods Work in Medical Multimodal Domain?
por: Chen, Jiawei, et al.
Publicado: (2024)
por: Chen, Jiawei, et al.
Publicado: (2024)
Efficiency in Focus: LayerNorm as a Catalyst for Fine-tuning Medical Visual Language Pre-trained Models
por: Chen, Jiawei, et al.
Publicado: (2024)
por: Chen, Jiawei, et al.
Publicado: (2024)
CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models
por: Cheng, Zihui, et al.
Publicado: (2024)
por: Cheng, Zihui, et al.
Publicado: (2024)
Skip and Skip: Segmenting Medical Images with Prompts
por: Chen, Jiawei, et al.
Publicado: (2024)
por: Chen, Jiawei, et al.
Publicado: (2024)
Robust Emotion Recognition in Context Debiasing
por: Yang, Dingkang, et al.
Publicado: (2024)
por: Yang, Dingkang, et al.
Publicado: (2024)
MaskBEV: Towards A Unified Framework for BEV Detection and Map Segmentation
por: Zhao, Xiao, et al.
Publicado: (2024)
por: Zhao, Xiao, et al.
Publicado: (2024)
Faster Diffusion Action Segmentation
por: Wang, Shuaibing, et al.
Publicado: (2024)
por: Wang, Shuaibing, et al.
Publicado: (2024)
HandGCAT: Occlusion-Robust 3D Hand Mesh Reconstruction from Monocular Images
por: Wang, Shuaibing, et al.
Publicado: (2024)
por: Wang, Shuaibing, et al.
Publicado: (2024)
MedCoT: Medical Chain of Thought via Hierarchical Expert
por: Liu, Jiaxiang, et al.
Publicado: (2024)
por: Liu, Jiaxiang, et al.
Publicado: (2024)
MCCD: Multi-Agent Collaboration-based Compositional Diffusion for Complex Text-to-Image Generation
por: Li, Mingcheng, et al.
Publicado: (2025)
por: Li, Mingcheng, et al.
Publicado: (2025)
MISS: A Generative Pretraining and Finetuning Approach for Med-VQA
por: Chen, Jiawei, et al.
Publicado: (2024)
por: Chen, Jiawei, et al.
Publicado: (2024)
ProFocus: Proactive Perception and Focused Reasoning in Vision-and-Language Navigation
por: Xue, Wei, et al.
Publicado: (2026)
por: Xue, Wei, et al.
Publicado: (2026)
FysicsWorld: A Unified Full-Modality Benchmark for Any-to-Any Understanding, Generation, and Reasoning
por: Jiang, Yue, et al.
Publicado: (2025)
por: Jiang, Yue, et al.
Publicado: (2025)
SatireDecoder: Visual Cascaded Decoupling for Enhancing Satirical Image Comprehension
por: Jiang, Yue, et al.
Publicado: (2025)
por: Jiang, Yue, et al.
Publicado: (2025)
Resolving Evidence Sparsity: Agentic Context Engineering for Long-Document Understanding
por: Liu, Keliang, et al.
Publicado: (2025)
por: Liu, Keliang, et al.
Publicado: (2025)
Improving Multimodal Sentiment Analysis via Modality Optimization and Dynamic Primary Modality Selection
por: Yang, Dingkang, et al.
Publicado: (2025)
por: Yang, Dingkang, et al.
Publicado: (2025)
ClinCoT: Clinical-Aware Visual Chain-of-Thought for Medical Vision Language Models
por: Liu, Xiwei, et al.
Publicado: (2026)
por: Liu, Xiwei, et al.
Publicado: (2026)
Asynchronous Multimodal Video Sequence Fusion via Learning Modality-Exclusive and -Agnostic Representations
por: Yang, Dingkang, et al.
Publicado: (2024)
por: Yang, Dingkang, et al.
Publicado: (2024)
Toward Robust Incomplete Multimodal Sentiment Analysis via Hierarchical Representation Learning
por: Li, Mingcheng, et al.
Publicado: (2024)
por: Li, Mingcheng, et al.
Publicado: (2024)
BloomScene: Lightweight Structured 3D Gaussian Splatting for Crossmodal Scene Generation
por: Hou, Xiaolu, et al.
Publicado: (2025)
por: Hou, Xiaolu, et al.
Publicado: (2025)
MM-Snowball: Evaluating and Mitigating Hallucination Snowballing in Multimodal Multi-Turn Dialogue
por: Jiang, Yue, et al.
Publicado: (2026)
por: Jiang, Yue, et al.
Publicado: (2026)
Forging a Dynamic Memory: Retrieval-Guided Continual Learning for Generalist Medical Foundation Models
por: Chen, Zizhi, et al.
Publicado: (2025)
por: Chen, Zizhi, et al.
Publicado: (2025)
OmniFysics: Towards Physical Intelligence Evolution via Omni-Modal Signal Processing and Network Optimization
por: Han, Minghao, et al.
Publicado: (2026)
por: Han, Minghao, et al.
Publicado: (2026)
SMCD: High Realism Motion Style Transfer via Mamba-based Diffusion
por: Qian, Ziyun, et al.
Publicado: (2024)
por: Qian, Ziyun, et al.
Publicado: (2024)
M3CoTBench: Benchmark Chain-of-Thought of MLLMs in Medical Image Understanding
por: Jiang, Juntao, et al.
Publicado: (2026)
por: Jiang, Juntao, et al.
Publicado: (2026)
Towards Multimodal Sentiment Analysis Debiasing via Bias Purification
por: Yang, Dingkang, et al.
Publicado: (2024)
por: Yang, Dingkang, et al.
Publicado: (2024)
Adaptive Reinforcement for Open-ended Medical Reasoning via Semantic-Guided Reward Collapse Mitigation
por: Liu, Yizhou, et al.
Publicado: (2025)
por: Liu, Yizhou, et al.
Publicado: (2025)
CoTBox-TTT: Grounding Medical VQA with Visual Chain-of-Thought Boxes During Test-time Training
por: Qian, Jiahe, et al.
Publicado: (2025)
por: Qian, Jiahe, et al.
Publicado: (2025)
Boosting Multi-modal Keyphrase Prediction with Dynamic Chain-of-Thought in Vision-Language Models
por: Ma, Qihang, et al.
Publicado: (2025)
por: Ma, Qihang, et al.
Publicado: (2025)
Understanding and Mitigating Hallucinations in Multimodal Chain-of-Thought Models
por: Ma, Ji, et al.
Publicado: (2026)
por: Ma, Ji, et al.
Publicado: (2026)
Correlation-Decoupled Knowledge Distillation for Multimodal Sentiment Analysis with Incomplete Modalities
por: Li, Mingcheng, et al.
Publicado: (2024)
por: Li, Mingcheng, et al.
Publicado: (2024)
Medical Report Generation Is A Multi-label Classification Problem
por: Fan, Yijian, et al.
Publicado: (2024)
por: Fan, Yijian, et al.
Publicado: (2024)
PersonaAnimator: Personalized Motion Transfer from Unconstrained Videos
por: Qian, Ziyun, et al.
Publicado: (2025)
por: Qian, Ziyun, et al.
Publicado: (2025)
HybridOcc: NeRF Enhanced Transformer-based Multi-Camera 3D Occupancy Prediction
por: Zhao, Xiao, et al.
Publicado: (2024)
por: Zhao, Xiao, et al.
Publicado: (2024)
Cross-Modal Causal Intervention for Medical Report Generation
por: Chen, Weixing, et al.
Publicado: (2023)
por: Chen, Weixing, et al.
Publicado: (2023)
Dynamic Traceback Learning for Medical Report Generation
por: Ye, Shuchang, et al.
Publicado: (2024)
por: Ye, Shuchang, et al.
Publicado: (2024)
CoPRS: Learning Positional Prior from Chain-of-Thought for Reasoning Segmentation
por: Lu, Zhenyu, et al.
Publicado: (2025)
por: Lu, Zhenyu, et al.
Publicado: (2025)
Seeing Through the Chain: Mitigate Hallucination in Multimodal Reasoning Models via CoT Compression and Contrastive Preference Optimization
por: Fang, Hao, et al.
Publicado: (2026)
por: Fang, Hao, et al.
Publicado: (2026)
MINT-CoT: Enabling Interleaved Visual Tokens in Mathematical Chain-of-Thought Reasoning
por: Chen, Xinyan, et al.
Publicado: (2025)
por: Chen, Xinyan, et al.
Publicado: (2025)
Ejemplares similares
-
Detecting and Evaluating Medical Hallucinations in Large Vision Language Models
por: Chen, Jiawei, et al.
Publicado: (2024) -
Can LLMs' Tuning Methods Work in Medical Multimodal Domain?
por: Chen, Jiawei, et al.
Publicado: (2024) -
Efficiency in Focus: LayerNorm as a Catalyst for Fine-tuning Medical Visual Language Pre-trained Models
por: Chen, Jiawei, et al.
Publicado: (2024) -
CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models
por: Cheng, Zihui, et al.
Publicado: (2024) -
Skip and Skip: Segmenting Medical Images with Prompts
por: Chen, Jiawei, et al.
Publicado: (2024)