Clinical Cognition Alignment for Gastrointestinal Diagnosis with Multimodal LLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zheng, Huan, Zhou, Yucheng, Yan, Tianyi, Chen, Dubing, Lu, Hongbo, Liao, Wenlong, He, Tao, Peng, Pai, Shen, Jianbing |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Semantic Causality-Aware Vision-Based 3D Occupancy Prediction
par: Chen, Dubing, et autres
Publié: (2025)
par: Chen, Dubing, et autres
Publié: (2025)
Rethinking Temporal Fusion with a Unified Gradient Descent View for 3D Semantic Occupancy Prediction
par: Chen, Dubing, et autres
Publié: (2025)
par: Chen, Dubing, et autres
Publié: (2025)
Multimodal Large Language Models for Multi-Subject In-Context Image Generation
par: Zhou, Yucheng, et autres
Publié: (2026)
par: Zhou, Yucheng, et autres
Publié: (2026)
From Human Intention to Action Prediction: Intention-Driven End-to-End Autonomous Driving
par: Zheng, Huan, et autres
Publié: (2025)
par: Zheng, Huan, et autres
Publié: (2025)
Sim4Seg: Boosting Multimodal Multi-disease Medical Diagnosis Segmentation with Region-Aware Vision-Language Similarity Masks
par: Song, Lingran, et autres
Publié: (2025)
par: Song, Lingran, et autres
Publié: (2025)
MAM: Modular Multi-Agent Framework for Multi-Modal Medical Diagnosis via Role-Specialized Collaboration
par: Zhou, Yucheng, et autres
Publié: (2025)
par: Zhou, Yucheng, et autres
Publié: (2025)
VisionNVS: Self-Supervised Inpainting for Novel View Synthesis under the Virtual-Shift Paradigm
par: Lu, Hongbo, et autres
Publié: (2026)
par: Lu, Hongbo, et autres
Publié: (2026)
OccDirector: Language-Guided Behavior and Interaction Generation in 4D Occupancy Space
par: Liang, Zhuding, et autres
Publié: (2026)
par: Liang, Zhuding, et autres
Publié: (2026)
AdaOcc: Adaptive Forward View Transformation and Flow Modeling for 3D Occupancy and Flow Prediction
par: Chen, Dubing, et autres
Publié: (2024)
par: Chen, Dubing, et autres
Publié: (2024)
Open-Vocabulary Object Detection via Neighboring Region Attention Alignment
par: Qiang, Sunyuan, et autres
Publié: (2024)
par: Qiang, Sunyuan, et autres
Publié: (2024)
The DAWN of World-Action Interactive Models
par: Lu, Hongbo, et autres
Publié: (2026)
par: Lu, Hongbo, et autres
Publié: (2026)
Improving Medical Large Vision-Language Models with Abnormal-Aware Feedback
par: Zhou, Yucheng, et autres
Publié: (2025)
par: Zhou, Yucheng, et autres
Publié: (2025)
Breaking Down Monocular Ambiguity: Exploiting Temporal Evolution for 3D Lane Detection
par: Zheng, Huan, et autres
Publié: (2025)
par: Zheng, Huan, et autres
Publié: (2025)
Rethinking Visual Dependency in Long-Context Reasoning for Large Vision-Language Models
par: Zhou, Yucheng, et autres
Publié: (2024)
par: Zhou, Yucheng, et autres
Publié: (2024)
Visual In-Context Learning for Large Vision-Language Models
par: Zhou, Yucheng, et autres
Publié: (2024)
par: Zhou, Yucheng, et autres
Publié: (2024)
Generative Planning with 3D-vision Language Pre-training for End-to-End Autonomous Driving
par: Li, Tengpeng, et autres
Publié: (2025)
par: Li, Tengpeng, et autres
Publié: (2025)
CubeFormer: A Simple yet Effective Baseline for Lightweight Image Super-Resolution
par: Wang, Jikai, et autres
Publié: (2024)
par: Wang, Jikai, et autres
Publié: (2024)
Decoupling Fine Detail and Global Geometry for Compressed Depth Map Super-Resolution
par: Zheng, Huan, et autres
Publié: (2024)
par: Zheng, Huan, et autres
Publié: (2024)
Condition Errors Refinement in Autoregressive Image Generation with Diffusion Loss
par: Zhou, Yucheng, et autres
Publié: (2026)
par: Zhou, Yucheng, et autres
Publié: (2026)
Self-Rewarding Large Vision-Language Models for Optimizing Prompts in Text-to-Image Generation
par: Yang, Hongji, et autres
Publié: (2025)
par: Yang, Hongji, et autres
Publié: (2025)
DC-ControlNet: Decoupling Inter- and Intra-Element Conditions in Image Generation with Diffusion Models
par: Yang, Hongji, et autres
Publié: (2025)
par: Yang, Hongji, et autres
Publié: (2025)
Two Causes, Not One: Rethinking Omission and Fabrication Hallucinations in MLLMs
par: Si, Guangzong, et autres
Publié: (2025)
par: Si, Guangzong, et autres
Publié: (2025)
CogOmniControl: Reasoning-Driven Controllable Video Generation via Creative Intent Cognition
par: Yang, Hongji, et autres
Publié: (2026)
par: Yang, Hongji, et autres
Publié: (2026)
From Broad Exploration to Stable Synthesis: Entropy-Guided Optimization for Autoregressive Image Generation
par: Song, Han, et autres
Publié: (2026)
par: Song, Han, et autres
Publié: (2026)
Copiloting Diagnosis of Autism in Real Clinical Scenarios via LLMs
par: Jiang, Yi, et autres
Publié: (2024)
par: Jiang, Yi, et autres
Publié: (2024)
Towards Geometry-Aware and Motion-Guided Video Human Mesh Recovery
par: Chen, Hongjun, et autres
Publié: (2026)
par: Chen, Hongjun, et autres
Publié: (2026)
RAWMamba: Unified sRGB-to-RAW De-rendering With State Space Model
par: Chen, Hongjun, et autres
Publié: (2024)
par: Chen, Hongjun, et autres
Publié: (2024)
You Only Click Once: Single Point Weakly Supervised 3D Instance Segmentation for Autonomous Driving
par: Jiang, Guangfeng, et autres
Publié: (2025)
par: Jiang, Guangfeng, et autres
Publié: (2025)
ALOcc: Adaptive Lifting-Based 3D Semantic Occupancy and Cost Volume-Based Flow Predictions
par: Chen, Dubing, et autres
Publié: (2024)
par: Chen, Dubing, et autres
Publié: (2024)
Evolutionary Generalized Zero-Shot Learning
par: Chen, Dubing, et autres
Publié: (2022)
par: Chen, Dubing, et autres
Publié: (2022)
HiCoGen: Hierarchical Compositional Text-to-Image Generation in Diffusion Models via Reinforcement Learning
par: Yang, Hongji, et autres
Publié: (2025)
par: Yang, Hongji, et autres
Publié: (2025)
LLM Sensitivity Evaluation Framework for Clinical Diagnosis
par: Yan, Chenwei, et autres
Publié: (2025)
par: Yan, Chenwei, et autres
Publié: (2025)
Enhancing Reasoning Abilities of Small LLMs with Cognitive Alignment
par: Cai, Wenrui, et autres
Publié: (2025)
par: Cai, Wenrui, et autres
Publié: (2025)
HanMoVLM: Large Vision-Language Models for Professional Artistic Painting Evaluation
par: Yang, Hongji, et autres
Publié: (2026)
par: Yang, Hongji, et autres
Publié: (2026)
MedCare: Advancing Medical LLMs through Decoupling Clinical Alignment and Knowledge Aggregation
par: Liao, Yusheng, et autres
Publié: (2024)
par: Liao, Yusheng, et autres
Publié: (2024)
Implicit Multimodal Alignment: On the Generalization of Frozen LLMs to Multimodal Inputs
par: Shukor, Mustafa, et autres
Publié: (2024)
par: Shukor, Mustafa, et autres
Publié: (2024)
Analogical Reasoning as a Doctor: A Foundation Model for Gastrointestinal Endoscopy Diagnosis
par: Peng, Peixi, et autres
Publié: (2026)
par: Peng, Peixi, et autres
Publié: (2026)
RLGF: Reinforcement Learning with Geometric Feedback for Autonomous Driving Video Generation
par: Yan, Tianyi, et autres
Publié: (2025)
par: Yan, Tianyi, et autres
Publié: (2025)
Understanding Alignment in Multimodal LLMs: A Comprehensive Study
par: Amirloo, Elmira, et autres
Publié: (2024)
par: Amirloo, Elmira, et autres
Publié: (2024)
EmoBench-M: Benchmarking Emotional Intelligence for Multimodal Large Language Models
par: Hu, He, et autres
Publié: (2025)
par: Hu, He, et autres
Publié: (2025)
Documents similaires
-
Semantic Causality-Aware Vision-Based 3D Occupancy Prediction
par: Chen, Dubing, et autres
Publié: (2025) -
Rethinking Temporal Fusion with a Unified Gradient Descent View for 3D Semantic Occupancy Prediction
par: Chen, Dubing, et autres
Publié: (2025) -
Multimodal Large Language Models for Multi-Subject In-Context Image Generation
par: Zhou, Yucheng, et autres
Publié: (2026) -
From Human Intention to Action Prediction: Intention-Driven End-to-End Autonomous Driving
par: Zheng, Huan, et autres
Publié: (2025) -
Sim4Seg: Boosting Multimodal Multi-disease Medical Diagnosis Segmentation with Region-Aware Vision-Language Similarity Masks
par: Song, Lingran, et autres
Publié: (2025)