GEM: Empowering MLLM for Grounded ECG Understanding with Time Series and Images
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lan, Xiang, Wu, Feng, He, Kai, Zhao, Qinghao, Hong, Shenda, Feng, Mengling |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Beyond Filtering: Adaptive Image-Text Quality Enhancement for MLLM Pretraining
par: Huang, Han, et autres
Publié: (2024)
par: Huang, Han, et autres
Publié: (2024)
VideoJudge: Bootstrapping Enables Scalable Supervision of MLLM-as-a-Judge for Video Understanding
par: Waheed, Abdul, et autres
Publié: (2025)
par: Waheed, Abdul, et autres
Publié: (2025)
Effective Training Data Synthesis for Improving MLLM Chart Understanding
par: Yang, Yuwei, et autres
Publié: (2025)
par: Yang, Yuwei, et autres
Publié: (2025)
Masked Training for Robust Arrhythmia Detection from Digitalized Multiple Layout ECG Images
par: Zhang, Shanwei, et autres
Publié: (2025)
par: Zhang, Shanwei, et autres
Publié: (2025)
Grounded Visual Factualization: Factual Anchor-Based Finetuning for Enhancing MLLM Factual Consistency
par: Morbiato, Filippo, et autres
Publié: (2025)
par: Morbiato, Filippo, et autres
Publié: (2025)
Improving MLLM Historical Record Extraction with Test-Time Image
par: Archibald, Taylor, et autres
Publié: (2025)
par: Archibald, Taylor, et autres
Publié: (2025)
Thinking with Programming Vision: Towards a Unified View for Thinking with Images
par: Guo, Zirun, et autres
Publié: (2025)
par: Guo, Zirun, et autres
Publié: (2025)
Natural Language Understanding and Inference with MLLM in Visual Question Answering: A Survey
par: Kuang, Jiayi, et autres
Publié: (2024)
par: Kuang, Jiayi, et autres
Publié: (2024)
Plug-and-Play Grounding of Reasoning in Multimodal Large Language Models
par: Chen, Jiaxing, et autres
Publié: (2024)
par: Chen, Jiaxing, et autres
Publié: (2024)
Multi-SpatialMLLM: Multi-Frame Spatial Understanding with Multi-Modal Large Language Models
par: Xu, Runsen, et autres
Publié: (2025)
par: Xu, Runsen, et autres
Publié: (2025)
VideoGEM: Training-free Action Grounding in Videos
par: Vogel, Felix, et autres
Publié: (2025)
par: Vogel, Felix, et autres
Publié: (2025)
ScanReason: Empowering 3D Visual Grounding with Reasoning Capabilities
par: Zhu, Chenming, et autres
Publié: (2024)
par: Zhu, Chenming, et autres
Publié: (2024)
Med-Banana-50K: A Cross-modality Large-Scale Dataset for Text-guided Medical Image Editing
par: Chen, Zhihui, et autres
Publié: (2025)
par: Chen, Zhihui, et autres
Publié: (2025)
Improving MLLM's Document Image Machine Translation via Synchronously Self-reviewing Its OCR Proficiency
par: Liang, Yupu, et autres
Publié: (2025)
par: Liang, Yupu, et autres
Publié: (2025)
Empowering Multimodal LLMs with External Tools: A Comprehensive Survey
par: An, Wenbin, et autres
Publié: (2025)
par: An, Wenbin, et autres
Publié: (2025)
ZARA: Training-Free Motion Time-Series Reasoning via Evidence-Grounded LLM Agents
par: Li, Zechen, et autres
Publié: (2025)
par: Li, Zechen, et autres
Publié: (2025)
Human-Aligned MLLM Judges for Fine-Grained Image Editing Evaluation: A Benchmark, Framework, and Analysis
par: Liu, Runzhou, et autres
Publié: (2026)
par: Liu, Runzhou, et autres
Publié: (2026)
3DCoMPaT200: Language-Grounded Compositional Understanding of Parts and Materials of 3D Shapes
par: Ahmed, Mahmoud, et autres
Publié: (2025)
par: Ahmed, Mahmoud, et autres
Publié: (2025)
Smoothing Grounding and Reasoning for MLLM-Powered GUI Agents with Query-Oriented Pivot Tasks
par: Wu, Zongru, et autres
Publié: (2025)
par: Wu, Zongru, et autres
Publié: (2025)
CultureCLIP: Empowering CLIP with Cultural Awareness through Synthetic Images and Contextualized Captions
par: Huang, Yuchen, et autres
Publié: (2025)
par: Huang, Yuchen, et autres
Publié: (2025)
Cantor: Inspiring Multimodal Chain-of-Thought of MLLM
par: Gao, Timin, et autres
Publié: (2024)
par: Gao, Timin, et autres
Publié: (2024)
VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning
par: Wang, Qiuchen, et autres
Publié: (2025)
par: Wang, Qiuchen, et autres
Publié: (2025)
IV-Bench: A Benchmark for Image-Grounded Video Perception and Reasoning in Multimodal LLMs
par: Ma, David, et autres
Publié: (2025)
par: Ma, David, et autres
Publié: (2025)
MLLM-Protector: Ensuring MLLM's Safety without Hurting Performance
par: Pi, Renjie, et autres
Publié: (2024)
par: Pi, Renjie, et autres
Publié: (2024)
Are Vision LLMs Road-Ready? A Comprehensive Benchmark for Safety-Critical Driving Video Understanding
par: Zeng, Tong, et autres
Publié: (2025)
par: Zeng, Tong, et autres
Publié: (2025)
Interpretable and Reliable Detection of AI-Generated Images via Grounded Reasoning in MLLMs
par: Ji, Yikun, et autres
Publié: (2025)
par: Ji, Yikun, et autres
Publié: (2025)
OCC-MLLM:Empowering Multimodal Large Language Model For the Understanding of Occluded Objects
par: Qiu, Wenmo, et autres
Publié: (2024)
par: Qiu, Wenmo, et autres
Publié: (2024)
TimeRefine: Temporal Grounding with Time Refining Video LLM
par: Wang, Xizi, et autres
Publié: (2024)
par: Wang, Xizi, et autres
Publié: (2024)
MLLM-as-a-Judge for Image Safety without Human Labeling
par: Wang, Zhenting, et autres
Publié: (2024)
par: Wang, Zhenting, et autres
Publié: (2024)
LLM-Bootstrapped Targeted Finding Guidance for Factual MLLM-based Medical Report Generation
par: Yang, Cunyuan, et autres
Publié: (2026)
par: Yang, Cunyuan, et autres
Publié: (2026)
FedMLLM: Federated Fine-tuning MLLM on Multimodal Heterogeneity Data
par: Xu, Binqian, et autres
Publié: (2024)
par: Xu, Binqian, et autres
Publié: (2024)
GeoAlign: Geometric Feature Realignment for MLLM Spatial Reasoning
par: Liu, Zhaochen, et autres
Publié: (2026)
par: Liu, Zhaochen, et autres
Publié: (2026)
Judge Anything: MLLM as a Judge Across Any Modality
par: Pu, Shu, et autres
Publié: (2025)
par: Pu, Shu, et autres
Publié: (2025)
DocScope: Benchmarking Verifiable Reasoning for Trustworthy Long-Document Understanding
par: Feng, Xiang, et autres
Publié: (2026)
par: Feng, Xiang, et autres
Publié: (2026)
GEM: Context-Aware Gaze EstiMation with Visual Search Behavior Matching for Chest Radiograph
par: Liu, Shaonan, et autres
Publié: (2024)
par: Liu, Shaonan, et autres
Publié: (2024)
EMOVA: Empowering Language Models to See, Hear and Speak with Vivid Emotions
par: Chen, Kai, et autres
Publié: (2024)
par: Chen, Kai, et autres
Publié: (2024)
Abstractive Visual Understanding of Multi-modal Structured Knowledge: A New Perspective for MLLM Evaluation
par: Zhang, Yichi, et autres
Publié: (2025)
par: Zhang, Yichi, et autres
Publié: (2025)
Calibrating MLLM-as-a-judge via Multimodal Bayesian Prompt Ensembles
par: Slyman, Eric, et autres
Publié: (2025)
par: Slyman, Eric, et autres
Publié: (2025)
Adaptive Markup Language Generation for Contextually-Grounded Visual Document Understanding
par: Xiao, Han, et autres
Publié: (2025)
par: Xiao, Han, et autres
Publié: (2025)
ScaleCap: Inference-Time Scalable Image Captioning via Dual-Modality Debiasing
par: Xing, Long, et autres
Publié: (2025)
par: Xing, Long, et autres
Publié: (2025)
Documents similaires
-
Beyond Filtering: Adaptive Image-Text Quality Enhancement for MLLM Pretraining
par: Huang, Han, et autres
Publié: (2024) -
VideoJudge: Bootstrapping Enables Scalable Supervision of MLLM-as-a-Judge for Video Understanding
par: Waheed, Abdul, et autres
Publié: (2025) -
Effective Training Data Synthesis for Improving MLLM Chart Understanding
par: Yang, Yuwei, et autres
Publié: (2025) -
Masked Training for Robust Arrhythmia Detection from Digitalized Multiple Layout ECG Images
par: Zhang, Shanwei, et autres
Publié: (2025) -
Grounded Visual Factualization: Factual Anchor-Based Finetuning for Enhancing MLLM Factual Consistency
par: Morbiato, Filippo, et autres
Publié: (2025)