Towards a Multimodal Large Language Model with Pixel-Level Insight for Biomedicine
Fuente:
arXiv
Guardado en:
| Autores principales: | Huang, Xiaoshuang, Shen, Lingdong, Liu, Jia, Shang, Fangxin, Li, Hongxiang, Huang, Haifeng, Yang, Yehui |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
A Refer-and-Ground Multimodal Large Language Model for Biomedicine
por: Huang, Xiaoshuang, et al.
Publicado: (2024)
por: Huang, Xiaoshuang, et al.
Publicado: (2024)
SegICL: A Multimodal In-context Learning Framework for Enhanced Segmentation in Medical Imaging
por: Shen, Lingdong, et al.
Publicado: (2024)
por: Shen, Lingdong, et al.
Publicado: (2024)
SynFundus-1M: A High-quality Million-scale Synthetic fundus images Dataset with Fifteen Types of Annotation
por: Shang, Fangxin, et al.
Publicado: (2023)
por: Shang, Fangxin, et al.
Publicado: (2023)
SafePLUG: Empowering Multimodal LLMs with Pixel-Level Insight and Temporal Grounding for Traffic Accident Understanding
por: Sheng, Zihao, et al.
Publicado: (2025)
por: Sheng, Zihao, et al.
Publicado: (2025)
FCMBench: The First Large-scale Financial Credit Multimodal Benchmark for Real-world Applications
por: Yang, Yehui, et al.
Publicado: (2026)
por: Yang, Yehui, et al.
Publicado: (2026)
GLaMM: Pixel Grounding Large Multimodal Model
por: Rasheed, Hanoona, et al.
Publicado: (2023)
por: Rasheed, Hanoona, et al.
Publicado: (2023)
MeteorPred: A Meteorological Multimodal Large Model and Dataset for Severe Weather Event Prediction
por: Tang, Shuo, et al.
Publicado: (2025)
por: Tang, Shuo, et al.
Publicado: (2025)
Toward Cognitive Supersensing in Multimodal Large Language Model
por: Li, Boyi, et al.
Publicado: (2026)
por: Li, Boyi, et al.
Publicado: (2026)
ChartInsights: Evaluating Multimodal Large Language Models for Low-Level Chart Question Answering
por: Wu, Yifan, et al.
Publicado: (2024)
por: Wu, Yifan, et al.
Publicado: (2024)
EPEE: Towards Efficient and Effective Foundation Models in Biomedicine
por: Zhan, Zaifu, et al.
Publicado: (2025)
por: Zhan, Zaifu, et al.
Publicado: (2025)
Robin3D: Improving 3D Large Language Model via Robust Instruction Tuning
por: Kang, Weitai, et al.
Publicado: (2024)
por: Kang, Weitai, et al.
Publicado: (2024)
Pixel-Grounded Retrieval for Knowledgeable Large Multimodal Models
por: Kim, Jeonghwan, et al.
Publicado: (2026)
por: Kim, Jeonghwan, et al.
Publicado: (2026)
PixelLM: Pixel Reasoning with Large Multimodal Model
por: Ren, Zhongwei, et al.
Publicado: (2023)
por: Ren, Zhongwei, et al.
Publicado: (2023)
Img-Diff: Contrastive Data Synthesis for Multimodal Large Language Models
por: Jiao, Qirui, et al.
Publicado: (2024)
por: Jiao, Qirui, et al.
Publicado: (2024)
GeoRSMLLM: A Multimodal Large Language Model for Vision-Language Tasks in Geoscience and Remote Sensing
por: Zhang, Zilun, et al.
Publicado: (2025)
por: Zhang, Zilun, et al.
Publicado: (2025)
FFAA: Multimodal Large Language Model based Explainable Open-World Face Forgery Analysis Assistant
por: Huang, Zhengchao, et al.
Publicado: (2024)
por: Huang, Zhengchao, et al.
Publicado: (2024)
Insight-V++: Towards Advanced Long-Chain Visual Reasoning with Multimodal Large Language Models
por: Dong, Yuhao, et al.
Publicado: (2026)
por: Dong, Yuhao, et al.
Publicado: (2026)
Text as Images: Can Multimodal Large Language Models Follow Printed Instructions in Pixels?
por: Li, Xiujun, et al.
Publicado: (2023)
por: Li, Xiujun, et al.
Publicado: (2023)
Cross-Modal Conditioned Reconstruction for Language-guided Medical Image Segmentation
por: Huang, Xiaoshuang, et al.
Publicado: (2024)
por: Huang, Xiaoshuang, et al.
Publicado: (2024)
KiToke: Kernel-based Interval-aware Token Compression for Video Large Language Models
por: Huang, Haifeng, et al.
Publicado: (2026)
por: Huang, Haifeng, et al.
Publicado: (2026)
UniPixel: Unified Object Referring and Segmentation for Pixel-Level Visual Reasoning
por: Liu, Ye, et al.
Publicado: (2025)
por: Liu, Ye, et al.
Publicado: (2025)
V-ITI: Mitigating Hallucinations in Multimodal Large Language Models via Visual Inference-Time Intervention
por: Sun, Nan, et al.
Publicado: (2025)
por: Sun, Nan, et al.
Publicado: (2025)
Context-Aware Semantic Segmentation: Enhancing Pixel-Level Understanding with Large Language Models for Advanced Vision Applications
por: Rahman, Ben
Publicado: (2025)
por: Rahman, Ben
Publicado: (2025)
Active-O3: Empowering Multimodal Large Language Models with Active Perception via GRPO
por: Zhu, Muzhi, et al.
Publicado: (2025)
por: Zhu, Muzhi, et al.
Publicado: (2025)
PixelThink: Towards Efficient Chain-of-Pixel Reasoning
por: Wang, Song, et al.
Publicado: (2025)
por: Wang, Song, et al.
Publicado: (2025)
A Survey on Evaluation of Multimodal Large Language Models
por: Huang, Jiaxing, et al.
Publicado: (2024)
por: Huang, Jiaxing, et al.
Publicado: (2024)
Humor in Pixels: Benchmarking Large Multimodal Models Understanding of Online Comics
por: Ryan, Yuriel, et al.
Publicado: (2025)
por: Ryan, Yuriel, et al.
Publicado: (2025)
Model Composition for Multimodal Large Language Models
por: Chen, Chi, et al.
Publicado: (2024)
por: Chen, Chi, et al.
Publicado: (2024)
LAST: Leveraging Tools as Hints to Enhance Spatial Reasoning for Multimodal Large Language Models
por: Tian, Shi-Yu, et al.
Publicado: (2026)
por: Tian, Shi-Yu, et al.
Publicado: (2026)
From Pixels to Insights: A Survey on Automatic Chart Understanding in the Era of Large Foundation Models
por: Huang, Kung-Hsiang, et al.
Publicado: (2024)
por: Huang, Kung-Hsiang, et al.
Publicado: (2024)
Prompt-Aware Adapter: Towards Learning Adaptive Visual Tokens for Multimodal Large Language Models
por: Zhang, Yue, et al.
Publicado: (2024)
por: Zhang, Yue, et al.
Publicado: (2024)
HybridStitch: Pixel and Timestep Level Model Stitching for Diffusion Acceleration
por: Sun, Desen, et al.
Publicado: (2026)
por: Sun, Desen, et al.
Publicado: (2026)
Temporal Insight Enhancement: Mitigating Temporal Hallucination in Multimodal Large Language Models
por: Sun, Li, et al.
Publicado: (2024)
por: Sun, Li, et al.
Publicado: (2024)
Xmodel-VLM: A Simple Baseline for Multimodal Vision Language Model
por: Xu, Wanting, et al.
Publicado: (2024)
por: Xu, Wanting, et al.
Publicado: (2024)
PiTe: Pixel-Temporal Alignment for Large Video-Language Model
por: Liu, Yang, et al.
Publicado: (2024)
por: Liu, Yang, et al.
Publicado: (2024)
Street-Level Geolocalization Using Multimodal Large Language Models and Retrieval-Augmented Generation
por: Bicakci, Yunus Serhat, et al.
Publicado: (2025)
por: Bicakci, Yunus Serhat, et al.
Publicado: (2025)
From Pixels to Words -- Towards Native Vision-Language Primitives at Scale
por: Diao, Haiwen, et al.
Publicado: (2025)
por: Diao, Haiwen, et al.
Publicado: (2025)
Divide-and-Conquer Inference for Large-Scale Visual Recognition with Multimodal Large Language Models
por: Ye, Zhipeng, et al.
Publicado: (2026)
por: Ye, Zhipeng, et al.
Publicado: (2026)
Grasp Any Region: Towards Precise, Contextual Pixel Understanding for Multimodal LLMs
por: Wang, Haochen, et al.
Publicado: (2025)
por: Wang, Haochen, et al.
Publicado: (2025)
EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models
por: Fang, Yiyang, et al.
Publicado: (2026)
por: Fang, Yiyang, et al.
Publicado: (2026)
Ejemplares similares
-
A Refer-and-Ground Multimodal Large Language Model for Biomedicine
por: Huang, Xiaoshuang, et al.
Publicado: (2024) -
SegICL: A Multimodal In-context Learning Framework for Enhanced Segmentation in Medical Imaging
por: Shen, Lingdong, et al.
Publicado: (2024) -
SynFundus-1M: A High-quality Million-scale Synthetic fundus images Dataset with Fifteen Types of Annotation
por: Shang, Fangxin, et al.
Publicado: (2023) -
SafePLUG: Empowering Multimodal LLMs with Pixel-Level Insight and Temporal Grounding for Traffic Accident Understanding
por: Sheng, Zihao, et al.
Publicado: (2025) -
FCMBench: The First Large-scale Financial Credit Multimodal Benchmark for Real-world Applications
por: Yang, Yehui, et al.
Publicado: (2026)