RoiMAM: Region-of-Interest Medical Attention Model for Efficient Vision-Language Understanding
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Yang, Jiayan, Wu, Zhuoyu, Fang, Wenqi |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
RT-Focuser: A Real-Time Lightweight Model for Edge-side Image Deblurring
von: Wu, Zhuoyu, et al.
Veröffentlicht: (2025)
von: Wu, Zhuoyu, et al.
Veröffentlicht: (2025)
GPT4RoI: Instruction Tuning Large Language Model on Region-of-Interest
von: Zhang, Shilong, et al.
Veröffentlicht: (2023)
von: Zhang, Shilong, et al.
Veröffentlicht: (2023)
EndoCaver: Handling Fog, Blur and Glare in Endoscopic Images via Joint Deblurring-Segmentation
von: Wu, Zhuoyu, et al.
Veröffentlicht: (2026)
von: Wu, Zhuoyu, et al.
Veröffentlicht: (2026)
PAM-UNet: Shifting Attention on Region of Interest in Medical Images
von: Das, Abhijit, et al.
Veröffentlicht: (2024)
von: Das, Abhijit, et al.
Veröffentlicht: (2024)
RegionGPT: Towards Region Understanding Vision Language Model
von: Guo, Qiushan, et al.
Veröffentlicht: (2024)
von: Guo, Qiushan, et al.
Veröffentlicht: (2024)
EVLM: An Efficient Vision-Language Model for Visual Understanding
von: Chen, Kaibing, et al.
Veröffentlicht: (2024)
von: Chen, Kaibing, et al.
Veröffentlicht: (2024)
MAM-CLIP: Vision-Language Pretraining on Mammography Atlases for BI-RADS Classification
von: Gulluk, Halil Ibrahim, et al.
Veröffentlicht: (2026)
von: Gulluk, Halil Ibrahim, et al.
Veröffentlicht: (2026)
Hulu-Med: A Transparent Generalist Model towards Holistic Medical Vision-Language Understanding
von: Jiang, Songtao, et al.
Veröffentlicht: (2025)
von: Jiang, Songtao, et al.
Veröffentlicht: (2025)
Privacy-Preserving Automated Rosacea Detection Based on Medically Inspired Region of Interest Selection
von: Yang, Chengyu, et al.
Veröffentlicht: (2025)
von: Yang, Chengyu, et al.
Veröffentlicht: (2025)
Semantically Grounded QFormer for Efficient Vision Language Understanding
von: Choraria, Moulik, et al.
Veröffentlicht: (2023)
von: Choraria, Moulik, et al.
Veröffentlicht: (2023)
PixelVLA: Advancing Pixel-level Understanding in Vision-Language-Action Model
von: Liang, Wenqi, et al.
Veröffentlicht: (2025)
von: Liang, Wenqi, et al.
Veröffentlicht: (2025)
FlexAttention for Efficient High-Resolution Vision-Language Models
von: Li, Junyan, et al.
Veröffentlicht: (2024)
von: Li, Junyan, et al.
Veröffentlicht: (2024)
SEAGULL: No-reference Image Quality Assessment for Regions of Interest via Vision-Language Instruction Tuning
von: Chen, Zewen, et al.
Veröffentlicht: (2024)
von: Chen, Zewen, et al.
Veröffentlicht: (2024)
Toward Interactive Regional Understanding in Vision-Large Language Models
von: Lee, Jungbeom, et al.
Veröffentlicht: (2024)
von: Lee, Jungbeom, et al.
Veröffentlicht: (2024)
MedROI: Codec-Agnostic Region of Interest-Centric Compression for Medical Images
von: Kim, Jiwon, et al.
Veröffentlicht: (2026)
von: Kim, Jiwon, et al.
Veröffentlicht: (2026)
Understanding Degradation with Vision Language Model
von: Lan, Guanzhou, et al.
Veröffentlicht: (2026)
von: Lan, Guanzhou, et al.
Veröffentlicht: (2026)
NEARL-CLIP: Interacted Query Adaptation with Orthogonal Regularization for Medical Vision-Language Understanding
von: Peng, Zelin, et al.
Veröffentlicht: (2025)
von: Peng, Zelin, et al.
Veröffentlicht: (2025)
Focus on What Matters: Enhancing Medical Vision-Language Models with Automatic Attention Alignment Tuning
von: Chang, Aofei, et al.
Veröffentlicht: (2025)
von: Chang, Aofei, et al.
Veröffentlicht: (2025)
MMIU: Multimodal Multi-image Understanding for Evaluating Large Vision-Language Models
von: Meng, Fanqing, et al.
Veröffentlicht: (2024)
von: Meng, Fanqing, et al.
Veröffentlicht: (2024)
Region of Interest based Medical Image Compression
von: Srivastava, Utkarsh Prakash, et al.
Veröffentlicht: (2025)
von: Srivastava, Utkarsh Prakash, et al.
Veröffentlicht: (2025)
Event-Priori-Based Vision-Language Model for Efficient Visual Understanding
von: Qin, Haotong, et al.
Veröffentlicht: (2025)
von: Qin, Haotong, et al.
Veröffentlicht: (2025)
Detecting and Evaluating Medical Hallucinations in Large Vision Language Models
von: Chen, Jiawei, et al.
Veröffentlicht: (2024)
von: Chen, Jiawei, et al.
Veröffentlicht: (2024)
HiPrune: Hierarchical Attention for Efficient Token Pruning in Vision-Language Models
von: Liu, Jizhihui, et al.
Veröffentlicht: (2025)
von: Liu, Jizhihui, et al.
Veröffentlicht: (2025)
Cross-Modal Attention Guided Unlearning in Vision-Language Models
von: Bhaila, Karuna, et al.
Veröffentlicht: (2025)
von: Bhaila, Karuna, et al.
Veröffentlicht: (2025)
Towards Vision-Language-Garment Models for Web Knowledge Garment Understanding and Generation
von: Ackermann, Jan, et al.
Veröffentlicht: (2025)
von: Ackermann, Jan, et al.
Veröffentlicht: (2025)
Attention Guided Alignment in Efficient Vision-Language Models
von: Mahajan, Shweta, et al.
Veröffentlicht: (2025)
von: Mahajan, Shweta, et al.
Veröffentlicht: (2025)
RegionMed-CLIP: A Region-Aware Multimodal Contrastive Learning Pre-trained Model for Medical Image Understanding
von: Fang, Tianchen, et al.
Veröffentlicht: (2025)
von: Fang, Tianchen, et al.
Veröffentlicht: (2025)
TCSAFormer: Efficient Vision Transformer with Token Compression and Sparse Attention for Medical Image Segmentation
von: Xia, Zunhui, et al.
Veröffentlicht: (2025)
von: Xia, Zunhui, et al.
Veröffentlicht: (2025)
VILA-M3: Enhancing Vision-Language Models with Medical Expert Knowledge
von: Nath, Vishwesh, et al.
Veröffentlicht: (2024)
von: Nath, Vishwesh, et al.
Veröffentlicht: (2024)
Particle-Based Shape Modeling for Arbitrary Regions-of-Interest
von: Xu, Hong, et al.
Veröffentlicht: (2023)
von: Xu, Hong, et al.
Veröffentlicht: (2023)
Remodeling Semantic Relationships in Vision-Language Fine-Tuning
von: Wu, Xiangyang, et al.
Veröffentlicht: (2025)
von: Wu, Xiangyang, et al.
Veröffentlicht: (2025)
Optimizing Vision-Language Consistency via Cross-Layer Regional Attention Alignment
von: Wang, Yifan, et al.
Veröffentlicht: (2025)
von: Wang, Yifan, et al.
Veröffentlicht: (2025)
MMCLIP: Cross-modal Attention Masked Modelling for Medical Language-Image Pre-Training
von: Wu, Biao, et al.
Veröffentlicht: (2024)
von: Wu, Biao, et al.
Veröffentlicht: (2024)
HSCR: Hierarchical Self-Contrastive Rewarding for Aligning Medical Vision Language Models
von: Jiang, Songtao, et al.
Veröffentlicht: (2025)
von: Jiang, Songtao, et al.
Veröffentlicht: (2025)
Segmenting and Understanding: Region-aware Semantic Attention for Fine-grained Image Quality Assessment with Large Language Models
von: Song, Chenyue, et al.
Veröffentlicht: (2025)
von: Song, Chenyue, et al.
Veröffentlicht: (2025)
Enhanced Vision-Language Models for Diverse Sensor Understanding: Cost-Efficient Optimization and Benchmarking
von: Chung, Sangyun, et al.
Veröffentlicht: (2024)
von: Chung, Sangyun, et al.
Veröffentlicht: (2024)
EAGLE: An Efficient Global Attention Lesion Segmentation Model for Hepatic Echinococcosis
von: Chen, Jiayan, et al.
Veröffentlicht: (2025)
von: Chen, Jiayan, et al.
Veröffentlicht: (2025)
Efficient Long-Context Modeling in Diffusion Language Models via Block Approximate Sparse Attention
von: Zhang, Wenhu, et al.
Veröffentlicht: (2026)
von: Zhang, Wenhu, et al.
Veröffentlicht: (2026)
SpatialBot: Precise Spatial Understanding with Vision Language Models
von: Cai, Wenxiao, et al.
Veröffentlicht: (2024)
von: Cai, Wenxiao, et al.
Veröffentlicht: (2024)
MedMoE: Modality-Specialized Mixture of Experts for Medical Vision-Language Understanding
von: Chopra, Shivang, et al.
Veröffentlicht: (2025)
von: Chopra, Shivang, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
RT-Focuser: A Real-Time Lightweight Model for Edge-side Image Deblurring
von: Wu, Zhuoyu, et al.
Veröffentlicht: (2025) -
GPT4RoI: Instruction Tuning Large Language Model on Region-of-Interest
von: Zhang, Shilong, et al.
Veröffentlicht: (2023) -
EndoCaver: Handling Fog, Blur and Glare in Endoscopic Images via Joint Deblurring-Segmentation
von: Wu, Zhuoyu, et al.
Veröffentlicht: (2026) -
PAM-UNet: Shifting Attention on Region of Interest in Medical Images
von: Das, Abhijit, et al.
Veröffentlicht: (2024) -
RegionGPT: Towards Region Understanding Vision Language Model
von: Guo, Qiushan, et al.
Veröffentlicht: (2024)