Efficient Bilinear Attention-based Fusion for Medical Visual Question Answering
Fuente:
arXiv
Saved in:
| Main Authors: | Zhang, Zhilin, Wang, Jie, Qin, Zhanghao, Zhu, Ruiqi, Gong, Xiaoliang |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Visual Question Answering in Ophthalmology: A Progressive and Practical Perspective
by: Chen, Xiaolan, et al.
Published: (2024)
by: Chen, Xiaolan, et al.
Published: (2024)
Unsupervised Denoising of Real Clinical Low Dose Liver CT with Perceptual Attention Networks
by: Guan, Zhilin, et al.
Published: (2026)
by: Guan, Zhilin, et al.
Published: (2026)
SAR-RAG: ATR Visual Question Answering by Semantic Search, Retrieval, and MLLM Generation
by: Ramirez, David F., et al.
Published: (2026)
by: Ramirez, David F., et al.
Published: (2026)
Edge-Enhanced Dilated Residual Attention Network for Multimodal Medical Image Fusion
by: Zhou, Meng, et al.
Published: (2024)
by: Zhou, Meng, et al.
Published: (2024)
Surgical-LVLM: Learning to Adapt Large Vision-Language Model for Grounded Visual Question Answering in Robotic Surgery
by: Wang, Guankun, et al.
Published: (2024)
by: Wang, Guankun, et al.
Published: (2024)
VideoQA-SC: Adaptive Semantic Communication for Video Question Answering
by: Guo, Jiangyuan, et al.
Published: (2024)
by: Guo, Jiangyuan, et al.
Published: (2024)
U-DFA: A Unified DINOv2-Unet with Dual Fusion Attention for Multi-Dataset Medical Segmentation
by: Sajjad, Zulkaif, et al.
Published: (2025)
by: Sajjad, Zulkaif, et al.
Published: (2025)
Towards a Large Language-Vision Question Answering Model for MSTAR Automatic Target Recognition
by: Ramirez, David F., et al.
Published: (2026)
by: Ramirez, David F., et al.
Published: (2026)
A Wavelet Guided Attention Module for Skin Cancer Classification with Gradient-based Feature Fusion
by: Roy, Ayush, et al.
Published: (2024)
by: Roy, Ayush, et al.
Published: (2024)
PulmoFusion: Advancing Pulmonary Health with Efficient Multi-Modal Fusion
by: Sharshar, Ahmed, et al.
Published: (2025)
by: Sharshar, Ahmed, et al.
Published: (2025)
DPAFNet:Dual Path Attention Fusion Network for Single Image Deraining
by: Wei, Bingcai
Published: (2024)
by: Wei, Bingcai
Published: (2024)
AutoFuse: Automatic Fusion Networks for Deformable Medical Image Registration
by: Meng, Mingyuan, et al.
Published: (2023)
by: Meng, Mingyuan, et al.
Published: (2023)
Attentional Triple-Encoder Network in Spatiospectral Domains for Medical Image Segmentation
by: Qi, Kristin, et al.
Published: (2025)
by: Qi, Kristin, et al.
Published: (2025)
Multi-modal Medical Image Fusion For Non-Small Cell Lung Cancer Classification
by: Hassan, Salma, et al.
Published: (2024)
by: Hassan, Salma, et al.
Published: (2024)
Advancing Deformable Medical Image Registration with Multi-axis Cross-covariance Attention
by: Meng, Mingyuan, et al.
Published: (2024)
by: Meng, Mingyuan, et al.
Published: (2024)
Improving Representation of High-frequency Components for Medical Visual Foundation Models
by: Chu, Yuetan, et al.
Published: (2024)
by: Chu, Yuetan, et al.
Published: (2024)
Explainable Knowledge Distillation for Efficient Medical Image Classification
by: Mir, Aqib Nazir, et al.
Published: (2025)
by: Mir, Aqib Nazir, et al.
Published: (2025)
Efficient Knowledge Distillation of SAM for Medical Image Segmentation
by: Patil, Kunal Dasharath, et al.
Published: (2025)
by: Patil, Kunal Dasharath, et al.
Published: (2025)
UNet with Self-Adaptive Mamba-Like Attention and Causal-Resonance Learning for Medical Image Segmentation
by: Qamar, Saqib, et al.
Published: (2025)
by: Qamar, Saqib, et al.
Published: (2025)
LatentArtiFusion: An Effective and Efficient Histological Artifacts Restoration Framework
by: He, Zhenqi, et al.
Published: (2024)
by: He, Zhenqi, et al.
Published: (2024)
Sequential Attention-based Sampling for Histopathological Analysis
by: G, Tarun, et al.
Published: (2025)
by: G, Tarun, et al.
Published: (2025)
Computationally Efficient Diffusion Models in Medical Imaging: A Comprehensive Review
by: Abdullah, et al.
Published: (2025)
by: Abdullah, et al.
Published: (2025)
Wavelet-Assisted Multi-Frequency Attention Network for Pansharpening
by: Huang, Jie, et al.
Published: (2025)
by: Huang, Jie, et al.
Published: (2025)
Unifying Image Processing as Visual Prompting Question Answering
by: Liu, Yihao, et al.
Published: (2023)
by: Liu, Yihao, et al.
Published: (2023)
Learning to Select Like Humans: Explainable Active Learning for Medical Imaging
by: Uddin, Ifrat Ikhtear, et al.
Published: (2026)
by: Uddin, Ifrat Ikhtear, et al.
Published: (2026)
2D_3D Feature Fusion via Cross-Modal Latent Synthesis and Attention Guided Restoration for Industrial Anomaly Detection
by: Ali, Usman, et al.
Published: (2025)
by: Ali, Usman, et al.
Published: (2025)
Reinforced Correlation Between Vision and Language for Precise Medical AI Assistant
by: Wang, Haonan, et al.
Published: (2025)
by: Wang, Haonan, et al.
Published: (2025)
ICFNet: Integrated Cross-modal Fusion Network for Survival Prediction
by: Zhang, Binyu, et al.
Published: (2025)
by: Zhang, Binyu, et al.
Published: (2025)
Efficient Visualization of Neural Networks with Generative Models and Adversarial Perturbations
by: Karagounis, Athanasios
Published: (2024)
by: Karagounis, Athanasios
Published: (2024)
MedVAE: Efficient Automated Interpretation of Medical Images with Large-Scale Generalizable Autoencoders
by: Varma, Maya, et al.
Published: (2025)
by: Varma, Maya, et al.
Published: (2025)
Epsilon-VAE: Denoising as Visual Decoding
by: Zhao, Long, et al.
Published: (2024)
by: Zhao, Long, et al.
Published: (2024)
Goal-Oriented Semantic Communication for Wireless Visual Question Answering
by: Liu, Sige, et al.
Published: (2024)
by: Liu, Sige, et al.
Published: (2024)
ClinicalFMamba: Advancing Clinical Assessment using Mamba-based Multimodal Neuroimaging Fusion
by: Zhou, Meng, et al.
Published: (2025)
by: Zhou, Meng, et al.
Published: (2025)
DEFNet: Multitasks-based Deep Evidential Fusion Network for Blind Image Quality Assessment
by: Lou, Yiwei, et al.
Published: (2025)
by: Lou, Yiwei, et al.
Published: (2025)
STA-Unet: Rethink the semantic redundant for Medical Imaging Segmentation
by: Vasa, Vamsi Krishna, et al.
Published: (2024)
by: Vasa, Vamsi Krishna, et al.
Published: (2024)
Pay Less On Clinical Images: Asymmetric Multi-Modal Fusion Method For Efficient Multi-Label Skin Lesion Classification
by: Tang, Peng, et al.
Published: (2024)
by: Tang, Peng, et al.
Published: (2024)
MAPUNetR: A Hybrid Vision Transformer and U-Net Architecture for Efficient and Interpretable Medical Image Segmentation
by: Shah, Ovais Iqbal, et al.
Published: (2024)
by: Shah, Ovais Iqbal, et al.
Published: (2024)
Fundus Image-based Visual Acuity Assessment with PAC-Guarantees
by: Jang, Sooyong, et al.
Published: (2024)
by: Jang, Sooyong, et al.
Published: (2024)
MedMimic: Physician-Inspired Multimodal Fusion for Early Diagnosis of Fever of Unknown Origin
by: Chen, Minrui, et al.
Published: (2025)
by: Chen, Minrui, et al.
Published: (2025)
Efficient Brain Tumor Segmentation Using a Dual-Decoder 3D U-Net with Attention Gates (DDUNet)
by: Pajouh, Mohammad Mahdi Danesh
Published: (2025)
by: Pajouh, Mohammad Mahdi Danesh
Published: (2025)
Similar Items
-
Visual Question Answering in Ophthalmology: A Progressive and Practical Perspective
by: Chen, Xiaolan, et al.
Published: (2024) -
Unsupervised Denoising of Real Clinical Low Dose Liver CT with Perceptual Attention Networks
by: Guan, Zhilin, et al.
Published: (2026) -
SAR-RAG: ATR Visual Question Answering by Semantic Search, Retrieval, and MLLM Generation
by: Ramirez, David F., et al.
Published: (2026) -
Edge-Enhanced Dilated Residual Attention Network for Multimodal Medical Image Fusion
by: Zhou, Meng, et al.
Published: (2024) -
Surgical-LVLM: Learning to Adapt Large Vision-Language Model for Grounded Visual Question Answering in Robotic Surgery
by: Wang, Guankun, et al.
Published: (2024)