$μ^2$Tokenizer: Differentiable Multi-Scale Multi-Modal Tokenizer for Radiology Report Generation
Fuente:
arXiv
Saved in:
| Main Authors: | Li, Siyou, Qin, Pengyao, Wu, Huanan, Nie, Dong, Thirunavukarasu, Arun J., Yu, Juntao, Zhang, Le |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Deep Learning Ensemble for Predicting Diabetic Macular Edema Onset Using Ultra-Wide Field Color Fundus Image
by: Qin, Pengyao, et al.
Published: (2024)
by: Qin, Pengyao, et al.
Published: (2024)
ViT3D Alignment of LLaMA3: 3D Medical Image Report Generation
by: Li, Siyou, et al.
Published: (2024)
by: Li, Siyou, et al.
Published: (2024)
General-Purpose vs. Domain-Adapted Large Language Models for Extraction of Structured Data from Chest Radiology Reports
by: Dhanaliwala, Ali H., et al.
Published: (2023)
by: Dhanaliwala, Ali H., et al.
Published: (2023)
Learnable Retrieval Enhanced Visual-Text Alignment and Fusion for Radiology Report Generation
by: Zhou, Qin, et al.
Published: (2025)
by: Zhou, Qin, et al.
Published: (2025)
EVTP-IVS: Effective Visual Token Pruning For Unifying Instruction Visual Segmentation In Multi-Modal Large Language Models
by: Zhu, Wenhui, et al.
Published: (2025)
by: Zhu, Wenhui, et al.
Published: (2025)
Scaling Next-Brain-Token Prediction for MEG
by: Csaky, Richard
Published: (2026)
by: Csaky, Richard
Published: (2026)
Simplifying Multimodality: Unimodal Approach to Multimodal Challenges in Radiology with General-Domain Large Language Model
by: Cho, Seonhee, et al.
Published: (2024)
by: Cho, Seonhee, et al.
Published: (2024)
Automatically Generating Narrative-Style Radiology Reports from Volumetric CT Images; a Proof of Concept
by: Borghouts, Marijn
Published: (2024)
by: Borghouts, Marijn
Published: (2024)
Medical AI Consensus: A Multi-Agent Framework for Radiology Report Generation and Evaluation
by: Elboardy, Ahmed T., et al.
Published: (2025)
by: Elboardy, Ahmed T., et al.
Published: (2025)
MSFMamba: Multi-Scale Feature Fusion State Space Model for Multi-Source Remote Sensing Image Classification
by: Gao, Feng, et al.
Published: (2024)
by: Gao, Feng, et al.
Published: (2024)
TVC: Tokenized Video Compression with Ultra-Low Bit Rate
by: Zhou, Lebin, et al.
Published: (2025)
by: Zhou, Lebin, et al.
Published: (2025)
Towards Interpretable Radiology Report Generation via Concept Bottlenecks using a Multi-Agentic RAG
by: Alam, Hasan Md Tusfiqur, et al.
Published: (2024)
by: Alam, Hasan Md Tusfiqur, et al.
Published: (2024)
Semantic-guided Masked Mutual Learning for Multi-modal Brain Tumor Segmentation with Arbitrary Missing Modalities
by: Liang, Guoyan, et al.
Published: (2025)
by: Liang, Guoyan, et al.
Published: (2025)
Gaze2Report: Radiology Report Generation via Visual-Gaze Prompt Tuning of LLMs
by: Konwer, Aishik, et al.
Published: (2026)
by: Konwer, Aishik, et al.
Published: (2026)
M2Diff: Multi-Modality Multi-Task Enhanced Diffusion Model for MRI-Guided Low-Dose PET Enhancement
by: Yar, Ghulam Nabi Ahmad Hassan, et al.
Published: (2026)
by: Yar, Ghulam Nabi Ahmad Hassan, et al.
Published: (2026)
Arctic Sea Ice Image Super-Resolution Based on Multi-Scale Convolution and Dual-Gating Mechanism
by: Fang, Zhaomin, et al.
Published: (2024)
by: Fang, Zhaomin, et al.
Published: (2024)
AI-Generated Annotations Dataset for Diverse Cancer Radiology Collections in NCI Image Data Commons
by: Murugesan, Gowtham Krishnan, et al.
Published: (2023)
by: Murugesan, Gowtham Krishnan, et al.
Published: (2023)
Untangling Vascular Trees for Surgery and Interventional Radiology
by: Houry, Guillaume, et al.
Published: (2025)
by: Houry, Guillaume, et al.
Published: (2025)
ResiComp: Loss-Resilient Image Compression via Dual-Functional Masked Visual Token Modeling
by: Wang, Sixian, et al.
Published: (2025)
by: Wang, Sixian, et al.
Published: (2025)
ReXplain: Translating Radiology into Patient-Friendly Video Reports
by: Luo, Luyang, et al.
Published: (2024)
by: Luo, Luyang, et al.
Published: (2024)
A Multi-Scale Spatial-Temporal Network for Wireless Video Transmission
by: Zhou, Xinyi, et al.
Published: (2024)
by: Zhou, Xinyi, et al.
Published: (2024)
Video TokenCom: Textual Intent-Guided Multi-Rate Video Token Communications with UEP-Based Adaptive Source-Channel Coding
by: Men, Jingxuan, et al.
Published: (2026)
by: Men, Jingxuan, et al.
Published: (2026)
Spatial-Temporal-Spectral Mamba with Sparse Deformable Token Sequence for Enhanced MODIS Time Series Classification
by: Dewis, Zack, et al.
Published: (2025)
by: Dewis, Zack, et al.
Published: (2025)
Multi-Scale Energy (MuSE) plug and play framework for inverse problems
by: Chand, Jyothi Rikhab, et al.
Published: (2023)
by: Chand, Jyothi Rikhab, et al.
Published: (2023)
Automating Vessel Segmentation in the Heart and Brain: A Trend to Develop Multi-Modality and Label-Efficient Deep Learning Techniques
by: Elsayed, Nazik, et al.
Published: (2024)
by: Elsayed, Nazik, et al.
Published: (2024)
A 28nm 0.22μJ/token memory-compute-intensity-aware CNN-Transformer accelerator with hybrid-attention-based layer-fusion and cascaded pruning for semantic-segmentation
by: Dong, Pingcheng, et al.
Published: (2025)
by: Dong, Pingcheng, et al.
Published: (2025)
Structural Entities Extraction and Patient Indications Incorporation for Chest X-ray Report Generation
by: Liu, Kang, et al.
Published: (2024)
by: Liu, Kang, et al.
Published: (2024)
OrthoInsight: Rib Fracture Diagnosis and Report Generation Based on Multi-Modal Large Models
by: Wu, Ningyong, et al.
Published: (2025)
by: Wu, Ningyong, et al.
Published: (2025)
Retrieval Augmented Generation with Multi-Modal LLM Framework for Wireless Environments
by: Mohsin, Muhammad Ahmed, et al.
Published: (2025)
by: Mohsin, Muhammad Ahmed, et al.
Published: (2025)
Survey: Transformer-based Models in Data Modality Conversion
by: Rashno, Elyas, et al.
Published: (2024)
by: Rashno, Elyas, et al.
Published: (2024)
Learning Segmentation from Radiology Reports
by: Bassi, Pedro R. A. S., et al.
Published: (2025)
by: Bassi, Pedro R. A. S., et al.
Published: (2025)
PupiNet: Seamless OCT-OCTA Interconversion Through Wavelet-Driven and Multi-Scale Attention Mechanisms
by: Tian, Renzhi, et al.
Published: (2025)
by: Tian, Renzhi, et al.
Published: (2025)
GenMFSR: Generative Multi-Frame Image Restoration and Super-Resolution
by: Weligampola, Harshana, et al.
Published: (2026)
by: Weligampola, Harshana, et al.
Published: (2026)
An Efficient Token Compression Framework for Visual Object Tracking
by: Wu, Weijing, et al.
Published: (2026)
by: Wu, Weijing, et al.
Published: (2026)
Multi-Modal Brain Tumor Segmentation via 3D Multi-Scale Self-attention and Cross-attention
by: Huang, Yonghao, et al.
Published: (2025)
by: Huang, Yonghao, et al.
Published: (2025)
Enhancing Real-World Active Speaker Detection with Multi-Modal Extraction Pre-Training
by: Tao, Ruijie, et al.
Published: (2024)
by: Tao, Ruijie, et al.
Published: (2024)
The Role of High-Performance GPU Resources in Large Language Model Based Radiology Imaging Diagnosis
by: Kao, Jyun-Ping
Published: (2025)
by: Kao, Jyun-Ping
Published: (2025)
A Multi-Grid Implicit Neural Representation for Multi-View Videos
by: Ling, Qingyue, et al.
Published: (2025)
by: Ling, Qingyue, et al.
Published: (2025)
End-to-end Multi-source Visual Prompt Tuning for Survival Analysis in Whole Slide Images
by: Qiu, Zhongwei, et al.
Published: (2024)
by: Qiu, Zhongwei, et al.
Published: (2024)
RadIR: A Scalable Framework for Multi-Grained Medical Image Retrieval via Radiology Report Mining
by: Zhang, Tengfei, et al.
Published: (2025)
by: Zhang, Tengfei, et al.
Published: (2025)
Similar Items
-
Deep Learning Ensemble for Predicting Diabetic Macular Edema Onset Using Ultra-Wide Field Color Fundus Image
by: Qin, Pengyao, et al.
Published: (2024) -
ViT3D Alignment of LLaMA3: 3D Medical Image Report Generation
by: Li, Siyou, et al.
Published: (2024) -
General-Purpose vs. Domain-Adapted Large Language Models for Extraction of Structured Data from Chest Radiology Reports
by: Dhanaliwala, Ali H., et al.
Published: (2023) -
Learnable Retrieval Enhanced Visual-Text Alignment and Fusion for Radiology Report Generation
by: Zhou, Qin, et al.
Published: (2025) -
EVTP-IVS: Effective Visual Token Pruning For Unifying Instruction Visual Segmentation In Multi-Modal Large Language Models
by: Zhu, Wenhui, et al.
Published: (2025)