LLaVA-RadZ: Can Multimodal Large Language Models Effectively Tackle Zero-shot Radiology Recognition?
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Bangyan, Huang, Wenxuan, Gao, Zhenkun, Wang, Yeqiang, Shen, Yunhang, Lin, Jingzhong, You, Ling, Shen, Yuxiang, Lin, Shaohui, Ouyang, Wanli, Sun, Yuling |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Dynamic-LLaVA: Efficient Multimodal Large Language Models via Dynamic Vision-language Context Sparsification
por: Huang, Wenxuan, et al.
Publicado: (2024)
por: Huang, Wenxuan, et al.
Publicado: (2024)
TG-LLaVA: Text Guided LLaVA via Learnable Latent Embeddings
por: Yan, Dawei, et al.
Publicado: (2024)
por: Yan, Dawei, et al.
Publicado: (2024)
DF-LLaVA: Unlocking MLLMs for Synthetic Image Detection via Knowledge Injection and Conflict-Driven Self-Reflection
por: Shen, Zhuokang, et al.
Publicado: (2025)
por: Shen, Zhuokang, et al.
Publicado: (2025)
Cosmos-LLaVA: Chatting with the Visual Cosmos-LLaVA: Görselle Sohbet Etmek
por: Zeer, Ahmed, et al.
Publicado: (2024)
por: Zeer, Ahmed, et al.
Publicado: (2024)
Can Sound Replace Vision in LLaVA With Token Substitution?
por: Vosoughi, Ali, et al.
Publicado: (2025)
por: Vosoughi, Ali, et al.
Publicado: (2025)
LLaVA-MoD: Making LLaVA Tiny via MoE Knowledge Distillation
por: Shu, Fangxun, et al.
Publicado: (2024)
por: Shu, Fangxun, et al.
Publicado: (2024)
LLaVA-c: Continual Improved Visual Instruction Tuning
por: Liu, Wenzhuo, et al.
Publicado: (2025)
por: Liu, Wenzhuo, et al.
Publicado: (2025)
PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning
por: Xu, Lin, et al.
Publicado: (2024)
por: Xu, Lin, et al.
Publicado: (2024)
LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models
por: Li, Feng, et al.
Publicado: (2024)
por: Li, Feng, et al.
Publicado: (2024)
LLaVA-Critic: Learning to Evaluate Multimodal Models
por: Xiong, Tianyi, et al.
Publicado: (2024)
por: Xiong, Tianyi, et al.
Publicado: (2024)
Video-LLaVA: Learning United Visual Representation by Alignment Before Projection
por: Lin, Bin, et al.
Publicado: (2023)
por: Lin, Bin, et al.
Publicado: (2023)
LLaVAC: Fine-tuning LLaVA as a Multimodal Sentiment Classifier
por: Chay-intr, T., et al.
Publicado: (2025)
por: Chay-intr, T., et al.
Publicado: (2025)
Amharic LLaMA and LLaVA: Multimodal LLMs for Low Resource Languages
por: Andersland, Michael
Publicado: (2024)
por: Andersland, Michael
Publicado: (2024)
LLaVA-MLB: Mitigating and Leveraging Attention Bias for Training-Free Video LLMs
por: Shen, Leqi, et al.
Publicado: (2025)
por: Shen, Leqi, et al.
Publicado: (2025)
MoE-LLaVA: Mixture of Experts for Large Vision-Language Models
por: Lin, Bin, et al.
Publicado: (2024)
por: Lin, Bin, et al.
Publicado: (2024)
PA-LLaVA: A Large Language-Vision Assistant for Human Pathology Image Understanding
por: Dai, Dawei, et al.
Publicado: (2024)
por: Dai, Dawei, et al.
Publicado: (2024)
WSI-LLaVA: A Multimodal Large Language Model for Whole Slide Image
por: Liang, Yuci, et al.
Publicado: (2024)
por: Liang, Yuci, et al.
Publicado: (2024)
Enhance Image-to-Image Generation with LLaVA-generated Prompts
por: Ding, Zhicheng, et al.
Publicado: (2024)
por: Ding, Zhicheng, et al.
Publicado: (2024)
LLaVA-OneVision: Easy Visual Task Transfer
por: Li, Bo, et al.
Publicado: (2024)
por: Li, Bo, et al.
Publicado: (2024)
LLaVA-Video: Video Instruction Tuning With Synthetic Data
por: Zhang, Yuanhan, et al.
Publicado: (2024)
por: Zhang, Yuanhan, et al.
Publicado: (2024)
LLaVA-ReID: Selective Multi-image Questioner for Interactive Person Re-Identification
por: Lu, Yiding, et al.
Publicado: (2025)
por: Lu, Yiding, et al.
Publicado: (2025)
LLaVA-OneVision-2: Towards Next-Generation Perceptual Intelligence
por: An, Xiang, et al.
Publicado: (2026)
por: An, Xiang, et al.
Publicado: (2026)
INF-LLaVA: Dual-perspective Perception for High-Resolution Multimodal Large Language Model
por: Ma, Yiwei, et al.
Publicado: (2024)
por: Ma, Yiwei, et al.
Publicado: (2024)
Rethinking Centered Kernel Alignment in Knowledge Distillation
por: Zhou, Zikai, et al.
Publicado: (2024)
por: Zhou, Zikai, et al.
Publicado: (2024)
SQ-LLaVA: Self-Questioning for Large Vision-Language Assistant
por: Sun, Guohao, et al.
Publicado: (2024)
por: Sun, Guohao, et al.
Publicado: (2024)
Wiki-LLaVA: Hierarchical Retrieval-Augmented Generation for Multimodal LLMs
por: Caffagni, Davide, et al.
Publicado: (2024)
por: Caffagni, Davide, et al.
Publicado: (2024)
LLaVA-SLT: Visual Language Tuning for Sign Language Translation
por: Liang, Han, et al.
Publicado: (2024)
por: Liang, Han, et al.
Publicado: (2024)
LLaVA-Ultra: Large Chinese Language and Vision Assistant for Ultrasound
por: Guo, Xuechen, et al.
Publicado: (2024)
por: Guo, Xuechen, et al.
Publicado: (2024)
LLaVA-Read: Enhancing Reading Ability of Multimodal Language Models
por: Zhang, Ruiyi, et al.
Publicado: (2024)
por: Zhang, Ruiyi, et al.
Publicado: (2024)
MC-LLaVA: Multi-Concept Personalized Vision-Language Model
por: An, Ruichuan, et al.
Publicado: (2024)
por: An, Ruichuan, et al.
Publicado: (2024)
MC-LLaVA: Multi-Concept Personalized Vision-Language Model
por: An, Ruichuan, et al.
Publicado: (2025)
por: An, Ruichuan, et al.
Publicado: (2025)
LLaVA-LE: Large Language-and-Vision Assistant for Lunar Exploration
por: Inal, Gokce, et al.
Publicado: (2026)
por: Inal, Gokce, et al.
Publicado: (2026)
MG-LLaVA: Towards Multi-Granularity Visual Instruction Tuning
por: Zhao, Xiangyu, et al.
Publicado: (2024)
por: Zhao, Xiangyu, et al.
Publicado: (2024)
X-LLaVA: Optimizing Bilingual Large Vision-Language Alignment
por: Shin, Dongjae, et al.
Publicado: (2024)
por: Shin, Dongjae, et al.
Publicado: (2024)
Dr-LLaVA: Visual Instruction Tuning with Symbolic Clinical Grounding
por: Sun, Shenghuan, et al.
Publicado: (2024)
por: Sun, Shenghuan, et al.
Publicado: (2024)
LLaVA-MoLE: Sparse Mixture of LoRA Experts for Mitigating Data Conflicts in Instruction Finetuning MLLMs
por: Chen, Shaoxiang, et al.
Publicado: (2024)
por: Chen, Shaoxiang, et al.
Publicado: (2024)
HiDe-LLaVA: Hierarchical Decoupling for Continual Instruction Tuning of Multimodal Large Language Model
por: Guo, Haiyang, et al.
Publicado: (2025)
por: Guo, Haiyang, et al.
Publicado: (2025)
SlowFast-LLaVA: A Strong Training-Free Baseline for Video Large Language Models
por: Xu, Mingze, et al.
Publicado: (2024)
por: Xu, Mingze, et al.
Publicado: (2024)
NOVO: Bridging LLaVA and SAM with Visual-only Prompts for Reasoning Segmentation
por: Yoon, Kyung-Yoon, et al.
Publicado: (2025)
por: Yoon, Kyung-Yoon, et al.
Publicado: (2025)
When LLaVA Meets Objects: Token Composition for Vision-Language-Models
por: Jahagirdar, Soumya, et al.
Publicado: (2026)
por: Jahagirdar, Soumya, et al.
Publicado: (2026)
Ejemplares similares
-
Dynamic-LLaVA: Efficient Multimodal Large Language Models via Dynamic Vision-language Context Sparsification
por: Huang, Wenxuan, et al.
Publicado: (2024) -
TG-LLaVA: Text Guided LLaVA via Learnable Latent Embeddings
por: Yan, Dawei, et al.
Publicado: (2024) -
DF-LLaVA: Unlocking MLLMs for Synthetic Image Detection via Knowledge Injection and Conflict-Driven Self-Reflection
por: Shen, Zhuokang, et al.
Publicado: (2025) -
Cosmos-LLaVA: Chatting with the Visual Cosmos-LLaVA: Görselle Sohbet Etmek
por: Zeer, Ahmed, et al.
Publicado: (2024) -
Can Sound Replace Vision in LLaVA With Token Substitution?
por: Vosoughi, Ali, et al.
Publicado: (2025)