WSI-LLaVA: A Multimodal Large Language Model for Whole Slide Image
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liang, Yuci, Lyu, Xinheng, Chen, Wenting, Ding, Meidan, Zhang, Jipeng, He, Xiangjian, Wu, Song, Xing, Xiaohan, Yang, Sen, Wang, Xiyue, Shen, Linlin |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
WSI-Agents: A Collaborative Multi-Agent System for Multi-Modal Whole Slide Image Analysis
par: Lyu, Xinheng, et autres
Publié: (2025)
par: Lyu, Xinheng, et autres
Publié: (2025)
SurvAgent: Hierarchical CoT-Enhanced Case Banking and Dichotomy-Based Multi-Agent System for Multimodal Survival Prediction
par: Huang, Guolin, et autres
Publié: (2025)
par: Huang, Guolin, et autres
Publié: (2025)
Hepato-LLaVA: An Expert MLLM with Sparse Topo-Pack Attention for Hepatocellular Pathology Analysis on Whole Slide Images
par: Yang, Yuxuan, et autres
Publié: (2026)
par: Yang, Yuxuan, et autres
Publié: (2026)
LLaVA-Critic: Learning to Evaluate Multimodal Models
par: Xiong, Tianyi, et autres
Publié: (2024)
par: Xiong, Tianyi, et autres
Publié: (2024)
TG-LLaVA: Text Guided LLaVA via Learnable Latent Embeddings
par: Yan, Dawei, et autres
Publié: (2024)
par: Yan, Dawei, et autres
Publié: (2024)
Enhance Image-to-Image Generation with LLaVA-generated Prompts
par: Ding, Zhicheng, et autres
Publié: (2024)
par: Ding, Zhicheng, et autres
Publié: (2024)
Cosmos-LLaVA: Chatting with the Visual Cosmos-LLaVA: Görselle Sohbet Etmek
par: Zeer, Ahmed, et autres
Publié: (2024)
par: Zeer, Ahmed, et autres
Publié: (2024)
MMedExpert-R1: Strengthening Multimodal Medical Reasoning via Domain-Specific Adaptation and Clinical Guideline Reinforcement
par: Ding, Meidan, et autres
Publié: (2026)
par: Ding, Meidan, et autres
Publié: (2026)
LLaVAC: Fine-tuning LLaVA as a Multimodal Sentiment Classifier
par: Chay-intr, T., et autres
Publié: (2025)
par: Chay-intr, T., et autres
Publié: (2025)
Amharic LLaMA and LLaVA: Multimodal LLMs for Low Resource Languages
par: Andersland, Michael
Publié: (2024)
par: Andersland, Michael
Publié: (2024)
HySurvPred: Multimodal Hyperbolic Embedding with Angle-Aware Hierarchical Contrastive Learning and Uncertainty Constraints for Survival Prediction
par: Yang, Jiaqi, et autres
Publié: (2025)
par: Yang, Jiaqi, et autres
Publié: (2025)
LLaVA-MoD: Making LLaVA Tiny via MoE Knowledge Distillation
par: Shu, Fangxun, et autres
Publié: (2024)
par: Shu, Fangxun, et autres
Publié: (2024)
Wiki-LLaVA: Hierarchical Retrieval-Augmented Generation for Multimodal LLMs
par: Caffagni, Davide, et autres
Publié: (2024)
par: Caffagni, Davide, et autres
Publié: (2024)
Beyond LLaVA-HD: Diving into High-Resolution Large Multimodal Models
par: Zhang, Yi-Fan, et autres
Publié: (2024)
par: Zhang, Yi-Fan, et autres
Publié: (2024)
LLaVA-Mini: Efficient Image and Video Large Multimodal Models with One Vision Token
par: Zhang, Shaolei, et autres
Publié: (2025)
par: Zhang, Shaolei, et autres
Publié: (2025)
G-LLaVA: Solving Geometric Problem with Multi-Modal Large Language Model
par: Gao, Jiahui, et autres
Publié: (2023)
par: Gao, Jiahui, et autres
Publié: (2023)
AVG-LLaVA: An Efficient Large Multimodal Model with Adaptive Visual Granularity
par: Lan, Zhibin, et autres
Publié: (2024)
par: Lan, Zhibin, et autres
Publié: (2024)
Math-LLaVA: Bootstrapping Mathematical Reasoning for Multimodal Large Language Models
par: Shi, Wenhao, et autres
Publié: (2024)
par: Shi, Wenhao, et autres
Publié: (2024)
Why do LLaVA Vision-Language Models Reply to Images in English?
par: Hinck, Musashi, et autres
Publié: (2024)
par: Hinck, Musashi, et autres
Publié: (2024)
LLaVA-RE: Binary Image-Text Relevancy Evaluation with Multimodal Large Language Model
par: Sun, Tao, et autres
Publié: (2025)
par: Sun, Tao, et autres
Publié: (2025)
LLaVA-Read: Enhancing Reading Ability of Multimodal Language Models
par: Zhang, Ruiyi, et autres
Publié: (2024)
par: Zhang, Ruiyi, et autres
Publié: (2024)
LLaVA-PruMerge: Adaptive Token Reduction for Efficient Large Multimodal Models
par: Shang, Yuzhang, et autres
Publié: (2024)
par: Shang, Yuzhang, et autres
Publié: (2024)
LLaVA-KD: A Framework of Distilling Multimodal Large Language Models
par: Cai, Yuxuan, et autres
Publié: (2024)
par: Cai, Yuxuan, et autres
Publié: (2024)
LLaVA-FA: Learning Fourier Approximation for Compressing Large Multimodal Models
par: Zheng, Pengcheng, et autres
Publié: (2026)
par: Zheng, Pengcheng, et autres
Publié: (2026)
LLaVA-Video: Video Instruction Tuning With Synthetic Data
par: Zhang, Yuanhan, et autres
Publié: (2024)
par: Zhang, Yuanhan, et autres
Publié: (2024)
Continual LLaVA: Continual Instruction Tuning in Large Vision-Language Models
par: Cao, Meng, et autres
Publié: (2024)
par: Cao, Meng, et autres
Publié: (2024)
X-LLaVA: Optimizing Bilingual Large Vision-Language Alignment
par: Shin, Dongjae, et autres
Publié: (2024)
par: Shin, Dongjae, et autres
Publié: (2024)
WSI-INR: Implicit Neural Representations for Lesion Segmentation in Whole-Slide Images
par: Wu, Yunheng, et autres
Publié: (2026)
par: Wu, Yunheng, et autres
Publié: (2026)
Purrfessor: A Fine-tuned Multimodal LLaVA Diet Health Chatbot
par: Lu, Linqi, et autres
Publié: (2024)
par: Lu, Linqi, et autres
Publié: (2024)
LLaVA-OneVision: Easy Visual Task Transfer
par: Li, Bo, et autres
Publié: (2024)
par: Li, Bo, et autres
Publié: (2024)
LLaVA-MLB: Mitigating and Leveraging Attention Bias for Training-Free Video LLMs
par: Shen, Leqi, et autres
Publié: (2025)
par: Shen, Leqi, et autres
Publié: (2025)
Med-RewardBench: Benchmarking Reward Models and Judges for Medical Multimodal Large Language Models
par: Ding, Meidan, et autres
Publié: (2025)
par: Ding, Meidan, et autres
Publié: (2025)
Agri-LLaVA: Knowledge-Infused Large Multimodal Assistant on Agricultural Pests and Diseases
par: Wang, Liqiong, et autres
Publié: (2024)
par: Wang, Liqiong, et autres
Publié: (2024)
LLaVA-Gemma: Accelerating Multimodal Foundation Models with a Compact Language Model
par: Hinck, Musashi, et autres
Publié: (2024)
par: Hinck, Musashi, et autres
Publié: (2024)
WSI-VQA: Interpreting Whole Slide Images by Generative Visual Question Answering
par: Chen, Pingyi, et autres
Publié: (2024)
par: Chen, Pingyi, et autres
Publié: (2024)
LLaVA-SLT: Visual Language Tuning for Sign Language Translation
par: Liang, Han, et autres
Publié: (2024)
par: Liang, Han, et autres
Publié: (2024)
Social-LLaVA: Enhancing Robot Navigation through Human-Language Reasoning in Social Spaces
par: Payandeh, Amirreza, et autres
Publié: (2024)
par: Payandeh, Amirreza, et autres
Publié: (2024)
Dynamic-LLaVA: Efficient Multimodal Large Language Models via Dynamic Vision-language Context Sparsification
par: Huang, Wenxuan, et autres
Publié: (2024)
par: Huang, Wenxuan, et autres
Publié: (2024)
ViP-LLaVA: Making Large Multimodal Models Understand Arbitrary Visual Prompts
par: Cai, Mu, et autres
Publié: (2023)
par: Cai, Mu, et autres
Publié: (2023)
LLaVA-NeuMT: Selective Layer-Neuron Modulation for Efficient Multilingual Multimodal Translation
par: Wei, Jingxuan, et autres
Publié: (2025)
par: Wei, Jingxuan, et autres
Publié: (2025)
Documents similaires
-
WSI-Agents: A Collaborative Multi-Agent System for Multi-Modal Whole Slide Image Analysis
par: Lyu, Xinheng, et autres
Publié: (2025) -
SurvAgent: Hierarchical CoT-Enhanced Case Banking and Dichotomy-Based Multi-Agent System for Multimodal Survival Prediction
par: Huang, Guolin, et autres
Publié: (2025) -
Hepato-LLaVA: An Expert MLLM with Sparse Topo-Pack Attention for Hepatocellular Pathology Analysis on Whole Slide Images
par: Yang, Yuxuan, et autres
Publié: (2026) -
LLaVA-Critic: Learning to Evaluate Multimodal Models
par: Xiong, Tianyi, et autres
Publié: (2024) -
TG-LLaVA: Text Guided LLaVA via Learnable Latent Embeddings
par: Yan, Dawei, et autres
Publié: (2024)