Hepato-LLaVA: An Expert MLLM with Sparse Topo-Pack Attention for Hepatocellular Pathology Analysis on Whole Slide Images
Fuente:
arXiv
Salvato in:
| Autori principali: | Yang, Yuxuan, Yan, Zhonghao, Zhang, Yi, Yun, Bo, Diao, Muxi, Zhao, Guowei, Liang, Kongming, Li, Wenbin, Ma, Zhanyu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
WSI-LLaVA: A Multimodal Large Language Model for Whole Slide Image
di: Liang, Yuci, et al.
Pubblicazione: (2024)
di: Liang, Yuci, et al.
Pubblicazione: (2024)
From Simple to Professional: A Combinatorial Controllable Image Captioning Agent
di: Wang, Xinran, et al.
Pubblicazione: (2024)
di: Wang, Xinran, et al.
Pubblicazione: (2024)
DetailVerifyBench: A Benchmark for Dense Hallucination Localization in Long Image Captions
di: Wang, Xinran, et al.
Pubblicazione: (2026)
di: Wang, Xinran, et al.
Pubblicazione: (2026)
MedReasoner: Reinforcement Learning Drives Reasoning Grounding from Clinical Thought to Pixel-Level Precision
di: Yan, Zhonghao, et al.
Pubblicazione: (2025)
di: Yan, Zhonghao, et al.
Pubblicazione: (2025)
Cosmos-LLaVA: Chatting with the Visual Cosmos-LLaVA: Görselle Sohbet Etmek
di: Zeer, Ahmed, et al.
Pubblicazione: (2024)
di: Zeer, Ahmed, et al.
Pubblicazione: (2024)
TG-LLaVA: Text Guided LLaVA via Learnable Latent Embeddings
di: Yan, Dawei, et al.
Pubblicazione: (2024)
di: Yan, Dawei, et al.
Pubblicazione: (2024)
Entropy-Adaptive Fine-Tuning: Resolving Confident Conflicts to Mitigate Forgetting
di: Diao, Muxi, et al.
Pubblicazione: (2026)
di: Diao, Muxi, et al.
Pubblicazione: (2026)
MLLM-LLaVA-FL: Multimodal Large Language Model Assisted Federated Learning
di: Zhang, Jianyi, et al.
Pubblicazione: (2024)
di: Zhang, Jianyi, et al.
Pubblicazione: (2024)
Harnessing Caption Detailness for Data-Efficient Text-to-Image Generation
di: Wang, Xinran, et al.
Pubblicazione: (2025)
di: Wang, Xinran, et al.
Pubblicazione: (2025)
LLaVA-MoD: Making LLaVA Tiny via MoE Knowledge Distillation
di: Shu, Fangxun, et al.
Pubblicazione: (2024)
di: Shu, Fangxun, et al.
Pubblicazione: (2024)
LLaVA-CoT: Let Vision Language Models Reason Step-by-Step
di: Xu, Guowei, et al.
Pubblicazione: (2024)
di: Xu, Guowei, et al.
Pubblicazione: (2024)
CineTechBench: A Benchmark for Cinematographic Technique Understanding and Generation
di: Wang, Xinran, et al.
Pubblicazione: (2025)
di: Wang, Xinran, et al.
Pubblicazione: (2025)
MoE-LLaVA: Mixture of Experts for Large Vision-Language Models
di: Lin, Bin, et al.
Pubblicazione: (2024)
di: Lin, Bin, et al.
Pubblicazione: (2024)
LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer
di: Zhang, Yipeng, et al.
Pubblicazione: (2024)
di: Zhang, Yipeng, et al.
Pubblicazione: (2024)
LLaVA-Video: Video Instruction Tuning With Synthetic Data
di: Zhang, Yuanhan, et al.
Pubblicazione: (2024)
di: Zhang, Yuanhan, et al.
Pubblicazione: (2024)
LLaVA-MoLE: Sparse Mixture of LoRA Experts for Mitigating Data Conflicts in Instruction Finetuning MLLMs
di: Chen, Shaoxiang, et al.
Pubblicazione: (2024)
di: Chen, Shaoxiang, et al.
Pubblicazione: (2024)
RO-Bench: Large-scale robustness evaluation of MLLMs with text-driven counterfactual videos
di: Yang, Zixi, et al.
Pubblicazione: (2025)
di: Yang, Zixi, et al.
Pubblicazione: (2025)
MCA-LLaVA: Manhattan Causal Attention for Reducing Hallucination in Large Vision-Language Models
di: Zhao, Qiyan, et al.
Pubblicazione: (2025)
di: Zhao, Qiyan, et al.
Pubblicazione: (2025)
Toward Generalizable Forgery Detection and Reasoning
di: Gao, Yueying, et al.
Pubblicazione: (2025)
di: Gao, Yueying, et al.
Pubblicazione: (2025)
DriveRX: A Vision-Language Reasoning Model for Cross-Task Autonomous Driving
di: Diao, Muxi, et al.
Pubblicazione: (2025)
di: Diao, Muxi, et al.
Pubblicazione: (2025)
PA-LLaVA: A Large Language-Vision Assistant for Human Pathology Image Understanding
di: Dai, Dawei, et al.
Pubblicazione: (2024)
di: Dai, Dawei, et al.
Pubblicazione: (2024)
LLaVA-OneVision: Easy Visual Task Transfer
di: Li, Bo, et al.
Pubblicazione: (2024)
di: Li, Bo, et al.
Pubblicazione: (2024)
LLaVA-Critic: Learning to Evaluate Multimodal Models
di: Xiong, Tianyi, et al.
Pubblicazione: (2024)
di: Xiong, Tianyi, et al.
Pubblicazione: (2024)
LLaVA-MLB: Mitigating and Leveraging Attention Bias for Training-Free Video LLMs
di: Shen, Leqi, et al.
Pubblicazione: (2025)
di: Shen, Leqi, et al.
Pubblicazione: (2025)
LLaVAC: Fine-tuning LLaVA as a Multimodal Sentiment Classifier
di: Chay-intr, T., et al.
Pubblicazione: (2025)
di: Chay-intr, T., et al.
Pubblicazione: (2025)
Amharic LLaMA and LLaVA: Multimodal LLMs for Low Resource Languages
di: Andersland, Michael
Pubblicazione: (2024)
di: Andersland, Michael
Pubblicazione: (2024)
ViDRiP-LLaVA: A Dataset and Benchmark for Diagnostic Reasoning from Pathology Videos
di: Vuong, Trinh T. L., et al.
Pubblicazione: (2025)
di: Vuong, Trinh T. L., et al.
Pubblicazione: (2025)
LLaVA-KD: A Framework of Distilling Multimodal Large Language Models
di: Cai, Yuxuan, et al.
Pubblicazione: (2024)
di: Cai, Yuxuan, et al.
Pubblicazione: (2024)
LLaVA-CMoE: Towards Continual Mixture of Experts for Large Vision-Language Models
di: Zhao, Hengyuan, et al.
Pubblicazione: (2025)
di: Zhao, Hengyuan, et al.
Pubblicazione: (2025)
LLaVA-SLT: Visual Language Tuning for Sign Language Translation
di: Liang, Han, et al.
Pubblicazione: (2024)
di: Liang, Han, et al.
Pubblicazione: (2024)
MC-LLaVA: Multi-Concept Personalized Vision-Language Model
di: An, Ruichuan, et al.
Pubblicazione: (2025)
di: An, Ruichuan, et al.
Pubblicazione: (2025)
MC-LLaVA: Multi-Concept Personalized Vision-Language Model
di: An, Ruichuan, et al.
Pubblicazione: (2024)
di: An, Ruichuan, et al.
Pubblicazione: (2024)
AutoRed: A Free-form Adversarial Prompt Generation Framework for Automated Red Teaming
di: Diao, Muxi, et al.
Pubblicazione: (2025)
di: Diao, Muxi, et al.
Pubblicazione: (2025)
Can Sound Replace Vision in LLaVA With Token Substitution?
di: Vosoughi, Ali, et al.
Pubblicazione: (2025)
di: Vosoughi, Ali, et al.
Pubblicazione: (2025)
Enhance Image-to-Image Generation with LLaVA-generated Prompts
di: Ding, Zhicheng, et al.
Pubblicazione: (2024)
di: Ding, Zhicheng, et al.
Pubblicazione: (2024)
LLaVA-c: Continual Improved Visual Instruction Tuning
di: Liu, Wenzhuo, et al.
Pubblicazione: (2025)
di: Liu, Wenzhuo, et al.
Pubblicazione: (2025)
Beyond LLaVA-HD: Diving into High-Resolution Large Multimodal Models
di: Zhang, Yi-Fan, et al.
Pubblicazione: (2024)
di: Zhang, Yi-Fan, et al.
Pubblicazione: (2024)
Continual LLaVA: Continual Instruction Tuning in Large Vision-Language Models
di: Cao, Meng, et al.
Pubblicazione: (2024)
di: Cao, Meng, et al.
Pubblicazione: (2024)
PGP-SAM: Prototype-Guided Prompt Learning for Efficient Few-Shot Medical Image Segmentation
di: Yan, Zhonghao, et al.
Pubblicazione: (2025)
di: Yan, Zhonghao, et al.
Pubblicazione: (2025)
LLaVA Needs More Knowledge: Retrieval Augmented Natural Language Generation with Knowledge Graph for Explaining Thoracic Pathologies
di: Hamza, Ameer, et al.
Pubblicazione: (2024)
di: Hamza, Ameer, et al.
Pubblicazione: (2024)
Documenti analoghi
-
WSI-LLaVA: A Multimodal Large Language Model for Whole Slide Image
di: Liang, Yuci, et al.
Pubblicazione: (2024) -
From Simple to Professional: A Combinatorial Controllable Image Captioning Agent
di: Wang, Xinran, et al.
Pubblicazione: (2024) -
DetailVerifyBench: A Benchmark for Dense Hallucination Localization in Long Image Captions
di: Wang, Xinran, et al.
Pubblicazione: (2026) -
MedReasoner: Reinforcement Learning Drives Reasoning Grounding from Clinical Thought to Pixel-Level Precision
di: Yan, Zhonghao, et al.
Pubblicazione: (2025) -
Cosmos-LLaVA: Chatting with the Visual Cosmos-LLaVA: Görselle Sohbet Etmek
di: Zeer, Ahmed, et al.
Pubblicazione: (2024)