AVG-LLaVA: An Efficient Large Multimodal Model with Adaptive Visual Granularity
Fuente:
arXiv
Salvato in:
| Autori principali: | Lan, Zhibin, Niu, Liqiang, Meng, Fandong, Li, Wenbo, Zhou, Jie, Su, Jinsong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
LLaVE: Large Language and Vision Embedding Models with Hardness-Weighted Contrastive Learning
di: Lan, Zhibin, et al.
Pubblicazione: (2025)
di: Lan, Zhibin, et al.
Pubblicazione: (2025)
LLaVA-PruMerge: Adaptive Token Reduction for Efficient Large Multimodal Models
di: Shang, Yuzhang, et al.
Pubblicazione: (2024)
di: Shang, Yuzhang, et al.
Pubblicazione: (2024)
LLaVA-Critic: Learning to Evaluate Multimodal Models
di: Xiong, Tianyi, et al.
Pubblicazione: (2024)
di: Xiong, Tianyi, et al.
Pubblicazione: (2024)
Cosmos-LLaVA: Chatting with the Visual Cosmos-LLaVA: Görselle Sohbet Etmek
di: Zeer, Ahmed, et al.
Pubblicazione: (2024)
di: Zeer, Ahmed, et al.
Pubblicazione: (2024)
WSI-LLaVA: A Multimodal Large Language Model for Whole Slide Image
di: Liang, Yuci, et al.
Pubblicazione: (2024)
di: Liang, Yuci, et al.
Pubblicazione: (2024)
LLaVA-Mini: Efficient Image and Video Large Multimodal Models with One Vision Token
di: Zhang, Shaolei, et al.
Pubblicazione: (2025)
di: Zhang, Shaolei, et al.
Pubblicazione: (2025)
LLaVA-OneVision: Easy Visual Task Transfer
di: Li, Bo, et al.
Pubblicazione: (2024)
di: Li, Bo, et al.
Pubblicazione: (2024)
LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models
di: Liu, Juntao, et al.
Pubblicazione: (2025)
di: Liu, Juntao, et al.
Pubblicazione: (2025)
ViP-LLaVA: Making Large Multimodal Models Understand Arbitrary Visual Prompts
di: Cai, Mu, et al.
Pubblicazione: (2023)
di: Cai, Mu, et al.
Pubblicazione: (2023)
LLaVA-Phi: Efficient Multi-Modal Assistant with Small Language Model
di: Zhu, Yichen, et al.
Pubblicazione: (2024)
di: Zhu, Yichen, et al.
Pubblicazione: (2024)
MG-LLaVA: Towards Multi-Granularity Visual Instruction Tuning
di: Zhao, Xiangyu, et al.
Pubblicazione: (2024)
di: Zhao, Xiangyu, et al.
Pubblicazione: (2024)
LLaVA-Video: Video Instruction Tuning With Synthetic Data
di: Zhang, Yuanhan, et al.
Pubblicazione: (2024)
di: Zhang, Yuanhan, et al.
Pubblicazione: (2024)
Wiki-LLaVA: Hierarchical Retrieval-Augmented Generation for Multimodal LLMs
di: Caffagni, Davide, et al.
Pubblicazione: (2024)
di: Caffagni, Davide, et al.
Pubblicazione: (2024)
Dynamic-LLaVA: Efficient Multimodal Large Language Models via Dynamic Vision-language Context Sparsification
di: Huang, Wenxuan, et al.
Pubblicazione: (2024)
di: Huang, Wenxuan, et al.
Pubblicazione: (2024)
Dr-LLaVA: Visual Instruction Tuning with Symbolic Clinical Grounding
di: Sun, Shenghuan, et al.
Pubblicazione: (2024)
di: Sun, Shenghuan, et al.
Pubblicazione: (2024)
LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models
di: Li, Feng, et al.
Pubblicazione: (2024)
di: Li, Feng, et al.
Pubblicazione: (2024)
Why do LLaVA Vision-Language Models Reply to Images in English?
di: Hinck, Musashi, et al.
Pubblicazione: (2024)
di: Hinck, Musashi, et al.
Pubblicazione: (2024)
SQ-LLaVA: Self-Questioning for Large Vision-Language Assistant
di: Sun, Guohao, et al.
Pubblicazione: (2024)
di: Sun, Guohao, et al.
Pubblicazione: (2024)
INF-LLaVA: Dual-perspective Perception for High-Resolution Multimodal Large Language Model
di: Ma, Yiwei, et al.
Pubblicazione: (2024)
di: Ma, Yiwei, et al.
Pubblicazione: (2024)
Translatotron-V(ison): An End-to-End Model for In-Image Machine Translation
di: Lan, Zhibin, et al.
Pubblicazione: (2024)
di: Lan, Zhibin, et al.
Pubblicazione: (2024)
LLaVA Steering: Visual Instruction Tuning with 500x Fewer Parameters through Modality Linear Representation-Steering
di: Bi, Jinhe, et al.
Pubblicazione: (2024)
di: Bi, Jinhe, et al.
Pubblicazione: (2024)
LLaVA-MORE: A Comparative Study of LLMs and Visual Backbones for Enhanced Visual Instruction Tuning
di: Cocchi, Federico, et al.
Pubblicazione: (2025)
di: Cocchi, Federico, et al.
Pubblicazione: (2025)
LLaVA-RE: Binary Image-Text Relevancy Evaluation with Multimodal Large Language Model
di: Sun, Tao, et al.
Pubblicazione: (2025)
di: Sun, Tao, et al.
Pubblicazione: (2025)
LLaVA-SLT: Visual Language Tuning for Sign Language Translation
di: Liang, Han, et al.
Pubblicazione: (2024)
di: Liang, Han, et al.
Pubblicazione: (2024)
Quilt-LLaVA: Visual Instruction Tuning by Extracting Localized Narratives from Open-Source Histopathology Videos
di: Seyfioglu, Mehmet Saygin, et al.
Pubblicazione: (2023)
di: Seyfioglu, Mehmet Saygin, et al.
Pubblicazione: (2023)
LLaVA-MoD: Making LLaVA Tiny via MoE Knowledge Distillation
di: Shu, Fangxun, et al.
Pubblicazione: (2024)
di: Shu, Fangxun, et al.
Pubblicazione: (2024)
Beyond LLaVA-HD: Diving into High-Resolution Large Multimodal Models
di: Zhang, Yi-Fan, et al.
Pubblicazione: (2024)
di: Zhang, Yi-Fan, et al.
Pubblicazione: (2024)
LLaVA-KD: A Framework of Distilling Multimodal Large Language Models
di: Cai, Yuxuan, et al.
Pubblicazione: (2024)
di: Cai, Yuxuan, et al.
Pubblicazione: (2024)
LLaVA-FA: Learning Fourier Approximation for Compressing Large Multimodal Models
di: Zheng, Pengcheng, et al.
Pubblicazione: (2026)
di: Zheng, Pengcheng, et al.
Pubblicazione: (2026)
ATP-LLaVA: Adaptive Token Pruning for Large Vision Language Models
di: Ye, Xubing, et al.
Pubblicazione: (2024)
di: Ye, Xubing, et al.
Pubblicazione: (2024)
TG-LLaVA: Text Guided LLaVA via Learnable Latent Embeddings
di: Yan, Dawei, et al.
Pubblicazione: (2024)
di: Yan, Dawei, et al.
Pubblicazione: (2024)
LLaVA-c: Continual Improved Visual Instruction Tuning
di: Liu, Wenzhuo, et al.
Pubblicazione: (2025)
di: Liu, Wenzhuo, et al.
Pubblicazione: (2025)
HyperLLaVA: Dynamic Visual and Language Expert Tuning for Multimodal Large Language Models
di: Zhang, Wenqiao, et al.
Pubblicazione: (2024)
di: Zhang, Wenqiao, et al.
Pubblicazione: (2024)
Agri-LLaVA: Knowledge-Infused Large Multimodal Assistant on Agricultural Pests and Diseases
di: Wang, Liqiong, et al.
Pubblicazione: (2024)
di: Wang, Liqiong, et al.
Pubblicazione: (2024)
LLaVA-UHD v4: What Makes Efficient Visual Encoding in MLLMs?
di: Fang, Kechen, et al.
Pubblicazione: (2026)
di: Fang, Kechen, et al.
Pubblicazione: (2026)
ViDRiP-LLaVA: A Dataset and Benchmark for Diagnostic Reasoning from Pathology Videos
di: Vuong, Trinh T. L., et al.
Pubblicazione: (2025)
di: Vuong, Trinh T. L., et al.
Pubblicazione: (2025)
LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs
di: Lou, Haoran, et al.
Pubblicazione: (2025)
di: Lou, Haoran, et al.
Pubblicazione: (2025)
LLaVA-Read: Enhancing Reading Ability of Multimodal Language Models
di: Zhang, Ruiyi, et al.
Pubblicazione: (2024)
di: Zhang, Ruiyi, et al.
Pubblicazione: (2024)
Continual LLaVA: Continual Instruction Tuning in Large Vision-Language Models
di: Cao, Meng, et al.
Pubblicazione: (2024)
di: Cao, Meng, et al.
Pubblicazione: (2024)
LLaVA-VSD: Large Language-and-Vision Assistant for Visual Spatial Description
di: Jin, Yizhang, et al.
Pubblicazione: (2024)
di: Jin, Yizhang, et al.
Pubblicazione: (2024)
Documenti analoghi
-
LLaVE: Large Language and Vision Embedding Models with Hardness-Weighted Contrastive Learning
di: Lan, Zhibin, et al.
Pubblicazione: (2025) -
LLaVA-PruMerge: Adaptive Token Reduction for Efficient Large Multimodal Models
di: Shang, Yuzhang, et al.
Pubblicazione: (2024) -
LLaVA-Critic: Learning to Evaluate Multimodal Models
di: Xiong, Tianyi, et al.
Pubblicazione: (2024) -
Cosmos-LLaVA: Chatting with the Visual Cosmos-LLaVA: Görselle Sohbet Etmek
di: Zeer, Ahmed, et al.
Pubblicazione: (2024) -
WSI-LLaVA: A Multimodal Large Language Model for Whole Slide Image
di: Liang, Yuci, et al.
Pubblicazione: (2024)