ConvLLaVA: Hierarchical Backbones as Visual Encoder for Large Multimodal Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Ge, Chunjiang, Cheng, Sijie, Wang, Ziming, Yuan, Jiale, Gao, Yuan, Song, Jun, Song, Shiji, Huang, Gao, Zheng, Bo |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
EfficientTrain++: Generalized Curriculum Learning for Efficient Visual Backbone Training
von: Wang, Yulin, et al.
Veröffentlicht: (2024)
von: Wang, Yulin, et al.
Veröffentlicht: (2024)
LLaVA-UHD: an LMM Perceiving Any Aspect Ratio and High-Resolution Images
von: Xu, Ruyi, et al.
Veröffentlicht: (2024)
von: Xu, Ruyi, et al.
Veröffentlicht: (2024)
Demystify Mamba in Vision: A Linear Attention Perspective
von: Han, Dongchen, et al.
Veröffentlicht: (2024)
von: Han, Dongchen, et al.
Veröffentlicht: (2024)
Cross-Modal Adapter for Vision-Language Retrieval
von: Jiang, Haojun, et al.
Veröffentlicht: (2022)
von: Jiang, Haojun, et al.
Veröffentlicht: (2022)
LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer
von: Zhang, Yipeng, et al.
Veröffentlicht: (2024)
von: Zhang, Yipeng, et al.
Veröffentlicht: (2024)
Probabilistic Contrastive Learning for Long-Tailed Visual Recognition
von: Du, Chaoqun, et al.
Veröffentlicht: (2024)
von: Du, Chaoqun, et al.
Veröffentlicht: (2024)
GSVA: Generalized Segmentation via Multimodal Large Language Models
von: Xia, Zhuofan, et al.
Veröffentlicht: (2023)
von: Xia, Zhuofan, et al.
Veröffentlicht: (2023)
PerturboLLaVA: Reducing Multimodal Hallucinations with Perturbative Visual Training
von: Chen, Cong, et al.
Veröffentlicht: (2025)
von: Chen, Cong, et al.
Veröffentlicht: (2025)
LLaVA-MORE: A Comparative Study of LLMs and Visual Backbones for Enhanced Visual Instruction Tuning
von: Cocchi, Federico, et al.
Veröffentlicht: (2025)
von: Cocchi, Federico, et al.
Veröffentlicht: (2025)
VisionLLaMA: A Unified LLaMA Backbone for Vision Tasks
von: Chu, Xiangxiang, et al.
Veröffentlicht: (2024)
von: Chu, Xiangxiang, et al.
Veröffentlicht: (2024)
LLaVA-ST: A Multimodal Large Language Model for Fine-Grained Spatial-Temporal Understanding
von: Li, Hongyu, et al.
Veröffentlicht: (2025)
von: Li, Hongyu, et al.
Veröffentlicht: (2025)
Everything to the Synthetic: Diffusion-driven Test-time Adaptation via Synthetic-Domain Alignment
von: Guo, Jiayi, et al.
Veröffentlicht: (2024)
von: Guo, Jiayi, et al.
Veröffentlicht: (2024)
AVG-LLaVA: An Efficient Large Multimodal Model with Adaptive Visual Granularity
von: Lan, Zhibin, et al.
Veröffentlicht: (2024)
von: Lan, Zhibin, et al.
Veröffentlicht: (2024)
LLaVA-FA: Learning Fourier Approximation for Compressing Large Multimodal Models
von: Zheng, Pengcheng, et al.
Veröffentlicht: (2026)
von: Zheng, Pengcheng, et al.
Veröffentlicht: (2026)
LLaVA-OneVision-2: Towards Next-Generation Perceptual Intelligence
von: An, Xiang, et al.
Veröffentlicht: (2026)
von: An, Xiang, et al.
Veröffentlicht: (2026)
iLLaVA: An Image is Worth Fewer Than 1/3 Input Tokens in Large Multimodal Models
von: Hu, Lianyu, et al.
Veröffentlicht: (2024)
von: Hu, Lianyu, et al.
Veröffentlicht: (2024)
SZTU-CMU at MER2024: Improving Emotion-LLaMA with Conv-Attention for Multimodal Emotion Recognition
von: Cheng, Zebang, et al.
Veröffentlicht: (2024)
von: Cheng, Zebang, et al.
Veröffentlicht: (2024)
WSI-LLaVA: A Multimodal Large Language Model for Whole Slide Image
von: Liang, Yuci, et al.
Veröffentlicht: (2024)
von: Liang, Yuci, et al.
Veröffentlicht: (2024)
Wiki-LLaVA: Hierarchical Retrieval-Augmented Generation for Multimodal LLMs
von: Caffagni, Davide, et al.
Veröffentlicht: (2024)
von: Caffagni, Davide, et al.
Veröffentlicht: (2024)
LLaVA-CoT: Let Vision Language Models Reason Step-by-Step
von: Xu, Guowei, et al.
Veröffentlicht: (2024)
von: Xu, Guowei, et al.
Veröffentlicht: (2024)
VA-Adapter: Adapting Ultrasound Foundation Model to Echocardiography Probe Guidance
von: Wang, Teng, et al.
Veröffentlicht: (2025)
von: Wang, Teng, et al.
Veröffentlicht: (2025)
Agri-LLaVA: Knowledge-Infused Large Multimodal Assistant on Agricultural Pests and Diseases
von: Wang, Liqiong, et al.
Veröffentlicht: (2024)
von: Wang, Liqiong, et al.
Veröffentlicht: (2024)
LLaVA-UHD v3: Progressive Visual Compression for Efficient Native-Resolution Encoding in MLLMs
von: Sun, Shichu, et al.
Veröffentlicht: (2025)
von: Sun, Shichu, et al.
Veröffentlicht: (2025)
Video-LLaVA: Learning United Visual Representation by Alignment Before Projection
von: Lin, Bin, et al.
Veröffentlicht: (2023)
von: Lin, Bin, et al.
Veröffentlicht: (2023)
Robust-LLaVA: On the Effectiveness of Large-Scale Robust Image Encoders for Multi-modal Large Language Models
von: Malik, Hashmat Shadab, et al.
Veröffentlicht: (2025)
von: Malik, Hashmat Shadab, et al.
Veröffentlicht: (2025)
FocusLLaVA: A Coarse-to-Fine Approach for Efficient and Effective Visual Token Compression
von: Zhu, Yuke, et al.
Veröffentlicht: (2024)
von: Zhu, Yuke, et al.
Veröffentlicht: (2024)
HyperLLaVA: Dynamic Visual and Language Expert Tuning for Multimodal Large Language Models
von: Zhang, Wenqiao, et al.
Veröffentlicht: (2024)
von: Zhang, Wenqiao, et al.
Veröffentlicht: (2024)
LLaVA-c: Continual Improved Visual Instruction Tuning
von: Liu, Wenzhuo, et al.
Veröffentlicht: (2025)
von: Liu, Wenzhuo, et al.
Veröffentlicht: (2025)
LLaVA-RadZ: Can Multimodal Large Language Models Effectively Tackle Zero-shot Radiology Recognition?
von: Li, Bangyan, et al.
Veröffentlicht: (2025)
von: Li, Bangyan, et al.
Veröffentlicht: (2025)
LLaVA-SLT: Visual Language Tuning for Sign Language Translation
von: Liang, Han, et al.
Veröffentlicht: (2024)
von: Liang, Han, et al.
Veröffentlicht: (2024)
LLaVA-UHD v4: What Makes Efficient Visual Encoding in MLLMs?
von: Fang, Kechen, et al.
Veröffentlicht: (2026)
von: Fang, Kechen, et al.
Veröffentlicht: (2026)
LLaVA-Critic: Learning to Evaluate Multimodal Models
von: Xiong, Tianyi, et al.
Veröffentlicht: (2024)
von: Xiong, Tianyi, et al.
Veröffentlicht: (2024)
MoE-LLaVA: Mixture of Experts for Large Vision-Language Models
von: Lin, Bin, et al.
Veröffentlicht: (2024)
von: Lin, Bin, et al.
Veröffentlicht: (2024)
ViP-LLaVA: Making Large Multimodal Models Understand Arbitrary Visual Prompts
von: Cai, Mu, et al.
Veröffentlicht: (2023)
von: Cai, Mu, et al.
Veröffentlicht: (2023)
Cosmos-LLaVA: Chatting with the Visual Cosmos-LLaVA: Görselle Sohbet Etmek
von: Zeer, Ahmed, et al.
Veröffentlicht: (2024)
von: Zeer, Ahmed, et al.
Veröffentlicht: (2024)
Beyond LLaVA-HD: Diving into High-Resolution Large Multimodal Models
von: Zhang, Yi-Fan, et al.
Veröffentlicht: (2024)
von: Zhang, Yi-Fan, et al.
Veröffentlicht: (2024)
LLaVA-KD: A Framework of Distilling Multimodal Large Language Models
von: Cai, Yuxuan, et al.
Veröffentlicht: (2024)
von: Cai, Yuxuan, et al.
Veröffentlicht: (2024)
NOVO: Bridging LLaVA and SAM with Visual-only Prompts for Reasoning Segmentation
von: Yoon, Kyung-Yoon, et al.
Veröffentlicht: (2025)
von: Yoon, Kyung-Yoon, et al.
Veröffentlicht: (2025)
Meta-Semi: A Meta-learning Approach for Semi-supervised Learning
von: Wang, Yulin, et al.
Veröffentlicht: (2020)
von: Wang, Yulin, et al.
Veröffentlicht: (2020)
UniRepLKNet: A Universal Perception Large-Kernel ConvNet for Audio, Video, Point Cloud, Time-Series and Image Recognition
von: Ding, Xiaohan, et al.
Veröffentlicht: (2023)
von: Ding, Xiaohan, et al.
Veröffentlicht: (2023)
Ähnliche Einträge
-
EfficientTrain++: Generalized Curriculum Learning for Efficient Visual Backbone Training
von: Wang, Yulin, et al.
Veröffentlicht: (2024) -
LLaVA-UHD: an LMM Perceiving Any Aspect Ratio and High-Resolution Images
von: Xu, Ruyi, et al.
Veröffentlicht: (2024) -
Demystify Mamba in Vision: A Linear Attention Perspective
von: Han, Dongchen, et al.
Veröffentlicht: (2024) -
Cross-Modal Adapter for Vision-Language Retrieval
von: Jiang, Haojun, et al.
Veröffentlicht: (2022) -
LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer
von: Zhang, Yipeng, et al.
Veröffentlicht: (2024)