LLaVA-CKD: Bottom-Up Cascaded Knowledge Distillation for Vision-Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Gkalelis, Nikolaos, Mezaris, Vasileios |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
T-TAME: Trainable Attention Mechanism for Explaining Convolutional Networks and Vision Transformers
par: Ntrougkas, Mariano V., et autres
Publié: (2024)
par: Ntrougkas, Mariano V., et autres
Publié: (2024)
TAME: Attention Mechanism Based Feature Fusion for Generating Explanation Maps of Convolutional Neural Networks
par: Ntrougkas, Mariano, et autres
Publié: (2023)
par: Ntrougkas, Mariano, et autres
Publié: (2023)
MC-LLaVA: Multi-Concept Personalized Vision-Language Model
par: An, Ruichuan, et autres
Publié: (2024)
par: An, Ruichuan, et autres
Publié: (2024)
MC-LLaVA: Multi-Concept Personalized Vision-Language Model
par: An, Ruichuan, et autres
Publié: (2025)
par: An, Ruichuan, et autres
Publié: (2025)
TG-LLaVA: Text Guided LLaVA via Learnable Latent Embeddings
par: Yan, Dawei, et autres
Publié: (2024)
par: Yan, Dawei, et autres
Publié: (2024)
LLaVA-Ultra: Large Chinese Language and Vision Assistant for Ultrasound
par: Guo, Xuechen, et autres
Publié: (2024)
par: Guo, Xuechen, et autres
Publié: (2024)
LLaVA-VSD: Large Language-and-Vision Assistant for Visual Spatial Description
par: Jin, Yizhang, et autres
Publié: (2024)
par: Jin, Yizhang, et autres
Publié: (2024)
Surgical-LLaVA: Toward Surgical Scenario Understanding via Large Language and Vision Models
par: Jin, Juseong, et autres
Publié: (2024)
par: Jin, Juseong, et autres
Publié: (2024)
LLaVA-SG: Leveraging Scene Graphs as Visual Semantic Expression in Vision-Language Models
par: Wang, Jingyi, et autres
Publié: (2024)
par: Wang, Jingyi, et autres
Publié: (2024)
LLaVA-Read: Enhancing Reading Ability of Multimodal Language Models
par: Zhang, Ruiyi, et autres
Publié: (2024)
par: Zhang, Ruiyi, et autres
Publié: (2024)
LLaVA-OneVision: Easy Visual Task Transfer
par: Li, Bo, et autres
Publié: (2024)
par: Li, Bo, et autres
Publié: (2024)
Cosmos-LLaVA: Chatting with the Visual Cosmos-LLaVA: Görselle Sohbet Etmek
par: Zeer, Ahmed, et autres
Publié: (2024)
par: Zeer, Ahmed, et autres
Publié: (2024)
SDAKD: Student Discriminator Assisted Knowledge Distillation for Super-Resolution Generative Adversarial Networks
par: Kaparinos, Nikolaos, et autres
Publié: (2025)
par: Kaparinos, Nikolaos, et autres
Publié: (2025)
SQ-LLaVA: Self-Questioning for Large Vision-Language Assistant
par: Sun, Guohao, et autres
Publié: (2024)
par: Sun, Guohao, et autres
Publié: (2024)
LLaVA-MoD: Making LLaVA Tiny via MoE Knowledge Distillation
par: Shu, Fangxun, et autres
Publié: (2024)
par: Shu, Fangxun, et autres
Publié: (2024)
ReGraP-LLaVA: Reasoning enabled Graph-based Personalized Large Language and Vision Assistant
par: Xiang, Yifan, et autres
Publié: (2025)
par: Xiang, Yifan, et autres
Publié: (2025)
INF-LLaVA: Dual-perspective Perception for High-Resolution Multimodal Large Language Model
par: Ma, Yiwei, et autres
Publié: (2024)
par: Ma, Yiwei, et autres
Publié: (2024)
LLaVA-Mini: Efficient Image and Video Large Multimodal Models with One Vision Token
par: Zhang, Shaolei, et autres
Publié: (2025)
par: Zhang, Shaolei, et autres
Publié: (2025)
AVG-LLaVA: An Efficient Large Multimodal Model with Adaptive Visual Granularity
par: Lan, Zhibin, et autres
Publié: (2024)
par: Lan, Zhibin, et autres
Publié: (2024)
Inverse-LLaVA: Eliminating Alignment Pre-training Through Text-to-Vision Mapping
par: Zhan, Xuhui, et autres
Publié: (2025)
par: Zhan, Xuhui, et autres
Publié: (2025)
Dynamic-LLaVA: Efficient Multimodal Large Language Models via Dynamic Vision-language Context Sparsification
par: Huang, Wenxuan, et autres
Publié: (2024)
par: Huang, Wenxuan, et autres
Publié: (2024)
R-LLaVA: Improving Med-VQA Understanding through Visual Region of Interest
par: Chen, Xupeng, et autres
Publié: (2024)
par: Chen, Xupeng, et autres
Publié: (2024)
LLaVA-Octopus: Unlocking Instruction-Driven Adaptive Projector Fusion for Video Understanding
par: Sun, Boyuan, et autres
Publié: (2025)
par: Sun, Boyuan, et autres
Publié: (2025)
TC-LLaVA: Rethinking the Transfer from Image to Video Understanding with Temporal Considerations
par: Gao, Mingze, et autres
Publié: (2024)
par: Gao, Mingze, et autres
Publié: (2024)
LLaVA-UHD: an LMM Perceiving Any Aspect Ratio and High-Resolution Images
par: Xu, Ruyi, et autres
Publié: (2024)
par: Xu, Ruyi, et autres
Publié: (2024)
LLaVA-PruMerge: Adaptive Token Reduction for Efficient Large Multimodal Models
par: Shang, Yuzhang, et autres
Publié: (2024)
par: Shang, Yuzhang, et autres
Publié: (2024)
Exploiting LMM-based knowledge for image classification tasks
par: Tzelepi, Maria, et autres
Publié: (2024)
par: Tzelepi, Maria, et autres
Publié: (2024)
Wiki-LLaVA: Hierarchical Retrieval-Augmented Generation for Multimodal LLMs
par: Caffagni, Davide, et autres
Publié: (2024)
par: Caffagni, Davide, et autres
Publié: (2024)
LLaVA-Surg: Towards Multimodal Surgical Assistant via Structured Surgical Video Learning
par: Li, Jiajie, et autres
Publié: (2024)
par: Li, Jiajie, et autres
Publié: (2024)
LLaVA-UHD v3: Progressive Visual Compression for Efficient Native-Resolution Encoding in MLLMs
par: Sun, Shichu, et autres
Publié: (2025)
par: Sun, Shichu, et autres
Publié: (2025)
Face-LLaVA: Facial Expression and Attribute Understanding through Instruction Tuning
par: Chaubey, Ashutosh, et autres
Publié: (2025)
par: Chaubey, Ashutosh, et autres
Publié: (2025)
LLaVA-Zip: Adaptive Visual Token Compression with Intrinsic Image Information
par: Wang, Ke, et autres
Publié: (2024)
par: Wang, Ke, et autres
Publié: (2024)
VidCtx: Context-aware Video Question Answering with Image Models
par: Goulas, Andreas, et autres
Publié: (2024)
par: Goulas, Andreas, et autres
Publié: (2024)
Dr-LLaVA: Visual Instruction Tuning with Symbolic Clinical Grounding
par: Sun, Shenghuan, et autres
Publié: (2024)
par: Sun, Shenghuan, et autres
Publié: (2024)
An Integrated Framework for Multi-Granular Explanation of Video Summarization
par: Tsigos, Konstantinos, et autres
Publié: (2024)
par: Tsigos, Konstantinos, et autres
Publié: (2024)
An Experimental Study on Generating Plausible Textual Explanations for Video Summarization
par: Eleftheriadis, Thomas, et autres
Publié: (2025)
par: Eleftheriadis, Thomas, et autres
Publié: (2025)
LLaVA-KD: A Framework of Distilling Multimodal Large Language Models
par: Cai, Yuxuan, et autres
Publié: (2024)
par: Cai, Yuxuan, et autres
Publié: (2024)
LLaVA-Scissor: Token Compression with Semantic Connected Components for Video LLMs
par: Sun, Boyuan, et autres
Publié: (2025)
par: Sun, Boyuan, et autres
Publié: (2025)
ViDRiP-LLaVA: A Dataset and Benchmark for Diagnostic Reasoning from Pathology Videos
par: Vuong, Trinh T. L., et autres
Publié: (2025)
par: Vuong, Trinh T. L., et autres
Publié: (2025)
Geo-LLaVA: A Large Multi-Modal Model for Solving Geometry Math Problems with Meta In-Context Learning
par: Xu, Shihao, et autres
Publié: (2024)
par: Xu, Shihao, et autres
Publié: (2024)
Documents similaires
-
T-TAME: Trainable Attention Mechanism for Explaining Convolutional Networks and Vision Transformers
par: Ntrougkas, Mariano V., et autres
Publié: (2024) -
TAME: Attention Mechanism Based Feature Fusion for Generating Explanation Maps of Convolutional Neural Networks
par: Ntrougkas, Mariano, et autres
Publié: (2023) -
MC-LLaVA: Multi-Concept Personalized Vision-Language Model
par: An, Ruichuan, et autres
Publié: (2024) -
MC-LLaVA: Multi-Concept Personalized Vision-Language Model
par: An, Ruichuan, et autres
Publié: (2025) -
TG-LLaVA: Text Guided LLaVA via Learnable Latent Embeddings
par: Yan, Dawei, et autres
Publié: (2024)