TinyLLaVA: A Framework of Small-scale Large Multimodal Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhou, Baichuan, Hu, Ying, Weng, Xi, Jia, Junlong, Luo, Jie, Liu, Xien, Wu, Ji, Huang, Lei |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
TinyLLaVA Factory: A Modularized Codebase for Small-scale Large Multimodal Models
par: Jia, Junlong, et autres
Publié: (2024)
par: Jia, Junlong, et autres
Publié: (2024)
TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler
par: Zhang, Xingjian, et autres
Publié: (2025)
par: Zhang, Xingjian, et autres
Publié: (2025)
TinyLLaVA-Video-R1: Towards Smaller LMMs for Video Reasoning
par: Zhang, Xingjian, et autres
Publié: (2025)
par: Zhang, Xingjian, et autres
Publié: (2025)
Democratizing MLLMs in Healthcare: TinyLLaVA-Med for Efficient Healthcare Diagnostics in Resource-Constrained Settings
par: Mir, Aya El, et autres
Publié: (2024)
par: Mir, Aya El, et autres
Publié: (2024)
AVG-LLaVA: An Efficient Large Multimodal Model with Adaptive Visual Granularity
par: Lan, Zhibin, et autres
Publié: (2024)
par: Lan, Zhibin, et autres
Publié: (2024)
Math-LLaVA: Bootstrapping Mathematical Reasoning for Multimodal Large Language Models
par: Shi, Wenhao, et autres
Publié: (2024)
par: Shi, Wenhao, et autres
Publié: (2024)
LLaVAC: Fine-tuning LLaVA as a Multimodal Sentiment Classifier
par: Chay-intr, T., et autres
Publié: (2025)
par: Chay-intr, T., et autres
Publié: (2025)
Amharic LLaMA and LLaVA: Multimodal LLMs for Low Resource Languages
par: Andersland, Michael
Publié: (2024)
par: Andersland, Michael
Publié: (2024)
LLaVA-Critic: Learning to Evaluate Multimodal Models
par: Xiong, Tianyi, et autres
Publié: (2024)
par: Xiong, Tianyi, et autres
Publié: (2024)
LLaVA-NeuMT: Selective Layer-Neuron Modulation for Efficient Multilingual Multimodal Translation
par: Wei, Jingxuan, et autres
Publié: (2025)
par: Wei, Jingxuan, et autres
Publié: (2025)
HyperLLaVA: Dynamic Visual and Language Expert Tuning for Multimodal Large Language Models
par: Zhang, Wenqiao, et autres
Publié: (2024)
par: Zhang, Wenqiao, et autres
Publié: (2024)
WSI-LLaVA: A Multimodal Large Language Model for Whole Slide Image
par: Liang, Yuci, et autres
Publié: (2024)
par: Liang, Yuci, et autres
Publié: (2024)
UrbanLLaVA: A Multi-modal Large Language Model for Urban Intelligence with Spatial Reasoning and Understanding
par: Feng, Jie, et autres
Publié: (2025)
par: Feng, Jie, et autres
Publié: (2025)
MLLM-LLaVA-FL: Multimodal Large Language Model Assisted Federated Learning
par: Zhang, Jianyi, et autres
Publié: (2024)
par: Zhang, Jianyi, et autres
Publié: (2024)
TinyGPT-V: Efficient Multimodal Large Language Model via Small Backbones
par: Yuan, Zhengqing, et autres
Publié: (2023)
par: Yuan, Zhengqing, et autres
Publié: (2023)
Dynamic-LLaVA: Efficient Multimodal Large Language Models via Dynamic Vision-language Context Sparsification
par: Huang, Wenxuan, et autres
Publié: (2024)
par: Huang, Wenxuan, et autres
Publié: (2024)
MultifacetEval: Multifaceted Evaluation to Probe LLMs in Mastering Medical Knowledge
par: Zhou, Yuxuan, et autres
Publié: (2024)
par: Zhou, Yuxuan, et autres
Publié: (2024)
LLaVA-PruMerge: Adaptive Token Reduction for Efficient Large Multimodal Models
par: Shang, Yuzhang, et autres
Publié: (2024)
par: Shang, Yuzhang, et autres
Publié: (2024)
HiDe-LLaVA: Hierarchical Decoupling for Continual Instruction Tuning of Multimodal Large Language Model
par: Guo, Haiyang, et autres
Publié: (2025)
par: Guo, Haiyang, et autres
Publié: (2025)
LLaMA Pro: Progressive LLaMA with Block Expansion
par: Wu, Chengyue, et autres
Publié: (2024)
par: Wu, Chengyue, et autres
Publié: (2024)
X-LLaVA: Optimizing Bilingual Large Vision-Language Alignment
par: Shin, Dongjae, et autres
Publié: (2024)
par: Shin, Dongjae, et autres
Publié: (2024)
LLaVA-CMoE: Towards Continual Mixture of Experts for Large Vision-Language Models
par: Zhao, Hengyuan, et autres
Publié: (2025)
par: Zhao, Hengyuan, et autres
Publié: (2025)
LLaVA-Mini: Efficient Image and Video Large Multimodal Models with One Vision Token
par: Zhang, Shaolei, et autres
Publié: (2025)
par: Zhang, Shaolei, et autres
Publié: (2025)
LLaVA-Phi: Efficient Multi-Modal Assistant with Small Language Model
par: Zhu, Yichen, et autres
Publié: (2024)
par: Zhu, Yichen, et autres
Publié: (2024)
LLaVA-Docent: Instruction Tuning with Multimodal Large Language Model to Support Art Appreciation Education
par: Lee, Unggi, et autres
Publié: (2024)
par: Lee, Unggi, et autres
Publié: (2024)
ViP-LLaVA: Making Large Multimodal Models Understand Arbitrary Visual Prompts
par: Cai, Mu, et autres
Publié: (2023)
par: Cai, Mu, et autres
Publié: (2023)
LLaVA-Gemma: Accelerating Multimodal Foundation Models with a Compact Language Model
par: Hinck, Musashi, et autres
Publié: (2024)
par: Hinck, Musashi, et autres
Publié: (2024)
Wiki-LLaVA: Hierarchical Retrieval-Augmented Generation for Multimodal LLMs
par: Caffagni, Davide, et autres
Publié: (2024)
par: Caffagni, Davide, et autres
Publié: (2024)
Cosmos-LLaVA: Chatting with the Visual Cosmos-LLaVA: Görselle Sohbet Etmek
par: Zeer, Ahmed, et autres
Publié: (2024)
par: Zeer, Ahmed, et autres
Publié: (2024)
G-LLaVA: Solving Geometric Problem with Multi-Modal Large Language Model
par: Gao, Jiahui, et autres
Publié: (2023)
par: Gao, Jiahui, et autres
Publié: (2023)
LLaVA-MoD: Making LLaVA Tiny via MoE Knowledge Distillation
par: Shu, Fangxun, et autres
Publié: (2024)
par: Shu, Fangxun, et autres
Publié: (2024)
LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models
par: Li, Feng, et autres
Publié: (2024)
par: Li, Feng, et autres
Publié: (2024)
Reliable and diverse evaluation of LLM medical knowledge mastery
par: Zhou, Yuxuan, et autres
Publié: (2024)
par: Zhou, Yuxuan, et autres
Publié: (2024)
LLaVA-Video: Video Instruction Tuning With Synthetic Data
par: Zhang, Yuanhan, et autres
Publié: (2024)
par: Zhang, Yuanhan, et autres
Publié: (2024)
SQ-LLaVA: Self-Questioning for Large Vision-Language Assistant
par: Sun, Guohao, et autres
Publié: (2024)
par: Sun, Guohao, et autres
Publié: (2024)
Annotation-Efficient Vision-Language Model Adaptation to the Polish Language Using the LLaVA Framework
par: Statkiewicz, Grzegorz, et autres
Publié: (2026)
par: Statkiewicz, Grzegorz, et autres
Publié: (2026)
LLM Sensitivity Evaluation Framework for Clinical Diagnosis
par: Yan, Chenwei, et autres
Publié: (2025)
par: Yan, Chenwei, et autres
Publié: (2025)
HapticLLaMA: A Multimodal Sensory Language Model for Haptic Captioning
par: Hu, Guimin, et autres
Publié: (2025)
par: Hu, Guimin, et autres
Publié: (2025)
From Large to Super-Tiny: End-to-End Optimization for Cost-Efficient LLMs
par: Ni, Jiliang, et autres
Publié: (2025)
par: Ni, Jiliang, et autres
Publié: (2025)
LLaSA: Large Language and E-Commerce Shopping Assistant
par: Zhang, Shuo, et autres
Publié: (2024)
par: Zhang, Shuo, et autres
Publié: (2024)
Documents similaires
-
TinyLLaVA Factory: A Modularized Codebase for Small-scale Large Multimodal Models
par: Jia, Junlong, et autres
Publié: (2024) -
TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler
par: Zhang, Xingjian, et autres
Publié: (2025) -
TinyLLaVA-Video-R1: Towards Smaller LMMs for Video Reasoning
par: Zhang, Xingjian, et autres
Publié: (2025) -
Democratizing MLLMs in Healthcare: TinyLLaVA-Med for Efficient Healthcare Diagnostics in Resource-Constrained Settings
par: Mir, Aya El, et autres
Publié: (2024) -
AVG-LLaVA: An Efficient Large Multimodal Model with Adaptive Visual Granularity
par: Lan, Zhibin, et autres
Publié: (2024)