TinyLLaVA Factory: A Modularized Codebase for Small-scale Large Multimodal Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Jia, Junlong, Hu, Ying, Weng, Xi, Shi, Yiming, Li, Miao, Zhang, Xingjian, Zhou, Baichuan, Liu, Ziyu, Luo, Jie, Huang, Lei, Wu, Ji |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
TinyLLaVA: A Framework of Small-scale Large Multimodal Models
por: Zhou, Baichuan, et al.
Publicado: (2024)
por: Zhou, Baichuan, et al.
Publicado: (2024)
TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler
por: Zhang, Xingjian, et al.
Publicado: (2025)
por: Zhang, Xingjian, et al.
Publicado: (2025)
TinyLLaVA-Video-R1: Towards Smaller LMMs for Video Reasoning
por: Zhang, Xingjian, et al.
Publicado: (2025)
por: Zhang, Xingjian, et al.
Publicado: (2025)
Democratizing MLLMs in Healthcare: TinyLLaVA-Med for Efficient Healthcare Diagnostics in Resource-Constrained Settings
por: Mir, Aya El, et al.
Publicado: (2024)
por: Mir, Aya El, et al.
Publicado: (2024)
LLaVA-MoD: Making LLaVA Tiny via MoE Knowledge Distillation
por: Shu, Fangxun, et al.
Publicado: (2024)
por: Shu, Fangxun, et al.
Publicado: (2024)
LLaVAC: Fine-tuning LLaVA as a Multimodal Sentiment Classifier
por: Chay-intr, T., et al.
Publicado: (2025)
por: Chay-intr, T., et al.
Publicado: (2025)
Amharic LLaMA and LLaVA: Multimodal LLMs for Low Resource Languages
por: Andersland, Michael
Publicado: (2024)
por: Andersland, Michael
Publicado: (2024)
TG-LLaVA: Text Guided LLaVA via Learnable Latent Embeddings
por: Yan, Dawei, et al.
Publicado: (2024)
por: Yan, Dawei, et al.
Publicado: (2024)
AVG-LLaVA: An Efficient Large Multimodal Model with Adaptive Visual Granularity
por: Lan, Zhibin, et al.
Publicado: (2024)
por: Lan, Zhibin, et al.
Publicado: (2024)
LLaVA-ST: A Multimodal Large Language Model for Fine-Grained Spatial-Temporal Understanding
por: Li, Hongyu, et al.
Publicado: (2025)
por: Li, Hongyu, et al.
Publicado: (2025)
LLaVA-Critic: Learning to Evaluate Multimodal Models
por: Xiong, Tianyi, et al.
Publicado: (2024)
por: Xiong, Tianyi, et al.
Publicado: (2024)
INF-LLaVA: Dual-perspective Perception for High-Resolution Multimodal Large Language Model
por: Ma, Yiwei, et al.
Publicado: (2024)
por: Ma, Yiwei, et al.
Publicado: (2024)
Math-LLaVA: Bootstrapping Mathematical Reasoning for Multimodal Large Language Models
por: Shi, Wenhao, et al.
Publicado: (2024)
por: Shi, Wenhao, et al.
Publicado: (2024)
RPG: A Repository Planning Graph for Unified and Scalable Codebase Generation
por: Luo, Jane, et al.
Publicado: (2025)
por: Luo, Jane, et al.
Publicado: (2025)
CityLLaVA: Efficient Fine-Tuning for VLMs in City Scenario
por: Duan, Zhizhao, et al.
Publicado: (2024)
por: Duan, Zhizhao, et al.
Publicado: (2024)
Cosmos-LLaVA: Chatting with the Visual Cosmos-LLaVA: Görselle Sohbet Etmek
por: Zeer, Ahmed, et al.
Publicado: (2024)
por: Zeer, Ahmed, et al.
Publicado: (2024)
LLaVA-NeuMT: Selective Layer-Neuron Modulation for Efficient Multilingual Multimodal Translation
por: Wei, Jingxuan, et al.
Publicado: (2025)
por: Wei, Jingxuan, et al.
Publicado: (2025)
Wiki-LLaVA: Hierarchical Retrieval-Augmented Generation for Multimodal LLMs
por: Caffagni, Davide, et al.
Publicado: (2024)
por: Caffagni, Davide, et al.
Publicado: (2024)
LLaVA-Read: Enhancing Reading Ability of Multimodal Language Models
por: Zhang, Ruiyi, et al.
Publicado: (2024)
por: Zhang, Ruiyi, et al.
Publicado: (2024)
PerturboLLaVA: Reducing Multimodal Hallucinations with Perturbative Visual Training
por: Chen, Cong, et al.
Publicado: (2025)
por: Chen, Cong, et al.
Publicado: (2025)
LLaVA-Phi: Efficient Multi-Modal Assistant with Small Language Model
por: Zhu, Yichen, et al.
Publicado: (2024)
por: Zhu, Yichen, et al.
Publicado: (2024)
UrbanLLaVA: A Multi-modal Large Language Model for Urban Intelligence with Spatial Reasoning and Understanding
por: Feng, Jie, et al.
Publicado: (2025)
por: Feng, Jie, et al.
Publicado: (2025)
360-LLaMA-Factory: Plug & Play Sequence Parallelism for Long Post-Training
por: Zou, Haosheng, et al.
Publicado: (2025)
por: Zou, Haosheng, et al.
Publicado: (2025)
HyperLLaVA: Dynamic Visual and Language Expert Tuning for Multimodal Large Language Models
por: Zhang, Wenqiao, et al.
Publicado: (2024)
por: Zhang, Wenqiao, et al.
Publicado: (2024)
MC-LLaVA: Multi-Concept Personalized Vision-Language Model
por: An, Ruichuan, et al.
Publicado: (2025)
por: An, Ruichuan, et al.
Publicado: (2025)
ConvLLaVA: Hierarchical Backbones as Visual Encoder for Large Multimodal Models
por: Ge, Chunjiang, et al.
Publicado: (2024)
por: Ge, Chunjiang, et al.
Publicado: (2024)
Beyond LLaVA-HD: Diving into High-Resolution Large Multimodal Models
por: Zhang, Yi-Fan, et al.
Publicado: (2024)
por: Zhang, Yi-Fan, et al.
Publicado: (2024)
LLaVA-KD: A Framework of Distilling Multimodal Large Language Models
por: Cai, Yuxuan, et al.
Publicado: (2024)
por: Cai, Yuxuan, et al.
Publicado: (2024)
LLaVA-FA: Learning Fourier Approximation for Compressing Large Multimodal Models
por: Zheng, Pengcheng, et al.
Publicado: (2026)
por: Zheng, Pengcheng, et al.
Publicado: (2026)
Purrfessor: A Fine-tuned Multimodal LLaVA Diet Health Chatbot
por: Lu, Linqi, et al.
Publicado: (2024)
por: Lu, Linqi, et al.
Publicado: (2024)
ModARO: A Modular Approach to Architecture Reconstruction of Distributed Microservice Codebases
por: Manglaras, Oscar, et al.
Publicado: (2026)
por: Manglaras, Oscar, et al.
Publicado: (2026)
Multi-Object Tracking Retrieval with LLaVA-Video: A Training-Free Solution to MOT25-StAG Challenge
por: Yang, Yi, et al.
Publicado: (2025)
por: Yang, Yi, et al.
Publicado: (2025)
Geo-LLaVA: A Large Multi-Modal Model for Solving Geometry Math Problems with Meta In-Context Learning
por: Xu, Shihao, et al.
Publicado: (2024)
por: Xu, Shihao, et al.
Publicado: (2024)
MC-LLaVA: Multi-Concept Personalized Vision-Language Model
por: An, Ruichuan, et al.
Publicado: (2024)
por: An, Ruichuan, et al.
Publicado: (2024)
LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training
por: An, Xiang, et al.
Publicado: (2025)
por: An, Xiang, et al.
Publicado: (2025)
LLaVA-PruMerge: Adaptive Token Reduction for Efficient Large Multimodal Models
por: Shang, Yuzhang, et al.
Publicado: (2024)
por: Shang, Yuzhang, et al.
Publicado: (2024)
MLLM-LLaVA-FL: Multimodal Large Language Model Assisted Federated Learning
por: Zhang, Jianyi, et al.
Publicado: (2024)
por: Zhang, Jianyi, et al.
Publicado: (2024)
Causal-LLaVA: Causal Disentanglement for Mitigating Hallucination in Multimodal Large Language Models
por: Hu, Xinmiao, et al.
Publicado: (2025)
por: Hu, Xinmiao, et al.
Publicado: (2025)
WSI-LLaVA: A Multimodal Large Language Model for Whole Slide Image
por: Liang, Yuci, et al.
Publicado: (2024)
por: Liang, Yuci, et al.
Publicado: (2024)
Agri-LLaVA: Knowledge-Infused Large Multimodal Assistant on Agricultural Pests and Diseases
por: Wang, Liqiong, et al.
Publicado: (2024)
por: Wang, Liqiong, et al.
Publicado: (2024)
Ejemplares similares
-
TinyLLaVA: A Framework of Small-scale Large Multimodal Models
por: Zhou, Baichuan, et al.
Publicado: (2024) -
TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler
por: Zhang, Xingjian, et al.
Publicado: (2025) -
TinyLLaVA-Video-R1: Towards Smaller LMMs for Video Reasoning
por: Zhang, Xingjian, et al.
Publicado: (2025) -
Democratizing MLLMs in Healthcare: TinyLLaVA-Med for Efficient Healthcare Diagnostics in Resource-Constrained Settings
por: Mir, Aya El, et al.
Publicado: (2024) -
LLaVA-MoD: Making LLaVA Tiny via MoE Knowledge Distillation
por: Shu, Fangxun, et al.
Publicado: (2024)