Enregistré dans:
| Auteurs principaux: | Jia, Junlong, Hu, Ying, Weng, Xi, Shi, Yiming, Li, Miao, Zhang, Xingjian, Zhou, Baichuan, Liu, Ziyu, Luo, Jie, Huang, Lei, Wu, Ji |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2405.11788 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
TinyLLaVA: A Framework of Small-scale Large Multimodal Models
par: Zhou, Baichuan, et autres
Publié: (2024)
par: Zhou, Baichuan, et autres
Publié: (2024)
TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler
par: Zhang, Xingjian, et autres
Publié: (2025)
par: Zhang, Xingjian, et autres
Publié: (2025)
TinyLLaVA-Video-R1: Towards Smaller LMMs for Video Reasoning
par: Zhang, Xingjian, et autres
Publié: (2025)
par: Zhang, Xingjian, et autres
Publié: (2025)
Democratizing MLLMs in Healthcare: TinyLLaVA-Med for Efficient Healthcare Diagnostics in Resource-Constrained Settings
par: Mir, Aya El, et autres
Publié: (2024)
par: Mir, Aya El, et autres
Publié: (2024)
LLaVA-MoD: Making LLaVA Tiny via MoE Knowledge Distillation
par: Shu, Fangxun, et autres
Publié: (2024)
par: Shu, Fangxun, et autres
Publié: (2024)
LLaVAC: Fine-tuning LLaVA as a Multimodal Sentiment Classifier
par: Chay-intr, T., et autres
Publié: (2025)
par: Chay-intr, T., et autres
Publié: (2025)
Amharic LLaMA and LLaVA: Multimodal LLMs for Low Resource Languages
par: Andersland, Michael
Publié: (2024)
par: Andersland, Michael
Publié: (2024)
TG-LLaVA: Text Guided LLaVA via Learnable Latent Embeddings
par: Yan, Dawei, et autres
Publié: (2024)
par: Yan, Dawei, et autres
Publié: (2024)
LLaVA-ST: A Multimodal Large Language Model for Fine-Grained Spatial-Temporal Understanding
par: Li, Hongyu, et autres
Publié: (2025)
par: Li, Hongyu, et autres
Publié: (2025)
AVG-LLaVA: An Efficient Large Multimodal Model with Adaptive Visual Granularity
par: Lan, Zhibin, et autres
Publié: (2024)
par: Lan, Zhibin, et autres
Publié: (2024)
LLaVA-Critic: Learning to Evaluate Multimodal Models
par: Xiong, Tianyi, et autres
Publié: (2024)
par: Xiong, Tianyi, et autres
Publié: (2024)
INF-LLaVA: Dual-perspective Perception for High-Resolution Multimodal Large Language Model
par: Ma, Yiwei, et autres
Publié: (2024)
par: Ma, Yiwei, et autres
Publié: (2024)
RPG: A Repository Planning Graph for Unified and Scalable Codebase Generation
par: Luo, Jane, et autres
Publié: (2025)
par: Luo, Jane, et autres
Publié: (2025)
Math-LLaVA: Bootstrapping Mathematical Reasoning for Multimodal Large Language Models
par: Shi, Wenhao, et autres
Publié: (2024)
par: Shi, Wenhao, et autres
Publié: (2024)
CityLLaVA: Efficient Fine-Tuning for VLMs in City Scenario
par: Duan, Zhizhao, et autres
Publié: (2024)
par: Duan, Zhizhao, et autres
Publié: (2024)
Cosmos-LLaVA: Chatting with the Visual Cosmos-LLaVA: Görselle Sohbet Etmek
par: Zeer, Ahmed, et autres
Publié: (2024)
par: Zeer, Ahmed, et autres
Publié: (2024)
360-LLaMA-Factory: Plug & Play Sequence Parallelism for Long Post-Training
par: Zou, Haosheng, et autres
Publié: (2025)
par: Zou, Haosheng, et autres
Publié: (2025)
LLaVA-NeuMT: Selective Layer-Neuron Modulation for Efficient Multilingual Multimodal Translation
par: Wei, Jingxuan, et autres
Publié: (2025)
par: Wei, Jingxuan, et autres
Publié: (2025)
Wiki-LLaVA: Hierarchical Retrieval-Augmented Generation for Multimodal LLMs
par: Caffagni, Davide, et autres
Publié: (2024)
par: Caffagni, Davide, et autres
Publié: (2024)
LLaVA-Read: Enhancing Reading Ability of Multimodal Language Models
par: Zhang, Ruiyi, et autres
Publié: (2024)
par: Zhang, Ruiyi, et autres
Publié: (2024)
PerturboLLaVA: Reducing Multimodal Hallucinations with Perturbative Visual Training
par: Chen, Cong, et autres
Publié: (2025)
par: Chen, Cong, et autres
Publié: (2025)
UrbanLLaVA: A Multi-modal Large Language Model for Urban Intelligence with Spatial Reasoning and Understanding
par: Feng, Jie, et autres
Publié: (2025)
par: Feng, Jie, et autres
Publié: (2025)
LLaVA-Phi: Efficient Multi-Modal Assistant with Small Language Model
par: Zhu, Yichen, et autres
Publié: (2024)
par: Zhu, Yichen, et autres
Publié: (2024)
MC-LLaVA: Multi-Concept Personalized Vision-Language Model
par: An, Ruichuan, et autres
Publié: (2025)
par: An, Ruichuan, et autres
Publié: (2025)
Multi-Object Tracking Retrieval with LLaVA-Video: A Training-Free Solution to MOT25-StAG Challenge
par: Yang, Yi, et autres
Publié: (2025)
par: Yang, Yi, et autres
Publié: (2025)
HyperLLaVA: Dynamic Visual and Language Expert Tuning for Multimodal Large Language Models
par: Zhang, Wenqiao, et autres
Publié: (2024)
par: Zhang, Wenqiao, et autres
Publié: (2024)
MC-LLaVA: Multi-Concept Personalized Vision-Language Model
par: An, Ruichuan, et autres
Publié: (2024)
par: An, Ruichuan, et autres
Publié: (2024)
ModARO: A Modular Approach to Architecture Reconstruction of Distributed Microservice Codebases
par: Manglaras, Oscar, et autres
Publié: (2026)
par: Manglaras, Oscar, et autres
Publié: (2026)
Geo-LLaVA: A Large Multi-Modal Model for Solving Geometry Math Problems with Meta In-Context Learning
par: Xu, Shihao, et autres
Publié: (2024)
par: Xu, Shihao, et autres
Publié: (2024)
ConvLLaVA: Hierarchical Backbones as Visual Encoder for Large Multimodal Models
par: Ge, Chunjiang, et autres
Publié: (2024)
par: Ge, Chunjiang, et autres
Publié: (2024)
Beyond LLaVA-HD: Diving into High-Resolution Large Multimodal Models
par: Zhang, Yi-Fan, et autres
Publié: (2024)
par: Zhang, Yi-Fan, et autres
Publié: (2024)
LLaVA-KD: A Framework of Distilling Multimodal Large Language Models
par: Cai, Yuxuan, et autres
Publié: (2024)
par: Cai, Yuxuan, et autres
Publié: (2024)
LLaVA-FA: Learning Fourier Approximation for Compressing Large Multimodal Models
par: Zheng, Pengcheng, et autres
Publié: (2026)
par: Zheng, Pengcheng, et autres
Publié: (2026)
Purrfessor: A Fine-tuned Multimodal LLaVA Diet Health Chatbot
par: Lu, Linqi, et autres
Publié: (2024)
par: Lu, Linqi, et autres
Publié: (2024)
LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training
par: An, Xiang, et autres
Publié: (2025)
par: An, Xiang, et autres
Publié: (2025)
LLaVA-Ultra: Large Chinese Language and Vision Assistant for Ultrasound
par: Guo, Xuechen, et autres
Publié: (2024)
par: Guo, Xuechen, et autres
Publié: (2024)
LLaVA-PruMerge: Adaptive Token Reduction for Efficient Large Multimodal Models
par: Shang, Yuzhang, et autres
Publié: (2024)
par: Shang, Yuzhang, et autres
Publié: (2024)
MLLM-LLaVA-FL: Multimodal Large Language Model Assisted Federated Learning
par: Zhang, Jianyi, et autres
Publié: (2024)
par: Zhang, Jianyi, et autres
Publié: (2024)
Causal-LLaVA: Causal Disentanglement for Mitigating Hallucination in Multimodal Large Language Models
par: Hu, Xinmiao, et autres
Publié: (2025)
par: Hu, Xinmiao, et autres
Publié: (2025)
WSI-LLaVA: A Multimodal Large Language Model for Whole Slide Image
par: Liang, Yuci, et autres
Publié: (2024)
par: Liang, Yuci, et autres
Publié: (2024)
Documents similaires
-
TinyLLaVA: A Framework of Small-scale Large Multimodal Models
par: Zhou, Baichuan, et autres
Publié: (2024) -
TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler
par: Zhang, Xingjian, et autres
Publié: (2025) -
TinyLLaVA-Video-R1: Towards Smaller LMMs for Video Reasoning
par: Zhang, Xingjian, et autres
Publié: (2025) -
Democratizing MLLMs in Healthcare: TinyLLaVA-Med for Efficient Healthcare Diagnostics in Resource-Constrained Settings
par: Mir, Aya El, et autres
Publié: (2024) -
LLaVA-MoD: Making LLaVA Tiny via MoE Knowledge Distillation
par: Shu, Fangxun, et autres
Publié: (2024)