u-LLaVA: Unifying Multi-Modal Tasks via Large Language Model
Fuente:
arXiv
Guardado en:
| Autores principales: | Xu, Jinjin, Xu, Liwu, Yang, Yuzhe, Li, Xiang, Wang, Fanyi, Xie, Yanchun, Huang, Yi-Jie, Li, Yaqian |
|---|---|
| Formato: | Preprint |
| Publicado: |
2023
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
G-LLaVA: Solving Geometric Problem with Multi-Modal Large Language Model
por: Gao, Jiahui, et al.
Publicado: (2023)
por: Gao, Jiahui, et al.
Publicado: (2023)
CLIP Brings Better Features to Visual Aesthetics Learners
por: Xu, Liwu, et al.
Publicado: (2023)
por: Xu, Liwu, et al.
Publicado: (2023)
TG-LLaVA: Text Guided LLaVA via Learnable Latent Embeddings
por: Yan, Dawei, et al.
Publicado: (2024)
por: Yan, Dawei, et al.
Publicado: (2024)
LLaVA-MoD: Making LLaVA Tiny via MoE Knowledge Distillation
por: Shu, Fangxun, et al.
Publicado: (2024)
por: Shu, Fangxun, et al.
Publicado: (2024)
LLaVA-Phi: Efficient Multi-Modal Assistant with Small Language Model
por: Zhu, Yichen, et al.
Publicado: (2024)
por: Zhu, Yichen, et al.
Publicado: (2024)
LLaVA-OneVision: Easy Visual Task Transfer
por: Li, Bo, et al.
Publicado: (2024)
por: Li, Bo, et al.
Publicado: (2024)
LLaVA-SLT: Visual Language Tuning for Sign Language Translation
por: Liang, Han, et al.
Publicado: (2024)
por: Liang, Han, et al.
Publicado: (2024)
SQ-LLaVA: Self-Questioning for Large Vision-Language Assistant
por: Sun, Guohao, et al.
Publicado: (2024)
por: Sun, Guohao, et al.
Publicado: (2024)
MG-LLaVA: Towards Multi-Granularity Visual Instruction Tuning
por: Zhao, Xiangyu, et al.
Publicado: (2024)
por: Zhao, Xiangyu, et al.
Publicado: (2024)
MoE-LLaVA: Mixture of Experts for Large Vision-Language Models
por: Lin, Bin, et al.
Publicado: (2024)
por: Lin, Bin, et al.
Publicado: (2024)
LLaVA-Ultra: Large Chinese Language and Vision Assistant for Ultrasound
por: Guo, Xuechen, et al.
Publicado: (2024)
por: Guo, Xuechen, et al.
Publicado: (2024)
Geo-LLaVA: A Large Multi-Modal Model for Solving Geometry Math Problems with Meta In-Context Learning
por: Xu, Shihao, et al.
Publicado: (2024)
por: Xu, Shihao, et al.
Publicado: (2024)
Cosmos-LLaVA: Chatting with the Visual Cosmos-LLaVA: Görselle Sohbet Etmek
por: Zeer, Ahmed, et al.
Publicado: (2024)
por: Zeer, Ahmed, et al.
Publicado: (2024)
Math-LLaVA: Bootstrapping Mathematical Reasoning for Multimodal Large Language Models
por: Shi, Wenhao, et al.
Publicado: (2024)
por: Shi, Wenhao, et al.
Publicado: (2024)
LLaVA-CoT: Let Vision Language Models Reason Step-by-Step
por: Xu, Guowei, et al.
Publicado: (2024)
por: Xu, Guowei, et al.
Publicado: (2024)
MLLM-LLaVA-FL: Multimodal Large Language Model Assisted Federated Learning
por: Zhang, Jianyi, et al.
Publicado: (2024)
por: Zhang, Jianyi, et al.
Publicado: (2024)
AVG-LLaVA: An Efficient Large Multimodal Model with Adaptive Visual Granularity
por: Lan, Zhibin, et al.
Publicado: (2024)
por: Lan, Zhibin, et al.
Publicado: (2024)
LLaVA-KD: A Framework of Distilling Multimodal Large Language Models
por: Cai, Yuxuan, et al.
Publicado: (2024)
por: Cai, Yuxuan, et al.
Publicado: (2024)
LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval
por: Lu, Weiheng, et al.
Publicado: (2024)
por: Lu, Weiheng, et al.
Publicado: (2024)
MC-LLaVA: Multi-Concept Personalized Vision-Language Model
por: An, Ruichuan, et al.
Publicado: (2025)
por: An, Ruichuan, et al.
Publicado: (2025)
Enhance Image-to-Image Generation with LLaVA-generated Prompts
por: Ding, Zhicheng, et al.
Publicado: (2024)
por: Ding, Zhicheng, et al.
Publicado: (2024)
MC-LLaVA: Multi-Concept Personalized Vision-Language Model
por: An, Ruichuan, et al.
Publicado: (2024)
por: An, Ruichuan, et al.
Publicado: (2024)
Power-LLaVA: Large Language and Vision Assistant for Power Transmission Line Inspection
por: Wang, Jiahao, et al.
Publicado: (2024)
por: Wang, Jiahao, et al.
Publicado: (2024)
PA-LLaVA: A Large Language-Vision Assistant for Human Pathology Image Understanding
por: Dai, Dawei, et al.
Publicado: (2024)
por: Dai, Dawei, et al.
Publicado: (2024)
HiDe-LLaVA: Hierarchical Decoupling for Continual Instruction Tuning of Multimodal Large Language Model
por: Guo, Haiyang, et al.
Publicado: (2025)
por: Guo, Haiyang, et al.
Publicado: (2025)
LLaVA-VSD: Large Language-and-Vision Assistant for Visual Spatial Description
por: Jin, Yizhang, et al.
Publicado: (2024)
por: Jin, Yizhang, et al.
Publicado: (2024)
Dynamic-LLaVA: Efficient Multimodal Large Language Models via Dynamic Vision-language Context Sparsification
por: Huang, Wenxuan, et al.
Publicado: (2024)
por: Huang, Wenxuan, et al.
Publicado: (2024)
LLaVA-Critic: Learning to Evaluate Multimodal Models
por: Xiong, Tianyi, et al.
Publicado: (2024)
por: Xiong, Tianyi, et al.
Publicado: (2024)
LLaVA-LE: Large Language-and-Vision Assistant for Lunar Exploration
por: Inal, Gokce, et al.
Publicado: (2026)
por: Inal, Gokce, et al.
Publicado: (2026)
X-LLaVA: Optimizing Bilingual Large Vision-Language Alignment
por: Shin, Dongjae, et al.
Publicado: (2024)
por: Shin, Dongjae, et al.
Publicado: (2024)
ReGraP-LLaVA: Reasoning enabled Graph-based Personalized Large Language and Vision Assistant
por: Xiang, Yifan, et al.
Publicado: (2025)
por: Xiang, Yifan, et al.
Publicado: (2025)
Align$^2$LLaVA: Cascaded Human and Large Language Model Preference Alignment for Multi-modal Instruction Curation
por: Huang, Hongzhe, et al.
Publicado: (2024)
por: Huang, Hongzhe, et al.
Publicado: (2024)
Causal-LLaVA: Causal Disentanglement for Mitigating Hallucination in Multimodal Large Language Models
por: Hu, Xinmiao, et al.
Publicado: (2025)
por: Hu, Xinmiao, et al.
Publicado: (2025)
Amharic LLaMA and LLaVA: Multimodal LLMs for Low Resource Languages
por: Andersland, Michael
Publicado: (2024)
por: Andersland, Michael
Publicado: (2024)
Can Sound Replace Vision in LLaVA With Token Substitution?
por: Vosoughi, Ali, et al.
Publicado: (2025)
por: Vosoughi, Ali, et al.
Publicado: (2025)
LLaVA-FA: Learning Fourier Approximation for Compressing Large Multimodal Models
por: Zheng, Pengcheng, et al.
Publicado: (2026)
por: Zheng, Pengcheng, et al.
Publicado: (2026)
HiRes-LLaVA: Restoring Fragmentation Input in High-Resolution Large Vision-Language Models
por: Huang, Runhui, et al.
Publicado: (2024)
por: Huang, Runhui, et al.
Publicado: (2024)
LLaVA-Video: Video Instruction Tuning With Synthetic Data
por: Zhang, Yuanhan, et al.
Publicado: (2024)
por: Zhang, Yuanhan, et al.
Publicado: (2024)
LLaVA-RE: Binary Image-Text Relevancy Evaluation with Multimodal Large Language Model
por: Sun, Tao, et al.
Publicado: (2025)
por: Sun, Tao, et al.
Publicado: (2025)
ATP-LLaVA: Adaptive Token Pruning for Large Vision Language Models
por: Ye, Xubing, et al.
Publicado: (2024)
por: Ye, Xubing, et al.
Publicado: (2024)
Ejemplares similares
-
G-LLaVA: Solving Geometric Problem with Multi-Modal Large Language Model
por: Gao, Jiahui, et al.
Publicado: (2023) -
CLIP Brings Better Features to Visual Aesthetics Learners
por: Xu, Liwu, et al.
Publicado: (2023) -
TG-LLaVA: Text Guided LLaVA via Learnable Latent Embeddings
por: Yan, Dawei, et al.
Publicado: (2024) -
LLaVA-MoD: Making LLaVA Tiny via MoE Knowledge Distillation
por: Shu, Fangxun, et al.
Publicado: (2024) -
LLaVA-Phi: Efficient Multi-Modal Assistant with Small Language Model
por: Zhu, Yichen, et al.
Publicado: (2024)