Yo'LLaVA: Your Personalized Language and Vision Assistant
Fuente:
arXiv
Guardado en:
| Autores principales: | Nguyen, Thao, Liu, Haotian, Li, Yuheng, Cai, Mu, Ojha, Utkarsh, Lee, Yong Jae |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Edit One for All: Interactive Batch Image Editing
por: Nguyen, Thao, et al.
Publicado: (2024)
por: Nguyen, Thao, et al.
Publicado: (2024)
YoChameleon: Personalized Vision and Language Generation
por: Nguyen, Thao, et al.
Publicado: (2025)
por: Nguyen, Thao, et al.
Publicado: (2025)
Towards Universal Fake Image Detectors that Generalize Across Generative Models
por: Ojha, Utkarsh, et al.
Publicado: (2023)
por: Ojha, Utkarsh, et al.
Publicado: (2023)
Leveraging Large Language Models for Scalable Vector Graphics-Driven Image Understanding
por: Cai, Mu, et al.
Publicado: (2023)
por: Cai, Mu, et al.
Publicado: (2023)
ViP-LLaVA: Making Large Multimodal Models Understand Arbitrary Visual Prompts
por: Cai, Mu, et al.
Publicado: (2023)
por: Cai, Mu, et al.
Publicado: (2023)
SQ-LLaVA: Self-Questioning for Large Vision-Language Assistant
por: Sun, Guohao, et al.
Publicado: (2024)
por: Sun, Guohao, et al.
Publicado: (2024)
LLaVA-LE: Large Language-and-Vision Assistant for Lunar Exploration
por: Inal, Gokce, et al.
Publicado: (2026)
por: Inal, Gokce, et al.
Publicado: (2026)
LLaVA-VSD: Large Language-and-Vision Assistant for Visual Spatial Description
por: Jin, Yizhang, et al.
Publicado: (2024)
por: Jin, Yizhang, et al.
Publicado: (2024)
Do Vision Models Develop Human-Like Progressive Difficulty Understanding?
por: Huang, Zeyi, et al.
Publicado: (2025)
por: Huang, Zeyi, et al.
Publicado: (2025)
LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval
por: Lu, Weiheng, et al.
Publicado: (2024)
por: Lu, Weiheng, et al.
Publicado: (2024)
LLaVA-Ultra: Large Chinese Language and Vision Assistant for Ultrasound
por: Guo, Xuechen, et al.
Publicado: (2024)
por: Guo, Xuechen, et al.
Publicado: (2024)
LLaVA-PruMerge: Adaptive Token Reduction for Efficient Large Multimodal Models
por: Shang, Yuzhang, et al.
Publicado: (2024)
por: Shang, Yuzhang, et al.
Publicado: (2024)
ReGraP-LLaVA: Reasoning enabled Graph-based Personalized Large Language and Vision Assistant
por: Xiang, Yifan, et al.
Publicado: (2025)
por: Xiang, Yifan, et al.
Publicado: (2025)
LLaRA: Supercharging Robot Learning Data for Vision-Language Policy
por: Li, Xiang, et al.
Publicado: (2024)
por: Li, Xiang, et al.
Publicado: (2024)
Power-LLaVA: Large Language and Vision Assistant for Power Transmission Line Inspection
por: Wang, Jiahao, et al.
Publicado: (2024)
por: Wang, Jiahao, et al.
Publicado: (2024)
Improved Baselines with Visual Instruction Tuning
por: Liu, Haotian, et al.
Publicado: (2023)
por: Liu, Haotian, et al.
Publicado: (2023)
Aligned Datasets Improve Detection of Latent Diffusion-Generated Images
por: Rajan, Anirudh Sundara, et al.
Publicado: (2024)
por: Rajan, Anirudh Sundara, et al.
Publicado: (2024)
LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model
por: Wang, Xiyao, et al.
Publicado: (2025)
por: Wang, Xiyao, et al.
Publicado: (2025)
MC-LLaVA: Multi-Concept Personalized Vision-Language Model
por: An, Ruichuan, et al.
Publicado: (2024)
por: An, Ruichuan, et al.
Publicado: (2024)
MC-LLaVA: Multi-Concept Personalized Vision-Language Model
por: An, Ruichuan, et al.
Publicado: (2025)
por: An, Ruichuan, et al.
Publicado: (2025)
Efficient LLaMA-3.2-Vision by Trimming Cross-attended Visual Features
por: Lee, Jewon, et al.
Publicado: (2025)
por: Lee, Jewon, et al.
Publicado: (2025)
LLaVA-Phi: Efficient Multi-Modal Assistant with Small Language Model
por: Zhu, Yichen, et al.
Publicado: (2024)
por: Zhu, Yichen, et al.
Publicado: (2024)
FairLLaVA: Fairness-Aware Parameter-Efficient Fine-Tuning for Large Vision-Language Assistants
por: Bhosale, Mahesh, et al.
Publicado: (2026)
por: Bhosale, Mahesh, et al.
Publicado: (2026)
VGBench: Evaluating Large Language Models on Vector Graphics Understanding and Generation
por: Zou, Bocheng, et al.
Publicado: (2024)
por: Zou, Bocheng, et al.
Publicado: (2024)
STLLaVA-Med: Self-Training Large Language and Vision Assistant for Medical Question-Answering
por: Sun, Guohao, et al.
Publicado: (2024)
por: Sun, Guohao, et al.
Publicado: (2024)
Continual LLaVA: Continual Instruction Tuning in Large Vision-Language Models
por: Cao, Meng, et al.
Publicado: (2024)
por: Cao, Meng, et al.
Publicado: (2024)
LLaVA-KD: A Framework of Distilling Multimodal Large Language Models
por: Cai, Yuxuan, et al.
Publicado: (2024)
por: Cai, Yuxuan, et al.
Publicado: (2024)
Removing Distributional Discrepancies in Captions Improves Image-Text Alignment
por: Li, Yuheng, et al.
Publicado: (2024)
por: Li, Yuheng, et al.
Publicado: (2024)
Agri-LLaVA: Knowledge-Infused Large Multimodal Assistant on Agricultural Pests and Diseases
por: Wang, Liqiong, et al.
Publicado: (2024)
por: Wang, Liqiong, et al.
Publicado: (2024)
Inverse-LLaVA: Eliminating Alignment Pre-training Through Text-to-Vision Mapping
por: Zhan, Xuhui, et al.
Publicado: (2025)
por: Zhan, Xuhui, et al.
Publicado: (2025)
Cosmos-LLaVA: Chatting with the Visual Cosmos-LLaVA: Görselle Sohbet Etmek
por: Zeer, Ahmed, et al.
Publicado: (2024)
por: Zeer, Ahmed, et al.
Publicado: (2024)
When LLaVA Meets Objects: Token Composition for Vision-Language-Models
por: Jahagirdar, Soumya, et al.
Publicado: (2026)
por: Jahagirdar, Soumya, et al.
Publicado: (2026)
ATP-LLaVA: Adaptive Token Pruning for Large Vision Language Models
por: Ye, Xubing, et al.
Publicado: (2024)
por: Ye, Xubing, et al.
Publicado: (2024)
MoE-LLaVA: Mixture of Experts for Large Vision-Language Models
por: Lin, Bin, et al.
Publicado: (2024)
por: Lin, Bin, et al.
Publicado: (2024)
LLaVA-CoT: Let Vision Language Models Reason Step-by-Step
por: Xu, Guowei, et al.
Publicado: (2024)
por: Xu, Guowei, et al.
Publicado: (2024)
LLaNA: Large Language and NeRF Assistant
por: Amaduzzi, Andrea, et al.
Publicado: (2024)
por: Amaduzzi, Andrea, et al.
Publicado: (2024)
Vinoground: Scrutinizing LMMs over Dense Temporal Reasoning with Short Videos
por: Zhang, Jianrui, et al.
Publicado: (2024)
por: Zhang, Jianrui, et al.
Publicado: (2024)
Relational Visual Similarity
por: Nguyen, Thao, et al.
Publicado: (2025)
por: Nguyen, Thao, et al.
Publicado: (2025)
CoLLaVO: Crayon Large Language and Vision mOdel
por: Lee, Byung-Kwan, et al.
Publicado: (2024)
por: Lee, Byung-Kwan, et al.
Publicado: (2024)
Personal Visual Memory from Explicit and Implicit Evidence
por: Nguyen, Viet, et al.
Publicado: (2026)
por: Nguyen, Viet, et al.
Publicado: (2026)
Ejemplares similares
-
Edit One for All: Interactive Batch Image Editing
por: Nguyen, Thao, et al.
Publicado: (2024) -
YoChameleon: Personalized Vision and Language Generation
por: Nguyen, Thao, et al.
Publicado: (2025) -
Towards Universal Fake Image Detectors that Generalize Across Generative Models
por: Ojha, Utkarsh, et al.
Publicado: (2023) -
Leveraging Large Language Models for Scalable Vector Graphics-Driven Image Understanding
por: Cai, Mu, et al.
Publicado: (2023) -
ViP-LLaVA: Making Large Multimodal Models Understand Arbitrary Visual Prompts
por: Cai, Mu, et al.
Publicado: (2023)