Enhance Image-to-Image Generation with LLaVA-generated Prompts
Fuente:
arXiv
Guardado en:
| Autores principales: | Ding, Zhicheng, Li, Panfeng, Yang, Qikai, Li, Siyang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Regional Style and Color Transfer
por: Ding, Zhicheng, et al.
Publicado: (2024)
por: Ding, Zhicheng, et al.
Publicado: (2024)
TG-LLaVA: Text Guided LLaVA via Learnable Latent Embeddings
por: Yan, Dawei, et al.
Publicado: (2024)
por: Yan, Dawei, et al.
Publicado: (2024)
LLaVA-MoD: Making LLaVA Tiny via MoE Knowledge Distillation
por: Shu, Fangxun, et al.
Publicado: (2024)
por: Shu, Fangxun, et al.
Publicado: (2024)
Sa2VA: Marrying SAM2 with LLaVA for Dense Grounded Understanding of Images and Videos
por: Yuan, Haobo, et al.
Publicado: (2025)
por: Yuan, Haobo, et al.
Publicado: (2025)
Confidence Trigger Detection: Accelerating Real-time Tracking-by-detection Systems
por: Ding, Zhicheng, et al.
Publicado: (2019)
por: Ding, Zhicheng, et al.
Publicado: (2019)
WSI-LLaVA: A Multimodal Large Language Model for Whole Slide Image
por: Liang, Yuci, et al.
Publicado: (2024)
por: Liang, Yuci, et al.
Publicado: (2024)
Data Augmentation Through Random Style Replacement
por: Yang, Qikai, et al.
Publicado: (2025)
por: Yang, Qikai, et al.
Publicado: (2025)
LLaVA-RE: Binary Image-Text Relevancy Evaluation with Multimodal Large Language Model
por: Sun, Tao, et al.
Publicado: (2025)
por: Sun, Tao, et al.
Publicado: (2025)
MG-LLaVA: Towards Multi-Granularity Visual Instruction Tuning
por: Zhao, Xiangyu, et al.
Publicado: (2024)
por: Zhao, Xiangyu, et al.
Publicado: (2024)
OMG-LLaVA: Bridging Image-level, Object-level, Pixel-level Reasoning and Understanding
por: Zhang, Tao, et al.
Publicado: (2024)
por: Zhang, Tao, et al.
Publicado: (2024)
NOVO: Bridging LLaVA and SAM with Visual-only Prompts for Reasoning Segmentation
por: Yoon, Kyung-Yoon, et al.
Publicado: (2025)
por: Yoon, Kyung-Yoon, et al.
Publicado: (2025)
Why do LLaVA Vision-Language Models Reply to Images in English?
por: Hinck, Musashi, et al.
Publicado: (2024)
por: Hinck, Musashi, et al.
Publicado: (2024)
PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning
por: Xu, Lin, et al.
Publicado: (2024)
por: Xu, Lin, et al.
Publicado: (2024)
LLaVA-Video: Video Instruction Tuning With Synthetic Data
por: Zhang, Yuanhan, et al.
Publicado: (2024)
por: Zhang, Yuanhan, et al.
Publicado: (2024)
LLaVA-Critic: Learning to Evaluate Multimodal Models
por: Xiong, Tianyi, et al.
Publicado: (2024)
por: Xiong, Tianyi, et al.
Publicado: (2024)
Cosmos-LLaVA: Chatting with the Visual Cosmos-LLaVA: Görselle Sohbet Etmek
por: Zeer, Ahmed, et al.
Publicado: (2024)
por: Zeer, Ahmed, et al.
Publicado: (2024)
TC-LLaVA: Rethinking the Transfer from Image to Video Understanding with Temporal Considerations
por: Gao, Mingze, et al.
Publicado: (2024)
por: Gao, Mingze, et al.
Publicado: (2024)
LLaVA-OneVision-2: Towards Next-Generation Perceptual Intelligence
por: An, Xiang, et al.
Publicado: (2026)
por: An, Xiang, et al.
Publicado: (2026)
Understanding and Mitigating Toxicity in Image-Text Pretraining Datasets: A Case Study on LLaVA
por: Kanjula, Karthik Reddy, et al.
Publicado: (2025)
por: Kanjula, Karthik Reddy, et al.
Publicado: (2025)
Hepato-LLaVA: An Expert MLLM with Sparse Topo-Pack Attention for Hepatocellular Pathology Analysis on Whole Slide Images
por: Yang, Yuxuan, et al.
Publicado: (2026)
por: Yang, Yuxuan, et al.
Publicado: (2026)
Video-LLaVA: Learning United Visual Representation by Alignment Before Projection
por: Lin, Bin, et al.
Publicado: (2023)
por: Lin, Bin, et al.
Publicado: (2023)
LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs
por: Lou, Haoran, et al.
Publicado: (2025)
por: Lou, Haoran, et al.
Publicado: (2025)
LLaVA-FA: Learning Fourier Approximation for Compressing Large Multimodal Models
por: Zheng, Pengcheng, et al.
Publicado: (2026)
por: Zheng, Pengcheng, et al.
Publicado: (2026)
LLaVA-CoT: Let Vision Language Models Reason Step-by-Step
por: Xu, Guowei, et al.
Publicado: (2024)
por: Xu, Guowei, et al.
Publicado: (2024)
LLaVA-Mini: Efficient Image and Video Large Multimodal Models with One Vision Token
por: Zhang, Shaolei, et al.
Publicado: (2025)
por: Zhang, Shaolei, et al.
Publicado: (2025)
u-LLaVA: Unifying Multi-Modal Tasks via Large Language Model
por: Xu, Jinjin, et al.
Publicado: (2023)
por: Xu, Jinjin, et al.
Publicado: (2023)
LLaVA-OneVision: Easy Visual Task Transfer
por: Li, Bo, et al.
Publicado: (2024)
por: Li, Bo, et al.
Publicado: (2024)
MoE-LLaVA: Mixture of Experts for Large Vision-Language Models
por: Lin, Bin, et al.
Publicado: (2024)
por: Lin, Bin, et al.
Publicado: (2024)
LLaVA-MLB: Mitigating and Leveraging Attention Bias for Training-Free Video LLMs
por: Shen, Leqi, et al.
Publicado: (2025)
por: Shen, Leqi, et al.
Publicado: (2025)
LLaVA-UHD: an LMM Perceiving Any Aspect Ratio and High-Resolution Images
por: Xu, Ruyi, et al.
Publicado: (2024)
por: Xu, Ruyi, et al.
Publicado: (2024)
LLaVA-c: Continual Improved Visual Instruction Tuning
por: Liu, Wenzhuo, et al.
Publicado: (2025)
por: Liu, Wenzhuo, et al.
Publicado: (2025)
Continual LLaVA: Continual Instruction Tuning in Large Vision-Language Models
por: Cao, Meng, et al.
Publicado: (2024)
por: Cao, Meng, et al.
Publicado: (2024)
LLaVA-SpaceSGG: Visual Instruct Tuning for Open-vocabulary Scene Graph Generation with Enhanced Spatial Relations
por: Xu, Mingjie, et al.
Publicado: (2024)
por: Xu, Mingjie, et al.
Publicado: (2024)
LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval
por: Lu, Weiheng, et al.
Publicado: (2024)
por: Lu, Weiheng, et al.
Publicado: (2024)
LLaVA-Read: Enhancing Reading Ability of Multimodal Language Models
por: Zhang, Ruiyi, et al.
Publicado: (2024)
por: Zhang, Ruiyi, et al.
Publicado: (2024)
LLaVA-4D: Embedding SpatioTemporal Prompt into LMMs for 4D Scene Understanding
por: Zhou, Hanyu, et al.
Publicado: (2025)
por: Zhou, Hanyu, et al.
Publicado: (2025)
LLaVA-Zip: Adaptive Visual Token Compression with Intrinsic Image Information
por: Wang, Ke, et al.
Publicado: (2024)
por: Wang, Ke, et al.
Publicado: (2024)
Robust-LLaVA: On the Effectiveness of Large-Scale Robust Image Encoders for Multi-modal Large Language Models
por: Malik, Hashmat Shadab, et al.
Publicado: (2025)
por: Malik, Hashmat Shadab, et al.
Publicado: (2025)
LLaVA-Ultra: Large Chinese Language and Vision Assistant for Ultrasound
por: Guo, Xuechen, et al.
Publicado: (2024)
por: Guo, Xuechen, et al.
Publicado: (2024)
LLaVA-SLT: Visual Language Tuning for Sign Language Translation
por: Liang, Han, et al.
Publicado: (2024)
por: Liang, Han, et al.
Publicado: (2024)
Ejemplares similares
-
Regional Style and Color Transfer
por: Ding, Zhicheng, et al.
Publicado: (2024) -
TG-LLaVA: Text Guided LLaVA via Learnable Latent Embeddings
por: Yan, Dawei, et al.
Publicado: (2024) -
LLaVA-MoD: Making LLaVA Tiny via MoE Knowledge Distillation
por: Shu, Fangxun, et al.
Publicado: (2024) -
Sa2VA: Marrying SAM2 with LLaVA for Dense Grounded Understanding of Images and Videos
por: Yuan, Haobo, et al.
Publicado: (2025) -
Confidence Trigger Detection: Accelerating Real-time Tracking-by-detection Systems
por: Ding, Zhicheng, et al.
Publicado: (2019)