LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs
Fuente:
arXiv
Guardado en:
| Autores principales: | Lou, Haoran, Fan, Chunxiao, Liu, Ziyan, Wu, Yuexin, Wang, Xinliang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
LLaVA-UHD v4: What Makes Efficient Visual Encoding in MLLMs?
por: Fang, Kechen, et al.
Publicado: (2026)
por: Fang, Kechen, et al.
Publicado: (2026)
LLaVA-c: Continual Improved Visual Instruction Tuning
por: Liu, Wenzhuo, et al.
Publicado: (2025)
por: Liu, Wenzhuo, et al.
Publicado: (2025)
LLaVA-VSD: Large Language-and-Vision Assistant for Visual Spatial Description
por: Jin, Yizhang, et al.
Publicado: (2024)
por: Jin, Yizhang, et al.
Publicado: (2024)
Video-LLaVA: Learning United Visual Representation by Alignment Before Projection
por: Lin, Bin, et al.
Publicado: (2023)
por: Lin, Bin, et al.
Publicado: (2023)
Cosmos-LLaVA: Chatting with the Visual Cosmos-LLaVA: Görselle Sohbet Etmek
por: Zeer, Ahmed, et al.
Publicado: (2024)
por: Zeer, Ahmed, et al.
Publicado: (2024)
SLQ: Bridging Modalities via Shared Latent Queries for Retrieval with Frozen MLLMs
por: Lou, Haoran, et al.
Publicado: (2026)
por: Lou, Haoran, et al.
Publicado: (2026)
LLaVA-UHD v3: Progressive Visual Compression for Efficient Native-Resolution Encoding in MLLMs
por: Sun, Shichu, et al.
Publicado: (2025)
por: Sun, Shichu, et al.
Publicado: (2025)
LLaVA-Zip: Adaptive Visual Token Compression with Intrinsic Image Information
por: Wang, Ke, et al.
Publicado: (2024)
por: Wang, Ke, et al.
Publicado: (2024)
LLaVA-SpaceSGG: Visual Instruct Tuning for Open-vocabulary Scene Graph Generation with Enhanced Spatial Relations
por: Xu, Mingjie, et al.
Publicado: (2024)
por: Xu, Mingjie, et al.
Publicado: (2024)
LLaVA-SLT: Visual Language Tuning for Sign Language Translation
por: Liang, Han, et al.
Publicado: (2024)
por: Liang, Han, et al.
Publicado: (2024)
MG-LLaVA: Towards Multi-Granularity Visual Instruction Tuning
por: Zhao, Xiangyu, et al.
Publicado: (2024)
por: Zhao, Xiangyu, et al.
Publicado: (2024)
LLaVA-OneVision: Easy Visual Task Transfer
por: Li, Bo, et al.
Publicado: (2024)
por: Li, Bo, et al.
Publicado: (2024)
LLaVA-MoD: Making LLaVA Tiny via MoE Knowledge Distillation
por: Shu, Fangxun, et al.
Publicado: (2024)
por: Shu, Fangxun, et al.
Publicado: (2024)
NOVO: Bridging LLaVA and SAM with Visual-only Prompts for Reasoning Segmentation
por: Yoon, Kyung-Yoon, et al.
Publicado: (2025)
por: Yoon, Kyung-Yoon, et al.
Publicado: (2025)
TS-LLaVA: Constructing Visual Tokens through Thumbnail-and-Sampling for Training-Free Video Large Language Models
por: Qu, Tingyu, et al.
Publicado: (2024)
por: Qu, Tingyu, et al.
Publicado: (2024)
TG-LLaVA: Text Guided LLaVA via Learnable Latent Embeddings
por: Yan, Dawei, et al.
Publicado: (2024)
por: Yan, Dawei, et al.
Publicado: (2024)
R-LLaVA: Improving Med-VQA Understanding through Visual Region of Interest
por: Chen, Xupeng, et al.
Publicado: (2024)
por: Chen, Xupeng, et al.
Publicado: (2024)
When LLaVA Meets Objects: Token Composition for Vision-Language-Models
por: Jahagirdar, Soumya, et al.
Publicado: (2026)
por: Jahagirdar, Soumya, et al.
Publicado: (2026)
ATP-LLaVA: Adaptive Token Pruning for Large Vision Language Models
por: Ye, Xubing, et al.
Publicado: (2024)
por: Ye, Xubing, et al.
Publicado: (2024)
LLaVA-MORE: A Comparative Study of LLMs and Visual Backbones for Enhanced Visual Instruction Tuning
por: Cocchi, Federico, et al.
Publicado: (2025)
por: Cocchi, Federico, et al.
Publicado: (2025)
Enhance Image-to-Image Generation with LLaVA-generated Prompts
por: Ding, Zhicheng, et al.
Publicado: (2024)
por: Ding, Zhicheng, et al.
Publicado: (2024)
LLaVA-Critic: Learning to Evaluate Multimodal Models
por: Xiong, Tianyi, et al.
Publicado: (2024)
por: Xiong, Tianyi, et al.
Publicado: (2024)
LLaVA Steering: Visual Instruction Tuning with 500x Fewer Parameters through Modality Linear Representation-Steering
por: Bi, Jinhe, et al.
Publicado: (2024)
por: Bi, Jinhe, et al.
Publicado: (2024)
Spatial Reasoning is Not a Free Lunch: A Controlled Study on LLaVA
por: Alam, Nahid, et al.
Publicado: (2026)
por: Alam, Nahid, et al.
Publicado: (2026)
AVG-LLaVA: An Efficient Large Multimodal Model with Adaptive Visual Granularity
por: Lan, Zhibin, et al.
Publicado: (2024)
por: Lan, Zhibin, et al.
Publicado: (2024)
Delta-LLaVA: Base-then-Specialize Alignment for Token-Efficient Vision-Language Models
por: Zamini, Mohamad, et al.
Publicado: (2025)
por: Zamini, Mohamad, et al.
Publicado: (2025)
Dr-LLaVA: Visual Instruction Tuning with Symbolic Clinical Grounding
por: Sun, Shenghuan, et al.
Publicado: (2024)
por: Sun, Shenghuan, et al.
Publicado: (2024)
LLaVA-SG: Leveraging Scene Graphs as Visual Semantic Expression in Vision-Language Models
por: Wang, Jingyi, et al.
Publicado: (2024)
por: Wang, Jingyi, et al.
Publicado: (2024)
LLaVA-Video: Video Instruction Tuning With Synthetic Data
por: Zhang, Yuanhan, et al.
Publicado: (2024)
por: Zhang, Yuanhan, et al.
Publicado: (2024)
Beyond LLaVA-HD: Diving into High-Resolution Large Multimodal Models
por: Zhang, Yi-Fan, et al.
Publicado: (2024)
por: Zhang, Yi-Fan, et al.
Publicado: (2024)
DF-LLaVA: Unlocking MLLMs for Synthetic Image Detection via Knowledge Injection and Conflict-Driven Self-Reflection
por: Shen, Zhuokang, et al.
Publicado: (2025)
por: Shen, Zhuokang, et al.
Publicado: (2025)
LLaVA-MoLE: Sparse Mixture of LoRA Experts for Mitigating Data Conflicts in Instruction Finetuning MLLMs
por: Chen, Shaoxiang, et al.
Publicado: (2024)
por: Chen, Shaoxiang, et al.
Publicado: (2024)
Continual LLaVA: Continual Instruction Tuning in Large Vision-Language Models
por: Cao, Meng, et al.
Publicado: (2024)
por: Cao, Meng, et al.
Publicado: (2024)
LLaVA-ST: A Multimodal Large Language Model for Fine-Grained Spatial-Temporal Understanding
por: Li, Hongyu, et al.
Publicado: (2025)
por: Li, Hongyu, et al.
Publicado: (2025)
LLaVA-MLB: Mitigating and Leveraging Attention Bias for Training-Free Video LLMs
por: Shen, Leqi, et al.
Publicado: (2025)
por: Shen, Leqi, et al.
Publicado: (2025)
LLaVA-Read: Enhancing Reading Ability of Multimodal Language Models
por: Zhang, Ruiyi, et al.
Publicado: (2024)
por: Zhang, Ruiyi, et al.
Publicado: (2024)
LLaVA-KD: A Framework of Distilling Multimodal Large Language Models
por: Cai, Yuxuan, et al.
Publicado: (2024)
por: Cai, Yuxuan, et al.
Publicado: (2024)
LLaVA-PruMerge: Adaptive Token Reduction for Efficient Large Multimodal Models
por: Shang, Yuzhang, et al.
Publicado: (2024)
por: Shang, Yuzhang, et al.
Publicado: (2024)
LLaVA-CoT: Let Vision Language Models Reason Step-by-Step
por: Xu, Guowei, et al.
Publicado: (2024)
por: Xu, Guowei, et al.
Publicado: (2024)
ViP-LLaVA: Making Large Multimodal Models Understand Arbitrary Visual Prompts
por: Cai, Mu, et al.
Publicado: (2023)
por: Cai, Mu, et al.
Publicado: (2023)
Ejemplares similares
-
LLaVA-UHD v4: What Makes Efficient Visual Encoding in MLLMs?
por: Fang, Kechen, et al.
Publicado: (2026) -
LLaVA-c: Continual Improved Visual Instruction Tuning
por: Liu, Wenzhuo, et al.
Publicado: (2025) -
LLaVA-VSD: Large Language-and-Vision Assistant for Visual Spatial Description
por: Jin, Yizhang, et al.
Publicado: (2024) -
Video-LLaVA: Learning United Visual Representation by Alignment Before Projection
por: Lin, Bin, et al.
Publicado: (2023) -
Cosmos-LLaVA: Chatting with the Visual Cosmos-LLaVA: Görselle Sohbet Etmek
por: Zeer, Ahmed, et al.
Publicado: (2024)