When LLaVA Meets Objects: Token Composition for Vision-Language-Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Jahagirdar, Soumya, Bousselham, Walid, Kukleva, Anna, Kuehne, Hilde |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
VOLD: Reasoning Transfer from LLMs to Vision-Language Models via On-Policy Distillation
von: Bousselham, Walid, et al.
Veröffentlicht: (2025)
von: Bousselham, Walid, et al.
Veröffentlicht: (2025)
VideoGEM: Training-free Action Grounding in Videos
von: Vogel, Felix, et al.
Veröffentlicht: (2025)
von: Vogel, Felix, et al.
Veröffentlicht: (2025)
DEX-AR: A Dynamic Explainability Method for Autoregressive Vision-Language Models
von: Bousselham, Walid, et al.
Veröffentlicht: (2026)
von: Bousselham, Walid, et al.
Veröffentlicht: (2026)
REVEAL: Relation-based Video Representation Learning for Video-Question-Answering
von: Chaybouti, Sofian, et al.
Veröffentlicht: (2025)
von: Chaybouti, Sofian, et al.
Veröffentlicht: (2025)
LeGrad: An Explainability Method for Vision Transformers via Feature Formation Sensitivity
von: Bousselham, Walid, et al.
Veröffentlicht: (2024)
von: Bousselham, Walid, et al.
Veröffentlicht: (2024)
ATP-LLaVA: Adaptive Token Pruning for Large Vision Language Models
von: Ye, Xubing, et al.
Veröffentlicht: (2024)
von: Ye, Xubing, et al.
Veröffentlicht: (2024)
MaskInversion: Localized Embeddings via Optimization of Explainability Maps
von: Bousselham, Walid, et al.
Veröffentlicht: (2024)
von: Bousselham, Walid, et al.
Veröffentlicht: (2024)
Delta-LLaVA: Base-then-Specialize Alignment for Token-Efficient Vision-Language Models
von: Zamini, Mohamad, et al.
Veröffentlicht: (2025)
von: Zamini, Mohamad, et al.
Veröffentlicht: (2025)
MoE-LLaVA: Mixture of Experts for Large Vision-Language Models
von: Lin, Bin, et al.
Veröffentlicht: (2024)
von: Lin, Bin, et al.
Veröffentlicht: (2024)
LLaVA-CoT: Let Vision Language Models Reason Step-by-Step
von: Xu, Guowei, et al.
Veröffentlicht: (2024)
von: Xu, Guowei, et al.
Veröffentlicht: (2024)
Continual LLaVA: Continual Instruction Tuning in Large Vision-Language Models
von: Cao, Meng, et al.
Veröffentlicht: (2024)
von: Cao, Meng, et al.
Veröffentlicht: (2024)
LLaVA-LE: Large Language-and-Vision Assistant for Lunar Exploration
von: Inal, Gokce, et al.
Veröffentlicht: (2026)
von: Inal, Gokce, et al.
Veröffentlicht: (2026)
MC-LLaVA: Multi-Concept Personalized Vision-Language Model
von: An, Ruichuan, et al.
Veröffentlicht: (2024)
von: An, Ruichuan, et al.
Veröffentlicht: (2024)
MC-LLaVA: Multi-Concept Personalized Vision-Language Model
von: An, Ruichuan, et al.
Veröffentlicht: (2025)
von: An, Ruichuan, et al.
Veröffentlicht: (2025)
Why do LLaVA Vision-Language Models Reply to Images in English?
von: Hinck, Musashi, et al.
Veröffentlicht: (2024)
von: Hinck, Musashi, et al.
Veröffentlicht: (2024)
LLaVA-MoD: Making LLaVA Tiny via MoE Knowledge Distillation
von: Shu, Fangxun, et al.
Veröffentlicht: (2024)
von: Shu, Fangxun, et al.
Veröffentlicht: (2024)
TTA-Vid: Generalized Test-Time Adaptation for Video Reasoning
von: Jahagirdar, Soumya Shamarao, et al.
Veröffentlicht: (2026)
von: Jahagirdar, Soumya Shamarao, et al.
Veröffentlicht: (2026)
LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval
von: Lu, Weiheng, et al.
Veröffentlicht: (2024)
von: Lu, Weiheng, et al.
Veröffentlicht: (2024)
TG-LLaVA: Text Guided LLaVA via Learnable Latent Embeddings
von: Yan, Dawei, et al.
Veröffentlicht: (2024)
von: Yan, Dawei, et al.
Veröffentlicht: (2024)
MM-TS: Multi-Modal Temperature and Margin Schedules for Contrastive Learning with Long-Tail Data
von: Sheludzko, Siarhei, et al.
Veröffentlicht: (2026)
von: Sheludzko, Siarhei, et al.
Veröffentlicht: (2026)
MCA-LLaVA: Manhattan Causal Attention for Reducing Hallucination in Large Vision-Language Models
von: Zhao, Qiyan, et al.
Veröffentlicht: (2025)
von: Zhao, Qiyan, et al.
Veröffentlicht: (2025)
LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs
von: Lou, Haoran, et al.
Veröffentlicht: (2025)
von: Lou, Haoran, et al.
Veröffentlicht: (2025)
LLaVA-Mini: Efficient Image and Video Large Multimodal Models with One Vision Token
von: Zhang, Shaolei, et al.
Veröffentlicht: (2025)
von: Zhang, Shaolei, et al.
Veröffentlicht: (2025)
LLaVA-Ultra: Large Chinese Language and Vision Assistant for Ultrasound
von: Guo, Xuechen, et al.
Veröffentlicht: (2024)
von: Guo, Xuechen, et al.
Veröffentlicht: (2024)
HowToCaption: Prompting LLMs to Transform Video Annotations at Scale
von: Shvetsova, Nina, et al.
Veröffentlicht: (2023)
von: Shvetsova, Nina, et al.
Veröffentlicht: (2023)
LLaVA-SLT: Visual Language Tuning for Sign Language Translation
von: Liang, Han, et al.
Veröffentlicht: (2024)
von: Liang, Han, et al.
Veröffentlicht: (2024)
LLaVA-CKD: Bottom-Up Cascaded Knowledge Distillation for Vision-Language Models
von: Gkalelis, Nikolaos, et al.
Veröffentlicht: (2026)
von: Gkalelis, Nikolaos, et al.
Veröffentlicht: (2026)
HiRes-LLaVA: Restoring Fragmentation Input in High-Resolution Large Vision-Language Models
von: Huang, Runhui, et al.
Veröffentlicht: (2024)
von: Huang, Runhui, et al.
Veröffentlicht: (2024)
LLaVA-Critic: Learning to Evaluate Multimodal Models
von: Xiong, Tianyi, et al.
Veröffentlicht: (2024)
von: Xiong, Tianyi, et al.
Veröffentlicht: (2024)
LLaVA-KD: A Framework of Distilling Multimodal Large Language Models
von: Cai, Yuxuan, et al.
Veröffentlicht: (2024)
von: Cai, Yuxuan, et al.
Veröffentlicht: (2024)
LLaVA-VSD: Large Language-and-Vision Assistant for Visual Spatial Description
von: Jin, Yizhang, et al.
Veröffentlicht: (2024)
von: Jin, Yizhang, et al.
Veröffentlicht: (2024)
Cosmos-LLaVA: Chatting with the Visual Cosmos-LLaVA: Görselle Sohbet Etmek
von: Zeer, Ahmed, et al.
Veröffentlicht: (2024)
von: Zeer, Ahmed, et al.
Veröffentlicht: (2024)
Safe-LLaVA: A Privacy-Preserving Vision-Language Dataset and Benchmark for Biometric Safety
von: Kim, Younggun, et al.
Veröffentlicht: (2025)
von: Kim, Younggun, et al.
Veröffentlicht: (2025)
TS-LLaVA: Constructing Visual Tokens through Thumbnail-and-Sampling for Training-Free Video Large Language Models
von: Qu, Tingyu, et al.
Veröffentlicht: (2024)
von: Qu, Tingyu, et al.
Veröffentlicht: (2024)
LLaVA-OneVision-2: Towards Next-Generation Perceptual Intelligence
von: An, Xiang, et al.
Veröffentlicht: (2026)
von: An, Xiang, et al.
Veröffentlicht: (2026)
LLaVA-OneVision: Easy Visual Task Transfer
von: Li, Bo, et al.
Veröffentlicht: (2024)
von: Li, Bo, et al.
Veröffentlicht: (2024)
Surgical-LLaVA: Toward Surgical Scenario Understanding via Large Language and Vision Models
von: Jin, Juseong, et al.
Veröffentlicht: (2024)
von: Jin, Juseong, et al.
Veröffentlicht: (2024)
LLaVA-SG: Leveraging Scene Graphs as Visual Semantic Expression in Vision-Language Models
von: Wang, Jingyi, et al.
Veröffentlicht: (2024)
von: Wang, Jingyi, et al.
Veröffentlicht: (2024)
LLaVA-Phi: Efficient Multi-Modal Assistant with Small Language Model
von: Zhu, Yichen, et al.
Veröffentlicht: (2024)
von: Zhu, Yichen, et al.
Veröffentlicht: (2024)
LLaVA-Read: Enhancing Reading Ability of Multimodal Language Models
von: Zhang, Ruiyi, et al.
Veröffentlicht: (2024)
von: Zhang, Ruiyi, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
VOLD: Reasoning Transfer from LLMs to Vision-Language Models via On-Policy Distillation
von: Bousselham, Walid, et al.
Veröffentlicht: (2025) -
VideoGEM: Training-free Action Grounding in Videos
von: Vogel, Felix, et al.
Veröffentlicht: (2025) -
DEX-AR: A Dynamic Explainability Method for Autoregressive Vision-Language Models
von: Bousselham, Walid, et al.
Veröffentlicht: (2026) -
REVEAL: Relation-based Video Representation Learning for Video-Question-Answering
von: Chaybouti, Sofian, et al.
Veröffentlicht: (2025) -
LeGrad: An Explainability Method for Vision Transformers via Feature Formation Sensitivity
von: Bousselham, Walid, et al.
Veröffentlicht: (2024)