LLaVA-MLB: Mitigating and Leveraging Attention Bias for Training-Free Video LLMs
Fuente:
arXiv
Salvato in:
| Autori principali: | Shen, Leqi, He, Tao, Gong, Guoqiang, Yang, Fan, Zhang, Yifeng, Liu, Pengzhang, Zhao, Sicheng, Ding, Guiguang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
FastVID: Dynamic Density Pruning for Fast Video Large Language Models
di: Shen, Leqi, et al.
Pubblicazione: (2025)
di: Shen, Leqi, et al.
Pubblicazione: (2025)
DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval
di: Shen, Leqi, et al.
Pubblicazione: (2025)
di: Shen, Leqi, et al.
Pubblicazione: (2025)
TempMe: Video Temporal Token Merging for Efficient Text-Video Retrieval
di: Shen, Leqi, et al.
Pubblicazione: (2024)
di: Shen, Leqi, et al.
Pubblicazione: (2024)
AdaTP: Attention-Debiased Token Pruning for Video Large Language Models
di: Sun, Fengyuan, et al.
Pubblicazione: (2025)
di: Sun, Fengyuan, et al.
Pubblicazione: (2025)
TG-LLaVA: Text Guided LLaVA via Learnable Latent Embeddings
di: Yan, Dawei, et al.
Pubblicazione: (2024)
di: Yan, Dawei, et al.
Pubblicazione: (2024)
LLaVA-Scissor: Token Compression with Semantic Connected Components for Video LLMs
di: Sun, Boyuan, et al.
Pubblicazione: (2025)
di: Sun, Boyuan, et al.
Pubblicazione: (2025)
LLaVA-MoD: Making LLaVA Tiny via MoE Knowledge Distillation
di: Shu, Fangxun, et al.
Pubblicazione: (2024)
di: Shu, Fangxun, et al.
Pubblicazione: (2024)
Cosmos-LLaVA: Chatting with the Visual Cosmos-LLaVA: Görselle Sohbet Etmek
di: Zeer, Ahmed, et al.
Pubblicazione: (2024)
di: Zeer, Ahmed, et al.
Pubblicazione: (2024)
SlowFast-LLaVA: A Strong Training-Free Baseline for Video Large Language Models
di: Xu, Mingze, et al.
Pubblicazione: (2024)
di: Xu, Mingze, et al.
Pubblicazione: (2024)
LLaVA-Video: Video Instruction Tuning With Synthetic Data
di: Zhang, Yuanhan, et al.
Pubblicazione: (2024)
di: Zhang, Yuanhan, et al.
Pubblicazione: (2024)
Amharic LLaMA and LLaVA: Multimodal LLMs for Low Resource Languages
di: Andersland, Michael
Pubblicazione: (2024)
di: Andersland, Michael
Pubblicazione: (2024)
PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning
di: Xu, Lin, et al.
Pubblicazione: (2024)
di: Xu, Lin, et al.
Pubblicazione: (2024)
LLaVA-Critic: Learning to Evaluate Multimodal Models
di: Xiong, Tianyi, et al.
Pubblicazione: (2024)
di: Xiong, Tianyi, et al.
Pubblicazione: (2024)
Enhance Image-to-Image Generation with LLaVA-generated Prompts
di: Ding, Zhicheng, et al.
Pubblicazione: (2024)
di: Ding, Zhicheng, et al.
Pubblicazione: (2024)
TS-LLaVA: Constructing Visual Tokens through Thumbnail-and-Sampling for Training-Free Video Large Language Models
di: Qu, Tingyu, et al.
Pubblicazione: (2024)
di: Qu, Tingyu, et al.
Pubblicazione: (2024)
MCA-LLaVA: Manhattan Causal Attention for Reducing Hallucination in Large Vision-Language Models
di: Zhao, Qiyan, et al.
Pubblicazione: (2025)
di: Zhao, Qiyan, et al.
Pubblicazione: (2025)
Wiki-LLaVA: Hierarchical Retrieval-Augmented Generation for Multimodal LLMs
di: Caffagni, Davide, et al.
Pubblicazione: (2024)
di: Caffagni, Davide, et al.
Pubblicazione: (2024)
Sa2VA: Marrying SAM2 with LLaVA for Dense Grounded Understanding of Images and Videos
di: Yuan, Haobo, et al.
Pubblicazione: (2025)
di: Yuan, Haobo, et al.
Pubblicazione: (2025)
LLaVA-Octopus: Unlocking Instruction-Driven Adaptive Projector Fusion for Video Understanding
di: Sun, Boyuan, et al.
Pubblicazione: (2025)
di: Sun, Boyuan, et al.
Pubblicazione: (2025)
Multi-Object Tracking Retrieval with LLaVA-Video: A Training-Free Solution to MOT25-StAG Challenge
di: Yang, Yi, et al.
Pubblicazione: (2025)
di: Yang, Yi, et al.
Pubblicazione: (2025)
TC-LLaVA: Rethinking the Transfer from Image to Video Understanding with Temporal Considerations
di: Gao, Mingze, et al.
Pubblicazione: (2024)
di: Gao, Mingze, et al.
Pubblicazione: (2024)
WSI-LLaVA: A Multimodal Large Language Model for Whole Slide Image
di: Liang, Yuci, et al.
Pubblicazione: (2024)
di: Liang, Yuci, et al.
Pubblicazione: (2024)
Spatial Reasoning is Not a Free Lunch: A Controlled Study on LLaVA
di: Alam, Nahid, et al.
Pubblicazione: (2026)
di: Alam, Nahid, et al.
Pubblicazione: (2026)
Causal-LLaVA: Causal Disentanglement for Mitigating Hallucination in Multimodal Large Language Models
di: Hu, Xinmiao, et al.
Pubblicazione: (2025)
di: Hu, Xinmiao, et al.
Pubblicazione: (2025)
Video-LLaVA: Learning United Visual Representation by Alignment Before Projection
di: Lin, Bin, et al.
Pubblicazione: (2023)
di: Lin, Bin, et al.
Pubblicazione: (2023)
LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval
di: Lu, Weiheng, et al.
Pubblicazione: (2024)
di: Lu, Weiheng, et al.
Pubblicazione: (2024)
SQ-LLaVA: Self-Questioning for Large Vision-Language Assistant
di: Sun, Guohao, et al.
Pubblicazione: (2024)
di: Sun, Guohao, et al.
Pubblicazione: (2024)
LLaVAC: Fine-tuning LLaVA as a Multimodal Sentiment Classifier
di: Chay-intr, T., et al.
Pubblicazione: (2025)
di: Chay-intr, T., et al.
Pubblicazione: (2025)
LLaVA-SG: Leveraging Scene Graphs as Visual Semantic Expression in Vision-Language Models
di: Wang, Jingyi, et al.
Pubblicazione: (2024)
di: Wang, Jingyi, et al.
Pubblicazione: (2024)
Understanding and Mitigating Toxicity in Image-Text Pretraining Datasets: A Case Study on LLaVA
di: Kanjula, Karthik Reddy, et al.
Pubblicazione: (2025)
di: Kanjula, Karthik Reddy, et al.
Pubblicazione: (2025)
LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs
di: Lou, Haoran, et al.
Pubblicazione: (2025)
di: Lou, Haoran, et al.
Pubblicazione: (2025)
MG-LLaVA: Towards Multi-Granularity Visual Instruction Tuning
di: Zhao, Xiangyu, et al.
Pubblicazione: (2024)
di: Zhao, Xiangyu, et al.
Pubblicazione: (2024)
LLaVA-KD: A Framework of Distilling Multimodal Large Language Models
di: Cai, Yuxuan, et al.
Pubblicazione: (2024)
di: Cai, Yuxuan, et al.
Pubblicazione: (2024)
LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training
di: An, Xiang, et al.
Pubblicazione: (2025)
di: An, Xiang, et al.
Pubblicazione: (2025)
Can Sound Replace Vision in LLaVA With Token Substitution?
di: Vosoughi, Ali, et al.
Pubblicazione: (2025)
di: Vosoughi, Ali, et al.
Pubblicazione: (2025)
LLaVA-OneVision: Easy Visual Task Transfer
di: Li, Bo, et al.
Pubblicazione: (2024)
di: Li, Bo, et al.
Pubblicazione: (2024)
LLaVA-c: Continual Improved Visual Instruction Tuning
di: Liu, Wenzhuo, et al.
Pubblicazione: (2025)
di: Liu, Wenzhuo, et al.
Pubblicazione: (2025)
Continual LLaVA: Continual Instruction Tuning in Large Vision-Language Models
di: Cao, Meng, et al.
Pubblicazione: (2024)
di: Cao, Meng, et al.
Pubblicazione: (2024)
Beyond LLaVA-HD: Diving into High-Resolution Large Multimodal Models
di: Zhang, Yi-Fan, et al.
Pubblicazione: (2024)
di: Zhang, Yi-Fan, et al.
Pubblicazione: (2024)
LLaVA-Mini: Efficient Image and Video Large Multimodal Models with One Vision Token
di: Zhang, Shaolei, et al.
Pubblicazione: (2025)
di: Zhang, Shaolei, et al.
Pubblicazione: (2025)
Documenti analoghi
-
FastVID: Dynamic Density Pruning for Fast Video Large Language Models
di: Shen, Leqi, et al.
Pubblicazione: (2025) -
DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval
di: Shen, Leqi, et al.
Pubblicazione: (2025) -
TempMe: Video Temporal Token Merging for Efficient Text-Video Retrieval
di: Shen, Leqi, et al.
Pubblicazione: (2024) -
AdaTP: Attention-Debiased Token Pruning for Video Large Language Models
di: Sun, Fengyuan, et al.
Pubblicazione: (2025) -
TG-LLaVA: Text Guided LLaVA via Learnable Latent Embeddings
di: Yan, Dawei, et al.
Pubblicazione: (2024)