iLLaVA: An Image is Worth Fewer Than 1/3 Input Tokens in Large Multimodal Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Hu, Lianyu, Gao, Liqing, Shang, Fanhua, Wan, Liang, Feng, Wei |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression
por: Hu, Lianyu, et al.
Publicado: (2025)
por: Hu, Lianyu, et al.
Publicado: (2025)
Deep Correlated Prompting for Visual Recognition with Missing Modalities
por: Hu, Lianyu, et al.
Publicado: (2024)
por: Hu, Lianyu, et al.
Publicado: (2024)
CorrNet+: Sign Language Recognition and Translation via Spatial-Temporal Correlation
por: Hu, Lianyu, et al.
Publicado: (2024)
por: Hu, Lianyu, et al.
Publicado: (2024)
Improving Continuous Sign Language Recognition with Adapted Image Models
por: Hu, Lianyu, et al.
Publicado: (2024)
por: Hu, Lianyu, et al.
Publicado: (2024)
Dynamic Spatial-Temporal Aggregation for Skeleton-Aware Sign Language Recognition
por: Hu, Lianyu, et al.
Publicado: (2024)
por: Hu, Lianyu, et al.
Publicado: (2024)
Pose-Guided Fine-Grained Sign Language Video Generation
por: Shi, Tongkai, et al.
Publicado: (2024)
por: Shi, Tongkai, et al.
Publicado: (2024)
LLaVA-Mini: Efficient Image and Video Large Multimodal Models with One Vision Token
por: Zhang, Shaolei, et al.
Publicado: (2025)
por: Zhang, Shaolei, et al.
Publicado: (2025)
LLaVA-PruMerge: Adaptive Token Reduction for Efficient Large Multimodal Models
por: Shang, Yuzhang, et al.
Publicado: (2024)
por: Shang, Yuzhang, et al.
Publicado: (2024)
COMMA: Co-Articulated Multi-Modal Learning
por: Hu, Lianyu, et al.
Publicado: (2023)
por: Hu, Lianyu, et al.
Publicado: (2023)
CFCML: A Coarse-to-Fine Crossmodal Learning Framework For Disease Diagnosis Using Multimodal Images and Tabular Data
por: Liu, Tianling, et al.
Publicado: (2026)
por: Liu, Tianling, et al.
Publicado: (2026)
HiRes-LLaVA: Restoring Fragmentation Input in High-Resolution Large Vision-Language Models
por: Huang, Runhui, et al.
Publicado: (2024)
por: Huang, Runhui, et al.
Publicado: (2024)
ConvLLaVA: Hierarchical Backbones as Visual Encoder for Large Multimodal Models
por: Ge, Chunjiang, et al.
Publicado: (2024)
por: Ge, Chunjiang, et al.
Publicado: (2024)
WSI-LLaVA: A Multimodal Large Language Model for Whole Slide Image
por: Liang, Yuci, et al.
Publicado: (2024)
por: Liang, Yuci, et al.
Publicado: (2024)
Completed Feature Disentanglement Learning for Multimodal MRIs Analysis
por: Liu, Tianling, et al.
Publicado: (2024)
por: Liu, Tianling, et al.
Publicado: (2024)
Beyond LLaVA-HD: Diving into High-Resolution Large Multimodal Models
por: Zhang, Yi-Fan, et al.
Publicado: (2024)
por: Zhang, Yi-Fan, et al.
Publicado: (2024)
LLaVA-ST: A Multimodal Large Language Model for Fine-Grained Spatial-Temporal Understanding
por: Li, Hongyu, et al.
Publicado: (2025)
por: Li, Hongyu, et al.
Publicado: (2025)
ATP-LLaVA: Adaptive Token Pruning for Large Vision Language Models
por: Ye, Xubing, et al.
Publicado: (2024)
por: Ye, Xubing, et al.
Publicado: (2024)
An Image is Worth 32 Tokens for Reconstruction and Generation
por: Yu, Qihang, et al.
Publicado: (2024)
por: Yu, Qihang, et al.
Publicado: (2024)
Agri-LLaVA: Knowledge-Infused Large Multimodal Assistant on Agricultural Pests and Diseases
por: Wang, Liqiong, et al.
Publicado: (2024)
por: Wang, Liqiong, et al.
Publicado: (2024)
LLaVA-RE: Binary Image-Text Relevancy Evaluation with Multimodal Large Language Model
por: Sun, Tao, et al.
Publicado: (2025)
por: Sun, Tao, et al.
Publicado: (2025)
Scaling Laws in Patchification: An Image Is Worth 50,176 Tokens And More
por: Wang, Feng, et al.
Publicado: (2025)
por: Wang, Feng, et al.
Publicado: (2025)
SSL-SSAW: Self-Supervised Learning with Sigmoid Self-Attention Weighting for Question-Based Sign Language Translation
por: Liu, Zekang, et al.
Publicado: (2025)
por: Liu, Zekang, et al.
Publicado: (2025)
Beyond Background Shift: Rethinking Instance Replay in Continual Semantic Segmentation
por: Yin, Hongmei, et al.
Publicado: (2025)
por: Yin, Hongmei, et al.
Publicado: (2025)
LLaVA-KD: A Framework of Distilling Multimodal Large Language Models
por: Cai, Yuxuan, et al.
Publicado: (2024)
por: Cai, Yuxuan, et al.
Publicado: (2024)
LLaVA-FA: Learning Fourier Approximation for Compressing Large Multimodal Models
por: Zheng, Pengcheng, et al.
Publicado: (2026)
por: Zheng, Pengcheng, et al.
Publicado: (2026)
FocusLLaVA: A Coarse-to-Fine Approach for Efficient and Effective Visual Token Compression
por: Zhu, Yuke, et al.
Publicado: (2024)
por: Zhu, Yuke, et al.
Publicado: (2024)
LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models
por: Li, Feng, et al.
Publicado: (2024)
por: Li, Feng, et al.
Publicado: (2024)
PDD: Manifold-Prior Diverse Distillation for Medical Anomaly Detection
por: Lu, Xijun, et al.
Publicado: (2026)
por: Lu, Xijun, et al.
Publicado: (2026)
LLaVA-Zip: Adaptive Visual Token Compression with Intrinsic Image Information
por: Wang, Ke, et al.
Publicado: (2024)
por: Wang, Ke, et al.
Publicado: (2024)
LLaVA Steering: Visual Instruction Tuning with 500x Fewer Parameters through Modality Linear Representation-Steering
por: Bi, Jinhe, et al.
Publicado: (2024)
por: Bi, Jinhe, et al.
Publicado: (2024)
Fewer Tokens and Fewer Videos: Extending Video Understanding Abilities in Large Vision-Language Models
por: Chen, Shimin, et al.
Publicado: (2024)
por: Chen, Shimin, et al.
Publicado: (2024)
Efficient Token Pruning for LLaDA-V
por: Wan, Zhewen, et al.
Publicado: (2026)
por: Wan, Zhewen, et al.
Publicado: (2026)
When LLaVA Meets Objects: Token Composition for Vision-Language-Models
por: Jahagirdar, Soumya, et al.
Publicado: (2026)
por: Jahagirdar, Soumya, et al.
Publicado: (2026)
LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs
por: Lou, Haoran, et al.
Publicado: (2025)
por: Lou, Haoran, et al.
Publicado: (2025)
Enhance Image-to-Image Generation with LLaVA-generated Prompts
por: Ding, Zhicheng, et al.
Publicado: (2024)
por: Ding, Zhicheng, et al.
Publicado: (2024)
EfficientLLaVA:Generalizable Auto-Pruning for Large Vision-language Models
por: Liang, Yinan, et al.
Publicado: (2025)
por: Liang, Yinan, et al.
Publicado: (2025)
LLaVA-Critic: Learning to Evaluate Multimodal Models
por: Xiong, Tianyi, et al.
Publicado: (2024)
por: Xiong, Tianyi, et al.
Publicado: (2024)
PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning
por: Xu, Lin, et al.
Publicado: (2024)
por: Xu, Lin, et al.
Publicado: (2024)
TG-LLaVA: Text Guided LLaVA via Learnable Latent Embeddings
por: Yan, Dawei, et al.
Publicado: (2024)
por: Yan, Dawei, et al.
Publicado: (2024)
Delta-LLaVA: Base-then-Specialize Alignment for Token-Efficient Vision-Language Models
por: Zamini, Mohamad, et al.
Publicado: (2025)
por: Zamini, Mohamad, et al.
Publicado: (2025)
Ejemplares similares
-
LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression
por: Hu, Lianyu, et al.
Publicado: (2025) -
Deep Correlated Prompting for Visual Recognition with Missing Modalities
por: Hu, Lianyu, et al.
Publicado: (2024) -
CorrNet+: Sign Language Recognition and Translation via Spatial-Temporal Correlation
por: Hu, Lianyu, et al.
Publicado: (2024) -
Improving Continuous Sign Language Recognition with Adapted Image Models
por: Hu, Lianyu, et al.
Publicado: (2024) -
Dynamic Spatial-Temporal Aggregation for Skeleton-Aware Sign Language Recognition
por: Hu, Lianyu, et al.
Publicado: (2024)