Quantized Prompt for Efficient Generalization of Vision-Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Hao, Tianxiang, Ding, Xiaohan, Feng, Juexiao, Yang, Yuhong, Chen, Hui, Ding, Guiguang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Towards Efficient Vision-Language Tuning: More Information Density, More Generalizability
por: Hao, Tianxiang, et al.
Publicado: (2023)
por: Hao, Tianxiang, et al.
Publicado: (2023)
YOLO-UniOW: Efficient Universal Open-World Object Detection
por: Liu, Lihao, et al.
Publicado: (2024)
por: Liu, Lihao, et al.
Publicado: (2024)
Debiased Novel Category Discovering and Localization
por: Feng, Juexiao, et al.
Publicado: (2024)
por: Feng, Juexiao, et al.
Publicado: (2024)
DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval
por: Shen, Leqi, et al.
Publicado: (2025)
por: Shen, Leqi, et al.
Publicado: (2025)
From Intention to Execution: Probing the Generalization Boundaries of Vision-Language-Action Models
por: Fang, Irving, et al.
Publicado: (2025)
por: Fang, Irving, et al.
Publicado: (2025)
PYRA: Parallel Yielding Re-Activation for Training-Inference Efficient Task Adaptation
por: Xiong, Yizhe, et al.
Publicado: (2024)
por: Xiong, Yizhe, et al.
Publicado: (2024)
Neutralizing Token Aggregation via Information Augmentation for Efficient Test-Time Adaptation
por: Xiong, Yizhe, et al.
Publicado: (2025)
por: Xiong, Yizhe, et al.
Publicado: (2025)
PrefixKV: Adaptive Prefix KV Cache is What Vision Instruction-Following Models Need for Efficient Generation
por: Wang, Ao, et al.
Publicado: (2024)
por: Wang, Ao, et al.
Publicado: (2024)
TempMe: Video Temporal Token Merging for Efficient Text-Video Retrieval
por: Shen, Leqi, et al.
Publicado: (2024)
por: Shen, Leqi, et al.
Publicado: (2024)
IAP: Improving Continual Learning of Vision-Language Models via Instance-Aware Prompting
por: Fu, Hao, et al.
Publicado: (2025)
por: Fu, Hao, et al.
Publicado: (2025)
Dissecting Bit-Level Scaling Laws in Quantizing Vision Generative Models
por: Ding, Xin, et al.
Publicado: (2025)
por: Ding, Xin, et al.
Publicado: (2025)
[CLS] Token Tells Everything Needed for Training-free Efficient MLLMs
por: Wang, Ao, et al.
Publicado: (2024)
por: Wang, Ao, et al.
Publicado: (2024)
Advancing Reliable Test-Time Adaptation of Vision-Language Models under Visual Variations
por: Liang, Yiwen, et al.
Publicado: (2025)
por: Liang, Yiwen, et al.
Publicado: (2025)
Learn from the Learnt: Source-Free Active Domain Adaptation via Contrastive Sampling and Visual Persistence
por: Lyu, Mengyao, et al.
Publicado: (2024)
por: Lyu, Mengyao, et al.
Publicado: (2024)
PECTP: Parameter-Efficient Cross-Task Prompts for Incremental Vision Transformer
por: Feng, Qian, et al.
Publicado: (2024)
por: Feng, Qian, et al.
Publicado: (2024)
AdaTP: Attention-Debiased Token Pruning for Video Large Language Models
por: Sun, Fengyuan, et al.
Publicado: (2025)
por: Sun, Fengyuan, et al.
Publicado: (2025)
RepViT-SAM: Towards Real-Time Segmenting Anything
por: Wang, Ao, et al.
Publicado: (2023)
por: Wang, Ao, et al.
Publicado: (2023)
LSNet: See Large, Focus Small
por: Wang, Ao, et al.
Publicado: (2025)
por: Wang, Ao, et al.
Publicado: (2025)
RepViT: Revisiting Mobile CNN From ViT Perspective
por: Wang, Ao, et al.
Publicado: (2023)
por: Wang, Ao, et al.
Publicado: (2023)
One-Dimensional Adapter to Rule Them All: Concepts, Diffusion Models and Erasing Applications
por: Lyu, Mengyao, et al.
Publicado: (2023)
por: Lyu, Mengyao, et al.
Publicado: (2023)
Diversity Covariance-Aware Prompt Learning for Vision-Language Models
por: Dong, Songlin, et al.
Publicado: (2025)
por: Dong, Songlin, et al.
Publicado: (2025)
Bayesian Prompt Flow Learning for Zero-Shot Anomaly Detection
por: Qu, Zhen, et al.
Publicado: (2025)
por: Qu, Zhen, et al.
Publicado: (2025)
CAIT: Triple-Win Compression towards High Accuracy, Fast Inference, and Favorable Transferability For ViTs
por: Wang, Ao, et al.
Publicado: (2023)
por: Wang, Ao, et al.
Publicado: (2023)
YOLOE: Real-Time Seeing Anything
por: Wang, Ao, et al.
Publicado: (2025)
por: Wang, Ao, et al.
Publicado: (2025)
Efficient Test-Time Prompt Tuning for Vision-Language Models
por: Zhu, Yuhan, et al.
Publicado: (2024)
por: Zhu, Yuhan, et al.
Publicado: (2024)
Revisiting Prompt Pretraining of Vision-Language Models
por: Chen, Zhenyuan, et al.
Publicado: (2024)
por: Chen, Zhenyuan, et al.
Publicado: (2024)
More is Better: Deep Domain Adaptation with Multiple Sources
por: Zhao, Sicheng, et al.
Publicado: (2024)
por: Zhao, Sicheng, et al.
Publicado: (2024)
Hierarchical Cross-modal Prompt Learning for Vision-Language Models
por: Zheng, Hao, et al.
Publicado: (2025)
por: Zheng, Hao, et al.
Publicado: (2025)
Context Enhancement with Reconstruction as Sequence for Unified Unsupervised Anomaly Detection
por: Yang, Hui-Yue, et al.
Publicado: (2024)
por: Yang, Hui-Yue, et al.
Publicado: (2024)
Rethinking Practical and Efficient Quantization Calibration for Vision-Language Models
por: Shang, Zhenhao, et al.
Publicado: (2026)
por: Shang, Zhenhao, et al.
Publicado: (2026)
Generalizing Vision-Language Models with Dedicated Prompt Guidance
por: Li, Xinyao, et al.
Publicado: (2025)
por: Li, Xinyao, et al.
Publicado: (2025)
VIP: Visual-guided Prompt Evolution for Efficient Dense Vision-Language Inference
por: Zhu, Hao, et al.
Publicado: (2026)
por: Zhu, Hao, et al.
Publicado: (2026)
FastVID: Dynamic Density Pruning for Fast Video Large Language Models
por: Shen, Leqi, et al.
Publicado: (2025)
por: Shen, Leqi, et al.
Publicado: (2025)
PruneHal: Reducing Hallucinations in Multi-modal Large Language Models through Adaptive KV Cache Pruning
por: Sun, Fengyuan, et al.
Publicado: (2025)
por: Sun, Fengyuan, et al.
Publicado: (2025)
YOLOv10: Real-Time End-to-End Object Detection
por: Wang, Ao, et al.
Publicado: (2024)
por: Wang, Ao, et al.
Publicado: (2024)
PromptKD: Unsupervised Prompt Distillation for Vision-Language Models
por: Li, Zheng, et al.
Publicado: (2024)
por: Li, Zheng, et al.
Publicado: (2024)
Human-Free Automated Prompting for Vision-Language Anomaly Detection: Prompt Optimization with Meta-guiding Prompt Scheme
por: Chen, Pi-Wei, et al.
Publicado: (2024)
por: Chen, Pi-Wei, et al.
Publicado: (2024)
Lightweight Unsupervised Federated Learning with Pretrained Vision Language Model
por: Yan, Hao, et al.
Publicado: (2024)
por: Yan, Hao, et al.
Publicado: (2024)
Boosting the Generalization and Reasoning of Vision Language Models with Curriculum Reinforcement Learning
por: Deng, Huilin, et al.
Publicado: (2025)
por: Deng, Huilin, et al.
Publicado: (2025)
FastOCR: Dynamic Visual Fixation via KV Cache Pruning for Efficient Document Parsing
por: Tang, Zihan, et al.
Publicado: (2026)
por: Tang, Zihan, et al.
Publicado: (2026)
Ejemplares similares
-
Towards Efficient Vision-Language Tuning: More Information Density, More Generalizability
por: Hao, Tianxiang, et al.
Publicado: (2023) -
YOLO-UniOW: Efficient Universal Open-World Object Detection
por: Liu, Lihao, et al.
Publicado: (2024) -
Debiased Novel Category Discovering and Localization
por: Feng, Juexiao, et al.
Publicado: (2024) -
DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval
por: Shen, Leqi, et al.
Publicado: (2025) -
From Intention to Execution: Probing the Generalization Boundaries of Vision-Language-Action Models
por: Fang, Irving, et al.
Publicado: (2025)