PruneHal: Reducing Hallucinations in Multi-modal Large Language Models through Adaptive KV Cache Pruning
Fuente:
arXiv
Guardado en:
| Autores principales: | Sun, Fengyuan, Chen, Hui, Xu, Xinhao, Zheng, Dandan, Chen, Jingdong, Zhou, Jun, Han, Jungong, Ding, Guiguang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
AdaTP: Attention-Debiased Token Pruning for Video Large Language Models
por: Sun, Fengyuan, et al.
Publicado: (2025)
por: Sun, Fengyuan, et al.
Publicado: (2025)
PrefixKV: Adaptive Prefix KV Cache is What Vision Instruction-Following Models Need for Efficient Generation
por: Wang, Ao, et al.
Publicado: (2024)
por: Wang, Ao, et al.
Publicado: (2024)
FastOCR: Dynamic Visual Fixation via KV Cache Pruning for Efficient Document Parsing
por: Tang, Zihan, et al.
Publicado: (2026)
por: Tang, Zihan, et al.
Publicado: (2026)
KVzap: Fast, Adaptive, and Faithful KV Cache Pruning
por: Jegou, Simon, et al.
Publicado: (2026)
por: Jegou, Simon, et al.
Publicado: (2026)
[CLS] Token Tells Everything Needed for Training-free Efficient MLLMs
por: Wang, Ao, et al.
Publicado: (2024)
por: Wang, Ao, et al.
Publicado: (2024)
Lethe: Layer- and Time-Adaptive KV Cache Pruning for Reasoning-Intensive LLM Serving
por: Zeng, Hui, et al.
Publicado: (2025)
por: Zeng, Hui, et al.
Publicado: (2025)
LSNet: See Large, Focus Small
por: Wang, Ao, et al.
Publicado: (2025)
por: Wang, Ao, et al.
Publicado: (2025)
Towards Threshold-Free KV Cache Pruning
por: Ni, Xuanfan, et al.
Publicado: (2025)
por: Ni, Xuanfan, et al.
Publicado: (2025)
Titanus: Enabling KV Cache Pruning and Quantization On-the-Fly for LLM Acceleration
por: Chen, Peilin, et al.
Publicado: (2025)
por: Chen, Peilin, et al.
Publicado: (2025)
Learn from the Learnt: Source-Free Active Domain Adaptation via Contrastive Sampling and Visual Persistence
por: Lyu, Mengyao, et al.
Publicado: (2024)
por: Lyu, Mengyao, et al.
Publicado: (2024)
Mostly Text, Smart Visuals: Asymmetric Text-Visual Pruning for Large Vision-Language Models
por: Li, Sijie, et al.
Publicado: (2026)
por: Li, Sijie, et al.
Publicado: (2026)
Cross-Self KV Cache Pruning for Efficient Vision-Language Inference
por: Pei, Xiaohuan, et al.
Publicado: (2024)
por: Pei, Xiaohuan, et al.
Publicado: (2024)
RepViT-SAM: Towards Real-Time Segmenting Anything
por: Wang, Ao, et al.
Publicado: (2023)
por: Wang, Ao, et al.
Publicado: (2023)
RepViT: Revisiting Mobile CNN From ViT Perspective
por: Wang, Ao, et al.
Publicado: (2023)
por: Wang, Ao, et al.
Publicado: (2023)
CachePrune: Teaching LLMs What Not to Follow via KV-Cache Editing
por: Wang, Rui, et al.
Publicado: (2025)
por: Wang, Rui, et al.
Publicado: (2025)
CachePrune: Privacy-Aware and Fine-Grained KV Cache Sharing for Efficient LLM Inference
por: Wu, Guanlong, et al.
Publicado: (2026)
por: Wu, Guanlong, et al.
Publicado: (2026)
DepthKV: Layer-Dependent KV Cache Pruning for Long-Context LLM Inference
por: Dehghanighobadi, Zahra, et al.
Publicado: (2026)
por: Dehghanighobadi, Zahra, et al.
Publicado: (2026)
PagedEviction: Structured Block-wise KV Cache Pruning for Efficient Large Language Model Inference
por: Chitty-Venkata, Krishna Teja, et al.
Publicado: (2025)
por: Chitty-Venkata, Krishna Teja, et al.
Publicado: (2025)
FastVID: Dynamic Density Pruning for Fast Video Large Language Models
por: Shen, Leqi, et al.
Publicado: (2025)
por: Shen, Leqi, et al.
Publicado: (2025)
Towards Efficient Vision-Language Tuning: More Information Density, More Generalizability
por: Hao, Tianxiang, et al.
Publicado: (2023)
por: Hao, Tianxiang, et al.
Publicado: (2023)
RAP: KV-Cache Compression via RoPE-Aligned Pruning
por: Xin, Jihao, et al.
Publicado: (2026)
por: Xin, Jihao, et al.
Publicado: (2026)
Mustafar: Promoting Unstructured Sparsity for KV Cache Pruning in LLM Inference
por: Joo, Donghyeon, et al.
Publicado: (2025)
por: Joo, Donghyeon, et al.
Publicado: (2025)
Fit and Prune: Fast and Training-free Visual Token Pruning for Multi-modal Large Language Models
por: Ye, Weihao, et al.
Publicado: (2024)
por: Ye, Weihao, et al.
Publicado: (2024)
SparK: Query-Aware Unstructured Sparsity with Recoverable KV Cache Channel Pruning
por: Liao, Huanxuan, et al.
Publicado: (2025)
por: Liao, Huanxuan, et al.
Publicado: (2025)
NutePrune: Efficient Progressive Pruning with Numerous Teachers for Large Language Models
por: Li, Shengrui, et al.
Publicado: (2024)
por: Li, Shengrui, et al.
Publicado: (2024)
Tracking and Segmenting Anything in Any Modality
por: Zhang, Tianlu, et al.
Publicado: (2025)
por: Zhang, Tianlu, et al.
Publicado: (2025)
CAIT: Triple-Win Compression towards High Accuracy, Fast Inference, and Favorable Transferability For ViTs
por: Wang, Ao, et al.
Publicado: (2023)
por: Wang, Ao, et al.
Publicado: (2023)
YOLOE: Real-Time Seeing Anything
por: Wang, Ao, et al.
Publicado: (2025)
por: Wang, Ao, et al.
Publicado: (2025)
Pruning Large Language Models with Semi-Structural Adaptive Sparse Training
por: Huang, Weiyu, et al.
Publicado: (2024)
por: Huang, Weiyu, et al.
Publicado: (2024)
SimMLM: A Simple Framework for Multi-modal Learning with Missing Modality
por: Li, Sijie, et al.
Publicado: (2025)
por: Li, Sijie, et al.
Publicado: (2025)
LongHalQA: Long-Context Hallucination Evaluation for MultiModal Large Language Models
por: Qiu, Han, et al.
Publicado: (2024)
por: Qiu, Han, et al.
Publicado: (2024)
Adaptive Pruning for Large Language Models with Structural Importance Awareness
por: Zheng, Haotian, et al.
Publicado: (2024)
por: Zheng, Haotian, et al.
Publicado: (2024)
OBCache: Optimal Brain KV Cache Pruning for Efficient Long-Context LLM Inference
por: Gu, Yuzhe, et al.
Publicado: (2025)
por: Gu, Yuzhe, et al.
Publicado: (2025)
Investigating Hallucinations in Pruned Large Language Models for Abstractive Summarization
por: Chrysostomou, George, et al.
Publicado: (2023)
por: Chrysostomou, George, et al.
Publicado: (2023)
UniAttn: Reducing Inference Costs via Softmax Unification for Post-Training LLMs
por: Xiong, Yizhe, et al.
Publicado: (2025)
por: Xiong, Yizhe, et al.
Publicado: (2025)
YOLOv10: Real-Time End-to-End Object Detection
por: Wang, Ao, et al.
Publicado: (2024)
por: Wang, Ao, et al.
Publicado: (2024)
Sample-aware Adaptive Structured Pruning for Large Language Models
por: Kong, Jun, et al.
Publicado: (2025)
por: Kong, Jun, et al.
Publicado: (2025)
Temporal Scaling Law for Large Language Models
por: Xiong, Yizhe, et al.
Publicado: (2024)
por: Xiong, Yizhe, et al.
Publicado: (2024)
Deterministic Differentiable Structured Pruning for Large Language Models
por: Huang, Weiyu, et al.
Publicado: (2026)
por: Huang, Weiyu, et al.
Publicado: (2026)
Cream of the Crop: Harvesting Rich, Scalable and Transferable Multi-Modal Data for Instruction Fine-Tuning
por: Lyu, Mengyao, et al.
Publicado: (2025)
por: Lyu, Mengyao, et al.
Publicado: (2025)
Ejemplares similares
-
AdaTP: Attention-Debiased Token Pruning for Video Large Language Models
por: Sun, Fengyuan, et al.
Publicado: (2025) -
PrefixKV: Adaptive Prefix KV Cache is What Vision Instruction-Following Models Need for Efficient Generation
por: Wang, Ao, et al.
Publicado: (2024) -
FastOCR: Dynamic Visual Fixation via KV Cache Pruning for Efficient Document Parsing
por: Tang, Zihan, et al.
Publicado: (2026) -
KVzap: Fast, Adaptive, and Faithful KV Cache Pruning
por: Jegou, Simon, et al.
Publicado: (2026) -
[CLS] Token Tells Everything Needed for Training-free Efficient MLLMs
por: Wang, Ao, et al.
Publicado: (2024)