CATP: Contextually Adaptive Token Pruning for Efficient and Enhanced Multimodal In-Context Learning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Yanshu, Yang, Jianjiang, Shen, Zhennan, Han, Ligong, Xu, Haoyan, Tang, Ruixiang |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Make LVLMs Focus: Context-Aware Attention Modulation for Better Multimodal In-Context Learning
par: Li, Yanshu, et autres
Publié: (2025)
par: Li, Yanshu, et autres
Publié: (2025)
TACO: Enhancing Multimodal In-context Learning via Task Mapping-Guided Sequence Configuration
par: Li, Yanshu, et autres
Publié: (2025)
par: Li, Yanshu, et autres
Publié: (2025)
CATP: Confidence-Aware Token Pruning for Camouflaged Object Detection
par: Gao, Yuhan, et autres
Publié: (2026)
par: Gao, Yuhan, et autres
Publié: (2026)
ReLoop: "Seeing Twice and Thinking Backwards" via Closed-loop Training to Mitigate Hallucinations in Multimodal understanding
par: Yang, Jianjiang, et autres
Publié: (2025)
par: Yang, Jianjiang, et autres
Publié: (2025)
M$^2$IV: Towards Efficient and Fine-grained Multimodal In-Context Learning via Representation Engineering
par: Li, Yanshu, et autres
Publié: (2025)
par: Li, Yanshu, et autres
Publié: (2025)
Advancing Multimodal In-Context Learning in Large Vision-Language Models with Task-aware Demonstrations
par: Li, Yanshu
Publié: (2025)
par: Li, Yanshu
Publié: (2025)
TrimTokenator-LC: Towards Adaptive Visual Token Pruning for Large Multimodal Models with Long Contexts
par: Zhang, Hao, et autres
Publié: (2025)
par: Zhang, Hao, et autres
Publié: (2025)
TrimTokenator: Towards Adaptive Visual Token Pruning for Large Multimodal Models
par: Zhang, Hao, et autres
Publié: (2025)
par: Zhang, Hao, et autres
Publié: (2025)
CROP: Contextual Region-Oriented Visual Token Pruning
par: Guo, Jiawei, et autres
Publié: (2025)
par: Guo, Jiawei, et autres
Publié: (2025)
Can Large Vision-Language Models Detect Images Copyright Infringement from GenAI?
par: Xu, Qipan, et autres
Publié: (2025)
par: Xu, Qipan, et autres
Publié: (2025)
Taming the Tri-Space Tension: ARC-Guided Hallucination Modeling and Control for Text-to-Image Generation
par: Yang, Jianjiang, et autres
Publié: (2025)
par: Yang, Jianjiang, et autres
Publié: (2025)
OccamToken: Efficient VLM Inference with Training-Free and Budget-Adaptive Token Pruning
par: Li, Geng, et autres
Publié: (2026)
par: Li, Geng, et autres
Publié: (2026)
TAMP: Token-Adaptive Layerwise Pruning in Multimodal Large Language Models
par: Lee, Jaewoo, et autres
Publié: (2025)
par: Lee, Jaewoo, et autres
Publié: (2025)
PruneVid: Visual Token Pruning for Efficient Video Large Language Models
par: Huang, Xiaohu, et autres
Publié: (2024)
par: Huang, Xiaohu, et autres
Publié: (2024)
ReDiPrune: Relevance-Diversity Pre-Projection Token Pruning for Efficient Multimodal LLMs
par: Yu, An, et autres
Publié: (2026)
par: Yu, An, et autres
Publié: (2026)
Token Pruning for In-Context Generation in Diffusion Transformers
par: Lin, Junqing, et autres
Publié: (2026)
par: Lin, Junqing, et autres
Publié: (2026)
CorrAdaptor: Adaptive Local Context Learning for Correspondence Pruning
par: Zhu, Wei, et autres
Publié: (2024)
par: Zhu, Wei, et autres
Publié: (2024)
Multimodal-Guided Dynamic Dataset Pruning for Robust and Efficient Data-Centric Learning
par: Yang, Suorong, et autres
Publié: (2025)
par: Yang, Suorong, et autres
Publié: (2025)
EntropyPrune: Matrix Entropy Guided Visual Token Pruning for Multimodal Large Language Models
par: Wang, Yahong, et autres
Publié: (2026)
par: Wang, Yahong, et autres
Publié: (2026)
IVC-Prune: Revealing the Implicit Visual Coordinates in LVLMs for Vision Token Pruning
par: Sun, Zhichao, et autres
Publié: (2026)
par: Sun, Zhichao, et autres
Publié: (2026)
Learning Compact Vision Tokens for Efficient Large Multimodal Models
par: Tang, Hao, et autres
Publié: (2025)
par: Tang, Hao, et autres
Publié: (2025)
PRANCE: Joint Token-Optimization and Structural Channel-Pruning for Adaptive ViT Inference
par: Li, Ye, et autres
Publié: (2024)
par: Li, Ye, et autres
Publié: (2024)
GTPT: Group-based Token Pruning Transformer for Efficient Human Pose Estimation
par: Wang, Haonan, et autres
Publié: (2024)
par: Wang, Haonan, et autres
Publié: (2024)
MADTP: Multimodal Alignment-Guided Dynamic Token Pruning for Accelerating Vision-Language Transformer
par: Cao, Jianjian, et autres
Publié: (2024)
par: Cao, Jianjian, et autres
Publié: (2024)
Less is More: Token-Efficient Video-QA via Adaptive Frame-Pruning and Semantic Graph Integration
par: Wang, Shaoguang, et autres
Publié: (2025)
par: Wang, Shaoguang, et autres
Publié: (2025)
Script: Graph-Structured and Query-Conditioned Semantic Token Pruning for Multimodal Large Language Models
par: Yang, Zhongyu, et autres
Publié: (2025)
par: Yang, Zhongyu, et autres
Publié: (2025)
SCOPE: Saliency-Coverage Oriented Token Pruning for Efficient Multimodel LLMs
par: Deng, Jinhong, et autres
Publié: (2025)
par: Deng, Jinhong, et autres
Publié: (2025)
ATP-LLaVA: Adaptive Token Pruning for Large Vision Language Models
par: Ye, Xubing, et autres
Publié: (2024)
par: Ye, Xubing, et autres
Publié: (2024)
HiPrune: Hierarchical Attention for Efficient Token Pruning in Vision-Language Models
par: Liu, Jizhihui, et autres
Publié: (2025)
par: Liu, Jizhihui, et autres
Publié: (2025)
Efficient Vision-Language Reasoning via Adaptive Token Pruning
par: Li, Xue, et autres
Publié: (2025)
par: Li, Xue, et autres
Publié: (2025)
HAWK: Head Importance-Aware Visual Token Pruning in Multimodal Models
par: Zhu, Qihui, et autres
Publié: (2026)
par: Zhu, Qihui, et autres
Publié: (2026)
TSP3D: Text-guided Sparse Voxel Pruning for Efficient 3D Visual Grounding
par: Guo, Wenxuan, et autres
Publié: (2025)
par: Guo, Wenxuan, et autres
Publié: (2025)
EventPrune: Cascaded Event-Assisted Token Pruning for Efficient First-Person Dynamic Spatial Reasoning
par: Ma, Pengtao, et autres
Publié: (2026)
par: Ma, Pengtao, et autres
Publié: (2026)
Efficient Token Pruning for LLaDA-V
par: Wan, Zhewen, et autres
Publié: (2026)
par: Wan, Zhewen, et autres
Publié: (2026)
AMMKD: Adaptive Multimodal Multi-teacher Distillation for Lightweight Vision-Language Models
par: Li, Yuqi, et autres
Publié: (2025)
par: Li, Yuqi, et autres
Publié: (2025)
Enhancing Multimodal In-Context Learning for Image Classification through Coreset Optimization
par: Chen, Huiyi, et autres
Publié: (2025)
par: Chen, Huiyi, et autres
Publié: (2025)
EgoPrune: Efficient Token Pruning for Egomotion Video Reasoning in Embodied Agent
par: Li, Jiaao, et autres
Publié: (2025)
par: Li, Jiaao, et autres
Publié: (2025)
Multi-Cue Adaptive Visual Token Pruning for Large Vision-Language Models
par: Luan, Bozhi, et autres
Publié: (2025)
par: Luan, Bozhi, et autres
Publié: (2025)
CoReDiT: Spatial Coherence-Guided Token Pruning and Reconstruction for Efficient Diffusion Transformers
par: Li, Zhuojin, et autres
Publié: (2026)
par: Li, Zhuojin, et autres
Publié: (2026)
Straightforward Layer-wise Pruning for More Efficient Visual Adaptation
par: Han, Ruizi, et autres
Publié: (2024)
par: Han, Ruizi, et autres
Publié: (2024)
Documents similaires
-
Make LVLMs Focus: Context-Aware Attention Modulation for Better Multimodal In-Context Learning
par: Li, Yanshu, et autres
Publié: (2025) -
TACO: Enhancing Multimodal In-context Learning via Task Mapping-Guided Sequence Configuration
par: Li, Yanshu, et autres
Publié: (2025) -
CATP: Confidence-Aware Token Pruning for Camouflaged Object Detection
par: Gao, Yuhan, et autres
Publié: (2026) -
ReLoop: "Seeing Twice and Thinking Backwards" via Closed-loop Training to Mitigate Hallucinations in Multimodal understanding
par: Yang, Jianjiang, et autres
Publié: (2025) -
M$^2$IV: Towards Efficient and Fine-grained Multimodal In-Context Learning via Representation Engineering
par: Li, Yanshu, et autres
Publié: (2025)