APLe: Token-Wise Adaptive for Multi-Modal Prompt Learning
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Cao, Guiming, Shi, Kaize, Fu, Hong, Zhang, Huaiwen, Xu, Guandong |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning
von: Zhong, Yiwu, et al.
Veröffentlicht: (2024)
von: Zhong, Yiwu, et al.
Veröffentlicht: (2024)
From Pixels to Tokens: Byte-Pair Encoding on Quantized Visual Modalities
von: Zhang, Wanpeng, et al.
Veröffentlicht: (2024)
von: Zhang, Wanpeng, et al.
Veröffentlicht: (2024)
Efficient Vision-Language Models by Summarizing Visual Tokens into Compact Registers
von: Wen, Yuxin, et al.
Veröffentlicht: (2024)
von: Wen, Yuxin, et al.
Veröffentlicht: (2024)
LLaVA-PruMerge: Adaptive Token Reduction for Efficient Large Multimodal Models
von: Shang, Yuzhang, et al.
Veröffentlicht: (2024)
von: Shang, Yuzhang, et al.
Veröffentlicht: (2024)
Why Only Text: Empowering Vision-and-Language Navigation with Multi-modal Prompts
von: Hong, Haodong, et al.
Veröffentlicht: (2024)
von: Hong, Haodong, et al.
Veröffentlicht: (2024)
What Factors Affect Multi-Modal In-Context Learning? An In-Depth Exploration
von: Qin, Libo, et al.
Veröffentlicht: (2024)
von: Qin, Libo, et al.
Veröffentlicht: (2024)
MMICL: Empowering Vision-language Model with Multi-Modal In-Context Learning
von: Zhao, Haozhe, et al.
Veröffentlicht: (2023)
von: Zhao, Haozhe, et al.
Veröffentlicht: (2023)
MM-R5: MultiModal Reasoning-Enhanced ReRanker via Reinforcement Learning for Document Retrieval
von: Xu, Mingjun, et al.
Veröffentlicht: (2025)
von: Xu, Mingjun, et al.
Veröffentlicht: (2025)
Musketeer: Joint Training for Multi-task Vision Language Model with Task Explanation Prompts
von: Zhang, Zhaoyang, et al.
Veröffentlicht: (2023)
von: Zhang, Zhaoyang, et al.
Veröffentlicht: (2023)
From Compound Figures to Composite Understanding: Developing a Multi-Modal LLM from Biomedical Literature with Medical Multiple-Image Benchmarking and Validation
von: Chen, Zhen, et al.
Veröffentlicht: (2025)
von: Chen, Zhen, et al.
Veröffentlicht: (2025)
Revisiting Multi-Modal LLM Evaluation
von: Lu, Jian, et al.
Veröffentlicht: (2024)
von: Lu, Jian, et al.
Veröffentlicht: (2024)
MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI
von: Yao, Huanjin, et al.
Veröffentlicht: (2025)
von: Yao, Huanjin, et al.
Veröffentlicht: (2025)
VoCoT: Unleashing Visually Grounded Multi-Step Reasoning in Large Multi-Modal Models
von: Li, Zejun, et al.
Veröffentlicht: (2024)
von: Li, Zejun, et al.
Veröffentlicht: (2024)
PixelPrune: Pixel-Level Adaptive Visual Token Reduction via Predictive Coding
von: Wang, Nan, et al.
Veröffentlicht: (2026)
von: Wang, Nan, et al.
Veröffentlicht: (2026)
Core Knowledge Deficits in Multi-Modal Language Models
von: Li, Yijiang, et al.
Veröffentlicht: (2024)
von: Li, Yijiang, et al.
Veröffentlicht: (2024)
Calibrating Uncertainty Quantification of Multi-Modal LLMs using Grounding
von: Padhi, Trilok, et al.
Veröffentlicht: (2025)
von: Padhi, Trilok, et al.
Veröffentlicht: (2025)
Multi-Modal Language Models as Text-to-Image Model Evaluators
von: Chen, Jiahui, et al.
Veröffentlicht: (2025)
von: Chen, Jiahui, et al.
Veröffentlicht: (2025)
Dermacen Analytica: A Novel Methodology Integrating Multi-Modal Large Language Models with Machine Learning in tele-dermatology
von: Panagoulias, Dimitrios P., et al.
Veröffentlicht: (2024)
von: Panagoulias, Dimitrios P., et al.
Veröffentlicht: (2024)
Prompt-Aware Adapter: Towards Learning Adaptive Visual Tokens for Multimodal Large Language Models
von: Zhang, Yue, et al.
Veröffentlicht: (2024)
von: Zhang, Yue, et al.
Veröffentlicht: (2024)
Multi-Prompt with Depth Partitioned Cross-Modal Learning
von: Tian, Yingjie, et al.
Veröffentlicht: (2023)
von: Tian, Yingjie, et al.
Veröffentlicht: (2023)
LFTR: Learning-Free Token Reduction for Multimodal Large Language Models
von: Zhao, Zihui, et al.
Veröffentlicht: (2025)
von: Zhao, Zihui, et al.
Veröffentlicht: (2025)
LayerCache: Exploiting Layer-wise Velocity Heterogeneity for Efficient Flow Matching Inference
von: Li, Guandong
Veröffentlicht: (2026)
von: Li, Guandong
Veröffentlicht: (2026)
Dual-Channel Attention Guidance for Training-Free Image Editing Control in Diffusion Transformers
von: Li, Guandong
Veröffentlicht: (2026)
von: Li, Guandong
Veröffentlicht: (2026)
Dual-Modal Attention-Enhanced Text-Video Retrieval with Triplet Partial Margin Contrastive Learning
von: Jiang, Chen, et al.
Veröffentlicht: (2023)
von: Jiang, Chen, et al.
Veröffentlicht: (2023)
Hybrid-Level Instruction Injection for Video Token Compression in Multi-modal Large Language Models
von: Liu, Zhihang, et al.
Veröffentlicht: (2025)
von: Liu, Zhihang, et al.
Veröffentlicht: (2025)
Investigating Cross-Modal Skill Injection: Scenarios, Methods, and Hyperparameters
von: Xu, Zhiyu, et al.
Veröffentlicht: (2026)
von: Xu, Zhiyu, et al.
Veröffentlicht: (2026)
ML-Mamba: Efficient Multi-Modal Large Language Model Utilizing Mamba-2
von: Huang, Wenjun, et al.
Veröffentlicht: (2024)
von: Huang, Wenjun, et al.
Veröffentlicht: (2024)
Preserving Multi-Modal Capabilities of Pre-trained VLMs for Improving Vision-Linguistic Compositionality
von: Oh, Youngtaek, et al.
Veröffentlicht: (2024)
von: Oh, Youngtaek, et al.
Veröffentlicht: (2024)
Bayesian Principles Improve Prompt Learning In Vision-Language Models
von: Kim, Mingyu, et al.
Veröffentlicht: (2025)
von: Kim, Mingyu, et al.
Veröffentlicht: (2025)
Analyzing Reasoning Consistency in Large Multimodal Models under Cross-Modal Conflicts
von: Zhu, Zhihao, et al.
Veröffentlicht: (2026)
von: Zhu, Zhihao, et al.
Veröffentlicht: (2026)
FlashVTG: Feature Layering and Adaptive Score Handling Network for Video Temporal Grounding
von: Cao, Zhuo, et al.
Veröffentlicht: (2024)
von: Cao, Zhuo, et al.
Veröffentlicht: (2024)
A Cross-Modal Rumor Detection Scheme via Contrastive Learning by Exploring Text and Image internal Correlations
von: Ma, Bin, et al.
Veröffentlicht: (2025)
von: Ma, Bin, et al.
Veröffentlicht: (2025)
Region-R1: Reinforcing Query-Side Region Cropping for Multi-Modal Re-Ranking
von: Hu, Chan-Wei, et al.
Veröffentlicht: (2026)
von: Hu, Chan-Wei, et al.
Veröffentlicht: (2026)
SAM4MLLM: Enhance Multi-Modal Large Language Model for Referring Expression Segmentation
von: Chen, Yi-Chia, et al.
Veröffentlicht: (2024)
von: Chen, Yi-Chia, et al.
Veröffentlicht: (2024)
Prompt4Trust: A Reinforcement Learning Prompt Augmentation Framework for Clinically-Aligned Confidence Calibration in Multimodal Large Language Models
von: Kriz, Anita, et al.
Veröffentlicht: (2025)
von: Kriz, Anita, et al.
Veröffentlicht: (2025)
Omni-Reward: Towards Generalist Omni-Modal Reward Modeling with Free-Form Preferences
von: Jin, Zhuoran, et al.
Veröffentlicht: (2025)
von: Jin, Zhuoran, et al.
Veröffentlicht: (2025)
Sparser Block-Sparse Attention via Token Permutation
von: Wang, Xinghao, et al.
Veröffentlicht: (2025)
von: Wang, Xinghao, et al.
Veröffentlicht: (2025)
Cross-Modal Safety Mechanism Transfer in Large Vision-Language Models
von: Xu, Shicheng, et al.
Veröffentlicht: (2024)
von: Xu, Shicheng, et al.
Veröffentlicht: (2024)
VLMQ: Token Saliency-Driven Post-Training Quantization for Vision-language Models
von: Xue, Yufei, et al.
Veröffentlicht: (2025)
von: Xue, Yufei, et al.
Veröffentlicht: (2025)
Mixture-of-Mamba: Enhancing Multi-Modal State-Space Models with Modality-Aware Sparsity
von: Liang, Weixin, et al.
Veröffentlicht: (2025)
von: Liang, Weixin, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning
von: Zhong, Yiwu, et al.
Veröffentlicht: (2024) -
From Pixels to Tokens: Byte-Pair Encoding on Quantized Visual Modalities
von: Zhang, Wanpeng, et al.
Veröffentlicht: (2024) -
Efficient Vision-Language Models by Summarizing Visual Tokens into Compact Registers
von: Wen, Yuxin, et al.
Veröffentlicht: (2024) -
LLaVA-PruMerge: Adaptive Token Reduction for Efficient Large Multimodal Models
von: Shang, Yuzhang, et al.
Veröffentlicht: (2024) -
Why Only Text: Empowering Vision-and-Language Navigation with Multi-modal Prompts
von: Hong, Haodong, et al.
Veröffentlicht: (2024)