Enhancing Vision-Language Model with Unmasked Token Alignment
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Liu, Jihao, Zheng, Jinliang, Liu, Boxiao, Liu, Yu, Li, Hongsheng |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
GLID: Pre-training a Generalist Encoder-Decoder Vision Model
von: Liu, Jihao, et al.
Veröffentlicht: (2024)
von: Liu, Jihao, et al.
Veröffentlicht: (2024)
MM-Instruct: Generated Visual Instructions for Large Multimodal Model Alignment
von: Liu, Jihao, et al.
Veröffentlicht: (2024)
von: Liu, Jihao, et al.
Veröffentlicht: (2024)
Unmasking Bias in Diffusion Model Training
von: Yu, Hu, et al.
Veröffentlicht: (2023)
von: Yu, Hu, et al.
Veröffentlicht: (2023)
Learning with Unmasked Tokens Drives Stronger Vision Learners
von: Kim, Taekyung, et al.
Veröffentlicht: (2023)
von: Kim, Taekyung, et al.
Veröffentlicht: (2023)
Exploring Interactive Semantic Alignment for Efficient HOI Detection with Vision-language Model
von: Dong, Jihao, et al.
Veröffentlicht: (2024)
von: Dong, Jihao, et al.
Veröffentlicht: (2024)
The Phantom Menace: Unmasking Privacy Leakages in Vision-Language Models
von: Caldarella, Simone, et al.
Veröffentlicht: (2024)
von: Caldarella, Simone, et al.
Veröffentlicht: (2024)
TextHawk2: A Large Vision-Language Model Excels in Bilingual OCR and Grounding with 16x Fewer Tokens
von: Yu, Ya-Qi, et al.
Veröffentlicht: (2024)
von: Yu, Ya-Qi, et al.
Veröffentlicht: (2024)
VLA-IAP: Training-Free Visual Token Pruning via Interaction Alignment for Vision-Language-Action Models
von: Cheng, Jintao, et al.
Veröffentlicht: (2026)
von: Cheng, Jintao, et al.
Veröffentlicht: (2026)
Towards Sequence Modeling Alignment between Tokenizer and Autoregressive Model
von: Wu, Pingyu, et al.
Veröffentlicht: (2025)
von: Wu, Pingyu, et al.
Veröffentlicht: (2025)
Towards Joint Quantization and Token Pruning of Vision-Language Models
von: Li, Xinqing, et al.
Veröffentlicht: (2026)
von: Li, Xinqing, et al.
Veröffentlicht: (2026)
Modest-Align: Data-Efficient Alignment for Vision-Language Models
von: Liu, Jiaxiang, et al.
Veröffentlicht: (2025)
von: Liu, Jiaxiang, et al.
Veröffentlicht: (2025)
AdaptInfer: Adaptive Token Pruning for Vision-Language Model Inference with Dynamical Text Guidance
von: Zhang, Weichen, et al.
Veröffentlicht: (2025)
von: Zhang, Weichen, et al.
Veröffentlicht: (2025)
DREAM: Disentangling Risks to Enhance Safety Alignment in Multimodal Large Language Models
von: Liu, Jianyu, et al.
Veröffentlicht: (2025)
von: Liu, Jianyu, et al.
Veröffentlicht: (2025)
See Further When Clear: Curriculum Consistency Model
von: Liu, Yunpeng, et al.
Veröffentlicht: (2024)
von: Liu, Yunpeng, et al.
Veröffentlicht: (2024)
Exploring the Role of Large Language Models in Prompt Encoding for Diffusion Models
von: Ma, Bingqi, et al.
Veröffentlicht: (2024)
von: Ma, Bingqi, et al.
Veröffentlicht: (2024)
MADTP: Multimodal Alignment-Guided Dynamic Token Pruning for Accelerating Vision-Language Transformer
von: Cao, Jianjian, et al.
Veröffentlicht: (2024)
von: Cao, Jianjian, et al.
Veröffentlicht: (2024)
Generalized Robot 3D Vision-Language Model with Fast Rendering and Pre-Training Vision-Language Alignment
von: Liu, Kangcheng, et al.
Veröffentlicht: (2023)
von: Liu, Kangcheng, et al.
Veröffentlicht: (2023)
Variation-aware Vision Token Dropping for Faster Large Vision-Language Models
von: Chen, Junjie, et al.
Veröffentlicht: (2025)
von: Chen, Junjie, et al.
Veröffentlicht: (2025)
Safety Alignment for Vision Language Models
von: Liu, Zhendong, et al.
Veröffentlicht: (2024)
von: Liu, Zhendong, et al.
Veröffentlicht: (2024)
Enhancing Visual Grounding and Generalization: A Multi-Task Cycle Training Approach for Vision-Language Models
von: Yang, Xiaoyu, et al.
Veröffentlicht: (2023)
von: Yang, Xiaoyu, et al.
Veröffentlicht: (2023)
PSA-VLM: Enhancing Vision-Language Model Safety through Progressive Concept-Bottleneck-Driven Alignment
von: Liu, Zhendong, et al.
Veröffentlicht: (2024)
von: Liu, Zhendong, et al.
Veröffentlicht: (2024)
WeMMU: Enhanced Bridging of Vision-Language Models and Diffusion Models via Noisy Query Tokens
von: Yang, Jian, et al.
Veröffentlicht: (2025)
von: Yang, Jian, et al.
Veröffentlicht: (2025)
Delta-LLaVA: Base-then-Specialize Alignment for Token-Efficient Vision-Language Models
von: Zamini, Mohamad, et al.
Veröffentlicht: (2025)
von: Zamini, Mohamad, et al.
Veröffentlicht: (2025)
Multi-Token Enhancing for Vision Representation Learning
von: Li, Zhong-Yu, et al.
Veröffentlicht: (2024)
von: Li, Zhong-Yu, et al.
Veröffentlicht: (2024)
Token-Level Inference-Time Alignment for Vision-Language Models
von: Chen, Kejia, et al.
Veröffentlicht: (2025)
von: Chen, Kejia, et al.
Veröffentlicht: (2025)
Asymmetric Visual Semantic Embedding Framework for Efficient Vision-Language Alignment
von: Liu, Yang, et al.
Veröffentlicht: (2025)
von: Liu, Yang, et al.
Veröffentlicht: (2025)
TagAlign: Improving Vision-Language Alignment with Multi-Tag Classification
von: Liu, Qinying, et al.
Veröffentlicht: (2023)
von: Liu, Qinying, et al.
Veröffentlicht: (2023)
Beyond Next-Token Alignment: Distilling Multimodal Large Language Models via Token Interactions
von: Chen, Lin, et al.
Veröffentlicht: (2026)
von: Chen, Lin, et al.
Veröffentlicht: (2026)
TEASER: Token Enhanced Spatial Modeling for Expressions Reconstruction
von: Liu, Yunfei, et al.
Veröffentlicht: (2025)
von: Liu, Yunfei, et al.
Veröffentlicht: (2025)
METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models
von: Liu, Yuchen, et al.
Veröffentlicht: (2025)
von: Liu, Yuchen, et al.
Veröffentlicht: (2025)
HiPrune: Hierarchical Attention for Efficient Token Pruning in Vision-Language Models
von: Liu, Jizhihui, et al.
Veröffentlicht: (2025)
von: Liu, Jizhihui, et al.
Veröffentlicht: (2025)
Instruction-Guided Visual Masking
von: Zheng, Jinliang, et al.
Veröffentlicht: (2024)
von: Zheng, Jinliang, et al.
Veröffentlicht: (2024)
Tuning Vision-Language Models with Candidate Labels by Prompt Alignment
von: Zhang, Zhifang, et al.
Veröffentlicht: (2024)
von: Zhang, Zhifang, et al.
Veröffentlicht: (2024)
Directed-Tokens: A Robust Multi-Modality Alignment Approach to Large Language-Vision Models
von: Truong, Thanh-Dat, et al.
Veröffentlicht: (2025)
von: Truong, Thanh-Dat, et al.
Veröffentlicht: (2025)
Test-time Alignment-Enhanced Adapter for Vision-Language Models
von: Tong, Baoshun, et al.
Veröffentlicht: (2024)
von: Tong, Baoshun, et al.
Veröffentlicht: (2024)
Accelerating Multimodal Large Language Models by Searching Optimal Vision Token Reduction
von: Zhao, Shiyu, et al.
Veröffentlicht: (2024)
von: Zhao, Shiyu, et al.
Veröffentlicht: (2024)
CDPDNet: Integrating Text Guidance with Hybrid Vision Encoders for Medical Image Segmentation
von: Wu, Jiong, et al.
Veröffentlicht: (2025)
von: Wu, Jiong, et al.
Veröffentlicht: (2025)
MF2Summ: Multimodal Fusion for Video Summarization with Temporal Alignment
von: wang, Shuo, et al.
Veröffentlicht: (2025)
von: wang, Shuo, et al.
Veröffentlicht: (2025)
Multi-Stage Knowledge Integration of Vision-Language Models for Continual Learning
von: Zhang, Hongsheng, et al.
Veröffentlicht: (2024)
von: Zhang, Hongsheng, et al.
Veröffentlicht: (2024)
HCC-3D: Hierarchical Compensatory Compression for 98% 3D Token Reduction in Vision-Language Models
von: Zhang, Liheng, et al.
Veröffentlicht: (2025)
von: Zhang, Liheng, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
GLID: Pre-training a Generalist Encoder-Decoder Vision Model
von: Liu, Jihao, et al.
Veröffentlicht: (2024) -
MM-Instruct: Generated Visual Instructions for Large Multimodal Model Alignment
von: Liu, Jihao, et al.
Veröffentlicht: (2024) -
Unmasking Bias in Diffusion Model Training
von: Yu, Hu, et al.
Veröffentlicht: (2023) -
Learning with Unmasked Tokens Drives Stronger Vision Learners
von: Kim, Taekyung, et al.
Veröffentlicht: (2023) -
Exploring Interactive Semantic Alignment for Efficient HOI Detection with Vision-language Model
von: Dong, Jihao, et al.
Veröffentlicht: (2024)