Enregistré dans:
| Auteurs principaux: | Pei, Xiaohuan, Huang, Tao, Ma, YanXiang, Xu, Chang |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2505.18605 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Cross-Self KV Cache Pruning for Efficient Vision-Language Inference
par: Pei, Xiaohuan, et autres
Publié: (2024)
par: Pei, Xiaohuan, et autres
Publié: (2024)
EfficientVMamba: Atrous Selective Scan for Light Weight Visual Mamba
par: Pei, Xiaohuan, et autres
Publié: (2024)
par: Pei, Xiaohuan, et autres
Publié: (2024)
LocalMamba: Visual State Space Model with Windowed Selective Scan
par: Huang, Tao, et autres
Publié: (2024)
par: Huang, Tao, et autres
Publié: (2024)
Q-Zoom: Query-Aware Adaptive Perception for Efficient Multimodal Large Language Models
par: Shi, Yuheng, et autres
Publié: (2026)
par: Shi, Yuheng, et autres
Publié: (2026)
Mitigating Object Hallucinations in Large Vision-Language Models via Attention Calibration
par: Zhu, Younan, et autres
Publié: (2025)
par: Zhu, Younan, et autres
Publié: (2025)
SyncMask: Synchronized Attentional Masking for Fashion-centric Vision-Language Pretraining
par: Song, Chull Hwan, et autres
Publié: (2024)
par: Song, Chull Hwan, et autres
Publié: (2024)
HyDRA: Hierarchical and Dynamic Rank Adaptation for Mobile Vision Language Model
par: Xi, Yuanhao, et autres
Publié: (2025)
par: Xi, Yuanhao, et autres
Publié: (2025)
Video-CCAM: Enhancing Video-Language Understanding with Causal Cross-Attention Masks for Short and Long Videos
par: Fei, Jiajun, et autres
Publié: (2024)
par: Fei, Jiajun, et autres
Publié: (2024)
EFTViT: Efficient Federated Training of Vision Transformers with Masked Images on Resource-Constrained Clients
par: Wu, Meihan, et autres
Publié: (2024)
par: Wu, Meihan, et autres
Publié: (2024)
ATA: Bridging Implicit Reasoning with Attention-Guided and Action-Guided Inference for Vision-Language Action Models
par: Yang, Cheng, et autres
Publié: (2026)
par: Yang, Cheng, et autres
Publié: (2026)
Rethinking Token Reduction for Large Vision-Language Models
par: Wang, Yi, et autres
Publié: (2026)
par: Wang, Yi, et autres
Publié: (2026)
Refer to Any Segmentation Mask Group With Vision-Language Prompts
par: Cao, Shengcao, et autres
Publié: (2025)
par: Cao, Shengcao, et autres
Publié: (2025)
MaskAnyNet: Rethinking Masked Image Regions as Valuable Information in Supervised Learning
par: Hong, Jingshan, et autres
Publié: (2025)
par: Hong, Jingshan, et autres
Publié: (2025)
AEMIM: Adversarial Examples Meet Masked Image Modeling
par: Xiang, Wenzhao, et autres
Publié: (2024)
par: Xiang, Wenzhao, et autres
Publié: (2024)
Multimodal Causal Reasoning Benchmark: Challenging Vision Large Language Models to Discern Causal Links Across Modalities
par: Li, Zhiyuan, et autres
Publié: (2024)
par: Li, Zhiyuan, et autres
Publié: (2024)
Seeing Through the Mask: Rethinking Adversarial Examples for CAPTCHAs
par: Jabary, Yahya, et autres
Publié: (2024)
par: Jabary, Yahya, et autres
Publié: (2024)
HiRED: Attention-Guided Token Dropping for Efficient Inference of High-Resolution Vision-Language Models
par: Arif, Kazi Hasan Ibn, et autres
Publié: (2024)
par: Arif, Kazi Hasan Ibn, et autres
Publié: (2024)
Vision-and-Language Navigation via Causal Learning
par: Wang, Liuyi, et autres
Publié: (2024)
par: Wang, Liuyi, et autres
Publié: (2024)
Self-Attention with State-Object Weighted Combination for Compositional Zero Shot Learning
par: Chang, Cheng-Hong, et autres
Publié: (2025)
par: Chang, Cheng-Hong, et autres
Publié: (2025)
Attention Hijacking: Response Manipulation Across Queries in Vision-Language Models
par: Wang, Zhiqiang, et autres
Publié: (2026)
par: Wang, Zhiqiang, et autres
Publié: (2026)
LaplacianFormer:Rethinking Linear Attention with Laplacian Kernel
par: Feng, Zhe, et autres
Publié: (2026)
par: Feng, Zhe, et autres
Publié: (2026)
Enhancing Medical Large Vision-Language Models via Alignment Distillation
par: Chang, Aofei, et autres
Publié: (2025)
par: Chang, Aofei, et autres
Publié: (2025)
Causal-SAM-LLM: Large Language Models as Causal Reasoners for Robust Medical Segmentation
par: Tang, Tao, et autres
Publié: (2025)
par: Tang, Tao, et autres
Publié: (2025)
Where Reliability Lives in Vision-Language Models: A Mechanistic Study of Attention, Hidden States, and Causal Circuits
par: Mann, Logan, et autres
Publié: (2026)
par: Mann, Logan, et autres
Publié: (2026)
Defense-to-Attack: Bypassing Weak Defenses Enables Stronger Jailbreaks in Vision-Language Models
par: Zhao, Yunhan, et autres
Publié: (2025)
par: Zhao, Yunhan, et autres
Publié: (2025)
RIV: Recursive Introspection Mask Diffusion Vision Language Model
par: Li, YuQian, et autres
Publié: (2025)
par: Li, YuQian, et autres
Publié: (2025)
PhysQuantAgent: An Inference Pipeline of Mass Estimation for Vision-Language Models
par: Yokomizo, Hisayuki, et autres
Publié: (2026)
par: Yokomizo, Hisayuki, et autres
Publié: (2026)
Attention-Guided Patch-Wise Sparse Adversarial Attacks on Vision-Language-Action Models
par: Zhang, Naifu, et autres
Publié: (2025)
par: Zhang, Naifu, et autres
Publié: (2025)
Towards Robust Vision Transformer via Masked Adaptive Ensemble
par: Lin, Fudong, et autres
Publié: (2024)
par: Lin, Fudong, et autres
Publié: (2024)
MedHEval: Benchmarking Hallucinations and Mitigation Strategies in Medical Large Vision-Language Models
par: Chang, Aofei, et autres
Publié: (2025)
par: Chang, Aofei, et autres
Publié: (2025)
CASA: Cross-Attention over Self-Attention for Efficient Vision-Language Fusion
par: Böhle, Moritz, et autres
Publié: (2025)
par: Böhle, Moritz, et autres
Publié: (2025)
Vision Inference Former: Sustaining Visual Consistency in Multimodal Large Language Models
par: Dong, Xinpeng, et autres
Publié: (2026)
par: Dong, Xinpeng, et autres
Publié: (2026)
Large Vision-Language Models Get Lost in Attention
par: Xi, Gongli, et autres
Publié: (2026)
par: Xi, Gongli, et autres
Publié: (2026)
Attention Prompting on Image for Large Vision-Language Models
par: Yu, Runpeng, et autres
Publié: (2024)
par: Yu, Runpeng, et autres
Publié: (2024)
Text-Guided Attention is All You Need for Zero-Shot Robustness in Vision-Language Models
par: Yu, Lu, et autres
Publié: (2024)
par: Yu, Lu, et autres
Publié: (2024)
Rethinking Prompt Design for Inference-time Scaling in Text-to-Visual Generation
par: Kim, Subin, et autres
Publié: (2025)
par: Kim, Subin, et autres
Publié: (2025)
Voila-A: Aligning Vision-Language Models with User's Gaze Attention
par: Yan, Kun, et autres
Publié: (2023)
par: Yan, Kun, et autres
Publié: (2023)
InfiniteVL: Synergizing Linear and Sparse Attention for Highly-Efficient, Unlimited-Input Vision-Language Models
par: Tao, Hongyuan, et autres
Publié: (2025)
par: Tao, Hongyuan, et autres
Publié: (2025)
ProVision: Programmatically Scaling Vision-centric Instruction Data for Multimodal Language Models
par: Zhang, Jieyu, et autres
Publié: (2024)
par: Zhang, Jieyu, et autres
Publié: (2024)
Vision-Language Introspection: Mitigating Overconfident Hallucinations in MLLMs via Interpretable Bi-Causal Steering
par: Liu, Shuliang, et autres
Publié: (2026)
par: Liu, Shuliang, et autres
Publié: (2026)
Documents similaires
-
Cross-Self KV Cache Pruning for Efficient Vision-Language Inference
par: Pei, Xiaohuan, et autres
Publié: (2024) -
EfficientVMamba: Atrous Selective Scan for Light Weight Visual Mamba
par: Pei, Xiaohuan, et autres
Publié: (2024) -
LocalMamba: Visual State Space Model with Windowed Selective Scan
par: Huang, Tao, et autres
Publié: (2024) -
Q-Zoom: Query-Aware Adaptive Perception for Efficient Multimodal Large Language Models
par: Shi, Yuheng, et autres
Publié: (2026) -
Mitigating Object Hallucinations in Large Vision-Language Models via Attention Calibration
par: Zhu, Younan, et autres
Publié: (2025)