MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Chen, Kaixiang, Fang, Pengfei, Xue, Hui |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Skip-Vision: Efficient and Scalable Acceleration of Vision-Language Models via Adaptive Token Skipping
por: Zeng, Weili, et al.
Publicado: (2025)
por: Zeng, Weili, et al.
Publicado: (2025)
EpiAgent: An Agent-Centric System for Ancient Inscription Restoration
por: Zhu, Shipeng, et al.
Publicado: (2026)
por: Zhu, Shipeng, et al.
Publicado: (2026)
Jailbreak Vision Language Models via Bi-Modal Adversarial Prompt
por: Ying, Zonghao, et al.
Publicado: (2024)
por: Ying, Zonghao, et al.
Publicado: (2024)
Multi-Modal Interpretability for Enhanced Localization in Vision-Language Models
por: Imran, Muhammad, et al.
Publicado: (2025)
por: Imran, Muhammad, et al.
Publicado: (2025)
EvoCut: Multi-Layer Evolution-Aware Visual Token Compression for Efficient Large Vision-Language Models
por: Lu, Hongyu, et al.
Publicado: (2026)
por: Lu, Hongyu, et al.
Publicado: (2026)
Instruction-Guided Fusion of Multi-Layer Visual Features in Large Vision-Language Models
por: Li, Xu, et al.
Publicado: (2024)
por: Li, Xu, et al.
Publicado: (2024)
Jailbreak Large Vision-Language Models Through Multi-Modal Linkage
por: Wang, Yu, et al.
Publicado: (2024)
por: Wang, Yu, et al.
Publicado: (2024)
BMIP: Bi-directional Modality Interaction Prompt Learning for VLM
por: Lv, Song-Lin, et al.
Publicado: (2025)
por: Lv, Song-Lin, et al.
Publicado: (2025)
GLAD: Generalizable Tuning for Vision-Language Models
por: Peng, Yuqi, et al.
Publicado: (2025)
por: Peng, Yuqi, et al.
Publicado: (2025)
Bi-directional Self-Registration for Misaligned Infrared-Visible Image Fusion
por: Li, Timing, et al.
Publicado: (2025)
por: Li, Timing, et al.
Publicado: (2025)
Scaffolding Coordinates to Promote Vision-Language Coordination in Large Multi-Modal Models
por: Lei, Xuanyu, et al.
Publicado: (2024)
por: Lei, Xuanyu, et al.
Publicado: (2024)
VaMP: Variational Multi-Modal Prompt Learning for Vision-Language Models
por: Cheng, Silin, et al.
Publicado: (2025)
por: Cheng, Silin, et al.
Publicado: (2025)
Adaptive Vision-Language Model Routing for Computer Use Agents
por: Liu, Xunzhuo, et al.
Publicado: (2026)
por: Liu, Xunzhuo, et al.
Publicado: (2026)
BiXFormer: A Robust Framework for Maximizing Modality Effectiveness in Multi-Modal Semantic Segmentation
por: Chen, Jialei, et al.
Publicado: (2025)
por: Chen, Jialei, et al.
Publicado: (2025)
VLM-UQBench: A Benchmark for Modality-Specific and Cross-Modality Uncertainties in Vision Language Models
por: Wang, Chenyu, et al.
Publicado: (2026)
por: Wang, Chenyu, et al.
Publicado: (2026)
Text-Phase Synergy Network with Dual Priors for Unsupervised Cross-Domain Image Retrieval
por: Yang, Jing, et al.
Publicado: (2026)
por: Yang, Jing, et al.
Publicado: (2026)
PEAN: A Diffusion-Based Prior-Enhanced Attention Network for Scene Text Image Super-Resolution
por: Zhao, Zuoyan, et al.
Publicado: (2023)
por: Zhao, Zuoyan, et al.
Publicado: (2023)
MMRL: Multi-Modal Representation Learning for Vision-Language Models
por: Guo, Yuncheng, et al.
Publicado: (2025)
por: Guo, Yuncheng, et al.
Publicado: (2025)
MultiMedVision: Multi-Modal Medical Vision Framework
por: Li, Frank, et al.
Publicado: (2026)
por: Li, Frank, et al.
Publicado: (2026)
SRasP: Self-Reorientation Adversarial Style Perturbation for Cross-Domain Few-Shot Learning
por: Li, Wenqian, et al.
Publicado: (2026)
por: Li, Wenqian, et al.
Publicado: (2026)
PEARL: Input-Agnostic Prompt Enhancement with Negative Feedback Regulation for Class-Incremental Learning
por: Qin, Yongchun, et al.
Publicado: (2024)
por: Qin, Yongchun, et al.
Publicado: (2024)
On Distilling the Displacement Knowledge for Few-Shot Class-Incremental Learning
por: Fang, Pengfei, et al.
Publicado: (2024)
por: Fang, Pengfei, et al.
Publicado: (2024)
SVasP: Self-Versatility Adversarial Style Perturbation for Cross-Domain Few-Shot Learning
por: Li, Wenqian, et al.
Publicado: (2024)
por: Li, Wenqian, et al.
Publicado: (2024)
Directed-Tokens: A Robust Multi-Modality Alignment Approach to Large Language-Vision Models
por: Truong, Thanh-Dat, et al.
Publicado: (2025)
por: Truong, Thanh-Dat, et al.
Publicado: (2025)
Rethinking Vision-Language Model in Face Forensics: Multi-Modal Interpretable Forged Face Detector
por: Guo, Xiao, et al.
Publicado: (2025)
por: Guo, Xiao, et al.
Publicado: (2025)
Vision-Motion-Reference Alignment for Referring Multi-Object Tracking via Multi-Modal Large Language Models
por: Lv, Weiyi, et al.
Publicado: (2025)
por: Lv, Weiyi, et al.
Publicado: (2025)
DeBiFormer: Vision Transformer with Deformable Agent Bi-level Routing Attention
por: Long, Nguyen Huu Bao, et al.
Publicado: (2024)
por: Long, Nguyen Huu Bao, et al.
Publicado: (2024)
Beyond Augmentation: Cross-Modal Transformer Fusion with Bi-directional Attention for Low-Data Aneurysm Screening
por: Titikhsha, Antara, et al.
Publicado: (2025)
por: Titikhsha, Antara, et al.
Publicado: (2025)
Majorization-Guided Test-Time Adaptation for Vision-Language Models under Modality-Specific Shift
por: Chen, Lixian, et al.
Publicado: (2026)
por: Chen, Lixian, et al.
Publicado: (2026)
Multi-Modal Adapter for Vision-Language Models
por: Seputis, Dominykas, et al.
Publicado: (2024)
por: Seputis, Dominykas, et al.
Publicado: (2024)
PositionOCR: Augmenting Positional Awareness in Multi-Modal Models via Hybrid Specialist Integration
por: Duan, Chen, et al.
Publicado: (2026)
por: Duan, Chen, et al.
Publicado: (2026)
Text Image Inpainting via Global Structure-Guided Diffusion Models
por: Zhu, Shipeng, et al.
Publicado: (2024)
por: Zhu, Shipeng, et al.
Publicado: (2024)
Cross-Modal Attention Guided Unlearning in Vision-Language Models
por: Bhaila, Karuna, et al.
Publicado: (2025)
por: Bhaila, Karuna, et al.
Publicado: (2025)
MMFuser: Multimodal Multi-Layer Feature Fuser for Fine-Grained Vision-Language Understanding
por: Cao, Yue, et al.
Publicado: (2024)
por: Cao, Yue, et al.
Publicado: (2024)
On Robustness of Vision-Language-Action Model against Multi-Modal Perturbations
por: Guo, Jianing, et al.
Publicado: (2025)
por: Guo, Jianing, et al.
Publicado: (2025)
DomainForensics: Exposing Face Forgery across Domains via Bi-directional Adaptation
por: Lv, Qingxuan, et al.
Publicado: (2023)
por: Lv, Qingxuan, et al.
Publicado: (2023)
Bi-VLDoc: Bidirectional Vision-Language Modeling for Visually-Rich Document Understanding
por: Luo, Chuwei, et al.
Publicado: (2022)
por: Luo, Chuwei, et al.
Publicado: (2022)
Unraveling Cross-Modality Knowledge Conflicts in Large Vision-Language Models
por: Zhu, Tinghui, et al.
Publicado: (2024)
por: Zhu, Tinghui, et al.
Publicado: (2024)
Q-CLIP: Unleashing the Power of Vision-Language Models for Video Quality Assessment through Unified Cross-Modal Adaptation
por: Mi, Yachun, et al.
Publicado: (2025)
por: Mi, Yachun, et al.
Publicado: (2025)
Collaborating Vision, Depth, and Thermal Signals for Multi-Modal Tracking: Dataset and Algorithm
por: Zhu, Xue-Feng, et al.
Publicado: (2025)
por: Zhu, Xue-Feng, et al.
Publicado: (2025)
Ejemplares similares
-
Skip-Vision: Efficient and Scalable Acceleration of Vision-Language Models via Adaptive Token Skipping
por: Zeng, Weili, et al.
Publicado: (2025) -
EpiAgent: An Agent-Centric System for Ancient Inscription Restoration
por: Zhu, Shipeng, et al.
Publicado: (2026) -
Jailbreak Vision Language Models via Bi-Modal Adversarial Prompt
por: Ying, Zonghao, et al.
Publicado: (2024) -
Multi-Modal Interpretability for Enhanced Localization in Vision-Language Models
por: Imran, Muhammad, et al.
Publicado: (2025) -
EvoCut: Multi-Layer Evolution-Aware Visual Token Compression for Efficient Large Vision-Language Models
por: Lu, Hongyu, et al.
Publicado: (2026)