EvoVLMA: Evolutionary Vision-Language Model Adaptation
Fuente:
arXiv
Salvato in:
| Autori principali: | Ding, Kun, Wang, Ying, Xiang, Shiming |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
A Survey of Low-shot Vision-Language Model Adaptation via Representer Theorem
di: Ding, Kun, et al.
Pubblicazione: (2024)
di: Ding, Kun, et al.
Pubblicazione: (2024)
Calibrated Cache Model for Few-Shot Vision-Language Model Adaptation
di: Ding, Kun, et al.
Pubblicazione: (2024)
di: Ding, Kun, et al.
Pubblicazione: (2024)
Compositional Kronecker Context Optimization for Vision-Language Models
di: Ding, Kun, et al.
Pubblicazione: (2024)
di: Ding, Kun, et al.
Pubblicazione: (2024)
Weak Distribution Detectors Lead to Stronger Generalizability of Vision-Language Prompt Tuning
di: Ding, Kun, et al.
Pubblicazione: (2024)
di: Ding, Kun, et al.
Pubblicazione: (2024)
WikiSeeker: Rethinking the Role of Vision-Language Models in Knowledge-Based Visual Question Answering
di: Zhu, Yingjian, et al.
Pubblicazione: (2026)
di: Zhu, Yingjian, et al.
Pubblicazione: (2026)
Prompt Tuning with Soft Context Sharing for Vision-Language Models
di: Ding, Kun, et al.
Pubblicazione: (2022)
di: Ding, Kun, et al.
Pubblicazione: (2022)
EvoCAD: Evolutionary CAD Code Generation with Vision Language Models
di: Preintner, Tobias, et al.
Pubblicazione: (2025)
di: Preintner, Tobias, et al.
Pubblicazione: (2025)
EvoVLA: Self-Evolving Vision-Language-Action Model
di: Liu, Zeting, et al.
Pubblicazione: (2025)
di: Liu, Zeting, et al.
Pubblicazione: (2025)
Re-ranking Reasoning Context with Tree Search Makes Large Vision-Language Models Stronger
di: Yang, Qi, et al.
Pubblicazione: (2025)
di: Yang, Qi, et al.
Pubblicazione: (2025)
AddressCLIP: Empowering Vision-Language Models for City-wide Image Address Localization
di: Xu, Shixiong, et al.
Pubblicazione: (2024)
di: Xu, Shixiong, et al.
Pubblicazione: (2024)
Evo-0: Vision-Language-Action Model with Implicit Spatial Understanding
di: Lin, Tao, et al.
Pubblicazione: (2025)
di: Lin, Tao, et al.
Pubblicazione: (2025)
Cascade Prompt Learning for Vision-Language Model Adaptation
di: Wu, Ge, et al.
Pubblicazione: (2024)
di: Wu, Ge, et al.
Pubblicazione: (2024)
Beyond Next-Token Alignment: Distilling Multimodal Large Language Models via Token Interactions
di: Chen, Lin, et al.
Pubblicazione: (2026)
di: Chen, Lin, et al.
Pubblicazione: (2026)
Beyond Sequential Distance: Inter-Modal Distance Invariant Position Encoding
di: Chen, Lin, et al.
Pubblicazione: (2026)
di: Chen, Lin, et al.
Pubblicazione: (2026)
Continuous Speculative Decoding for Autoregressive Image Generation
di: Wang, Zili, et al.
Pubblicazione: (2024)
di: Wang, Zili, et al.
Pubblicazione: (2024)
Evo-1: Lightweight Vision-Language-Action Model with Preserved Semantic Alignment
di: Lin, Tao, et al.
Pubblicazione: (2025)
di: Lin, Tao, et al.
Pubblicazione: (2025)
Evo-Depth: A Lightweight Depth-Enhanced Vision-Language-Action Model
di: Lin, Tao, et al.
Pubblicazione: (2026)
di: Lin, Tao, et al.
Pubblicazione: (2026)
IF-Bench: Benchmarking and Enhancing MLLMs for Infrared Images with Generative Visual Prompting
di: Zhang, Tao, et al.
Pubblicazione: (2025)
di: Zhang, Tao, et al.
Pubblicazione: (2025)
SeaVIS: Sound-Enhanced Association for Online Audio-Visual Instance Segmentation
di: Zhu, Yingjian, et al.
Pubblicazione: (2026)
di: Zhu, Yingjian, et al.
Pubblicazione: (2026)
Interpretable Zero-Shot Learning with Locally-Aligned Vision-Language Model
di: Chen, Shiming, et al.
Pubblicazione: (2025)
di: Chen, Shiming, et al.
Pubblicazione: (2025)
Dynamic Rank Adaptation for Vision-Language Models
di: Wang, Jiahui, et al.
Pubblicazione: (2025)
di: Wang, Jiahui, et al.
Pubblicazione: (2025)
Disease-informed Adaptation of Vision-Language Models
di: Zhang, Jiajin, et al.
Pubblicazione: (2024)
di: Zhang, Jiajin, et al.
Pubblicazione: (2024)
Complementary Subspace Low-Rank Adaptation of Vision-Language Models for Few-Shot Classification
di: Wang, Zhongqi, et al.
Pubblicazione: (2025)
di: Wang, Zhongqi, et al.
Pubblicazione: (2025)
SAM-MI: A Mask-Injected Framework for Enhancing Open-Vocabulary Semantic Segmentation with SAM
di: Chen, Lin, et al.
Pubblicazione: (2025)
di: Chen, Lin, et al.
Pubblicazione: (2025)
UNIP: Rethinking Pre-trained Attention Patterns for Infrared Semantic Segmentation
di: Zhang, Tao, et al.
Pubblicazione: (2025)
di: Zhang, Tao, et al.
Pubblicazione: (2025)
EvoIR: Towards All-in-One Image Restoration via Evolutionary Frequency Modulation
di: Ma, Jiaqi, et al.
Pubblicazione: (2025)
di: Ma, Jiaqi, et al.
Pubblicazione: (2025)
EvoCut: Multi-Layer Evolution-Aware Visual Token Compression for Efficient Large Vision-Language Models
di: Lu, Hongyu, et al.
Pubblicazione: (2026)
di: Lu, Hongyu, et al.
Pubblicazione: (2026)
DSFC-Net: A Dual-Encoder Spatial and Frequency Co-Awareness Network for Rural Road Extraction
di: Zhang, Zhengbo, et al.
Pubblicazione: (2026)
di: Zhang, Zhengbo, et al.
Pubblicazione: (2026)
Rethinking Comprehensive Benchmark for Chart Understanding: A Perspective from Scientific Literature
di: Shen, Lingdong, et al.
Pubblicazione: (2024)
di: Shen, Lingdong, et al.
Pubblicazione: (2024)
Diffusion Model as a Noise-Aware Latent Reward Model for Step-Level Preference Optimization
di: Zhang, Tao, et al.
Pubblicazione: (2025)
di: Zhang, Tao, et al.
Pubblicazione: (2025)
Active Learning via Vision-Language Model Adaptation with Open Data
di: Wang, Tong, et al.
Pubblicazione: (2025)
di: Wang, Tong, et al.
Pubblicazione: (2025)
Rethinking the Need for Source Models: Source-Free Domain Adaptation from Scratch Guided by a Vision-Language Model
di: Bingtao, Zhou, et al.
Pubblicazione: (2026)
di: Bingtao, Zhou, et al.
Pubblicazione: (2026)
Negation-Aware Test-Time Adaptation for Vision-Language Models
di: Han, Haochen, et al.
Pubblicazione: (2025)
di: Han, Haochen, et al.
Pubblicazione: (2025)
Hierarchical Dual-Subspace Decoupling for Continual Learning in Vision-Language Models
di: Qin, Mengxin, et al.
Pubblicazione: (2026)
di: Qin, Mengxin, et al.
Pubblicazione: (2026)
Flatness Guided Test-Time Adaptation for Vision-Language Models
di: Li, Aodi, et al.
Pubblicazione: (2025)
di: Li, Aodi, et al.
Pubblicazione: (2025)
EvoComp: Learning Visual Token Compression for Multimodal Large Language Models via Semantic-Guided Evolutionary Labeling
di: Song, Jiafei, et al.
Pubblicazione: (2026)
di: Song, Jiafei, et al.
Pubblicazione: (2026)
Conflict Adaptation in Vision-Language Models
di: Hu, Xiaoyang
Pubblicazione: (2025)
di: Hu, Xiaoyang
Pubblicazione: (2025)
EvoVid: Temporal-Centric Self-Evolution for Video Large Language Models
di: Huang, Shiqi, et al.
Pubblicazione: (2026)
di: Huang, Shiqi, et al.
Pubblicazione: (2026)
DIMoE-Adapters: Dynamic Expert Evolution for Continual Learning in Vision-Language Models
di: Qin, Mengxin, et al.
Pubblicazione: (2026)
di: Qin, Mengxin, et al.
Pubblicazione: (2026)
Realistic Test-Time Adaptation of Vision-Language Models
di: Zanella, Maxime, et al.
Pubblicazione: (2025)
di: Zanella, Maxime, et al.
Pubblicazione: (2025)
Documenti analoghi
-
A Survey of Low-shot Vision-Language Model Adaptation via Representer Theorem
di: Ding, Kun, et al.
Pubblicazione: (2024) -
Calibrated Cache Model for Few-Shot Vision-Language Model Adaptation
di: Ding, Kun, et al.
Pubblicazione: (2024) -
Compositional Kronecker Context Optimization for Vision-Language Models
di: Ding, Kun, et al.
Pubblicazione: (2024) -
Weak Distribution Detectors Lead to Stronger Generalizability of Vision-Language Prompt Tuning
di: Ding, Kun, et al.
Pubblicazione: (2024) -
WikiSeeker: Rethinking the Role of Vision-Language Models in Knowledge-Based Visual Question Answering
di: Zhu, Yingjian, et al.
Pubblicazione: (2026)