Test-time Alignment-Enhanced Adapter for Vision-Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Tong, Baoshun, Song, Kaiyu, Lai, Hanjiang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Enhancing Few-Shot Out-of-Distribution Detection with Gradient Aligned Context Optimization
di: Tong, Baoshun, et al.
Pubblicazione: (2024)
di: Tong, Baoshun, et al.
Pubblicazione: (2024)
Improving Training-free Conditional Diffusion Model via Fisher Information
di: Song, Kaiyu, et al.
Pubblicazione: (2024)
di: Song, Kaiyu, et al.
Pubblicazione: (2024)
Leveraging Previous Steps: A Training-free Fast Solver for Flow Diffusion
di: Song, Kaiyu, et al.
Pubblicazione: (2024)
di: Song, Kaiyu, et al.
Pubblicazione: (2024)
Rethinking Oversaturation in Classifier-Free Guidance via Low Frequency
di: Song, Kaiyu, et al.
Pubblicazione: (2025)
di: Song, Kaiyu, et al.
Pubblicazione: (2025)
Two Simple Principles for Diffusion-Based Test-Time Adaptation
di: Song, Kaiyu, et al.
Pubblicazione: (2023)
di: Song, Kaiyu, et al.
Pubblicazione: (2023)
Flow Matching Posterior Sampling: A Training-free Conditional Generation for Flow Matching
di: Song, Kaiyu, et al.
Pubblicazione: (2024)
di: Song, Kaiyu, et al.
Pubblicazione: (2024)
An Iteration-Free Fixed-Point Estimator for Diffusion Inversion
di: Chen, Yifei, et al.
Pubblicazione: (2025)
di: Chen, Yifei, et al.
Pubblicazione: (2025)
Uncovering Linguistic Fragility in Vision-Language-Action Models via Diversity-Aware Red Teaming
di: Tong, Baoshun, et al.
Pubblicazione: (2026)
di: Tong, Baoshun, et al.
Pubblicazione: (2026)
Topology Sculptor, Shape Refiner: Discrete Diffusion Model for High-Fidelity 3D Meshes Generation
di: Song, Kaiyu, et al.
Pubblicazione: (2025)
di: Song, Kaiyu, et al.
Pubblicazione: (2025)
Subspace Alignment for Vision-Language Model Test-time Adaptation
di: Zeng, Zhichen, et al.
Pubblicazione: (2026)
di: Zeng, Zhichen, et al.
Pubblicazione: (2026)
Pretrain like Your Inference: Masked Tuning Improves Zero-Shot Composed Image Retrieval
di: Chen, Junyang, et al.
Pubblicazione: (2023)
di: Chen, Junyang, et al.
Pubblicazione: (2023)
CLIP-Adapter: Better Vision-Language Models with Feature Adapters
di: Gao, Peng, et al.
Pubblicazione: (2021)
di: Gao, Peng, et al.
Pubblicazione: (2021)
Meta-Adapter: An Online Few-shot Learner for Vision-Language Model
di: Cheng, Cheng, et al.
Pubblicazione: (2023)
di: Cheng, Cheng, et al.
Pubblicazione: (2023)
Mema: Memory-Augmented Adapter for Enhanced Vision-Language Understanding
di: Liu, Ying, et al.
Pubblicazione: (2026)
di: Liu, Ying, et al.
Pubblicazione: (2026)
Enhancing Vision-Language Model with Unmasked Token Alignment
di: Liu, Jihao, et al.
Pubblicazione: (2024)
di: Liu, Jihao, et al.
Pubblicazione: (2024)
BoostAdapter: Improving Vision-Language Test-Time Adaptation via Regional Bootstrapping
di: Zhang, Taolin, et al.
Pubblicazione: (2024)
di: Zhang, Taolin, et al.
Pubblicazione: (2024)
Skip Tuning: Pre-trained Vision-Language Models are Effective and Efficient Adapters Themselves
di: Wu, Shihan, et al.
Pubblicazione: (2024)
di: Wu, Shihan, et al.
Pubblicazione: (2024)
T-Gated Adapter: A Lightweight Temporal Adapter for Vision-Language Medical Segmentation
di: Khadka, Pranjal
Pubblicazione: (2026)
di: Khadka, Pranjal
Pubblicazione: (2026)
Robust Calibration of Large Vision-Language Adapters
di: Murugesan, Balamurali, et al.
Pubblicazione: (2024)
di: Murugesan, Balamurali, et al.
Pubblicazione: (2024)
HeBA: Heterogeneous Bottleneck Adapters for Robust Vision-Language Models
di: Islam, Md Jahidul
Pubblicazione: (2026)
di: Islam, Md Jahidul
Pubblicazione: (2026)
HeGraphAdapter: Tuning Multi-Modal Vision-Language Models with Heterogeneous Graph Adapter
di: Zhao, Yumiao, et al.
Pubblicazione: (2024)
di: Zhao, Yumiao, et al.
Pubblicazione: (2024)
A Navigation Framework Utilizing Vision-Language Models
di: Duan, Yicheng, et al.
Pubblicazione: (2025)
di: Duan, Yicheng, et al.
Pubblicazione: (2025)
ArtGPT-4: Towards Artistic-understanding Large Vision-Language Models with Enhanced Adapter
di: Yuan, Zhengqing, et al.
Pubblicazione: (2023)
di: Yuan, Zhengqing, et al.
Pubblicazione: (2023)
TTL: Test-time Textual Learning for OOD Detection with Pretrained Vision-Language Models
di: Ye, Jinlun, et al.
Pubblicazione: (2026)
di: Ye, Jinlun, et al.
Pubblicazione: (2026)
CAST: Cross-modal Alignment Similarity Test for Vision Language Models
di: Dagan, Gautier, et al.
Pubblicazione: (2024)
di: Dagan, Gautier, et al.
Pubblicazione: (2024)
Cross-Modal Adapter for Vision-Language Retrieval
di: Jiang, Haojun, et al.
Pubblicazione: (2022)
di: Jiang, Haojun, et al.
Pubblicazione: (2022)
Boosting Continual Learning of Vision-Language Models via Mixture-of-Experts Adapters
di: Yu, Jiazuo, et al.
Pubblicazione: (2024)
di: Yu, Jiazuo, et al.
Pubblicazione: (2024)
OS-HGAdapter: Open Semantic Hypergraph Adapter for Large Language Models Assisted Entropy-Enhanced Image-Text Alignment
di: Chen, Rongjun, et al.
Pubblicazione: (2025)
di: Chen, Rongjun, et al.
Pubblicazione: (2025)
DIMoE-Adapters: Dynamic Expert Evolution for Continual Learning in Vision-Language Models
di: Qin, Mengxin, et al.
Pubblicazione: (2026)
di: Qin, Mengxin, et al.
Pubblicazione: (2026)
Test-time Distribution Learning Adapter for Cross-modal Visual Reasoning
di: Zhang, Yi, et al.
Pubblicazione: (2024)
di: Zhang, Yi, et al.
Pubblicazione: (2024)
QueryAdapter: Rapid Adaptation of Vision-Language Models in Response to Natural Language Queries
di: Chapman, Nicolas Harvey, et al.
Pubblicazione: (2025)
di: Chapman, Nicolas Harvey, et al.
Pubblicazione: (2025)
Object Referring-Guided Scanpath Prediction with Perception-Enhanced Vision-Language Models
di: Quan, Rong, et al.
Pubblicazione: (2026)
di: Quan, Rong, et al.
Pubblicazione: (2026)
Locality Alignment Improves Vision-Language Models
di: Covert, Ian, et al.
Pubblicazione: (2024)
di: Covert, Ian, et al.
Pubblicazione: (2024)
Enhance Vision-Language Alignment with Noise
di: Huang, Sida, et al.
Pubblicazione: (2024)
di: Huang, Sida, et al.
Pubblicazione: (2024)
Enhanced Online Test-time Adaptation with Feature-Weight Cosine Alignment
di: Chuah, WeiQin, et al.
Pubblicazione: (2024)
di: Chuah, WeiQin, et al.
Pubblicazione: (2024)
Multi-Modal Adapter for Vision-Language Models
di: Seputis, Dominykas, et al.
Pubblicazione: (2024)
di: Seputis, Dominykas, et al.
Pubblicazione: (2024)
MV-CC: Mask Enhanced Video Model for Remote Sensing Change Caption
di: Liu, Ruixun, et al.
Pubblicazione: (2024)
di: Liu, Ruixun, et al.
Pubblicazione: (2024)
MetaTPT: Meta Test-time Prompt Tuning for Vision-Language Models
di: Lei, Yuqing, et al.
Pubblicazione: (2025)
di: Lei, Yuqing, et al.
Pubblicazione: (2025)
ScVLM: Enhancing Vision-Language Model for Safety-Critical Event Understanding
di: Shi, Liang, et al.
Pubblicazione: (2024)
di: Shi, Liang, et al.
Pubblicazione: (2024)
Focus on What Matters: Enhancing Medical Vision-Language Models with Automatic Attention Alignment Tuning
di: Chang, Aofei, et al.
Pubblicazione: (2025)
di: Chang, Aofei, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Enhancing Few-Shot Out-of-Distribution Detection with Gradient Aligned Context Optimization
di: Tong, Baoshun, et al.
Pubblicazione: (2024) -
Improving Training-free Conditional Diffusion Model via Fisher Information
di: Song, Kaiyu, et al.
Pubblicazione: (2024) -
Leveraging Previous Steps: A Training-free Fast Solver for Flow Diffusion
di: Song, Kaiyu, et al.
Pubblicazione: (2024) -
Rethinking Oversaturation in Classifier-Free Guidance via Low Frequency
di: Song, Kaiyu, et al.
Pubblicazione: (2025) -
Two Simple Principles for Diffusion-Based Test-Time Adaptation
di: Song, Kaiyu, et al.
Pubblicazione: (2023)