Post-pre-training for Modality Alignment in Vision-Language Foundation Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Yamaguchi, Shin'ya, Feng, Dewei, Kanai, Sekitoshi, Adachi, Kazuki, Chijiwa, Daiki |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Adaptive Random Feature Regularization on Fine-tuning Deep Neural Networks
di: Yamaguchi, Shin'ya, et al.
Pubblicazione: (2024)
di: Yamaguchi, Shin'ya, et al.
Pubblicazione: (2024)
Parallel In-context Learning for Large Vision Language Models
di: Yamaguchi, Shin'ya, et al.
Pubblicazione: (2026)
di: Yamaguchi, Shin'ya, et al.
Pubblicazione: (2026)
Rationale-Enhanced Decoding for Multi-modal Chain-of-Thought
di: Yamaguchi, Shin'ya, et al.
Pubblicazione: (2025)
di: Yamaguchi, Shin'ya, et al.
Pubblicazione: (2025)
Learning Robust Convolutional Neural Networks with Relevant Feature Focusing via Explanations
di: Adachi, Kazuki, et al.
Pubblicazione: (2022)
di: Adachi, Kazuki, et al.
Pubblicazione: (2022)
Transfer Learning with Pre-trained Conditional Generative Models
di: Yamaguchi, Shin'ya, et al.
Pubblicazione: (2022)
di: Yamaguchi, Shin'ya, et al.
Pubblicazione: (2022)
Zero-shot Concept Bottleneck Models
di: Yamaguchi, Shin'ya, et al.
Pubblicazione: (2025)
di: Yamaguchi, Shin'ya, et al.
Pubblicazione: (2025)
Uniformity First: Uniformity-aware Test-time Adaptation of Vision-language Models against Image Corruption
di: Adachi, Kazuki, et al.
Pubblicazione: (2025)
di: Adachi, Kazuki, et al.
Pubblicazione: (2025)
Test-time Similarity Modification for Person Re-identification toward Temporal Distribution Shift
di: Adachi, Kazuki, et al.
Pubblicazione: (2024)
di: Adachi, Kazuki, et al.
Pubblicazione: (2024)
MultiModal Fine-tuning with Synthetic Captions
di: Enomoto, Shohei, et al.
Pubblicazione: (2026)
di: Enomoto, Shohei, et al.
Pubblicazione: (2026)
Explanation Bottleneck Models
di: Yamaguchi, Shin'ya, et al.
Pubblicazione: (2024)
di: Yamaguchi, Shin'ya, et al.
Pubblicazione: (2024)
Evaluating Time-Series Training Dataset through Lens of Spectrum in Deep State Space Models
di: Kanai, Sekitoshi, et al.
Pubblicazione: (2024)
di: Kanai, Sekitoshi, et al.
Pubblicazione: (2024)
Understanding Pure Textual Reasoning for Blind Image Quality Assessment
di: Li, Yuan, et al.
Pubblicazione: (2026)
di: Li, Yuan, et al.
Pubblicazione: (2026)
Difference Vector Equalization for Robust Fine-tuning of Vision-Language Models
di: Suzuki, Satoshi, et al.
Pubblicazione: (2025)
di: Suzuki, Satoshi, et al.
Pubblicazione: (2025)
Toward Data Efficient Model Merging between Different Datasets without Performance Degradation
di: Yamada, Masanori, et al.
Pubblicazione: (2023)
di: Yamada, Masanori, et al.
Pubblicazione: (2023)
Test-time Adaptation Meets Image Enhancement: Improving Accuracy via Uncertainty-aware Logit Switching
di: Enomoto, Shohei, et al.
Pubblicazione: (2024)
di: Enomoto, Shohei, et al.
Pubblicazione: (2024)
Building Reasonable Inference for Vision-Language Models in Blind Image Quality Assessment
di: Li, Yuan, et al.
Pubblicazione: (2025)
di: Li, Yuan, et al.
Pubblicazione: (2025)
Test-time Adaptation for Regression by Subspace Alignment
di: Adachi, Kazuki, et al.
Pubblicazione: (2024)
di: Adachi, Kazuki, et al.
Pubblicazione: (2024)
Respecting Modality Gap in Post-hoc Out-of-distribution Detection with Pre-trained Vision-Language Models
di: Hu, Yuanwei, et al.
Pubblicazione: (2026)
di: Hu, Yuanwei, et al.
Pubblicazione: (2026)
Align-KD: Distilling Cross-Modal Alignment Knowledge for Mobile Vision-Language Model
di: Feng, Qianhan, et al.
Pubblicazione: (2024)
di: Feng, Qianhan, et al.
Pubblicazione: (2024)
Investigate the Low-level Visual Perception in Vision-Language based Image Quality Assessment
di: Li, Yuan, et al.
Pubblicazione: (2025)
di: Li, Yuan, et al.
Pubblicazione: (2025)
FFF: Fixing Flawed Foundations in contrastive pre-training results in very strong Vision-Language models
di: Bulat, Adrian, et al.
Pubblicazione: (2024)
di: Bulat, Adrian, et al.
Pubblicazione: (2024)
Beyond Cross-Modal Alignment: Measuring and Leveraging Modality Gap in Vision-Language Models
di: Yan, Hanqi, et al.
Pubblicazione: (2025)
di: Yan, Hanqi, et al.
Pubblicazione: (2025)
Machine Learning Modeling for Multi-order Human Visual Motion Processing
di: Sun, Zitang, et al.
Pubblicazione: (2025)
di: Sun, Zitang, et al.
Pubblicazione: (2025)
Text-Printed Image: Bridging the Image-Text Modality Gap for Text-centric Training of Large Vision-Language Models
di: Yamabe, Shojiro, et al.
Pubblicazione: (2025)
di: Yamabe, Shojiro, et al.
Pubblicazione: (2025)
All in One: Exploring Unified Vision-Language Tracking with Multi-Modal Alignment
di: Zhang, Chunhui, et al.
Pubblicazione: (2023)
di: Zhang, Chunhui, et al.
Pubblicazione: (2023)
Guiding Perception-Reasoning Closer to Human in Blind Image Quality Assessment
di: Li, Yuan, et al.
Pubblicazione: (2025)
di: Li, Yuan, et al.
Pubblicazione: (2025)
DGTRSD & DGTRS-CLIP: A Dual-Granularity Remote Sensing Image-Text Dataset and Vision Language Foundation Model for Alignment
di: Chen, Weizhi, et al.
Pubblicazione: (2025)
di: Chen, Weizhi, et al.
Pubblicazione: (2025)
Covariance-aware Feature Alignment with Pre-computed Source Statistics for Test-time Adaptation to Multiple Image Corruptions
di: Adachi, Kazuki, et al.
Pubblicazione: (2022)
di: Adachi, Kazuki, et al.
Pubblicazione: (2022)
Token-Level Inference-Time Alignment for Vision-Language Models
di: Chen, Kejia, et al.
Pubblicazione: (2025)
di: Chen, Kejia, et al.
Pubblicazione: (2025)
Safety Alignment for Vision Language Models
di: Liu, Zhendong, et al.
Pubblicazione: (2024)
di: Liu, Zhendong, et al.
Pubblicazione: (2024)
3D Modality-Aware Pre-training for Vision-Language Model in MRI Multi-organ Abnormality Detection
di: Zhu, Haowen, et al.
Pubblicazione: (2026)
di: Zhu, Haowen, et al.
Pubblicazione: (2026)
Feedback-based Modal Mutual Search for Attacking Vision-Language Pre-training Models
di: Ding, Renhua, et al.
Pubblicazione: (2024)
di: Ding, Renhua, et al.
Pubblicazione: (2024)
Lossless Vocabulary Reduction for Auto-Regressive Language Models
di: Chijiwa, Daiki, et al.
Pubblicazione: (2025)
di: Chijiwa, Daiki, et al.
Pubblicazione: (2025)
TinyAlign: Boosting Lightweight Vision-Language Models by Mitigating Modal Alignment Bottlenecks
di: Hu, Yuanze, et al.
Pubblicazione: (2025)
di: Hu, Yuanze, et al.
Pubblicazione: (2025)
On the Utility of Foundation Models for Fast MRI: Vision-Language-Guided Image Reconstruction
di: Feng, Ruimin, et al.
Pubblicazione: (2025)
di: Feng, Ruimin, et al.
Pubblicazione: (2025)
PivotMerge: Bridging Heterogeneous Multimodal Pre-training via Post-Alignment Model Merging
di: Shao, Zibo, et al.
Pubblicazione: (2026)
di: Shao, Zibo, et al.
Pubblicazione: (2026)
When Language Overwrites Vision: Over-Alignment and Geometric Debiasing in Vision-Language Models
di: Saini, Harshvardhan, et al.
Pubblicazione: (2026)
di: Saini, Harshvardhan, et al.
Pubblicazione: (2026)
OmniMRI: A Unified Vision--Language Foundation Model for Generalist MRI Interpretation
di: He, Xingxin, et al.
Pubblicazione: (2025)
di: He, Xingxin, et al.
Pubblicazione: (2025)
A Multi-Modal Foundation Model to Assist People with Blindness and Low Vision in Environmental Interaction
di: Hao, Yu, et al.
Pubblicazione: (2023)
di: Hao, Yu, et al.
Pubblicazione: (2023)
Decoding Vision Transformers: the Diffusion Steering Lens
di: Takatsuki, Ryota, et al.
Pubblicazione: (2025)
di: Takatsuki, Ryota, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Adaptive Random Feature Regularization on Fine-tuning Deep Neural Networks
di: Yamaguchi, Shin'ya, et al.
Pubblicazione: (2024) -
Parallel In-context Learning for Large Vision Language Models
di: Yamaguchi, Shin'ya, et al.
Pubblicazione: (2026) -
Rationale-Enhanced Decoding for Multi-modal Chain-of-Thought
di: Yamaguchi, Shin'ya, et al.
Pubblicazione: (2025) -
Learning Robust Convolutional Neural Networks with Relevant Feature Focusing via Explanations
di: Adachi, Kazuki, et al.
Pubblicazione: (2022) -
Transfer Learning with Pre-trained Conditional Generative Models
di: Yamaguchi, Shin'ya, et al.
Pubblicazione: (2022)