Harnessing Frozen Unimodal Encoders for Flexible Multimodal Alignment
Fuente:
arXiv
Salvato in:
| Autori principali: | Maniparambil, Mayug, Akshulakov, Raiymbek, Djilali, Yasser Abdelaziz Dahou, Narayan, Sanath, Singh, Ankit, O'Connor, Noel E. |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Do Vision and Language Encoders Represent the World Similarly?
di: Maniparambil, Mayug, et al.
Pubblicazione: (2024)
di: Maniparambil, Mayug, et al.
Pubblicazione: (2024)
ViSpeR: Multilingual Audio-Visual Speech Recognition
di: Narayan, Sanath, et al.
Pubblicazione: (2024)
di: Narayan, Sanath, et al.
Pubblicazione: (2024)
Hold-One-Shot-Out (HOSO) for Validation-Free Few-Shot CLIP Adapters
di: Vorster, Chris, et al.
Pubblicazione: (2026)
di: Vorster, Chris, et al.
Pubblicazione: (2026)
Underrepresented in Foundation Model Pretraining Data? A One-Shot Probe
di: Vorster, Chris, et al.
Pubblicazione: (2026)
di: Vorster, Chris, et al.
Pubblicazione: (2026)
Understanding Space Is Rocket Science -- Only Top Reasoning Models Can Solve Spatial Understanding Tasks
di: Hoehing, Nils, et al.
Pubblicazione: (2025)
di: Hoehing, Nils, et al.
Pubblicazione: (2025)
Are Natural-Domain Foundation Models Effective for Accelerated Cardiac MRI Reconstruction?
di: Hashmi, Anam, et al.
Pubblicazione: (2026)
di: Hashmi, Anam, et al.
Pubblicazione: (2026)
Ensemble Learning with Sparse Hypercolumns
di: Dietlmeier, Julia, et al.
Pubblicazione: (2026)
di: Dietlmeier, Julia, et al.
Pubblicazione: (2026)
Pinpoint Counterfactuals: Reducing social bias in foundation models via localized counterfactual generation
di: Sirotkin, Kirill, et al.
Pubblicazione: (2024)
di: Sirotkin, Kirill, et al.
Pubblicazione: (2024)
Vision-Language Models Can't See the Obvious
di: Dahou, Yasser, et al.
Pubblicazione: (2025)
di: Dahou, Yasser, et al.
Pubblicazione: (2025)
Test-Time Adaptation with SaLIP: A Cascade of SAM and CLIP for Zero shot Medical Image Segmentation
di: Aleem, Sidra, et al.
Pubblicazione: (2024)
di: Aleem, Sidra, et al.
Pubblicazione: (2024)
VisRes Bench: On Evaluating the Visual Reasoning Capabilities of VLMs
di: Törtei, Brigitta Malagurski, et al.
Pubblicazione: (2025)
di: Törtei, Brigitta Malagurski, et al.
Pubblicazione: (2025)
Falcon Perception
di: Bevli, Aviraj, et al.
Pubblicazione: (2026)
di: Bevli, Aviraj, et al.
Pubblicazione: (2026)
SigLino: Efficient Multi-Teacher Distillation for Agglomerative Vision Foundation Models
di: Chaybouti, Sofian, et al.
Pubblicazione: (2025)
di: Chaybouti, Sofian, et al.
Pubblicazione: (2025)
Falcon2-11B Technical Report
di: Malartic, Quentin, et al.
Pubblicazione: (2024)
di: Malartic, Quentin, et al.
Pubblicazione: (2024)
TopoBench: Benchmarking LLMs on Hard Topological Reasoning
di: Maniparambil, Mayug, et al.
Pubblicazione: (2026)
di: Maniparambil, Mayug, et al.
Pubblicazione: (2026)
Towards Label-Free Brain Tumor Segmentation: Unsupervised Learning with Multimodal MRI
di: Comas-Quiles, Gerard, et al.
Pubblicazione: (2025)
di: Comas-Quiles, Gerard, et al.
Pubblicazione: (2025)
Implicit Multimodal Alignment: On the Generalization of Frozen LLMs to Multimodal Inputs
di: Shukor, Mustafa, et al.
Pubblicazione: (2024)
di: Shukor, Mustafa, et al.
Pubblicazione: (2024)
Open-Vocabulary Temporal Action Localization using Multimodal Guidance
di: Gupta, Akshita, et al.
Pubblicazione: (2024)
di: Gupta, Akshita, et al.
Pubblicazione: (2024)
Semantic Alignment of Unimodal Medical Text and Vision Representations
di: Di Folco, Maxime, et al.
Pubblicazione: (2025)
di: Di Folco, Maxime, et al.
Pubblicazione: (2025)
Assessing and Learning Alignment of Unimodal Vision and Language Models
di: Zhang, Le, et al.
Pubblicazione: (2024)
di: Zhang, Le, et al.
Pubblicazione: (2024)
Parameter-Free Bio-Inspired Channel Attention for Enhanced Cardiac MRI Reconstruction
di: Hashmi, Anam, et al.
Pubblicazione: (2025)
di: Hashmi, Anam, et al.
Pubblicazione: (2025)
Accelerating Cardiac MRI Reconstruction with CMRatt: An Attention-Driven Approach
di: Hashmi, Anam, et al.
Pubblicazione: (2024)
di: Hashmi, Anam, et al.
Pubblicazione: (2024)
Multimodal Representation Learning by Alternating Unimodal Adaptation
di: Zhang, Xiaohui, et al.
Pubblicazione: (2023)
di: Zhang, Xiaohui, et al.
Pubblicazione: (2023)
Batch Augmentation with Unimodal Fine-tuning for Multimodal Learning
di: Kabir, H M Dipu, et al.
Pubblicazione: (2025)
di: Kabir, H M Dipu, et al.
Pubblicazione: (2025)
VLSM-Ensemble: Ensembling CLIP-based Vision-Language Models for Enhanced Medical Image Segmentation
di: Dietlmeier, Julia, et al.
Pubblicazione: (2025)
di: Dietlmeier, Julia, et al.
Pubblicazione: (2025)
PMT: Plain Mask Transformer for Image and Video Segmentation with Frozen Vision Encoders
di: Cavagnero, Niccolò, et al.
Pubblicazione: (2026)
di: Cavagnero, Niccolò, et al.
Pubblicazione: (2026)
Foundation Models in Remote Sensing: Evolving from Unimodality to Multimodality
di: Hong, Danfeng, et al.
Pubblicazione: (2026)
di: Hong, Danfeng, et al.
Pubblicazione: (2026)
Localization vs. Semantics: Visual Representations in Unimodal and Multimodal Models
di: Li, Zhuowan, et al.
Pubblicazione: (2022)
di: Li, Zhuowan, et al.
Pubblicazione: (2022)
MMPareto: Boosting Multimodal Learning with Innocent Unimodal Assistance
di: Wei, Yake, et al.
Pubblicazione: (2024)
di: Wei, Yake, et al.
Pubblicazione: (2024)
An accurate detection is not all you need to combat label noise in web-noisy datasets
di: Albert, Paul, et al.
Pubblicazione: (2024)
di: Albert, Paul, et al.
Pubblicazione: (2024)
Beyond Unimodal Boundaries: Generative Recommendation with Multimodal Semantics
di: Zhu, Jing, et al.
Pubblicazione: (2025)
di: Zhu, Jing, et al.
Pubblicazione: (2025)
Frozen Transformers in Language Models Are Effective Visual Encoder Layers
di: Pang, Ziqi, et al.
Pubblicazione: (2023)
di: Pang, Ziqi, et al.
Pubblicazione: (2023)
Robo-MUTUAL: Robotic Multimodal Task Specification via Unimodal Learning
di: Li, Jianxiong, et al.
Pubblicazione: (2024)
di: Li, Jianxiong, et al.
Pubblicazione: (2024)
HyperTopo-Adapters: Geometry- and Topology-Aware Segmentation of Leaf Lesions on Frozen Encoders
di: Ndubuisi, Chimdi Walter, et al.
Pubblicazione: (2025)
di: Ndubuisi, Chimdi Walter, et al.
Pubblicazione: (2025)
DINOv3 as a Frozen Encoder for CRPS-Oriented Probabilistic Rainfall Nowcasting
di: Filho, Luciano Araujo Dourado, et al.
Pubblicazione: (2025)
di: Filho, Luciano Araujo Dourado, et al.
Pubblicazione: (2025)
Better Together: Leveraging Unpaired Multimodal Data for Stronger Unimodal Models
di: Gupta, Sharut, et al.
Pubblicazione: (2025)
di: Gupta, Sharut, et al.
Pubblicazione: (2025)
Reinforcement Learning meets Masked Video Modeling : Trajectory-Guided Adaptive Token Selection
di: Rai, Ayush K., et al.
Pubblicazione: (2025)
di: Rai, Ayush K., et al.
Pubblicazione: (2025)
Cross-Modal Knowledge Distillation for PET-Free Amyloid-Beta Detection from MRI
di: Chiumento, Francesco, et al.
Pubblicazione: (2026)
di: Chiumento, Francesco, et al.
Pubblicazione: (2026)
Fixed-Budget Parameter-Efficient Training with Frozen Encoders Improves Multimodal Chest X-Ray Classification
di: Khan, Md Ashik, et al.
Pubblicazione: (2025)
di: Khan, Md Ashik, et al.
Pubblicazione: (2025)
CSA: Data-efficient Mapping of Unimodal Features to Multimodal Features
di: Li, Po-han, et al.
Pubblicazione: (2024)
di: Li, Po-han, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Do Vision and Language Encoders Represent the World Similarly?
di: Maniparambil, Mayug, et al.
Pubblicazione: (2024) -
ViSpeR: Multilingual Audio-Visual Speech Recognition
di: Narayan, Sanath, et al.
Pubblicazione: (2024) -
Hold-One-Shot-Out (HOSO) for Validation-Free Few-Shot CLIP Adapters
di: Vorster, Chris, et al.
Pubblicazione: (2026) -
Underrepresented in Foundation Model Pretraining Data? A One-Shot Probe
di: Vorster, Chris, et al.
Pubblicazione: (2026) -
Understanding Space Is Rocket Science -- Only Top Reasoning Models Can Solve Spatial Understanding Tasks
di: Hoehing, Nils, et al.
Pubblicazione: (2025)