Impact of Pretraining Word Co-occurrence on Compositional Generalization in Multimodal Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Qu, Helen, Xie, Sang Michael |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Connect Later: Improving Fine-tuning for Robustness with Targeted Augmentations
por: Qu, Helen, et al.
Publicado: (2024)
por: Qu, Helen, et al.
Publicado: (2024)
Pretrain Where? Investigating How Pretraining Data Diversity Impacts Geospatial Foundation Model Performance
por: Kaur, Amandeep, et al.
Publicado: (2026)
por: Kaur, Amandeep, et al.
Publicado: (2026)
LMFusion: Adapting Pretrained Language Models for Multimodal Generation
por: Shi, Weijia, et al.
Publicado: (2024)
por: Shi, Weijia, et al.
Publicado: (2024)
Context-Aware Multimodal Pretraining
por: Roth, Karsten, et al.
Publicado: (2024)
por: Roth, Karsten, et al.
Publicado: (2024)
Towards Knowledge Guided Pretraining Approaches for Multimodal Foundation Models: Applications in Remote Sensing
por: Ravirathinam, Praveen, et al.
Publicado: (2024)
por: Ravirathinam, Praveen, et al.
Publicado: (2024)
Foundation Model-oriented Robustness: Robust Image Model Evaluation with Pretrained Models
por: Zhang, Peiyan, et al.
Publicado: (2023)
por: Zhang, Peiyan, et al.
Publicado: (2023)
A Practitioner's Guide to Continual Multimodal Pretraining
por: Roth, Karsten, et al.
Publicado: (2024)
por: Roth, Karsten, et al.
Publicado: (2024)
Draw Like an Artist: Complex Scene Generation with Diffusion Model via Composition, Painting, and Retouching
por: Liu, Minghao, et al.
Publicado: (2024)
por: Liu, Minghao, et al.
Publicado: (2024)
Pretrained Visual Uncertainties
por: Kirchhof, Michael, et al.
Publicado: (2024)
por: Kirchhof, Michael, et al.
Publicado: (2024)
SpectralEarth-FM: Bringing Hyperspectral Imagery into Multimodal Earth Observation Pretraining
por: Braham, Nassim Ait Ali, et al.
Publicado: (2026)
por: Braham, Nassim Ait Ali, et al.
Publicado: (2026)
Simplifying Knowledge Transfer in Pretrained Models
por: Jain, Siddharth, et al.
Publicado: (2025)
por: Jain, Siddharth, et al.
Publicado: (2025)
COMPRER: A Multimodal Multi-Objective Pretraining Framework for Enhanced Medical Image Representation
por: Lutsker, Guy, et al.
Publicado: (2024)
por: Lutsker, Guy, et al.
Publicado: (2024)
Is Large-Scale Pretraining the Secret to Good Domain Generalization?
por: Teterwak, Piotr, et al.
Publicado: (2024)
por: Teterwak, Piotr, et al.
Publicado: (2024)
Why Fine-grained Labels in Pretraining Benefit Generalization?
por: Hong, Guan Zhe, et al.
Publicado: (2024)
por: Hong, Guan Zhe, et al.
Publicado: (2024)
SILMM: Self-Improving Large Multimodal Models for Compositional Text-to-Image Generation
por: Qu, Leigang, et al.
Publicado: (2024)
por: Qu, Leigang, et al.
Publicado: (2024)
No "Zero-Shot" Without Exponential Data: Pretraining Concept Frequency Determines Multimodal Model Performance
por: Udandarao, Vishaal, et al.
Publicado: (2024)
por: Udandarao, Vishaal, et al.
Publicado: (2024)
Pretrained Diffusion Models Are Inherently Skipped-Step Samplers
por: Xu, Wenju
Publicado: (2025)
por: Xu, Wenju
Publicado: (2025)
Pretrained Image-Text Models are Secretly Video Captioners
por: Zhang, Chunhui, et al.
Publicado: (2025)
por: Zhang, Chunhui, et al.
Publicado: (2025)
Progressive Compositionality in Text-to-Image Generative Models
por: Han, Evans Xu, et al.
Publicado: (2024)
por: Han, Evans Xu, et al.
Publicado: (2024)
Fantastic Gains and Where to Find Them: On the Existence and Prospect of General Knowledge Transfer between Any Pretrained Model
por: Roth, Karsten, et al.
Publicado: (2023)
por: Roth, Karsten, et al.
Publicado: (2023)
2.5 Years in Class: A Multimodal Textbook for Vision-Language Pretraining
por: Zhang, Wenqi, et al.
Publicado: (2025)
por: Zhang, Wenqi, et al.
Publicado: (2025)
Reflecting on the State of Rehearsal-free Continual Learning with Pretrained Models
por: Thede, Lukas, et al.
Publicado: (2024)
por: Thede, Lukas, et al.
Publicado: (2024)
ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model
por: Han, Kunyang, et al.
Publicado: (2024)
por: Han, Kunyang, et al.
Publicado: (2024)
Negative Label Guided OOD Detection with Pretrained Vision-Language Models
por: Jiang, Xue, et al.
Publicado: (2024)
por: Jiang, Xue, et al.
Publicado: (2024)
Image Clustering via the Principle of Rate Reduction in the Age of Pretrained Models
por: Chu, Tianzhe, et al.
Publicado: (2023)
por: Chu, Tianzhe, et al.
Publicado: (2023)
Accelerating Augmentation Invariance Pretraining
por: Lin, Jinhong, et al.
Publicado: (2024)
por: Lin, Jinhong, et al.
Publicado: (2024)
What Variables Affect Out-of-Distribution Generalization in Pretrained Models?
por: Harun, Md Yousuf, et al.
Publicado: (2024)
por: Harun, Md Yousuf, et al.
Publicado: (2024)
Learning Multimodal Latent Generative Models with Energy-Based Prior
por: Yuan, Shiyu, et al.
Publicado: (2024)
por: Yuan, Shiyu, et al.
Publicado: (2024)
Enhancing Compositional Generalization via Compositional Feature Alignment
por: Wang, Haoxiang, et al.
Publicado: (2024)
por: Wang, Haoxiang, et al.
Publicado: (2024)
Words That Make Language Models Perceive
por: Wang, Sophie L., et al.
Publicado: (2025)
por: Wang, Sophie L., et al.
Publicado: (2025)
Breaking the Likelihood-Quality Trade-off in Diffusion Models by Merging Pretrained Experts
por: Esfandiari, Yasin, et al.
Publicado: (2025)
por: Esfandiari, Yasin, et al.
Publicado: (2025)
Compositional Generalization Requires Linear, Orthogonal Representations in Vision Embedding Models
por: Uselis, Arnas, et al.
Publicado: (2026)
por: Uselis, Arnas, et al.
Publicado: (2026)
Medical Semantic Segmentation with Diffusion Pretrain
por: Li, David, et al.
Publicado: (2025)
por: Li, David, et al.
Publicado: (2025)
Polyp Segmentation Generalisability of Pretrained Backbones
por: Sanderson, Edward, et al.
Publicado: (2024)
por: Sanderson, Edward, et al.
Publicado: (2024)
Multimodal Generalized Category Discovery
por: Su, Yuchang, et al.
Publicado: (2024)
por: Su, Yuchang, et al.
Publicado: (2024)
Rethinking Generative Image Pretraining: How Far Are We From Scaling Up Next-Pixel Prediction?
por: Yan, Xinchen, et al.
Publicado: (2025)
por: Yan, Xinchen, et al.
Publicado: (2025)
Contrastive Test-Time Composition of Multiple LoRA Models for Image Generation
por: Meral, Tuna Han Salih, et al.
Publicado: (2024)
por: Meral, Tuna Han Salih, et al.
Publicado: (2024)
Self-Supervised Pretraining for Aerial Road Extraction
por: Polley, Rupert, et al.
Publicado: (2025)
por: Polley, Rupert, et al.
Publicado: (2025)
Object-level Self-Distillation for Vision Pretraining
por: Hızlı, Çağlar, et al.
Publicado: (2025)
por: Hızlı, Çağlar, et al.
Publicado: (2025)
STARFlow2: Bridging Language Models and Normalizing Flows for Unified Multimodal Generation
por: Shen, Ying, et al.
Publicado: (2026)
por: Shen, Ying, et al.
Publicado: (2026)
Ejemplares similares
-
Connect Later: Improving Fine-tuning for Robustness with Targeted Augmentations
por: Qu, Helen, et al.
Publicado: (2024) -
Pretrain Where? Investigating How Pretraining Data Diversity Impacts Geospatial Foundation Model Performance
por: Kaur, Amandeep, et al.
Publicado: (2026) -
LMFusion: Adapting Pretrained Language Models for Multimodal Generation
por: Shi, Weijia, et al.
Publicado: (2024) -
Context-Aware Multimodal Pretraining
por: Roth, Karsten, et al.
Publicado: (2024) -
Towards Knowledge Guided Pretraining Approaches for Multimodal Foundation Models: Applications in Remote Sensing
por: Ravirathinam, Praveen, et al.
Publicado: (2024)