Context-Aware Multimodal Pretraining
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Roth, Karsten, Akata, Zeynep, Damen, Dima, Balažević, Ivana, Hénaff, Olivier J. |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
A Practitioner's Guide to Continual Multimodal Pretraining
par: Roth, Karsten, et autres
Publié: (2024)
par: Roth, Karsten, et autres
Publié: (2024)
Reflecting on the State of Rehearsal-free Continual Learning with Pretrained Models
par: Thede, Lukas, et autres
Publié: (2024)
par: Thede, Lukas, et autres
Publié: (2024)
Fantastic Gains and Where to Find Them: On the Existence and Prospect of General Knowledge Transfer between Any Pretrained Model
par: Roth, Karsten, et autres
Publié: (2023)
par: Roth, Karsten, et autres
Publié: (2023)
ETHER: Efficient Finetuning of Large-Scale Models with Hyperplane Reflections
par: Bini, Massimo, et autres
Publié: (2024)
par: Bini, Massimo, et autres
Publié: (2024)
How to Merge Your Multimodal Models Over Time?
par: Dziadzio, Sebastian, et autres
Publié: (2024)
par: Dziadzio, Sebastian, et autres
Publié: (2024)
DeLoRA: Decoupling Angles and Strength in Low-rank Adaptation
par: Bini, Massimo, et autres
Publié: (2025)
par: Bini, Massimo, et autres
Publié: (2025)
Perception Test 2024: Challenge Summary and a Novel Hour-Long VideoQA Benchmark
par: Heyward, Joseph, et autres
Publié: (2024)
par: Heyward, Joseph, et autres
Publié: (2024)
Memory Consolidation Enables Long-Context Video Understanding
par: Balažević, Ivana, et autres
Publié: (2024)
par: Balažević, Ivana, et autres
Publié: (2024)
Improving Intervention Efficacy via Concept Realignment in Concept Bottleneck Models
par: Singhi, Nishad, et autres
Publié: (2024)
par: Singhi, Nishad, et autres
Publié: (2024)
Disentangled Representation Learning with the Gromov-Monge Gap
par: Uscidda, Théo, et autres
Publié: (2024)
par: Uscidda, Théo, et autres
Publié: (2024)
Sparse Autoencoders are Topic Models
par: Girrbach, Leander, et autres
Publié: (2025)
par: Girrbach, Leander, et autres
Publié: (2025)
MemLoRA: Distilling Expert Adapters for On-Device Memory Systems
par: Bini, Massimo, et autres
Publié: (2025)
par: Bini, Massimo, et autres
Publié: (2025)
Person-Centric Annotations of LAION-400M: Auditing Bias and Its Transfer to Models
par: Girrbach, Leander, et autres
Publié: (2025)
par: Girrbach, Leander, et autres
Publié: (2025)
Dissecting Multimodal In-Context Learning: Modality Asymmetries and Circuit Dynamics in modern Transformers
par: Huang, Yiran, et autres
Publié: (2026)
par: Huang, Yiran, et autres
Publié: (2026)
COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training
par: Kim, Sanghwan, et autres
Publié: (2024)
par: Kim, Sanghwan, et autres
Publié: (2024)
Time Series Representations for Classification Lie Hidden in Pretrained Vision Transformers
par: Roschmann, Simon, et autres
Publié: (2025)
par: Roschmann, Simon, et autres
Publié: (2025)
Vision-by-Language for Training-Free Compositional Image Retrieval
par: Karthik, Shyamgopal, et autres
Publié: (2023)
par: Karthik, Shyamgopal, et autres
Publié: (2023)
2.5 Years in Class: A Multimodal Textbook for Vision-Language Pretraining
par: Zhang, Wenqi, et autres
Publié: (2025)
par: Zhang, Wenqi, et autres
Publié: (2025)
Investigating Structural Pruning and Recovery Techniques for Compressing Multimodal Large Language Models: An Empirical Study
par: Huang, Yiran, et autres
Publié: (2025)
par: Huang, Yiran, et autres
Publié: (2025)
No "Zero-Shot" Without Exponential Data: Pretraining Concept Frequency Determines Multimodal Model Performance
par: Udandarao, Vishaal, et autres
Publié: (2024)
par: Udandarao, Vishaal, et autres
Publié: (2024)
Learning to Read Where to Look: Disease-Aware Vision-Language Pretraining for 3D CT
par: Ging, Simon, et autres
Publié: (2026)
par: Ging, Simon, et autres
Publié: (2026)
From Drop-off to Recovery: A Mechanistic Analysis of Segmentation in MLLMs
par: Wu, Boyong, et autres
Publié: (2026)
par: Wu, Boyong, et autres
Publié: (2026)
The Manifold Hypothesis for Gradient-Based Explanations
par: Bordt, Sebastian, et autres
Publié: (2022)
par: Bordt, Sebastian, et autres
Publié: (2022)
LMFusion: Adapting Pretrained Language Models for Multimodal Generation
par: Shi, Weijia, et autres
Publié: (2024)
par: Shi, Weijia, et autres
Publié: (2024)
Stitch: Training-Free Position Control in Multimodal Diffusion Transformers
par: Bader, Jessica, et autres
Publié: (2025)
par: Bader, Jessica, et autres
Publié: (2025)
The Cost of Context: Mitigating Textual Bias in Multimodal Retrieval-Augmented Generation
par: Jung, Hoin, et autres
Publié: (2026)
par: Jung, Hoin, et autres
Publié: (2026)
Noise Hypernetworks: Amortizing Test-Time Compute in Diffusion Models
par: Eyring, Luca, et autres
Publié: (2025)
par: Eyring, Luca, et autres
Publié: (2025)
ReNO: Enhancing One-step Text-to-Image Models through Reward-based Noise Optimization
par: Eyring, Luca, et autres
Publié: (2024)
par: Eyring, Luca, et autres
Publié: (2024)
Uncertainty-Aware Exploratory Direct Preference Optimization for Multimodal Large Language Models
par: Zhang, Huatian, et autres
Publié: (2026)
par: Zhang, Huatian, et autres
Publié: (2026)
DataDream: Few-shot Guided Dataset Generation
par: Kim, Jae Myung, et autres
Publié: (2024)
par: Kim, Jae Myung, et autres
Publié: (2024)
Active Data Curation Effectively Distills Large-Scale Multimodal Models
par: Udandarao, Vishaal, et autres
Publié: (2024)
par: Udandarao, Vishaal, et autres
Publié: (2024)
SUB: Benchmarking CBM Generalization via Synthetic Attribute Substitutions
par: Bader, Jessica, et autres
Publié: (2025)
par: Bader, Jessica, et autres
Publié: (2025)
Layerwise complexity-matched learning yields an improved model of cortical area V2
par: Parthasarathy, Nikhil, et autres
Publié: (2023)
par: Parthasarathy, Nikhil, et autres
Publié: (2023)
LDP: Generalizing to Multilingual Visual Information Extraction by Language Decoupled Pretraining
par: Shen, Huawen, et autres
Publié: (2024)
par: Shen, Huawen, et autres
Publié: (2024)
MoLAN: A Unified Modality-Aware Noise Dynamic Editing Framework for Multimodal Sentiment Analysis
par: Xu, Xingle, et autres
Publié: (2025)
par: Xu, Xingle, et autres
Publié: (2025)
Multimodal Task Vectors Enable Many-Shot Multimodal In-Context Learning
par: Huang, Brandon, et autres
Publié: (2024)
par: Huang, Brandon, et autres
Publié: (2024)
Multilingual OCR-Aware Fine-Tuning and Prompt-Guided Chain-of-Thought Reasoning for Multimodal Large Language Models
par: Xu, Qinwu, et autres
Publié: (2026)
par: Xu, Qinwu, et autres
Publié: (2026)
Language-Pretraining-Induced Bias: A Strong Foundation for General Vision Tasks
par: Luo, Yaxin, et autres
Publié: (2026)
par: Luo, Yaxin, et autres
Publié: (2026)
Latent Action Pretraining from Videos
par: Ye, Seonghyeon, et autres
Publié: (2024)
par: Ye, Seonghyeon, et autres
Publié: (2024)
PaliGemma: A versatile 3B VLM for transfer
par: Beyer, Lucas, et autres
Publié: (2024)
par: Beyer, Lucas, et autres
Publié: (2024)
Documents similaires
-
A Practitioner's Guide to Continual Multimodal Pretraining
par: Roth, Karsten, et autres
Publié: (2024) -
Reflecting on the State of Rehearsal-free Continual Learning with Pretrained Models
par: Thede, Lukas, et autres
Publié: (2024) -
Fantastic Gains and Where to Find Them: On the Existence and Prospect of General Knowledge Transfer between Any Pretrained Model
par: Roth, Karsten, et autres
Publié: (2023) -
ETHER: Efficient Finetuning of Large-Scale Models with Hyperplane Reflections
par: Bini, Massimo, et autres
Publié: (2024) -
How to Merge Your Multimodal Models Over Time?
par: Dziadzio, Sebastian, et autres
Publié: (2024)