Concept-Aware Batch Sampling Improves Language-Image Pretraining
Fuente:
arXiv
Salvato in:
| Autori principali: | Ghosh, Adhiraj, Udandarao, Vishaal, Nguyen, Thao, Farina, Matteo, Cherti, Mehdi, Jitsev, Jenia, Oh, Sewoong, Ricci, Elisa, Schmidt, Ludwig, Bethge, Matthias |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
A Good CREPE needs more than just Sugar: Investigating Biases in Compositional Vision-Language Benchmarks
di: Udandarao, Vishaal, et al.
Pubblicazione: (2025)
di: Udandarao, Vishaal, et al.
Pubblicazione: (2025)
ONEBench to Test Them All: Sample-Level Benchmarking Over Open-Ended Capabilities
di: Ghosh, Adhiraj, et al.
Pubblicazione: (2024)
di: Ghosh, Adhiraj, et al.
Pubblicazione: (2024)
No "Zero-Shot" Without Exponential Data: Pretraining Concept Frequency Determines Multimodal Model Performance
di: Udandarao, Vishaal, et al.
Pubblicazione: (2024)
di: Udandarao, Vishaal, et al.
Pubblicazione: (2024)
A Practitioner's Guide to Continual Multimodal Pretraining
di: Roth, Karsten, et al.
Pubblicazione: (2024)
di: Roth, Karsten, et al.
Pubblicazione: (2024)
Alice in Wonderland: Simple Tasks Showing Complete Reasoning Breakdown in State-Of-the-Art Large Language Models
di: Nezhurina, Marianna, et al.
Pubblicazione: (2024)
di: Nezhurina, Marianna, et al.
Pubblicazione: (2024)
Reproducible scaling laws for contrastive language-image learning
di: Cherti, Mehdi, et al.
Pubblicazione: (2022)
di: Cherti, Mehdi, et al.
Pubblicazione: (2022)
Scaling Laws for Robust Comparison of Open Foundation Language-Vision Models and Datasets
di: Nezhurina, Marianna, et al.
Pubblicazione: (2025)
di: Nezhurina, Marianna, et al.
Pubblicazione: (2025)
Inverse Deep Learning Ray Tracing for Heliostat Surface Prediction
di: Lewen, Jan, et al.
Pubblicazione: (2024)
di: Lewen, Jan, et al.
Pubblicazione: (2024)
Scalable heliostat surface predictions from focal spots: Sim-to-Real transfer of inverse Deep Learning Raytracing
di: Lewen, Jan, et al.
Pubblicazione: (2025)
di: Lewen, Jan, et al.
Pubblicazione: (2025)
A Sober Look at Progress in Language Model Reasoning: Pitfalls and Paths to Reproducibility
di: Hochlehnert, Andreas, et al.
Pubblicazione: (2025)
di: Hochlehnert, Andreas, et al.
Pubblicazione: (2025)
Solving Spatial Supersensing Without Spatial Supersensing
di: Udandarao, Vishaal, et al.
Pubblicazione: (2025)
di: Udandarao, Vishaal, et al.
Pubblicazione: (2025)
Efficient Lifelong Model Evaluation in an Era of Rapid Progress
di: Prabhu, Ameya, et al.
Pubblicazione: (2024)
di: Prabhu, Ameya, et al.
Pubblicazione: (2024)
CiteME: Can Language Models Accurately Cite Scientific Claims?
di: Press, Ori, et al.
Pubblicazione: (2024)
di: Press, Ori, et al.
Pubblicazione: (2024)
Resolving Discrepancies in Compute-Optimal Scaling of Language Models
di: Porian, Tomer, et al.
Pubblicazione: (2024)
di: Porian, Tomer, et al.
Pubblicazione: (2024)
How to Merge Your Multimodal Models Over Time?
di: Dziadzio, Sebastian, et al.
Pubblicazione: (2024)
di: Dziadzio, Sebastian, et al.
Pubblicazione: (2024)
Project Alexandria: Towards Freeing Scientific Knowledge from Copyright Burdens via LLMs
di: Schuhmann, Christoph, et al.
Pubblicazione: (2025)
di: Schuhmann, Christoph, et al.
Pubblicazione: (2025)
Recycling the Web: A Method to Enhance Pre-training Data Quality and Quantity for Language Models
di: Nguyen, Thao, et al.
Pubblicazione: (2025)
di: Nguyen, Thao, et al.
Pubblicazione: (2025)
Better Alignment with Instruction Back-and-Forth Translation
di: Nguyen, Thao, et al.
Pubblicazione: (2024)
di: Nguyen, Thao, et al.
Pubblicazione: (2024)
Game Reasoning Arena: A Framework and Benchmark for Assessing Reasoning Capabilities of Large Language Models via Game Play
di: Cipolina-Kun, Lucia, et al.
Pubblicazione: (2025)
di: Cipolina-Kun, Lucia, et al.
Pubblicazione: (2025)
AudioToolAgent: An Agentic Framework for Audio-Language Models
di: Wijngaard, Gijs, et al.
Pubblicazione: (2025)
di: Wijngaard, Gijs, et al.
Pubblicazione: (2025)
Multilingual Diversity Improves Vision-Language Representations
di: Nguyen, Thao, et al.
Pubblicazione: (2024)
di: Nguyen, Thao, et al.
Pubblicazione: (2024)
Improving Performance, Robustness, and Fairness of Radiographic AI Models with Finely-Controllable Synthetic Data
di: Moroianu, Stefania L., et al.
Pubblicazione: (2025)
di: Moroianu, Stefania L., et al.
Pubblicazione: (2025)
LLM generation novelty through the lens of semantic similarity
di: Davydov, Philipp, et al.
Pubblicazione: (2025)
di: Davydov, Philipp, et al.
Pubblicazione: (2025)
Data-Centric Lessons To Improve Speech-Language Pretraining
di: Udandarao, Vishaal, et al.
Pubblicazione: (2025)
di: Udandarao, Vishaal, et al.
Pubblicazione: (2025)
Rethinking Few-Shot Adaptation of Vision-Language Models in Two Stages
di: Farina, Matteo, et al.
Pubblicazione: (2025)
di: Farina, Matteo, et al.
Pubblicazione: (2025)
Linear Model Merging Unlocks Simple and Scalable Multimodal Data Mixture Optimization
di: Berasi, Davide, et al.
Pubblicazione: (2026)
di: Berasi, Davide, et al.
Pubblicazione: (2026)
Paradoxes of Social Capital
di: Cherti, Myriam
Pubblicazione: (2010)
di: Cherti, Myriam
Pubblicazione: (2010)
Portfolio Optimization Proxies under Label Scarcity and Regime Shifts via Bayesian and Deterministic Students under Semi-Supervised Sandwich Training
di: Chattopadhyay, Adhiraj
Pubblicazione: (2026)
di: Chattopadhyay, Adhiraj
Pubblicazione: (2026)
Equivariance by Contrast: Identifiable Equivariant Embeddings from Unlabeled Finite Group Actions
di: Schmidt, Tobias, et al.
Pubblicazione: (2025)
di: Schmidt, Tobias, et al.
Pubblicazione: (2025)
Pretraining Frequency Predicts Compositional Generalization of CLIP on Real-World Tasks
di: Wiedemer, Thaddäus, et al.
Pubblicazione: (2025)
di: Wiedemer, Thaddäus, et al.
Pubblicazione: (2025)
Sampling from Your Language Model One Byte at a Time
di: Hayase, Jonathan, et al.
Pubblicazione: (2025)
di: Hayase, Jonathan, et al.
Pubblicazione: (2025)
Large Multimodal Models as General In-Context Classifiers
di: Garosi, Marco, et al.
Pubblicazione: (2026)
di: Garosi, Marco, et al.
Pubblicazione: (2026)
Not Only Text: Exploring Compositionality of Visual Representations in Vision-Language Models
di: Berasi, Davide, et al.
Pubblicazione: (2025)
di: Berasi, Davide, et al.
Pubblicazione: (2025)
Frustratingly Easy Test-Time Adaptation of Vision-Language Models
di: Farina, Matteo, et al.
Pubblicazione: (2024)
di: Farina, Matteo, et al.
Pubblicazione: (2024)
Reflecting on the State of Rehearsal-free Continual Learning with Pretrained Models
di: Thede, Lukas, et al.
Pubblicazione: (2024)
di: Thede, Lukas, et al.
Pubblicazione: (2024)
Investigating Continual Pretraining in Large Language Models: Insights and Implications
di: Yıldız, Çağatay, et al.
Pubblicazione: (2024)
di: Yıldız, Çağatay, et al.
Pubblicazione: (2024)
Learning in Compact Spaces with Approximately Normalized Transformer
di: Franke, Jörg K. H., et al.
Pubblicazione: (2025)
di: Franke, Jörg K. H., et al.
Pubblicazione: (2025)
PairAlign: A Framework for Sequence Tokenization via Self-Alignment with Applications to Audio Tokenization
di: Banerjee, Adhiraj, et al.
Pubblicazione: (2026)
di: Banerjee, Adhiraj, et al.
Pubblicazione: (2026)
Dissipative relativistic fluid flow: A simple Lorentz invariant causal model capturing entropy shocks in its zero viscosity limit
di: Reintjes, Moritz, et al.
Pubblicazione: (2024)
di: Reintjes, Moritz, et al.
Pubblicazione: (2024)
CodecSep: Prompt-Driven Universal Sound Separation on Neural Audio Codec Latents
di: Banerjee, Adhiraj, et al.
Pubblicazione: (2025)
di: Banerjee, Adhiraj, et al.
Pubblicazione: (2025)
Documenti analoghi
-
A Good CREPE needs more than just Sugar: Investigating Biases in Compositional Vision-Language Benchmarks
di: Udandarao, Vishaal, et al.
Pubblicazione: (2025) -
ONEBench to Test Them All: Sample-Level Benchmarking Over Open-Ended Capabilities
di: Ghosh, Adhiraj, et al.
Pubblicazione: (2024) -
No "Zero-Shot" Without Exponential Data: Pretraining Concept Frequency Determines Multimodal Model Performance
di: Udandarao, Vishaal, et al.
Pubblicazione: (2024) -
A Practitioner's Guide to Continual Multimodal Pretraining
di: Roth, Karsten, et al.
Pubblicazione: (2024) -
Alice in Wonderland: Simple Tasks Showing Complete Reasoning Breakdown in State-Of-the-Art Large Language Models
di: Nezhurina, Marianna, et al.
Pubblicazione: (2024)