No "Zero-Shot" Without Exponential Data: Pretraining Concept Frequency Determines Multimodal Model Performance
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Udandarao, Vishaal, Prabhu, Ameya, Ghosh, Adhiraj, Sharma, Yash, Torr, Philip H. S., Bibi, Adel, Albanie, Samuel, Bethge, Matthias |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Efficient Lifelong Model Evaluation in an Era of Rapid Progress
par: Prabhu, Ameya, et autres
Publié: (2024)
par: Prabhu, Ameya, et autres
Publié: (2024)
ONEBench to Test Them All: Sample-Level Benchmarking Over Open-Ended Capabilities
par: Ghosh, Adhiraj, et autres
Publié: (2024)
par: Ghosh, Adhiraj, et autres
Publié: (2024)
How to Merge Your Multimodal Models Over Time?
par: Dziadzio, Sebastian, et autres
Publié: (2024)
par: Dziadzio, Sebastian, et autres
Publié: (2024)
A Sober Look at Progress in Language Model Reasoning: Pitfalls and Paths to Reproducibility
par: Hochlehnert, Andreas, et autres
Publié: (2025)
par: Hochlehnert, Andreas, et autres
Publié: (2025)
A Practitioner's Guide to Continual Multimodal Pretraining
par: Roth, Karsten, et autres
Publié: (2024)
par: Roth, Karsten, et autres
Publié: (2024)
Solving Spatial Supersensing Without Spatial Supersensing
par: Udandarao, Vishaal, et autres
Publié: (2025)
par: Udandarao, Vishaal, et autres
Publié: (2025)
CiteME: Can Language Models Accurately Cite Scientific Claims?
par: Press, Ori, et autres
Publié: (2024)
par: Press, Ori, et autres
Publié: (2024)
Concept-Aware Batch Sampling Improves Language-Image Pretraining
par: Ghosh, Adhiraj, et autres
Publié: (2025)
par: Ghosh, Adhiraj, et autres
Publié: (2025)
A Good CREPE needs more than just Sugar: Investigating Biases in Compositional Vision-Language Benchmarks
par: Udandarao, Vishaal, et autres
Publié: (2025)
par: Udandarao, Vishaal, et autres
Publié: (2025)
Pretraining Frequency Predicts Compositional Generalization of CLIP on Real-World Tasks
par: Wiedemer, Thaddäus, et autres
Publié: (2025)
par: Wiedemer, Thaddäus, et autres
Publié: (2025)
Round-Trip Translation Reveals What Frontier Multilingual Benchmarks Miss
par: Skorobogat, Ronald, et autres
Publié: (2026)
par: Skorobogat, Ronald, et autres
Publié: (2026)
Mapping Post-Training Forgetting in Language Models at Scale
par: Harmon, Jackson, et autres
Publié: (2025)
par: Harmon, Jackson, et autres
Publié: (2025)
Wu's Method can Boost Symbolic AI to Rival Silver Medalists and AlphaGeometry to Outperform Gold Medalists at IMO Geometry
par: Sinha, Shiven, et autres
Publié: (2024)
par: Sinha, Shiven, et autres
Publié: (2024)
Active Data Curation Effectively Distills Large-Scale Multimodal Models
par: Udandarao, Vishaal, et autres
Publié: (2024)
par: Udandarao, Vishaal, et autres
Publié: (2024)
Are We Done with Object-Centric Learning?
par: Rubinstein, Alexander, et autres
Publié: (2025)
par: Rubinstein, Alexander, et autres
Publié: (2025)
LLM generation novelty through the lens of semantic similarity
par: Davydov, Philipp, et autres
Publié: (2025)
par: Davydov, Philipp, et autres
Publié: (2025)
When Do Prompting and Prefix-Tuning Work? A Theory of Capabilities and Limitations
par: Petrov, Aleksandar, et autres
Publié: (2023)
par: Petrov, Aleksandar, et autres
Publié: (2023)
Personalizing Text-to-Image Generation to Individual Taste
par: Maerten, Anne-Sofie, et autres
Publié: (2026)
par: Maerten, Anne-Sofie, et autres
Publié: (2026)
Investigating Continual Pretraining in Large Language Models: Insights and Implications
par: Yıldız, Çağatay, et autres
Publié: (2024)
par: Yıldız, Çağatay, et autres
Publié: (2024)
On Pretraining Data Diversity for Self-Supervised Learning
par: Hammoud, Hasan Abed Al Kader, et autres
Publié: (2024)
par: Hammoud, Hasan Abed Al Kader, et autres
Publié: (2024)
Zero-Shot Visual Concept Blending Without Text Guidance
par: Makino, Hiroya, et autres
Publié: (2025)
par: Makino, Hiroya, et autres
Publié: (2025)
GRAB: A Challenging GRaph Analysis Benchmark for Large Multimodal Models
par: Roberts, Jonathan, et autres
Publié: (2024)
par: Roberts, Jonathan, et autres
Publié: (2024)
VGGSounder: Audio-Visual Evaluations for Foundation Models
par: Zverev, Daniil, et autres
Publié: (2025)
par: Zverev, Daniil, et autres
Publié: (2025)
Bi-Factorial Preference Optimization: Balancing Safety-Helpfulness in Language Models
par: Zhang, Wenxuan, et autres
Publié: (2024)
par: Zhang, Wenxuan, et autres
Publié: (2024)
On the Coexistence and Ensembling of Watermarks
par: Petrov, Aleksandar, et autres
Publié: (2025)
par: Petrov, Aleksandar, et autres
Publié: (2025)
Prompting a Pretrained Transformer Can Be a Universal Approximator
par: Petrov, Aleksandar, et autres
Publié: (2024)
par: Petrov, Aleksandar, et autres
Publié: (2024)
Data-Centric Lessons To Improve Speech-Language Pretraining
par: Udandarao, Vishaal, et autres
Publié: (2025)
par: Udandarao, Vishaal, et autres
Publié: (2025)
Corrective Machine Unlearning
par: Goel, Shashwat, et autres
Publié: (2024)
par: Goel, Shashwat, et autres
Publié: (2024)
SciFIBench: Benchmarking Large Multimodal Models for Scientific Figure Interpretation
par: Roberts, Jonathan, et autres
Publié: (2024)
par: Roberts, Jonathan, et autres
Publié: (2024)
ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models
par: Roberts, Jonathan, et autres
Publié: (2025)
par: Roberts, Jonathan, et autres
Publié: (2025)
Do as I do (Safely): Mitigating Task-Specific Fine-tuning Risks in Large Language Models
par: Eiras, Francisco, et autres
Publié: (2024)
par: Eiras, Francisco, et autres
Publié: (2024)
How Long Is a Piece of String? A Brief Empirical Analysis of Tokenizers
par: Roberts, Jonathan, et autres
Publié: (2026)
par: Roberts, Jonathan, et autres
Publié: (2026)
Needle Threading: Can LLMs Follow Threads through Near-Million-Scale Haystacks?
par: Roberts, Jonathan, et autres
Publié: (2024)
par: Roberts, Jonathan, et autres
Publié: (2024)
Segment, Select, Correct: A Framework for Weakly-Supervised Referring Segmentation
par: Eiras, Francisco, et autres
Publié: (2023)
par: Eiras, Francisco, et autres
Publié: (2023)
Universal In-Context Approximation By Prompting Fully Recurrent Models
par: Petrov, Aleksandar, et autres
Publié: (2024)
par: Petrov, Aleksandar, et autres
Publié: (2024)
Reflecting on the State of Rehearsal-free Continual Learning with Pretrained Models
par: Thede, Lukas, et autres
Publié: (2024)
par: Thede, Lukas, et autres
Publié: (2024)
PairAlign: A Framework for Sequence Tokenization via Self-Alignment with Applications to Audio Tokenization
par: Banerjee, Adhiraj, et autres
Publié: (2026)
par: Banerjee, Adhiraj, et autres
Publié: (2026)
Object segmentation from common fate: Motion energy processing enables human-like zero-shot generalization to random dot stimuli
par: Tangemann, Matthias, et autres
Publié: (2024)
par: Tangemann, Matthias, et autres
Publié: (2024)
Random Representations Outperform Online Continually Learned Representations
par: Prabhu, Ameya, et autres
Publié: (2024)
par: Prabhu, Ameya, et autres
Publié: (2024)
Great Models Think Alike and this Undermines AI Oversight
par: Goel, Shashwat, et autres
Publié: (2025)
par: Goel, Shashwat, et autres
Publié: (2025)
Documents similaires
-
Efficient Lifelong Model Evaluation in an Era of Rapid Progress
par: Prabhu, Ameya, et autres
Publié: (2024) -
ONEBench to Test Them All: Sample-Level Benchmarking Over Open-Ended Capabilities
par: Ghosh, Adhiraj, et autres
Publié: (2024) -
How to Merge Your Multimodal Models Over Time?
par: Dziadzio, Sebastian, et autres
Publié: (2024) -
A Sober Look at Progress in Language Model Reasoning: Pitfalls and Paths to Reproducibility
par: Hochlehnert, Andreas, et autres
Publié: (2025) -
A Practitioner's Guide to Continual Multimodal Pretraining
par: Roth, Karsten, et autres
Publié: (2024)