Babel-ImageNet: Massively Multilingual Evaluation of Vision-and-Language Representations
Fuente:
arXiv
Saved in:
| Main Authors: | Geigle, Gregor, Timofte, Radu, Glavaš, Goran |
|---|---|
| Format: | Preprint |
| Published: |
2023
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Does Object Grounding Really Reduce Hallucination of Large Vision-Language Models?
by: Geigle, Gregor, et al.
Published: (2024)
by: Geigle, Gregor, et al.
Published: (2024)
African or European Swallow? Benchmarking Large Vision-Language Models for Fine-Grained Object Classification
by: Geigle, Gregor, et al.
Published: (2024)
by: Geigle, Gregor, et al.
Published: (2024)
mBLIP: Efficient Bootstrapping of Multilingual Vision-LLMs
by: Geigle, Gregor, et al.
Published: (2023)
by: Geigle, Gregor, et al.
Published: (2023)
Centurio: On Drivers of Multilingual Ability of Large Vision-Language Model
by: Geigle, Gregor, et al.
Published: (2025)
by: Geigle, Gregor, et al.
Published: (2025)
InstructIR: High-Quality Image Restoration Following Human Instructions
by: Conde, Marcos V., et al.
Published: (2024)
by: Conde, Marcos V., et al.
Published: (2024)
Kaleidoscope: In-language Exams for Massively Multilingual Vision Evaluation
by: Salazar, Israfel, et al.
Published: (2025)
by: Salazar, Israfel, et al.
Published: (2025)
Flaws of ImageNet, Computer Vision's Favourite Dataset
by: Kisel, Nikita, et al.
Published: (2024)
by: Kisel, Nikita, et al.
Published: (2024)
Transfer Learning from ImageNet for MEG-Based Decoding of Imagined Speech
by: Jhilal, Soufiane, et al.
Published: (2026)
by: Jhilal, Soufiane, et al.
Published: (2026)
Speedrunning ImageNet Diffusion
by: Bhanded, Swayam
Published: (2025)
by: Bhanded, Swayam
Published: (2025)
FLEURS-ASL: Including American Sign Language in Massively Multilingual Multitask Evaluation
by: Tanzer, Garrett
Published: (2024)
by: Tanzer, Garrett
Published: (2024)
Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation
by: Wang, Xintong, et al.
Published: (2025)
by: Wang, Xintong, et al.
Published: (2025)
NeoBabel: A Multilingual Open Tower for Visual Generation
by: Derakhshani, Mohammad Mahdi, et al.
Published: (2025)
by: Derakhshani, Mohammad Mahdi, et al.
Published: (2025)
LLM as a Neural Architect: Controlled Generation of Image Captioning Models Under Strict API Contracts
by: Jesani, Krunal, et al.
Published: (2025)
by: Jesani, Krunal, et al.
Published: (2025)
Constructing Multilingual Visual-Text Datasets Revealing Visual Multilingual Ability of Vision Language Models
by: Atuhurra, Jesse, et al.
Published: (2024)
by: Atuhurra, Jesse, et al.
Published: (2024)
EXAMS-V: A Multi-Discipline Multilingual Multimodal Exam Benchmark for Evaluating Vision Language Models
by: Das, Rocktim Jyoti, et al.
Published: (2024)
by: Das, Rocktim Jyoti, et al.
Published: (2024)
Behind Maya: Building a Multilingual Vision Language Model
by: Alam, Nahid, et al.
Published: (2025)
by: Alam, Nahid, et al.
Published: (2025)
Self-Supervised ImageNet Representations for In Vivo Confocal Microscopy: Tortuosity Grading without Segmentation Maps
by: Ouan, Kim, et al.
Published: (2026)
by: Ouan, Kim, et al.
Published: (2026)
Beyond ImageNet: Understanding Cross-Dataset Robustness of Lightweight Vision Models
by: Zhang, Weidong, et al.
Published: (2025)
by: Zhang, Weidong, et al.
Published: (2025)
Fine-Grained ImageNet Classification in the Wild
by: Lymperaiou, Maria, et al.
Published: (2023)
by: Lymperaiou, Maria, et al.
Published: (2023)
How far can we go with ImageNet for Text-to-Image generation?
by: Degeorge, L., et al.
Published: (2025)
by: Degeorge, L., et al.
Published: (2025)
ImageNet-OOD: Deciphering Modern Out-of-Distribution Detection Algorithms
by: Yang, William, et al.
Published: (2023)
by: Yang, William, et al.
Published: (2023)
A U-Net and Transformer Pipeline for Multilingual Image Translation
by: Sahay, Siddharth, et al.
Published: (2025)
by: Sahay, Siddharth, et al.
Published: (2025)
e5-omni: Explicit Cross-modal Alignment for Omni-modal Embeddings
by: Chen, Haonan, et al.
Published: (2026)
by: Chen, Haonan, et al.
Published: (2026)
The Regularizing Power of Language-Training Deepfake Detectors
by: Hopf, Benedikt, et al.
Published: (2026)
by: Hopf, Benedikt, et al.
Published: (2026)
Closed-Loop LLM Discovery of Non-Standard Channel Priors in Vision Models
by: Uzun, Tolgay Atinc, et al.
Published: (2026)
by: Uzun, Tolgay Atinc, et al.
Published: (2026)
Infrared Object Detection with Ultra Small ConvNets: Is ImageNet Pretraining Still Useful?
by: Muralidharan, Srikanth, et al.
Published: (2025)
by: Muralidharan, Srikanth, et al.
Published: (2025)
TemMed-Bench: Evaluating Temporal Medical Image Reasoning in Vision-Language Models
by: Zhang, Junyi, et al.
Published: (2025)
by: Zhang, Junyi, et al.
Published: (2025)
What Makes ImageNet Look Unlike LAION
by: Shirali, Ali, et al.
Published: (2023)
by: Shirali, Ali, et al.
Published: (2023)
ImageNot: A contrast with ImageNet preserves model rankings
by: Salaudeen, Olawale, et al.
Published: (2024)
by: Salaudeen, Olawale, et al.
Published: (2024)
Practical Manipulation Model for Robust Deepfake Detection
by: Hopf, Benedikt, et al.
Published: (2025)
by: Hopf, Benedikt, et al.
Published: (2025)
CNN and ViT Efficiency Study on Tiny ImageNet and DermaMNIST Datasets
by: Amangeldi, Aidar, et al.
Published: (2025)
by: Amangeldi, Aidar, et al.
Published: (2025)
Geometry aware 3D generation from in-the-wild images in ImageNet
by: Shen, Qijia, et al.
Published: (2024)
by: Shen, Qijia, et al.
Published: (2024)
Accessing Vision Foundation Models via ImageNet-1K
by: Zhang, Yitian, et al.
Published: (2024)
by: Zhang, Yitian, et al.
Published: (2024)
MultiVENT 2.0: A Massive Multilingual Benchmark for Event-Centric Video Retrieval
by: Kriz, Reno, et al.
Published: (2024)
by: Kriz, Reno, et al.
Published: (2024)
Evaluating Vision-Language Models as Evaluators in Path Planning
by: Aghzal, Mohamed, et al.
Published: (2024)
by: Aghzal, Mohamed, et al.
Published: (2024)
Mitigating Multilingual Hallucination in Large Vision-Language Models
by: Qu, Xiaoye, et al.
Published: (2024)
by: Qu, Xiaoye, et al.
Published: (2024)
MVL-SIB: A Massively Multilingual Vision-Language Benchmark for Cross-Modal Topical Matching
by: Schmidt, Fabian David, et al.
Published: (2025)
by: Schmidt, Fabian David, et al.
Published: (2025)
MIEB: Massive Image Embedding Benchmark
by: Xiao, Chenghao, et al.
Published: (2025)
by: Xiao, Chenghao, et al.
Published: (2025)
G3DR: Generative 3D Reconstruction in ImageNet
by: Reddy, Pradyumna, et al.
Published: (2024)
by: Reddy, Pradyumna, et al.
Published: (2024)
ImageNet-Think-250K: A Large-Scale Synthetic Dataset for Multimodal Reasoning for Vision Language Models
by: Chitty-Venkata, Krishna Teja, et al.
Published: (2025)
by: Chitty-Venkata, Krishna Teja, et al.
Published: (2025)
Similar Items
-
Does Object Grounding Really Reduce Hallucination of Large Vision-Language Models?
by: Geigle, Gregor, et al.
Published: (2024) -
African or European Swallow? Benchmarking Large Vision-Language Models for Fine-Grained Object Classification
by: Geigle, Gregor, et al.
Published: (2024) -
mBLIP: Efficient Bootstrapping of Multilingual Vision-LLMs
by: Geigle, Gregor, et al.
Published: (2023) -
Centurio: On Drivers of Multilingual Ability of Large Vision-Language Model
by: Geigle, Gregor, et al.
Published: (2025) -
InstructIR: High-Quality Image Restoration Following Human Instructions
by: Conde, Marcos V., et al.
Published: (2024)