ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Roberts, Jonathan, Taesiri, Mohammad Reza, Sharma, Ansh, Gupta, Akash, Roberts, Samuel, Croitoru, Ioana, Bogolin, Simion-Vlad, Tang, Jialu, Langer, Florian, Raina, Vyas, Raina, Vatsal, Xiong, Hanyi, Udandarao, Vishaal, Lu, Jingyi, Chen, Shiyang, Purkis, Sam, Yan, Tianshuo, Lin, Wenye, Shin, Gyungin, Yang, Qiaochu, Nguyen, Anh Totti, Atkinson, David I., Baranwal, Aaditya, Coca, Alexandru, Dang, Mikah, Dziadzio, Sebastian, Kunz, Jakob D., Liang, Kaiqu, Lo, Alexander, Pulfer, Brian, Walton, Steven, Yang, Charig, Han, Kai, Albanie, Samuel |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ONEBench to Test Them All: Sample-Level Benchmarking Over Open-Ended Capabilities
par: Ghosh, Adhiraj, et autres
Publié: (2024)
par: Ghosh, Adhiraj, et autres
Publié: (2024)
How to Merge Your Multimodal Models Over Time?
par: Dziadzio, Sebastian, et autres
Publié: (2024)
par: Dziadzio, Sebastian, et autres
Publié: (2024)
A Good CREPE needs more than just Sugar: Investigating Biases in Compositional Vision-Language Benchmarks
par: Udandarao, Vishaal, et autres
Publié: (2025)
par: Udandarao, Vishaal, et autres
Publié: (2025)
A Sober Look at Progress in Language Model Reasoning: Pitfalls and Paths to Reproducibility
par: Hochlehnert, Andreas, et autres
Publié: (2025)
par: Hochlehnert, Andreas, et autres
Publié: (2025)
Efficient Lifelong Model Evaluation in an Era of Rapid Progress
par: Prabhu, Ameya, et autres
Publié: (2024)
par: Prabhu, Ameya, et autres
Publié: (2024)
A Practitioner's Guide to Continual Multimodal Pretraining
par: Roth, Karsten, et autres
Publié: (2024)
par: Roth, Karsten, et autres
Publié: (2024)
GAMEBoT: Transparent Assessment of LLM Reasoning in Games
par: Lin, Wenye, et autres
Publié: (2024)
par: Lin, Wenye, et autres
Publié: (2024)
How Long Is a Piece of String? A Brief Empirical Analysis of Tokenizers
par: Roberts, Jonathan, et autres
Publié: (2026)
par: Roberts, Jonathan, et autres
Publié: (2026)
Needle Threading: Can LLMs Follow Threads through Near-Million-Scale Haystacks?
par: Roberts, Jonathan, et autres
Publié: (2024)
par: Roberts, Jonathan, et autres
Publié: (2024)
GRAB: A Challenging GRaph Analysis Benchmark for Large Multimodal Models
par: Roberts, Jonathan, et autres
Publié: (2024)
par: Roberts, Jonathan, et autres
Publié: (2024)
No "Zero-Shot" Without Exponential Data: Pretraining Concept Frequency Determines Multimodal Model Performance
par: Udandarao, Vishaal, et autres
Publié: (2024)
par: Udandarao, Vishaal, et autres
Publié: (2024)
SciFIBench: Benchmarking Large Multimodal Models for Scientific Figure Interpretation
par: Roberts, Jonathan, et autres
Publié: (2024)
par: Roberts, Jonathan, et autres
Publié: (2024)
Active Data Curation Effectively Distills Large-Scale Multimodal Models
par: Udandarao, Vishaal, et autres
Publié: (2024)
par: Udandarao, Vishaal, et autres
Publié: (2024)
Charting New Territories: Exploring the Geographic and Geospatial Capabilities of Multimodal LLMs
par: Roberts, Jonathan, et autres
Publié: (2023)
par: Roberts, Jonathan, et autres
Publié: (2023)
Chapter 12 Kashmir’s Crafts Women
par: Raina, Neelam
Publié: (2024)
par: Raina, Neelam
Publié: (2024)
Logit Disagreement: OoD Detection with Bayesian Neural Networks
par: Raina, Kevin
Publié: (2025)
par: Raina, Kevin
Publié: (2025)
El mito político de la RDA
par: Raina Zimmering
Publié: (2001)
par: Raina Zimmering
Publié: (2001)
MEMORIAS E HISTORIOGRAFÍA EN TORNO AL DEBATE POR LA “VIOLENCIA POLÍTICA” EN LA ARGENTINA, 2003-2013
par: Andrea Raina
Publié: (2016)
par: Andrea Raina
Publié: (2016)
B-score: Detecting biases in large language models using response history
par: Vo, An, et autres
Publié: (2025)
par: Vo, An, et autres
Publié: (2025)
Environmental microbiology // Raina M. Maier, Ian L. Pepper, Charles P. Gerba
par: Maier, Raina M
Publié: (2009)
par: Maier, Raina M
Publié: (2009)
“Transgender Marginalization and Exclusion”: A Study of Arundhati Roy’s The Ministry of Utmost Happiness
par: Javeed Ahmad Raina
Publié: (2017)
par: Javeed Ahmad Raina
Publié: (2017)
Implicación de los valores éticos y morales en el enfrentamiento de las adicciones en jóvenes
par: Daniel Gutierrez Raina
Publié: (2008)
par: Daniel Gutierrez Raina
Publié: (2008)
anguyen8/vision-llms-are-blind: official
par: Pooyan R, et autres
Publié: (2026)
par: Pooyan R, et autres
Publié: (2026)
Vision language models are blind: Failing to translate detailed visual features into words
par: Rahmanzadehgervi, Pooyan, et autres
Publié: (2024)
par: Rahmanzadehgervi, Pooyan, et autres
Publié: (2024)
PCNN: Probable-Class Nearest-Neighbor Explanations Improve Fine-Grained Image Classification Accuracy for AIs and Humans
par: Giang, et autres
Publié: (2023)
par: Giang, et autres
Publié: (2023)
Knock, Knock. Who's There? On the Security of LG's Knock Codes
par: Samuel, Raina, et autres
Publié: (2020)
par: Samuel, Raina, et autres
Publié: (2020)
Question-Based Retrieval using Atomic Units for Enterprise RAG
par: Raina, Vatsal, et autres
Publié: (2024)
par: Raina, Vatsal, et autres
Publié: (2024)
Decoding Quantum LDPC Codes using Collaborative Check Node Removal
par: Bhattacharyya, Mainak, et autres
Publié: (2025)
par: Bhattacharyya, Mainak, et autres
Publié: (2025)
A Provably Secure Framework for Noise-Aware Delegated Quantum Computation and Storage
par: Gupta, Sanidhya, et autres
Publié: (2024)
par: Gupta, Sanidhya, et autres
Publié: (2024)
Question Difficulty Ranking for Multiple-Choice Reading Comprehension
par: Raina, Vatsal, et autres
Publié: (2024)
par: Raina, Vatsal, et autres
Publié: (2024)
Out-of-Distribution Detection from Small Training Sets using Bayesian Neural Network Classifiers
par: Raina, Kevin, et autres
Publié: (2025)
par: Raina, Kevin, et autres
Publié: (2025)
Controlling Whisper: Universal Acoustic Adversarial Attacks to Control Speech Foundation Models
par: Raina, Vyas, et autres
Publié: (2024)
par: Raina, Vyas, et autres
Publié: (2024)
Design Considerations Based on Stability for a Class of TCP Algorithms
par: Prabhakar, Sreekanth, et autres
Publié: (2025)
par: Prabhakar, Sreekanth, et autres
Publié: (2025)
Quantum Approximation Optimization Algorithm for the Trellis based Viterbi Decoding of Classical Error Correcting Codes
par: Bhattacharyya, Mainak, et autres
Publié: (2023)
par: Bhattacharyya, Mainak, et autres
Publié: (2023)
SyncNet: correlating objective for time delay estimation in audio signals
par: Raina, Akshay, et autres
Publié: (2022)
par: Raina, Akshay, et autres
Publié: (2022)
Pulse Shaping for Superconducting Qubits
par: Patra, Animesh, et autres
Publié: (2026)
par: Patra, Animesh, et autres
Publié: (2026)
Fault-tolerance of the [[8,1,3]] non-CSS code
par: Maheshwari, Pranav, et autres
Publié: (2024)
par: Maheshwari, Pranav, et autres
Publié: (2024)
Soft Contextualized Encoder For User Defined Text Classification
par: Maheshwari, Charu, et autres
Publié: (2026)
par: Maheshwari, Charu, et autres
Publié: (2026)
A Physics‐Informed Neural Network Framework for Tumor‐Immune Interactions, Metastatic Invasion, and Haptotaxis Systems
par: Aayushman Raina, et autres
Publié: (2025)
par: Aayushman Raina, et autres
Publié: (2025)
Florence Nightingale, la vigencia de un legado
par: Daniel Ernesto Gutiérrez Raina
Publié: (2021)
par: Daniel Ernesto Gutiérrez Raina
Publié: (2021)
Documents similaires
-
ONEBench to Test Them All: Sample-Level Benchmarking Over Open-Ended Capabilities
par: Ghosh, Adhiraj, et autres
Publié: (2024) -
How to Merge Your Multimodal Models Over Time?
par: Dziadzio, Sebastian, et autres
Publié: (2024) -
A Good CREPE needs more than just Sugar: Investigating Biases in Compositional Vision-Language Benchmarks
par: Udandarao, Vishaal, et autres
Publié: (2025) -
A Sober Look at Progress in Language Model Reasoning: Pitfalls and Paths to Reproducibility
par: Hochlehnert, Andreas, et autres
Publié: (2025) -
Efficient Lifelong Model Evaluation in an Era of Rapid Progress
par: Prabhu, Ameya, et autres
Publié: (2024)