AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Mai, Zheda, Chowdhury, Arpita, Wang, Zihe, Jeon, Sooyoung, Wang, Lemeng, Hou, Jiacheng, Kil, Jihyung, Chao, Wei-Lun |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
MLLM-CompBench: A Comparative Reasoning Benchmark for Multimodal LLMs
por: Kil, Jihyung, et al.
Publicado: (2024)
por: Kil, Jihyung, et al.
Publicado: (2024)
Lessons and Open Questions from a Unified Study of Camera-Trap Species Recognition Over Time
por: Jeon, Sooyoung, et al.
Publicado: (2026)
por: Jeon, Sooyoung, et al.
Publicado: (2026)
Finer-CAM: Spotting the Difference Reveals Finer Details for Visual Explanation
por: Zhang, Ziheng, et al.
Publicado: (2025)
por: Zhang, Ziheng, et al.
Publicado: (2025)
A Study of Failure Modes in Two-Stage Human-Object Interaction Detection
por: Wang, Lemeng, et al.
Publicado: (2026)
por: Wang, Lemeng, et al.
Publicado: (2026)
Dual-View Visual Contextualization for Web Navigation
por: Kil, Jihyung, et al.
Publicado: (2024)
por: Kil, Jihyung, et al.
Publicado: (2024)
Revisiting semi-supervised learning in the era of foundation models
por: Zhang, Ping, et al.
Publicado: (2025)
por: Zhang, Ping, et al.
Publicado: (2025)
VisR-Bench: An Empirical Study on Visual Retrieval-Augmented Generation for Multilingual Long Document Understanding
por: Chen, Jian, et al.
Publicado: (2025)
por: Chen, Jian, et al.
Publicado: (2025)
Leveraging Sparse LiDAR for RAFT-Stereo: A Depth Pre-Fill Perspective
por: Yoo, Jinsu, et al.
Publicado: (2025)
por: Yoo, Jinsu, et al.
Publicado: (2025)
Lessons and Insights from a Unifying Study of Parameter-Efficient Fine-Tuning (PEFT) in Visual Recognition
por: Mai, Zheda, et al.
Publicado: (2024)
por: Mai, Zheda, et al.
Publicado: (2024)
II-MMR: Identifying and Improving Multi-modal Multi-hop Reasoning in Visual Question Answering
por: Kil, Jihyung, et al.
Publicado: (2024)
por: Kil, Jihyung, et al.
Publicado: (2024)
Prompt-CAM: Making Vision Transformers Interpretable for Fine-Grained Analysis
por: Chowdhury, Arpita, et al.
Publicado: (2025)
por: Chowdhury, Arpita, et al.
Publicado: (2025)
Revisiting Model Stitching In the Foundation Model Era
por: Mai, Zheda, et al.
Publicado: (2026)
por: Mai, Zheda, et al.
Publicado: (2026)
Fine-Tuning is Fine, if Calibrated
por: Mai, Zheda, et al.
Publicado: (2024)
por: Mai, Zheda, et al.
Publicado: (2024)
AVA-VLA: Improving Vision-Language-Action models with Active Visual Attention
por: Xiao, Lei, et al.
Publicado: (2025)
por: Xiao, Lei, et al.
Publicado: (2025)
MMDocBench: Benchmarking Large Vision-Language Models for Fine-Grained Visual Document Understanding
por: Zhu, Fengbin, et al.
Publicado: (2024)
por: Zhu, Fengbin, et al.
Publicado: (2024)
ArtiBench and ArtiBrain: Benchmarking Generalizable Vision-Language Articulated Object Manipulation
por: Wu, Yuhan, et al.
Publicado: (2025)
por: Wu, Yuhan, et al.
Publicado: (2025)
GPT-4V(ision) is a Generalist Web Agent, if Grounded
por: Zheng, Boyuan, et al.
Publicado: (2024)
por: Zheng, Boyuan, et al.
Publicado: (2024)
AVA: Towards Agentic Video Analytics with Vision Language Models
por: Yan, Yuxuan, et al.
Publicado: (2025)
por: Yan, Yuxuan, et al.
Publicado: (2025)
InfiniBench: Infinite Benchmarking for Visual Spatial Reasoning with Customizable Scene Complexity
por: Wang, Haoming, et al.
Publicado: (2025)
por: Wang, Haoming, et al.
Publicado: (2025)
Q-Bench: A Benchmark for General-Purpose Foundation Models on Low-level Vision
por: Wu, Haoning, et al.
Publicado: (2023)
por: Wu, Haoning, et al.
Publicado: (2023)
ReadBench: Measuring the Dense Text Visual Reading Ability of Vision-Language Models
por: Clavié, Benjamin, et al.
Publicado: (2025)
por: Clavié, Benjamin, et al.
Publicado: (2025)
Representation Shift: Unifying Token Compression with FlashAttention
por: Choi, Joonmyung, et al.
Publicado: (2025)
por: Choi, Joonmyung, et al.
Publicado: (2025)
RULER-Bench: Probing Rule-based Reasoning Abilities of Next-level Video Generation Models for Vision Foundation Intelligence
por: He, Xuming, et al.
Publicado: (2025)
por: He, Xuming, et al.
Publicado: (2025)
MLLM4TS: Leveraging Vision and Multimodal Language Models for General Time-Series Analysis
por: Liu, Qinghua, et al.
Publicado: (2025)
por: Liu, Qinghua, et al.
Publicado: (2025)
Transfer Your Perspective: Controllable 3D Generation from Any Viewpoint in a Driving Scene
por: Pan, Tai-Yu, et al.
Publicado: (2025)
por: Pan, Tai-Yu, et al.
Publicado: (2025)
On the Feasibility and Opportunity of Autoregressive 3D Object Detection
por: Huang, Zanming, et al.
Publicado: (2026)
por: Huang, Zanming, et al.
Publicado: (2026)
LocateBench: Evaluating the Locating Ability of Vision Language Models
por: Chiang, Ting-Rui, et al.
Publicado: (2024)
por: Chiang, Ting-Rui, et al.
Publicado: (2024)
Assessing the Visual Enumeration Abilities of Specialized Counting Architectures and Vision-Language Models
por: Hou, Kuinan, et al.
Publicado: (2025)
por: Hou, Kuinan, et al.
Publicado: (2025)
IllusionBench+: A Large-scale and Comprehensive Benchmark for Visual Illusion Understanding in Vision-Language Models
por: Zhang, Yiming, et al.
Publicado: (2025)
por: Zhang, Yiming, et al.
Publicado: (2025)
TB-AVA: Text as a Semantic Bridge for Audio-Visual Parameter Efficient Finetuning
por: Kim, Seongah, et al.
Publicado: (2026)
por: Kim, Seongah, et al.
Publicado: (2026)
CoSpace: Benchmarking Continuous Space Perception Ability for Vision-Language Models
por: Zhu, Yiqi, et al.
Publicado: (2025)
por: Zhu, Yiqi, et al.
Publicado: (2025)
CompareBench: A Benchmark for Visual Comparison Reasoning in Vision-Language Models
por: Cai, Jie, et al.
Publicado: (2025)
por: Cai, Jie, et al.
Publicado: (2025)
VGRP-Bench: Visual Grid Reasoning Puzzle Benchmark for Large Vision-Language Models
por: Ren, Yufan, et al.
Publicado: (2025)
por: Ren, Yufan, et al.
Publicado: (2025)
DocPrune:Efficient Document Question Answering via Background, Question, and Comprehension-aware Token Pruning
por: Choi, Joonmyung, et al.
Publicado: (2026)
por: Choi, Joonmyung, et al.
Publicado: (2026)
ViStoryBench: Comprehensive Benchmark Suite for Story Visualization
por: Zhuang, Cailin, et al.
Publicado: (2025)
por: Zhuang, Cailin, et al.
Publicado: (2025)
Forensics-Bench: A Comprehensive Forgery Detection Benchmark Suite for Large Vision Language Models
por: Wang, Jin, et al.
Publicado: (2025)
por: Wang, Jin, et al.
Publicado: (2025)
Cryo-Bench: Benchmarking Foundation Models for Cryosphere Applications
por: Kaushik, Saurabh, et al.
Publicado: (2026)
por: Kaushik, Saurabh, et al.
Publicado: (2026)
Medical Large Vision Language Models with Multi-Image Visual Ability
por: Yang, Xikai, et al.
Publicado: (2025)
por: Yang, Xikai, et al.
Publicado: (2025)
InverseMeetInsert: Robust Real Image Editing via Geometric Accumulation Inversion in Guided Diffusion Models
por: Zheng, Yan, et al.
Publicado: (2024)
por: Zheng, Yan, et al.
Publicado: (2024)
BioCAP: Exploiting Synthetic Captions Beyond Labels in Biological Foundation Models
por: Zhang, Ziheng, et al.
Publicado: (2025)
por: Zhang, Ziheng, et al.
Publicado: (2025)
Ejemplares similares
-
MLLM-CompBench: A Comparative Reasoning Benchmark for Multimodal LLMs
por: Kil, Jihyung, et al.
Publicado: (2024) -
Lessons and Open Questions from a Unified Study of Camera-Trap Species Recognition Over Time
por: Jeon, Sooyoung, et al.
Publicado: (2026) -
Finer-CAM: Spotting the Difference Reveals Finer Details for Visual Explanation
por: Zhang, Ziheng, et al.
Publicado: (2025) -
A Study of Failure Modes in Two-Stage Human-Object Interaction Detection
por: Wang, Lemeng, et al.
Publicado: (2026) -
Dual-View Visual Contextualization for Web Navigation
por: Kil, Jihyung, et al.
Publicado: (2024)