VAREX: A Benchmark for Multi-Modal Structured Extraction from Documents
Fuente:
arXiv
Guardado en:
| Autores principales: | Barzelay, Udi, Azulai, Ophir, Shapira, Inbar, Friedman, Idan, Dahood, Foad Abo, Lee, Madison, Daniels, Abraham |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
KVP10k : A Comprehensive Dataset for Key-Value Pair Extraction in Business Documents
por: Naparstek, Oshri, et al.
Publicado: (2024)
por: Naparstek, Oshri, et al.
Publicado: (2024)
Is the Modality Gap a Bug or a Feature? A Robustness Perspective
por: Chowers, Rhea, et al.
Publicado: (2026)
por: Chowers, Rhea, et al.
Publicado: (2026)
REAL-MM-RAG: A Real-World Multi-Modal Retrieval Benchmark
por: Wasserman, Navve, et al.
Publicado: (2025)
por: Wasserman, Navve, et al.
Publicado: (2025)
READoc: A Unified Benchmark for Realistic Document Structured Extraction
por: Li, Zichao, et al.
Publicado: (2024)
por: Li, Zichao, et al.
Publicado: (2024)
LaVPR: Benchmarking Language and Vision for Place Recognition
por: Idan, Ofer, et al.
Publicado: (2026)
por: Idan, Ofer, et al.
Publicado: (2026)
TUNI: Real-time RGB-T Semantic Segmentation with Unified Multi-Modal Feature Extraction and Cross-Modal Feature Fusion
por: Guo, Xiaodong, et al.
Publicado: (2025)
por: Guo, Xiaodong, et al.
Publicado: (2025)
Image2Struct: Benchmarking Structure Extraction for Vision-Language Models
por: Roberts, Josselin Somerville, et al.
Publicado: (2024)
por: Roberts, Josselin Somerville, et al.
Publicado: (2024)
Contrast-X: A Multi-Modal Contrast Image Synthesis Benchmark and Universal Modality Flow Matching
por: Chen, Yifan, et al.
Publicado: (2026)
por: Chen, Yifan, et al.
Publicado: (2026)
Multi-Modal Character Localization and Extraction for Chinese Text Recognition
por: Li, Qilong, et al.
Publicado: (2026)
por: Li, Qilong, et al.
Publicado: (2026)
MVPBench: A Multi-Video Perception Evaluation Benchmark for Multi-Modal Video Understanding
por: Bai, Purui, et al.
Publicado: (2026)
por: Bai, Purui, et al.
Publicado: (2026)
MMRel: Benchmarking Relation Understanding in Multi-Modal Large Language Models
por: Nie, Jiahao, et al.
Publicado: (2024)
por: Nie, Jiahao, et al.
Publicado: (2024)
MUVR: A Multi-Modal Untrimmed Video Retrieval Benchmark with Multi-Level Visual Correspondence
por: Feng, Yue, et al.
Publicado: (2025)
por: Feng, Yue, et al.
Publicado: (2025)
Col-Bandit: Zero-Shot Query-Time Pruning for Late-Interaction Retrieval
por: Pony, Roi, et al.
Publicado: (2026)
por: Pony, Roi, et al.
Publicado: (2026)
Modality-Agnostic Structural Image Representation Learning for Deformable Multi-Modality Medical Image Registration
por: Mok, Tony C. W., et al.
Publicado: (2024)
por: Mok, Tony C. W., et al.
Publicado: (2024)
BoxingVI: A Multi-Modal Benchmark for Boxing Action Recognition and Localization
por: Kumar, Rahul, et al.
Publicado: (2025)
por: Kumar, Rahul, et al.
Publicado: (2025)
Multi-Modal Interpretability for Enhanced Localization in Vision-Language Models
por: Imran, Muhammad, et al.
Publicado: (2025)
por: Imran, Muhammad, et al.
Publicado: (2025)
Financial Table Extraction in Image Documents
por: Watson, William, et al.
Publicado: (2024)
por: Watson, William, et al.
Publicado: (2024)
LiveXiv -- A Multi-Modal Live Benchmark Based on Arxiv Papers Content
por: Shabtay, Nimrod, et al.
Publicado: (2024)
por: Shabtay, Nimrod, et al.
Publicado: (2024)
Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark
por: Hao, Yunzhuo, et al.
Publicado: (2025)
por: Hao, Yunzhuo, et al.
Publicado: (2025)
When Pedestrian Detection Meets Multi-Modal Learning: Generalist Model and Benchmark Dataset
por: Zhang, Yi, et al.
Publicado: (2024)
por: Zhang, Yi, et al.
Publicado: (2024)
MTMMC: A Large-Scale Real-World Multi-Modal Camera Tracking Benchmark
por: Woo, Sanghyun, et al.
Publicado: (2024)
por: Woo, Sanghyun, et al.
Publicado: (2024)
All-weather Multi-Modality Image Fusion: Unified Framework and 100k Benchmark
por: Li, Xilai, et al.
Publicado: (2024)
por: Li, Xilai, et al.
Publicado: (2024)
Multi-Modal Building Change Detection for Large-Scale Small Changes: Benchmark and Baseline
por: Wang, Ye, et al.
Publicado: (2026)
por: Wang, Ye, et al.
Publicado: (2026)
Multi-Modal Video Feature Extraction for Popularity Prediction
por: Liu, Haixu, et al.
Publicado: (2025)
por: Liu, Haixu, et al.
Publicado: (2025)
LED Benchmark: Diagnosing Structural Layout Errors for Document Layout Analysis
por: Heo, Inbum, et al.
Publicado: (2025)
por: Heo, Inbum, et al.
Publicado: (2025)
Multi-Modal Guided Multi-Source Domain Adaptation for Object Detection
por: Lee, Sangin, et al.
Publicado: (2026)
por: Lee, Sangin, et al.
Publicado: (2026)
Multi-Modal and Multi-Resolution Data Fusion for High-Resolution Cloud Removal: A Novel Baseline and Benchmark
por: Xu, Fang, et al.
Publicado: (2023)
por: Xu, Fang, et al.
Publicado: (2023)
Exploring a Unified Vision-Centric Contrastive Alternatives on Multi-Modal Web Documents
por: Lin, Yiqi, et al.
Publicado: (2025)
por: Lin, Yiqi, et al.
Publicado: (2025)
AutoGUI-v2: A Comprehensive Multi-Modal GUI Functionality Understanding Benchmark
por: Li, Hongxin, et al.
Publicado: (2026)
por: Li, Hongxin, et al.
Publicado: (2026)
IMTBench: A Multi-Scenario Cross-Modal Collaborative Evaluation Benchmark for In-Image Machine Translation
por: Lyu, Jiahao, et al.
Publicado: (2026)
por: Lyu, Jiahao, et al.
Publicado: (2026)
Benchmarking Multi-modal Semantic Segmentation under Sensor Failures: Missing and Noisy Modality Robustness
por: Liao, Chenfei, et al.
Publicado: (2025)
por: Liao, Chenfei, et al.
Publicado: (2025)
Omnia de EgoTempo: Benchmarking Temporal Understanding of Multi-Modal LLMs in Egocentric Videos
por: Plizzari, Chiara, et al.
Publicado: (2025)
por: Plizzari, Chiara, et al.
Publicado: (2025)
Diffusion-Based Cross-Modal Feature Extraction for Multi-Label Classification
por: Lan, Tian, et al.
Publicado: (2025)
por: Lan, Tian, et al.
Publicado: (2025)
Towards Unified Benchmark and Models for Multi-Modal Perceptual Metrics
por: Ghazanfari, Sara, et al.
Publicado: (2024)
por: Ghazanfari, Sara, et al.
Publicado: (2024)
UNIKIE-BENCH: Benchmarking Large Multimodal Models for Key Information Extraction in Visual Documents
por: Ji, Yifan, et al.
Publicado: (2026)
por: Ji, Yifan, et al.
Publicado: (2026)
Few Shots Text to Image Retrieval: New Benchmarking Dataset and Optimization Methods
por: Idan, Ofer, et al.
Publicado: (2026)
por: Idan, Ofer, et al.
Publicado: (2026)
Benchmarking Document Parsers on Mathematical Formula Extraction from PDFs
por: Horn, Pius, et al.
Publicado: (2025)
por: Horn, Pius, et al.
Publicado: (2025)
ICD-Net: Inertial Covariance Displacement Network for Drone Visual-Inertial SLAM
por: Shapira, Tali Orlev, et al.
Publicado: (2025)
por: Shapira, Tali Orlev, et al.
Publicado: (2025)
Joint Extraction Matters: Prompt-Based Visual Question Answering for Multi-Field Document Information Extraction
por: Loem, Mengsay, et al.
Publicado: (2025)
por: Loem, Mengsay, et al.
Publicado: (2025)
Contrastive Sequential-Diffusion Learning: Non-linear and Multi-Scene Instructional Video Synthesis
por: Ramos, Vasco, et al.
Publicado: (2024)
por: Ramos, Vasco, et al.
Publicado: (2024)
Ejemplares similares
-
KVP10k : A Comprehensive Dataset for Key-Value Pair Extraction in Business Documents
por: Naparstek, Oshri, et al.
Publicado: (2024) -
Is the Modality Gap a Bug or a Feature? A Robustness Perspective
por: Chowers, Rhea, et al.
Publicado: (2026) -
REAL-MM-RAG: A Real-World Multi-Modal Retrieval Benchmark
por: Wasserman, Navve, et al.
Publicado: (2025) -
READoc: A Unified Benchmark for Realistic Document Structured Extraction
por: Li, Zichao, et al.
Publicado: (2024) -
LaVPR: Benchmarking Language and Vision for Place Recognition
por: Idan, Ofer, et al.
Publicado: (2026)