UNIKIE-BENCH: Benchmarking Large Multimodal Models for Key Information Extraction in Visual Documents
Fuente:
arXiv
Salvato in:
| Autori principali: | Ji, Yifan, Xu, Zhipeng, Liu, Zhenghao, Chen, Zulong, Zhang, Qian, Yang, Zhibo, Lin, Junyang, Gu, Yu, Yu, Ge, Sun, Maosong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
CC-OCR V2: Benchmarking Large Multimodal Models for Literacy in Real-world Document Processing
di: Xu, Zhipeng, et al.
Pubblicazione: (2026)
di: Xu, Zhipeng, et al.
Pubblicazione: (2026)
Layout-Aware Parsing Meets Efficient LLMs: A Unified, Scalable Framework for Resume Information Extraction and Evaluation
di: Zhu, Fanwei, et al.
Pubblicazione: (2025)
di: Zhu, Fanwei, et al.
Pubblicazione: (2025)
Long-Chain Reasoning Distillation via Adaptive Prefix Alignment
di: Liu, Zhenghao, et al.
Pubblicazione: (2026)
di: Liu, Zhenghao, et al.
Pubblicazione: (2026)
Mixture-of-Retrieval Experts for Reasoning-Guided Multimodal Knowledge Exploitation
di: Peng, Chunyi, et al.
Pubblicazione: (2025)
di: Peng, Chunyi, et al.
Pubblicazione: (2025)
Lang2Act: Fine-Grained Visual Reasoning through Self-Emergent Linguistic Toolchains
di: Xiong, Yuqi, et al.
Pubblicazione: (2026)
di: Xiong, Yuqi, et al.
Pubblicazione: (2026)
UNIDOC-BENCH: A Unified Benchmark for Document-Centric Multimodal RAG
di: Peng, Xiangyu, et al.
Pubblicazione: (2025)
di: Peng, Xiangyu, et al.
Pubblicazione: (2025)
ReAlign: Optimizing the Visual Document Retriever with Reasoning-Guided Fine-Grained Alignment
di: Yang, Hao, et al.
Pubblicazione: (2026)
di: Yang, Hao, et al.
Pubblicazione: (2026)
U2-BENCH: Benchmarking Large Vision-Language Models on Ultrasound Understanding
di: Le, Anjie, et al.
Pubblicazione: (2025)
di: Le, Anjie, et al.
Pubblicazione: (2025)
Multi-domain Multi-modal Document Classification Benchmark with a Multi-level Taxonomy
di: Ma, Denghao, et al.
Pubblicazione: (2026)
di: Ma, Denghao, et al.
Pubblicazione: (2026)
Empirical Analysis of Decoding Biases in Masked Diffusion Models
di: Huang, Pengcheng, et al.
Pubblicazione: (2025)
di: Huang, Pengcheng, et al.
Pubblicazione: (2025)
Mitigating Judgment Preference Bias in Large Language Models through Group-Based Polling
di: Liu, Shuliang, et al.
Pubblicazione: (2025)
di: Liu, Shuliang, et al.
Pubblicazione: (2025)
DI-BENCH: Benchmarking Large Language Models on Dependency Inference with Testable Repositories at Scale
di: Zhang, Linghao, et al.
Pubblicazione: (2025)
di: Zhang, Linghao, et al.
Pubblicazione: (2025)
MetaMem: Evolving Meta-Memory for Knowledge Utilization through Self-Reflective Symbolic Optimization
di: Xin, Haidong, et al.
Pubblicazione: (2026)
di: Xin, Haidong, et al.
Pubblicazione: (2026)
STEER-BENCH: A Benchmark for Evaluating the Steerability of Large Language Models
di: Chen, Kai, et al.
Pubblicazione: (2025)
di: Chen, Kai, et al.
Pubblicazione: (2025)
Learning Refined Document Representations for Dense Retrieval via Deliberate Thinking
di: Ji, Yifan, et al.
Pubblicazione: (2025)
di: Ji, Yifan, et al.
Pubblicazione: (2025)
GSR-BENCH: A Benchmark for Grounded Spatial Reasoning Evaluation via Multimodal LLMs
di: Rajabi, Navid, et al.
Pubblicazione: (2024)
di: Rajabi, Navid, et al.
Pubblicazione: (2024)
VisRAG 2.0: Evidence-Guided Multi-Image Reasoning in Visual Retrieval-Augmented Generation
di: Sun, Yubo, et al.
Pubblicazione: (2025)
di: Sun, Yubo, et al.
Pubblicazione: (2025)
Enhancing Long-Chain Reasoning Distillation through Error-Aware Self-Reflection
di: Wu, Zhuoyang, et al.
Pubblicazione: (2025)
di: Wu, Zhuoyang, et al.
Pubblicazione: (2025)
CODIS: Benchmarking Context-Dependent Visual Comprehension for Multimodal Large Language Models
di: Luo, Fuwen, et al.
Pubblicazione: (2024)
di: Luo, Fuwen, et al.
Pubblicazione: (2024)
Judge as A Judge: Improving the Evaluation of Retrieval-Augmented Generation through the Judge-Consistency of Large Language Models
di: Liu, Shuliang, et al.
Pubblicazione: (2025)
di: Liu, Shuliang, et al.
Pubblicazione: (2025)
DOCFORGE-BENCH: A Comprehensive 0-shot Benchmark for Document Forgery Detection and Analysis
di: Zhao, Zengqi, et al.
Pubblicazione: (2026)
di: Zhao, Zengqi, et al.
Pubblicazione: (2026)
DocThinker: Explainable Multimodal Large Language Models with Rule-based Reinforcement Learning for Document Understanding
di: Yu, Wenwen, et al.
Pubblicazione: (2025)
di: Yu, Wenwen, et al.
Pubblicazione: (2025)
ReasonBENCH: Benchmarking the (In)Stability of LLM Reasoning
di: Potamitis, Nearchos, et al.
Pubblicazione: (2025)
di: Potamitis, Nearchos, et al.
Pubblicazione: (2025)
Chunks as Arms: Multi-Armed Bandit-Guided Sampling for Long-Context LLM Preference Optimization
di: Duan, Shaohua, et al.
Pubblicazione: (2025)
di: Duan, Shaohua, et al.
Pubblicazione: (2025)
KIEval: Evaluation Metric for Document Key Information Extraction
di: Khang, Minsoo, et al.
Pubblicazione: (2025)
di: Khang, Minsoo, et al.
Pubblicazione: (2025)
VisualAgentBench: Towards Large Multimodal Models as Visual Foundation Agents
di: Liu, Xiao, et al.
Pubblicazione: (2024)
di: Liu, Xiao, et al.
Pubblicazione: (2024)
HIP: Hierarchical Point Modeling and Pre-training for Visual Information Extraction
di: Long, Rujiao, et al.
Pubblicazione: (2024)
di: Long, Rujiao, et al.
Pubblicazione: (2024)
CC-OCR: A Comprehensive and Challenging OCR Benchmark for Evaluating Large Multimodal Models in Literacy
di: Yang, Zhibo, et al.
Pubblicazione: (2024)
di: Yang, Zhibo, et al.
Pubblicazione: (2024)
ViBERTgrid BiLSTM-CRF: Multimodal Key Information Extraction from Unstructured Financial Documents
di: Pala, Furkan, et al.
Pubblicazione: (2024)
di: Pala, Furkan, et al.
Pubblicazione: (2024)
OmniParser: A Unified Framework for Text Spotting, Key Information Extraction and Table Recognition
di: Wan, Jianqiang, et al.
Pubblicazione: (2024)
di: Wan, Jianqiang, et al.
Pubblicazione: (2024)
Enhancing the Patent Matching Capability of Large Language Models via the Memory Graph
di: Xiong, Qiushi, et al.
Pubblicazione: (2025)
di: Xiong, Qiushi, et al.
Pubblicazione: (2025)
Relation-Rich Visual Document Generator for Visual Information Extraction
di: Jiang, Zi-Han, et al.
Pubblicazione: (2025)
di: Jiang, Zi-Han, et al.
Pubblicazione: (2025)
READoc: A Unified Benchmark for Realistic Document Structured Extraction
di: Li, Zichao, et al.
Pubblicazione: (2024)
di: Li, Zichao, et al.
Pubblicazione: (2024)
EffiVLM-BENCH: A Comprehensive Benchmark for Evaluating Training-Free Acceleration in Large Vision-Language Models
di: Wang, Zekun, et al.
Pubblicazione: (2025)
di: Wang, Zekun, et al.
Pubblicazione: (2025)
OMGEval: An Open Multilingual Generative Evaluation Benchmark for Large Language Models
di: Liu, Yang, et al.
Pubblicazione: (2024)
di: Liu, Yang, et al.
Pubblicazione: (2024)
Cleaner Pretraining Corpus Curation with Neural Web Scraping
di: Xu, Zhipeng, et al.
Pubblicazione: (2024)
di: Xu, Zhipeng, et al.
Pubblicazione: (2024)
NEO-BENCH: Evaluating Robustness of Large Language Models with Neologisms
di: Zheng, Jonathan, et al.
Pubblicazione: (2024)
di: Zheng, Jonathan, et al.
Pubblicazione: (2024)
Generative Compositor for Few-Shot Visual Information Extraction
di: Yang, Zhibo, et al.
Pubblicazione: (2025)
di: Yang, Zhibo, et al.
Pubblicazione: (2025)
CaT-BENCH: Benchmarking Language Model Understanding of Causal and Temporal Dependencies in Plans
di: Lal, Yash Kumar, et al.
Pubblicazione: (2024)
di: Lal, Yash Kumar, et al.
Pubblicazione: (2024)
AR-BENCH: Benchmarking Legal Reasoning with Judgment Error Detection, Classification and Correction
di: Li, Yifei, et al.
Pubblicazione: (2026)
di: Li, Yifei, et al.
Pubblicazione: (2026)
Documenti analoghi
-
CC-OCR V2: Benchmarking Large Multimodal Models for Literacy in Real-world Document Processing
di: Xu, Zhipeng, et al.
Pubblicazione: (2026) -
Layout-Aware Parsing Meets Efficient LLMs: A Unified, Scalable Framework for Resume Information Extraction and Evaluation
di: Zhu, Fanwei, et al.
Pubblicazione: (2025) -
Long-Chain Reasoning Distillation via Adaptive Prefix Alignment
di: Liu, Zhenghao, et al.
Pubblicazione: (2026) -
Mixture-of-Retrieval Experts for Reasoning-Guided Multimodal Knowledge Exploitation
di: Peng, Chunyi, et al.
Pubblicazione: (2025) -
Lang2Act: Fine-Grained Visual Reasoning through Self-Emergent Linguistic Toolchains
di: Xiong, Yuqi, et al.
Pubblicazione: (2026)