Beyond String Matching: Semantic Evaluation of PDF Table Extraction
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Horn, Pius, Keuper, Janis |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Benchmarking Document Parsers on Mathematical Formula Extraction from PDFs
par: Horn, Pius, et autres
Publié: (2025)
par: Horn, Pius, et autres
Publié: (2025)
TalentMine: LLM-Based Extraction and Question-Answering from Multimodal Talent Tables
par: Mannam, Varun, et autres
Publié: (2025)
par: Mannam, Varun, et autres
Publié: (2025)
OmniDocBench: Benchmarking Diverse PDF Document Parsing with Comprehensive Annotations
par: Ouyang, Linke, et autres
Publié: (2024)
par: Ouyang, Linke, et autres
Publié: (2024)
PhotoBench: Beyond Visual Matching Towards Personalized Intent-Driven Photo Retrieval
par: Xu, Tianyi, et autres
Publié: (2026)
par: Xu, Tianyi, et autres
Publié: (2026)
Beyond Unimodal Boundaries: Generative Recommendation with Multimodal Semantics
par: Zhu, Jing, et autres
Publié: (2025)
par: Zhu, Jing, et autres
Publié: (2025)
Beyond Final Answers: CRYSTAL Benchmark for Transparent Multimodal Reasoning Evaluation
par: Barrios, Wayner, et autres
Publié: (2026)
par: Barrios, Wayner, et autres
Publié: (2026)
NovaLAD: A Fast, CPU-Optimized Document Extraction Pipeline for Generative AI and Data Intelligence
par: Ulla, Aman
Publié: (2026)
par: Ulla, Aman
Publié: (2026)
HotelMatch-LLM: Joint Multi-Task Training of Small and Large Language Models for Efficient Multimodal Hotel Retrieval
par: Askari, Arian, et autres
Publié: (2025)
par: Askari, Arian, et autres
Publié: (2025)
RE-TRIANGLE: Does TRIANGLE Enable Multimodal Alignment Beyond Cosine Similarity in Retrieval?
par: Ghosh, Arijit, et autres
Publié: (2026)
par: Ghosh, Arijit, et autres
Publié: (2026)
EfficientPosterGen: Semantic-aware Efficient Poster Generation via Token Compression and Accurate Violation Detection
par: Tang, Wenxin, et autres
Publié: (2026)
par: Tang, Wenxin, et autres
Publié: (2026)
RAPTOR: Refined Approach for Product Table Object Recognition
par: Thomas, Eliott, et autres
Publié: (2025)
par: Thomas, Eliott, et autres
Publié: (2025)
Leveraging Customer Feedback for Multi-modal Insight Extraction
par: Mukku, Sandeep Sricharan, et autres
Publié: (2024)
par: Mukku, Sandeep Sricharan, et autres
Publié: (2024)
Learning Visual Composition through Improved Semantic Guidance
par: Stone, Austin, et autres
Publié: (2024)
par: Stone, Austin, et autres
Publié: (2024)
ViBERTgrid BiLSTM-CRF: Multimodal Key Information Extraction from Unstructured Financial Documents
par: Pala, Furkan, et autres
Publié: (2024)
par: Pala, Furkan, et autres
Publié: (2024)
INQUIRE: A Natural World Text-to-Image Retrieval Benchmark
par: Vendrow, Edward, et autres
Publié: (2024)
par: Vendrow, Edward, et autres
Publié: (2024)
Character-based Outfit Generation with Vision-augmented Style Extraction via LLMs
par: Forouzandehmehr, Najmeh, et autres
Publié: (2024)
par: Forouzandehmehr, Najmeh, et autres
Publié: (2024)
Beyond Matryoshka: Revisiting Sparse Coding for Adaptive Representation
par: Wen, Tiansheng, et autres
Publié: (2025)
par: Wen, Tiansheng, et autres
Publié: (2025)
A Picture is Worth a Thousand Words? An Empirical Study of Aggregation Strategies for Visual Financial Document Retrieval
par: Lim, Ho Hung, et autres
Publié: (2026)
par: Lim, Ho Hung, et autres
Publié: (2026)
Boosting Document Parsing Efficiency and Performance with Coarse-to-Fine Visual Processing
par: Cui, Cheng, et autres
Publié: (2026)
par: Cui, Cheng, et autres
Publié: (2026)
From Historical Tabular Image to Knowledge Graphs: A Provenance-Aware Modular Pipeline
par: Shoilee, Sarah Binta Alam, et autres
Publié: (2026)
par: Shoilee, Sarah Binta Alam, et autres
Publié: (2026)
Pailitao-VL: Unified Embedding and Reranker for Real-Time Multi-Modal Industrial Search
par: Chen, Lei, et autres
Publié: (2026)
par: Chen, Lei, et autres
Publié: (2026)
Your Embedding Model is SMARTer Than You Think
par: Zhang, Jianrui, et autres
Publié: (2026)
par: Zhang, Jianrui, et autres
Publié: (2026)
Efficient Logic Gate Networks for Video Copy Detection
par: Fojcik, Katarzyna
Publié: (2026)
par: Fojcik, Katarzyna
Publié: (2026)
Hierarchical Long Video Understanding with Audiovisual Entity Cohesion and Agentic Search
par: Yin, Xinlei, et autres
Publié: (2026)
par: Yin, Xinlei, et autres
Publié: (2026)
Good Scores, Bad Data: A Metric for Multimodal Coherence
par: Srinivasan, Vasundra
Publié: (2026)
par: Srinivasan, Vasundra
Publié: (2026)
ITSELF: Attention Guided Fine-Grained Alignment for Vision-Language Retrieval
par: Nguyen, Tien-Huy, et autres
Publié: (2026)
par: Nguyen, Tien-Huy, et autres
Publié: (2026)
Multi-task Cross-modal Learning for Chest X-ray Image Retrieval
par: Liang, Zhaohui, et autres
Publié: (2026)
par: Liang, Zhaohui, et autres
Publié: (2026)
PEARL: Personalized Streaming Video Understanding Model
par: Zheng, Yuanhong, et autres
Publié: (2026)
par: Zheng, Yuanhong, et autres
Publié: (2026)
A comprehensive multimodal dataset and benchmark for ulcerative colitis scoring in endoscopy
par: Ghatwary, Noha, et autres
Publié: (2026)
par: Ghatwary, Noha, et autres
Publié: (2026)
CRISP -- Clustering-Based Redundancy-Reduced Instance Sampling for Pathology Case Representation and Retrieval
par: Afzal, Zahra Rahimi, et autres
Publié: (2026)
par: Afzal, Zahra Rahimi, et autres
Publié: (2026)
Retrieval-Guided Generation for Safer Histopathology Image Captioning
par: Hoq, Md. Enamul, et autres
Publié: (2026)
par: Hoq, Md. Enamul, et autres
Publié: (2026)
Open-SAT: LLM-Guided Query Embedding Refinement for Open-Vocabulary Object Retrieval in Satellite Imagery
par: Arefeen, Md Adnan, et autres
Publié: (2026)
par: Arefeen, Md Adnan, et autres
Publié: (2026)
Benchmark Granularity and Model Robustness for Image-Text Retrieval
par: Hendriksen, Mariya, et autres
Publié: (2024)
par: Hendriksen, Mariya, et autres
Publié: (2024)
Smart Routing for Multimodal Video Retrieval: When to Search What
par: Rosa, Kevin Dela
Publié: (2025)
par: Rosa, Kevin Dela
Publié: (2025)
Attribute-Aware Implicit Modality Alignment for Text Attribute Person Search
par: Wang, Xin, et autres
Publié: (2024)
par: Wang, Xin, et autres
Publié: (2024)
Weakly Supervised Deep Hyperspherical Quantization for Image Retrieval
par: Wang, Jinpeng, et autres
Publié: (2024)
par: Wang, Jinpeng, et autres
Publié: (2024)
Low-Data Classification of Historical Music Manuscripts: A Few-Shot Learning Approach
par: Shatri, Elona, et autres
Publié: (2024)
par: Shatri, Elona, et autres
Publié: (2024)
Video Enriched Retrieval Augmented Generation Using Aligned Video Captions
par: Rosa, Kevin Dela
Publié: (2024)
par: Rosa, Kevin Dela
Publié: (2024)
Zero-Shot Image Moderation in Google Ads with LLM-Assisted Textual Descriptions and Cross-modal Co-embeddings
par: Luo, Enming, et autres
Publié: (2024)
par: Luo, Enming, et autres
Publié: (2024)
Accelerating Flood Warnings by 10 Hours: The Power of River Network Topology in AI-enhanced Flood Forecasting
par: Wang, Hongjun, et autres
Publié: (2024)
par: Wang, Hongjun, et autres
Publié: (2024)
Documents similaires
-
Benchmarking Document Parsers on Mathematical Formula Extraction from PDFs
par: Horn, Pius, et autres
Publié: (2025) -
TalentMine: LLM-Based Extraction and Question-Answering from Multimodal Talent Tables
par: Mannam, Varun, et autres
Publié: (2025) -
OmniDocBench: Benchmarking Diverse PDF Document Parsing with Comprehensive Annotations
par: Ouyang, Linke, et autres
Publié: (2024) -
PhotoBench: Beyond Visual Matching Towards Personalized Intent-Driven Photo Retrieval
par: Xu, Tianyi, et autres
Publié: (2026) -
Beyond Unimodal Boundaries: Generative Recommendation with Multimodal Semantics
par: Zhu, Jing, et autres
Publié: (2025)