Multi-Modal Vision vs. Text-Based Parsing: Benchmarking LLM Strategies for Invoice Processing
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Berghaus, David, Berger, Armin, Hillebrand, Lars, Cvejoski, Kostadin, Sifa, Rafet |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Domain-Adaptation through Synthetic Data: Fine-Tuning Large Language Models for German Law
par: Bashir, Ali Hamza, et autres
Publié: (2026)
par: Bashir, Ali Hamza, et autres
Publié: (2026)
Reasoning LLMs in the Medical Domain: A Literature Survey
par: Berger, Armin, et autres
Publié: (2025)
par: Berger, Armin, et autres
Publié: (2025)
Advancing Risk and Quality Assurance: A RAG Chatbot for Improved Regulatory Compliance
par: Hillebrand, Lars, et autres
Publié: (2025)
par: Hillebrand, Lars, et autres
Publié: (2025)
Towards Unified Multimodal Financial Forecasting: Integrating Sentiment Embeddings and Market Indicators via Cross-Modal Attention
par: Khanna, Sarthak, et autres
Publié: (2025)
par: Khanna, Sarthak, et autres
Publié: (2025)
History Rhymes: Macro-Contextual Retrieval for Robust Financial Forecasting
par: Khanna, Sarthak, et autres
Publié: (2025)
par: Khanna, Sarthak, et autres
Publié: (2025)
Interpretable Topic Extraction and Word Embedding Learning using row-stochastic DEDICOM
par: Hillebrand, Lars, et autres
Publié: (2025)
par: Hillebrand, Lars, et autres
Publié: (2025)
A Survey on Current Trends and Recent Advances in Text Anonymization
par: Deußer, Tobias, et autres
Publié: (2025)
par: Deußer, Tobias, et autres
Publié: (2025)
Pointer-Guided Pre-Training: Infusing Large Language Models with Paragraph-Level Contextual Awareness
par: Hillebrand, Lars, et autres
Publié: (2024)
par: Hillebrand, Lars, et autres
Publié: (2024)
Is continuous CoT better suited for multi-lingual reasoning?
par: Bashir, Ali Hamza, et autres
Publié: (2026)
par: Bashir, Ali Hamza, et autres
Publié: (2026)
Powerful Training-Free Membership Inference Against Autoregressive Language Models
par: Ilić, David, et autres
Publié: (2026)
par: Ilić, David, et autres
Publié: (2026)
[Vision Paper] PRObot: Enhancing Patient-Reported Outcome Measures for Diabetic Retinopathy using Chatbots and Generative AI
par: Pielka, Maren, et autres
Publié: (2024)
par: Pielka, Maren, et autres
Publié: (2024)
SynCED-EnDe 2025: A Synthetic and Curated English - German Dataset for Critical Error Detection in Machine Translation
par: Chopra, Muskaan, et autres
Publié: (2025)
par: Chopra, Muskaan, et autres
Publié: (2025)
Towards Reliable Machine Translation: Scaling LLMs for Critical Error Detection and Safety
par: Chopra, Muskaan, et autres
Publié: (2026)
par: Chopra, Muskaan, et autres
Publié: (2026)
How Small Can You Go? Compact Language Models for On-Device Critical Error Detection in Machine Translation
par: Chopra, Muskaan, et autres
Publié: (2025)
par: Chopra, Muskaan, et autres
Publié: (2025)
Towards Automated Regulatory Compliance Verification in Financial Auditing with Large Language Models
par: Berger, Armin, et autres
Publié: (2025)
par: Berger, Armin, et autres
Publié: (2025)
On Foundation Models for Temporal Point Processes to Accelerate Scientific Discovery
par: Berghaus, David, et autres
Publié: (2025)
par: Berghaus, David, et autres
Publié: (2025)
Protecting Private Code in IDE Autocomplete using Differential Privacy
par: Grigorenko, Evgeny, et autres
Publié: (2026)
par: Grigorenko, Evgeny, et autres
Publié: (2026)
From Retinal Pixels to Patients: Evolution of Deep Learning Research in Diabetic Retinopathy Screening
par: Chopra, Muskaan, et autres
Publié: (2025)
par: Chopra, Muskaan, et autres
Publié: (2025)
AceParse: A Comprehensive Dataset with Diverse Structured Texts for Academic Literature Parsing
par: Ji, Huawei, et autres
Publié: (2024)
par: Ji, Huawei, et autres
Publié: (2024)
Benchmark Success, Clinical Failure: When Reinforcement Learning Optimizes for Benchmarks, Not Patients
par: Berger, Armin, et autres
Publié: (2025)
par: Berger, Armin, et autres
Publié: (2025)
Parse Trees Guided LLM Prompt Compression
par: Mao, Wenhao, et autres
Publié: (2024)
par: Mao, Wenhao, et autres
Publié: (2024)
Investigating Text Shortening Strategy in BERT: Truncation vs Summarization
par: Mutasodirin, Mirza Alim, et autres
Publié: (2024)
par: Mutasodirin, Mirza Alim, et autres
Publié: (2024)
Foundation Inference Models for Markov Jump Processes
par: Berghaus, David, et autres
Publié: (2024)
par: Berghaus, David, et autres
Publié: (2024)
A Universal Prompting Strategy for Extracting Process Model Information from Natural Language Text using Large Language Models
par: Neuberger, Julian, et autres
Publié: (2024)
par: Neuberger, Julian, et autres
Publié: (2024)
Parsing the Switch: LLM-Based UD Annotation for Complex Code-Switched and Low-Resource Languages
par: Kellert, Olga, et autres
Publié: (2025)
par: Kellert, Olga, et autres
Publié: (2025)
The Base-Rate Effect on LLM Benchmark Performance: Disambiguating Test-Taking Strategies from Benchmark Performance
par: Moore, Kyle, et autres
Publié: (2024)
par: Moore, Kyle, et autres
Publié: (2024)
Bayesian Optimization with LLM-Based Acquisition Functions for Natural Language Preference Elicitation
par: Austin, David Eric, et autres
Publié: (2024)
par: Austin, David Eric, et autres
Publié: (2024)
In-Context Learning of Temporal Point Processes with Foundation Inference Models
par: Berghaus, David, et autres
Publié: (2025)
par: Berghaus, David, et autres
Publié: (2025)
Weakly Supervised Text-to-SQL Parsing through Question Decomposition
par: Wolfson, Tomer, et autres
Publié: (2021)
par: Wolfson, Tomer, et autres
Publié: (2021)
HPE:Answering Complex Questions over Text by Hybrid Question Parsing and Execution
par: Liu, Ye, et autres
Publié: (2023)
par: Liu, Ye, et autres
Publié: (2023)
A Review of Multi-Modal Large Language and Vision Models
par: Carolan, Kilian, et autres
Publié: (2024)
par: Carolan, Kilian, et autres
Publié: (2024)
Knots: A Large-Scale Multi-Agent Enhanced Expert-Annotated Dataset and LLM Prompt Optimization for NOTAM Semantic Parsing
par: Liu, Maoqi, et autres
Publié: (2025)
par: Liu, Maoqi, et autres
Publié: (2025)
Disambiguate First, Parse Later: Generating Interpretations for Ambiguity Resolution in Semantic Parsing
par: Saparina, Irina, et autres
Publié: (2025)
par: Saparina, Irina, et autres
Publié: (2025)
A Systematic Evaluation of LLM Strategies for Mental Health Text Analysis: Fine-tuning vs. Prompt Engineering vs. RAG
par: Kermani, Arshia, et autres
Publié: (2025)
par: Kermani, Arshia, et autres
Publié: (2025)
STRuCT-LLM: Unifying Tabular and Graph Reasoning with Reinforcement Learning for Semantic Parsing
par: Stoisser, Josefa Lia, et autres
Publié: (2025)
par: Stoisser, Josefa Lia, et autres
Publié: (2025)
MultiSocial: Multilingual Benchmark of Machine-Generated Text Detection of Social-Media Texts
par: Macko, Dominik, et autres
Publié: (2024)
par: Macko, Dominik, et autres
Publié: (2024)
Calibrating LLMs for Text-to-SQL Parsing by Leveraging Sub-clause Frequencies
par: Liu, Terrance, et autres
Publié: (2025)
par: Liu, Terrance, et autres
Publié: (2025)
SPFT-SQL: Enhancing Large Language Model for Text-to-SQL Parsing by Self-Play Fine-Tuning
par: Zhang, Yuhao, et autres
Publié: (2025)
par: Zhang, Yuhao, et autres
Publié: (2025)
DetectRL: Benchmarking LLM-Generated Text Detection in Real-World Scenarios
par: Wu, Junchao, et autres
Publié: (2024)
par: Wu, Junchao, et autres
Publié: (2024)
LKD-KGC: Domain-Specific KG Construction via LLM-driven Knowledge Dependency Parsing
par: Sun, Jiaqi, et autres
Publié: (2025)
par: Sun, Jiaqi, et autres
Publié: (2025)
Documents similaires
-
Domain-Adaptation through Synthetic Data: Fine-Tuning Large Language Models for German Law
par: Bashir, Ali Hamza, et autres
Publié: (2026) -
Reasoning LLMs in the Medical Domain: A Literature Survey
par: Berger, Armin, et autres
Publié: (2025) -
Advancing Risk and Quality Assurance: A RAG Chatbot for Improved Regulatory Compliance
par: Hillebrand, Lars, et autres
Publié: (2025) -
Towards Unified Multimodal Financial Forecasting: Integrating Sentiment Embeddings and Market Indicators via Cross-Modal Attention
par: Khanna, Sarthak, et autres
Publié: (2025) -
History Rhymes: Macro-Contextual Retrieval for Robust Financial Forecasting
par: Khanna, Sarthak, et autres
Publié: (2025)