Exploring OCR-augmented Generation for Bilingual VQA
Fuente:
arXiv
Salvato in:
| Autori principali: | Lee, JoonHo, Park, Sunho |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
BEM: Training-Free Background Embedding Memory for False-Positive Suppression in Real-Time Fixed-Background Camera
di: Park, Junwoo, et al.
Pubblicazione: (2026)
di: Park, Junwoo, et al.
Pubblicazione: (2026)
Training Unbiased Diffusion Models From Biased Dataset
di: Kim, Yeongmin, et al.
Pubblicazione: (2024)
di: Kim, Yeongmin, et al.
Pubblicazione: (2024)
OCR Hinders RAG: Evaluating the Cascading Impact of OCR on Retrieval-Augmented Generation
di: Zhang, Junyuan, et al.
Pubblicazione: (2024)
di: Zhang, Junyuan, et al.
Pubblicazione: (2024)
When Good OCR Is Not Enough: Benchmarking OCR Robustness for Retrieval-Augmented Generation
di: Sun, Lin, et al.
Pubblicazione: (2026)
di: Sun, Lin, et al.
Pubblicazione: (2026)
Hierarchical Visual Feature Aggregation for OCR-Free Document Understanding
di: Park, Jaeyoo, et al.
Pubblicazione: (2024)
di: Park, Jaeyoo, et al.
Pubblicazione: (2024)
Ocean-OCR: Towards General OCR Application via a Vision-Language Model
di: Chen, Song, et al.
Pubblicazione: (2025)
di: Chen, Song, et al.
Pubblicazione: (2025)
Integrating Query-aware Segmentation and Cross-Attention for Robust VQA
di: Choi, Wonjun, et al.
Pubblicazione: (2024)
di: Choi, Wonjun, et al.
Pubblicazione: (2024)
VQA-Diff: Exploiting VQA and Diffusion for Zero-Shot Image-to-3D Vehicle Asset Generation in Autonomous Driving
di: Liu, Yibo, et al.
Pubblicazione: (2024)
di: Liu, Yibo, et al.
Pubblicazione: (2024)
General OCR Theory: Towards OCR-2.0 via a Unified End-to-end Model
di: Wei, Haoran, et al.
Pubblicazione: (2024)
di: Wei, Haoran, et al.
Pubblicazione: (2024)
OCR-Agent: Agentic OCR with Capability and Memory Reflection
di: Wen, Shimin, et al.
Pubblicazione: (2026)
di: Wen, Shimin, et al.
Pubblicazione: (2026)
OmniOCR: Generalist OCR for Ethnic Minority Languages
di: Liu, Bonan, et al.
Pubblicazione: (2026)
di: Liu, Bonan, et al.
Pubblicazione: (2026)
Enhancing Document VQA Models via Retrieval-Augmented Generation
di: López, Eric, et al.
Pubblicazione: (2025)
di: López, Eric, et al.
Pubblicazione: (2025)
SeeDiff: Off-the-Shelf Seeded Mask Generation from Diffusion Models
di: Park, Joon Hyun, et al.
Pubblicazione: (2025)
di: Park, Joon Hyun, et al.
Pubblicazione: (2025)
On the Role of Visual Grounding in VQA
di: Reich, Daniel, et al.
Pubblicazione: (2024)
di: Reich, Daniel, et al.
Pubblicazione: (2024)
RGC-VQA: An Exploration Database for Robotic-Generated Video Quality Assessment
di: Jin, Jianing, et al.
Pubblicazione: (2025)
di: Jin, Jianing, et al.
Pubblicazione: (2025)
Agentar-Fin-OCR
di: Qian, Siyi, et al.
Pubblicazione: (2026)
di: Qian, Siyi, et al.
Pubblicazione: (2026)
Exploring Scalability of Self-Training for Open-Vocabulary Temporal Action Localization
di: Hyun, Jeongseok, et al.
Pubblicazione: (2024)
di: Hyun, Jeongseok, et al.
Pubblicazione: (2024)
MME-VideoOCR: Evaluating OCR-Based Capabilities of Multimodal LLMs in Video Scenarios
di: Shi, Yang, et al.
Pubblicazione: (2025)
di: Shi, Yang, et al.
Pubblicazione: (2025)
TC-OCR: TableCraft OCR for Efficient Detection & Recognition of Table Structure & Content
di: Anand, Avinash, et al.
Pubblicazione: (2024)
di: Anand, Avinash, et al.
Pubblicazione: (2024)
olmOCR 2: Unit Test Rewards for Document OCR
di: Poznanski, Jake, et al.
Pubblicazione: (2025)
di: Poznanski, Jake, et al.
Pubblicazione: (2025)
VQA Training Sets are Self-play Environments for Generating Few-shot Pools
di: Misiunas, Tautvydas, et al.
Pubblicazione: (2024)
di: Misiunas, Tautvydas, et al.
Pubblicazione: (2024)
EduVQA: Towards Concept-Aware Assessment of Educational AI-Generated Videos
di: Chen, Baoliang, et al.
Pubblicazione: (2026)
di: Chen, Baoliang, et al.
Pubblicazione: (2026)
TextHawk2: A Large Vision-Language Model Excels in Bilingual OCR and Grounding with 16x Fewer Tokens
di: Yu, Ya-Qi, et al.
Pubblicazione: (2024)
di: Yu, Ya-Qi, et al.
Pubblicazione: (2024)
Exploring the Application of Visual Question Answering (VQA) for Classroom Activity Monitoring
di: Vu, Sinh Trong, et al.
Pubblicazione: (2025)
di: Vu, Sinh Trong, et al.
Pubblicazione: (2025)
OCRGenBench: A Comprehensive Benchmark for Evaluating OCR Generative Capabilities
di: Zhang, Peirong, et al.
Pubblicazione: (2025)
di: Zhang, Peirong, et al.
Pubblicazione: (2025)
ABot-OCR Technical Report
di: Jiang, Kaitao, et al.
Pubblicazione: (2026)
di: Jiang, Kaitao, et al.
Pubblicazione: (2026)
Post-Training Quantization via Residual Truncation and Zero Suppression for Diffusion Models
di: Kim, Donghoon, et al.
Pubblicazione: (2025)
di: Kim, Donghoon, et al.
Pubblicazione: (2025)
CC-OCR: A Comprehensive and Challenging OCR Benchmark for Evaluating Large Multimodal Models in Literacy
di: Yang, Zhibo, et al.
Pubblicazione: (2024)
di: Yang, Zhibo, et al.
Pubblicazione: (2024)
RoundTripOCR: A Data Generation Technique for Enhancing Post-OCR Error Correction in Low-Resource Devanagari Languages
di: Kashid, Harshvivek, et al.
Pubblicazione: (2024)
di: Kashid, Harshvivek, et al.
Pubblicazione: (2024)
Elevating Flow-Guided Video Inpainting with Reference Generation
di: Cho, Suhwan, et al.
Pubblicazione: (2024)
di: Cho, Suhwan, et al.
Pubblicazione: (2024)
Exploring Annotation-free Image Captioning with Retrieval-augmented Pseudo Sentence Generation
di: Li, Zhiyuan, et al.
Pubblicazione: (2023)
di: Li, Zhiyuan, et al.
Pubblicazione: (2023)
Error Patterns in Historical OCR: A Comparative Analysis of TrOCR and a Vision-Language Model
di: Vesalainen, Ari, et al.
Pubblicazione: (2026)
di: Vesalainen, Ari, et al.
Pubblicazione: (2026)
Knowledge Condensation and Reasoning for Knowledge-based VQA
di: Hao, Dongze, et al.
Pubblicazione: (2024)
di: Hao, Dongze, et al.
Pubblicazione: (2024)
Measuring Faithful and Plausible Visual Grounding in VQA
di: Reich, Daniel, et al.
Pubblicazione: (2023)
di: Reich, Daniel, et al.
Pubblicazione: (2023)
From Plausibility to Verifiability: Risk-Controlled Generative OCR with Vision-Language Models
di: Gong, Weile, et al.
Pubblicazione: (2026)
di: Gong, Weile, et al.
Pubblicazione: (2026)
Exploring Temporally-Aware Features for Point Tracking
di: Kim, Inès Hyeonsu, et al.
Pubblicazione: (2025)
di: Kim, Inès Hyeonsu, et al.
Pubblicazione: (2025)
DODO: Discrete OCR Diffusion Models
di: Man, Sean, et al.
Pubblicazione: (2026)
di: Man, Sean, et al.
Pubblicazione: (2026)
An Empirical Study of Scaling Law for OCR
di: Rang, Miao, et al.
Pubblicazione: (2023)
di: Rang, Miao, et al.
Pubblicazione: (2023)
SURE-VQA: Systematic Understanding of Robustness Evaluation in Medical VQA Tasks
di: Kahl, Kim-Celine, et al.
Pubblicazione: (2024)
di: Kahl, Kim-Celine, et al.
Pubblicazione: (2024)
HDRSDR-VQA: A Subjective Video Quality Dataset for HDR and SDR Comparative Evaluation
di: Chen, Bowen, et al.
Pubblicazione: (2025)
di: Chen, Bowen, et al.
Pubblicazione: (2025)
Documenti analoghi
-
BEM: Training-Free Background Embedding Memory for False-Positive Suppression in Real-Time Fixed-Background Camera
di: Park, Junwoo, et al.
Pubblicazione: (2026) -
Training Unbiased Diffusion Models From Biased Dataset
di: Kim, Yeongmin, et al.
Pubblicazione: (2024) -
OCR Hinders RAG: Evaluating the Cascading Impact of OCR on Retrieval-Augmented Generation
di: Zhang, Junyuan, et al.
Pubblicazione: (2024) -
When Good OCR Is Not Enough: Benchmarking OCR Robustness for Retrieval-Augmented Generation
di: Sun, Lin, et al.
Pubblicazione: (2026) -
Hierarchical Visual Feature Aggregation for OCR-Free Document Understanding
di: Park, Jaeyoo, et al.
Pubblicazione: (2024)