SynthDoc: Bilingual Documents Synthesis for Visual Document Understanding
Fuente:
arXiv
Salvato in:
| Autori principali: | Ding, Chuanghao, Liu, Xuejing, Tang, Wei, Li, Juan, Wang, Xiaoliang, Zhao, Rui, Nguyen, Cam-Tu, Tan, Fei |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Cross-Lingual SynthDocs: A Large-Scale Synthetic Corpus for Any to Arabic OCR and Document Understanding
di: Al-Homoud, Haneen, et al.
Pubblicazione: (2025)
di: Al-Homoud, Haneen, et al.
Pubblicazione: (2025)
MiMIC: Mitigating Visual Modality Collapse in Universal Multimodal Retrieval While Avoiding Semantic Misalignment
di: Li, Juan, et al.
Pubblicazione: (2026)
di: Li, Juan, et al.
Pubblicazione: (2026)
Bi-VLDoc: Bidirectional Vision-Language Modeling for Visually-Rich Document Understanding
di: Luo, Chuwei, et al.
Pubblicazione: (2022)
di: Luo, Chuwei, et al.
Pubblicazione: (2022)
A Dual-Module Denoising Approach with Curriculum Learning for Enhancing Multimodal Aspect-Based Sentiment Analysis
di: Van Doan, Nguyen, et al.
Pubblicazione: (2024)
di: Van Doan, Nguyen, et al.
Pubblicazione: (2024)
Extending Visual Dynamics for Video-to-Music Generation
di: Liu, Xiaohao, et al.
Pubblicazione: (2025)
di: Liu, Xiaohao, et al.
Pubblicazione: (2025)
VDE Bench: Evaluating The Capability of Image Editing Models to Modify Visual Documents
di: Yi, Hongzhu, et al.
Pubblicazione: (2026)
di: Yi, Hongzhu, et al.
Pubblicazione: (2026)
Towards Signboard-Oriented Visual Question Answering: ViSignVQA Dataset, Method and Benchmark
di: Nguyen, Hieu Minh, et al.
Pubblicazione: (2025)
di: Nguyen, Hieu Minh, et al.
Pubblicazione: (2025)
Multi-modal and Multi-scale Spatial Environment Understanding for Immersive Visual Text-to-Speech
di: Liu, Rui, et al.
Pubblicazione: (2024)
di: Liu, Rui, et al.
Pubblicazione: (2024)
SMSP: A Plug-and-Play Strategy of Multi-Scale Perception for MLLMs to Perceive Visual Illusions
di: Tu, Jinzhe, et al.
Pubblicazione: (2026)
di: Tu, Jinzhe, et al.
Pubblicazione: (2026)
Do LLMs Understand Visual Anomalies? Uncovering LLM's Capabilities in Zero-shot Anomaly Detection
di: Zhu, Jiaqi, et al.
Pubblicazione: (2024)
di: Zhu, Jiaqi, et al.
Pubblicazione: (2024)
FeatDistill: A Feature Distillation Enhanced Multi-Expert Ensemble Framework for Robust AI-generated Image Detection
di: Tu, Zhilin, et al.
Pubblicazione: (2026)
di: Tu, Zhilin, et al.
Pubblicazione: (2026)
MosaicDoc: A Large-Scale Bilingual Benchmark for Visually Rich Document Understanding
di: Chen, Ketong, et al.
Pubblicazione: (2025)
di: Chen, Ketong, et al.
Pubblicazione: (2025)
From Data Deluge to Data Curation: A Filtering-WoRA Paradigm for Efficient Text-based Person Search
di: Sun, Jintao, et al.
Pubblicazione: (2024)
di: Sun, Jintao, et al.
Pubblicazione: (2024)
Where Does Vision Meet Language? Understanding and Refining Visual Fusion in MLLMs via Contrastive Attention
di: Song, Shezheng, et al.
Pubblicazione: (2026)
di: Song, Shezheng, et al.
Pubblicazione: (2026)
StableDub: Taming Diffusion Prior for Generalized and Efficient Visual Dubbing
di: Chen, Liyang, et al.
Pubblicazione: (2025)
di: Chen, Liyang, et al.
Pubblicazione: (2025)
DVF: Advancing Robust and Accurate Fine-Grained Image Retrieval with Retrieval Guidelines
di: Jiang, Xin, et al.
Pubblicazione: (2024)
di: Jiang, Xin, et al.
Pubblicazione: (2024)
JointAVBench: A Benchmark for Joint Audio-Visual Reasoning Evaluation
di: Chao, Jianghan, et al.
Pubblicazione: (2025)
di: Chao, Jianghan, et al.
Pubblicazione: (2025)
StreamingEval: A Unified Evaluation Protocol towards Realistic Streaming Video Understanding
di: Tang, Guowei, et al.
Pubblicazione: (2026)
di: Tang, Guowei, et al.
Pubblicazione: (2026)
PixCLIP: Achieving Fine-grained Visual Language Understanding via Any-granularity Pixel-Text Alignment Learning
di: Xiao, Yicheng, et al.
Pubblicazione: (2025)
di: Xiao, Yicheng, et al.
Pubblicazione: (2025)
Visual Grounding with Multi-modal Conditional Adaptation
di: Yao, Ruilin, et al.
Pubblicazione: (2024)
di: Yao, Ruilin, et al.
Pubblicazione: (2024)
On the Robustness of Human-Object Interaction Detection against Distribution Shift
di: Xie, Chi, et al.
Pubblicazione: (2025)
di: Xie, Chi, et al.
Pubblicazione: (2025)
Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing
di: Zhao, Pengcheng, et al.
Pubblicazione: (2024)
di: Zhao, Pengcheng, et al.
Pubblicazione: (2024)
Learning Contrastive Self-Distillation for Ultra-Fine-Grained Visual Categorization Targeting Limited Samples
di: Fang, Ziye, et al.
Pubblicazione: (2023)
di: Fang, Ziye, et al.
Pubblicazione: (2023)
Scaling up Multimodal Pre-training for Sign Language Understanding
di: Zhou, Wengang, et al.
Pubblicazione: (2024)
di: Zhou, Wengang, et al.
Pubblicazione: (2024)
SequencePAR: Understanding Pedestrian Attributes via A Sequence Generation Paradigm
di: Jin, Jiandong, et al.
Pubblicazione: (2023)
di: Jin, Jiandong, et al.
Pubblicazione: (2023)
Patch-level Sounding Object Tracking for Audio-Visual Question Answering
di: Li, Zhangbin, et al.
Pubblicazione: (2024)
di: Li, Zhangbin, et al.
Pubblicazione: (2024)
4D Gaussian Splatting with Scale-aware Residual Field and Adaptive Optimization for Real-time Rendering of Temporally Complex Dynamic Scenes
di: Yan, Jinbo, et al.
Pubblicazione: (2024)
di: Yan, Jinbo, et al.
Pubblicazione: (2024)
Fine-grained Image Retrieval via Dual-Vision Adaptation
di: Jiang, Xin, et al.
Pubblicazione: (2025)
di: Jiang, Xin, et al.
Pubblicazione: (2025)
Spatio-Temporal Data Enhanced Vision-Language Model for Traffic Scene Understanding
di: Ma, Jingtian, et al.
Pubblicazione: (2025)
di: Ma, Jingtian, et al.
Pubblicazione: (2025)
Hierarchical Knowledge Graphs for Story Understanding in Visual Narratives
di: Chen, Yi-Chun
Pubblicazione: (2025)
di: Chen, Yi-Chun
Pubblicazione: (2025)
Incorporating Visual Experts to Resolve the Information Loss in Multimodal Large Language Models
di: He, Xin, et al.
Pubblicazione: (2024)
di: He, Xin, et al.
Pubblicazione: (2024)
Multimodal Markup Document Models for Graphic Design Completion
di: Kikuchi, Kotaro, et al.
Pubblicazione: (2024)
di: Kikuchi, Kotaro, et al.
Pubblicazione: (2024)
Memories are One-to-Many Mapping Alleviators in Talking Face Generation
di: Tang, Anni, et al.
Pubblicazione: (2022)
di: Tang, Anni, et al.
Pubblicazione: (2022)
Disparity-based Stereo Image Compression with Aligned Cross-View Priors
di: Zhai, Yongqi, et al.
Pubblicazione: (2022)
di: Zhai, Yongqi, et al.
Pubblicazione: (2022)
A Tri-Dynamic Preprocessing Framework for UGC Video Compression
di: Zhao, Fei, et al.
Pubblicazione: (2025)
di: Zhao, Fei, et al.
Pubblicazione: (2025)
A Preprocessing Framework for Video Machine Vision under Compression
di: Zhao, Fei, et al.
Pubblicazione: (2025)
di: Zhao, Fei, et al.
Pubblicazione: (2025)
LinVT: Empower Your Image-level Large Language Model to Understand Videos
di: Gao, Lishuai, et al.
Pubblicazione: (2024)
di: Gao, Lishuai, et al.
Pubblicazione: (2024)
Class Agnostic Instance-level Descriptor for Visual Instance Search
di: Sun, Qi-Ying, et al.
Pubblicazione: (2025)
di: Sun, Qi-Ying, et al.
Pubblicazione: (2025)
MMBench-Video: A Long-Form Multi-Shot Benchmark for Holistic Video Understanding
di: Fang, Xinyu, et al.
Pubblicazione: (2024)
di: Fang, Xinyu, et al.
Pubblicazione: (2024)
GaussianTalker: Speaker-specific Talking Head Synthesis via 3D Gaussian Splatting
di: Yu, Hongyun, et al.
Pubblicazione: (2024)
di: Yu, Hongyun, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Cross-Lingual SynthDocs: A Large-Scale Synthetic Corpus for Any to Arabic OCR and Document Understanding
di: Al-Homoud, Haneen, et al.
Pubblicazione: (2025) -
MiMIC: Mitigating Visual Modality Collapse in Universal Multimodal Retrieval While Avoiding Semantic Misalignment
di: Li, Juan, et al.
Pubblicazione: (2026) -
Bi-VLDoc: Bidirectional Vision-Language Modeling for Visually-Rich Document Understanding
di: Luo, Chuwei, et al.
Pubblicazione: (2022) -
A Dual-Module Denoising Approach with Curriculum Learning for Enhancing Multimodal Aspect-Based Sentiment Analysis
di: Van Doan, Nguyen, et al.
Pubblicazione: (2024) -
Extending Visual Dynamics for Video-to-Music Generation
di: Liu, Xiaohao, et al.
Pubblicazione: (2025)