IndicDLP: A Foundational Dataset for Multi-Lingual and Multi-Domain Document Layout Parsing
Fuente:
arXiv
Saved in:
| Main Authors: | Nath, Oikantik, Kukkala, Sahithi, Khapra, Mitesh, Sarvadevabhatla, Ravi Kiran |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Can Vision-Language Models Evaluate Handwritten Math?
by: Nath, Oikantik, et al.
Published: (2025)
by: Nath, Oikantik, et al.
Published: (2025)
TexTAR : Textual Attribute Recognition in Multi-domain and Multi-lingual Document Images
by: Kumar, Rohan, et al.
Published: (2025)
by: Kumar, Rohan, et al.
Published: (2025)
MoRAG -- Multi-Fusion Retrieval Augmented Generation for Human Motion
by: Kalakonda, Sai Shashank, et al.
Published: (2024)
by: Kalakonda, Sai Shashank, et al.
Published: (2024)
OLAF: A Plug-and-Play Framework for Enhanced Multi-object Multi-part Scene Parsing
by: Gupta, Pranav, et al.
Published: (2024)
by: Gupta, Pranav, et al.
Published: (2024)
IDD-X: A Multi-View Dataset for Ego-relative Important Object Localization and Explanation in Dense and Unstructured Traffic
by: Parikh, Chirag, et al.
Published: (2024)
by: Parikh, Chirag, et al.
Published: (2024)
RoadSocial: A Diverse VideoQA Dataset and Benchmark for Road Event Understanding from Social Video Narratives
by: Parikh, Chirag, et al.
Published: (2025)
by: Parikh, Chirag, et al.
Published: (2025)
RoadTones: Tone Controllable Text Generation from Road Event Videos
by: Parikh, Chirag, et al.
Published: (2026)
by: Parikh, Chirag, et al.
Published: (2026)
Transfer-LMR: Heavy-Tail Driving Behavior Recognition in Diverse Traffic Scenarios
by: Parikh, Chirag, et al.
Published: (2024)
by: Parikh, Chirag, et al.
Published: (2024)
DashCop: Automated E-ticket Generation for Two-Wheeler Traffic Violations Using Dashcam Videos
by: Rawat, Deepti, et al.
Published: (2025)
by: Rawat, Deepti, et al.
Published: (2025)
CrackUDA: Incremental Unsupervised Domain Adaptation for Improved Crack Segmentation in Civil Structures
by: Srivastava, Kushagra, et al.
Published: (2024)
by: Srivastava, Kushagra, et al.
Published: (2024)
STRinGS: Selective Text Refinement in Gaussian Splatting
by: Raundhal, Abhinav, et al.
Published: (2025)
by: Raundhal, Abhinav, et al.
Published: (2025)
IndicSTR12: A Dataset for Indic Scene Text Recognition
by: Lunia, Harsh, et al.
Published: (2024)
by: Lunia, Harsh, et al.
Published: (2024)
Parser-Oriented Structural Refinement for a Stable Layout Interface in Document Parsing
by: Liu, Fuyuan, et al.
Published: (2026)
by: Liu, Fuyuan, et al.
Published: (2026)
Unveiling Text in Challenging Stone Inscriptions: A Character-Context-Aware Patching Strategy for Binarization
by: Jena, Pratyush, et al.
Published: (2026)
by: Jena, Pratyush, et al.
Published: (2026)
dots.ocr: Multilingual Document Layout Parsing in a Single Vision-Language Model
by: Li, Yumeng, et al.
Published: (2025)
by: Li, Yumeng, et al.
Published: (2025)
SeeThrough3D: Occlusion Aware 3D Control in Text-to-Image Generation
by: Agrawal, Vaibhav, et al.
Published: (2026)
by: Agrawal, Vaibhav, et al.
Published: (2026)
Diachronic Document Dataset for Semantic Layout Analysis
by: Clérice, Thibault, et al.
Published: (2024)
by: Clérice, Thibault, et al.
Published: (2024)
Seeing Isn't Believing: Uncovering Blind Spots in Evaluator Vision-Language Models
by: Khan, Mohammed Safi Ur Rahman, et al.
Published: (2026)
by: Khan, Mohammed Safi Ur Rahman, et al.
Published: (2026)
PhysLab: A Benchmark Dataset for Multi-Granularity Visual Parsing of Physics Experiments
by: Zou, Minghao, et al.
Published: (2025)
by: Zou, Minghao, et al.
Published: (2025)
Cross-Domain Document Layout Analysis Using Document Style Guide
by: Wu, Xingjiao, et al.
Published: (2022)
by: Wu, Xingjiao, et al.
Published: (2022)
Chitranuvad: Adapting Multi-Lingual LLMs for Multimodal Translation
by: Khan, Shaharukh, et al.
Published: (2025)
by: Khan, Shaharukh, et al.
Published: (2025)
Ev-Layout: A Large-scale Event-based Multi-modal Dataset for Indoor Layout Estimation and Tracking
by: Guo, Xucheng, et al.
Published: (2025)
by: Guo, Xucheng, et al.
Published: (2025)
ParseBench: A Document Parsing Benchmark for AI Agents
by: Zhang, Boyang, et al.
Published: (2026)
by: Zhang, Boyang, et al.
Published: (2026)
RanLayNet: A Dataset for Document Layout Detection used for Domain Adaptation and Generalization
by: Anand, Avinash, et al.
Published: (2024)
by: Anand, Avinash, et al.
Published: (2024)
Scenes as Tokens: Multi-Scale Normal Distributions Transform Tokenizer for General 3D Vision-Language Understanding
by: Tang, Yutao, et al.
Published: (2025)
by: Tang, Yutao, et al.
Published: (2025)
Infinity Parser: Layout Aware Reinforcement Learning for Scanned Document Parsing
by: Wang, Baode, et al.
Published: (2025)
by: Wang, Baode, et al.
Published: (2025)
SciPostLayout: A Dataset for Layout Analysis and Layout Generation of Scientific Posters
by: Tanaka, Shohei, et al.
Published: (2024)
by: Tanaka, Shohei, et al.
Published: (2024)
Tracking-Guided 4D Generation: Foundation-Tracker Motion Priors for 3D Model Animation
by: Sun, Su, et al.
Published: (2025)
by: Sun, Su, et al.
Published: (2025)
Leveraging Multi-View Weak Supervision for Occlusion-Aware Multi-Human Parsing
by: Bragagnolo, Laura, et al.
Published: (2025)
by: Bragagnolo, Laura, et al.
Published: (2025)
μgat: Improving Single-Page Document Parsing by Providing Multi-Page Context
by: Quattrini, Fabio, et al.
Published: (2024)
by: Quattrini, Fabio, et al.
Published: (2024)
Learning 3D Texture-Aware Representations for Parsing Diverse Human Clothing and Body Parts
by: Chhatre, Kiran, et al.
Published: (2025)
by: Chhatre, Kiran, et al.
Published: (2025)
LED Benchmark: Diagnosing Structural Layout Errors for Document Layout Analysis
by: Heo, Inbum, et al.
Published: (2025)
by: Heo, Inbum, et al.
Published: (2025)
OmniWorld: A Multi-Domain and Multi-Modal Dataset for 4D World Modeling
by: Zhou, Yang, et al.
Published: (2025)
by: Zhou, Yang, et al.
Published: (2025)
Semantic Parsing of Colonoscopy Videos with Multi-Label Temporal Networks
by: Kelner, Ori, et al.
Published: (2023)
by: Kelner, Ori, et al.
Published: (2023)
Multitwine: Multi-Object Compositing with Text and Layout Control
by: Tarrés, Gemma Canet, et al.
Published: (2025)
by: Tarrés, Gemma Canet, et al.
Published: (2025)
A Hybrid Approach for Document Layout Analysis in Document images
by: Shehzadi, Tahira, et al.
Published: (2024)
by: Shehzadi, Tahira, et al.
Published: (2024)
Multimodal OCR: Parse Anything from Documents
by: Zheng, Handong, et al.
Published: (2026)
by: Zheng, Handong, et al.
Published: (2026)
PartGLEE: A Foundation Model for Recognizing and Parsing Any Objects
by: Li, Junyi, et al.
Published: (2024)
by: Li, Junyi, et al.
Published: (2024)
Unsupervised Collaborative Domain Adaptation for Driving Scene Parsing
by: Fan, Jiahe, et al.
Published: (2026)
by: Fan, Jiahe, et al.
Published: (2026)
MDIW-13: a New Multi-Lingual and Multi-Script Database and Benchmark for Script Identification
by: Ferrer, Miguel A., et al.
Published: (2024)
by: Ferrer, Miguel A., et al.
Published: (2024)
Similar Items
-
Can Vision-Language Models Evaluate Handwritten Math?
by: Nath, Oikantik, et al.
Published: (2025) -
TexTAR : Textual Attribute Recognition in Multi-domain and Multi-lingual Document Images
by: Kumar, Rohan, et al.
Published: (2025) -
MoRAG -- Multi-Fusion Retrieval Augmented Generation for Human Motion
by: Kalakonda, Sai Shashank, et al.
Published: (2024) -
OLAF: A Plug-and-Play Framework for Enhanced Multi-object Multi-part Scene Parsing
by: Gupta, Pranav, et al.
Published: (2024) -
IDD-X: A Multi-View Dataset for Ego-relative Important Object Localization and Explanation in Dense and Unstructured Traffic
by: Parikh, Chirag, et al.
Published: (2024)