DocRevive: A Unified Pipeline for Document Text Restoration
Fuente:
arXiv
Guardado en:
| Autores principales: | Purkayastha, Kunal, Banerjee, Ayan, Llados, Josep, Pal, Umapada |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
GraphKD: Exploring Knowledge Distillation Towards Document Object Detection with Structured Graph Creation
por: Banerjee, Ayan, et al.
Publicado: (2024)
por: Banerjee, Ayan, et al.
Publicado: (2024)
TaleDiffusion: Multi-Character Story Generation with Dialogue Rendering
por: Banerjee, Ayan, et al.
Publicado: (2025)
por: Banerjee, Ayan, et al.
Publicado: (2025)
CraftSVG: Multi-Object Text-to-SVG Synthesis via Layout Guided Diffusion
por: Banerjee, Ayan, et al.
Publicado: (2024)
por: Banerjee, Ayan, et al.
Publicado: (2024)
Diving into the Depths of Spotting Text in Multi-Domain Noisy Scenes
por: Das, Alloy, et al.
Publicado: (2023)
por: Das, Alloy, et al.
Publicado: (2023)
FastTextSpotter: A High-Efficiency Transformer for Multilingual Scene Text Spotting
por: Das, Alloy, et al.
Publicado: (2024)
por: Das, Alloy, et al.
Publicado: (2024)
CraftGraffiti: Exploring Human Identity with Custom Graffiti Art via Facial-Preserving Diffusion Models
por: Banerjee, Ayan, et al.
Publicado: (2025)
por: Banerjee, Ayan, et al.
Publicado: (2025)
DistilDoc: Knowledge Distillation for Visually-Rich Document Applications
por: Van Landeghem, Jordy, et al.
Publicado: (2024)
por: Van Landeghem, Jordy, et al.
Publicado: (2024)
LayeredDoc: Domain Adaptive Document Restoration with a Layer Separation Approach
por: Pilligua, Maria, et al.
Publicado: (2024)
por: Pilligua, Maria, et al.
Publicado: (2024)
FASTER: A Font-Agnostic Scene Text Editing and Rendering Framework
por: Das, Alloy, et al.
Publicado: (2023)
por: Das, Alloy, et al.
Publicado: (2023)
GlobalDoc: A Cross-Modal Vision-Language Framework for Real-World Document Image Retrieval and Classification
por: Bakkali, Souhail, et al.
Publicado: (2023)
por: Bakkali, Souhail, et al.
Publicado: (2023)
CountLoop: Training-Free High-Instance Image Generation via Iterative Agent Guidance
por: Mondal, Anindya, et al.
Publicado: (2025)
por: Mondal, Anindya, et al.
Publicado: (2025)
Uni-DocDiff: A Unified Document Restoration Model Based on Diffusion
por: Zhao, Fangmin, et al.
Publicado: (2025)
por: Zhao, Fangmin, et al.
Publicado: (2025)
DocRes: A Generalist Model Toward Unifying Document Image Restoration Tasks
por: Zhang, Jiaxin, et al.
Publicado: (2024)
por: Zhang, Jiaxin, et al.
Publicado: (2024)
DocSynthv2: A Practical Autoregressive Modeling for Document Generation
por: Biswas, Sanket, et al.
Publicado: (2024)
por: Biswas, Sanket, et al.
Publicado: (2024)
GeoContrastNet: Contrastive Key-Value Edge Learning for Language-Agnostic Document Understanding
por: Biescas, Nil, et al.
Publicado: (2024)
por: Biescas, Nil, et al.
Publicado: (2024)
Fetch-A-Set: A Large-Scale OCR-Free Benchmark for Historical Document Retrieval
por: Molina, Adrià, et al.
Publicado: (2024)
por: Molina, Adrià, et al.
Publicado: (2024)
CogDoc: Towards Unified thinking in Documents
por: Xu, Qixin, et al.
Publicado: (2025)
por: Xu, Qixin, et al.
Publicado: (2025)
STEFANN: Scene Text Editor using Font Adaptive Neural Network
por: Roy, Prasun, et al.
Publicado: (2019)
por: Roy, Prasun, et al.
Publicado: (2019)
SketchGPT: Autoregressive Modeling for Sketch Generation and Recognition
por: Tiwari, Adarsh, et al.
Publicado: (2024)
por: Tiwari, Adarsh, et al.
Publicado: (2024)
Correlation Weighted Prototype-based Self-Supervised One-Shot Segmentation of Medical Images
por: Manna, Siladittya, et al.
Publicado: (2024)
por: Manna, Siladittya, et al.
Publicado: (2024)
TIPS: Text-Induced Pose Synthesis
por: Roy, Prasun, et al.
Publicado: (2022)
por: Roy, Prasun, et al.
Publicado: (2022)
A Lightweight Context-Driven Training-Free Network for Scene Text Segmentation and Recognition
por: Chakraborty, Ritabrata, et al.
Publicado: (2025)
por: Chakraborty, Ritabrata, et al.
Publicado: (2025)
A CNN Based Framework for Unistroke Numeral Recognition in Air-Writing
por: Roy, Prasun, et al.
Publicado: (2023)
por: Roy, Prasun, et al.
Publicado: (2023)
DRG-Font: Dynamic Reference-Guided Few-shot Font Generation via Contrastive Style-Content Disentanglement
por: Chakraborty, Rejoy, et al.
Publicado: (2026)
por: Chakraborty, Rejoy, et al.
Publicado: (2026)
MIO : Mutual Information Optimization using Self-Supervised Binary Contrastive Learning
por: Manna, Siladittya, et al.
Publicado: (2021)
por: Manna, Siladittya, et al.
Publicado: (2021)
Towards Generative Class Prompt Learning for Fine-grained Visual Recognition
por: Chattopadhyay, Soumitri, et al.
Publicado: (2024)
por: Chattopadhyay, Soumitri, et al.
Publicado: (2024)
Reviving Cultural Heritage: A Novel Approach for Comprehensive Historical Document Restoration
por: Zhang, Yuyi, et al.
Publicado: (2025)
por: Zhang, Yuyi, et al.
Publicado: (2025)
Multi-scale Attention Guided Pose Transfer
por: Roy, Prasun, et al.
Publicado: (2022)
por: Roy, Prasun, et al.
Publicado: (2022)
A Transformer Based Handwriting Recognition System Jointly Using Online and Offline Features
por: Lodh, Ayush, et al.
Publicado: (2025)
por: Lodh, Ayush, et al.
Publicado: (2025)
The OCR Quest for Generalization: Learning to recognize low-resource alphabets with model editing
por: Rodríguez, Adrià Molina, et al.
Publicado: (2025)
por: Rodríguez, Adrià Molina, et al.
Publicado: (2025)
mPLUG-DocOwl 1.5: Unified Structure Learning for OCR-free Document Understanding
por: Hu, Anwen, et al.
Publicado: (2024)
por: Hu, Anwen, et al.
Publicado: (2024)
Decorrelation-based Self-Supervised Visual Representation Learning for Writer Identification
por: Maitra, Arkadip, et al.
Publicado: (2024)
por: Maitra, Arkadip, et al.
Publicado: (2024)
ReviveDiff: A Universal Diffusion Model for Restoring Images in Adverse Weather Conditions
por: Huang, Wenfeng, et al.
Publicado: (2024)
por: Huang, Wenfeng, et al.
Publicado: (2024)
Conformal uncertainty quantification to evaluate predictive fairness of foundation AI model for skin lesion classes across patient demographics
por: Bhattacharyya, Swarnava, et al.
Publicado: (2025)
por: Bhattacharyya, Swarnava, et al.
Publicado: (2025)
Towards Robust Cross-Dataset Object Detection Generalization under Domain Specificity
por: Chakraborty, Ritabrata, et al.
Publicado: (2026)
por: Chakraborty, Ritabrata, et al.
Publicado: (2026)
DocLayLLM: An Efficient Multi-modal Extension of Large Language Models for Text-rich Document Understanding
por: Liao, Wenhui, et al.
Publicado: (2024)
por: Liao, Wenhui, et al.
Publicado: (2024)
Position and Rotation Invariant Sign Language Recognition from 3D Kinect Data with Recurrent Neural Networks
por: Roy, Prasun, et al.
Publicado: (2020)
por: Roy, Prasun, et al.
Publicado: (2020)
Exploring Mutual Cross-Modal Attention for Context-Aware Human Affordance Generation
por: Roy, Prasun, et al.
Publicado: (2025)
por: Roy, Prasun, et al.
Publicado: (2025)
Scene Aware Person Image Generation through Global Contextual Conditioning
por: Roy, Prasun, et al.
Publicado: (2022)
por: Roy, Prasun, et al.
Publicado: (2022)
Semantically Consistent Person Image Generation
por: Roy, Prasun, et al.
Publicado: (2023)
por: Roy, Prasun, et al.
Publicado: (2023)
Ejemplares similares
-
GraphKD: Exploring Knowledge Distillation Towards Document Object Detection with Structured Graph Creation
por: Banerjee, Ayan, et al.
Publicado: (2024) -
TaleDiffusion: Multi-Character Story Generation with Dialogue Rendering
por: Banerjee, Ayan, et al.
Publicado: (2025) -
CraftSVG: Multi-Object Text-to-SVG Synthesis via Layout Guided Diffusion
por: Banerjee, Ayan, et al.
Publicado: (2024) -
Diving into the Depths of Spotting Text in Multi-Domain Noisy Scenes
por: Das, Alloy, et al.
Publicado: (2023) -
FastTextSpotter: A High-Efficiency Transformer for Multilingual Scene Text Spotting
por: Das, Alloy, et al.
Publicado: (2024)