DocRes: A Generalist Model Toward Unifying Document Image Restoration Tasks
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Jiaxin, Peng, Dezhi, Liu, Chongyu, Zhang, Peirong, Jin, Lianwen |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
UPOCR: Towards Unified Pixel-Level OCR Interface
par: Peng, Dezhi, et autres
Publié: (2023)
par: Peng, Dezhi, et autres
Publié: (2023)
ViTEraser: Harnessing the Power of Vision Transformers for Scene Text Removal with SegMIM Pretraining
par: Peng, Dezhi, et autres
Publié: (2023)
par: Peng, Dezhi, et autres
Publié: (2023)
Predicting the Original Appearance of Damaged Historical Documents
par: Yang, Zhenhua, et autres
Publié: (2024)
par: Yang, Zhenhua, et autres
Publié: (2024)
Online Writer Retrieval with Chinese Handwritten Phrases: A Synergistic Temporal-Frequency Representation Learning Approach
par: Zhang, Peirong, et autres
Publié: (2024)
par: Zhang, Peirong, et autres
Publié: (2024)
DocKylin: A Large Multimodal Model for Visual Document Understanding with Efficient Visual Slimming
par: Zhang, Jiaxin, et autres
Publié: (2024)
par: Zhang, Jiaxin, et autres
Publié: (2024)
DocR1: Evidence Page-Guided GRPO for Multi-Page Document Understanding
par: Xiong, Junyu, et autres
Publié: (2025)
par: Xiong, Junyu, et autres
Publié: (2025)
SwinTextSpotter v2: Towards Better Synergy for Scene Text Spotting
par: Huang, Mingxin, et autres
Publié: (2024)
par: Huang, Mingxin, et autres
Publié: (2024)
HierCode: A Lightweight Hierarchical Codebook for Zero-shot Chinese Text Recognition
par: Zhang, Yuyi, et autres
Publié: (2024)
par: Zhang, Yuyi, et autres
Publié: (2024)
Reviving Cultural Heritage: A Novel Approach for Comprehensive Historical Document Restoration
par: Zhang, Yuyi, et autres
Publié: (2025)
par: Zhang, Yuyi, et autres
Publié: (2025)
Capturing More: Learning Multi-Domain Representations for Robust Online Handwriting Verification
par: Zhang, Peirong, et autres
Publié: (2025)
par: Zhang, Peirong, et autres
Publié: (2025)
LEGO: Self-Supervised Representation Learning for Scene Text Images
par: Ren, Yujin, et autres
Publié: (2024)
par: Ren, Yujin, et autres
Publié: (2024)
RedundancyLens: Revealing and Exploiting Visual Token Processing Redundancy for Efficient Decoder-Only MLLMs
par: Li, Hongliang, et autres
Publié: (2025)
par: Li, Hongliang, et autres
Publié: (2025)
DocRevive: A Unified Pipeline for Document Text Restoration
par: Purkayastha, Kunal, et autres
Publié: (2026)
par: Purkayastha, Kunal, et autres
Publié: (2026)
Uni-DocDiff: A Unified Document Restoration Model Based on Diffusion
par: Zhao, Fangmin, et autres
Publié: (2025)
par: Zhao, Fangmin, et autres
Publié: (2025)
CogDoc: Towards Unified thinking in Documents
par: Xu, Qixin, et autres
Publié: (2025)
par: Xu, Qixin, et autres
Publié: (2025)
Privacy-Preserving Biometric Verification with Handwritten Random Digit String
par: Zhang, Peirong, et autres
Publié: (2025)
par: Zhang, Peirong, et autres
Publié: (2025)
DocLayLLM: An Efficient Multi-modal Extension of Large Language Models for Text-rich Document Understanding
par: Liao, Wenhui, et autres
Publié: (2024)
par: Liao, Wenhui, et autres
Publié: (2024)
MegaHan97K: A Large-Scale Dataset for Mega-Category Chinese Character Recognition with over 97K Categories
par: Zhang, Yuyi, et autres
Publié: (2025)
par: Zhang, Yuyi, et autres
Publié: (2025)
OCRGenBench: A Comprehensive Benchmark for Evaluating OCR Generative Capabilities
par: Zhang, Peirong, et autres
Publié: (2025)
par: Zhang, Peirong, et autres
Publié: (2025)
DeQA-Doc: Adapting DeQA-Score to Document Image Quality Assessment
par: Gao, Junjie, et autres
Publié: (2025)
par: Gao, Junjie, et autres
Publié: (2025)
Medical Vision Generalist: Unifying Medical Imaging Tasks in Context
par: Ren, Sucheng, et autres
Publié: (2024)
par: Ren, Sucheng, et autres
Publié: (2024)
Omni-IML: Towards Unified Image Manipulation Localization
par: Qu, Chenfan, et autres
Publié: (2024)
par: Qu, Chenfan, et autres
Publié: (2024)
PosterVerse: A Full-Workflow Framework for Commercial-Grade Poster Generation with HTML-Based Scalable Typography
par: Liu, Junle, et autres
Publié: (2026)
par: Liu, Junle, et autres
Publié: (2026)
mPLUG-DocOwl 1.5: Unified Structure Learning for OCR-free Document Understanding
par: Hu, Anwen, et autres
Publié: (2024)
par: Hu, Anwen, et autres
Publié: (2024)
DGSolver: Diffusion Generalist Solver with Universal Posterior Sampling for Image Restoration
par: Wang, Hebaixu, et autres
Publié: (2025)
par: Wang, Hebaixu, et autres
Publié: (2025)
Res$^2$CLIP: Few-Shot Generalist Anomaly Detection with Residual-to-Residual Alignment
par: Liu, Xinyue, et autres
Publié: (2026)
par: Liu, Xinyue, et autres
Publié: (2026)
Continual Learning-Based Unified Model for Unpaired Image Restoration Tasks
par: Kartheek, Kotha, et autres
Publié: (2025)
par: Kartheek, Kotha, et autres
Publié: (2025)
MCCD: A Multi-Attribute Chinese Calligraphy Character Dataset Annotated with Script Styles, Dynasties, and Calligraphers
par: Zhao, Yixin, et autres
Publié: (2025)
par: Zhao, Yixin, et autres
Publié: (2025)
UniRes: Universal Image Restoration for Complex Degradations
par: Zhou, Mo, et autres
Publié: (2025)
par: Zhou, Mo, et autres
Publié: (2025)
UniVG: A Generalist Diffusion Model for Unified Image Generation and Editing
par: Fu, Tsu-Jui, et autres
Publié: (2025)
par: Fu, Tsu-Jui, et autres
Publié: (2025)
DocSAM: Unified Document Image Segmentation via Query Decomposition and Heterogeneous Mixed Learning
par: Li, Xiao-Hui, et autres
Publié: (2025)
par: Li, Xiao-Hui, et autres
Publié: (2025)
Masked AutoDecoder is Effective Multi-Task Vision Generalist
par: Qiu, Han, et autres
Publié: (2024)
par: Qiu, Han, et autres
Publié: (2024)
UARE: A Unified Vision-Language Model for Image Quality Assessment, Restoration, and Enhancement
par: Li, Weiqi, et autres
Publié: (2025)
par: Li, Weiqi, et autres
Publié: (2025)
CRNet: A Detail-Preserving Network for Unified Image Restoration and Enhancement Task
par: Yang, Kangzhen, et autres
Publié: (2024)
par: Yang, Kangzhen, et autres
Publié: (2024)
A Unified Foundation Model for All-in-One Multi-Modal Remote Sensing Image Restoration and Fusion with Language Prompting
par: Cui, Yongchuan, et autres
Publié: (2026)
par: Cui, Yongchuan, et autres
Publié: (2026)
RealRestorer: Towards Generalizable Real-World Image Restoration with Large-Scale Image Editing Models
par: Yang, Yufeng, et autres
Publié: (2026)
par: Yang, Yufeng, et autres
Publié: (2026)
DocXplain: A Novel Model-Agnostic Explainability Method for Document Image Classification
par: Saifullah, Saifullah, et autres
Publié: (2024)
par: Saifullah, Saifullah, et autres
Publié: (2024)
USB: Unified Synthetic Brain Framework for Bidirectional Pathology-Healthy Generation and Editing
par: Wang, Jun, et autres
Publié: (2025)
par: Wang, Jun, et autres
Publié: (2025)
Toward a Diffusion-Based Generalist for Dense Vision Tasks
par: Fan, Yue, et autres
Publié: (2024)
par: Fan, Yue, et autres
Publié: (2024)
DICEPTION: A Generalist Diffusion Model for Visual Perceptual Tasks
par: Zhao, Canyu, et autres
Publié: (2025)
par: Zhao, Canyu, et autres
Publié: (2025)
Documents similaires
-
UPOCR: Towards Unified Pixel-Level OCR Interface
par: Peng, Dezhi, et autres
Publié: (2023) -
ViTEraser: Harnessing the Power of Vision Transformers for Scene Text Removal with SegMIM Pretraining
par: Peng, Dezhi, et autres
Publié: (2023) -
Predicting the Original Appearance of Damaged Historical Documents
par: Yang, Zhenhua, et autres
Publié: (2024) -
Online Writer Retrieval with Chinese Handwritten Phrases: A Synergistic Temporal-Frequency Representation Learning Approach
par: Zhang, Peirong, et autres
Publié: (2024) -
DocKylin: A Large Multimodal Model for Visual Document Understanding with Efficient Visual Slimming
par: Zhang, Jiaxin, et autres
Publié: (2024)