DODO: Discrete OCR Diffusion Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Man, Sean, Deutch, Gilad, Ganz, Roy, Ronen, Roi, Tsiper, Shahar, Mazor, Shai, Nayman, Niv |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
VisFocus: Prompt-Guided Vision Encoders for OCR-Free Dense Document Understanding
par: Abramovich, Ofir, et autres
Publié: (2024)
par: Abramovich, Ofir, et autres
Publié: (2024)
GRAM: Global Reasoning for Multi-Page VQA
par: Blau, Tsachi, et autres
Publié: (2024)
par: Blau, Tsachi, et autres
Publié: (2024)
Question Aware Vision Transformer for Multimodal Reasoning
par: Ganz, Roy, et autres
Publié: (2024)
par: Ganz, Roy, et autres
Publié: (2024)
TurboEdit: Text-Based Image Editing Using Few-Step Diffusion Models
par: Deutch, Gilad, et autres
Publié: (2024)
par: Deutch, Gilad, et autres
Publié: (2024)
DocVLM: Make Your VLM an Efficient Reader
par: Nacson, Mor Shpigel, et autres
Publié: (2024)
par: Nacson, Mor Shpigel, et autres
Publié: (2024)
FreeAugment: Data Augmentation Search Across All Degrees of Freedom
par: Bekor, Tom, et autres
Publié: (2024)
par: Bekor, Tom, et autres
Publié: (2024)
Text-to-Image Generation Via Energy-Based CLIP
par: Ganz, Roy, et autres
Publié: (2024)
par: Ganz, Roy, et autres
Publié: (2024)
LVLM-Aware Multimodal Retrieval for RAG-Based Medical Diagnosis with General-Purpose Models
par: Mazor, Nir, et autres
Publié: (2025)
par: Mazor, Nir, et autres
Publié: (2025)
DNN-based 3D Cloud Retrieval for Variable Solar Illumination and Multiview Spaceborne Imaging
par: Klein, Tamar, et autres
Publié: (2024)
par: Klein, Tamar, et autres
Publié: (2024)
Accelerating Text-to-Video Generation with Calibrated Sparse Attention
par: Yehezkel, Shai, et autres
Publié: (2026)
par: Yehezkel, Shai, et autres
Publié: (2026)
Not Every Image is Worth a Thousand Words: Quantifying Originality in Stable Diffusion
par: Haviv, Adi, et autres
Publié: (2024)
par: Haviv, Adi, et autres
Publié: (2024)
PuzLM: Solving Jigsaw Puzzles with Sequence-to-Sequence Language Models
par: Elkin, Gur, et autres
Publié: (2025)
par: Elkin, Gur, et autres
Publié: (2025)
Enhancing Consistency-Based Image Generation via Adversarialy-Trained Classification and Energy-Based Discrimination
par: Golan, Shelly, et autres
Publié: (2024)
par: Golan, Shelly, et autres
Publié: (2024)
TextSR: Diffusion Super-Resolution with Multilingual OCR Guidance
par: Ye, Keren, et autres
Publié: (2025)
par: Ye, Keren, et autres
Publié: (2025)
Ocean-OCR: Towards General OCR Application via a Vision-Language Model
par: Chen, Song, et autres
Publié: (2025)
par: Chen, Song, et autres
Publié: (2025)
MinerU-Diffusion: Rethinking Document OCR as Inverse Rendering via Diffusion Decoding
par: Dong, Hejun, et autres
Publié: (2026)
par: Dong, Hejun, et autres
Publié: (2026)
OCR-Agent: Agentic OCR with Capability and Memory Reflection
par: Wen, Shimin, et autres
Publié: (2026)
par: Wen, Shimin, et autres
Publié: (2026)
OmniOCR: Generalist OCR for Ethnic Minority Languages
par: Liu, Bonan, et autres
Publié: (2026)
par: Liu, Bonan, et autres
Publié: (2026)
CC-OCR: A Comprehensive and Challenging OCR Benchmark for Evaluating Large Multimodal Models in Literacy
par: Yang, Zhibo, et autres
Publié: (2024)
par: Yang, Zhibo, et autres
Publié: (2024)
Error Patterns in Historical OCR: A Comparative Analysis of TrOCR and a Vision-Language Model
par: Vesalainen, Ari, et autres
Publié: (2026)
par: Vesalainen, Ari, et autres
Publié: (2026)
General OCR Theory: Towards OCR-2.0 via a Unified End-to-end Model
par: Wei, Haoran, et autres
Publié: (2024)
par: Wei, Haoran, et autres
Publié: (2024)
Multi-View Foundation Models
par: Segre, Leo, et autres
Publié: (2025)
par: Segre, Leo, et autres
Publié: (2025)
Dependency-Aware Discrete Diffusion for Scene Graph Generation
par: Rajagopalan, Rajalaxmi, et autres
Publié: (2026)
par: Rajagopalan, Rajalaxmi, et autres
Publié: (2026)
Solving Convex Partition Visual Jigsaw Puzzles
par: Ohayon, Yaniv, et autres
Publié: (2025)
par: Ohayon, Yaniv, et autres
Publié: (2025)
Pairwise Alignment & Compatibility for Arbitrarily Irregular Image Fragments
par: Shahar, Ofir Itzhak, et autres
Publié: (2025)
par: Shahar, Ofir Itzhak, et autres
Publié: (2025)
Class-Conditioned Transformation for Enhanced Robust Image Classification
par: Blau, Tsachi, et autres
Publié: (2023)
par: Blau, Tsachi, et autres
Publié: (2023)
LightOnOCR: A 1B End-to-End Multilingual Vision-Language Model for State-of-the-Art OCR
par: Taghadouini, Said, et autres
Publié: (2026)
par: Taghadouini, Said, et autres
Publié: (2026)
Reasoning-OCR: Can Large Multimodal Models Solve Complex Logical Reasoning Problems from OCR Cues?
par: He, Haibin, et autres
Publié: (2025)
par: He, Haibin, et autres
Publié: (2025)
Paint by Inpaint: Learning to Add Image Objects by Removing Them First
par: Wasserman, Navve, et autres
Publié: (2024)
par: Wasserman, Navve, et autres
Publié: (2024)
Agentar-Fin-OCR
par: Qian, Siyi, et autres
Publié: (2026)
par: Qian, Siyi, et autres
Publié: (2026)
When Good OCR Is Not Enough: Benchmarking OCR Robustness for Retrieval-Augmented Generation
par: Sun, Lin, et autres
Publié: (2026)
par: Sun, Lin, et autres
Publié: (2026)
OCR Hinders RAG: Evaluating the Cascading Impact of OCR on Retrieval-Augmented Generation
par: Zhang, Junyuan, et autres
Publié: (2024)
par: Zhang, Junyuan, et autres
Publié: (2024)
GlotOCR Bench: OCR Models Still Struggle Beyond a Handful of Unicode Scripts
par: Kargaran, Amir Hossein, et autres
Publié: (2026)
par: Kargaran, Amir Hossein, et autres
Publié: (2026)
Learned 3D volumetric recovery of clouds and its uncertainty for climate analysis
par: Ronen, Roi, et autres
Publié: (2024)
par: Ronen, Roi, et autres
Publié: (2024)
A Graph-Based Approach for Category-Agnostic Pose Estimation
par: Hirschorn, Or, et autres
Publié: (2023)
par: Hirschorn, Or, et autres
Publié: (2023)
Edge Weight Prediction For Category-Agnostic Pose Estimation
par: Hirschorn, Or, et autres
Publié: (2024)
par: Hirschorn, Or, et autres
Publié: (2024)
When Are Concepts Erased From Diffusion Models?
par: Lu, Kevin, et autres
Publié: (2025)
par: Lu, Kevin, et autres
Publié: (2025)
Advancing Image Classification with Discrete Diffusion Classification Modeling
par: Belhasin, Omer, et autres
Publié: (2025)
par: Belhasin, Omer, et autres
Publié: (2025)
DianJin-OCR-R1: Enhancing OCR Capabilities via a Reasoning-and-Tool Interleaved Vision-Language Model
par: Chen, Qian, et autres
Publié: (2025)
par: Chen, Qian, et autres
Publié: (2025)
MME-VideoOCR: Evaluating OCR-Based Capabilities of Multimodal LLMs in Video Scenarios
par: Shi, Yang, et autres
Publié: (2025)
par: Shi, Yang, et autres
Publié: (2025)
Documents similaires
-
VisFocus: Prompt-Guided Vision Encoders for OCR-Free Dense Document Understanding
par: Abramovich, Ofir, et autres
Publié: (2024) -
GRAM: Global Reasoning for Multi-Page VQA
par: Blau, Tsachi, et autres
Publié: (2024) -
Question Aware Vision Transformer for Multimodal Reasoning
par: Ganz, Roy, et autres
Publié: (2024) -
TurboEdit: Text-Based Image Editing Using Few-Step Diffusion Models
par: Deutch, Gilad, et autres
Publié: (2024) -
DocVLM: Make Your VLM an Efficient Reader
par: Nacson, Mor Shpigel, et autres
Publié: (2024)