From Plausibility to Verifiability: Risk-Controlled Generative OCR with Vision-Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Gong, Weile, Zuo, Yiping, Lu, Zijian, He, Xin, Fan, Weibei, Qi, Lianyong, Jin, Shi |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ContractSkill: Repairable Contract-Based Skills for Multimodal Web Agents
par: Lu, Zijian, et autres
Publié: (2026)
par: Lu, Zijian, et autres
Publié: (2026)
Ocean-OCR: Towards General OCR Application via a Vision-Language Model
par: Chen, Song, et autres
Publié: (2025)
par: Chen, Song, et autres
Publié: (2025)
VLPrompt: Vision-Language Prompting for Panoptic Scene Graph Generation
par: Zhou, Zijian, et autres
Publié: (2023)
par: Zhou, Zijian, et autres
Publié: (2023)
From Seeing to Predicting: A Vision-Language Framework for Trajectory Forecasting and Controlled Video Generation
par: Yang, Fan, et autres
Publié: (2025)
par: Yang, Fan, et autres
Publié: (2025)
VLIPP: Towards Physically Plausible Video Generation with Vision and Language Informed Physical Prior
par: Yang, Xindi, et autres
Publié: (2025)
par: Yang, Xindi, et autres
Publié: (2025)
THOM: Generating Physically Plausible Hand-Object Meshes From Text
par: Jeong, Uyoung, et autres
Publié: (2026)
par: Jeong, Uyoung, et autres
Publié: (2026)
Error Patterns in Historical OCR: A Comparative Analysis of TrOCR and a Vision-Language Model
par: Vesalainen, Ari, et autres
Publié: (2026)
par: Vesalainen, Ari, et autres
Publié: (2026)
LightOnOCR: A 1B End-to-End Multilingual Vision-Language Model for State-of-the-Art OCR
par: Taghadouini, Said, et autres
Publié: (2026)
par: Taghadouini, Said, et autres
Publié: (2026)
OrthoPhys: Physically Plausible Video Generation with Orthogonal-View Geometry Guidance
par: Wang, Cong, et autres
Publié: (2026)
par: Wang, Cong, et autres
Publié: (2026)
AtlasOCR: Building the First Open-Source Darija OCR Model with Vision Language Models
par: Momayiz, Imane, et autres
Publié: (2026)
par: Momayiz, Imane, et autres
Publié: (2026)
SCAResNet: A ResNet Variant Optimized for Tiny Object Detection in Transmission and Distribution Towers
par: Li, Weile, et autres
Publié: (2024)
par: Li, Weile, et autres
Publié: (2024)
OCR Hinders RAG: Evaluating the Cascading Impact of OCR on Retrieval-Augmented Generation
par: Zhang, Junyuan, et autres
Publié: (2024)
par: Zhang, Junyuan, et autres
Publié: (2024)
OmniOCR: Generalist OCR for Ethnic Minority Languages
par: Liu, Bonan, et autres
Publié: (2026)
par: Liu, Bonan, et autres
Publié: (2026)
Generate, but Verify: Reducing Hallucination in Vision-Language Models with Retrospective Resampling
par: Wu, Tsung-Han, et autres
Publié: (2025)
par: Wu, Tsung-Han, et autres
Publié: (2025)
OCRVerse: Towards Holistic OCR in End-to-End Vision-Language Models
par: Zhong, Yufeng, et autres
Publié: (2026)
par: Zhong, Yufeng, et autres
Publié: (2026)
DianJin-OCR-R1: Enhancing OCR Capabilities via a Reasoning-and-Tool Interleaved Vision-Language Model
par: Chen, Qian, et autres
Publié: (2025)
par: Chen, Qian, et autres
Publié: (2025)
From Generated Human Videos to Physically Plausible Robot Trajectories
par: Ni, James, et autres
Publié: (2025)
par: Ni, James, et autres
Publié: (2025)
Q-Mask: Query-driven Causal Masks for Text Anchoring in OCR-Oriented Vision-Language Models
par: Xu, Longwei, et autres
Publié: (2026)
par: Xu, Longwei, et autres
Publié: (2026)
Fréchet Denoised Distance: Enhancing Plausibility Evaluation for Generated Designs with Denoising Autoencoder
par: Fan, Jiajie, et autres
Publié: (2024)
par: Fan, Jiajie, et autres
Publié: (2024)
Vision-Centric Activation and Coordination for Multimodal Large Language Models
par: Wang, Yunnan, et autres
Publié: (2025)
par: Wang, Yunnan, et autres
Publié: (2025)
PAMD: Plausibility-Aware Motion Diffusion Model for Long Dance Generation
par: Wang, Hongsong, et autres
Publié: (2025)
par: Wang, Hongsong, et autres
Publié: (2025)
PhysHMR: Learning Humanoid Control Policies from Vision for Physically Plausible Human Motion Reconstruction
par: Feng, Qiao, et autres
Publié: (2025)
par: Feng, Qiao, et autres
Publié: (2025)
OCR-Agent: Agentic OCR with Capability and Memory Reflection
par: Wen, Shimin, et autres
Publié: (2026)
par: Wen, Shimin, et autres
Publié: (2026)
ABot-OCR Technical Report
par: Jiang, Kaitao, et autres
Publié: (2026)
par: Jiang, Kaitao, et autres
Publié: (2026)
Text Promptable Surgical Instrument Segmentation with Vision-Language Models
par: Zhou, Zijian, et autres
Publié: (2023)
par: Zhou, Zijian, et autres
Publié: (2023)
FantasyVLN: Unified Multimodal Chain-of-Thought Reasoning for Vision-Language Navigation
par: Zuo, Jing, et autres
Publié: (2026)
par: Zuo, Jing, et autres
Publié: (2026)
Vision Foundation Models as Generalist Tokenizers for Image Generation
par: Zheng, Anlin, et autres
Publié: (2026)
par: Zheng, Anlin, et autres
Publié: (2026)
Baseer: A Vision-Language Model for Arabic Document-to-Markdown OCR
par: Hennara, Khalil, et autres
Publié: (2025)
par: Hennara, Khalil, et autres
Publié: (2025)
Finetuning Vision-Language Models as OCR Systems for Low-Resource Languages: A Case Study of Manchu
par: Chung, Yan Hon Michael, et autres
Publié: (2025)
par: Chung, Yan Hon Michael, et autres
Publié: (2025)
PreP-OCR: A Complete Pipeline for Document Image Restoration and Enhanced OCR Accuracy
par: Guan, Shuhao, et autres
Publié: (2025)
par: Guan, Shuhao, et autres
Publié: (2025)
When Good OCR Is Not Enough: Benchmarking OCR Robustness for Retrieval-Augmented Generation
par: Sun, Lin, et autres
Publié: (2026)
par: Sun, Lin, et autres
Publié: (2026)
Action Draft and Verify: A Self-Verifying Framework for Vision-Language-Action Model
par: Zhao, Chen, et autres
Publié: (2026)
par: Zhao, Chen, et autres
Publié: (2026)
Offline Semantic Guidance for Efficient Vision-Language-Action Policy Distillation
par: Shi, Jin, et autres
Publié: (2026)
par: Shi, Jin, et autres
Publié: (2026)
DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge
par: Zhang, Wenyao, et autres
Publié: (2025)
par: Zhang, Wenyao, et autres
Publié: (2025)
Agentar-Fin-OCR
par: Qian, Siyi, et autres
Publié: (2026)
par: Qian, Siyi, et autres
Publié: (2026)
TextHawk2: A Large Vision-Language Model Excels in Bilingual OCR and Grounding with 16x Fewer Tokens
par: Yu, Ya-Qi, et autres
Publié: (2024)
par: Yu, Ya-Qi, et autres
Publié: (2024)
PhyPrompt: RL-based Prompt Refinement for Physically Plausible Text-to-Video Generation
par: Wu, Shang, et autres
Publié: (2026)
par: Wu, Shang, et autres
Publié: (2026)
MMPhysVideo: Scaling Physical Plausibility in Video Generation via Joint Multimodal Modeling
par: Lin, Shubo, et autres
Publié: (2026)
par: Lin, Shubo, et autres
Publié: (2026)
MorphGen: Controllable and Morphologically Plausible Generative Cell-Imaging
par: Demirel, Berker, et autres
Publié: (2025)
par: Demirel, Berker, et autres
Publié: (2025)
UPOCR: Towards Unified Pixel-Level OCR Interface
par: Peng, Dezhi, et autres
Publié: (2023)
par: Peng, Dezhi, et autres
Publié: (2023)
Documents similaires
-
ContractSkill: Repairable Contract-Based Skills for Multimodal Web Agents
par: Lu, Zijian, et autres
Publié: (2026) -
Ocean-OCR: Towards General OCR Application via a Vision-Language Model
par: Chen, Song, et autres
Publié: (2025) -
VLPrompt: Vision-Language Prompting for Panoptic Scene Graph Generation
par: Zhou, Zijian, et autres
Publié: (2023) -
From Seeing to Predicting: A Vision-Language Framework for Trajectory Forecasting and Controlled Video Generation
par: Yang, Fan, et autres
Publié: (2025) -
VLIPP: Towards Physically Plausible Video Generation with Vision and Language Informed Physical Prior
par: Yang, Xindi, et autres
Publié: (2025)