Agentar-Fin-OCR
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Qian, Siyi, Bai, Xiongfei, Fu, Bingtao, Lu, Yichen, Zhang, Gaoyang, Yang, Xudong, Zhang, Peng |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
CoMPaSS: Enhancing Spatial Understanding in Text-to-Image Diffusion Models
par: Zhang, Gaoyang, et autres
Publié: (2024)
par: Zhang, Gaoyang, et autres
Publié: (2024)
FinCriticalED: A Visual Benchmark for Financial Fact-Level OCR
par: He, Yueru, et autres
Publié: (2025)
par: He, Yueru, et autres
Publié: (2025)
Tracing Copied Pixels and Regularizing Patch Affinity in Copy Detection
par: Lu, Yichen, et autres
Publié: (2026)
par: Lu, Yichen, et autres
Publié: (2026)
MME-VideoOCR: Evaluating OCR-Based Capabilities of Multimodal LLMs in Video Scenarios
par: Shi, Yang, et autres
Publié: (2025)
par: Shi, Yang, et autres
Publié: (2025)
Rethinking the Need for Source Models: Source-Free Domain Adaptation from Scratch Guided by a Vision-Language Model
par: Bingtao, Zhou, et autres
Publié: (2026)
par: Bingtao, Zhou, et autres
Publié: (2026)
DianJin-OCR-R1: Enhancing OCR Capabilities via a Reasoning-and-Tool Interleaved Vision-Language Model
par: Chen, Qian, et autres
Publié: (2025)
par: Chen, Qian, et autres
Publié: (2025)
CC-OCR: A Comprehensive and Challenging OCR Benchmark for Evaluating Large Multimodal Models in Literacy
par: Yang, Zhibo, et autres
Publié: (2024)
par: Yang, Zhibo, et autres
Publié: (2024)
OmniOCR: Generalist OCR for Ethnic Minority Languages
par: Liu, Bonan, et autres
Publié: (2026)
par: Liu, Bonan, et autres
Publié: (2026)
Multimodal OCR: Parse Anything from Documents
par: Zheng, Handong, et autres
Publié: (2026)
par: Zheng, Handong, et autres
Publié: (2026)
MonkeyOCR: Document Parsing with a Structure-Recognition-Relation Triplet Paradigm
par: Li, Zhang, et autres
Publié: (2025)
par: Li, Zhang, et autres
Publié: (2025)
IAF-Net: Illumination-Adaptive Fusion for Low-Light Urban Road Segmentation
par: Wang, Bingtao, et autres
Publié: (2026)
par: Wang, Bingtao, et autres
Publié: (2026)
OCR Hinders RAG: Evaluating the Cascading Impact of OCR on Retrieval-Augmented Generation
par: Zhang, Junyuan, et autres
Publié: (2024)
par: Zhang, Junyuan, et autres
Publié: (2024)
When Good OCR Is Not Enough: Benchmarking OCR Robustness for Retrieval-Augmented Generation
par: Sun, Lin, et autres
Publié: (2026)
par: Sun, Lin, et autres
Publié: (2026)
OCR-Agent: Agentic OCR with Capability and Memory Reflection
par: Wen, Shimin, et autres
Publié: (2026)
par: Wen, Shimin, et autres
Publié: (2026)
UPOCR: Towards Unified Pixel-Level OCR Interface
par: Peng, Dezhi, et autres
Publié: (2023)
par: Peng, Dezhi, et autres
Publié: (2023)
Efficient RGB-D Scene Understanding via Multi-task Adaptive Learning and Cross-dimensional Feature Guidance
par: Sun, Guodong, et autres
Publié: (2026)
par: Sun, Guodong, et autres
Publié: (2026)
Ocean-OCR: Towards General OCR Application via a Vision-Language Model
par: Chen, Song, et autres
Publié: (2025)
par: Chen, Song, et autres
Publié: (2025)
LiteViLNet: Lightweight Vision-LiDAR Fusion Network for Efficient Road Segmentation
par: Peng, Daojie, et autres
Publié: (2026)
par: Peng, Daojie, et autres
Publié: (2026)
General OCR Theory: Towards OCR-2.0 via a Unified End-to-end Model
par: Wei, Haoran, et autres
Publié: (2024)
par: Wei, Haoran, et autres
Publié: (2024)
TextMonkey: An OCR-Free Large Multimodal Model for Understanding Document
par: Liu, Yuliang, et autres
Publié: (2024)
par: Liu, Yuliang, et autres
Publié: (2024)
Real-Time Glottis Detection Framework via Spatial-decoupled Feature Learning for Nasal Transnasal Intubation
par: Liu, Jinyu, et autres
Publié: (2026)
par: Liu, Jinyu, et autres
Publié: (2026)
OCR-Quality: A Human-Annotated Dataset for OCR Quality Assessment
par: Zhang, Yulong
Publié: (2025)
par: Zhang, Yulong
Publié: (2025)
OCRBench: On the Hidden Mystery of OCR in Large Multimodal Models
par: Liu, Yuliang, et autres
Publié: (2023)
par: Liu, Yuliang, et autres
Publié: (2023)
HunyuanOCR Technical Report
par: Hunyuan Vision Team, et autres
Publié: (2025)
par: Hunyuan Vision Team, et autres
Publié: (2025)
PaddleOCR 3.0 Technical Report
par: Cui, Cheng, et autres
Publié: (2025)
par: Cui, Cheng, et autres
Publié: (2025)
OCRGenBench: A Comprehensive Benchmark for Evaluating OCR Generative Capabilities
par: Zhang, Peirong, et autres
Publié: (2025)
par: Zhang, Peirong, et autres
Publié: (2025)
Reasoning-OCR: Can Large Multimodal Models Solve Complex Logical Reasoning Problems from OCR Cues?
par: He, Haibin, et autres
Publié: (2025)
par: He, Haibin, et autres
Publié: (2025)
TextFlux: An OCR-Free DiT Model for High-Fidelity Multilingual Scene Text Synthesis
par: Xie, Yu, et autres
Publié: (2025)
par: Xie, Yu, et autres
Publié: (2025)
FinSight-Net:A Physics-Aware Decoupled Network with Frequency-Domain Compensation for Underwater Fish Detection in Smart Aquaculture
par: Yang, Jinsong, et autres
Publié: (2026)
par: Yang, Jinsong, et autres
Publié: (2026)
AuthFace: Towards Authentic Blind Face Restoration with Face-oriented Generative Diffusion Prior
par: Liang, Guoqiang, et autres
Publié: (2024)
par: Liang, Guoqiang, et autres
Publié: (2024)
FinPercep-RM: A Fine-grained Reward Model and Co-evolutionary Curriculum for RL-based Real-world Super-Resolution
par: Liu, Yidi, et autres
Publié: (2025)
par: Liu, Yidi, et autres
Publié: (2025)
A Semantic-Aware and Multi-Guided Network for Infrared-Visible Image Fusion
par: Zhang, Xiaoli, et autres
Publié: (2024)
par: Zhang, Xiaoli, et autres
Publié: (2024)
GenieDrive: Towards Physics-Aware Driving World Model with 4D Occupancy Guided Video Generation
par: Yang, Zhenya, et autres
Publié: (2025)
par: Yang, Zhenya, et autres
Publié: (2025)
Seeing is Believing? Mitigating OCR Hallucinations in Multimodal Large Language Models
par: He, Zhentao, et autres
Publié: (2025)
par: He, Zhentao, et autres
Publié: (2025)
TC-OCR: TableCraft OCR for Efficient Detection & Recognition of Table Structure & Content
par: Anand, Avinash, et autres
Publié: (2024)
par: Anand, Avinash, et autres
Publié: (2024)
SimpleOCR: Rendering Visualized Questions to Teach MLLMs to Read
par: Peng, Yibo, et autres
Publié: (2026)
par: Peng, Yibo, et autres
Publié: (2026)
Visual Attention Prompted Prediction and Learning
par: Zhang, Yifei, et autres
Publié: (2023)
par: Zhang, Yifei, et autres
Publié: (2023)
olmOCR 2: Unit Test Rewards for Document OCR
par: Poznanski, Jake, et autres
Publié: (2025)
par: Poznanski, Jake, et autres
Publié: (2025)
Physically-Grounded Manifold Projection Model for Generalizable Metal Artifact Reduction in Dental CBCT
par: Li, Zhi, et autres
Publié: (2025)
par: Li, Zhi, et autres
Publié: (2025)
Chronicles-OCR: A Cross-Temporal Perception Benchmark for the Evolutionary Trajectory of Chinese Characters
par: Li, Gengluo, et autres
Publié: (2026)
par: Li, Gengluo, et autres
Publié: (2026)
Documents similaires
-
CoMPaSS: Enhancing Spatial Understanding in Text-to-Image Diffusion Models
par: Zhang, Gaoyang, et autres
Publié: (2024) -
FinCriticalED: A Visual Benchmark for Financial Fact-Level OCR
par: He, Yueru, et autres
Publié: (2025) -
Tracing Copied Pixels and Regularizing Patch Affinity in Copy Detection
par: Lu, Yichen, et autres
Publié: (2026) -
MME-VideoOCR: Evaluating OCR-Based Capabilities of Multimodal LLMs in Video Scenarios
par: Shi, Yang, et autres
Publié: (2025) -
Rethinking the Need for Source Models: Source-Free Domain Adaptation from Scratch Guided by a Vision-Language Model
par: Bingtao, Zhou, et autres
Publié: (2026)