LOCR: Location-Guided Transformer for Optical Character Recognition
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Sun, Yu, Zhou, Dongzhan, Lin, Chen, He, Conghui, Ouyang, Wanli, Zhong, Han-Sen |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Image Over Text: Transforming Formula Recognition Evaluation with Character Detection Matching
par: Wang, Bin, et autres
Publié: (2024)
par: Wang, Bin, et autres
Publié: (2024)
Logios : An open source Greek Polytonic Optical Character Recognition system
par: Konstantinos, Perifanos, et autres
Publié: (2025)
par: Konstantinos, Perifanos, et autres
Publié: (2025)
Rethinking Genomic Modeling Through Optical Character Recognition
par: Xiang, Hongxin, et autres
Publié: (2026)
par: Xiang, Hongxin, et autres
Publié: (2026)
$Δ$-AttnMask: Attention-Guided Masked Hidden States for Efficient Data Selection and Augmentation
par: Hu, Jucheng, et autres
Publié: (2025)
par: Hu, Jucheng, et autres
Publié: (2025)
Low-Resource Heuristics for Bahnaric Optical Character Recognition Improvement
par: Tran, Phat, et autres
Publié: (2026)
par: Tran, Phat, et autres
Publié: (2026)
Qalam : A Multimodal LLM for Arabic Optical Character and Handwriting Recognition
par: Bhatia, Gagan, et autres
Publié: (2024)
par: Bhatia, Gagan, et autres
Publié: (2024)
Ancient but Digitized: Developing Handwritten Optical Character Recognition for East Syriac Script Through Creating KHAMIS Dataset
par: Majeed, Ameer, et autres
Publié: (2024)
par: Majeed, Ameer, et autres
Publié: (2024)
A CLIP-Powered Framework for Robust and Generalizable Data Selection
par: Yang, Suorong, et autres
Publié: (2024)
par: Yang, Suorong, et autres
Publié: (2024)
Similarity Guided Multimodal Fusion Transformer for Semantic Location Prediction in Social Media
par: Zhang, Zhizhen, et autres
Publié: (2024)
par: Zhang, Zhizhen, et autres
Publié: (2024)
Beyond Hallucinations: Enhancing LVLMs through Hallucination-Aware Direct Preference Optimization
par: Zhao, Zhiyuan, et autres
Publié: (2023)
par: Zhao, Zhiyuan, et autres
Publié: (2023)
Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning
par: Zhang, Di, et autres
Publié: (2024)
par: Zhang, Di, et autres
Publié: (2024)
Attention Reallocation: Towards Zero-cost and Controllable Hallucination Mitigation of MLLMs
par: Tu, Chongjun, et autres
Publié: (2025)
par: Tu, Chongjun, et autres
Publié: (2025)
AgenticOCR: Parsing Only What You Need for Efficient Retrieval-Augmented Generation
par: Wang, Zhengren, et autres
Publié: (2026)
par: Wang, Zhengren, et autres
Publié: (2026)
Token Pruning in Multimodal Large Language Models: Are We Solving the Right Problem?
par: Wen, Zichen, et autres
Publié: (2025)
par: Wen, Zichen, et autres
Publié: (2025)
Multimodal-Guided Dynamic Dataset Pruning for Robust and Efficient Data-Centric Learning
par: Yang, Suorong, et autres
Publié: (2025)
par: Yang, Suorong, et autres
Publié: (2025)
SignX: Continuous Sign Recognition in Compact Pose-Rich Latent Space
par: Fang, Sen, et autres
Publié: (2025)
par: Fang, Sen, et autres
Publié: (2025)
A Renaissance of Explicit Motion Information Mining from Transformers for Action Recognition
par: Zhuang, Peiqin, et autres
Publié: (2025)
par: Zhuang, Peiqin, et autres
Publié: (2025)
Hallucination at a Glance: Controlled Visual Edits and Fine-Grained Multimodal Learning
par: Bai, Tianyi, et autres
Publié: (2025)
par: Bai, Tianyi, et autres
Publié: (2025)
Octavius: Mitigating Task Interference in MLLMs via LoRA-MoE
par: Chen, Zeren, et autres
Publié: (2023)
par: Chen, Zeren, et autres
Publié: (2023)
TCFormer: Visual Recognition via Token Clustering Transformer
par: Zeng, Wang, et autres
Publié: (2024)
par: Zeng, Wang, et autres
Publié: (2024)
Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification
par: Bai, Tianyi, et autres
Publié: (2025)
par: Bai, Tianyi, et autres
Publié: (2025)
CMT: A Cascade MAR with Topology Predictor for Multimodal Conditional CAD Generation
par: Wu, Jianyu, et autres
Publié: (2025)
par: Wu, Jianyu, et autres
Publié: (2025)
SynthVLM: Towards High-Quality and Efficient Synthesis of Image-Caption Datasets for Vision-Language Models
par: Liu, Zheng, et autres
Publié: (2024)
par: Liu, Zheng, et autres
Publié: (2024)
CLEAR: Character Unlearning in Textual and Visual Modalities
par: Dontsov, Alexey, et autres
Publié: (2024)
par: Dontsov, Alexey, et autres
Publié: (2024)
From Perception to Reasoning: Deep Thinking Empowers Multimodal Large Language Models
par: Zhu, Wenxin, et autres
Publié: (2025)
par: Zhu, Wenxin, et autres
Publié: (2025)
Through the Lens of Character: Resolving Modality-Role Interference in Multimodal Role-Playing Agent
par: Tang, Yihong, et autres
Publié: (2026)
par: Tang, Yihong, et autres
Publié: (2026)
LLMs as Bridges: Reformulating Grounded Multimodal Named Entity Recognition
par: Li, Jinyuan, et autres
Publié: (2024)
par: Li, Jinyuan, et autres
Publié: (2024)
Invizo: Arabic Handwritten Document Optical Character Recognition Solution
par: Waly, Alhossien, et autres
Publié: (2025)
par: Waly, Alhossien, et autres
Publié: (2025)
Actial: Activate Spatial Reasoning Ability of Multimodal Large Language Models
par: Zhan, Xiaoyu, et autres
Publié: (2025)
par: Zhan, Xiaoyu, et autres
Publié: (2025)
Dolphin: Moving Towards Closed-loop Auto-research through Thinking, Practice, and Feedback
par: Yuan, Jiakang, et autres
Publié: (2025)
par: Yuan, Jiakang, et autres
Publié: (2025)
MindBench: A Comprehensive Benchmark for Mind Map Structure Recognition and Analysis
par: Chen, Lei, et autres
Publié: (2024)
par: Chen, Lei, et autres
Publié: (2024)
VisRAG 2.0: Evidence-Guided Multi-Image Reasoning in Visual Retrieval-Augmented Generation
par: Sun, Yubo, et autres
Publié: (2025)
par: Sun, Yubo, et autres
Publié: (2025)
MMBench: Is Your Multi-modal Model an All-around Player?
par: Liu, Yuan, et autres
Publié: (2023)
par: Liu, Yuan, et autres
Publié: (2023)
OmniCharacter: Towards Immersive Role-Playing Agents with Seamless Speech-Language Personality Interaction
par: Zhang, Haonan, et autres
Publié: (2025)
par: Zhang, Haonan, et autres
Publié: (2025)
Unsupervised Attention Regularization Based Domain Adaptation for Oracle Character Recognition
par: Wang, Mei, et autres
Publié: (2024)
par: Wang, Mei, et autres
Publié: (2024)
Stop Looking for Important Tokens in Multimodal Language Models: Duplication Matters More
par: Wen, Zichen, et autres
Publié: (2025)
par: Wen, Zichen, et autres
Publié: (2025)
CHURRO: Making History Readable with an Open-Weight Large Vision-Language Model for High-Accuracy, Low-Cost Historical Text Recognition
par: Semnani, Sina J., et autres
Publié: (2025)
par: Semnani, Sina J., et autres
Publié: (2025)
ComfyBench: Benchmarking LLM-based Agents in ComfyUI for Autonomously Designing Collaborative AI Systems
par: Xue, Xiangyuan, et autres
Publié: (2024)
par: Xue, Xiangyuan, et autres
Publié: (2024)
Expanding the Boundaries of Vision Prior Knowledge in Multi-modal Large Language Models
par: Liang, Qiao, et autres
Publié: (2025)
par: Liang, Qiao, et autres
Publié: (2025)
InternLM-XComposer-2.5: A Versatile Large Vision Language Model Supporting Long-Contextual Input and Output
par: Zhang, Pan, et autres
Publié: (2024)
par: Zhang, Pan, et autres
Publié: (2024)
Documents similaires
-
Image Over Text: Transforming Formula Recognition Evaluation with Character Detection Matching
par: Wang, Bin, et autres
Publié: (2024) -
Logios : An open source Greek Polytonic Optical Character Recognition system
par: Konstantinos, Perifanos, et autres
Publié: (2025) -
Rethinking Genomic Modeling Through Optical Character Recognition
par: Xiang, Hongxin, et autres
Publié: (2026) -
$Δ$-AttnMask: Attention-Guided Masked Hidden States for Efficient Data Selection and Augmentation
par: Hu, Jucheng, et autres
Publié: (2025) -
Low-Resource Heuristics for Bahnaric Optical Character Recognition Improvement
par: Tran, Phat, et autres
Publié: (2026)