Robustness Evaluation of OCR-based Visual Document Understanding under Multi-Modal Adversarial Attacks
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Tien, Dong Nguyen, Le, Dung D. |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Adversarial Training with OCR Modality Perturbation for Scene-Text Visual Question Answering
par: Shen, Zhixuan, et autres
Publié: (2024)
par: Shen, Zhixuan, et autres
Publié: (2024)
ThyroidEffi 1.0: A Cost-Effective System for High-Performance Multi-Class Thyroid Carcinoma Classification
par: Pham-Ngoc, Hai, et autres
Publié: (2025)
par: Pham-Ngoc, Hai, et autres
Publié: (2025)
TextMonkey: An OCR-Free Large Multimodal Model for Understanding Document
par: Liu, Yuliang, et autres
Publié: (2024)
par: Liu, Yuliang, et autres
Publié: (2024)
Adversarial Attack for RGB-Event based Visual Object Tracking
par: Chen, Qiang, et autres
Publié: (2025)
par: Chen, Qiang, et autres
Publié: (2025)
Lost in OCR Translation? Vision-Based Approaches to Robust Document Retrieval
par: Most, Alexander, et autres
Publié: (2025)
par: Most, Alexander, et autres
Publié: (2025)
Steal Now and Attack Later: Evaluating Robustness of Object Detection against Black-box Adversarial Attacks
par: Chen, Erh-Chung, et autres
Publié: (2024)
par: Chen, Erh-Chung, et autres
Publié: (2024)
Emotion Loss Attacking: Adversarial Attack Perception for Skeleton based on Multi-dimensional Features
par: Liu, Feng, et autres
Publié: (2024)
par: Liu, Feng, et autres
Publié: (2024)
One Noise to Rule Them All: Multi-View Adversarial Attacks with Universal Perturbation
par: Ergezer, Mehmet, et autres
Publié: (2024)
par: Ergezer, Mehmet, et autres
Publié: (2024)
MonkeyOCR v1.5 Technical Report: Unlocking Robust Document Parsing for Complex Patterns
par: Zhang, Jiarui, et autres
Publié: (2025)
par: Zhang, Jiarui, et autres
Publié: (2025)
OCR is All you need: Importing Multi-Modality into Image-based Defect Detection System
par: Hsu, Chih-Chung, et autres
Publié: (2024)
par: Hsu, Chih-Chung, et autres
Publié: (2024)
Adversarial Attack Against Images Classification based on Generative Adversarial Networks
par: Yang, Yahe
Publié: (2024)
par: Yang, Yahe
Publié: (2024)
SimpleDoc: Multi-Modal Document Understanding with Dual-Cue Page Retrieval and Iterative Refinement
par: Jain, Chelsi, et autres
Publié: (2025)
par: Jain, Chelsi, et autres
Publié: (2025)
Comparing Deep Neural Network for Multi-Label ECG Diagnosis From Scanned ECG
par: Nguyen, Cuong V., et autres
Publié: (2025)
par: Nguyen, Cuong V., et autres
Publié: (2025)
MolX: Enhancing Large Language Models for Molecular Understanding With A Multi-Modal Extension
par: Le, Khiem, et autres
Publié: (2024)
par: Le, Khiem, et autres
Publié: (2024)
Shedding Light on VLN Robustness: A Black-box Framework for Indoor Lighting-based Adversarial Attack
par: Li, Chenyang, et autres
Publié: (2025)
par: Li, Chenyang, et autres
Publié: (2025)
CDUPatch: Color-Driven Universal Adversarial Patch Attack for Dual-Modal Visible-Infrared Detectors
par: Long, Jiahuan, et autres
Publié: (2025)
par: Long, Jiahuan, et autres
Publié: (2025)
Beyond Attack Success Rate: A Multi-Metric Evaluation of Adversarial Transferability in Medical Imaging Models
par: Curl, Emily, et autres
Publié: (2026)
par: Curl, Emily, et autres
Publié: (2026)
VEN-VL: A Visual Ensemble MoE Framework for Effective and Efficient Multi-Modal Understanding
par: Wu, Yinghao, et autres
Publié: (2026)
par: Wu, Yinghao, et autres
Publié: (2026)
HDC: Hierarchical Distillation for Multi-level Noisy Consistency in Semi-Supervised Fetal Ultrasound Segmentation
par: Le, Tran Quoc Khanh, et autres
Publié: (2025)
par: Le, Tran Quoc Khanh, et autres
Publié: (2025)
Enhancing Adversarial Transferability in Visual-Language Pre-training Models via Local Shuffle and Sample-based Attack
par: Liu, Xin, et autres
Publié: (2025)
par: Liu, Xin, et autres
Publié: (2025)
Concept-based Adversarial Attack: a Probabilistic Perspective
par: Zhang, Andi, et autres
Publié: (2025)
par: Zhang, Andi, et autres
Publié: (2025)
Confidence-Aware Document OCR Error Detection
par: Hemmer, Arthur, et autres
Publié: (2024)
par: Hemmer, Arthur, et autres
Publié: (2024)
Filtered-ViT: A Robust Defense Against Multiple Adversarial Patch Attacks
par: Khanal, Aja, et autres
Publié: (2025)
par: Khanal, Aja, et autres
Publié: (2025)
B-AVIBench: Towards Evaluating the Robustness of Large Vision-Language Model on Black-box Adversarial Visual-Instructions
par: Zhang, Hao, et autres
Publié: (2024)
par: Zhang, Hao, et autres
Publié: (2024)
Rethinking Gradient-based Adversarial Attacks on Point Cloud Classification
par: Chen, Jun, et autres
Publié: (2025)
par: Chen, Jun, et autres
Publié: (2025)
MADTempo: An Interactive System for Multi-Event Temporal Video Retrieval with Query Augmentation
par: Vu, Huu-An, et autres
Publié: (2025)
par: Vu, Huu-An, et autres
Publié: (2025)
Probing the Robustness of Vision-Language Pretrained Models: A Multimodal Adversarial Attack Approach
par: Guan, Jiwei, et autres
Publié: (2024)
par: Guan, Jiwei, et autres
Publié: (2024)
Securing Vision-Language Models with a Robust Encoder Against Jailbreak and Adversarial Attacks
par: Hossain, Md Zarif, et autres
Publié: (2024)
par: Hossain, Md Zarif, et autres
Publié: (2024)
Enhancing Object Detection Robustness: Detecting and Restoring Confidence in the Presence of Adversarial Patch Attacks
par: Kazoom, Roie, et autres
Publié: (2024)
par: Kazoom, Roie, et autres
Publié: (2024)
Robust-R1: Degradation-Aware Reasoning for Robust Visual Understanding
par: Tang, Jiaqi, et autres
Publié: (2025)
par: Tang, Jiaqi, et autres
Publié: (2025)
Machine Intelligence that Understands Visual and Linguistic Information and Interacts with Humans and Environments
par: Nguyen, Van Quang
Publié: (2026)
par: Nguyen, Van Quang
Publié: (2026)
Evaluating OCR performance on food packaging labels in South Africa
par: Nagayi, Mayimunah, et autres
Publié: (2025)
par: Nagayi, Mayimunah, et autres
Publié: (2025)
Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT
par: Dong, Zhuobai, et autres
Publié: (2025)
par: Dong, Zhuobai, et autres
Publié: (2025)
On the Adversarial Robustness of Large Vision-Language Models under Visual Token Compression
par: Zhang, Xinwei, et autres
Publié: (2026)
par: Zhang, Xinwei, et autres
Publié: (2026)
A Survey on MLLM-based Visually Rich Document Understanding: Methods, Challenges, and Emerging Trends
par: Ding, Yihao, et autres
Publié: (2025)
par: Ding, Yihao, et autres
Publié: (2025)
OCR-Quality: A Human-Annotated Dataset for OCR Quality Assessment
par: Zhang, Yulong
Publié: (2025)
par: Zhang, Yulong
Publié: (2025)
PerspectiveNet: Multi-View Perception for Dynamic Scene Understanding
par: Nguyen, Vinh
Publié: (2024)
par: Nguyen, Vinh
Publié: (2024)
IGL-DT: Iterative Global-Local Feature Learning with Dual-Teacher Semantic Segmentation Framework under Limited Annotation Scheme
par: Tran, Dinh Dai Quan, et autres
Publié: (2025)
par: Tran, Dinh Dai Quan, et autres
Publié: (2025)
Reading or Reasoning? Format Decoupled Reinforcement Learning for Document OCR
par: Zhong, Yufeng, et autres
Publié: (2025)
par: Zhong, Yufeng, et autres
Publié: (2025)
Architecture-Agnostic Modality-Isolated Gated Fusion for Robust Multi-Modal Prostate MRI Segmentation
par: Shu, Yongbo, et autres
Publié: (2026)
par: Shu, Yongbo, et autres
Publié: (2026)
Documents similaires
-
Adversarial Training with OCR Modality Perturbation for Scene-Text Visual Question Answering
par: Shen, Zhixuan, et autres
Publié: (2024) -
ThyroidEffi 1.0: A Cost-Effective System for High-Performance Multi-Class Thyroid Carcinoma Classification
par: Pham-Ngoc, Hai, et autres
Publié: (2025) -
TextMonkey: An OCR-Free Large Multimodal Model for Understanding Document
par: Liu, Yuliang, et autres
Publié: (2024) -
Adversarial Attack for RGB-Event based Visual Object Tracking
par: Chen, Qiang, et autres
Publié: (2025) -
Lost in OCR Translation? Vision-Based Approaches to Robust Document Retrieval
par: Most, Alexander, et autres
Publié: (2025)