DEVICE: Depth and Visual Concepts Aware Transformer for OCR-based Image Captioning
Fuente:
arXiv
Salvato in:
| Autori principali: | Xu, Dongsheng, Huang, Qingbao, Zhang, Xingmao, Cheng, Haonan, Shuang, Feng, Cai, Yi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Visually-Aware Context Modeling for News Image Captioning
di: Qu, Tingyu, et al.
Pubblicazione: (2023)
di: Qu, Tingyu, et al.
Pubblicazione: (2023)
Shifted Window Fourier Transform And Retention For Image Captioning
di: Hu, Jia Cheng, et al.
Pubblicazione: (2024)
di: Hu, Jia Cheng, et al.
Pubblicazione: (2024)
Capturing Rich Behavior Representations: A Dynamic Action Semantic-Aware Graph Transformer for Video Captioning
di: Liu, Caihua, et al.
Pubblicazione: (2025)
di: Liu, Caihua, et al.
Pubblicazione: (2025)
OwlCap: Harmonizing Motion-Detail for Video Captioning via HMD-270K and Caption Set Equivalence Reward
di: Zhong, Chunlin, et al.
Pubblicazione: (2025)
di: Zhong, Chunlin, et al.
Pubblicazione: (2025)
Adversarial Training with OCR Modality Perturbation for Scene-Text Visual Question Answering
di: Shen, Zhixuan, et al.
Pubblicazione: (2024)
di: Shen, Zhixuan, et al.
Pubblicazione: (2024)
TimeChat-Captioner: Scripting Multi-Scene Videos with Time-Aware and Structural Audio-Visual Captions
di: Yao, Linli, et al.
Pubblicazione: (2026)
di: Yao, Linli, et al.
Pubblicazione: (2026)
A Novel Lightweight Transformer with Edge-Aware Fusion for Remote Sensing Image Captioning
di: Das, Swadhin, et al.
Pubblicazione: (2025)
di: Das, Swadhin, et al.
Pubblicazione: (2025)
Exploring Interpretability for Visual Prompt Tuning with Cross-layer Concepts
di: Wang, Yubin, et al.
Pubblicazione: (2025)
di: Wang, Yubin, et al.
Pubblicazione: (2025)
Top-Down Framework for Weakly-supervised Grounded Image Captioning
di: Cai, Chen, et al.
Pubblicazione: (2023)
di: Cai, Chen, et al.
Pubblicazione: (2023)
GeReA: Question-Aware Prompt Captions for Knowledge-based Visual Question Answering
di: Ma, Ziyu, et al.
Pubblicazione: (2024)
di: Ma, Ziyu, et al.
Pubblicazione: (2024)
Dual-Stream Collaborative Transformer for Image Captioning
di: Wan, Jun, et al.
Pubblicazione: (2026)
di: Wan, Jun, et al.
Pubblicazione: (2026)
Aesthetic Image Captioning with Saliency Enhanced MLLMs
di: Tao, Yilin, et al.
Pubblicazione: (2025)
di: Tao, Yilin, et al.
Pubblicazione: (2025)
Masked Diffusion Captioning for Visual Feature Learning
di: Feng, Chao, et al.
Pubblicazione: (2025)
di: Feng, Chao, et al.
Pubblicazione: (2025)
PreP-OCR: A Complete Pipeline for Document Image Restoration and Enhanced OCR Accuracy
di: Guan, Shuhao, et al.
Pubblicazione: (2025)
di: Guan, Shuhao, et al.
Pubblicazione: (2025)
BACON: Improving Clarity of Image Captions via Bag-of-Concept Graphs
di: Yang, Zhantao, et al.
Pubblicazione: (2024)
di: Yang, Zhantao, et al.
Pubblicazione: (2024)
CaptionQA: Is Your Caption as Useful as the Image Itself?
di: Yang, Shijia, et al.
Pubblicazione: (2025)
di: Yang, Shijia, et al.
Pubblicazione: (2025)
Transformer based Multitask Learning for Image Captioning and Object Detection
di: Basak, Debolena, et al.
Pubblicazione: (2024)
di: Basak, Debolena, et al.
Pubblicazione: (2024)
ViTOC: Vision Transformer and Object-aware Captioner
di: Huang, Feiyang
Pubblicazione: (2024)
di: Huang, Feiyang
Pubblicazione: (2024)
From Image Captioning to Visual Storytelling
di: Passadakis, Admitos, et al.
Pubblicazione: (2025)
di: Passadakis, Admitos, et al.
Pubblicazione: (2025)
When Good OCR Is Not Enough: Benchmarking OCR Robustness for Retrieval-Augmented Generation
di: Sun, Lin, et al.
Pubblicazione: (2026)
di: Sun, Lin, et al.
Pubblicazione: (2026)
UIT-DarkCow team at ImageCLEFmedical Caption 2024: Diagnostic Captioning for Radiology Images Efficiency with Transformer Models
di: Van Nguyen, Quan, et al.
Pubblicazione: (2024)
di: Van Nguyen, Quan, et al.
Pubblicazione: (2024)
L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training
di: Li, Li, et al.
Pubblicazione: (2025)
di: Li, Li, et al.
Pubblicazione: (2025)
CultureCLIP: Empowering CLIP with Cultural Awareness through Synthetic Images and Contextualized Captions
di: Huang, Yuchen, et al.
Pubblicazione: (2025)
di: Huang, Yuchen, et al.
Pubblicazione: (2025)
Automated Image Captioning with CNNs and Transformers
di: Cahyono, Joshua Adrian, et al.
Pubblicazione: (2024)
di: Cahyono, Joshua Adrian, et al.
Pubblicazione: (2024)
Context-Independent OCR with Multimodal LLMs: Effects of Image Resolution and Visual Complexity
di: Inoue, Kotaro
Pubblicazione: (2025)
di: Inoue, Kotaro
Pubblicazione: (2025)
OCR-Agent: Agentic OCR with Capability and Memory Reflection
di: Wen, Shimin, et al.
Pubblicazione: (2026)
di: Wen, Shimin, et al.
Pubblicazione: (2026)
OmniOCR: Generalist OCR for Ethnic Minority Languages
di: Liu, Bonan, et al.
Pubblicazione: (2026)
di: Liu, Bonan, et al.
Pubblicazione: (2026)
Multimodal Arabic Captioning with Interpretable Visual Concept Integration
di: Elchafei, Passant, et al.
Pubblicazione: (2025)
di: Elchafei, Passant, et al.
Pubblicazione: (2025)
DS@BioMed at ImageCLEFmedical Caption 2024: Enhanced Attention Mechanisms in Medical Caption Generation through Concept Detection Integration
di: Nguyen, Nhi Ngoc-Yen, et al.
Pubblicazione: (2024)
di: Nguyen, Nhi Ngoc-Yen, et al.
Pubblicazione: (2024)
ABot-OCR Technical Report
di: Jiang, Kaitao, et al.
Pubblicazione: (2026)
di: Jiang, Kaitao, et al.
Pubblicazione: (2026)
Group Relative Policy Optimization for Image Captioning
di: Liang, Xu
Pubblicazione: (2025)
di: Liang, Xu
Pubblicazione: (2025)
Image Captioning in news report scenario
di: Liu, Tianrui, et al.
Pubblicazione: (2024)
di: Liu, Tianrui, et al.
Pubblicazione: (2024)
RxnCaption: Reformulating Reaction Diagram Parsing as Visual Prompt Guided Captioning
di: Song, Jiahe, et al.
Pubblicazione: (2025)
di: Song, Jiahe, et al.
Pubblicazione: (2025)
Do More Details Always Introduce More Hallucinations in LVLM-based Image Captioning?
di: Feng, Mingqian, et al.
Pubblicazione: (2024)
di: Feng, Mingqian, et al.
Pubblicazione: (2024)
EVENT-Retriever: Event-Aware Multimodal Image Retrieval for Realistic Captions
di: Vo, Dinh-Khoi, et al.
Pubblicazione: (2025)
di: Vo, Dinh-Khoi, et al.
Pubblicazione: (2025)
ITP: Instance-Aware Test Pruning for Out-of-Distribution Detection
di: Xu, Haonan, et al.
Pubblicazione: (2024)
di: Xu, Haonan, et al.
Pubblicazione: (2024)
Lesion-Aware Visual-Language Fusion for Automated Image Captioning of Ulcerative Colitis Endoscopic Examinations
di: Escamilla, Alexis Ivan Lopez, et al.
Pubblicazione: (2025)
di: Escamilla, Alexis Ivan Lopez, et al.
Pubblicazione: (2025)
ViConEx-Med: Visual Concept Explainability via Multi-Concept Token Transformer for Medical Image Analysis
di: Patrício, Cristiano, et al.
Pubblicazione: (2025)
di: Patrício, Cristiano, et al.
Pubblicazione: (2025)
FinCriticalED: A Visual Benchmark for Financial Fact-Level OCR
di: He, Yueru, et al.
Pubblicazione: (2025)
di: He, Yueru, et al.
Pubblicazione: (2025)
MetaCaptioner: Towards Generalist Visual Captioning with Open-source Suites
di: Lei, Zhenxin, et al.
Pubblicazione: (2025)
di: Lei, Zhenxin, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Visually-Aware Context Modeling for News Image Captioning
di: Qu, Tingyu, et al.
Pubblicazione: (2023) -
Shifted Window Fourier Transform And Retention For Image Captioning
di: Hu, Jia Cheng, et al.
Pubblicazione: (2024) -
Capturing Rich Behavior Representations: A Dynamic Action Semantic-Aware Graph Transformer for Video Captioning
di: Liu, Caihua, et al.
Pubblicazione: (2025) -
OwlCap: Harmonizing Motion-Detail for Video Captioning via HMD-270K and Caption Set Equivalence Reward
di: Zhong, Chunlin, et al.
Pubblicazione: (2025) -
Adversarial Training with OCR Modality Perturbation for Scene-Text Visual Question Answering
di: Shen, Zhixuan, et al.
Pubblicazione: (2024)