ComicsPAP: understanding comic strips by picking the correct panel
Fuente:
arXiv
Salvato in:
| Autori principali: | Vivoli, Emanuele, Llabrés, Artemis, Souibgui, Mohamed Ali, Bertini, Marco, Llobet, Ernest Valveny, Karatzas, Dimosthenis |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
One missing piece in Vision and Language: A Survey on Comics Understanding
di: Vivoli, Emanuele, et al.
Pubblicazione: (2024)
di: Vivoli, Emanuele, et al.
Pubblicazione: (2024)
Multimodal Transformer for Comics Text-Cloze
di: Vivoli, Emanuele, et al.
Pubblicazione: (2024)
di: Vivoli, Emanuele, et al.
Pubblicazione: (2024)
CoSMo: A Multimodal Transformer for Page Stream Segmentation in Comic Books
di: Ortega, Marc Serra, et al.
Pubblicazione: (2025)
di: Ortega, Marc Serra, et al.
Pubblicazione: (2025)
CoMix: A Comprehensive Benchmark for Multi-Task Comic Understanding
di: Vivoli, Emanuele, et al.
Pubblicazione: (2024)
di: Vivoli, Emanuele, et al.
Pubblicazione: (2024)
ComiCap: A VLMs pipeline for dense captioning of Comic Panels
di: Vivoli, Emanuele, et al.
Pubblicazione: (2024)
di: Vivoli, Emanuele, et al.
Pubblicazione: (2024)
Image-text matching for large-scale book collections
di: Llabrés, Artemis, et al.
Pubblicazione: (2024)
di: Llabrés, Artemis, et al.
Pubblicazione: (2024)
Comics Datasets Framework: Mix of Comics datasets for detection benchmarking
di: Vivoli, Emanuele, et al.
Pubblicazione: (2024)
di: Vivoli, Emanuele, et al.
Pubblicazione: (2024)
Enhancing Document VQA Models via Retrieval-Augmented Generation
di: López, Eric, et al.
Pubblicazione: (2025)
di: López, Eric, et al.
Pubblicazione: (2025)
DocVXQA: Context-Aware Visual Explanations for Document Question Answering
di: Souibgui, Mohamed Ali, et al.
Pubblicazione: (2025)
di: Souibgui, Mohamed Ali, et al.
Pubblicazione: (2025)
Machine Unlearning for Document Classification
di: Kang, Lei, et al.
Pubblicazione: (2024)
di: Kang, Lei, et al.
Pubblicazione: (2024)
Retrieval Augmented Verification for Zero-Shot Detection of Multimodal Disinformation
di: Dey, Arka Ujjal, et al.
Pubblicazione: (2024)
di: Dey, Arka Ujjal, et al.
Pubblicazione: (2024)
Multi-Page Document Visual Question Answering using Self-Attention Scoring Mechanism
di: Kang, Lei, et al.
Pubblicazione: (2024)
di: Kang, Lei, et al.
Pubblicazione: (2024)
GRIF-DM: Generation of Rich Impression Fonts using Diffusion Models
di: Kang, Lei, et al.
Pubblicazione: (2024)
di: Kang, Lei, et al.
Pubblicazione: (2024)
Learning Quantifiable Visual Explanations Without Ground-Truth
di: Singh, Amritpal, et al.
Pubblicazione: (2026)
di: Singh, Amritpal, et al.
Pubblicazione: (2026)
Reading in the Dark: Low-light Scene Text Recognition
di: Fu, Xuanshuo, et al.
Pubblicazione: (2026)
di: Fu, Xuanshuo, et al.
Pubblicazione: (2026)
Preserving Privacy Without Compromising Accuracy: Machine Unlearning for Handwritten Text Recognition
di: Kang, Lei, et al.
Pubblicazione: (2025)
di: Kang, Lei, et al.
Pubblicazione: (2025)
HoloMine: A Synthetic Dataset for Buried Landmines Recognition using Microwave Holographic Imaging
di: Vivoli, Emanuele, et al.
Pubblicazione: (2025)
di: Vivoli, Emanuele, et al.
Pubblicazione: (2025)
A Fast Hierarchical Method for Multi-script and Arbitrary Oriented Scene Text Extraction
di: Gomez, Lluis, et al.
Pubblicazione: (2014)
di: Gomez, Lluis, et al.
Pubblicazione: (2014)
Privacy-Aware Document Visual Question Answering
di: Tito, Rubèn, et al.
Pubblicazione: (2023)
di: Tito, Rubèn, et al.
Pubblicazione: (2023)
Counterfeit Answers: Adversarial Forgery against OCR-Free Document Visual Question Answering
di: Pintore, Marco, et al.
Pubblicazione: (2025)
di: Pintore, Marco, et al.
Pubblicazione: (2025)
Federated Document Visual Question Answering: A Pilot Study
di: Nguyen, Khanh, et al.
Pubblicazione: (2024)
di: Nguyen, Khanh, et al.
Pubblicazione: (2024)
TRIM: A Self-Supervised Video Summarization Framework Maximizing Temporal Relative Information and Representativeness
di: Mishra, Pritam, et al.
Pubblicazione: (2025)
di: Mishra, Pritam, et al.
Pubblicazione: (2025)
TRIMMER: A New Paradigm for Video Summarization through Self-Supervised Reinforcement Learning
di: Mishra, Pritam, et al.
Pubblicazione: (2026)
di: Mishra, Pritam, et al.
Pubblicazione: (2026)
ORCA: Orchestrated Reasoning with Collaborative Agents for Document Visual Question Answering
di: Lassoued, Aymen, et al.
Pubblicazione: (2026)
di: Lassoued, Aymen, et al.
Pubblicazione: (2026)
A Benchmark for Symbolic Reasoning from Pixel Sequences: Grid-Level Visual Completion and Correction
di: Kang, Lei, et al.
Pubblicazione: (2025)
di: Kang, Lei, et al.
Pubblicazione: (2025)
AVIR: Adaptive Visual In-Document Retrieval for Efficient Multi-Page Document Question Answering
di: Li, Zongmin, et al.
Pubblicazione: (2026)
di: Li, Zongmin, et al.
Pubblicazione: (2026)
Towards Generative Class Prompt Learning for Fine-grained Visual Recognition
di: Chattopadhyay, Soumitri, et al.
Pubblicazione: (2024)
di: Chattopadhyay, Soumitri, et al.
Pubblicazione: (2024)
Reading Between the Lanes: Text VideoQA on the Road
di: Tom, George, et al.
Pubblicazione: (2023)
di: Tom, George, et al.
Pubblicazione: (2023)
xLSTM-ECG: Multi-label ECG Classification via Feature Fusion with xLSTM
di: Kang, Lei, et al.
Pubblicazione: (2025)
di: Kang, Lei, et al.
Pubblicazione: (2025)
Spatially Grounded Explanations in Vision Language Models for Document Visual Question Answering
di: Lagos, Maximiliano Hormazábal, et al.
Pubblicazione: (2025)
di: Lagos, Maximiliano Hormazábal, et al.
Pubblicazione: (2025)
NeurIPS 2023 Competition: Privacy Preserving Federated Learning Document VQA
di: Tobaben, Marlon, et al.
Pubblicazione: (2024)
di: Tobaben, Marlon, et al.
Pubblicazione: (2024)
CSSL-MHTR: Continual Self-Supervised Learning for Scalable Multi-script Handwritten Text Recognition
di: Dhiaf, Marwa, et al.
Pubblicazione: (2023)
di: Dhiaf, Marwa, et al.
Pubblicazione: (2023)
LLM-Driven Medical Document Analysis: Enhancing Trustworthy Pathology and Differential Diagnosis
di: Kang, Lei, et al.
Pubblicazione: (2025)
di: Kang, Lei, et al.
Pubblicazione: (2025)
LayeredDoc: Domain Adaptive Document Restoration with a Layer Separation Approach
di: Pilligua, Maria, et al.
Pubblicazione: (2024)
di: Pilligua, Maria, et al.
Pubblicazione: (2024)
NeuralLVC: Neural Lossless Video Compression via Masked Diffusion with Temporal Conditioning
di: Uricchio, Tiberio, et al.
Pubblicazione: (2026)
di: Uricchio, Tiberio, et al.
Pubblicazione: (2026)
Retrieval Augmented Comic Image Generation
di: Shui, Yunhao, et al.
Pubblicazione: (2025)
di: Shui, Yunhao, et al.
Pubblicazione: (2025)
The Manga Whisperer: Automatically Generating Transcriptions for Comics
di: Sachdeva, Ragav, et al.
Pubblicazione: (2024)
di: Sachdeva, Ragav, et al.
Pubblicazione: (2024)
Quality-Aware Image-Text Alignment for Opinion-Unaware Image Quality Assessment
di: Agnolucci, Lorenzo, et al.
Pubblicazione: (2024)
di: Agnolucci, Lorenzo, et al.
Pubblicazione: (2024)
Zooming into Comics: Region-Aware RL Improves Fine-Grained Comic Understanding in Vision-Language Models
di: Chen, Yule, et al.
Pubblicazione: (2025)
di: Chen, Yule, et al.
Pubblicazione: (2025)
From Panels to Prose: Generating Literary Narratives from Comics
di: Sachdeva, Ragav, et al.
Pubblicazione: (2025)
di: Sachdeva, Ragav, et al.
Pubblicazione: (2025)
Documenti analoghi
-
One missing piece in Vision and Language: A Survey on Comics Understanding
di: Vivoli, Emanuele, et al.
Pubblicazione: (2024) -
Multimodal Transformer for Comics Text-Cloze
di: Vivoli, Emanuele, et al.
Pubblicazione: (2024) -
CoSMo: A Multimodal Transformer for Page Stream Segmentation in Comic Books
di: Ortega, Marc Serra, et al.
Pubblicazione: (2025) -
CoMix: A Comprehensive Benchmark for Multi-Task Comic Understanding
di: Vivoli, Emanuele, et al.
Pubblicazione: (2024) -
ComiCap: A VLMs pipeline for dense captioning of Comic Panels
di: Vivoli, Emanuele, et al.
Pubblicazione: (2024)