From Panels to Prose: Generating Literary Narratives from Comics
Fuente:
arXiv
Salvato in:
| Autori principali: | Sachdeva, Ragav, Zisserman, Andrew |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
The Manga Whisperer: Automatically Generating Transcriptions for Comics
di: Sachdeva, Ragav, et al.
Pubblicazione: (2024)
di: Sachdeva, Ragav, et al.
Pubblicazione: (2024)
Tails Tell Tales: Chapter-Wide Manga Transcriptions with Character Names
di: Sachdeva, Ragav, et al.
Pubblicazione: (2024)
di: Sachdeva, Ragav, et al.
Pubblicazione: (2024)
CountGD++: Generalized Prompting for Open-World Counting
di: Amini-Naieni, Niki, et al.
Pubblicazione: (2025)
di: Amini-Naieni, Niki, et al.
Pubblicazione: (2025)
ComiCap: A VLMs pipeline for dense captioning of Comic Panels
di: Vivoli, Emanuele, et al.
Pubblicazione: (2024)
di: Vivoli, Emanuele, et al.
Pubblicazione: (2024)
Personalizing Retrieval using Joint Embeddings or "the Return of Fluffy"
di: Korbar, Bruno, et al.
Pubblicazione: (2025)
di: Korbar, Bruno, et al.
Pubblicazione: (2025)
Chirality in Action: Time-Aware Video Representation Learning by Latent Straightening
di: Bagad, Piyush, et al.
Pubblicazione: (2025)
di: Bagad, Piyush, et al.
Pubblicazione: (2025)
Retrieval Augmented Comic Image Generation
di: Shui, Yunhao, et al.
Pubblicazione: (2025)
di: Shui, Yunhao, et al.
Pubblicazione: (2025)
From 3D Pose to Prose: Biomechanics-Grounded Vision--Language Coaching
di: Ji, Yuyang, et al.
Pubblicazione: (2026)
di: Ji, Yuyang, et al.
Pubblicazione: (2026)
A General Protocol to Probe Large Vision Models for 3D Physical Understanding
di: Zhan, Guanqi, et al.
Pubblicazione: (2023)
di: Zhan, Guanqi, et al.
Pubblicazione: (2023)
Recognising BSL Fingerspelling in Continuous Signing Sequences
di: Chan, Alyssa, et al.
Pubblicazione: (2026)
di: Chan, Alyssa, et al.
Pubblicazione: (2026)
Appearance-Based Refinement for Object-Centric Motion Segmentation
di: Xie, Junyu, et al.
Pubblicazione: (2023)
di: Xie, Junyu, et al.
Pubblicazione: (2023)
Adapting MLLMs for Nuanced Video Retrieval
di: Bagad, Piyush, et al.
Pubblicazione: (2025)
di: Bagad, Piyush, et al.
Pubblicazione: (2025)
Comics Datasets Framework: Mix of Comics datasets for detection benchmarking
di: Vivoli, Emanuele, et al.
Pubblicazione: (2024)
di: Vivoli, Emanuele, et al.
Pubblicazione: (2024)
CountGD: Multi-Modal Open-World Counting
di: Amini-Naieni, Niki, et al.
Pubblicazione: (2024)
di: Amini-Naieni, Niki, et al.
Pubblicazione: (2024)
Open-World Object Counting in Videos
di: Amini-Naieni, Niki, et al.
Pubblicazione: (2025)
di: Amini-Naieni, Niki, et al.
Pubblicazione: (2025)
New keypoint-based approach for recognising British Sign Language (BSL) from sequences
di: Deb, Oishi, et al.
Pubblicazione: (2024)
di: Deb, Oishi, et al.
Pubblicazione: (2024)
Recognizing Co-Speech Gestures in-the-Wild
di: Hegde, Sindhu B, et al.
Pubblicazione: (2026)
di: Hegde, Sindhu B, et al.
Pubblicazione: (2026)
Amodal Ground Truth and Completion in the Wild
di: Zhan, Guanqi, et al.
Pubblicazione: (2023)
di: Zhan, Guanqi, et al.
Pubblicazione: (2023)
It's Just Another Day: Unique Video Captioning by Discriminative Prompting
di: Perrett, Toby, et al.
Pubblicazione: (2024)
di: Perrett, Toby, et al.
Pubblicazione: (2024)
Moving Object Segmentation: All You Need Is SAM (and Flow)
di: Xie, Junyu, et al.
Pubblicazione: (2024)
di: Xie, Junyu, et al.
Pubblicazione: (2024)
GMOS: Grounding Moving Object Segmentation in 3D Space and Time
di: Xie, Junyu, et al.
Pubblicazione: (2026)
di: Xie, Junyu, et al.
Pubblicazione: (2026)
From Pixels to Prose: A Large Dataset of Dense Image Captions
di: Singla, Vasu, et al.
Pubblicazione: (2024)
di: Singla, Vasu, et al.
Pubblicazione: (2024)
Seeing without Pixels: Perception from Camera Trajectories
di: Xue, Zihui, et al.
Pubblicazione: (2025)
di: Xue, Zihui, et al.
Pubblicazione: (2025)
Pixels to Prose: Understanding the art of Image Captioning
di: Singh, Hrishikesh, et al.
Pubblicazione: (2024)
di: Singh, Hrishikesh, et al.
Pubblicazione: (2024)
Made to Order: Discovering monotonic temporal changes via self-supervised video ordering
di: Yang, Charig, et al.
Pubblicazione: (2024)
di: Yang, Charig, et al.
Pubblicazione: (2024)
Multimodal Transformer for Comics Text-Cloze
di: Vivoli, Emanuele, et al.
Pubblicazione: (2024)
di: Vivoli, Emanuele, et al.
Pubblicazione: (2024)
3D Spine Shape Estimation from Single 2D DXA
di: Bourigault, Emmanuelle, et al.
Pubblicazione: (2024)
di: Bourigault, Emmanuelle, et al.
Pubblicazione: (2024)
Advanced Knowledge Extraction of Physical Design Drawings, Translation and conversion to CAD formats using Deep Learning
di: M, Jesher Joshua, et al.
Pubblicazione: (2024)
di: M, Jesher Joshua, et al.
Pubblicazione: (2024)
Inferring Dynamic Physical Properties from Video Foundation Models
di: Zhan, Guanqi, et al.
Pubblicazione: (2025)
di: Zhan, Guanqi, et al.
Pubblicazione: (2025)
Character-Centric Understanding of Animated Movies
di: Gui, Zhongrui, et al.
Pubblicazione: (2025)
di: Gui, Zhongrui, et al.
Pubblicazione: (2025)
ELIP: Enhanced Visual-Language Foundation Models for Image Retrieval
di: Zhan, Guanqi, et al.
Pubblicazione: (2025)
di: Zhan, Guanqi, et al.
Pubblicazione: (2025)
Understanding Co-speech Gestures in-the-wild
di: Hegde, Sindhu B, et al.
Pubblicazione: (2025)
di: Hegde, Sindhu B, et al.
Pubblicazione: (2025)
Lost in Translation, Found in Context: Sign Language Translation with Contextual Cues
di: Jang, Youngjoon, et al.
Pubblicazione: (2025)
di: Jang, Youngjoon, et al.
Pubblicazione: (2025)
TIM: A Time Interval Machine for Audio-Visual Action Recognition
di: Chalk, Jacob, et al.
Pubblicazione: (2024)
di: Chalk, Jacob, et al.
Pubblicazione: (2024)
Text-Conditioned Resampler For Long Form Video Understanding
di: Korbar, Bruno, et al.
Pubblicazione: (2023)
di: Korbar, Bruno, et al.
Pubblicazione: (2023)
Character-aware audio-visual subtitling in context
di: Huh, Jaesung, et al.
Pubblicazione: (2024)
di: Huh, Jaesung, et al.
Pubblicazione: (2024)
From Pixels to Prose: Advancing Multi-Modal Language Models for Remote Sensing
di: Sun, Xintian, et al.
Pubblicazione: (2024)
di: Sun, Xintian, et al.
Pubblicazione: (2024)
Shot-by-Shot: Film-Grammar-Aware Training-Free Audio Description Generation
di: Xie, Junyu, et al.
Pubblicazione: (2025)
di: Xie, Junyu, et al.
Pubblicazione: (2025)
OPRO: Orthogonal Panel-Relative Operators for Panel-Aware In-Context Image Generation
di: Lee, Sanghyeon, et al.
Pubblicazione: (2026)
di: Lee, Sanghyeon, et al.
Pubblicazione: (2026)
ComicsPAP: understanding comic strips by picking the correct panel
di: Vivoli, Emanuele, et al.
Pubblicazione: (2025)
di: Vivoli, Emanuele, et al.
Pubblicazione: (2025)
Documenti analoghi
-
The Manga Whisperer: Automatically Generating Transcriptions for Comics
di: Sachdeva, Ragav, et al.
Pubblicazione: (2024) -
Tails Tell Tales: Chapter-Wide Manga Transcriptions with Character Names
di: Sachdeva, Ragav, et al.
Pubblicazione: (2024) -
CountGD++: Generalized Prompting for Open-World Counting
di: Amini-Naieni, Niki, et al.
Pubblicazione: (2025) -
ComiCap: A VLMs pipeline for dense captioning of Comic Panels
di: Vivoli, Emanuele, et al.
Pubblicazione: (2024) -
Personalizing Retrieval using Joint Embeddings or "the Return of Fluffy"
di: Korbar, Bruno, et al.
Pubblicazione: (2025)