Unlocking Comics: The AI4VA Dataset for Visual Understanding
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Grönquist, Peter, Bhattacharjee, Deblina, Aydemir, Bahar, Ozaydin, Baran, Zhang, Tong, Salzmann, Mathieu, Süsstrunk, Sabine |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
OMH: Structured Sparsity via Optimally Matched Hierarchy for Unsupervised Semantic Segmentation
par: Ozaydin, Baran, et autres
Publié: (2024)
par: Ozaydin, Baran, et autres
Publié: (2024)
Data Augmentation via Latent Diffusion for Saliency Prediction
par: Aydemir, Bahar, et autres
Publié: (2024)
par: Aydemir, Bahar, et autres
Publié: (2024)
DSI2I: Dense Style for Unpaired Image-to-Image Translation
par: Ozaydin, Baran, et autres
Publié: (2022)
par: Ozaydin, Baran, et autres
Publié: (2022)
TempSAL -- Uncovering Temporal Information for Deep Saliency Prediction
par: Aydemir, Bahar, et autres
Publié: (2023)
par: Aydemir, Bahar, et autres
Publié: (2023)
x-RAGE: eXtended Reality -- Action & Gesture Events Dataset
par: Parmar, Vivek, et autres
Publié: (2024)
par: Parmar, Vivek, et autres
Publié: (2024)
A Manually Annotated Image-Caption Dataset for Detecting Children in the Wild
par: Kireev, Klim, et autres
Publié: (2025)
par: Kireev, Klim, et autres
Publié: (2025)
Self-evolving Embodied AI
par: Feng, Tongtong, et autres
Publié: (2026)
par: Feng, Tongtong, et autres
Publié: (2026)
Introducing Nylon Face Mask Attacks: A Dataset for Evaluating Generalised Face Presentation Attack Detection
par: Manasa, et autres
Publié: (2025)
par: Manasa, et autres
Publié: (2025)
Multi-Image Super Resolution Framework for Detection and Analysis of Plant Roots
par: Agarwal, Shubham, et autres
Publié: (2026)
par: Agarwal, Shubham, et autres
Publié: (2026)
VOLMO: Versatile and Open Large Models for Ophthalmology
par: Qin, Zhenyue, et autres
Publié: (2026)
par: Qin, Zhenyue, et autres
Publié: (2026)
Evaluating and Enhancing Trustworthiness of LLMs in Perception Tasks
par: Dona, Malsha Ashani Mahawatta, et autres
Publié: (2024)
par: Dona, Malsha Ashani Mahawatta, et autres
Publié: (2024)
Learned Display Radiance Fields with Lensless Cameras
par: Chen, Ziyang, et autres
Publié: (2025)
par: Chen, Ziyang, et autres
Publié: (2025)
Can Foundation Models Revolutionize Mobile AR Sparse Sensing?
par: Zhao, Yiqin, et autres
Publié: (2025)
par: Zhao, Yiqin, et autres
Publié: (2025)
SynSpill: Improved Industrial Spill Detection With Synthetic Data
par: Baranwal, Aaditya, et autres
Publié: (2025)
par: Baranwal, Aaditya, et autres
Publié: (2025)
Scrutinizing Data from Sky: An Examination of Its Veracity in Area Based Traffic Contexts
par: Ali, Yawar, et autres
Publié: (2024)
par: Ali, Yawar, et autres
Publié: (2024)
Fourier-based Action Recognition for Wildlife Behavior Quantification with Event Cameras
par: Hamann, Friedhelm, et autres
Publié: (2024)
par: Hamann, Friedhelm, et autres
Publié: (2024)
Towards Railway Domain Adaptation for LiDAR-based 3D Detection: Road-to-Rail and Sim-to-Real via SynDRA-BBox
par: Diaz, Xavier, et autres
Publié: (2025)
par: Diaz, Xavier, et autres
Publié: (2025)
Fast Quantum Convolutional Neural Networks for Low-Complexity Object Detection in Autonomous Driving Applications
par: Baek, Hankyul, et autres
Publié: (2023)
par: Baek, Hankyul, et autres
Publié: (2023)
Enhancing Autism Spectrum Disorder Early Detection with the Parent-Child Dyads Block-Play Protocol and an Attention-enhanced GCN-xLSTM Hybrid Deep Learning Framework
par: Li, Xiang, et autres
Publié: (2024)
par: Li, Xiang, et autres
Publié: (2024)
DashCam Video: A complementary low-cost data stream for on-demand forest-infrastructure system monitoring
par: Joshi, Durga, et autres
Publié: (2025)
par: Joshi, Durga, et autres
Publié: (2025)
Assistive Image Annotation Systems with Deep Learning and Natural Language Capabilities: A Review
par: Mots'oehli, Moseli
Publié: (2024)
par: Mots'oehli, Moseli
Publié: (2024)
From Pixels to Nucleotides: End-to-End Token-Based Video Compression for DNA Storage
par: Ruan, Cihan, et autres
Publié: (2026)
par: Ruan, Cihan, et autres
Publié: (2026)
Attention-based Generative Latent Replay: A Continual Learning Approach for WSI Analysis
par: Kumari, Pratibha, et autres
Publié: (2025)
par: Kumari, Pratibha, et autres
Publié: (2025)
Extracting Object Heights From LiDAR & Aerial Imagery
par: Guerrero, Jesus
Publié: (2024)
par: Guerrero, Jesus
Publié: (2024)
SpecTrack: Learned Multi-Rotation Tracking via Speckle Imaging
par: Chen, Ziyang, et autres
Publié: (2024)
par: Chen, Ziyang, et autres
Publié: (2024)
Diff-GNSS: Diffusion-based Pseudorange Error Estimation
par: Zhu, Jiaqi, et autres
Publié: (2025)
par: Zhu, Jiaqi, et autres
Publié: (2025)
PI-HMR: Towards Robust In-bed Temporal Human Shape Reconstruction with Contact Pressure Sensing
par: Wu, Ziyu, et autres
Publié: (2025)
par: Wu, Ziyu, et autres
Publié: (2025)
EATFormer: Improving Vision Transformer Inspired by Evolutionary Algorithm
par: Zhang, Jiangning, et autres
Publié: (2022)
par: Zhang, Jiangning, et autres
Publié: (2022)
Probabilistic Online Event Downsampling
par: Girbau-Xalabarder, Andreu, et autres
Publié: (2025)
par: Girbau-Xalabarder, Andreu, et autres
Publié: (2025)
INSIGHT: Indoor Scene Intelligence from Geometric-Semantic Hierarchy Transfer for Public~Safety
par: Dimopoulos, Alexander Nikitas, et autres
Publié: (2026)
par: Dimopoulos, Alexander Nikitas, et autres
Publié: (2026)
Hyperspectral Sensors and Autonomous Driving: Technologies, Limitations, and Opportunities
par: Shah, Imad Ali, et autres
Publié: (2025)
par: Shah, Imad Ali, et autres
Publié: (2025)
Unmanned Aerial Vehicle (UAV)-Based Mapping of Iris Pseudacorus L. Invasion in Laguna del Sauce (Uruguay) Coast
par: Silvarrey, Alejo, et autres
Publié: (2025)
par: Silvarrey, Alejo, et autres
Publié: (2025)
Neuromorphic Face Analysis: a Survey
par: Becattini, Federico, et autres
Publié: (2024)
par: Becattini, Federico, et autres
Publié: (2024)
Detecting sexually explicit content in the context of the child sexual abuse materials (CSAM): end-to-end classifiers and region-based networks
par: Gutfeter, Weronika, et autres
Publié: (2024)
par: Gutfeter, Weronika, et autres
Publié: (2024)
All-Optical Segmentation via Diffractive Neural Networks for Autonomous Driving
par: Li, Yingjie, et autres
Publié: (2026)
par: Li, Yingjie, et autres
Publié: (2026)
DoorDet: Semi-Automated Multi-Class Door Detection Dataset via Object Detection and Large Language Models
par: Zhang, Licheng, et autres
Publié: (2025)
par: Zhang, Licheng, et autres
Publié: (2025)
VIPER Strike: Defeating Visual Reasoning CAPTCHAs via Structured Vision-Language Inference
par: Qi, Minfeng, et autres
Publié: (2026)
par: Qi, Minfeng, et autres
Publié: (2026)
From Flat to Spatial: Comparison of 4 methods constructing 3D, 2 and 1/2D Models from 2D Plans with neural networks
par: Sam, Jacob, et autres
Publié: (2024)
par: Sam, Jacob, et autres
Publié: (2024)
Measurement-Adapted Eigentask Representations for Photon-Limited Optical Readout
par: Chen, Tianyang, et autres
Publié: (2026)
par: Chen, Tianyang, et autres
Publié: (2026)
V-RoAst: Visual Road Assessment. Can VLM be a Road Safety Assessor Using the iRAP Standard?
par: Jongwiriyanurak, Natchapon, et autres
Publié: (2024)
par: Jongwiriyanurak, Natchapon, et autres
Publié: (2024)
Documents similaires
-
OMH: Structured Sparsity via Optimally Matched Hierarchy for Unsupervised Semantic Segmentation
par: Ozaydin, Baran, et autres
Publié: (2024) -
Data Augmentation via Latent Diffusion for Saliency Prediction
par: Aydemir, Bahar, et autres
Publié: (2024) -
DSI2I: Dense Style for Unpaired Image-to-Image Translation
par: Ozaydin, Baran, et autres
Publié: (2022) -
TempSAL -- Uncovering Temporal Information for Deep Saliency Prediction
par: Aydemir, Bahar, et autres
Publié: (2023) -
x-RAGE: eXtended Reality -- Action & Gesture Events Dataset
par: Parmar, Vivek, et autres
Publié: (2024)