Multi-language Video Subtitle Dataset for Image-based Text Recognition
Fuente:
arXiv
Saved in:
| Main Authors: | Singkhornart, Thanadol, Surinta, Olarik |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
EcoCropsAID: Economic Crops Aerial Image Dataset for Land Use Classification
by: Noppitak, Sangdaow, et al.
Published: (2024)
by: Noppitak, Sangdaow, et al.
Published: (2024)
AIWR: Aerial Image Water Resource Dataset for Segmentation Analysis
by: Noppitak, Sangdaow, et al.
Published: (2024)
by: Noppitak, Sangdaow, et al.
Published: (2024)
One-Stage-TFS: Thai One-Stage Fingerspelling Dataset for Fingerspelling Recognition Frameworks
by: Lata, Siriwiwat, et al.
Published: (2024)
by: Lata, Siriwiwat, et al.
Published: (2024)
EventSTR: A Benchmark Dataset and Baselines for Event Stream based Scene Text Recognition
by: Wang, Xiao, et al.
Published: (2025)
by: Wang, Xiao, et al.
Published: (2025)
FindingEmo: An Image Dataset for Emotion Recognition in the Wild
by: Mertens, Laurent, et al.
Published: (2024)
by: Mertens, Laurent, et al.
Published: (2024)
15M Multimodal Facial Image-Text Dataset
by: Dai, Dawei, et al.
Published: (2024)
by: Dai, Dawei, et al.
Published: (2024)
Flatten: Video Action Recognition is an Image Classification task
by: Chen, Junlin, et al.
Published: (2024)
by: Chen, Junlin, et al.
Published: (2024)
Model-based Cleaning of the QUILT-1M Pathology Dataset for Text-Conditional Image Synthesis
by: Aubreville, Marc, et al.
Published: (2024)
by: Aubreville, Marc, et al.
Published: (2024)
Visual WetlandBirds Dataset: Bird Species Identification and Behavior Recognition in Videos
by: Rodriguez-Juan, Javier, et al.
Published: (2025)
by: Rodriguez-Juan, Javier, et al.
Published: (2025)
VSI: Visual Subtitle Integration for Keyframe Selection to enhance Long Video Understanding
by: He, Jianxiang, et al.
Published: (2025)
by: He, Jianxiang, et al.
Published: (2025)
Multi-Modal Character Localization and Extraction for Chinese Text Recognition
by: Li, Qilong, et al.
Published: (2026)
by: Li, Qilong, et al.
Published: (2026)
HARIVO: Harnessing Text-to-Image Models for Video Generation
by: Kwon, Mingi, et al.
Published: (2024)
by: Kwon, Mingi, et al.
Published: (2024)
Kvasir-VQA: A Text-Image Pair GI Tract Dataset
by: Gautam, Sushant, et al.
Published: (2024)
by: Gautam, Sushant, et al.
Published: (2024)
Progressive Image Restoration via Text-Conditioned Video Generation
by: Kang, Peng, et al.
Published: (2025)
by: Kang, Peng, et al.
Published: (2025)
Video Text Preservation with Synthetic Text-Rich Videos
by: Liu, Ziyang, et al.
Published: (2025)
by: Liu, Ziyang, et al.
Published: (2025)
Multi-Scale Temporal Difference Transformer for Video-Text Retrieval
by: Wang, Ni, et al.
Published: (2024)
by: Wang, Ni, et al.
Published: (2024)
A High-Quality Dataset and Reliable Evaluation for Interleaved Image-Text Generation
by: Feng, Yukang, et al.
Published: (2025)
by: Feng, Yukang, et al.
Published: (2025)
MVIP -- A Dataset and Methods for Application Oriented Multi-View and Multi-Modal Industrial Part Recognition
by: Koch, Paul, et al.
Published: (2025)
by: Koch, Paul, et al.
Published: (2025)
When Words Can't Capture It All: Towards Video-Based User Complaint Text Generation with Multimodal Video Complaint Dataset
by: Das, Sarmistha, et al.
Published: (2025)
by: Das, Sarmistha, et al.
Published: (2025)
Towards Explainable AI: Multi-Modal Transformer for Video-based Image Description Generation
by: Agarwal, Lakshita, et al.
Published: (2025)
by: Agarwal, Lakshita, et al.
Published: (2025)
DragText: Rethinking Text Embedding in Point-based Image Editing
by: Choi, Gayoon, et al.
Published: (2024)
by: Choi, Gayoon, et al.
Published: (2024)
Contrastive Learning-based Multi Modal Architecture for Emoticon Prediction by Employing Image-Text Pairs
by: Pandey, Ananya, et al.
Published: (2024)
by: Pandey, Ananya, et al.
Published: (2024)
MAVEN A Multi-Agent Framework for Multicultural Text-to-Video Generation
by: Li, Shuowei, et al.
Published: (2026)
by: Li, Shuowei, et al.
Published: (2026)
Multimodal Emotion Recognition with Vision-language Prompting and Modality Dropout
by: QI, Anbin, et al.
Published: (2024)
by: QI, Anbin, et al.
Published: (2024)
Bosch Street Dataset: A Multi-Modal Dataset with Imaging Radar for Automated Driving
by: Armanious, Karim, et al.
Published: (2024)
by: Armanious, Karim, et al.
Published: (2024)
Multi-Group Proportional Representation for Text-to-Image Models
by: Jung, Sangwon, et al.
Published: (2025)
by: Jung, Sangwon, et al.
Published: (2025)
Human Activity Recognition using RGB-Event based Sensors: A Multi-modal Heat Conduction Model and A Benchmark Dataset
by: Wang, Shiao, et al.
Published: (2025)
by: Wang, Shiao, et al.
Published: (2025)
Open Set Recognition for Endoscopic Image Classification: A Deep Learning Approach on the Kvasir Dataset
by: Moazzami, Kasra, et al.
Published: (2025)
by: Moazzami, Kasra, et al.
Published: (2025)
Improving Explicit Spatial Relationships in Text-to-Image Generation through an Automatically Derived Dataset
by: Salaberria, Ander, et al.
Published: (2024)
by: Salaberria, Ander, et al.
Published: (2024)
Handwritten Text Recognition: A Survey
by: Garrido-Munoz, Carlos, et al.
Published: (2025)
by: Garrido-Munoz, Carlos, et al.
Published: (2025)
What Is That Talk About? A Video-to-Text Summarization Dataset for Scientific Presentations
by: Liu, Dongqi, et al.
Published: (2025)
by: Liu, Dongqi, et al.
Published: (2025)
Multi-Grained Compositional Visual Clue Learning for Image Intent Recognition
by: Tang, Yin, et al.
Published: (2025)
by: Tang, Yin, et al.
Published: (2025)
Knowledge-based learning in Text-RAG and Image-RAG
by: Shim, Alexander, et al.
Published: (2026)
by: Shim, Alexander, et al.
Published: (2026)
TC-Bench: Benchmarking Temporal Compositionality in Text-to-Video and Image-to-Video Generation
by: Feng, Weixi, et al.
Published: (2024)
by: Feng, Weixi, et al.
Published: (2024)
CLIPDrag: Combining Text-based and Drag-based Instructions for Image Editing
by: Jiang, Ziqi, et al.
Published: (2024)
by: Jiang, Ziqi, et al.
Published: (2024)
Let's Go Shopping (LGS) -- Web-Scale Image-Text Dataset for Visual Concept Understanding
by: Bai, Yatong, et al.
Published: (2024)
by: Bai, Yatong, et al.
Published: (2024)
Identity Decoupling for Multi-Subject Personalization of Text-to-Image Models
by: Jang, Sangwon, et al.
Published: (2024)
by: Jang, Sangwon, et al.
Published: (2024)
Upcycling Text-to-Image Diffusion Models for Multi-Task Capabilities
by: Chavhan, Ruchika, et al.
Published: (2025)
by: Chavhan, Ruchika, et al.
Published: (2025)
Object Recognition Datasets and Challenges: A Review
by: Salari, Aria, et al.
Published: (2025)
by: Salari, Aria, et al.
Published: (2025)
WAS: Dataset and Methods for Artistic Text Segmentation
by: Xie, Xudong, et al.
Published: (2024)
by: Xie, Xudong, et al.
Published: (2024)
Similar Items
-
EcoCropsAID: Economic Crops Aerial Image Dataset for Land Use Classification
by: Noppitak, Sangdaow, et al.
Published: (2024) -
AIWR: Aerial Image Water Resource Dataset for Segmentation Analysis
by: Noppitak, Sangdaow, et al.
Published: (2024) -
One-Stage-TFS: Thai One-Stage Fingerspelling Dataset for Fingerspelling Recognition Frameworks
by: Lata, Siriwiwat, et al.
Published: (2024) -
EventSTR: A Benchmark Dataset and Baselines for Event Stream based Scene Text Recognition
by: Wang, Xiao, et al.
Published: (2025) -
FindingEmo: An Image Dataset for Emotion Recognition in the Wild
by: Mertens, Laurent, et al.
Published: (2024)