DEJIMA: A Novel Large-scale Japanese Dataset for Image Captioning and Visual Question Answering
Fuente:
arXiv
Salvato in:
| Autori principali: | Katsube, Toshiki, Fukuhara, Taiga, Ando, Kenichiro, Mukuta, Yusuke, Uehara, Kohei, Harada, Tatsuya |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Improved 3D Scene Stylization via Text-Guided Generative Image Editing with Region-Based Control
di: Fujiwara, Haruo, et al.
Pubblicazione: (2025)
di: Fujiwara, Haruo, et al.
Pubblicazione: (2025)
Style-NeRF2NeRF: 3D Style Transfer From Style-Aligned Multi-View Images
di: Fujiwara, Haruo, et al.
Pubblicazione: (2024)
di: Fujiwara, Haruo, et al.
Pubblicazione: (2024)
Enhancing Visual Question Answering through Question-Driven Image Captions as Prompts
di: Özdemir, Övgü, et al.
Pubblicazione: (2024)
di: Özdemir, Övgü, et al.
Pubblicazione: (2024)
A Gaze-grounded Visual Question Answering Dataset for Clarifying Ambiguous Japanese Questions
di: Inadumi, Shun, et al.
Pubblicazione: (2024)
di: Inadumi, Shun, et al.
Pubblicazione: (2024)
Advancing Large Multi-modal Models with Explicit Chain-of-Reasoning and Visual Question Generation
di: Uehara, Kohei, et al.
Pubblicazione: (2024)
di: Uehara, Kohei, et al.
Pubblicazione: (2024)
JSynFlow: Japanese Synthesised Flowchart Visual Question Answering Dataset built with Large Language Models
di: Sasaki, Hiroshi
Pubblicazione: (2026)
di: Sasaki, Hiroshi
Pubblicazione: (2026)
RAW-Adapter: Adapting Pre-trained Visual Model to Camera RAW Images
di: Cui, Ziteng, et al.
Pubblicazione: (2024)
di: Cui, Ziteng, et al.
Pubblicazione: (2024)
Expert Knowledge-Aware Image Difference Graph Representation Learning for Difference-Aware Medical Visual Question Answering
di: Hu, Xinyue, et al.
Pubblicazione: (2023)
di: Hu, Xinyue, et al.
Pubblicazione: (2023)
Aligning Large Language Model Behavior with Human Citation Preferences
di: Ando, Kenichiro, et al.
Pubblicazione: (2026)
di: Ando, Kenichiro, et al.
Pubblicazione: (2026)
ViOCRVQA: Novel Benchmark Dataset and Vision Reader for Visual Question Answering by Understanding Vietnamese Text in Images
di: Pham, Huy Quang, et al.
Pubblicazione: (2024)
di: Pham, Huy Quang, et al.
Pubblicazione: (2024)
SCRA-VQA: Summarized Caption-Rerank for Augmented Large Language Models in Visual Question Answering
di: Zhang, Yan, et al.
Pubblicazione: (2025)
di: Zhang, Yan, et al.
Pubblicazione: (2025)
GeReA: Question-Aware Prompt Captions for Knowledge-based Visual Question Answering
di: Ma, Ziyu, et al.
Pubblicazione: (2024)
di: Ma, Ziyu, et al.
Pubblicazione: (2024)
Detecting and Understanding Hateful Contents in Memes Through Captioning and Visual Question-Answering
di: Anaissi, Ali, et al.
Pubblicazione: (2025)
di: Anaissi, Ali, et al.
Pubblicazione: (2025)
Enhancing Scientific Visual Question Answering via Vision-Caption aware Supervised Fine-Tuning
di: Kapuriya, Janak, et al.
Pubblicazione: (2025)
di: Kapuriya, Janak, et al.
Pubblicazione: (2025)
CoralVQA: A Large-Scale Visual Question Answering Dataset for Coral Reef Image Understanding
di: Han, Hongyong, et al.
Pubblicazione: (2025)
di: Han, Hongyong, et al.
Pubblicazione: (2025)
RAW-Adapter: Adapting Pre-trained Visual Model to Camera RAW Images and A Benchmark
di: Cui, Ziteng, et al.
Pubblicazione: (2025)
di: Cui, Ziteng, et al.
Pubblicazione: (2025)
A Comprehensive Survey on Visual Question Answering Datasets and Algorithms
di: Kabir, Raihan, et al.
Pubblicazione: (2024)
di: Kabir, Raihan, et al.
Pubblicazione: (2024)
Cross-Embodiment Offline Reinforcement Learning for Heterogeneous Robot Datasets
di: Abe, Haruki, et al.
Pubblicazione: (2026)
di: Abe, Haruki, et al.
Pubblicazione: (2026)
StackOverflowVQA: Stack Overflow Visual Question Answering Dataset
di: Mirzaei, Motahhare, et al.
Pubblicazione: (2024)
di: Mirzaei, Motahhare, et al.
Pubblicazione: (2024)
Fully Authentic Visual Question Answering Dataset from Online Communities
di: Chen, Chongyan, et al.
Pubblicazione: (2023)
di: Chen, Chongyan, et al.
Pubblicazione: (2023)
HyperVQ: MLR-based Vector Quantization in Hyperbolic Space
di: Goswami, Nabarun, et al.
Pubblicazione: (2024)
di: Goswami, Nabarun, et al.
Pubblicazione: (2024)
Detection Based Part-level Articulated Object Reconstruction from Single RGBD Image
di: Kawana, Yuki, et al.
Pubblicazione: (2025)
di: Kawana, Yuki, et al.
Pubblicazione: (2025)
MaGRITTe: Manipulative and Generative 3D Realization from Image, Topview and Text
di: Hara, Takayuki, et al.
Pubblicazione: (2024)
di: Hara, Takayuki, et al.
Pubblicazione: (2024)
RS-MoE: A Vision-Language Model with Mixture of Experts for Remote Sensing Image Captioning and Visual Question Answering
di: Lin, Hui, et al.
Pubblicazione: (2024)
di: Lin, Hui, et al.
Pubblicazione: (2024)
Visual Question Answering on Multiple Remote Sensing Image Modalities
di: Boussaid, Hichem, et al.
Pubblicazione: (2025)
di: Boussaid, Hichem, et al.
Pubblicazione: (2025)
RadImageNet-VQA: A Large-Scale CT and MRI Dataset for Radiologic Visual Question Answering
di: Butsanets, Léo, et al.
Pubblicazione: (2025)
di: Butsanets, Léo, et al.
Pubblicazione: (2025)
DisasterVQA: A Visual Question Answering Benchmark Dataset for Disaster Scenes
di: Al-Mohannadi, Aisha, et al.
Pubblicazione: (2026)
di: Al-Mohannadi, Aisha, et al.
Pubblicazione: (2026)
VeriSciQA: An Auto-Verified Dataset for Scientific Visual Question Answering
di: Li, Yuyi, et al.
Pubblicazione: (2025)
di: Li, Yuyi, et al.
Pubblicazione: (2025)
Knowledge Detection by Relevant Question and Image Attributes in Visual Question Answering
di: Ahir, Param, et al.
Pubblicazione: (2023)
di: Ahir, Param, et al.
Pubblicazione: (2023)
QIRL: Boosting Visual Question Answering via Optimized Question-Image Relation Learning
di: Xu, Quanxing, et al.
Pubblicazione: (2025)
di: Xu, Quanxing, et al.
Pubblicazione: (2025)
Questioning the Stability of Visual Question Answering
di: Rosenfeld, Amir, et al.
Pubblicazione: (2025)
di: Rosenfeld, Amir, et al.
Pubblicazione: (2025)
VDMA: Video Question Answering with Dynamically Generated Multi-Agents
di: Kugo, Noriyuki, et al.
Pubblicazione: (2024)
di: Kugo, Noriyuki, et al.
Pubblicazione: (2024)
STRIDE-QA: Visual Question Answering Dataset for Spatiotemporal Reasoning in Urban Driving Scenes
di: Ishihara, Keishi, et al.
Pubblicazione: (2025)
di: Ishihara, Keishi, et al.
Pubblicazione: (2025)
RoadscapesQA: A Multitask, Multimodal Dataset for Visual Question Answering on Indian Roads
di: Iyer, Vijayasri, et al.
Pubblicazione: (2026)
di: Iyer, Vijayasri, et al.
Pubblicazione: (2026)
Dataset and Benchmark for Urdu Natural Scenes Text Detection, Recognition and Visual Question Answering
di: Maryam, Hiba, et al.
Pubblicazione: (2024)
di: Maryam, Hiba, et al.
Pubblicazione: (2024)
AutoViVQA: A Large-Scale Automatically Constructed Dataset for Vietnamese Visual Question Answering
di: Tuong, Nguyen Anh, et al.
Pubblicazione: (2026)
di: Tuong, Nguyen Anh, et al.
Pubblicazione: (2026)
Unifying Image Processing as Visual Prompting Question Answering
di: Liu, Yihao, et al.
Pubblicazione: (2023)
di: Liu, Yihao, et al.
Pubblicazione: (2023)
Selectively Answering Visual Questions
di: Eisenschlos, Julian Martin, et al.
Pubblicazione: (2024)
di: Eisenschlos, Julian Martin, et al.
Pubblicazione: (2024)
Visually Interpretable Subtask Reasoning for Visual Question Answering
di: Cheng, Yu, et al.
Pubblicazione: (2025)
di: Cheng, Yu, et al.
Pubblicazione: (2025)
Targeted Visual Prompting for Medical Visual Question Answering
di: Tascon-Morales, Sergio, et al.
Pubblicazione: (2024)
di: Tascon-Morales, Sergio, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Improved 3D Scene Stylization via Text-Guided Generative Image Editing with Region-Based Control
di: Fujiwara, Haruo, et al.
Pubblicazione: (2025) -
Style-NeRF2NeRF: 3D Style Transfer From Style-Aligned Multi-View Images
di: Fujiwara, Haruo, et al.
Pubblicazione: (2024) -
Enhancing Visual Question Answering through Question-Driven Image Captions as Prompts
di: Özdemir, Övgü, et al.
Pubblicazione: (2024) -
A Gaze-grounded Visual Question Answering Dataset for Clarifying Ambiguous Japanese Questions
di: Inadumi, Shun, et al.
Pubblicazione: (2024) -
Advancing Large Multi-modal Models with Explicit Chain-of-Reasoning and Visual Question Generation
di: Uehara, Kohei, et al.
Pubblicazione: (2024)