Salvato in:
| Autori principali: | Wang, Fei, Chen, Chengcheng, Chen, Hongyu, Chang, Yugang, Zeng, Weiming |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2411.01445 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MID: A Comprehensive Shore-Based Dataset for Multi-Scale Dense Ship Occlusion and Interaction Scenarios
di: Chang, Yugang, et al.
Pubblicazione: (2024)
di: Chang, Yugang, et al.
Pubblicazione: (2024)
Bring Remote Sensing Object Detect Into Nature Language Model: Using SFT Method
di: Wang, Fei, et al.
Pubblicazione: (2025)
di: Wang, Fei, et al.
Pubblicazione: (2025)
RSNet: A Light Framework for The Detection of SAR Ship Detection
di: Chen, Hongyu, et al.
Pubblicazione: (2024)
di: Chen, Hongyu, et al.
Pubblicazione: (2024)
Breaking the Visual Shortcuts in Multimodal Knowledge-Based Visual Question Answering
di: Lee, Dosung, et al.
Pubblicazione: (2025)
di: Lee, Dosung, et al.
Pubblicazione: (2025)
Advancing Multimodal Large Language Models in Chart Question Answering with Visualization-Referenced Instruction Tuning
di: Zeng, Xingchen, et al.
Pubblicazione: (2024)
di: Zeng, Xingchen, et al.
Pubblicazione: (2024)
Enhanced Multimodal RAG-LLM for Accurate Visual Question Answering
di: Xue, Junxiao, et al.
Pubblicazione: (2024)
di: Xue, Junxiao, et al.
Pubblicazione: (2024)
Music Audio-Visual Question Answering Requires Specialized Multimodal Designs
di: You, Wenhao, et al.
Pubblicazione: (2025)
di: You, Wenhao, et al.
Pubblicazione: (2025)
Enhancing Scientific Visual Question Answering via Vision-Caption aware Supervised Fine-Tuning
di: Kapuriya, Janak, et al.
Pubblicazione: (2025)
di: Kapuriya, Janak, et al.
Pubblicazione: (2025)
Multimodal Rationales for Explainable Visual Question Answering
di: Li, Kun, et al.
Pubblicazione: (2024)
di: Li, Kun, et al.
Pubblicazione: (2024)
Fully Authentic Visual Question Answering Dataset from Online Communities
di: Chen, Chongyan, et al.
Pubblicazione: (2023)
di: Chen, Chongyan, et al.
Pubblicazione: (2023)
MV-CoRe: Multimodal Visual-Conceptual Reasoning for Complex Visual Question Answering
di: Peng, Jingwei, et al.
Pubblicazione: (2025)
di: Peng, Jingwei, et al.
Pubblicazione: (2025)
RoadscapesQA: A Multitask, Multimodal Dataset for Visual Question Answering on Indian Roads
di: Iyer, Vijayasri, et al.
Pubblicazione: (2026)
di: Iyer, Vijayasri, et al.
Pubblicazione: (2026)
Cross-modal Ship Re-Identification via Optical and SAR Imagery: A Novel Dataset and Method
di: Wang, Han, et al.
Pubblicazione: (2025)
di: Wang, Han, et al.
Pubblicazione: (2025)
VeriSciQA: An Auto-Verified Dataset for Scientific Visual Question Answering
di: Li, Yuyi, et al.
Pubblicazione: (2025)
di: Li, Yuyi, et al.
Pubblicazione: (2025)
PMC-VQA: Visual Instruction Tuning for Medical Visual Question Answering
di: Zhang, Xiaoman, et al.
Pubblicazione: (2023)
di: Zhang, Xiaoman, et al.
Pubblicazione: (2023)
Denoising-Enhanced YOLO for Robust SAR Ship Detection
di: Zhao, Xiaojing, et al.
Pubblicazione: (2026)
di: Zhao, Xiaojing, et al.
Pubblicazione: (2026)
Robust Visual Question Answering: Datasets, Methods, and Future Challenges
di: Ma, Jie, et al.
Pubblicazione: (2023)
di: Ma, Jie, et al.
Pubblicazione: (2023)
A Comprehensive Survey on Visual Question Answering Datasets and Algorithms
di: Kabir, Raihan, et al.
Pubblicazione: (2024)
di: Kabir, Raihan, et al.
Pubblicazione: (2024)
NASTaR: NovaSAR Automated Ship Target Recognition Dataset
di: Hosseiny, Benyamin, et al.
Pubblicazione: (2025)
di: Hosseiny, Benyamin, et al.
Pubblicazione: (2025)
Enhancing Scientific Visual Question Answering through Multimodal Reasoning and Ensemble Modeling
di: Movva, Prahitha, et al.
Pubblicazione: (2025)
di: Movva, Prahitha, et al.
Pubblicazione: (2025)
Improving Few-Shot Change Detection Visual Question Answering via Decision-Ambiguity-guided Reinforcement Fine-Tuning
di: Dong, Fuyu, et al.
Pubblicazione: (2025)
di: Dong, Fuyu, et al.
Pubblicazione: (2025)
Towards Fine-Grained Video Question Answering
di: Dai, Wei, et al.
Pubblicazione: (2025)
di: Dai, Wei, et al.
Pubblicazione: (2025)
Design as Desired: Utilizing Visual Question Answering for Multimodal Pre-training
di: Su, Tongkun, et al.
Pubblicazione: (2024)
di: Su, Tongkun, et al.
Pubblicazione: (2024)
Benchmarking Large Multimodal Models for Ophthalmic Visual Question Answering with OphthalWeChat
di: Xu, Pusheng, et al.
Pubblicazione: (2025)
di: Xu, Pusheng, et al.
Pubblicazione: (2025)
Towards Signboard-Oriented Visual Question Answering: ViSignVQA Dataset, Method and Benchmark
di: Nguyen, Hieu Minh, et al.
Pubblicazione: (2025)
di: Nguyen, Hieu Minh, et al.
Pubblicazione: (2025)
PDF-MVQA: A Dataset for Multimodal Information Retrieval in PDF-based Visual Question Answering
di: Ding, Yihao, et al.
Pubblicazione: (2024)
di: Ding, Yihao, et al.
Pubblicazione: (2024)
VQA-MHUG: A Gaze Dataset to Study Multimodal Neural Attention in Visual Question Answering
di: Sood, Ekta, et al.
Pubblicazione: (2021)
di: Sood, Ekta, et al.
Pubblicazione: (2021)
StackOverflowVQA: Stack Overflow Visual Question Answering Dataset
di: Mirzaei, Motahhare, et al.
Pubblicazione: (2024)
di: Mirzaei, Motahhare, et al.
Pubblicazione: (2024)
RSAdapter: Adapting Multimodal Models for Remote Sensing Visual Question Answering
di: Wang, Yuduo, et al.
Pubblicazione: (2023)
di: Wang, Yuduo, et al.
Pubblicazione: (2023)
Fine-Grained Knowledge Structuring and Retrieval for Visual Question Answering
di: Zhang, Zhengxuan, et al.
Pubblicazione: (2025)
di: Zhang, Zhengxuan, et al.
Pubblicazione: (2025)
AutoViVQA: A Large-Scale Automatically Constructed Dataset for Vietnamese Visual Question Answering
di: Tuong, Nguyen Anh, et al.
Pubblicazione: (2026)
di: Tuong, Nguyen Anh, et al.
Pubblicazione: (2026)
Visual Question Answering Instruction: Unlocking Multimodal Large Language Model To Domain-Specific Visual Multitasks
di: Lee, Jusung, et al.
Pubblicazione: (2024)
di: Lee, Jusung, et al.
Pubblicazione: (2024)
FOCUS: Internal MLLM Representations for Efficient Fine-Grained Visual Question Answering
di: Zhong, Liangyu, et al.
Pubblicazione: (2025)
di: Zhong, Liangyu, et al.
Pubblicazione: (2025)
Lightweight SAR Ship Detection via Contrastive Distillation
di: Devasundaram, Surendar, et al.
Pubblicazione: (2026)
di: Devasundaram, Surendar, et al.
Pubblicazione: (2026)
Adapting Lightweight Vision Language Models for Radiological Visual Question Answering
di: Shourya, Aditya, et al.
Pubblicazione: (2025)
di: Shourya, Aditya, et al.
Pubblicazione: (2025)
DisasterVQA: A Visual Question Answering Benchmark Dataset for Disaster Scenes
di: Al-Mohannadi, Aisha, et al.
Pubblicazione: (2026)
di: Al-Mohannadi, Aisha, et al.
Pubblicazione: (2026)
Multimodal Integration of Human-Like Attention in Visual Question Answering
di: Sood, Ekta, et al.
Pubblicazione: (2021)
di: Sood, Ekta, et al.
Pubblicazione: (2021)
SilVar: Speech Driven Multimodal Model for Reasoning Visual Question Answering and Object Localization
di: Pham, Tan-Hanh, et al.
Pubblicazione: (2024)
di: Pham, Tan-Hanh, et al.
Pubblicazione: (2024)
Enhancing Visual Question Answering with Multimodal LLMs via Chain-of-Question Guided Retrieval-Augmented Generation
di: Xu, Quanxing, et al.
Pubblicazione: (2026)
di: Xu, Quanxing, et al.
Pubblicazione: (2026)
Questioning the Stability of Visual Question Answering
di: Rosenfeld, Amir, et al.
Pubblicazione: (2025)
di: Rosenfeld, Amir, et al.
Pubblicazione: (2025)
Documenti analoghi
-
MID: A Comprehensive Shore-Based Dataset for Multi-Scale Dense Ship Occlusion and Interaction Scenarios
di: Chang, Yugang, et al.
Pubblicazione: (2024) -
Bring Remote Sensing Object Detect Into Nature Language Model: Using SFT Method
di: Wang, Fei, et al.
Pubblicazione: (2025) -
RSNet: A Light Framework for The Detection of SAR Ship Detection
di: Chen, Hongyu, et al.
Pubblicazione: (2024) -
Breaking the Visual Shortcuts in Multimodal Knowledge-Based Visual Question Answering
di: Lee, Dosung, et al.
Pubblicazione: (2025) -
Advancing Multimodal Large Language Models in Chart Question Answering with Visualization-Referenced Instruction Tuning
di: Zeng, Xingchen, et al.
Pubblicazione: (2024)