A Visual Question Answering Method for SAR Ship: Breaking the Requirement for Multimodal Dataset Construction and Model Fine-Tuning
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Fei, Chen, Chengcheng, Chen, Hongyu, Chang, Yugang, Zeng, Weiming |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
MID: A Comprehensive Shore-Based Dataset for Multi-Scale Dense Ship Occlusion and Interaction Scenarios
por: Chang, Yugang, et al.
Publicado: (2024)
por: Chang, Yugang, et al.
Publicado: (2024)
Bring Remote Sensing Object Detect Into Nature Language Model: Using SFT Method
por: Wang, Fei, et al.
Publicado: (2025)
por: Wang, Fei, et al.
Publicado: (2025)
RSNet: A Light Framework for The Detection of SAR Ship Detection
por: Chen, Hongyu, et al.
Publicado: (2024)
por: Chen, Hongyu, et al.
Publicado: (2024)
Breaking the Visual Shortcuts in Multimodal Knowledge-Based Visual Question Answering
por: Lee, Dosung, et al.
Publicado: (2025)
por: Lee, Dosung, et al.
Publicado: (2025)
Advancing Multimodal Large Language Models in Chart Question Answering with Visualization-Referenced Instruction Tuning
por: Zeng, Xingchen, et al.
Publicado: (2024)
por: Zeng, Xingchen, et al.
Publicado: (2024)
Enhanced Multimodal RAG-LLM for Accurate Visual Question Answering
por: Xue, Junxiao, et al.
Publicado: (2024)
por: Xue, Junxiao, et al.
Publicado: (2024)
Enhancing Scientific Visual Question Answering via Vision-Caption aware Supervised Fine-Tuning
por: Kapuriya, Janak, et al.
Publicado: (2025)
por: Kapuriya, Janak, et al.
Publicado: (2025)
Multimodal Rationales for Explainable Visual Question Answering
por: Li, Kun, et al.
Publicado: (2024)
por: Li, Kun, et al.
Publicado: (2024)
RoadscapesQA: A Multitask, Multimodal Dataset for Visual Question Answering on Indian Roads
por: Iyer, Vijayasri, et al.
Publicado: (2026)
por: Iyer, Vijayasri, et al.
Publicado: (2026)
Fully Authentic Visual Question Answering Dataset from Online Communities
por: Chen, Chongyan, et al.
Publicado: (2023)
por: Chen, Chongyan, et al.
Publicado: (2023)
MV-CoRe: Multimodal Visual-Conceptual Reasoning for Complex Visual Question Answering
por: Peng, Jingwei, et al.
Publicado: (2025)
por: Peng, Jingwei, et al.
Publicado: (2025)
Music Audio-Visual Question Answering Requires Specialized Multimodal Designs
por: You, Wenhao, et al.
Publicado: (2025)
por: You, Wenhao, et al.
Publicado: (2025)
Cross-modal Ship Re-Identification via Optical and SAR Imagery: A Novel Dataset and Method
por: Wang, Han, et al.
Publicado: (2025)
por: Wang, Han, et al.
Publicado: (2025)
VeriSciQA: An Auto-Verified Dataset for Scientific Visual Question Answering
por: Li, Yuyi, et al.
Publicado: (2025)
por: Li, Yuyi, et al.
Publicado: (2025)
PMC-VQA: Visual Instruction Tuning for Medical Visual Question Answering
por: Zhang, Xiaoman, et al.
Publicado: (2023)
por: Zhang, Xiaoman, et al.
Publicado: (2023)
Denoising-Enhanced YOLO for Robust SAR Ship Detection
por: Zhao, Xiaojing, et al.
Publicado: (2026)
por: Zhao, Xiaojing, et al.
Publicado: (2026)
A Comprehensive Survey on Visual Question Answering Datasets and Algorithms
por: Kabir, Raihan, et al.
Publicado: (2024)
por: Kabir, Raihan, et al.
Publicado: (2024)
Enhancing Scientific Visual Question Answering through Multimodal Reasoning and Ensemble Modeling
por: Movva, Prahitha, et al.
Publicado: (2025)
por: Movva, Prahitha, et al.
Publicado: (2025)
Improving Few-Shot Change Detection Visual Question Answering via Decision-Ambiguity-guided Reinforcement Fine-Tuning
por: Dong, Fuyu, et al.
Publicado: (2025)
por: Dong, Fuyu, et al.
Publicado: (2025)
Robust Visual Question Answering: Datasets, Methods, and Future Challenges
por: Ma, Jie, et al.
Publicado: (2023)
por: Ma, Jie, et al.
Publicado: (2023)
NASTaR: NovaSAR Automated Ship Target Recognition Dataset
por: Hosseiny, Benyamin, et al.
Publicado: (2025)
por: Hosseiny, Benyamin, et al.
Publicado: (2025)
Towards Signboard-Oriented Visual Question Answering: ViSignVQA Dataset, Method and Benchmark
por: Nguyen, Hieu Minh, et al.
Publicado: (2025)
por: Nguyen, Hieu Minh, et al.
Publicado: (2025)
StackOverflowVQA: Stack Overflow Visual Question Answering Dataset
por: Mirzaei, Motahhare, et al.
Publicado: (2024)
por: Mirzaei, Motahhare, et al.
Publicado: (2024)
Visual Question Answering Instruction: Unlocking Multimodal Large Language Model To Domain-Specific Visual Multitasks
por: Lee, Jusung, et al.
Publicado: (2024)
por: Lee, Jusung, et al.
Publicado: (2024)
Benchmarking Large Multimodal Models for Ophthalmic Visual Question Answering with OphthalWeChat
por: Xu, Pusheng, et al.
Publicado: (2025)
por: Xu, Pusheng, et al.
Publicado: (2025)
Design as Desired: Utilizing Visual Question Answering for Multimodal Pre-training
por: Su, Tongkun, et al.
Publicado: (2024)
por: Su, Tongkun, et al.
Publicado: (2024)
PDF-MVQA: A Dataset for Multimodal Information Retrieval in PDF-based Visual Question Answering
por: Ding, Yihao, et al.
Publicado: (2024)
por: Ding, Yihao, et al.
Publicado: (2024)
VQA-MHUG: A Gaze Dataset to Study Multimodal Neural Attention in Visual Question Answering
por: Sood, Ekta, et al.
Publicado: (2021)
por: Sood, Ekta, et al.
Publicado: (2021)
FOCUS: Internal MLLM Representations for Efficient Fine-Grained Visual Question Answering
por: Zhong, Liangyu, et al.
Publicado: (2025)
por: Zhong, Liangyu, et al.
Publicado: (2025)
RSAdapter: Adapting Multimodal Models for Remote Sensing Visual Question Answering
por: Wang, Yuduo, et al.
Publicado: (2023)
por: Wang, Yuduo, et al.
Publicado: (2023)
AutoViVQA: A Large-Scale Automatically Constructed Dataset for Vietnamese Visual Question Answering
por: Tuong, Nguyen Anh, et al.
Publicado: (2026)
por: Tuong, Nguyen Anh, et al.
Publicado: (2026)
Fine-Grained Knowledge Structuring and Retrieval for Visual Question Answering
por: Zhang, Zhengxuan, et al.
Publicado: (2025)
por: Zhang, Zhengxuan, et al.
Publicado: (2025)
Towards Fine-Grained Video Question Answering
por: Dai, Wei, et al.
Publicado: (2025)
por: Dai, Wei, et al.
Publicado: (2025)
DisasterVQA: A Visual Question Answering Benchmark Dataset for Disaster Scenes
por: Al-Mohannadi, Aisha, et al.
Publicado: (2026)
por: Al-Mohannadi, Aisha, et al.
Publicado: (2026)
SilVar: Speech Driven Multimodal Model for Reasoning Visual Question Answering and Object Localization
por: Pham, Tan-Hanh, et al.
Publicado: (2024)
por: Pham, Tan-Hanh, et al.
Publicado: (2024)
Lightweight SAR Ship Detection via Contrastive Distillation
por: Devasundaram, Surendar, et al.
Publicado: (2026)
por: Devasundaram, Surendar, et al.
Publicado: (2026)
Adapting Lightweight Vision Language Models for Radiological Visual Question Answering
por: Shourya, Aditya, et al.
Publicado: (2025)
por: Shourya, Aditya, et al.
Publicado: (2025)
Enhancing Visual Question Answering with Multimodal LLMs via Chain-of-Question Guided Retrieval-Augmented Generation
por: Xu, Quanxing, et al.
Publicado: (2026)
por: Xu, Quanxing, et al.
Publicado: (2026)
DriveLM: Driving with Graph Visual Question Answering
por: Sima, Chonghao, et al.
Publicado: (2023)
por: Sima, Chonghao, et al.
Publicado: (2023)
Multimodal Integration of Human-Like Attention in Visual Question Answering
por: Sood, Ekta, et al.
Publicado: (2021)
por: Sood, Ekta, et al.
Publicado: (2021)
Ejemplares similares
-
MID: A Comprehensive Shore-Based Dataset for Multi-Scale Dense Ship Occlusion and Interaction Scenarios
por: Chang, Yugang, et al.
Publicado: (2024) -
Bring Remote Sensing Object Detect Into Nature Language Model: Using SFT Method
por: Wang, Fei, et al.
Publicado: (2025) -
RSNet: A Light Framework for The Detection of SAR Ship Detection
por: Chen, Hongyu, et al.
Publicado: (2024) -
Breaking the Visual Shortcuts in Multimodal Knowledge-Based Visual Question Answering
por: Lee, Dosung, et al.
Publicado: (2025) -
Advancing Multimodal Large Language Models in Chart Question Answering with Visualization-Referenced Instruction Tuning
por: Zeng, Xingchen, et al.
Publicado: (2024)