Salvato in:
| Autori principali: | Mo, Wentao, Liu, Yang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2402.15933 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Find The Gap: Knowledge Base Reasoning For Visual Question Answering
di: Barezi, Elham J., et al.
Pubblicazione: (2024)
di: Barezi, Elham J., et al.
Pubblicazione: (2024)
FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering
di: Huang, Chengyue, et al.
Pubblicazione: (2025)
di: Huang, Chengyue, et al.
Pubblicazione: (2025)
Exploring Diverse Methods in Visual Question Answering
di: Li, Panfeng, et al.
Pubblicazione: (2024)
di: Li, Panfeng, et al.
Pubblicazione: (2024)
Multi-Agent VQA: Exploring Multi-Agent Foundation Models in Zero-Shot Visual Question Answering
di: Jiang, Bowen, et al.
Pubblicazione: (2024)
di: Jiang, Bowen, et al.
Pubblicazione: (2024)
Distilling Neuro-Symbolic Programs into 3D Multi-modal LLMs
di: Mo, Wentao, et al.
Pubblicazione: (2026)
di: Mo, Wentao, et al.
Pubblicazione: (2026)
CVQA: Culturally-diverse Multilingual Visual Question Answering Benchmark
di: Romero, David, et al.
Pubblicazione: (2024)
di: Romero, David, et al.
Pubblicazione: (2024)
Federated Document Visual Question Answering: A Pilot Study
di: Nguyen, Khanh, et al.
Pubblicazione: (2024)
di: Nguyen, Khanh, et al.
Pubblicazione: (2024)
ProtoVQA: An Adaptable Prototypical Framework for Explainable Fine-Grained Visual Question Answering
di: Diao, Xingjian, et al.
Pubblicazione: (2025)
di: Diao, Xingjian, et al.
Pubblicazione: (2025)
Meta-Adaptive Prompt Distillation for Few-Shot Visual Question Answering
di: Gupta, Akash, et al.
Pubblicazione: (2025)
di: Gupta, Akash, et al.
Pubblicazione: (2025)
Naturally Supervised 3D Visual Grounding with Language-Regularized Concept Learners
di: Feng, Chun, et al.
Pubblicazione: (2024)
di: Feng, Chun, et al.
Pubblicazione: (2024)
Spatially Grounded Explanations in Vision Language Models for Document Visual Question Answering
di: Lagos, Maximiliano Hormazábal, et al.
Pubblicazione: (2025)
di: Lagos, Maximiliano Hormazábal, et al.
Pubblicazione: (2025)
Lexicon3D: Probing Visual Foundation Models for Complex 3D Scene Understanding
di: Man, Yunze, et al.
Pubblicazione: (2024)
di: Man, Yunze, et al.
Pubblicazione: (2024)
UCSF-PDGM-VQA: Visual Question Answering dataset for brain tumor MRI interpretation
di: Ghosh, Shiv, et al.
Pubblicazione: (2026)
di: Ghosh, Shiv, et al.
Pubblicazione: (2026)
VQA-Levels: A Hierarchical Approach for Classifying Questions in VQA
di: Madaka, Madhuri Latha, et al.
Pubblicazione: (2025)
di: Madaka, Madhuri Latha, et al.
Pubblicazione: (2025)
Prompting Medical Large Vision-Language Models to Diagnose Pathologies by Visual Question Answering
di: Guo, Danfeng, et al.
Pubblicazione: (2024)
di: Guo, Danfeng, et al.
Pubblicazione: (2024)
MiniGPT-3D: Efficiently Aligning 3D Point Clouds with Large Language Models using 2D Priors
di: Tang, Yuan, et al.
Pubblicazione: (2024)
di: Tang, Yuan, et al.
Pubblicazione: (2024)
TinyVQA: Compact Multimodal Deep Neural Network for Visual Question Answering on Resource-Constrained Devices
di: Rashid, Hasib-Al, et al.
Pubblicazione: (2024)
di: Rashid, Hasib-Al, et al.
Pubblicazione: (2024)
Adversarial Attacks on VQA-NLE: Exposing and Alleviating Inconsistencies in Visual Question Answering Explanations
di: Yeh, Yahsin, et al.
Pubblicazione: (2025)
di: Yeh, Yahsin, et al.
Pubblicazione: (2025)
Guiding Vision-Language Model Selection for Visual Question-Answering Across Tasks, Domains, and Knowledge Types
di: Sinha, Neelabh, et al.
Pubblicazione: (2024)
di: Sinha, Neelabh, et al.
Pubblicazione: (2024)
PlantVillageVQA: A Visual Question Answering Dataset for Benchmarking Vision-Language Models in Plant Science
di: Sakib, Syed Nazmus, et al.
Pubblicazione: (2025)
di: Sakib, Syed Nazmus, et al.
Pubblicazione: (2025)
MediFact at MEDIQA-M3G 2024: Medical Question Answering in Dermatology with Multimodal Learning
di: Saeed, Nadia
Pubblicazione: (2024)
di: Saeed, Nadia
Pubblicazione: (2024)
MoReVQA: Exploring Modular Reasoning Models for Video Question Answering
di: Min, Juhong, et al.
Pubblicazione: (2024)
di: Min, Juhong, et al.
Pubblicazione: (2024)
Tri-VQA: Triangular Reasoning Medical Visual Question Answering for Multi-Attribute Analysis
di: Fan, Lin, et al.
Pubblicazione: (2024)
di: Fan, Lin, et al.
Pubblicazione: (2024)
MMToM-QA: Multimodal Theory of Mind Question Answering
di: Jin, Chuanyang, et al.
Pubblicazione: (2024)
di: Jin, Chuanyang, et al.
Pubblicazione: (2024)
BIP3D: Bridging 2D Images and 3D Perception for Embodied Intelligence
di: Lin, Xuewu, et al.
Pubblicazione: (2024)
di: Lin, Xuewu, et al.
Pubblicazione: (2024)
CausalChaos! Dataset for Comprehensive Causal Action Question Answering Over Longer Causal Chains Grounded in Dynamic Visual Scenes
di: Parmar, Paritosh, et al.
Pubblicazione: (2024)
di: Parmar, Paritosh, et al.
Pubblicazione: (2024)
3D-GRAND: A Million-Scale Dataset for 3D-LLMs with Better Grounding and Less Hallucination
di: Yang, Jianing, et al.
Pubblicazione: (2024)
di: Yang, Jianing, et al.
Pubblicazione: (2024)
An Embodied Generalist Agent in 3D World
di: Huang, Jiangyong, et al.
Pubblicazione: (2023)
di: Huang, Jiangyong, et al.
Pubblicazione: (2023)
Language-Image Models with 3D Understanding
di: Cho, Jang Hyun, et al.
Pubblicazione: (2024)
di: Cho, Jang Hyun, et al.
Pubblicazione: (2024)
FlowVQA: Mapping Multimodal Logic in Visual Question Answering with Flowcharts
di: Singh, Shubhankar, et al.
Pubblicazione: (2024)
di: Singh, Shubhankar, et al.
Pubblicazione: (2024)
MapIQ: Evaluating Multimodal Large Language Models for Map Question Answering
di: Srivastava, Varun, et al.
Pubblicazione: (2025)
di: Srivastava, Varun, et al.
Pubblicazione: (2025)
Modality-Aware Integration with Large Language Models for Knowledge-based Visual Question Answering
di: Dong, Junnan, et al.
Pubblicazione: (2024)
di: Dong, Junnan, et al.
Pubblicazione: (2024)
RadImageNet-VQA: A Large-Scale CT and MRI Dataset for Radiologic Visual Question Answering
di: Butsanets, Léo, et al.
Pubblicazione: (2025)
di: Butsanets, Léo, et al.
Pubblicazione: (2025)
Bridging the 2D-3D Gap: A Hierarchical Semantic-Geometric Map for Vision Language Navigation
di: Li, Kailing, et al.
Pubblicazione: (2026)
di: Li, Kailing, et al.
Pubblicazione: (2026)
BERT-VQA: Visual Question Answering on Plots
di: Vu, Tai, et al.
Pubblicazione: (2025)
di: Vu, Tai, et al.
Pubblicazione: (2025)
TraveLER: A Modular Multi-LMM Agent Framework for Video Question-Answering
di: Shang, Chuyi, et al.
Pubblicazione: (2024)
di: Shang, Chuyi, et al.
Pubblicazione: (2024)
Situational Awareness Matters in 3D Vision Language Reasoning
di: Man, Yunze, et al.
Pubblicazione: (2024)
di: Man, Yunze, et al.
Pubblicazione: (2024)
Bridging the Gap Between Multimodal Foundation Models and World Models
di: He, Xuehai
Pubblicazione: (2025)
di: He, Xuehai
Pubblicazione: (2025)
Visual Question Decomposition on Multimodal Large Language Models
di: Zhang, Haowei, et al.
Pubblicazione: (2024)
di: Zhang, Haowei, et al.
Pubblicazione: (2024)
Improving Automatic VQA Evaluation Using Large Language Models
di: Mañas, Oscar, et al.
Pubblicazione: (2023)
di: Mañas, Oscar, et al.
Pubblicazione: (2023)
Documenti analoghi
-
Find The Gap: Knowledge Base Reasoning For Visual Question Answering
di: Barezi, Elham J., et al.
Pubblicazione: (2024) -
FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering
di: Huang, Chengyue, et al.
Pubblicazione: (2025) -
Exploring Diverse Methods in Visual Question Answering
di: Li, Panfeng, et al.
Pubblicazione: (2024) -
Multi-Agent VQA: Exploring Multi-Agent Foundation Models in Zero-Shot Visual Question Answering
di: Jiang, Bowen, et al.
Pubblicazione: (2024) -
Distilling Neuro-Symbolic Programs into 3D Multi-modal LLMs
di: Mo, Wentao, et al.
Pubblicazione: (2026)