SViQA: A Unified Speech-Vision Multimodal Model for Textless Visual Question Answering
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Li, Bingxin |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
RSAdapter: Adapting Multimodal Models for Remote Sensing Visual Question Answering
par: Wang, Yuduo, et autres
Publié: (2023)
par: Wang, Yuduo, et autres
Publié: (2023)
MMToM-QA: Multimodal Theory of Mind Question Answering
par: Jin, Chuanyang, et autres
Publié: (2024)
par: Jin, Chuanyang, et autres
Publié: (2024)
DarkQA: Benchmarking Vision-Language Models on Visual-Primitive Question Answering in Low-Light Indoor Scenes
par: Park, Yohan, et autres
Publié: (2025)
par: Park, Yohan, et autres
Publié: (2025)
Vision-Language Models for Medical Report Generation and Visual Question Answering: A Review
par: Hartsock, Iryna, et autres
Publié: (2024)
par: Hartsock, Iryna, et autres
Publié: (2024)
Questioning the Stability of Visual Question Answering
par: Rosenfeld, Amir, et autres
Publié: (2025)
par: Rosenfeld, Amir, et autres
Publié: (2025)
Answering Questions in Stages: Prompt Chaining for Contract QA
par: Roegiest, Adam, et autres
Publié: (2024)
par: Roegiest, Adam, et autres
Publié: (2024)
TM-PATHVQA:90000+ Textless Multilingual Questions for Medical Visual Question Answering
par: Rajkhowa, Tonmoy, et autres
Publié: (2024)
par: Rajkhowa, Tonmoy, et autres
Publié: (2024)
ElectroVizQA: How well do Multi-modal LLMs perform in Electronics Visual Question Answering?
par: Meshram, Pragati Shuddhodhan, et autres
Publié: (2024)
par: Meshram, Pragati Shuddhodhan, et autres
Publié: (2024)
Describe Anything Model for Visual Question Answering on Text-rich Images
par: Vu, Yen-Linh, et autres
Publié: (2025)
par: Vu, Yen-Linh, et autres
Publié: (2025)
Enhancing Visual Question Answering through Ranking-Based Hybrid Training and Multimodal Fusion
par: Chen, Peiyuan, et autres
Publié: (2024)
par: Chen, Peiyuan, et autres
Publié: (2024)
BERT-VQA: Visual Question Answering on Plots
par: Vu, Tai, et autres
Publié: (2025)
par: Vu, Tai, et autres
Publié: (2025)
CL-MoE: Enhancing Multimodal Large Language Model with Dual Momentum Mixture-of-Experts for Continual Visual Question Answering
par: Huai, Tianyu, et autres
Publié: (2025)
par: Huai, Tianyu, et autres
Publié: (2025)
Spatially Grounded Explanations in Vision Language Models for Document Visual Question Answering
par: Lagos, Maximiliano Hormazábal, et autres
Publié: (2025)
par: Lagos, Maximiliano Hormazábal, et autres
Publié: (2025)
ReasonDrive: Efficient Visual Question Answering for Autonomous Vehicles with Reasoning-Enhanced Small Vision-Language Models
par: Chahe, Amirhosein, et autres
Publié: (2025)
par: Chahe, Amirhosein, et autres
Publié: (2025)
COREVQA: A Crowd Observation and Reasoning Entailment Visual Question Answering Benchmark
par: Chintapatla, Ishant, et autres
Publié: (2025)
par: Chintapatla, Ishant, et autres
Publié: (2025)
Prompting Medical Large Vision-Language Models to Diagnose Pathologies by Visual Question Answering
par: Guo, Danfeng, et autres
Publié: (2024)
par: Guo, Danfeng, et autres
Publié: (2024)
FlowVQA: Mapping Multimodal Logic in Visual Question Answering with Flowcharts
par: Singh, Shubhankar, et autres
Publié: (2024)
par: Singh, Shubhankar, et autres
Publié: (2024)
DocVXQA: Context-Aware Visual Explanations for Document Question Answering
par: Souibgui, Mohamed Ali, et autres
Publié: (2025)
par: Souibgui, Mohamed Ali, et autres
Publié: (2025)
Learning to Compress Contexts for Efficient Knowledge-based Visual Question Answering
par: Weng, Weixi, et autres
Publié: (2024)
par: Weng, Weixi, et autres
Publié: (2024)
TPCL: Task Progressive Curriculum Learning for Robust Visual Question Answering
par: Akl, Ahmed, et autres
Publié: (2024)
par: Akl, Ahmed, et autres
Publié: (2024)
PlantVillageVQA: A Visual Question Answering Dataset for Benchmarking Vision-Language Models in Plant Science
par: Sakib, Syed Nazmus, et autres
Publié: (2025)
par: Sakib, Syed Nazmus, et autres
Publié: (2025)
Exploring the Effectiveness of Object-Centric Representations in Visual Question Answering: Comparative Insights with Foundation Models
par: Mamaghan, Amir Mohammad Karimi, et autres
Publié: (2024)
par: Mamaghan, Amir Mohammad Karimi, et autres
Publié: (2024)
Towards Self-Explainable Document Visual Question Answering with Chain-of-Explanation Predictions
par: Indrehus, Kjetil, et autres
Publié: (2026)
par: Indrehus, Kjetil, et autres
Publié: (2026)
Privacy-Aware Document Visual Question Answering
par: Tito, Rubèn, et autres
Publié: (2023)
par: Tito, Rubèn, et autres
Publié: (2023)
Exploring Diverse Methods in Visual Question Answering
par: Li, Panfeng, et autres
Publié: (2024)
par: Li, Panfeng, et autres
Publié: (2024)
RoadscapesQA: A Multitask, Multimodal Dataset for Visual Question Answering on Indian Roads
par: Iyer, Vijayasri, et autres
Publié: (2026)
par: Iyer, Vijayasri, et autres
Publié: (2026)
Bridging Vision Language Models and Symbolic Grounding for Video Question Answering
par: Ma, Haodi, et autres
Publié: (2025)
par: Ma, Haodi, et autres
Publié: (2025)
SViM3D: Stable Video Material Diffusion for Single Image 3D Generation
par: Engelhardt, Andreas, et autres
Publié: (2025)
par: Engelhardt, Andreas, et autres
Publié: (2025)
Guiding Vision-Language Model Selection for Visual Question-Answering Across Tasks, Domains, and Knowledge Types
par: Sinha, Neelabh, et autres
Publié: (2024)
par: Sinha, Neelabh, et autres
Publié: (2024)
TinyVQA: Compact Multimodal Deep Neural Network for Visual Question Answering on Resource-Constrained Devices
par: Rashid, Hasib-Al, et autres
Publié: (2024)
par: Rashid, Hasib-Al, et autres
Publié: (2024)
ViInfographicVQA: A Benchmark for Single and Multi-image Visual Question Answering on Vietnamese Infographics
par: Van-Dinh, Tue-Thu, et autres
Publié: (2025)
par: Van-Dinh, Tue-Thu, et autres
Publié: (2025)
STLLaVA-Med: Self-Training Large Language and Vision Assistant for Medical Question-Answering
par: Sun, Guohao, et autres
Publié: (2024)
par: Sun, Guohao, et autres
Publié: (2024)
MM-Prompt: Cross-Modal Prompt Tuning for Continual Visual Question Answering
par: Li, Xu, et autres
Publié: (2025)
par: Li, Xu, et autres
Publié: (2025)
Advancing Egocentric Video Question Answering with Multimodal Large Language Models
par: Patel, Alkesh, et autres
Publié: (2025)
par: Patel, Alkesh, et autres
Publié: (2025)
Evaluating Zero-Shot GPT-4V Performance on 3D Visual Question Answering Benchmarks
par: Singh, Simranjit, et autres
Publié: (2024)
par: Singh, Simranjit, et autres
Publié: (2024)
RECODE: Reasoning Through Code Generation for Visual Question Answering
par: Shen, Junhong, et autres
Publié: (2025)
par: Shen, Junhong, et autres
Publié: (2025)
Prophet: Prompting Large Language Models with Complementary Answer Heuristics for Knowledge-based Visual Question Answering
par: Yu, Zhou, et autres
Publié: (2023)
par: Yu, Zhou, et autres
Publié: (2023)
Federated Document Visual Question Answering: A Pilot Study
par: Nguyen, Khanh, et autres
Publié: (2024)
par: Nguyen, Khanh, et autres
Publié: (2024)
MANZANO: A Simple and Scalable Unified Multimodal Model with a Hybrid Vision Tokenizer
par: Li, Yanghao, et autres
Publié: (2025)
par: Li, Yanghao, et autres
Publié: (2025)
MapIQ: Evaluating Multimodal Large Language Models for Map Question Answering
par: Srivastava, Varun, et autres
Publié: (2025)
par: Srivastava, Varun, et autres
Publié: (2025)
Documents similaires
-
RSAdapter: Adapting Multimodal Models for Remote Sensing Visual Question Answering
par: Wang, Yuduo, et autres
Publié: (2023) -
MMToM-QA: Multimodal Theory of Mind Question Answering
par: Jin, Chuanyang, et autres
Publié: (2024) -
DarkQA: Benchmarking Vision-Language Models on Visual-Primitive Question Answering in Low-Light Indoor Scenes
par: Park, Yohan, et autres
Publié: (2025) -
Vision-Language Models for Medical Report Generation and Visual Question Answering: A Review
par: Hartsock, Iryna, et autres
Publié: (2024) -
Questioning the Stability of Visual Question Answering
par: Rosenfeld, Amir, et autres
Publié: (2025)