Question-Aware Gaussian Experts for Audio-Visual Question Answering
Fuente:
arXiv
Guardado en:
| Autores principales: | Kim, Hongyeob, Jung, Inyoung, Suh, Dayoon, Zhang, Youjia, Lee, Sangmin, Hong, Sungeun |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
RA-Touch: Retrieval-Augmented Touch Understanding with Enriched Visual Data
por: Cho, Yoorhim, et al.
Publicado: (2025)
por: Cho, Yoorhim, et al.
Publicado: (2025)
Backpropagation-Free Test-Time Adaptation via Probabilistic Gaussian Alignment
por: Zhang, Youjia, et al.
Publicado: (2025)
por: Zhang, Youjia, et al.
Publicado: (2025)
Learning Trimodal Relation for Audio-Visual Question Answering with Missing Modality
por: Park, Kyu Ri, et al.
Publicado: (2024)
por: Park, Kyu Ri, et al.
Publicado: (2024)
Instance-Aware Test-Time Segmentation for Continual Domain Shifts
por: Lee, Seunghwan, et al.
Publicado: (2025)
por: Lee, Seunghwan, et al.
Publicado: (2025)
Breaking the Visual Shortcuts in Multimodal Knowledge-Based Visual Question Answering
por: Lee, Dosung, et al.
Publicado: (2025)
por: Lee, Dosung, et al.
Publicado: (2025)
ZOO-Prune: Training-Free Token Pruning via Zeroth-Order Gradient Estimation in Vision-Language Models
por: Kim, Youngeun, et al.
Publicado: (2025)
por: Kim, Youngeun, et al.
Publicado: (2025)
SaSR-Net: Source-Aware Semantic Representation Network for Enhancing Audio-Visual Question Answering
por: Yang, Tianyu, et al.
Publicado: (2024)
por: Yang, Tianyu, et al.
Publicado: (2024)
CLIP-Powered TASS: Target-Aware Single-Stream Network for Audio-Visual Question Answering
por: Jiang, Yuanyuan, et al.
Publicado: (2024)
por: Jiang, Yuanyuan, et al.
Publicado: (2024)
Patch-level Sounding Object Tracking for Audio-Visual Question Answering
por: Li, Zhangbin, et al.
Publicado: (2024)
por: Li, Zhangbin, et al.
Publicado: (2024)
Object-aware Sound Source Localization via Audio-Visual Scene Understanding
por: Um, Sung Jin, et al.
Publicado: (2025)
por: Um, Sung Jin, et al.
Publicado: (2025)
Boosting Audio Visual Question Answering via Key Semantic-Aware Cues
por: Li, Guangyao, et al.
Publicado: (2024)
por: Li, Guangyao, et al.
Publicado: (2024)
Questioning the Stability of Visual Question Answering
por: Rosenfeld, Amir, et al.
Publicado: (2025)
por: Rosenfeld, Amir, et al.
Publicado: (2025)
Privacy-Aware Document Visual Question Answering
por: Tito, Rubèn, et al.
Publicado: (2023)
por: Tito, Rubèn, et al.
Publicado: (2023)
DocVXQA: Context-Aware Visual Explanations for Document Question Answering
por: Souibgui, Mohamed Ali, et al.
Publicado: (2025)
por: Souibgui, Mohamed Ali, et al.
Publicado: (2025)
Answering Diverse Questions via Text Attached with Key Audio-Visual Clues
por: Ye, Qilang, et al.
Publicado: (2024)
por: Ye, Qilang, et al.
Publicado: (2024)
Expert Knowledge-Aware Image Difference Graph Representation Learning for Difference-Aware Medical Visual Question Answering
por: Hu, Xinyue, et al.
Publicado: (2023)
por: Hu, Xinyue, et al.
Publicado: (2023)
Selectively Answering Visual Questions
por: Eisenschlos, Julian Martin, et al.
Publicado: (2024)
por: Eisenschlos, Julian Martin, et al.
Publicado: (2024)
GeReA: Question-Aware Prompt Captions for Knowledge-based Visual Question Answering
por: Ma, Ziyu, et al.
Publicado: (2024)
por: Ma, Ziyu, et al.
Publicado: (2024)
AV-Master: Dual-Path Comprehensive Perception Makes Better Audio-Visual Question Answering
por: Zhang, Jiayu, et al.
Publicado: (2025)
por: Zhang, Jiayu, et al.
Publicado: (2025)
Retrieving to Recover: Towards Incomplete Audio-Visual Question Answering via Semantic-consistent Purification
por: Zhang, Jiayu, et al.
Publicado: (2026)
por: Zhang, Jiayu, et al.
Publicado: (2026)
Query-Guided Spatial-Temporal-Frequency Interaction for Music Audio-Visual Question Answering
por: Li, Kun, et al.
Publicado: (2026)
por: Li, Kun, et al.
Publicado: (2026)
FIQ: Fundamental Question Generation with the Integration of Question Embeddings for Video Question Answering
por: Oh, Ju-Young, et al.
Publicado: (2025)
por: Oh, Ju-Young, et al.
Publicado: (2025)
Question-Instructed Visual Descriptions for Zero-Shot Video Question Answering
por: Romero, David, et al.
Publicado: (2024)
por: Romero, David, et al.
Publicado: (2024)
Retrieval-Augmented Natural Language Reasoning for Explainable Visual Question Answering
por: Lim, Su Hyeon, et al.
Publicado: (2024)
por: Lim, Su Hyeon, et al.
Publicado: (2024)
Learning Question-Aware Keyframe Selection with Synthetic Supervision for Video Question Answering
por: Kwon, Minchan, et al.
Publicado: (2026)
por: Kwon, Minchan, et al.
Publicado: (2026)
QIRL: Boosting Visual Question Answering via Optimized Question-Image Relation Learning
por: Xu, Quanxing, et al.
Publicado: (2025)
por: Xu, Quanxing, et al.
Publicado: (2025)
Visually Interpretable Subtask Reasoning for Visual Question Answering
por: Cheng, Yu, et al.
Publicado: (2025)
por: Cheng, Yu, et al.
Publicado: (2025)
Targeted Visual Prompting for Medical Visual Question Answering
por: Tascon-Morales, Sergio, et al.
Publicado: (2024)
por: Tascon-Morales, Sergio, et al.
Publicado: (2024)
Visual Robustness Benchmark for Visual Question Answering (VQA)
por: Ishmam, Md Farhan, et al.
Publicado: (2024)
por: Ishmam, Md Farhan, et al.
Publicado: (2024)
Human Uncertainty-Aware Data Selection and Automatic Labeling in Visual Question Answering
por: Lan, Jian, et al.
Publicado: (2025)
por: Lan, Jian, et al.
Publicado: (2025)
Enhancing Continual Learning in Visual Question Answering with Modality-Aware Feature Distillation
por: Nikandrou, Malvina, et al.
Publicado: (2024)
por: Nikandrou, Malvina, et al.
Publicado: (2024)
Evaluating Variance in Visual Question Answering Benchmarks
por: SR, Nikitha
Publicado: (2025)
por: SR, Nikitha
Publicado: (2025)
Multimodal Rationales for Explainable Visual Question Answering
por: Li, Kun, et al.
Publicado: (2024)
por: Li, Kun, et al.
Publicado: (2024)
Hallucination Benchmark in Medical Visual Question Answering
por: Wu, Jinge, et al.
Publicado: (2024)
por: Wu, Jinge, et al.
Publicado: (2024)
DocPrune:Efficient Document Question Answering via Background, Question, and Comprehension-aware Token Pruning
por: Choi, Joonmyung, et al.
Publicado: (2026)
por: Choi, Joonmyung, et al.
Publicado: (2026)
Object Retrieval for Visual Question Answering with Outside Knowledge
por: Kan, Shichao, et al.
Publicado: (2024)
por: Kan, Shichao, et al.
Publicado: (2024)
PMC-VQA: Visual Instruction Tuning for Medical Visual Question Answering
por: Zhang, Xiaoman, et al.
Publicado: (2023)
por: Zhang, Xiaoman, et al.
Publicado: (2023)
Variational Visual Question Answering for Uncertainty-Aware Selective Prediction
por: Wieczorek, Tobias Jan, et al.
Publicado: (2025)
por: Wieczorek, Tobias Jan, et al.
Publicado: (2025)
Location-Aware Pretraining for Medical Difference Visual Question Answering
por: Musinguzi, Denis, et al.
Publicado: (2026)
por: Musinguzi, Denis, et al.
Publicado: (2026)
RoboSurg-VQA: A Multimodal Benchmark for Surgical Segmentation-Aware Visual Question Answering
por: Zhang, Chengyi, et al.
Publicado: (2026)
por: Zhang, Chengyi, et al.
Publicado: (2026)
Ejemplares similares
-
RA-Touch: Retrieval-Augmented Touch Understanding with Enriched Visual Data
por: Cho, Yoorhim, et al.
Publicado: (2025) -
Backpropagation-Free Test-Time Adaptation via Probabilistic Gaussian Alignment
por: Zhang, Youjia, et al.
Publicado: (2025) -
Learning Trimodal Relation for Audio-Visual Question Answering with Missing Modality
por: Park, Kyu Ri, et al.
Publicado: (2024) -
Instance-Aware Test-Time Segmentation for Continual Domain Shifts
por: Lee, Seunghwan, et al.
Publicado: (2025) -
Breaking the Visual Shortcuts in Multimodal Knowledge-Based Visual Question Answering
por: Lee, Dosung, et al.
Publicado: (2025)