Query-Guided Spatial-Temporal-Frequency Interaction for Music Audio-Visual Question Answering
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Kun, Yang, Michael Ying, Brandt, Sami Sebastian |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Multimodal Rationales for Explainable Visual Question Answering
por: Li, Kun, et al.
Publicado: (2024)
por: Li, Kun, et al.
Publicado: (2024)
Patch-level Sounding Object Tracking for Audio-Visual Question Answering
por: Li, Zhangbin, et al.
Publicado: (2024)
por: Li, Zhangbin, et al.
Publicado: (2024)
Question-Aware Gaussian Experts for Audio-Visual Question Answering
por: Kim, Hongyeob, et al.
Publicado: (2025)
por: Kim, Hongyeob, et al.
Publicado: (2025)
Music Audio-Visual Question Answering Requires Specialized Multimodal Designs
por: You, Wenhao, et al.
Publicado: (2025)
por: You, Wenhao, et al.
Publicado: (2025)
Perceive, Query & Reason: Enhancing Video QA with Question-Guided Temporal Queries
por: Amoroso, Roberto, et al.
Publicado: (2024)
por: Amoroso, Roberto, et al.
Publicado: (2024)
Answering Diverse Questions via Text Attached with Key Audio-Visual Clues
por: Ye, Qilang, et al.
Publicado: (2024)
por: Ye, Qilang, et al.
Publicado: (2024)
SurgTEMP: Temporal-Aware Surgical Video Question Answering with Text-guided Visual Memory for Laparoscopic Cholecystectomy
por: Li, Shi, et al.
Publicado: (2026)
por: Li, Shi, et al.
Publicado: (2026)
Q-FSRU: Quantum-Augmented Frequency-Spectral For Medical Visual Question Answering
por: Thakur, Rakesh, et al.
Publicado: (2025)
por: Thakur, Rakesh, et al.
Publicado: (2025)
Detect2Interact: Localizing Object Key Field in Visual Question Answering (VQA) with LLMs
por: Wang, Jialou, et al.
Publicado: (2024)
por: Wang, Jialou, et al.
Publicado: (2024)
SaSR-Net: Source-Aware Semantic Representation Network for Enhancing Audio-Visual Question Answering
por: Yang, Tianyu, et al.
Publicado: (2024)
por: Yang, Tianyu, et al.
Publicado: (2024)
RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language
por: Biswas, Subrata, et al.
Publicado: (2025)
por: Biswas, Subrata, et al.
Publicado: (2025)
SpatialV2A: Visual-Guided High-fidelity Spatial Audio Generation
por: Wang, Yanan, et al.
Publicado: (2026)
por: Wang, Yanan, et al.
Publicado: (2026)
Retrieving to Recover: Towards Incomplete Audio-Visual Question Answering via Semantic-consistent Purification
por: Zhang, Jiayu, et al.
Publicado: (2026)
por: Zhang, Jiayu, et al.
Publicado: (2026)
AV-Master: Dual-Path Comprehensive Perception Makes Better Audio-Visual Question Answering
por: Zhang, Jiayu, et al.
Publicado: (2025)
por: Zhang, Jiayu, et al.
Publicado: (2025)
CLIP-Powered TASS: Target-Aware Single-Stream Network for Audio-Visual Question Answering
por: Jiang, Yuanyuan, et al.
Publicado: (2024)
por: Jiang, Yuanyuan, et al.
Publicado: (2024)
Saliency Guided Longitudinal Medical Visual Question Answering
por: Wu, Jialin, et al.
Publicado: (2025)
por: Wu, Jialin, et al.
Publicado: (2025)
STAIR: Spatial-Temporal Reasoning with Auditable Intermediate Results for Video Question Answering
por: Wang, Yueqian, et al.
Publicado: (2024)
por: Wang, Yueqian, et al.
Publicado: (2024)
Spatial-Temporal Graph Mamba for Music-Guided Dance Video Synthesis
por: Tang, Hao, et al.
Publicado: (2025)
por: Tang, Hao, et al.
Publicado: (2025)
Visual Environment-Interactive Planning for Embodied Complex-Question Answering
por: Lan, Ning, et al.
Publicado: (2025)
por: Lan, Ning, et al.
Publicado: (2025)
Enhancing Visual Question Answering with Multimodal LLMs via Chain-of-Question Guided Retrieval-Augmented Generation
por: Xu, Quanxing, et al.
Publicado: (2026)
por: Xu, Quanxing, et al.
Publicado: (2026)
Boosting Audio Visual Question Answering via Key Semantic-Aware Cues
por: Li, Guangyao, et al.
Publicado: (2024)
por: Li, Guangyao, et al.
Publicado: (2024)
Text-Guided Coarse-to-Fine Fusion Network for Robust Remote Sensing Visual Question Answering
por: Zhao, Zhicheng, et al.
Publicado: (2024)
por: Zhao, Zhicheng, et al.
Publicado: (2024)
Selectively Answering Visual Questions
por: Eisenschlos, Julian Martin, et al.
Publicado: (2024)
por: Eisenschlos, Julian Martin, et al.
Publicado: (2024)
CC-VQA: Conflict- and Correlation-Aware Method for Mitigating Knowledge Conflict in Knowledge-Based Visual Question Answering
por: Hong, Yuyang, et al.
Publicado: (2026)
por: Hong, Yuyang, et al.
Publicado: (2026)
Reconstruction as a Bridge for Event-Based Visual Question Answering
por: Lou, Hanyue, et al.
Publicado: (2025)
por: Lou, Hanyue, et al.
Publicado: (2025)
Diversifying Query: Region-Guided Transformer for Temporal Sentence Grounding
por: Sun, Xiaolong, et al.
Publicado: (2024)
por: Sun, Xiaolong, et al.
Publicado: (2024)
Visually Interpretable Subtask Reasoning for Visual Question Answering
por: Cheng, Yu, et al.
Publicado: (2025)
por: Cheng, Yu, et al.
Publicado: (2025)
Targeted Visual Prompting for Medical Visual Question Answering
por: Tascon-Morales, Sergio, et al.
Publicado: (2024)
por: Tascon-Morales, Sergio, et al.
Publicado: (2024)
Visual Robustness Benchmark for Visual Question Answering (VQA)
por: Ishmam, Md Farhan, et al.
Publicado: (2024)
por: Ishmam, Md Farhan, et al.
Publicado: (2024)
Learning Trimodal Relation for Audio-Visual Question Answering with Missing Modality
por: Park, Kyu Ri, et al.
Publicado: (2024)
por: Park, Kyu Ri, et al.
Publicado: (2024)
Look, Listen, and Answer: Overcoming Biases for Audio-Visual Question Answering
por: Ma, Jie, et al.
Publicado: (2024)
por: Ma, Jie, et al.
Publicado: (2024)
DriveLM: Driving with Graph Visual Question Answering
por: Sima, Chonghao, et al.
Publicado: (2023)
por: Sima, Chonghao, et al.
Publicado: (2023)
Questioning the Stability of Visual Question Answering
por: Rosenfeld, Amir, et al.
Publicado: (2025)
por: Rosenfeld, Amir, et al.
Publicado: (2025)
GoT-CQA: Graph-of-Thought Guided Compositional Reasoning for Chart Question Answering
por: Zhang, Lingling, et al.
Publicado: (2024)
por: Zhang, Lingling, et al.
Publicado: (2024)
Robust Audio-Visual Segmentation via Audio-Guided Visual Convergent Alignment
por: Liu, Chen, et al.
Publicado: (2025)
por: Liu, Chen, et al.
Publicado: (2025)
Evaluating Variance in Visual Question Answering Benchmarks
por: SR, Nikitha
Publicado: (2025)
por: SR, Nikitha
Publicado: (2025)
QA-Dragon: Query-Aware Dynamic RAG System for Knowledge-Intensive Visual Question Answering
por: Jiang, Zhuohang, et al.
Publicado: (2025)
por: Jiang, Zhuohang, et al.
Publicado: (2025)
Enhancing Generalization in Medical Visual Question Answering Tasks via Gradient-Guided Model Perturbation
por: Liu, Gang, et al.
Publicado: (2024)
por: Liu, Gang, et al.
Publicado: (2024)
From Hindsight to Foresight: Self-Encouraged Hindsight Distillation for Knowledge-based Visual Question Answering
por: Zhao, Yu, et al.
Publicado: (2025)
por: Zhao, Yu, et al.
Publicado: (2025)
BERT-VQA: Visual Question Answering on Plots
por: Vu, Tai, et al.
Publicado: (2025)
por: Vu, Tai, et al.
Publicado: (2025)
Ejemplares similares
-
Multimodal Rationales for Explainable Visual Question Answering
por: Li, Kun, et al.
Publicado: (2024) -
Patch-level Sounding Object Tracking for Audio-Visual Question Answering
por: Li, Zhangbin, et al.
Publicado: (2024) -
Question-Aware Gaussian Experts for Audio-Visual Question Answering
por: Kim, Hongyeob, et al.
Publicado: (2025) -
Music Audio-Visual Question Answering Requires Specialized Multimodal Designs
por: You, Wenhao, et al.
Publicado: (2025) -
Perceive, Query & Reason: Enhancing Video QA with Question-Guided Temporal Queries
por: Amoroso, Roberto, et al.
Publicado: (2024)