CLIP-Powered TASS: Target-Aware Single-Stream Network for Audio-Visual Question Answering
Fuente:
arXiv
Guardado en:
| Autores principales: | Jiang, Yuanyuan, Yin, Jianqin |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Question-Aware Gaussian Experts for Audio-Visual Question Answering
por: Kim, Hongyeob, et al.
Publicado: (2025)
por: Kim, Hongyeob, et al.
Publicado: (2025)
Leveraging the Video-level Semantic Consistency of Event for Audio-visual Event Localization
por: Jiang, Yuanyuan, et al.
Publicado: (2022)
por: Jiang, Yuanyuan, et al.
Publicado: (2022)
ESG-Net: Event-Aware Semantic Guided Network for Dense Audio-Visual Event Localization
por: Li, Huilai, et al.
Publicado: (2025)
por: Li, Huilai, et al.
Publicado: (2025)
CLIP-UP: CLIP-Based Unanswerable Problem Detection for Visual Question Answering
por: Vardi, Ben, et al.
Publicado: (2025)
por: Vardi, Ben, et al.
Publicado: (2025)
SaSR-Net: Source-Aware Semantic Representation Network for Enhancing Audio-Visual Question Answering
por: Yang, Tianyu, et al.
Publicado: (2024)
por: Yang, Tianyu, et al.
Publicado: (2024)
Targeted Visual Prompting for Medical Visual Question Answering
por: Tascon-Morales, Sergio, et al.
Publicado: (2024)
por: Tascon-Morales, Sergio, et al.
Publicado: (2024)
Boosting Audio Visual Question Answering via Key Semantic-Aware Cues
por: Li, Guangyao, et al.
Publicado: (2024)
por: Li, Guangyao, et al.
Publicado: (2024)
Answering Diverse Questions via Text Attached with Key Audio-Visual Clues
por: Ye, Qilang, et al.
Publicado: (2024)
por: Ye, Qilang, et al.
Publicado: (2024)
ActivityCLIP: Enhancing Group Activity Recognition by Mining Complementary Information from Text to Supplement Image Modality
por: Xu, Guoliang, et al.
Publicado: (2024)
por: Xu, Guoliang, et al.
Publicado: (2024)
Patch-level Sounding Object Tracking for Audio-Visual Question Answering
por: Li, Zhangbin, et al.
Publicado: (2024)
por: Li, Zhangbin, et al.
Publicado: (2024)
Query-Guided Spatial-Temporal-Frequency Interaction for Music Audio-Visual Question Answering
por: Li, Kun, et al.
Publicado: (2026)
por: Li, Kun, et al.
Publicado: (2026)
CLIP-AE: CLIP-assisted Cross-view Audio-Visual Enhancement for Unsupervised Temporal Action Localization
por: Xia, Rui, et al.
Publicado: (2025)
por: Xia, Rui, et al.
Publicado: (2025)
Streaming Video Question-Answering with In-context Video KV-Cache Retrieval
por: Di, Shangzhe, et al.
Publicado: (2025)
por: Di, Shangzhe, et al.
Publicado: (2025)
EAR: Enhancing Uni-Modal Representations for Weakly Supervised Audio-Visual Video Parsing
por: Li, Huilai, et al.
Publicado: (2026)
por: Li, Huilai, et al.
Publicado: (2026)
A Two-stream Hybrid CNN-Transformer Network for Skeleton-based Human Interaction Recognition
por: Yin, Ruoqi, et al.
Publicado: (2023)
por: Yin, Ruoqi, et al.
Publicado: (2023)
AV-Master: Dual-Path Comprehensive Perception Makes Better Audio-Visual Question Answering
por: Zhang, Jiayu, et al.
Publicado: (2025)
por: Zhang, Jiayu, et al.
Publicado: (2025)
Retrieving to Recover: Towards Incomplete Audio-Visual Question Answering via Semantic-consistent Purification
por: Zhang, Jiayu, et al.
Publicado: (2026)
por: Zhang, Jiayu, et al.
Publicado: (2026)
Enhancing Continual Learning in Visual Question Answering with Modality-Aware Feature Distillation
por: Nikandrou, Malvina, et al.
Publicado: (2024)
por: Nikandrou, Malvina, et al.
Publicado: (2024)
Human Uncertainty-Aware Data Selection and Automatic Labeling in Visual Question Answering
por: Lan, Jian, et al.
Publicado: (2025)
por: Lan, Jian, et al.
Publicado: (2025)
Selectively Answering Visual Questions
por: Eisenschlos, Julian Martin, et al.
Publicado: (2024)
por: Eisenschlos, Julian Martin, et al.
Publicado: (2024)
GeReA: Question-Aware Prompt Captions for Knowledge-based Visual Question Answering
por: Ma, Ziyu, et al.
Publicado: (2024)
por: Ma, Ziyu, et al.
Publicado: (2024)
CogStream: Context-guided Streaming Video Question Answering
por: Zhao, Zicheng, et al.
Publicado: (2025)
por: Zhao, Zicheng, et al.
Publicado: (2025)
Visual Robustness Benchmark for Visual Question Answering (VQA)
por: Ishmam, Md Farhan, et al.
Publicado: (2024)
por: Ishmam, Md Farhan, et al.
Publicado: (2024)
Visually Interpretable Subtask Reasoning for Visual Question Answering
por: Cheng, Yu, et al.
Publicado: (2025)
por: Cheng, Yu, et al.
Publicado: (2025)
Learning Trimodal Relation for Audio-Visual Question Answering with Missing Modality
por: Park, Kyu Ri, et al.
Publicado: (2024)
por: Park, Kyu Ri, et al.
Publicado: (2024)
Look, Listen, and Answer: Overcoming Biases for Audio-Visual Question Answering
por: Ma, Jie, et al.
Publicado: (2024)
por: Ma, Jie, et al.
Publicado: (2024)
Variational Visual Question Answering for Uncertainty-Aware Selective Prediction
por: Wieczorek, Tobias Jan, et al.
Publicado: (2025)
por: Wieczorek, Tobias Jan, et al.
Publicado: (2025)
Location-Aware Pretraining for Medical Difference Visual Question Answering
por: Musinguzi, Denis, et al.
Publicado: (2026)
por: Musinguzi, Denis, et al.
Publicado: (2026)
Questioning the Stability of Visual Question Answering
por: Rosenfeld, Amir, et al.
Publicado: (2025)
por: Rosenfeld, Amir, et al.
Publicado: (2025)
Object-centric Video Question Answering with Visual Grounding and Referring
por: Wang, Haochen, et al.
Publicado: (2025)
por: Wang, Haochen, et al.
Publicado: (2025)
Privacy-Aware Document Visual Question Answering
por: Tito, Rubèn, et al.
Publicado: (2023)
por: Tito, Rubèn, et al.
Publicado: (2023)
StreamKV: Streaming Video Question-Answering with Segment-based KV Cache Retrieval and Compression
por: Chen, Yilong, et al.
Publicado: (2025)
por: Chen, Yilong, et al.
Publicado: (2025)
Self-Bootstrapped Visual-Language Model for Knowledge Selection and Question Answering
por: Hao, Dongze, et al.
Publicado: (2024)
por: Hao, Dongze, et al.
Publicado: (2024)
VoQA: Visual-only Question Answering
por: An, Jianing, et al.
Publicado: (2025)
por: An, Jianing, et al.
Publicado: (2025)
Towards more realistic human motion prediction with attention to motion coordination
por: Ding, Pengxiang, et al.
Publicado: (2024)
por: Ding, Pengxiang, et al.
Publicado: (2024)
DisasterVQA: A Visual Question Answering Benchmark Dataset for Disaster Scenes
por: Al-Mohannadi, Aisha, et al.
Publicado: (2026)
por: Al-Mohannadi, Aisha, et al.
Publicado: (2026)
Multimodal Rationales for Explainable Visual Question Answering
por: Li, Kun, et al.
Publicado: (2024)
por: Li, Kun, et al.
Publicado: (2024)
Evaluating Variance in Visual Question Answering Benchmarks
por: SR, Nikitha
Publicado: (2025)
por: SR, Nikitha
Publicado: (2025)
Music Audio-Visual Question Answering Requires Specialized Multimodal Designs
por: You, Wenhao, et al.
Publicado: (2025)
por: You, Wenhao, et al.
Publicado: (2025)
FaithSCAN: Model-Driven Single-Pass Hallucination Detection for Faithful Visual Question Answering
por: Tong, Chaodong, et al.
Publicado: (2026)
por: Tong, Chaodong, et al.
Publicado: (2026)
Ejemplares similares
-
Question-Aware Gaussian Experts for Audio-Visual Question Answering
por: Kim, Hongyeob, et al.
Publicado: (2025) -
Leveraging the Video-level Semantic Consistency of Event for Audio-visual Event Localization
por: Jiang, Yuanyuan, et al.
Publicado: (2022) -
ESG-Net: Event-Aware Semantic Guided Network for Dense Audio-Visual Event Localization
por: Li, Huilai, et al.
Publicado: (2025) -
CLIP-UP: CLIP-Based Unanswerable Problem Detection for Visual Question Answering
por: Vardi, Ben, et al.
Publicado: (2025) -
SaSR-Net: Source-Aware Semantic Representation Network for Enhancing Audio-Visual Question Answering
por: Yang, Tianyu, et al.
Publicado: (2024)