Salvato in:
| Autori principali: | Jiang, Yuanyuan, Yin, Jianqin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2405.07451 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Leveraging the Video-level Semantic Consistency of Event for Audio-visual Event Localization
di: Jiang, Yuanyuan, et al.
Pubblicazione: (2022)
di: Jiang, Yuanyuan, et al.
Pubblicazione: (2022)
Question-Aware Gaussian Experts for Audio-Visual Question Answering
di: Kim, Hongyeob, et al.
Pubblicazione: (2025)
di: Kim, Hongyeob, et al.
Pubblicazione: (2025)
ESG-Net: Event-Aware Semantic Guided Network for Dense Audio-Visual Event Localization
di: Li, Huilai, et al.
Pubblicazione: (2025)
di: Li, Huilai, et al.
Pubblicazione: (2025)
CLIP-UP: CLIP-Based Unanswerable Problem Detection for Visual Question Answering
di: Vardi, Ben, et al.
Pubblicazione: (2025)
di: Vardi, Ben, et al.
Pubblicazione: (2025)
SaSR-Net: Source-Aware Semantic Representation Network for Enhancing Audio-Visual Question Answering
di: Yang, Tianyu, et al.
Pubblicazione: (2024)
di: Yang, Tianyu, et al.
Pubblicazione: (2024)
Targeted Visual Prompting for Medical Visual Question Answering
di: Tascon-Morales, Sergio, et al.
Pubblicazione: (2024)
di: Tascon-Morales, Sergio, et al.
Pubblicazione: (2024)
Boosting Audio Visual Question Answering via Key Semantic-Aware Cues
di: Li, Guangyao, et al.
Pubblicazione: (2024)
di: Li, Guangyao, et al.
Pubblicazione: (2024)
ActivityCLIP: Enhancing Group Activity Recognition by Mining Complementary Information from Text to Supplement Image Modality
di: Xu, Guoliang, et al.
Pubblicazione: (2024)
di: Xu, Guoliang, et al.
Pubblicazione: (2024)
Answering Diverse Questions via Text Attached with Key Audio-Visual Clues
di: Ye, Qilang, et al.
Pubblicazione: (2024)
di: Ye, Qilang, et al.
Pubblicazione: (2024)
A Two-stream Hybrid CNN-Transformer Network for Skeleton-based Human Interaction Recognition
di: Yin, Ruoqi, et al.
Pubblicazione: (2023)
di: Yin, Ruoqi, et al.
Pubblicazione: (2023)
Patch-level Sounding Object Tracking for Audio-Visual Question Answering
di: Li, Zhangbin, et al.
Pubblicazione: (2024)
di: Li, Zhangbin, et al.
Pubblicazione: (2024)
EAR: Enhancing Uni-Modal Representations for Weakly Supervised Audio-Visual Video Parsing
di: Li, Huilai, et al.
Pubblicazione: (2026)
di: Li, Huilai, et al.
Pubblicazione: (2026)
Query-Guided Spatial-Temporal-Frequency Interaction for Music Audio-Visual Question Answering
di: Li, Kun, et al.
Pubblicazione: (2026)
di: Li, Kun, et al.
Pubblicazione: (2026)
CLIP-AE: CLIP-assisted Cross-view Audio-Visual Enhancement for Unsupervised Temporal Action Localization
di: Xia, Rui, et al.
Pubblicazione: (2025)
di: Xia, Rui, et al.
Pubblicazione: (2025)
Streaming Video Question-Answering with In-context Video KV-Cache Retrieval
di: Di, Shangzhe, et al.
Pubblicazione: (2025)
di: Di, Shangzhe, et al.
Pubblicazione: (2025)
AV-Master: Dual-Path Comprehensive Perception Makes Better Audio-Visual Question Answering
di: Zhang, Jiayu, et al.
Pubblicazione: (2025)
di: Zhang, Jiayu, et al.
Pubblicazione: (2025)
Retrieving to Recover: Towards Incomplete Audio-Visual Question Answering via Semantic-consistent Purification
di: Zhang, Jiayu, et al.
Pubblicazione: (2026)
di: Zhang, Jiayu, et al.
Pubblicazione: (2026)
Selectively Answering Visual Questions
di: Eisenschlos, Julian Martin, et al.
Pubblicazione: (2024)
di: Eisenschlos, Julian Martin, et al.
Pubblicazione: (2024)
Towards more realistic human motion prediction with attention to motion coordination
di: Ding, Pengxiang, et al.
Pubblicazione: (2024)
di: Ding, Pengxiang, et al.
Pubblicazione: (2024)
Learning Trimodal Relation for Audio-Visual Question Answering with Missing Modality
di: Park, Kyu Ri, et al.
Pubblicazione: (2024)
di: Park, Kyu Ri, et al.
Pubblicazione: (2024)
Look, Listen, and Answer: Overcoming Biases for Audio-Visual Question Answering
di: Ma, Jie, et al.
Pubblicazione: (2024)
di: Ma, Jie, et al.
Pubblicazione: (2024)
Privacy-Aware Document Visual Question Answering
di: Tito, Rubèn, et al.
Pubblicazione: (2023)
di: Tito, Rubèn, et al.
Pubblicazione: (2023)
Music Audio-Visual Question Answering Requires Specialized Multimodal Designs
di: You, Wenhao, et al.
Pubblicazione: (2025)
di: You, Wenhao, et al.
Pubblicazione: (2025)
CogStream: Context-guided Streaming Video Question Answering
di: Zhao, Zicheng, et al.
Pubblicazione: (2025)
di: Zhao, Zicheng, et al.
Pubblicazione: (2025)
Enhancing Continual Learning in Visual Question Answering with Modality-Aware Feature Distillation
di: Nikandrou, Malvina, et al.
Pubblicazione: (2024)
di: Nikandrou, Malvina, et al.
Pubblicazione: (2024)
Human Uncertainty-Aware Data Selection and Automatic Labeling in Visual Question Answering
di: Lan, Jian, et al.
Pubblicazione: (2025)
di: Lan, Jian, et al.
Pubblicazione: (2025)
GeReA: Question-Aware Prompt Captions for Knowledge-based Visual Question Answering
di: Ma, Ziyu, et al.
Pubblicazione: (2024)
di: Ma, Ziyu, et al.
Pubblicazione: (2024)
Questioning the Stability of Visual Question Answering
di: Rosenfeld, Amir, et al.
Pubblicazione: (2025)
di: Rosenfeld, Amir, et al.
Pubblicazione: (2025)
Variational Visual Question Answering for Uncertainty-Aware Selective Prediction
di: Wieczorek, Tobias Jan, et al.
Pubblicazione: (2025)
di: Wieczorek, Tobias Jan, et al.
Pubblicazione: (2025)
Location-Aware Pretraining for Medical Difference Visual Question Answering
di: Musinguzi, Denis, et al.
Pubblicazione: (2026)
di: Musinguzi, Denis, et al.
Pubblicazione: (2026)
VoQA: Visual-only Question Answering
di: An, Jianing, et al.
Pubblicazione: (2025)
di: An, Jianing, et al.
Pubblicazione: (2025)
Visual Robustness Benchmark for Visual Question Answering (VQA)
di: Ishmam, Md Farhan, et al.
Pubblicazione: (2024)
di: Ishmam, Md Farhan, et al.
Pubblicazione: (2024)
Visually Interpretable Subtask Reasoning for Visual Question Answering
di: Cheng, Yu, et al.
Pubblicazione: (2025)
di: Cheng, Yu, et al.
Pubblicazione: (2025)
Object-centric Video Question Answering with Visual Grounding and Referring
di: Wang, Haochen, et al.
Pubblicazione: (2025)
di: Wang, Haochen, et al.
Pubblicazione: (2025)
FaithSCAN: Model-Driven Single-Pass Hallucination Detection for Faithful Visual Question Answering
di: Tong, Chaodong, et al.
Pubblicazione: (2026)
di: Tong, Chaodong, et al.
Pubblicazione: (2026)
DisasterVQA: A Visual Question Answering Benchmark Dataset for Disaster Scenes
di: Al-Mohannadi, Aisha, et al.
Pubblicazione: (2026)
di: Al-Mohannadi, Aisha, et al.
Pubblicazione: (2026)
Self-Bootstrapped Visual-Language Model for Knowledge Selection and Question Answering
di: Hao, Dongze, et al.
Pubblicazione: (2024)
di: Hao, Dongze, et al.
Pubblicazione: (2024)
Fine-Grained Knowledge Structuring and Retrieval for Visual Question Answering
di: Zhang, Zhengxuan, et al.
Pubblicazione: (2025)
di: Zhang, Zhengxuan, et al.
Pubblicazione: (2025)
StreamKV: Streaming Video Question-Answering with Segment-based KV Cache Retrieval and Compression
di: Chen, Yilong, et al.
Pubblicazione: (2025)
di: Chen, Yilong, et al.
Pubblicazione: (2025)
Multimodal Rationales for Explainable Visual Question Answering
di: Li, Kun, et al.
Pubblicazione: (2024)
di: Li, Kun, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Leveraging the Video-level Semantic Consistency of Event for Audio-visual Event Localization
di: Jiang, Yuanyuan, et al.
Pubblicazione: (2022) -
Question-Aware Gaussian Experts for Audio-Visual Question Answering
di: Kim, Hongyeob, et al.
Pubblicazione: (2025) -
ESG-Net: Event-Aware Semantic Guided Network for Dense Audio-Visual Event Localization
di: Li, Huilai, et al.
Pubblicazione: (2025) -
CLIP-UP: CLIP-Based Unanswerable Problem Detection for Visual Question Answering
di: Vardi, Ben, et al.
Pubblicazione: (2025) -
SaSR-Net: Source-Aware Semantic Representation Network for Enhancing Audio-Visual Question Answering
di: Yang, Tianyu, et al.
Pubblicazione: (2024)