Visual question answering: from early developments to recent advances -- a survey
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Huynh, Ngoc Dung, Bouadjenek, Mohamed Reda, Aryal, Sunil, Razzak, Imran, Hacid, Hakim |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SimpsonsVQA: Enhancing Inquiry-Based Learning with a Tailored Dataset
par: Huynh, Ngoc Dung, et autres
Publié: (2024)
par: Huynh, Ngoc Dung, et autres
Publié: (2024)
SVLA: A Unified Speech-Vision-Language Assistant with Multimodal Reasoning and Speech Generation
par: Huynh, Ngoc Dung, et autres
Publié: (2025)
par: Huynh, Ngoc Dung, et autres
Publié: (2025)
Margin-bounded Confidence Scores for Out-of-Distribution Detection
par: Tamang, Lakpa D., et autres
Publié: (2024)
par: Tamang, Lakpa D., et autres
Publié: (2024)
Omnidirectional Video Super-Resolution using Deep Learning
par: Baniya, Arbind Agrahari, et autres
Publié: (2025)
par: Baniya, Arbind Agrahari, et autres
Publié: (2025)
Rolling Ball Optimizer: Learning by ironing out loss landscape wrinkles
par: Belgoumri, Mohammed Djameleddine, et autres
Publié: (2025)
par: Belgoumri, Mohammed Djameleddine, et autres
Publié: (2025)
TOTNet: Occlusion-Aware Temporal Tracking for Robust Ball Detection in Sports Videos
par: Xu, Hao, et autres
Publié: (2025)
par: Xu, Hao, et autres
Publié: (2025)
Deep Learning for Sports Video Event Detection: Tasks, Datasets, Methods, and Challenges
par: Xu, Hao, et autres
Publié: (2025)
par: Xu, Hao, et autres
Publié: (2025)
VideoMem: Constructing, Analyzing, Predicting Short-term and Long-term Video Memorability
par: Cohendet, Romain, et autres
Publié: (2018)
par: Cohendet, Romain, et autres
Publié: (2018)
MindTuner: Cross-Subject Visual Decoding with Visual Fingerprint and Semantic Correction
par: Gong, Zixuan, et autres
Publié: (2024)
par: Gong, Zixuan, et autres
Publié: (2024)
Causal Debiasing for Visual Commonsense Reasoning
par: Zou, Jiayi, et autres
Publié: (2025)
par: Zou, Jiayi, et autres
Publié: (2025)
Deep learning for 3D human pose estimation and mesh recovery: A survey
par: Liu, Yang, et autres
Publié: (2024)
par: Liu, Yang, et autres
Publié: (2024)
Visual Grounding with Multi-modal Conditional Adaptation
par: Yao, Ruilin, et autres
Publié: (2024)
par: Yao, Ruilin, et autres
Publié: (2024)
Learning Brain Representation with Hierarchical Visual Embeddings
par: Zheng, Jiawen, et autres
Publié: (2026)
par: Zheng, Jiawen, et autres
Publié: (2026)
Extending Visual Dynamics for Video-to-Music Generation
par: Liu, Xiaohao, et autres
Publié: (2025)
par: Liu, Xiaohao, et autres
Publié: (2025)
Language-Guided Diffusion Model for Visual Grounding
par: Chen, Sijia, et autres
Publié: (2023)
par: Chen, Sijia, et autres
Publié: (2023)
CLIP Brings Better Features to Visual Aesthetics Learners
par: Xu, Liwu, et autres
Publié: (2023)
par: Xu, Liwu, et autres
Publié: (2023)
Incorporating Visual Correspondence into Diffusion Model for Virtual Try-On
par: Wan, Siqi, et autres
Publié: (2025)
par: Wan, Siqi, et autres
Publié: (2025)
Noise-Tolerant Learning for Audio-Visual Action Recognition
par: Han, Haochen, et autres
Publié: (2022)
par: Han, Haochen, et autres
Publié: (2022)
Holistic Visual-Textual Sentiment Analysis with Prior Models
par: Chen, Junyu, et autres
Publié: (2022)
par: Chen, Junyu, et autres
Publié: (2022)
Visual Autoregressive Modeling for Instruction-Guided Image Editing
par: Mao, Qingyang, et autres
Publié: (2025)
par: Mao, Qingyang, et autres
Publié: (2025)
Towards Flexible Evaluation for Generative Visual Question Answering
par: Ji, Huishan, et autres
Publié: (2024)
par: Ji, Huishan, et autres
Publié: (2024)
Towards Open-Vocabulary Audio-Visual Event Localization
par: Zhou, Jinxing, et autres
Publié: (2024)
par: Zhou, Jinxing, et autres
Publié: (2024)
ASAP: Advancing Semantic Alignment Promotes Multi-Modal Manipulation Detecting and Grounding
par: Zhang, Zhenxing, et autres
Publié: (2024)
par: Zhang, Zhenxing, et autres
Publié: (2024)
Visual Semantic Description Generation with MLLMs for Image-Text Matching
par: Chen, Junyu, et autres
Publié: (2025)
par: Chen, Junyu, et autres
Publié: (2025)
Class Agnostic Instance-level Descriptor for Visual Instance Search
par: Sun, Qi-Ying, et autres
Publié: (2025)
par: Sun, Qi-Ying, et autres
Publié: (2025)
SynthDoc: Bilingual Documents Synthesis for Visual Document Understanding
par: Ding, Chuanghao, et autres
Publié: (2024)
par: Ding, Chuanghao, et autres
Publié: (2024)
Wills Aligner: Multi-Subject Collaborative Brain Visual Decoding
par: Bao, Guangyin, et autres
Publié: (2024)
par: Bao, Guangyin, et autres
Publié: (2024)
Scaling Audio-Visual Quality Assessment Dataset via Crowdsourcing
par: Yang, Renyu, et autres
Publié: (2026)
par: Yang, Renyu, et autres
Publié: (2026)
Learning from Silence and Noise for Visual Sound Source Localization
par: Juanola, Xavier, et autres
Publié: (2025)
par: Juanola, Xavier, et autres
Publié: (2025)
Unraveling Instance Associations: A Closer Look for Audio-Visual Segmentation
par: Chen, Yuanhong, et autres
Publié: (2023)
par: Chen, Yuanhong, et autres
Publié: (2023)
Dual Attribute-Spatial Relation Alignment for 3D Visual Grounding
par: Xu, Yue, et autres
Publié: (2024)
par: Xu, Yue, et autres
Publié: (2024)
StableDub: Taming Diffusion Prior for Generalized and Efficient Visual Dubbing
par: Chen, Liyang, et autres
Publié: (2025)
par: Chen, Liyang, et autres
Publié: (2025)
JointAVBench: A Benchmark for Joint Audio-Visual Reasoning Evaluation
par: Chao, Jianghan, et autres
Publié: (2025)
par: Chao, Jianghan, et autres
Publié: (2025)
Patch-level Sounding Object Tracking for Audio-Visual Question Answering
par: Li, Zhangbin, et autres
Publié: (2024)
par: Li, Zhangbin, et autres
Publié: (2024)
Delving Deeper: Hierarchical Visual Perception for Robust Video-Text Retrieval
par: Xie, Zequn, et autres
Publié: (2026)
par: Xie, Zequn, et autres
Publié: (2026)
MEGC2026: Micro-Expression Grand Challenge on Visual Question Answering
par: Fan, Xinqi, et autres
Publié: (2026)
par: Fan, Xinqi, et autres
Publié: (2026)
QPT V2: Masked Image Modeling Advances Visual Scoring
par: Xie, Qizhi, et autres
Publié: (2024)
par: Xie, Qizhi, et autres
Publié: (2024)
Unbiased Video Scene Graph Generation via Visual and Semantic Dual Debiasing
par: Li, Yanjun, et autres
Publié: (2025)
par: Li, Yanjun, et autres
Publié: (2025)
MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces
par: E, Shaojun, et autres
Publié: (2025)
par: E, Shaojun, et autres
Publié: (2025)
Q-Adapt: Adapting LMM for Visual Quality Assessment with Progressive Instruction Tuning
par: Lu, Yiting, et autres
Publié: (2025)
par: Lu, Yiting, et autres
Publié: (2025)
Documents similaires
-
SimpsonsVQA: Enhancing Inquiry-Based Learning with a Tailored Dataset
par: Huynh, Ngoc Dung, et autres
Publié: (2024) -
SVLA: A Unified Speech-Vision-Language Assistant with Multimodal Reasoning and Speech Generation
par: Huynh, Ngoc Dung, et autres
Publié: (2025) -
Margin-bounded Confidence Scores for Out-of-Distribution Detection
par: Tamang, Lakpa D., et autres
Publié: (2024) -
Omnidirectional Video Super-Resolution using Deep Learning
par: Baniya, Arbind Agrahari, et autres
Publié: (2025) -
Rolling Ball Optimizer: Learning by ironing out loss landscape wrinkles
par: Belgoumri, Mohammed Djameleddine, et autres
Publié: (2025)