Exploring Advanced Techniques for Visual Question Answering: A Comprehensive Comparison
Fuente:
arXiv
Salvato in:
| Autori principali: | Baby, Aiswarya, Koshy, Tintu Thankom |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Advanced Clustering Framework for Semiconductor Image Analytics Integrating Deep TDA with Self-Supervised and Transfer Learning Techniques
di: Giri, Janhavi, et al.
Pubblicazione: (2025)
di: Giri, Janhavi, et al.
Pubblicazione: (2025)
MicroCrackAttentionNeXt: Advancing Microcrack Detection in Wave Field Analysis Using Deep Neural Networks through Feature Visualization
di: Moreh, Fatahlla, et al.
Pubblicazione: (2024)
di: Moreh, Fatahlla, et al.
Pubblicazione: (2024)
A Smart Healthcare System for Monkeypox Skin Lesion Detection and Tracking
di: Alghoraibi, Huda, et al.
Pubblicazione: (2025)
di: Alghoraibi, Huda, et al.
Pubblicazione: (2025)
Enhancing Object Detection with Privileged Information: A Model-Agnostic Teacher-Student Approach
di: Bartolo, Matthias, et al.
Pubblicazione: (2026)
di: Bartolo, Matthias, et al.
Pubblicazione: (2026)
DeepSeek-Inspired Exploration of RL-based LLMs and Synergy with Wireless Networks: A Survey
di: Qiao, Yu, et al.
Pubblicazione: (2025)
di: Qiao, Yu, et al.
Pubblicazione: (2025)
MedGrad E-CLIP: Enhancing Trust and Transparency in AI-Driven Skin Lesion Diagnosis
di: Kamal, Sadia, et al.
Pubblicazione: (2025)
di: Kamal, Sadia, et al.
Pubblicazione: (2025)
Interpretability-Aware Pruning for Efficient Medical Image Analysis
di: Malik, Nikita, et al.
Pubblicazione: (2025)
di: Malik, Nikita, et al.
Pubblicazione: (2025)
Self-supervised Normality Learning and Divergence Vector-guided Model Merging for Zero-shot Congenital Heart Disease Detection in Fetal Ultrasound Videos
di: Saha, Pramit, et al.
Pubblicazione: (2025)
di: Saha, Pramit, et al.
Pubblicazione: (2025)
Haphazard Inputs as Images in Online Learning
di: Agarwal, Rohit, et al.
Pubblicazione: (2025)
di: Agarwal, Rohit, et al.
Pubblicazione: (2025)
CNN-Based Automated Parameter Extraction Framework for Modeling Memristive Devices
di: Hamid, Akif, et al.
Pubblicazione: (2025)
di: Hamid, Akif, et al.
Pubblicazione: (2025)
WiFlexFormer: Efficient WiFi-Based Person-Centric Sensing
di: Strohmayer, Julian, et al.
Pubblicazione: (2024)
di: Strohmayer, Julian, et al.
Pubblicazione: (2024)
DATTA: Domain-Adversarial Test-Time Adaptation for Cross-Domain WiFi-Based Human Activity Recognition
di: Strohmayer, Julian, et al.
Pubblicazione: (2024)
di: Strohmayer, Julian, et al.
Pubblicazione: (2024)
Resource-Aware Evolutionary Neural Architecture Search for Cardiac MRI Segmentation
di: Yasmin, Farhana, et al.
Pubblicazione: (2026)
di: Yasmin, Farhana, et al.
Pubblicazione: (2026)
Automating grapevine LAI features estimation with UAV imagery and machine learning
di: Akram, Muhammad Waseem, et al.
Pubblicazione: (2024)
di: Akram, Muhammad Waseem, et al.
Pubblicazione: (2024)
Demographic Predictability in 3D CT Foundation Embeddings
di: Zheng, Guangyao, et al.
Pubblicazione: (2024)
di: Zheng, Guangyao, et al.
Pubblicazione: (2024)
An explainable vision transformer with transfer learning based efficient drought stress identification
di: Patra, Aswini Kumar, et al.
Pubblicazione: (2024)
di: Patra, Aswini Kumar, et al.
Pubblicazione: (2024)
State-of-the-Art Transformer Models for Image Super-Resolution: Techniques, Challenges, and Applications
di: Dutta, Debasish, et al.
Pubblicazione: (2025)
di: Dutta, Debasish, et al.
Pubblicazione: (2025)
VLAD: A VLM-Augmented Autonomous Driving Framework with Hierarchical Planning and Interpretable Decision Process
di: Gariboldi, Cristian, et al.
Pubblicazione: (2025)
di: Gariboldi, Cristian, et al.
Pubblicazione: (2025)
Pedestrian Intention Prediction via Vision-Language Foundation Models
di: Azarmi, Mohsen, et al.
Pubblicazione: (2025)
di: Azarmi, Mohsen, et al.
Pubblicazione: (2025)
Cross-Platform Scaling of Vision-Language-Action Models from Edge to Cloud GPUs
di: Taherin, Amir, et al.
Pubblicazione: (2025)
di: Taherin, Amir, et al.
Pubblicazione: (2025)
WeatherEdit: Controllable Weather Editing with 4D Gaussian Field
di: Qian, Chenghao, et al.
Pubblicazione: (2025)
di: Qian, Chenghao, et al.
Pubblicazione: (2025)
Cost-Effective Model Evaluation with Meta-Learning
di: Pham, Trinh, et al.
Pubblicazione: (2026)
di: Pham, Trinh, et al.
Pubblicazione: (2026)
PhyWorld: Physics-Faithful World Model for Video Generation
di: Zhao, Pu, et al.
Pubblicazione: (2026)
di: Zhao, Pu, et al.
Pubblicazione: (2026)
MHub.ai: A Simple, Standardized, and Reproducible Platform for AI Models in Medical Imaging
di: Nürnberg, Leonard, et al.
Pubblicazione: (2026)
di: Nürnberg, Leonard, et al.
Pubblicazione: (2026)
V-RoAst: Visual Road Assessment. Can VLM be a Road Safety Assessor Using the iRAP Standard?
di: Jongwiriyanurak, Natchapon, et al.
Pubblicazione: (2024)
di: Jongwiriyanurak, Natchapon, et al.
Pubblicazione: (2024)
World Models in Artificial Intelligence: Sensing, Learning, and Reasoning Like a Child
di: Del Ser, Javier, et al.
Pubblicazione: (2025)
di: Del Ser, Javier, et al.
Pubblicazione: (2025)
Quantum Computing Supported Adversarial Attack-Resilient Autonomous Vehicle Perception Module for Traffic Sign Classification
di: Majumder, Reek, et al.
Pubblicazione: (2025)
di: Majumder, Reek, et al.
Pubblicazione: (2025)
Attention via Synaptic Plasticity is All You Need: A Biologically Inspired Spiking Neuromorphic Transformer
di: Mondal, Kallol, et al.
Pubblicazione: (2025)
di: Mondal, Kallol, et al.
Pubblicazione: (2025)
Gesture Matters: Pedestrian Gesture Recognition for AVs Through Skeleton Pose Evaluation
di: Mahdi, Alif Rizqullah, et al.
Pubblicazione: (2026)
di: Mahdi, Alif Rizqullah, et al.
Pubblicazione: (2026)
Self-Contrastive Forward-Forward Algorithm
di: Chen, Xing, et al.
Pubblicazione: (2024)
di: Chen, Xing, et al.
Pubblicazione: (2024)
Deployment-Aligned Low-Precision Neural Architecture Search for Spaceborne Edge AI
di: Thind, Parampuneet Kaur, et al.
Pubblicazione: (2026)
di: Thind, Parampuneet Kaur, et al.
Pubblicazione: (2026)
Prompt to Protection: A Comparative Study of Multimodal LLMs in Construction Hazard Recognition
di: Chaudhary, Nishi, et al.
Pubblicazione: (2025)
di: Chaudhary, Nishi, et al.
Pubblicazione: (2025)
FollowGen: A Scaled Noise Conditional Diffusion Model for Car-Following Trajectory Prediction
di: You, Junwei, et al.
Pubblicazione: (2024)
di: You, Junwei, et al.
Pubblicazione: (2024)
Federated Learning for Blind Image Super-Resolution
di: Moser, Brian B., et al.
Pubblicazione: (2024)
di: Moser, Brian B., et al.
Pubblicazione: (2024)
PhytoSynth: Leveraging Multi-modal Generative Models for Crop Disease Data Generation with Novel Benchmarking and Prompt Engineering Approach
di: Rai, Nitin, et al.
Pubblicazione: (2025)
di: Rai, Nitin, et al.
Pubblicazione: (2025)
Detecting Multiple Diseases in Multiple Crops Using Deep Learning
di: Yadav, Vivek, et al.
Pubblicazione: (2025)
di: Yadav, Vivek, et al.
Pubblicazione: (2025)
From Images to Insights: Explainable Biodiversity Monitoring with Plain Language Habitat Explanations
di: Zhou, Yutong, et al.
Pubblicazione: (2025)
di: Zhou, Yutong, et al.
Pubblicazione: (2025)
Improving watermelon (Citrullus lanatus) disease classification with generative artificial intelligence (GenAI)-based synthetic and real-field images via a custom EfficientNetV2-L model
di: Rai, Nitin, et al.
Pubblicazione: (2025)
di: Rai, Nitin, et al.
Pubblicazione: (2025)
Progressive Multimodal Interaction Network for Reliable Quantification of Fish Feeding Intensity in Aquaculture
di: Zhang, Shulong, et al.
Pubblicazione: (2025)
di: Zhang, Shulong, et al.
Pubblicazione: (2025)
Automated Facility Enumeration for Building Compliance Checking using Door Detection and Large Language Models
di: Zhang, Licheng, et al.
Pubblicazione: (2025)
di: Zhang, Licheng, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Advanced Clustering Framework for Semiconductor Image Analytics Integrating Deep TDA with Self-Supervised and Transfer Learning Techniques
di: Giri, Janhavi, et al.
Pubblicazione: (2025) -
MicroCrackAttentionNeXt: Advancing Microcrack Detection in Wave Field Analysis Using Deep Neural Networks through Feature Visualization
di: Moreh, Fatahlla, et al.
Pubblicazione: (2024) -
A Smart Healthcare System for Monkeypox Skin Lesion Detection and Tracking
di: Alghoraibi, Huda, et al.
Pubblicazione: (2025) -
Enhancing Object Detection with Privileged Information: A Model-Agnostic Teacher-Student Approach
di: Bartolo, Matthias, et al.
Pubblicazione: (2026) -
DeepSeek-Inspired Exploration of RL-based LLMs and Synergy with Wireless Networks: A Survey
di: Qiao, Yu, et al.
Pubblicazione: (2025)