Enhancing Generalization in Medical Visual Question Answering Tasks via Gradient-Guided Model Perturbation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liu, Gang, Li, Hongyang, He, Zerui, Zhong, Shenjun |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Towards Flexible Evaluation for Generative Visual Question Answering
par: Ji, Huishan, et autres
Publié: (2024)
par: Ji, Huishan, et autres
Publié: (2024)
PolySmart @ TRECVid 2024 Medical Video Question Answering
par: Wu, Jiaxin, et autres
Publié: (2024)
par: Wu, Jiaxin, et autres
Publié: (2024)
Patch-level Sounding Object Tracking for Audio-Visual Question Answering
par: Li, Zhangbin, et autres
Publié: (2024)
par: Li, Zhangbin, et autres
Publié: (2024)
MEGC2026: Micro-Expression Grand Challenge on Visual Question Answering
par: Fan, Xinqi, et autres
Publié: (2026)
par: Fan, Xinqi, et autres
Publié: (2026)
MEGC2025: Micro-Expression Grand Challenge on Spot Then Recognize and Visual Question Answering
par: Fan, Xinqi, et autres
Publié: (2025)
par: Fan, Xinqi, et autres
Publié: (2025)
Boosting Audio Visual Question Answering via Key Semantic-Aware Cues
par: Li, Guangyao, et autres
Publié: (2024)
par: Li, Guangyao, et autres
Publié: (2024)
Towards Signboard-Oriented Visual Question Answering: ViSignVQA Dataset, Method and Benchmark
par: Nguyen, Hieu Minh, et autres
Publié: (2025)
par: Nguyen, Hieu Minh, et autres
Publié: (2025)
Knowledge Acquisition Disentanglement for Knowledge-based Visual Question Answering with Large Language Models
par: An, Wenbin, et autres
Publié: (2024)
par: An, Wenbin, et autres
Publié: (2024)
A Comprehensive Survey of Knowledge-Based Vision Question Answering Systems: The Lifecycle of Knowledge in Visual Reasoning Task
par: Deng, Jiaqi, et autres
Publié: (2025)
par: Deng, Jiaqi, et autres
Publié: (2025)
LipGen: Viseme-Guided Lip Video Generation for Enhancing Visual Speech Recognition
par: Hao, Bowen, et autres
Publié: (2025)
par: Hao, Bowen, et autres
Publié: (2025)
Can I Trust Your Answer? Visually Grounded Video Question Answering
par: Xiao, Junbin, et autres
Publié: (2023)
par: Xiao, Junbin, et autres
Publié: (2023)
Scene-Text Grounding for Text-Based Video Question Answering
par: Zhou, Sheng, et autres
Publié: (2024)
par: Zhou, Sheng, et autres
Publié: (2024)
EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering
par: Zhou, Sheng, et autres
Publié: (2025)
par: Zhou, Sheng, et autres
Publié: (2025)
Language-Guided Diffusion Model for Visual Grounding
par: Chen, Sijia, et autres
Publié: (2023)
par: Chen, Sijia, et autres
Publié: (2023)
Visual Autoregressive Modeling for Instruction-Guided Image Editing
par: Mao, Qingyang, et autres
Publié: (2025)
par: Mao, Qingyang, et autres
Publié: (2025)
Learning Trimodal Relation for Audio-Visual Question Answering with Missing Modality
par: Park, Kyu Ri, et autres
Publié: (2024)
par: Park, Kyu Ri, et autres
Publié: (2024)
AdaCoder: Adaptive Prompt Compression for Programmatic Visual Question Answering
par: Ukai, Mahiro, et autres
Publié: (2024)
par: Ukai, Mahiro, et autres
Publié: (2024)
Copy-Move Forgery Detection and Question Answering for Remote Sensing Image
par: Zhang, Ze, et autres
Publié: (2024)
par: Zhang, Ze, et autres
Publié: (2024)
POVQA: Preference-Optimized Video Question Answering with Rationales for Data Efficiency
par: Dahal, Ashim, et autres
Publié: (2025)
par: Dahal, Ashim, et autres
Publié: (2025)
Parameter-Efficient Fine-Tuning Medical Multimodal Large Language Models for Medical Visual Grounding
par: He, Jinlong, et autres
Publié: (2024)
par: He, Jinlong, et autres
Publié: (2024)
ReAG: Reasoning-Augmented Generation for Knowledge-based Visual Question Answering
par: Compagnoni, Alberto, et autres
Publié: (2025)
par: Compagnoni, Alberto, et autres
Publié: (2025)
VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering
par: Meng, Yiran, et autres
Publié: (2025)
par: Meng, Yiran, et autres
Publié: (2025)
SkyLink: Unifying Street-Satellite Geo-Localization via UAV-Mediated 3D Scene Alignment
par: Zhang, Hongyang, et autres
Publié: (2025)
par: Zhang, Hongyang, et autres
Publié: (2025)
PathVLM-R1: A Reinforcement Learning-Driven Reasoning Model for Pathology Visual-Language Tasks
par: Wu, Jianyu, et autres
Publié: (2025)
par: Wu, Jianyu, et autres
Publié: (2025)
DMC$^3$: Dual-Modal Counterfactual Contrastive Construction for Egocentric Video Question Answering
par: Zou, Jiayi, et autres
Publié: (2025)
par: Zou, Jiayi, et autres
Publié: (2025)
Question-Answering Dense Video Events
par: Qin, Hangyu, et autres
Publié: (2024)
par: Qin, Hangyu, et autres
Publié: (2024)
Ask Questions with Double Hints: Visual Question Generation with Answer-awareness and Region-reference
par: Shen, Kai, et autres
Publié: (2024)
par: Shen, Kai, et autres
Publié: (2024)
Mitigating Easy Option Bias in Multiple-Choice Question Answering
par: Zhang, Hao, et autres
Publié: (2025)
par: Zhang, Hao, et autres
Publié: (2025)
DreamStory: Open-Domain Story Visualization by LLM-Guided Multi-Subject Consistent Diffusion
par: He, Huiguo, et autres
Publié: (2024)
par: He, Huiguo, et autres
Publié: (2024)
VidCtx: Context-aware Video Question Answering with Image Models
par: Goulas, Andreas, et autres
Publié: (2024)
par: Goulas, Andreas, et autres
Publié: (2024)
Gradient-Guided Modality Decoupling for Missing-Modality Robustness
par: Wang, Hao, et autres
Publié: (2024)
par: Wang, Hao, et autres
Publié: (2024)
Unbiased Video Scene Graph Generation via Visual and Semantic Dual Debiasing
par: Li, Yanjun, et autres
Publié: (2025)
par: Li, Yanjun, et autres
Publié: (2025)
GAOT: Generating Articulated Objects Through Text-Guided Diffusion Models
par: Sun, Hao, et autres
Publié: (2025)
par: Sun, Hao, et autres
Publié: (2025)
Enhancing the Learning Experience: Using Vision-Language Models to Generate Questions for Educational Videos
par: Stamatakis, Markos, et autres
Publié: (2025)
par: Stamatakis, Markos, et autres
Publié: (2025)
HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning
par: Chen, Liyang, et autres
Publié: (2025)
par: Chen, Liyang, et autres
Publié: (2025)
Augmenting Multimodal LLMs with Self-Reflective Tokens for Knowledge-based Visual Question Answering
par: Cocchi, Federico, et autres
Publié: (2024)
par: Cocchi, Federico, et autres
Publié: (2024)
Advancing Weakly-Supervised Audio-Visual Video Parsing via Segment-wise Pseudo Labeling
par: Zhou, Jinxing, et autres
Publié: (2024)
par: Zhou, Jinxing, et autres
Publié: (2024)
Music Audio-Visual Question Answering Requires Specialized Multimodal Designs
par: You, Wenhao, et autres
Publié: (2025)
par: You, Wenhao, et autres
Publié: (2025)
GeoLink: A 3D-Aware Framework Towards Better Generalization in Cross-View Geo-Localization
par: Zhang, Hongyang, et autres
Publié: (2026)
par: Zhang, Hongyang, et autres
Publié: (2026)
CinePile: A Long Video Question Answering Dataset and Benchmark
par: Rawal, Ruchit, et autres
Publié: (2024)
par: Rawal, Ruchit, et autres
Publié: (2024)
Documents similaires
-
Towards Flexible Evaluation for Generative Visual Question Answering
par: Ji, Huishan, et autres
Publié: (2024) -
PolySmart @ TRECVid 2024 Medical Video Question Answering
par: Wu, Jiaxin, et autres
Publié: (2024) -
Patch-level Sounding Object Tracking for Audio-Visual Question Answering
par: Li, Zhangbin, et autres
Publié: (2024) -
MEGC2026: Micro-Expression Grand Challenge on Visual Question Answering
par: Fan, Xinqi, et autres
Publié: (2026) -
MEGC2025: Micro-Expression Grand Challenge on Spot Then Recognize and Visual Question Answering
par: Fan, Xinqi, et autres
Publié: (2025)