Foundation Models and Adaptive Feature Selection: A Synergistic Approach to Video Question Answering
Fuente:
arXiv
Saved in:
| Main Authors: | Rongali, Sai Bhargav, C, Mohamad Hassan N, Jha, Ankit, Bhargava, Neha, Prasad, Saurabh, Banerjee, Biplab |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
OSLoPrompt: Bridging Low-Supervision Challenges and Open-Set Domain Generalization in CLIP
by: C, Mohamad Hassan N, et al.
Published: (2025)
by: C, Mohamad Hassan N, et al.
Published: (2025)
CDAD-Net: Bridging Domain Gaps in Generalized Category Discovery
by: Rongali, Sai Bhargav, et al.
Published: (2024)
by: Rongali, Sai Bhargav, et al.
Published: (2024)
Label-Efficient Hyperspectral Image Classification via Spectral FiLM Modulation of Low-Level Pretrained Diffusion Features
by: Hu, Yuzhen, et al.
Published: (2025)
by: Hu, Yuzhen, et al.
Published: (2025)
AD-CLIP: Adapting Domains in Prompt Space Using CLIP
by: Singha, Mainak, et al.
Published: (2023)
by: Singha, Mainak, et al.
Published: (2023)
Foundational Question Generation for Video Question Answering via an Embedding-Integrated Approach
by: Oh, Ju-Young
Published: (2025)
by: Oh, Ju-Young
Published: (2025)
Elevating All Zero-Shot Sketch-Based Image Retrieval Through Multimodal Prompt Learning
by: Singha, Mainak, et al.
Published: (2024)
by: Singha, Mainak, et al.
Published: (2024)
Static or Dynamic: Towards Query-Adaptive Token Selection for Video Question Answering
by: Shi, Yumeng, et al.
Published: (2025)
by: Shi, Yumeng, et al.
Published: (2025)
Unknown Prompt, the only Lacuna: Unveiling CLIP's Potential for Open Domain Generalization
by: Singha, Mainak, et al.
Published: (2024)
by: Singha, Mainak, et al.
Published: (2024)
GraphVL: Graph-Enhanced Semantic Modeling via Vision-Language Models for Generalized Class Discovery
by: Solanki, Bhupendra, et al.
Published: (2024)
by: Solanki, Bhupendra, et al.
Published: (2024)
MMLGNet: Cross-Modal Alignment of Remote Sensing Data using CLIP
by: Chaudhary, Aditya, et al.
Published: (2026)
by: Chaudhary, Aditya, et al.
Published: (2026)
POVQA: Preference-Optimized Video Question Answering with Rationales for Data Efficiency
by: Dahal, Ashim, et al.
Published: (2025)
by: Dahal, Ashim, et al.
Published: (2025)
COSMo: CLIP Talks on Open-Set Multi-Target Domain Adaptation
by: Monga, Munish, et al.
Published: (2024)
by: Monga, Munish, et al.
Published: (2024)
BioVLM: Routing Prompts, Not Parameters, for Cross-Modality Generalization in Biomedical VLMs
by: Singha, Mainak, et al.
Published: (2026)
by: Singha, Mainak, et al.
Published: (2026)
FedMVP: Federated Multimodal Visual Prompt Tuning for Vision-Language Models
by: Singha, Mainak, et al.
Published: (2025)
by: Singha, Mainak, et al.
Published: (2025)
A.I.R.: Enabling Adaptive, Iterative, and Reasoning-based Frame Selection For Video Question Answering
by: Zou, Yuanhao, et al.
Published: (2025)
by: Zou, Yuanhao, et al.
Published: (2025)
A Sensor Agnostic Domain Generalization Framework for Leveraging Geospatial Foundation Models: Enhancing Semantic Segmentation viaSynergistic Pseudo-Labeling and Generative Learning
by: Yaghmour, Anan, et al.
Published: (2025)
by: Yaghmour, Anan, et al.
Published: (2025)
BIMBA: Selective-Scan Compression for Long-Range Video Question Answering
by: Islam, Md Mohaiminul, et al.
Published: (2025)
by: Islam, Md Mohaiminul, et al.
Published: (2025)
Reconstruction Guided Few-shot Network For Remote Sensing Image Classification
by: Jaiswal, Mohit, et al.
Published: (2026)
by: Jaiswal, Mohit, et al.
Published: (2026)
SDHSI-Net: Learning Better Representations for Hyperspectral Images via Self-Distillation
by: Singh, Prachet Dev, et al.
Published: (2026)
by: Singh, Prachet Dev, et al.
Published: (2026)
Learning Question-Aware Keyframe Selection with Synthetic Supervision for Video Question Answering
by: Kwon, Minchan, et al.
Published: (2026)
by: Kwon, Minchan, et al.
Published: (2026)
In the Era of Prompt Learning with Vision-Language Models
by: Jha, Ankit
Published: (2024)
by: Jha, Ankit
Published: (2024)
Enhancing Multi-Image Question Answering via Submodular Subset Selection
by: Sharma, Aaryan, et al.
Published: (2025)
by: Sharma, Aaryan, et al.
Published: (2025)
TemporalDoRA: Temporal PEFT for Robust Surgical Video Question Answering
by: Carlini, Luca, et al.
Published: (2026)
by: Carlini, Luca, et al.
Published: (2026)
Selectively Answering Visual Questions
by: Eisenschlos, Julian Martin, et al.
Published: (2024)
by: Eisenschlos, Julian Martin, et al.
Published: (2024)
HORNet: Task-Guided Frame Selection for Video Question Answering with Vision-Language Models
by: Bai, Xiangyu, et al.
Published: (2026)
by: Bai, Xiangyu, et al.
Published: (2026)
FocusGraph: Graph-Structured Frame Selection for Embodied Long Video Question Answering
by: Zemskova, Tatiana, et al.
Published: (2026)
by: Zemskova, Tatiana, et al.
Published: (2026)
VideoQA-SC: Adaptive Semantic Communication for Video Question Answering
by: Guo, Jiangyuan, et al.
Published: (2024)
by: Guo, Jiangyuan, et al.
Published: (2024)
Enhanced Textual Feature Extraction for Visual Question Answering: A Simple Convolutional Approach
by: Zhang, Zhilin, et al.
Published: (2024)
by: Zhang, Zhilin, et al.
Published: (2024)
Grounded Question-Answering in Long Egocentric Videos
by: Di, Shangzhe, et al.
Published: (2023)
by: Di, Shangzhe, et al.
Published: (2023)
Agentic Keyframe Search for Video Question Answering
by: Fan, Sunqi, et al.
Published: (2025)
by: Fan, Sunqi, et al.
Published: (2025)
Prompting Video-Language Foundation Models with Domain-specific Fine-grained Heuristics for Video Question Answering
by: Yu, Ting, et al.
Published: (2024)
by: Yu, Ting, et al.
Published: (2024)
When Domain Generalization meets Generalized Category Discovery: An Adaptive Task-Arithmetic Driven Approach
by: Rathore, Vaibhav, et al.
Published: (2025)
by: Rathore, Vaibhav, et al.
Published: (2025)
End-to-End Video Question Answering with Frame Scoring Mechanisms and Adaptive Sampling
by: Liang, Jianxin, et al.
Published: (2024)
by: Liang, Jianxin, et al.
Published: (2024)
Question-Instructed Visual Descriptions for Zero-Shot Video Question Answering
by: Romero, David, et al.
Published: (2024)
by: Romero, David, et al.
Published: (2024)
HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering
by: Ben-Ami, Dan, et al.
Published: (2026)
by: Ben-Ami, Dan, et al.
Published: (2026)
Narrative Aligned Long Form Video Question Answering
by: Jain, Rahul, et al.
Published: (2026)
by: Jain, Rahul, et al.
Published: (2026)
SurgViVQA: Temporally-Grounded Video Question Answering for Surgical Scene Understanding
by: Drago, Mauro Orazio, et al.
Published: (2025)
by: Drago, Mauro Orazio, et al.
Published: (2025)
ViLA: Efficient Video-Language Alignment for Video Question Answering
by: Wang, Xijun, et al.
Published: (2023)
by: Wang, Xijun, et al.
Published: (2023)
REVEAL: Relation-based Video Representation Learning for Video-Question-Answering
by: Chaybouti, Sofian, et al.
Published: (2025)
by: Chaybouti, Sofian, et al.
Published: (2025)
VideoDistill: Language-aware Vision Distillation for Video Question Answering
by: Zou, Bo, et al.
Published: (2024)
by: Zou, Bo, et al.
Published: (2024)
Similar Items
-
OSLoPrompt: Bridging Low-Supervision Challenges and Open-Set Domain Generalization in CLIP
by: C, Mohamad Hassan N, et al.
Published: (2025) -
CDAD-Net: Bridging Domain Gaps in Generalized Category Discovery
by: Rongali, Sai Bhargav, et al.
Published: (2024) -
Label-Efficient Hyperspectral Image Classification via Spectral FiLM Modulation of Low-Level Pretrained Diffusion Features
by: Hu, Yuzhen, et al.
Published: (2025) -
AD-CLIP: Adapting Domains in Prompt Space Using CLIP
by: Singha, Mainak, et al.
Published: (2023) -
Foundational Question Generation for Video Question Answering via an Embedding-Integrated Approach
by: Oh, Ju-Young
Published: (2025)