SADL: An Effective In-Context Learning Method for Compositional Visual QA
Fuente:
arXiv
Saved in:
| Main Authors: | Dang, Long Hoang, Le, Thao Minh, Le, Vuong, Phuong, Tu Minh, Tran, Truyen |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Towards Agentic AI for Multimodal-Guided Video Object Segmentation
by: Tran, Tuyen, et al.
Published: (2025)
by: Tran, Tuyen, et al.
Published: (2025)
Progressive Multi-granular Alignments for Grounded Reasoning in Large Vision-Language Models
by: Le, Quang-Hung, et al.
Published: (2024)
by: Le, Quang-Hung, et al.
Published: (2024)
Unified Framework with Consistency across Modalities for Human Activity Recognition
by: Tran, Tuyen, et al.
Published: (2024)
by: Tran, Tuyen, et al.
Published: (2024)
Planner-Refiner: Dynamic Space-Time Refinement for Vision-Language Alignment in Videos
by: Tran, Tuyen, et al.
Published: (2025)
by: Tran, Tuyen, et al.
Published: (2025)
Finding the Trigger: Causal Abductive Reasoning on Video Events
by: Le, Thao Minh, et al.
Published: (2025)
by: Le, Thao Minh, et al.
Published: (2025)
MedXplain-VQA: Multi-Component Explainable Medical Visual Question Answering
by: Nguyen, Hai-Dang, et al.
Published: (2025)
by: Nguyen, Hai-Dang, et al.
Published: (2025)
VietMEAgent: Culturally-Aware Few-Shot Multimodal Explanation for Vietnamese Visual Question Answering
by: Nguyen, Hai-Dang, et al.
Published: (2025)
by: Nguyen, Hai-Dang, et al.
Published: (2025)
Robust Deepfake Detection: Mitigating Spatial Attention Drift via Calibrated Complementary Ensembles
by: Le-Phan, Minh-Khoa, et al.
Published: (2026)
by: Le-Phan, Minh-Khoa, et al.
Published: (2026)
EDGER: EDge-Guided with HEatmap Refinement for Generalizable Image Forgery Localization
by: Le-Phan, Minh-Khoa, et al.
Published: (2026)
by: Le-Phan, Minh-Khoa, et al.
Published: (2026)
FrameDiT: Diffusion Transformer with Matrix Attention for Efficient Video Generation
by: Le, Minh Khoa, et al.
Published: (2026)
by: Le, Minh Khoa, et al.
Published: (2026)
Enhancing Video Summarization with Context Awareness
by: Huynh-Lam, Hai-Dang, et al.
Published: (2024)
by: Huynh-Lam, Hai-Dang, et al.
Published: (2024)
U-CESE: Unified Clip-based Event Search Engine for AI Challenge HCMC 2025
by: Le, Duc-Nhuan, et al.
Published: (2026)
by: Le, Duc-Nhuan, et al.
Published: (2026)
Cluster-based Video Summarization with Temporal Context Awareness
by: Huynh-Lam, Hai-Dang, et al.
Published: (2024)
by: Huynh-Lam, Hai-Dang, et al.
Published: (2024)
Ensemble Learning for Vietnamese Scene Text Spotting in Urban Environments
by: Nguyen, Hieu, et al.
Published: (2024)
by: Nguyen, Hieu, et al.
Published: (2024)
Leveraging knowledge distillation for partial multi-task learning from multiple remote sensing datasets
by: Lê, Hoàng-Ân, et al.
Published: (2024)
by: Lê, Hoàng-Ân, et al.
Published: (2024)
Object Detection in Thermal Images Using Deep Learning for Unmanned Aerial Vehicles
by: Tu, Minh Dang, et al.
Published: (2024)
by: Tu, Minh Dang, et al.
Published: (2024)
Towards Signboard-Oriented Visual Question Answering: ViSignVQA Dataset, Method and Benchmark
by: Nguyen, Hieu Minh, et al.
Published: (2025)
by: Nguyen, Hieu Minh, et al.
Published: (2025)
MasHeNe: A Benchmark for Head and Neck CT Mass Segmentation using Window-Enhanced Mamba with Frequency-Domain Integration
by: Dao, Thao Thi Phuong, et al.
Published: (2025)
by: Dao, Thao Thi Phuong, et al.
Published: (2025)
NAYER: Noisy Layer Data Generation for Efficient and Effective Data-free Knowledge Distillation
by: Tran, Minh-Tuan, et al.
Published: (2023)
by: Tran, Minh-Tuan, et al.
Published: (2023)
Box for Mask and Mask for Box: weak losses for multi-task partially supervised learning
by: Lê, Hoàng-Ân, et al.
Published: (2024)
by: Lê, Hoàng-Ân, et al.
Published: (2024)
Dual Strategies for Test-Time Adaptation
by: Phuong, Nam Nguyen, et al.
Published: (2026)
by: Phuong, Nam Nguyen, et al.
Published: (2026)
GUNNEL: Guided Mixup Augmentation and Multi-Model Fusion for Aquatic Animal Segmentation
by: Le, Minh-Quan, et al.
Published: (2021)
by: Le, Minh-Quan, et al.
Published: (2021)
MaskDiff: Modeling Mask Distribution with Diffusion Probabilistic Model for Few-Shot Instance Segmentation
by: Le, Minh-Quan, et al.
Published: (2023)
by: Le, Minh-Quan, et al.
Published: (2023)
PrefPaint: Enhancing Medical Image Inpainting through Expert Human Feedback
by: Bui, Duy-Bao, et al.
Published: (2025)
by: Bui, Duy-Bao, et al.
Published: (2025)
Online 3D Multi-Camera Perception through Robust 2D Tracking and Depth-based Late Aggregation
by: Le, Vu-Minh, et al.
Published: (2025)
by: Le, Vu-Minh, et al.
Published: (2025)
Leveraging feature communication in federated learning for remote sensing image classification
by: Duong, Anh-Kiet, et al.
Published: (2024)
by: Duong, Anh-Kiet, et al.
Published: (2024)
TaleForge: Interactive Multimodal System for Personalized Story Creation
by: Nguyen, Minh-Loi, et al.
Published: (2025)
by: Nguyen, Minh-Loi, et al.
Published: (2025)
CamoFA: A Learnable Fourier-based Augmentation for Camouflage Segmentation
by: Le, Minh-Quan, et al.
Published: (2023)
by: Le, Minh-Quan, et al.
Published: (2023)
Universal Multi-Domain Translation via Diffusion Routers
by: Kieu, Duc, et al.
Published: (2025)
by: Kieu, Duc, et al.
Published: (2025)
Physics-informed Ground Reaction Dynamics from Human Motion Capture
by: Le, Cuong, et al.
Published: (2025)
by: Le, Cuong, et al.
Published: (2025)
Amodal Instance Segmentation with Diffusion Shape Prior Estimation
by: Tran, Minh, et al.
Published: (2024)
by: Tran, Minh, et al.
Published: (2024)
HENASY: Learning to Assemble Scene-Entities for Egocentric Video-Language Model
by: Vo, Khoa, et al.
Published: (2024)
by: Vo, Khoa, et al.
Published: (2024)
AgriKD: Cross-Architecture Knowledge Distillation for Efficient Leaf Disease Classification
by: Le, Minh-Dung, et al.
Published: (2026)
by: Le, Minh-Dung, et al.
Published: (2026)
Interactive Interface For Semantic Segmentation Dataset Synthesis
by: Tran, Ngoc-Do, et al.
Published: (2025)
by: Tran, Ngoc-Do, et al.
Published: (2025)
Test-Time Instance-Specific Parameter Composition: A New Paradigm for Adaptive Generative Modeling
by: Tran, Minh-Tuan, et al.
Published: (2026)
by: Tran, Minh-Tuan, et al.
Published: (2026)
GraspMamba: A Mamba-based Language-driven Grasp Detection Framework with Hierarchical Feature Learning
by: Nguyen, Huy Hoang, et al.
Published: (2024)
by: Nguyen, Huy Hoang, et al.
Published: (2024)
Unifying Global and Local Scene Entities Modelling for Precise Action Spotting
by: Tran, Kim Hoang, et al.
Published: (2024)
by: Tran, Kim Hoang, et al.
Published: (2024)
LSC-ADL: An Activity of Daily Living (ADL)-Annotated Lifelog Dataset Generated via Semi-Automatic Clustering
by: Ho-Le, Minh-Quan, et al.
Published: (2025)
by: Ho-Le, Minh-Quan, et al.
Published: (2025)
PGDS: Pose-Guidance Deep Supervision for Mitigating Clothes-Changing in Person Re-Identification
by: Trinh, Quoc-Huy, et al.
Published: (2023)
by: Trinh, Quoc-Huy, et al.
Published: (2023)
SHREC 2025: Retrieval of Optimal Objects for Multi-modal Enhanced Language and Spatial Assistance (ROOMELSA)
by: Nguyen, Trong-Thuan, et al.
Published: (2025)
by: Nguyen, Trong-Thuan, et al.
Published: (2025)
Similar Items
-
Towards Agentic AI for Multimodal-Guided Video Object Segmentation
by: Tran, Tuyen, et al.
Published: (2025) -
Progressive Multi-granular Alignments for Grounded Reasoning in Large Vision-Language Models
by: Le, Quang-Hung, et al.
Published: (2024) -
Unified Framework with Consistency across Modalities for Human Activity Recognition
by: Tran, Tuyen, et al.
Published: (2024) -
Planner-Refiner: Dynamic Space-Time Refinement for Vision-Language Alignment in Videos
by: Tran, Tuyen, et al.
Published: (2025) -
Finding the Trigger: Causal Abductive Reasoning on Video Events
by: Le, Thao Minh, et al.
Published: (2025)