SADL: An Effective In-Context Learning Method for Compositional Visual QA
Fuente:
arXiv
Salvato in:
| Autori principali: | Dang, Long Hoang, Le, Thao Minh, Le, Vuong, Phuong, Tu Minh, Tran, Truyen |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Towards Agentic AI for Multimodal-Guided Video Object Segmentation
di: Tran, Tuyen, et al.
Pubblicazione: (2025)
di: Tran, Tuyen, et al.
Pubblicazione: (2025)
Progressive Multi-granular Alignments for Grounded Reasoning in Large Vision-Language Models
di: Le, Quang-Hung, et al.
Pubblicazione: (2024)
di: Le, Quang-Hung, et al.
Pubblicazione: (2024)
Unified Framework with Consistency across Modalities for Human Activity Recognition
di: Tran, Tuyen, et al.
Pubblicazione: (2024)
di: Tran, Tuyen, et al.
Pubblicazione: (2024)
Planner-Refiner: Dynamic Space-Time Refinement for Vision-Language Alignment in Videos
di: Tran, Tuyen, et al.
Pubblicazione: (2025)
di: Tran, Tuyen, et al.
Pubblicazione: (2025)
Finding the Trigger: Causal Abductive Reasoning on Video Events
di: Le, Thao Minh, et al.
Pubblicazione: (2025)
di: Le, Thao Minh, et al.
Pubblicazione: (2025)
MedXplain-VQA: Multi-Component Explainable Medical Visual Question Answering
di: Nguyen, Hai-Dang, et al.
Pubblicazione: (2025)
di: Nguyen, Hai-Dang, et al.
Pubblicazione: (2025)
VietMEAgent: Culturally-Aware Few-Shot Multimodal Explanation for Vietnamese Visual Question Answering
di: Nguyen, Hai-Dang, et al.
Pubblicazione: (2025)
di: Nguyen, Hai-Dang, et al.
Pubblicazione: (2025)
Robust Deepfake Detection: Mitigating Spatial Attention Drift via Calibrated Complementary Ensembles
di: Le-Phan, Minh-Khoa, et al.
Pubblicazione: (2026)
di: Le-Phan, Minh-Khoa, et al.
Pubblicazione: (2026)
EDGER: EDge-Guided with HEatmap Refinement for Generalizable Image Forgery Localization
di: Le-Phan, Minh-Khoa, et al.
Pubblicazione: (2026)
di: Le-Phan, Minh-Khoa, et al.
Pubblicazione: (2026)
FrameDiT: Diffusion Transformer with Matrix Attention for Efficient Video Generation
di: Le, Minh Khoa, et al.
Pubblicazione: (2026)
di: Le, Minh Khoa, et al.
Pubblicazione: (2026)
Enhancing Video Summarization with Context Awareness
di: Huynh-Lam, Hai-Dang, et al.
Pubblicazione: (2024)
di: Huynh-Lam, Hai-Dang, et al.
Pubblicazione: (2024)
U-CESE: Unified Clip-based Event Search Engine for AI Challenge HCMC 2025
di: Le, Duc-Nhuan, et al.
Pubblicazione: (2026)
di: Le, Duc-Nhuan, et al.
Pubblicazione: (2026)
Cluster-based Video Summarization with Temporal Context Awareness
di: Huynh-Lam, Hai-Dang, et al.
Pubblicazione: (2024)
di: Huynh-Lam, Hai-Dang, et al.
Pubblicazione: (2024)
Ensemble Learning for Vietnamese Scene Text Spotting in Urban Environments
di: Nguyen, Hieu, et al.
Pubblicazione: (2024)
di: Nguyen, Hieu, et al.
Pubblicazione: (2024)
Leveraging knowledge distillation for partial multi-task learning from multiple remote sensing datasets
di: Lê, Hoàng-Ân, et al.
Pubblicazione: (2024)
di: Lê, Hoàng-Ân, et al.
Pubblicazione: (2024)
Object Detection in Thermal Images Using Deep Learning for Unmanned Aerial Vehicles
di: Tu, Minh Dang, et al.
Pubblicazione: (2024)
di: Tu, Minh Dang, et al.
Pubblicazione: (2024)
Towards Signboard-Oriented Visual Question Answering: ViSignVQA Dataset, Method and Benchmark
di: Nguyen, Hieu Minh, et al.
Pubblicazione: (2025)
di: Nguyen, Hieu Minh, et al.
Pubblicazione: (2025)
MasHeNe: A Benchmark for Head and Neck CT Mass Segmentation using Window-Enhanced Mamba with Frequency-Domain Integration
di: Dao, Thao Thi Phuong, et al.
Pubblicazione: (2025)
di: Dao, Thao Thi Phuong, et al.
Pubblicazione: (2025)
NAYER: Noisy Layer Data Generation for Efficient and Effective Data-free Knowledge Distillation
di: Tran, Minh-Tuan, et al.
Pubblicazione: (2023)
di: Tran, Minh-Tuan, et al.
Pubblicazione: (2023)
Box for Mask and Mask for Box: weak losses for multi-task partially supervised learning
di: Lê, Hoàng-Ân, et al.
Pubblicazione: (2024)
di: Lê, Hoàng-Ân, et al.
Pubblicazione: (2024)
Dual Strategies for Test-Time Adaptation
di: Phuong, Nam Nguyen, et al.
Pubblicazione: (2026)
di: Phuong, Nam Nguyen, et al.
Pubblicazione: (2026)
GUNNEL: Guided Mixup Augmentation and Multi-Model Fusion for Aquatic Animal Segmentation
di: Le, Minh-Quan, et al.
Pubblicazione: (2021)
di: Le, Minh-Quan, et al.
Pubblicazione: (2021)
MaskDiff: Modeling Mask Distribution with Diffusion Probabilistic Model for Few-Shot Instance Segmentation
di: Le, Minh-Quan, et al.
Pubblicazione: (2023)
di: Le, Minh-Quan, et al.
Pubblicazione: (2023)
PrefPaint: Enhancing Medical Image Inpainting through Expert Human Feedback
di: Bui, Duy-Bao, et al.
Pubblicazione: (2025)
di: Bui, Duy-Bao, et al.
Pubblicazione: (2025)
Online 3D Multi-Camera Perception through Robust 2D Tracking and Depth-based Late Aggregation
di: Le, Vu-Minh, et al.
Pubblicazione: (2025)
di: Le, Vu-Minh, et al.
Pubblicazione: (2025)
Leveraging feature communication in federated learning for remote sensing image classification
di: Duong, Anh-Kiet, et al.
Pubblicazione: (2024)
di: Duong, Anh-Kiet, et al.
Pubblicazione: (2024)
TaleForge: Interactive Multimodal System for Personalized Story Creation
di: Nguyen, Minh-Loi, et al.
Pubblicazione: (2025)
di: Nguyen, Minh-Loi, et al.
Pubblicazione: (2025)
CamoFA: A Learnable Fourier-based Augmentation for Camouflage Segmentation
di: Le, Minh-Quan, et al.
Pubblicazione: (2023)
di: Le, Minh-Quan, et al.
Pubblicazione: (2023)
Universal Multi-Domain Translation via Diffusion Routers
di: Kieu, Duc, et al.
Pubblicazione: (2025)
di: Kieu, Duc, et al.
Pubblicazione: (2025)
Physics-informed Ground Reaction Dynamics from Human Motion Capture
di: Le, Cuong, et al.
Pubblicazione: (2025)
di: Le, Cuong, et al.
Pubblicazione: (2025)
Amodal Instance Segmentation with Diffusion Shape Prior Estimation
di: Tran, Minh, et al.
Pubblicazione: (2024)
di: Tran, Minh, et al.
Pubblicazione: (2024)
HENASY: Learning to Assemble Scene-Entities for Egocentric Video-Language Model
di: Vo, Khoa, et al.
Pubblicazione: (2024)
di: Vo, Khoa, et al.
Pubblicazione: (2024)
AgriKD: Cross-Architecture Knowledge Distillation for Efficient Leaf Disease Classification
di: Le, Minh-Dung, et al.
Pubblicazione: (2026)
di: Le, Minh-Dung, et al.
Pubblicazione: (2026)
Interactive Interface For Semantic Segmentation Dataset Synthesis
di: Tran, Ngoc-Do, et al.
Pubblicazione: (2025)
di: Tran, Ngoc-Do, et al.
Pubblicazione: (2025)
Test-Time Instance-Specific Parameter Composition: A New Paradigm for Adaptive Generative Modeling
di: Tran, Minh-Tuan, et al.
Pubblicazione: (2026)
di: Tran, Minh-Tuan, et al.
Pubblicazione: (2026)
GraspMamba: A Mamba-based Language-driven Grasp Detection Framework with Hierarchical Feature Learning
di: Nguyen, Huy Hoang, et al.
Pubblicazione: (2024)
di: Nguyen, Huy Hoang, et al.
Pubblicazione: (2024)
Unifying Global and Local Scene Entities Modelling for Precise Action Spotting
di: Tran, Kim Hoang, et al.
Pubblicazione: (2024)
di: Tran, Kim Hoang, et al.
Pubblicazione: (2024)
LSC-ADL: An Activity of Daily Living (ADL)-Annotated Lifelog Dataset Generated via Semi-Automatic Clustering
di: Ho-Le, Minh-Quan, et al.
Pubblicazione: (2025)
di: Ho-Le, Minh-Quan, et al.
Pubblicazione: (2025)
PGDS: Pose-Guidance Deep Supervision for Mitigating Clothes-Changing in Person Re-Identification
di: Trinh, Quoc-Huy, et al.
Pubblicazione: (2023)
di: Trinh, Quoc-Huy, et al.
Pubblicazione: (2023)
SHREC 2025: Retrieval of Optimal Objects for Multi-modal Enhanced Language and Spatial Assistance (ROOMELSA)
di: Nguyen, Trong-Thuan, et al.
Pubblicazione: (2025)
di: Nguyen, Trong-Thuan, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Towards Agentic AI for Multimodal-Guided Video Object Segmentation
di: Tran, Tuyen, et al.
Pubblicazione: (2025) -
Progressive Multi-granular Alignments for Grounded Reasoning in Large Vision-Language Models
di: Le, Quang-Hung, et al.
Pubblicazione: (2024) -
Unified Framework with Consistency across Modalities for Human Activity Recognition
di: Tran, Tuyen, et al.
Pubblicazione: (2024) -
Planner-Refiner: Dynamic Space-Time Refinement for Vision-Language Alignment in Videos
di: Tran, Tuyen, et al.
Pubblicazione: (2025) -
Finding the Trigger: Causal Abductive Reasoning on Video Events
di: Le, Thao Minh, et al.
Pubblicazione: (2025)