ED-SAM: An Efficient Diffusion Sampling Approach to Domain Generalization in Vision-Language Foundation Models
Fuente:
arXiv
Saved in:
| Main Authors: | Truong, Thanh-Dat, Li, Xin, Raj, Bhiksha, Cothren, Jackson, Luu, Khoa |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
FALCON: Fairness Learning via Contrastive Attention Approach to Continual Semantic Scene Understanding
by: Truong, Thanh-Dat, et al.
Published: (2023)
by: Truong, Thanh-Dat, et al.
Published: (2023)
$ϕ$-DPO: Fairness Direct Preference Optimization Approach to Continual Learning in Large Multimodal Models
by: Truong, Thanh-Dat, et al.
Published: (2026)
by: Truong, Thanh-Dat, et al.
Published: (2026)
Directed-Tokens: A Robust Multi-Modality Alignment Approach to Large Language-Vision Models
by: Truong, Thanh-Dat, et al.
Published: (2025)
by: Truong, Thanh-Dat, et al.
Published: (2025)
CONDA: Continual Unsupervised Domain Adaptation Learning in Visual Perception for Self-Driving Cars
by: Truong, Thanh-Dat, et al.
Published: (2022)
by: Truong, Thanh-Dat, et al.
Published: (2022)
BIMA: Bijective Maximum Likelihood Learning Approach to Hallucination Prediction and Mitigation in Large Vision-Language Models
by: Tran, Huu-Thien, et al.
Published: (2025)
by: Tran, Huu-Thien, et al.
Published: (2025)
Cross-view Action Recognition Understanding From Exocentric to Egocentric Perspective
by: Truong, Thanh-Dat, et al.
Published: (2023)
by: Truong, Thanh-Dat, et al.
Published: (2023)
Insect-Foundation: A Foundation Model and Large Multimodal Dataset for Vision-Language Insect Understanding
by: Truong, Thanh-Dat, et al.
Published: (2025)
by: Truong, Thanh-Dat, et al.
Published: (2025)
EAGLE: Efficient Adaptive Geometry-based Learning in Cross-view Understanding
by: Truong, Thanh-Dat, et al.
Published: (2024)
by: Truong, Thanh-Dat, et al.
Published: (2024)
BRAIN: Bias-Mitigation Continual Learning Approach to Vision-Brain Understanding
by: Nguyen, Xuan-Bac, et al.
Published: (2025)
by: Nguyen, Xuan-Bac, et al.
Published: (2025)
MANGO: Multimodal Attention-based Normalizing Flow Approach to Fusion Learning
by: Truong, Thanh-Dat, et al.
Published: (2025)
by: Truong, Thanh-Dat, et al.
Published: (2025)
DINTR: Tracking via Diffusion-based Interpolation
by: Nguyen, Pha, et al.
Published: (2024)
by: Nguyen, Pha, et al.
Published: (2024)
Multi-view Action Recognition via Directed Gromov-Wasserstein Discrepancy
by: Nguyen, Hoang-Quan, et al.
Published: (2024)
by: Nguyen, Hoang-Quan, et al.
Published: (2024)
Insect-Foundation: A Foundation Model and Large-scale 1M Dataset for Visual Insect Understanding
by: Nguyen, Hoang-Quan, et al.
Published: (2023)
by: Nguyen, Hoang-Quan, et al.
Published: (2023)
CYCLO: Cyclic Graph Transformer Approach to Multi-Object Relationship Modeling in Aerial Videos
by: Nguyen, Trong-Thuan, et al.
Published: (2024)
by: Nguyen, Trong-Thuan, et al.
Published: (2024)
HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation
by: Nguyen, Trong-Thuan, et al.
Published: (2024)
by: Nguyen, Trong-Thuan, et al.
Published: (2024)
Towards Robust and Fair Vision Learning in Open-World Environments
by: Truong, Thanh-Dat
Published: (2024)
by: Truong, Thanh-Dat
Published: (2024)
THYME: Temporal Hierarchical-Cyclic Interactivity Modeling for Video Scene Graphs in Aerial Footage
by: Nguyen, Trong-Thuan, et al.
Published: (2025)
by: Nguyen, Trong-Thuan, et al.
Published: (2025)
FLAASH: Flow-Attention Adaptive Semantic Hierarchical Fusion for Multi-Modal Tobacco Content Analysis
by: Chappa, Naga VS Raviteja, et al.
Published: (2024)
by: Chappa, Naga VS Raviteja, et al.
Published: (2024)
HIG: Hierarchical Interlacement Graph Approach to Scene Graph Generation in Video Understanding
by: Nguyen, Trong-Thuan, et al.
Published: (2023)
by: Nguyen, Trong-Thuan, et al.
Published: (2023)
Mamba as a Bridge: Where Vision Foundation Models Meet Vision Language Models for Domain-Generalized Semantic Segmentation
by: Zhang, Xin, et al.
Published: (2025)
by: Zhang, Xin, et al.
Published: (2025)
FrameDiT: Diffusion Transformer with Matrix Attention for Efficient Video Generation
by: Le, Minh Khoa, et al.
Published: (2026)
by: Le, Minh Khoa, et al.
Published: (2026)
COBRA: A Continual Learning Approach to Vision-Brain Understanding
by: Nguyen, Xuan-Bac, et al.
Published: (2024)
by: Nguyen, Xuan-Bac, et al.
Published: (2024)
Brainformer: Mimic Human Visual Brain Functions to Machine Vision Models via fMRI
by: Nguyen, Xuan-Bac, et al.
Published: (2023)
by: Nguyen, Xuan-Bac, et al.
Published: (2023)
Towards multi-modal forgery representation learning for AI-generated video detection and localization
by: Le, Dat, et al.
Published: (2026)
by: Le, Dat, et al.
Published: (2026)
QLAM: A Quantum Long-Attention Memory Approach to Long-Sequence Token Modeling
by: Nguyen, Hoang-Quan, et al.
Published: (2026)
by: Nguyen, Hoang-Quan, et al.
Published: (2026)
Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation
by: Nguyen, Huu Tien, et al.
Published: (2025)
by: Nguyen, Huu Tien, et al.
Published: (2025)
Sampling Foundational Transformer: A Theoretical Perspective
by: Nguyen, Viet Anh, et al.
Published: (2024)
by: Nguyen, Viet Anh, et al.
Published: (2024)
Guiding Noisy Label Conditional Diffusion Models with Score-based Discriminator Correction
by: Cong, Dat Nguyen, et al.
Published: (2025)
by: Cong, Dat Nguyen, et al.
Published: (2025)
Robust SAM: On the Adversarial Robustness of Vision Foundation Models
by: Long, Jiahuan, et al.
Published: (2025)
by: Long, Jiahuan, et al.
Published: (2025)
ELEV-VISION-SAM: Integrated Vision Language and Foundation Model for Automated Estimation of Building Lowest Floor Elevation
by: Ho, Yu-Hsuan, et al.
Published: (2024)
by: Ho, Yu-Hsuan, et al.
Published: (2024)
Quantum Vision Clustering
by: Nguyen, Xuan Bac, et al.
Published: (2023)
by: Nguyen, Xuan Bac, et al.
Published: (2023)
Efficient Domain-Adaptive Multi-Task Dense Prediction with Vision Foundation Models
by: Kang, Beomseok, et al.
Published: (2025)
by: Kang, Beomseok, et al.
Published: (2025)
BRACTIVE: A Brain Activation Approach to Human Visual Brain Learning
by: Nguyen, Xuan-Bac, et al.
Published: (2024)
by: Nguyen, Xuan-Bac, et al.
Published: (2024)
RePack then Refine: Efficient Diffusion Transformer with Vision Foundation Model
by: Dong, Guanfang, et al.
Published: (2025)
by: Dong, Guanfang, et al.
Published: (2025)
A Survey on Segment Anything Model (SAM): Vision Foundation Model Meets Prompt Engineering
by: Zhang, Chaoning, et al.
Published: (2023)
by: Zhang, Chaoning, et al.
Published: (2023)
Quantum-Brain: Quantum-Inspired Neural Network Approach to Vision-Brain Understanding
by: Nguyen, Hoang-Quan, et al.
Published: (2024)
by: Nguyen, Hoang-Quan, et al.
Published: (2024)
LangXAI: Integrating Large Vision Models for Generating Textual Explanations to Enhance Explainability in Visual Perception Tasks
by: Nguyen, Truong Thanh Hung, et al.
Published: (2024)
by: Nguyen, Truong Thanh Hung, et al.
Published: (2024)
CT to PET Translation: A Large-scale Dataset and Domain-Knowledge-Guided Diffusion Approach
by: Nguyen, Dac Thai, et al.
Published: (2024)
by: Nguyen, Dac Thai, et al.
Published: (2024)
NICO-RAG: Multimodal Hypergraph Retrieval-Augmented Generation for Understanding the Nicotine Public Health Crisis
by: Serna-Aguilera, Manuel, et al.
Published: (2026)
by: Serna-Aguilera, Manuel, et al.
Published: (2026)
Multi-Perspective Data Augmentation for Few-shot Object Detection
by: Vu, Anh-Khoa Nguyen, et al.
Published: (2025)
by: Vu, Anh-Khoa Nguyen, et al.
Published: (2025)
Similar Items
-
FALCON: Fairness Learning via Contrastive Attention Approach to Continual Semantic Scene Understanding
by: Truong, Thanh-Dat, et al.
Published: (2023) -
$ϕ$-DPO: Fairness Direct Preference Optimization Approach to Continual Learning in Large Multimodal Models
by: Truong, Thanh-Dat, et al.
Published: (2026) -
Directed-Tokens: A Robust Multi-Modality Alignment Approach to Large Language-Vision Models
by: Truong, Thanh-Dat, et al.
Published: (2025) -
CONDA: Continual Unsupervised Domain Adaptation Learning in Visual Perception for Self-Driving Cars
by: Truong, Thanh-Dat, et al.
Published: (2022) -
BIMA: Bijective Maximum Likelihood Learning Approach to Hallucination Prediction and Mitigation in Large Vision-Language Models
by: Tran, Huu-Thien, et al.
Published: (2025)