SyncMask: Synchronized Attentional Masking for Fashion-centric Vision-Language Pretraining
Fuente:
arXiv
Salvato in:
| Autori principali: | Song, Chull Hwan, Hwang, Taebaek, Yoon, Jooyoung, Choi, Shunghyun, Gu, Yeong Hyeon |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
On Train-Test Class Overlap and Detection for Image Retrieval
di: Song, Chull Hwan, et al.
Pubblicazione: (2024)
di: Song, Chull Hwan, et al.
Pubblicazione: (2024)
DCText: Scheduled Attention Masking for Visual Text Generation via Divide-and-Conquer Strategy
di: Song, Jaewoo, et al.
Pubblicazione: (2025)
di: Song, Jaewoo, et al.
Pubblicazione: (2025)
Mitigating Mask Prior Drift and Positional Attention Collapse in Large Diffusion Vision-Language Models
di: Hong, Sujung, et al.
Pubblicazione: (2026)
di: Hong, Sujung, et al.
Pubblicazione: (2026)
MADiff: Text-Guided Fashion Image Editing with Mask Prediction and Attention-Enhanced Diffusion
di: Zhan, Zechao, et al.
Pubblicazione: (2024)
di: Zhan, Zechao, et al.
Pubblicazione: (2024)
Efficient Self-supervised Vision Pretraining with Local Masked Reconstruction
di: Chen, Jun, et al.
Pubblicazione: (2022)
di: Chen, Jun, et al.
Pubblicazione: (2022)
Polyline Path Masked Attention for Vision Transformer
di: Zhao, Zhongchen, et al.
Pubblicazione: (2025)
di: Zhao, Zhongchen, et al.
Pubblicazione: (2025)
Rethinking Causal Mask Attention for Vision-Language Inference
di: Pei, Xiaohuan, et al.
Pubblicazione: (2025)
di: Pei, Xiaohuan, et al.
Pubblicazione: (2025)
Do You Keep an Eye on What I Ask? Mitigating Multimodal Hallucination via Attention-Guided Ensemble Decoding
di: Cho, Yeongjae, et al.
Pubblicazione: (2025)
di: Cho, Yeongjae, et al.
Pubblicazione: (2025)
Masked Language Prompting for Generative Data Augmentation in Few-shot Fashion Style Recognition
di: Hirakawa, Yuki, et al.
Pubblicazione: (2025)
di: Hirakawa, Yuki, et al.
Pubblicazione: (2025)
EVEREST: Efficient Masked Video Autoencoder by Removing Redundant Spatiotemporal Tokens
di: Hwang, Sunil, et al.
Pubblicazione: (2022)
di: Hwang, Sunil, et al.
Pubblicazione: (2022)
Diffusion Masked Pretraining for Dynamic Point Cloud
di: Zhang, Zhuoyue, et al.
Pubblicazione: (2026)
di: Zhang, Zhuoyue, et al.
Pubblicazione: (2026)
Cluster-Wise Spatio-Temporal Masking for Efficient Video-Language Pretraining
di: Zhuang, Weijun, et al.
Pubblicazione: (2026)
di: Zhuang, Weijun, et al.
Pubblicazione: (2026)
MAL: Cluster-Masked and Multi-Task Pretraining for Enhanced xLSTM Vision Performance
di: Huang, Wenjun, et al.
Pubblicazione: (2024)
di: Huang, Wenjun, et al.
Pubblicazione: (2024)
Distribution-Based Masked Medical Vision-Language Model Using Structured Reports
di: Gowda, Shreyank N, et al.
Pubblicazione: (2025)
di: Gowda, Shreyank N, et al.
Pubblicazione: (2025)
Feature Attenuation of Defective Representation Can Resolve Incomplete Masking on Anomaly Detection
di: Park, YeongHyeon, et al.
Pubblicazione: (2024)
di: Park, YeongHyeon, et al.
Pubblicazione: (2024)
AnyDesign: Versatile Area Fashion Editing via Mask-Free Diffusion
di: Niu, Yunfang, et al.
Pubblicazione: (2024)
di: Niu, Yunfang, et al.
Pubblicazione: (2024)
Efficient Masked Image Compression with Position-Indexed Self-Attention
di: Dai, Chengjie, et al.
Pubblicazione: (2025)
di: Dai, Chengjie, et al.
Pubblicazione: (2025)
SpatiO: Adaptive Test-Time Orchestration of Vision-Language Agents for Spatial Reasoning
di: Hwang, Chan Yeong, et al.
Pubblicazione: (2026)
di: Hwang, Chan Yeong, et al.
Pubblicazione: (2026)
A Unified Masked Jigsaw Puzzle Framework for Vision and Language Models
di: Ye, Weixin, et al.
Pubblicazione: (2026)
di: Ye, Weixin, et al.
Pubblicazione: (2026)
CSF-Net: Context-Semantic Fusion Network for Large Mask Inpainting
di: Heo, Chae-Yeon, et al.
Pubblicazione: (2025)
di: Heo, Chae-Yeon, et al.
Pubblicazione: (2025)
MaskedCLIP: Bridging the Masked and CLIP Space for Semi-Supervised Medical Vision-Language Pre-training
di: Zhu, Lei, et al.
Pubblicazione: (2025)
di: Zhu, Lei, et al.
Pubblicazione: (2025)
Q-Mask: Query-driven Causal Masks for Text Anchoring in OCR-Oriented Vision-Language Models
di: Xu, Longwei, et al.
Pubblicazione: (2026)
di: Xu, Longwei, et al.
Pubblicazione: (2026)
Efficient Vision-Language Pre-training by Cluster Masking
di: Wei, Zihao, et al.
Pubblicazione: (2024)
di: Wei, Zihao, et al.
Pubblicazione: (2024)
Improving Diffusion-Based Generative Models via Approximated Optimal Transport
di: Kim, Daegyu, et al.
Pubblicazione: (2024)
di: Kim, Daegyu, et al.
Pubblicazione: (2024)
SyncVIS: Synchronized Video Instance Segmentation
di: Zheng, Rongkun, et al.
Pubblicazione: (2024)
di: Zheng, Rongkun, et al.
Pubblicazione: (2024)
Efficient Diffusion-Driven Corruption Editor for Test-Time Adaptation
di: Oh, Yeongtak, et al.
Pubblicazione: (2024)
di: Oh, Yeongtak, et al.
Pubblicazione: (2024)
Language-driven Grasp Detection with Mask-guided Attention
di: Van Vo, Tuan, et al.
Pubblicazione: (2024)
di: Van Vo, Tuan, et al.
Pubblicazione: (2024)
UM-Depth : Uncertainty Masked Self-Supervised Monocular Depth Estimation with Visual Odometry
di: Um, Tae-Wook, et al.
Pubblicazione: (2025)
di: Um, Tae-Wook, et al.
Pubblicazione: (2025)
Mask2Map: Vectorized HD Map Construction Using Bird's Eye View Segmentation Masks
di: Choi, Sehwan, et al.
Pubblicazione: (2024)
di: Choi, Sehwan, et al.
Pubblicazione: (2024)
Refer to Any Segmentation Mask Group With Vision-Language Prompts
di: Cao, Shengcao, et al.
Pubblicazione: (2025)
di: Cao, Shengcao, et al.
Pubblicazione: (2025)
Video Super-Resolution Transformer with Masked Inter&Intra-Frame Attention
di: Zhou, Xingyu, et al.
Pubblicazione: (2024)
di: Zhou, Xingyu, et al.
Pubblicazione: (2024)
CAMILA: Context-Aware Masking for Image Editing with Language Alignment
di: Kim, Hyunseung, et al.
Pubblicazione: (2025)
di: Kim, Hyunseung, et al.
Pubblicazione: (2025)
TextGuider: Training-Free Guidance for Text Rendering via Attention Alignment
di: Baek, Kanghyun, et al.
Pubblicazione: (2025)
di: Baek, Kanghyun, et al.
Pubblicazione: (2025)
MAP: Unleashing Hybrid Mamba-Transformer Vision Backbone's Potential with Masked Autoregressive Pretraining
di: Liu, Yunze, et al.
Pubblicazione: (2024)
di: Liu, Yunze, et al.
Pubblicazione: (2024)
Masked Diffusion Vision-Language Models for Temporal Action Localization
di: Wang, Fengshun, et al.
Pubblicazione: (2026)
di: Wang, Fengshun, et al.
Pubblicazione: (2026)
FlashLips: 100-FPS Mask-Free Latent Lip-Sync using Reconstruction Instead of Diffusion or GANs
di: Zinonos, Andreas, et al.
Pubblicazione: (2025)
di: Zinonos, Andreas, et al.
Pubblicazione: (2025)
Improving Geometry in Sparse-View 3DGS via Reprojection-based DoF Separation
di: Kim, Yongsung, et al.
Pubblicazione: (2024)
di: Kim, Yongsung, et al.
Pubblicazione: (2024)
Large-Scale Text-to-Image Model with Inpainting is a Zero-Shot Subject-Driven Image Generator
di: Shin, Chaehun, et al.
Pubblicazione: (2024)
di: Shin, Chaehun, et al.
Pubblicazione: (2024)
SyncTalk: The Devil is in the Synchronization for Talking Head Synthesis
di: Peng, Ziqiao, et al.
Pubblicazione: (2023)
di: Peng, Ziqiao, et al.
Pubblicazione: (2023)
FreeMask: Rethinking the Importance of Attention Masks for Zero-Shot Video Editing
di: Cai, Lingling, et al.
Pubblicazione: (2024)
di: Cai, Lingling, et al.
Pubblicazione: (2024)
Documenti analoghi
-
On Train-Test Class Overlap and Detection for Image Retrieval
di: Song, Chull Hwan, et al.
Pubblicazione: (2024) -
DCText: Scheduled Attention Masking for Visual Text Generation via Divide-and-Conquer Strategy
di: Song, Jaewoo, et al.
Pubblicazione: (2025) -
Mitigating Mask Prior Drift and Positional Attention Collapse in Large Diffusion Vision-Language Models
di: Hong, Sujung, et al.
Pubblicazione: (2026) -
MADiff: Text-Guided Fashion Image Editing with Mask Prediction and Attention-Enhanced Diffusion
di: Zhan, Zechao, et al.
Pubblicazione: (2024) -
Efficient Self-supervised Vision Pretraining with Local Masked Reconstruction
di: Chen, Jun, et al.
Pubblicazione: (2022)