GenMask: Adapting DiT for Segmentation via Direct Mask Generation
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Yang, Yuhuan, Zhuang, Xianwei, Cai, Yuxuan, Ma, Chaofan, Bai, Shuai, Yao, Jiangchao, Zhang, Ya, Lin, Junyang, Wang, Yanfeng |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition
von: Yang, Yuhuan, et al.
Veröffentlicht: (2025)
von: Yang, Yuhuan, et al.
Veröffentlicht: (2025)
ReMamber: Referring Image Segmentation with Mamba Twister
von: Yang, Yuhuan, et al.
Veröffentlicht: (2024)
von: Yang, Yuhuan, et al.
Veröffentlicht: (2024)
Multi-Modal Prototypes for Open-World Semantic Segmentation
von: Yang, Yuhuan, et al.
Veröffentlicht: (2023)
von: Yang, Yuhuan, et al.
Veröffentlicht: (2023)
SaFiRe: Saccade-Fixation Reiteration with Mamba for Referring Image Segmentation
von: Mao, Zhenjie, et al.
Veröffentlicht: (2025)
von: Mao, Zhenjie, et al.
Veröffentlicht: (2025)
Mask$^2$DiT: Dual Mask-based Diffusion Transformer for Multi-Scene Long Video Generation
von: Qi, Tianhao, et al.
Veröffentlicht: (2025)
von: Qi, Tianhao, et al.
Veröffentlicht: (2025)
AttrSeg: Open-Vocabulary Semantic Segmentation via Attribute Decomposition-Aggregation
von: Ma, Chaofan, et al.
Veröffentlicht: (2023)
von: Ma, Chaofan, et al.
Veröffentlicht: (2023)
G4Seg: Generation for Inexact Segmentation Refinement with Diffusion Models
von: Zhang, Tianjiao, et al.
Veröffentlicht: (2025)
von: Zhang, Tianjiao, et al.
Veröffentlicht: (2025)
Rejection Mixing: Fast Semantic Propagation of Mask Tokens for Efficient DLLM Inference
von: Ye, Yushi, et al.
Veröffentlicht: (2026)
von: Ye, Yushi, et al.
Veröffentlicht: (2026)
SegGen: Supercharging Segmentation Models with Text2Mask and Mask2Img Synthesis
von: Ye, Hanrong, et al.
Veröffentlicht: (2023)
von: Ye, Hanrong, et al.
Veröffentlicht: (2023)
DiT4DiT: Jointly Modeling Video Dynamics and Actions for Generalizable Robot Control
von: Ma, Teli, et al.
Veröffentlicht: (2026)
von: Ma, Teli, et al.
Veröffentlicht: (2026)
DiVE: DiT-based Video Generation with Enhanced Control
von: Jiang, Junpeng, et al.
Veröffentlicht: (2024)
von: Jiang, Junpeng, et al.
Veröffentlicht: (2024)
DiT-HC: Enabling Efficient Training of Visual Generation Model DiT on HPC-oriented CPU Cluster
von: Zhang, Jinxiao, et al.
Veröffentlicht: (2026)
von: Zhang, Jinxiao, et al.
Veröffentlicht: (2026)
MaterialPicker: Multi-Modal DiT-Based Material Generation
von: Ma, Xiaohe, et al.
Veröffentlicht: (2024)
von: Ma, Xiaohe, et al.
Veröffentlicht: (2024)
TetriServe: Efficient DiT Serving for Heterogeneous Image Generation
von: Lu, Runyu, et al.
Veröffentlicht: (2025)
von: Lu, Runyu, et al.
Veröffentlicht: (2025)
DiffAtlas: GenAI-fying Atlas Segmentation via Image-Mask Diffusion
von: Zhang, Hantao, et al.
Veröffentlicht: (2025)
von: Zhang, Hantao, et al.
Veröffentlicht: (2025)
Learning Versatile Skills with Curriculum Masking
von: Tang, Yao, et al.
Veröffentlicht: (2024)
von: Tang, Yao, et al.
Veröffentlicht: (2024)
Federated Learning under Partially Class-Disjoint Data via Manifold Reshaping
von: Fan, Ziqing, et al.
Veröffentlicht: (2024)
von: Fan, Ziqing, et al.
Veröffentlicht: (2024)
DiT360: High-Fidelity Panoramic Image Generation via Hybrid Training
von: Feng, Haoran, et al.
Veröffentlicht: (2025)
von: Feng, Haoran, et al.
Veröffentlicht: (2025)
Domain-Inspired Sharpness-Aware Minimization Under Domain Shifts
von: Zhang, Ruipeng, et al.
Veröffentlicht: (2024)
von: Zhang, Ruipeng, et al.
Veröffentlicht: (2024)
Zero-shot Composed Text-Image Retrieval
von: Liu, Yikun, et al.
Veröffentlicht: (2023)
von: Liu, Yikun, et al.
Veröffentlicht: (2023)
DiT4Edit: Diffusion Transformer for Image Editing
von: Feng, Kunyu, et al.
Veröffentlicht: (2024)
von: Feng, Kunyu, et al.
Veröffentlicht: (2024)
Remix-DiT: Mixing Diffusion Transformers for Multi-Expert Denoising
von: Fang, Gongfan, et al.
Veröffentlicht: (2024)
von: Fang, Gongfan, et al.
Veröffentlicht: (2024)
FocusDiT: Masking Queries in Diffusion Transformers for Fine-grained Image Generation
von: Fang, Xueji, et al.
Veröffentlicht: (2026)
von: Fang, Xueji, et al.
Veröffentlicht: (2026)
S2DiT: Sandwich Diffusion Transformer for Mobile Streaming Video Generation
von: Zhao, Lin, et al.
Veröffentlicht: (2026)
von: Zhao, Lin, et al.
Veröffentlicht: (2026)
SimGen: A Diffusion-Based Framework for Simultaneous Surgical Image and Segmentation Mask Generation
von: Bhat, Aditya, et al.
Veröffentlicht: (2025)
von: Bhat, Aditya, et al.
Veröffentlicht: (2025)
MaskAdapt: Learning Flexible Motion Adaptation via Mask-Invariant Prior for Physics-Based Characters
von: Park, Soomin, et al.
Veröffentlicht: (2026)
von: Park, Soomin, et al.
Veröffentlicht: (2026)
Insert Anything: Image Insertion via In-Context Editing in DiT
von: Song, Wensong, et al.
Veröffentlicht: (2025)
von: Song, Wensong, et al.
Veröffentlicht: (2025)
StableMask: Refining Causal Masking in Decoder-only Transformer
von: Yin, Qingyu, et al.
Veröffentlicht: (2024)
von: Yin, Qingyu, et al.
Veröffentlicht: (2024)
Progressive Confident Masking Attention Network for Audio-Visual Segmentation
von: Wang, Yuxuan, et al.
Veröffentlicht: (2024)
von: Wang, Yuxuan, et al.
Veröffentlicht: (2024)
MaskDiME: Adaptive Masked Diffusion for Precise and Efficient Visual Counterfactual Explanations
von: Guo, Changlu, et al.
Veröffentlicht: (2026)
von: Guo, Changlu, et al.
Veröffentlicht: (2026)
DiT-IC: Aligned Diffusion Transformer for Efficient Image Compression
von: Shi, Junqi, et al.
Veröffentlicht: (2026)
von: Shi, Junqi, et al.
Veröffentlicht: (2026)
DC-DiT: Adaptive Compute and Elastic Inference for Visual Generation via Dynamic Chunking
von: Haridas, Akash, et al.
Veröffentlicht: (2026)
von: Haridas, Akash, et al.
Veröffentlicht: (2026)
Contrast-Unity for Partially-Supervised Temporal Sentence Grounding
von: Wang, Haicheng, et al.
Veröffentlicht: (2025)
von: Wang, Haicheng, et al.
Veröffentlicht: (2025)
FD-DiT: Frequency Domain-Directed Diffusion Transformer for Low-Dose CT Reconstruction
von: Liu, Qiqing, et al.
Veröffentlicht: (2025)
von: Liu, Qiqing, et al.
Veröffentlicht: (2025)
Q-DiT: Accurate Post-Training Quantization for Diffusion Transformers
von: Chen, Lei, et al.
Veröffentlicht: (2024)
von: Chen, Lei, et al.
Veröffentlicht: (2024)
Conditional Panoramic Image Generation via Masked Autoregressive Modeling
von: Wang, Chaoyang, et al.
Veröffentlicht: (2025)
von: Wang, Chaoyang, et al.
Veröffentlicht: (2025)
DiTReducio: A Training-Free Acceleration for DiT-Based TTS via Progressive Calibration
von: Huo, Yanru, et al.
Veröffentlicht: (2025)
von: Huo, Yanru, et al.
Veröffentlicht: (2025)
Mask-Adapter: The Devil is in the Masks for Open-Vocabulary Segmentation
von: Li, Yongkang, et al.
Veröffentlicht: (2024)
von: Li, Yongkang, et al.
Veröffentlicht: (2024)
MaskMoE: Boosting Token-Level Learning via Routing Mask in Mixture-of-Experts
von: Su, Zhenpeng, et al.
Veröffentlicht: (2024)
von: Su, Zhenpeng, et al.
Veröffentlicht: (2024)
LlamaSeg: Image Segmentation via Autoregressive Mask Generation
von: Deng, Jiru, et al.
Veröffentlicht: (2025)
von: Deng, Jiru, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition
von: Yang, Yuhuan, et al.
Veröffentlicht: (2025) -
ReMamber: Referring Image Segmentation with Mamba Twister
von: Yang, Yuhuan, et al.
Veröffentlicht: (2024) -
Multi-Modal Prototypes for Open-World Semantic Segmentation
von: Yang, Yuhuan, et al.
Veröffentlicht: (2023) -
SaFiRe: Saccade-Fixation Reiteration with Mamba for Referring Image Segmentation
von: Mao, Zhenjie, et al.
Veröffentlicht: (2025) -
Mask$^2$DiT: Dual Mask-based Diffusion Transformer for Multi-Scene Long Video Generation
von: Qi, Tianhao, et al.
Veröffentlicht: (2025)