A Hidden Semantic Bottleneck in Conditional Embeddings of Diffusion Transformers
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Pham, Trung X., Zhang, Kang, Hong, Ji Woo, Yoo, Chang D. |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Cross-view Masked Diffusion Transformers for Person Image Synthesis
von: Pham, Trung X., et al.
Veröffentlicht: (2024)
von: Pham, Trung X., et al.
Veröffentlicht: (2024)
E-MD3C: Taming Masked Diffusion Transformers for Efficient Zero-Shot Object Customization
von: Pham, Trung X., et al.
Veröffentlicht: (2025)
von: Pham, Trung X., et al.
Veröffentlicht: (2025)
ITA-MDT: Image-Timestep-Adaptive Masked Diffusion Transformer Framework for Image-Based Virtual Try-On
von: Hong, Ji Woo, et al.
Veröffentlicht: (2025)
von: Hong, Ji Woo, et al.
Veröffentlicht: (2025)
MDSGen: Fast and Efficient Masked Diffusion Temporal-Aware Transformers for Open-Domain Sound Generation
von: Pham, Trung X., et al.
Veröffentlicht: (2024)
von: Pham, Trung X., et al.
Veröffentlicht: (2024)
DNI: Dilutional Noise Initialization for Diffusion Video Editing
von: Yoon, Sunjae, et al.
Veröffentlicht: (2024)
von: Yoon, Sunjae, et al.
Veröffentlicht: (2024)
TARO: Timestep-Adaptive Representation Alignment with Onset-Aware Conditioning for Synchronized Video-to-Audio Synthesis
von: Ton, Tri, et al.
Veröffentlicht: (2025)
von: Ton, Tri, et al.
Veröffentlicht: (2025)
FlexiEdit: Frequency-Aware Latent Refinement for Enhanced Non-Rigid Editing
von: Koo, Gwanhyeong, et al.
Veröffentlicht: (2024)
von: Koo, Gwanhyeong, et al.
Veröffentlicht: (2024)
High-Fidelity Text-to-Image Generation from Pre-Trained Vision-Language Models via Distribution-Conditioned Diffusion Decoding
von: Hong, Ji Woo, et al.
Veröffentlicht: (2026)
von: Hong, Ji Woo, et al.
Veröffentlicht: (2026)
Embedding-Free Transformer with Inference Spatial Reduction for Efficient Semantic Segmentation
von: Yu, Hyunwoo, et al.
Veröffentlicht: (2024)
von: Yu, Hyunwoo, et al.
Veröffentlicht: (2024)
FlowDrag: 3D-aware Drag-based Image Editing with Mesh-guided Deformation Vector Flow Fields
von: Koo, Gwanhyeong, et al.
Veröffentlicht: (2025)
von: Koo, Gwanhyeong, et al.
Veröffentlicht: (2025)
Occlusion-robust Stylization for Drawing-based 3D Animation
von: Yoon, Sunjae, et al.
Veröffentlicht: (2025)
von: Yoon, Sunjae, et al.
Veröffentlicht: (2025)
PADM: A Physics-aware Diffusion Model for Attenuation Correction
von: Pham, Trung Kien, et al.
Veröffentlicht: (2025)
von: Pham, Trung Kien, et al.
Veröffentlicht: (2025)
Guiding Diffusion Models with Semantically Degraded Conditions
von: Han, Shilong, et al.
Veröffentlicht: (2026)
von: Han, Shilong, et al.
Veröffentlicht: (2026)
Multimodal Conditional Information Bottleneck for Generalizable AI-Generated Image Detection
von: Qin, Haotian, et al.
Veröffentlicht: (2025)
von: Qin, Haotian, et al.
Veröffentlicht: (2025)
Zero-Shot Dual-Path Integration Framework for Open-Vocabulary 3D Instance Segmentation
von: Ton, Tri, et al.
Veröffentlicht: (2024)
von: Ton, Tri, et al.
Veröffentlicht: (2024)
Scalable Diffusion Transformer for Conditional 4D fMRI Synthesis
von: Seo, Jungwoo, et al.
Veröffentlicht: (2025)
von: Seo, Jungwoo, et al.
Veröffentlicht: (2025)
Marine Saliency Segmenter: Object-Focused Conditional Diffusion with Region-Level Semantic Knowledge Distillation
von: Chang, Laibin, et al.
Veröffentlicht: (2025)
von: Chang, Laibin, et al.
Veröffentlicht: (2025)
Enhancing Transformers Through Conditioned Embedded Tokens
von: Saratchandran, Hemanth, et al.
Veröffentlicht: (2025)
von: Saratchandran, Hemanth, et al.
Veröffentlicht: (2025)
Wavelet-Guided Acceleration of Text Inversion in Diffusion-Based Image Editing
von: Koo, Gwanhyeong, et al.
Veröffentlicht: (2024)
von: Koo, Gwanhyeong, et al.
Veröffentlicht: (2024)
Selective Query-guided Debiasing for Video Corpus Moment Retrieval
von: Yoon, Sunjae, et al.
Veröffentlicht: (2022)
von: Yoon, Sunjae, et al.
Veröffentlicht: (2022)
SDiT: Semantic Region-Adaptive for Diffusion Transformers
von: Lin, Bowen, et al.
Veröffentlicht: (2026)
von: Lin, Bowen, et al.
Veröffentlicht: (2026)
Semantic Routing: Exploring Multi-Layer LLM Feature Weighting for Diffusion Transformers
von: Li, Bozhou, et al.
Veröffentlicht: (2026)
von: Li, Bozhou, et al.
Veröffentlicht: (2026)
CreatiDesign: A Unified Multi-Conditional Diffusion Transformer for Creative Graphic Design
von: Zhang, Hui, et al.
Veröffentlicht: (2025)
von: Zhang, Hui, et al.
Veröffentlicht: (2025)
Polyphony: Diffusion-based Dual-Hand Action Segmentation with Alternating Vision Transformer and Semantic Conditioning
von: Zheng, Hao, et al.
Veröffentlicht: (2026)
von: Zheng, Hao, et al.
Veröffentlicht: (2026)
PEEB: Part-based Image Classifiers with an Explainable and Editable Language Bottleneck
von: Pham, Thang M., et al.
Veröffentlicht: (2024)
von: Pham, Thang M., et al.
Veröffentlicht: (2024)
Comprehensive Information Bottleneck for Unveiling Universal Attribution to Interpret Vision Transformers
von: Hong, Jung-Ho, et al.
Veröffentlicht: (2025)
von: Hong, Jung-Ho, et al.
Veröffentlicht: (2025)
SemLayoutDiff: Semantic Layout Generation with Diffusion Model for Indoor Scene Synthesis
von: Sun, Xiaohao, et al.
Veröffentlicht: (2025)
von: Sun, Xiaohao, et al.
Veröffentlicht: (2025)
SteeringDiffusion: A Bottlenecked Activation Control Interface for Diffusion Models
von: Wu, Fangzheng, et al.
Veröffentlicht: (2026)
von: Wu, Fangzheng, et al.
Veröffentlicht: (2026)
FRAG: Frequency Adapting Group for Diffusion Video Editing
von: Yoon, Sunjae, et al.
Veröffentlicht: (2024)
von: Yoon, Sunjae, et al.
Veröffentlicht: (2024)
Translation of Text Embedding via Delta Vector to Suppress Strongly Entangled Content in Text-to-Image Diffusion Models
von: Koh, Eunseo, et al.
Veröffentlicht: (2025)
von: Koh, Eunseo, et al.
Veröffentlicht: (2025)
HTMNet: A Hybrid Network with Transformer-Mamba Bottleneck Multimodal Fusion for Transparent and Reflective Objects Depth Completion
von: Xie, Guanghu, et al.
Veröffentlicht: (2025)
von: Xie, Guanghu, et al.
Veröffentlicht: (2025)
Video Anomaly Detection with Semantics-Aware Information Bottleneck
von: Li, Juntong, et al.
Veröffentlicht: (2025)
von: Li, Juntong, et al.
Veröffentlicht: (2025)
Bridging Semantic and Kinematic Conditions with Diffusion-based Discrete Motion Tokenizer
von: Gu, Chenyang, et al.
Veröffentlicht: (2026)
von: Gu, Chenyang, et al.
Veröffentlicht: (2026)
EFHQ: Multi-purpose ExtremePose-Face-HQ dataset
von: Dao, Trung Tuan, et al.
Veröffentlicht: (2023)
von: Dao, Trung Tuan, et al.
Veröffentlicht: (2023)
Training-free Diffusion Acceleration with Bottleneck Sampling
von: Tian, Ye, et al.
Veröffentlicht: (2025)
von: Tian, Ye, et al.
Veröffentlicht: (2025)
TPC: Test-time Procrustes Calibration for Diffusion-based Human Image Animation
von: Yoon, Sunjae, et al.
Veröffentlicht: (2024)
von: Yoon, Sunjae, et al.
Veröffentlicht: (2024)
Rethinking Global Text Conditioning in Diffusion Transformers
von: Starodubcev, Nikita, et al.
Veröffentlicht: (2026)
von: Starodubcev, Nikita, et al.
Veröffentlicht: (2026)
Exploring Hardware Friendly Bottleneck Architecture in CNN for Embedded Computing Systems
von: Lei, Xing, et al.
Veröffentlicht: (2024)
von: Lei, Xing, et al.
Veröffentlicht: (2024)
PointDiffuse: A Dual-Conditional Diffusion Model for Enhanced Point Cloud Semantic Segmentation
von: He, Yong, et al.
Veröffentlicht: (2025)
von: He, Yong, et al.
Veröffentlicht: (2025)
MultiDreamer3D: Multi-concept 3D Customization with Concept-Aware Diffusion Guidance
von: Song, Wooseok, et al.
Veröffentlicht: (2025)
von: Song, Wooseok, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Cross-view Masked Diffusion Transformers for Person Image Synthesis
von: Pham, Trung X., et al.
Veröffentlicht: (2024) -
E-MD3C: Taming Masked Diffusion Transformers for Efficient Zero-Shot Object Customization
von: Pham, Trung X., et al.
Veröffentlicht: (2025) -
ITA-MDT: Image-Timestep-Adaptive Masked Diffusion Transformer Framework for Image-Based Virtual Try-On
von: Hong, Ji Woo, et al.
Veröffentlicht: (2025) -
MDSGen: Fast and Efficient Masked Diffusion Temporal-Aware Transformers for Open-Domain Sound Generation
von: Pham, Trung X., et al.
Veröffentlicht: (2024) -
DNI: Dilutional Noise Initialization for Diffusion Video Editing
von: Yoon, Sunjae, et al.
Veröffentlicht: (2024)