No Other Representation Component Is Needed: Diffusion Transformers Can Provide Representation Guidance by Themselves
Fuente:
arXiv
Salvato in:
| Autori principali: | Jiang, Dengyang, Wang, Mengmeng, Li, Liuzhuozheng, Zhang, Lei, Wang, Haoyu, Wei, Wei, Dai, Guang, Zhang, Yanning, Wang, Jingdong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Low-Biased General Annotated Dataset Generation
di: Jiang, Dengyang, et al.
Pubblicazione: (2024)
di: Jiang, Dengyang, et al.
Pubblicazione: (2024)
SRA 2: Variational Autoencoder Self-Representation Alignment for Efficient Diffusion Training
di: Wang, Mengmeng, et al.
Pubblicazione: (2026)
di: Wang, Mengmeng, et al.
Pubblicazione: (2026)
Exploring Time Conditioning in Diffusion Generative Models from Disjoint Noisy Data Manifolds
di: Li, Liuzhuozheng, et al.
Pubblicazione: (2026)
di: Li, Liuzhuozheng, et al.
Pubblicazione: (2026)
Deforming Videos to Masks: Flow Matching for Referring Video Segmentation
di: Wang, Zanyi, et al.
Pubblicazione: (2025)
di: Wang, Zanyi, et al.
Pubblicazione: (2025)
Unlocking the Potential of Grounding DINO in Videos: Parameter-Efficient Adaptation for Limited-Data Spatial-Temporal Localization
di: Wang, Zanyi, et al.
Pubblicazione: (2026)
di: Wang, Zanyi, et al.
Pubblicazione: (2026)
JoDiffusion: Jointly Diffusing Image with Pixel-Level Annotations for Semantic Segmentation Promotion
di: Wang, Haoyu, et al.
Pubblicazione: (2025)
di: Wang, Haoyu, et al.
Pubblicazione: (2025)
AffordanceSAM: Segment Anything Once More in Affordance Grounding
di: Jiang, Dengyang, et al.
Pubblicazione: (2025)
di: Jiang, Dengyang, et al.
Pubblicazione: (2025)
Prompt-Free Conditional Diffusion for Multi-object Image Augmentation
di: Wang, Haoyu, et al.
Pubblicazione: (2025)
di: Wang, Haoyu, et al.
Pubblicazione: (2025)
Disentangled Representation Learning with Transmitted Information Bottleneck
di: Dang, Zhuohang, et al.
Pubblicazione: (2023)
di: Dang, Zhuohang, et al.
Pubblicazione: (2023)
SSMG: Spatial-Semantic Map Guided Diffusion Model for Free-form Layout-to-Image Generation
di: Jia, Chengyou, et al.
Pubblicazione: (2023)
di: Jia, Chengyou, et al.
Pubblicazione: (2023)
DreamSalon: A Staged Diffusion Framework for Preserving Identity-Context in Editable Face Generation
di: Lin, Haonan, et al.
Pubblicazione: (2024)
di: Lin, Haonan, et al.
Pubblicazione: (2024)
TriCLIP-3D: A Unified Parameter-Efficient Framework for Tri-Modal 3D Visual Grounding based on CLIP
di: Li, Fan, et al.
Pubblicazione: (2025)
di: Li, Fan, et al.
Pubblicazione: (2025)
Schedule Your Edit: A Simple yet Effective Diffusion Noise Schedule for Image Editing
di: Lin, Haonan, et al.
Pubblicazione: (2024)
di: Lin, Haonan, et al.
Pubblicazione: (2024)
Training-Free Representation Guidance for Diffusion Models with a Representation Alignment Projector
di: Zu, Wenqiang, et al.
Pubblicazione: (2026)
di: Zu, Wenqiang, et al.
Pubblicazione: (2026)
SpotActor: Training-Free Layout-Controlled Consistent Image Generation
di: Wang, Jiahao, et al.
Pubblicazione: (2024)
di: Wang, Jiahao, et al.
Pubblicazione: (2024)
OneActor: Consistent Character Generation via Cluster-Conditioned Guidance
di: Wang, Jiahao, et al.
Pubblicazione: (2024)
di: Wang, Jiahao, et al.
Pubblicazione: (2024)
Flipped Classroom: Aligning Teacher Attention with Student in Generalized Category Discovery
di: Lin, Haonan, et al.
Pubblicazione: (2024)
di: Lin, Haonan, et al.
Pubblicazione: (2024)
Top-Down Guidance for Learning Object-Centric Representations
di: Zou, Junhong, et al.
Pubblicazione: (2024)
di: Zou, Junhong, et al.
Pubblicazione: (2024)
DiT-JSCC: Rethinking Deep JSCC with Diffusion Transformers and Semantic Representations
di: Tan, Kailin, et al.
Pubblicazione: (2026)
di: Tan, Kailin, et al.
Pubblicazione: (2026)
RefAlign: Representation Alignment for Reference-to-Video Generation
di: Wang, Lei, et al.
Pubblicazione: (2026)
di: Wang, Lei, et al.
Pubblicazione: (2026)
Learning Diffusion Models with Flexible Representation Guidance
di: Wang, Chenyu, et al.
Pubblicazione: (2025)
di: Wang, Chenyu, et al.
Pubblicazione: (2025)
M2-CLIP: A Multimodal, Multi-task Adapting Framework for Video Action Recognition
di: Wang, Mengmeng, et al.
Pubblicazione: (2024)
di: Wang, Mengmeng, et al.
Pubblicazione: (2024)
UniTriGen: Unified Triplet Generation of Aligned Visible-Infrared-Label for Few-Shot RGB-T Semantic Segmentation
di: Zhou, Ping, et al.
Pubblicazione: (2026)
di: Zhou, Ping, et al.
Pubblicazione: (2026)
PSDiff: Diffusion Model for Person Search with Iterative and Collaborative Refinement
di: Jia, Chengyou, et al.
Pubblicazione: (2023)
di: Jia, Chengyou, et al.
Pubblicazione: (2023)
Distribution Matching Distillation Meets Reinforcement Learning
di: Jiang, Dengyang, et al.
Pubblicazione: (2025)
di: Jiang, Dengyang, et al.
Pubblicazione: (2025)
MA-FSAR: Multimodal Adaptation of CLIP for Few-Shot Action Recognition
di: Xing, Jiazheng, et al.
Pubblicazione: (2023)
di: Xing, Jiazheng, et al.
Pubblicazione: (2023)
CrossDiff: Exploring Self-Supervised Representation of Pansharpening via Cross-Predictive Diffusion Model
di: Xing, Yinghui, et al.
Pubblicazione: (2024)
di: Xing, Yinghui, et al.
Pubblicazione: (2024)
Optical Flow Representation Alignment Mamba Diffusion Model for Medical Video Generation
di: Wang, Zhenbin, et al.
Pubblicazione: (2024)
di: Wang, Zhenbin, et al.
Pubblicazione: (2024)
RefTon: Reference person shot assist virtual Try-on
di: Li, Liuzhuozheng, et al.
Pubblicazione: (2025)
di: Li, Liuzhuozheng, et al.
Pubblicazione: (2025)
A Plug-and-Play Method for Rare Human-Object Interactions Detection by Bridging Domain Gap
di: Zhang, Lijun, et al.
Pubblicazione: (2024)
di: Zhang, Lijun, et al.
Pubblicazione: (2024)
AutoBench-V: Can Large Vision-Language Models Benchmark Themselves?
di: Bao, Han, et al.
Pubblicazione: (2024)
di: Bao, Han, et al.
Pubblicazione: (2024)
Timestep-Aware Correction for Quantized Diffusion Models
di: Yao, Yuzhe, et al.
Pubblicazione: (2024)
di: Yao, Yuzhe, et al.
Pubblicazione: (2024)
Routing Matters in MoE: Scaling Diffusion Transformers with Explicit Routing Guidance
di: Wei, Yujie, et al.
Pubblicazione: (2025)
di: Wei, Yujie, et al.
Pubblicazione: (2025)
RiT: Vanilla Diffusion Transformers Suffice in Representation Space
di: Zhang, Le, et al.
Pubblicazione: (2026)
di: Zhang, Le, et al.
Pubblicazione: (2026)
Visual Object Tracking across Diverse Data Modalities: A Review
di: Wang, Mengmeng, et al.
Pubblicazione: (2024)
di: Wang, Mengmeng, et al.
Pubblicazione: (2024)
Exploring Diffusion Time-steps for Unsupervised Representation Learning
di: Yue, Zhongqi, et al.
Pubblicazione: (2024)
di: Yue, Zhongqi, et al.
Pubblicazione: (2024)
Language Embedding Meets Dynamic Graph: A New Exploration for Neural Architecture Representation Learning
di: Jing, Haizhao, et al.
Pubblicazione: (2025)
di: Jing, Haizhao, et al.
Pubblicazione: (2025)
Instructing Text-to-Image Diffusion Models via Classifier-Guided Semantic Optimization
di: Chang, Yuanyuan, et al.
Pubblicazione: (2025)
di: Chang, Yuanyuan, et al.
Pubblicazione: (2025)
Unleashing the Intrinsic Visual Representation Capability of Multimodal Large Language Models
di: Li, Hengzhuang, et al.
Pubblicazione: (2025)
di: Li, Hengzhuang, et al.
Pubblicazione: (2025)
Short-LVLM: Compressing and Accelerating Large Vision-Language Models by Pruning Redundant Layers
di: Ma, Ji, et al.
Pubblicazione: (2025)
di: Ma, Ji, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Low-Biased General Annotated Dataset Generation
di: Jiang, Dengyang, et al.
Pubblicazione: (2024) -
SRA 2: Variational Autoencoder Self-Representation Alignment for Efficient Diffusion Training
di: Wang, Mengmeng, et al.
Pubblicazione: (2026) -
Exploring Time Conditioning in Diffusion Generative Models from Disjoint Noisy Data Manifolds
di: Li, Liuzhuozheng, et al.
Pubblicazione: (2026) -
Deforming Videos to Masks: Flow Matching for Referring Video Segmentation
di: Wang, Zanyi, et al.
Pubblicazione: (2025) -
Unlocking the Potential of Grounding DINO in Videos: Parameter-Efficient Adaptation for Limited-Data Spatial-Temporal Localization
di: Wang, Zanyi, et al.
Pubblicazione: (2026)