SRA 2: Variational Autoencoder Self-Representation Alignment for Efficient Diffusion Training
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Mengmeng, Jiang, Dengyang, Li, Liuzhuozheng, Lin, Yucheng, Shen, Guojiang, Kong, Xiangjie, Liu, Yong, Dai, Guang, Wang, Jingdong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
No Other Representation Component Is Needed: Diffusion Transformers Can Provide Representation Guidance by Themselves
di: Jiang, Dengyang, et al.
Pubblicazione: (2025)
di: Jiang, Dengyang, et al.
Pubblicazione: (2025)
Exploring Time Conditioning in Diffusion Generative Models from Disjoint Noisy Data Manifolds
di: Li, Liuzhuozheng, et al.
Pubblicazione: (2026)
di: Li, Liuzhuozheng, et al.
Pubblicazione: (2026)
Unlocking the Potential of Grounding DINO in Videos: Parameter-Efficient Adaptation for Limited-Data Spatial-Temporal Localization
di: Wang, Zanyi, et al.
Pubblicazione: (2026)
di: Wang, Zanyi, et al.
Pubblicazione: (2026)
Deforming Videos to Masks: Flow Matching for Referring Video Segmentation
di: Wang, Zanyi, et al.
Pubblicazione: (2025)
di: Wang, Zanyi, et al.
Pubblicazione: (2025)
TrackAny3D: Transferring Pretrained 3D Models for Category-unified 3D Point Cloud Tracking
di: Wang, Mengmeng, et al.
Pubblicazione: (2025)
di: Wang, Mengmeng, et al.
Pubblicazione: (2025)
Low-Biased General Annotated Dataset Generation
di: Jiang, Dengyang, et al.
Pubblicazione: (2024)
di: Jiang, Dengyang, et al.
Pubblicazione: (2024)
Point-SRA: Self-Representation Alignment for 3D Representation Learning
di: Wei, Lintong, et al.
Pubblicazione: (2026)
di: Wei, Lintong, et al.
Pubblicazione: (2026)
DreamSalon: A Staged Diffusion Framework for Preserving Identity-Context in Editable Face Generation
di: Lin, Haonan, et al.
Pubblicazione: (2024)
di: Lin, Haonan, et al.
Pubblicazione: (2024)
Improving Region Representation Learning from Urban Imagery with Noisy Long-Caption Supervision
di: Zhang, Yimei, et al.
Pubblicazione: (2025)
di: Zhang, Yimei, et al.
Pubblicazione: (2025)
Schedule Your Edit: A Simple yet Effective Diffusion Noise Schedule for Image Editing
di: Lin, Haonan, et al.
Pubblicazione: (2024)
di: Lin, Haonan, et al.
Pubblicazione: (2024)
TriCLIP-3D: A Unified Parameter-Efficient Framework for Tri-Modal 3D Visual Grounding based on CLIP
di: Li, Fan, et al.
Pubblicazione: (2025)
di: Li, Fan, et al.
Pubblicazione: (2025)
SpotActor: Training-Free Layout-Controlled Consistent Image Generation
di: Wang, Jiahao, et al.
Pubblicazione: (2024)
di: Wang, Jiahao, et al.
Pubblicazione: (2024)
SSMG: Spatial-Semantic Map Guided Diffusion Model for Free-form Layout-to-Image Generation
di: Jia, Chengyou, et al.
Pubblicazione: (2023)
di: Jia, Chengyou, et al.
Pubblicazione: (2023)
Timestep-Aware Correction for Quantized Diffusion Models
di: Yao, Yuzhe, et al.
Pubblicazione: (2024)
di: Yao, Yuzhe, et al.
Pubblicazione: (2024)
AffordanceSAM: Segment Anything Once More in Affordance Grounding
di: Jiang, Dengyang, et al.
Pubblicazione: (2025)
di: Jiang, Dengyang, et al.
Pubblicazione: (2025)
M2-CLIP: A Multimodal, Multi-task Adapting Framework for Video Action Recognition
di: Wang, Mengmeng, et al.
Pubblicazione: (2024)
di: Wang, Mengmeng, et al.
Pubblicazione: (2024)
Multimodal Trajectory Representation Learning for Travel Time Estimation
di: Liu, Zhi, et al.
Pubblicazione: (2025)
di: Liu, Zhi, et al.
Pubblicazione: (2025)
MA-FSAR: Multimodal Adaptation of CLIP for Few-Shot Action Recognition
di: Xing, Jiazheng, et al.
Pubblicazione: (2023)
di: Xing, Jiazheng, et al.
Pubblicazione: (2023)
Flipped Classroom: Aligning Teacher Attention with Student in Generalized Category Discovery
di: Lin, Haonan, et al.
Pubblicazione: (2024)
di: Lin, Haonan, et al.
Pubblicazione: (2024)
Visual Object Tracking across Diverse Data Modalities: A Review
di: Wang, Mengmeng, et al.
Pubblicazione: (2024)
di: Wang, Mengmeng, et al.
Pubblicazione: (2024)
Laminating Representation Autoencoders for Efficient Diffusion
di: Calvo-González, Ramón, et al.
Pubblicazione: (2026)
di: Calvo-González, Ramón, et al.
Pubblicazione: (2026)
Vision-TTT: Efficient and Expressive Visual Representation Learning with Test-Time Training
di: Kong, Quan, et al.
Pubblicazione: (2026)
di: Kong, Quan, et al.
Pubblicazione: (2026)
PSDiff: Diffusion Model for Person Search with Iterative and Collaborative Refinement
di: Jia, Chengyou, et al.
Pubblicazione: (2023)
di: Jia, Chengyou, et al.
Pubblicazione: (2023)
SRA-Seg: Synthetic to Real Alignment for Semi-Supervised Medical Image Segmentation
di: Aranya, OFM Riaz Rahman, et al.
Pubblicazione: (2026)
di: Aranya, OFM Riaz Rahman, et al.
Pubblicazione: (2026)
Disentangled Representation Learning with Transmitted Information Bottleneck
di: Dang, Zhuohang, et al.
Pubblicazione: (2023)
di: Dang, Zhuohang, et al.
Pubblicazione: (2023)
RefTon: Reference person shot assist virtual Try-on
di: Li, Liuzhuozheng, et al.
Pubblicazione: (2025)
di: Li, Liuzhuozheng, et al.
Pubblicazione: (2025)
DGAE: Diffusion-Guided Autoencoder for Efficient Latent Representation Learning
di: Liu, Dongxu, et al.
Pubblicazione: (2025)
di: Liu, Dongxu, et al.
Pubblicazione: (2025)
JoDiffusion: Jointly Diffusing Image with Pixel-Level Annotations for Semantic Segmentation Promotion
di: Wang, Haoyu, et al.
Pubblicazione: (2025)
di: Wang, Haoyu, et al.
Pubblicazione: (2025)
Latent Diffusion Model without Variational Autoencoder
di: Shi, Minglei, et al.
Pubblicazione: (2025)
di: Shi, Minglei, et al.
Pubblicazione: (2025)
SARA: Structural and Adversarial Representation Alignment for Training-efficient Diffusion Models
di: Chen, Hesen, et al.
Pubblicazione: (2025)
di: Chen, Hesen, et al.
Pubblicazione: (2025)
Distribution Matching Distillation Meets Reinforcement Learning
di: Jiang, Dengyang, et al.
Pubblicazione: (2025)
di: Jiang, Dengyang, et al.
Pubblicazione: (2025)
TryOn-Adapter: Efficient Fine-Grained Clothing Identity Adaptation for High-Fidelity Virtual Try-On
di: Xing, Jiazheng, et al.
Pubblicazione: (2024)
di: Xing, Jiazheng, et al.
Pubblicazione: (2024)
RefAlign: Representation Alignment for Reference-to-Video Generation
di: Wang, Lei, et al.
Pubblicazione: (2026)
di: Wang, Lei, et al.
Pubblicazione: (2026)
Instructing Text-to-Image Diffusion Models via Classifier-Guided Semantic Optimization
di: Chang, Yuanyuan, et al.
Pubblicazione: (2025)
di: Chang, Yuanyuan, et al.
Pubblicazione: (2025)
LiteVAE: Lightweight and Efficient Variational Autoencoders for Latent Diffusion Models
di: Sadat, Seyedmorteza, et al.
Pubblicazione: (2024)
di: Sadat, Seyedmorteza, et al.
Pubblicazione: (2024)
Diffusion Transformers with Representation Autoencoders
di: Zheng, Boyang, et al.
Pubblicazione: (2025)
di: Zheng, Boyang, et al.
Pubblicazione: (2025)
Efficient Masked Autoencoders with Self-Consistency
di: Li, Zhaowen, et al.
Pubblicazione: (2023)
di: Li, Zhaowen, et al.
Pubblicazione: (2023)
Scaling Text-to-Image Diffusion Transformers with Representation Autoencoders
di: Tong, Shengbang, et al.
Pubblicazione: (2026)
di: Tong, Shengbang, et al.
Pubblicazione: (2026)
SRA: A Novel Method to Improve Feature Embedding in Self-supervised Learning for Histopathological Images
di: Manoochehri, Hamid, et al.
Pubblicazione: (2024)
di: Manoochehri, Hamid, et al.
Pubblicazione: (2024)
Deep Feature Consistent Variational Autoencoder
di: Hou, Xianxu, et al.
Pubblicazione: (2016)
di: Hou, Xianxu, et al.
Pubblicazione: (2016)
Documenti analoghi
-
No Other Representation Component Is Needed: Diffusion Transformers Can Provide Representation Guidance by Themselves
di: Jiang, Dengyang, et al.
Pubblicazione: (2025) -
Exploring Time Conditioning in Diffusion Generative Models from Disjoint Noisy Data Manifolds
di: Li, Liuzhuozheng, et al.
Pubblicazione: (2026) -
Unlocking the Potential of Grounding DINO in Videos: Parameter-Efficient Adaptation for Limited-Data Spatial-Temporal Localization
di: Wang, Zanyi, et al.
Pubblicazione: (2026) -
Deforming Videos to Masks: Flow Matching for Referring Video Segmentation
di: Wang, Zanyi, et al.
Pubblicazione: (2025) -
TrackAny3D: Transferring Pretrained 3D Models for Category-unified 3D Point Cloud Tracking
di: Wang, Mengmeng, et al.
Pubblicazione: (2025)