Exploring Time Conditioning in Diffusion Generative Models from Disjoint Noisy Data Manifolds
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Liuzhuozheng, Zhan, Zhiyuan, Liu, Shuhong, Jiang, Dengyang, Wang, Zanyi, Dai, Guang, Wang, Jingdong, Wang, Mengmeng |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Unlocking the Potential of Grounding DINO in Videos: Parameter-Efficient Adaptation for Limited-Data Spatial-Temporal Localization
par: Wang, Zanyi, et autres
Publié: (2026)
par: Wang, Zanyi, et autres
Publié: (2026)
Deforming Videos to Masks: Flow Matching for Referring Video Segmentation
par: Wang, Zanyi, et autres
Publié: (2025)
par: Wang, Zanyi, et autres
Publié: (2025)
No Other Representation Component Is Needed: Diffusion Transformers Can Provide Representation Guidance by Themselves
par: Jiang, Dengyang, et autres
Publié: (2025)
par: Jiang, Dengyang, et autres
Publié: (2025)
SRA 2: Variational Autoencoder Self-Representation Alignment for Efficient Diffusion Training
par: Wang, Mengmeng, et autres
Publié: (2026)
par: Wang, Mengmeng, et autres
Publié: (2026)
Low-Biased General Annotated Dataset Generation
par: Jiang, Dengyang, et autres
Publié: (2024)
par: Jiang, Dengyang, et autres
Publié: (2024)
TriCLIP-3D: A Unified Parameter-Efficient Framework for Tri-Modal 3D Visual Grounding based on CLIP
par: Li, Fan, et autres
Publié: (2025)
par: Li, Fan, et autres
Publié: (2025)
AffordanceSAM: Segment Anything Once More in Affordance Grounding
par: Jiang, Dengyang, et autres
Publié: (2025)
par: Jiang, Dengyang, et autres
Publié: (2025)
RefTon: Reference person shot assist virtual Try-on
par: Li, Liuzhuozheng, et autres
Publié: (2025)
par: Li, Liuzhuozheng, et autres
Publié: (2025)
SSMG: Spatial-Semantic Map Guided Diffusion Model for Free-form Layout-to-Image Generation
par: Jia, Chengyou, et autres
Publié: (2023)
par: Jia, Chengyou, et autres
Publié: (2023)
Distribution Matching Distillation Meets Reinforcement Learning
par: Jiang, Dengyang, et autres
Publié: (2025)
par: Jiang, Dengyang, et autres
Publié: (2025)
DreamSalon: A Staged Diffusion Framework for Preserving Identity-Context in Editable Face Generation
par: Lin, Haonan, et autres
Publié: (2024)
par: Lin, Haonan, et autres
Publié: (2024)
Flipped Classroom: Aligning Teacher Attention with Student in Generalized Category Discovery
par: Lin, Haonan, et autres
Publié: (2024)
par: Lin, Haonan, et autres
Publié: (2024)
Schedule Your Edit: A Simple yet Effective Diffusion Noise Schedule for Image Editing
par: Lin, Haonan, et autres
Publié: (2024)
par: Lin, Haonan, et autres
Publié: (2024)
D-OPSD: On-Policy Self-Distillation for Continuously Tuning Step-Distilled Diffusion Models
par: Jiang, Dengyang, et autres
Publié: (2026)
par: Jiang, Dengyang, et autres
Publié: (2026)
PSDiff: Diffusion Model for Person Search with Iterative and Collaborative Refinement
par: Jia, Chengyou, et autres
Publié: (2023)
par: Jia, Chengyou, et autres
Publié: (2023)
SpotActor: Training-Free Layout-Controlled Consistent Image Generation
par: Wang, Jiahao, et autres
Publié: (2024)
par: Wang, Jiahao, et autres
Publié: (2024)
Disentangled Noisy Correspondence Learning
par: Dang, Zhuohang, et autres
Publié: (2024)
par: Dang, Zhuohang, et autres
Publié: (2024)
Timestep-Aware Correction for Quantized Diffusion Models
par: Yao, Yuzhe, et autres
Publié: (2024)
par: Yao, Yuzhe, et autres
Publié: (2024)
Visual Object Tracking across Diverse Data Modalities: A Review
par: Wang, Mengmeng, et autres
Publié: (2024)
par: Wang, Mengmeng, et autres
Publié: (2024)
MG-SLAM: Structure Gaussian Splatting SLAM with Manhattan World Hypothesis
par: Liu, Shuhong, et autres
Publié: (2024)
par: Liu, Shuhong, et autres
Publié: (2024)
M2-CLIP: A Multimodal, Multi-task Adapting Framework for Video Action Recognition
par: Wang, Mengmeng, et autres
Publié: (2024)
par: Wang, Mengmeng, et autres
Publié: (2024)
Instructing Text-to-Image Diffusion Models via Classifier-Guided Semantic Optimization
par: Chang, Yuanyuan, et autres
Publié: (2025)
par: Chang, Yuanyuan, et autres
Publié: (2025)
MA-FSAR: Multimodal Adaptation of CLIP for Few-Shot Action Recognition
par: Xing, Jiazheng, et autres
Publié: (2023)
par: Xing, Jiazheng, et autres
Publié: (2023)
JoDiffusion: Jointly Diffusing Image with Pixel-Level Annotations for Semantic Segmentation Promotion
par: Wang, Haoyu, et autres
Publié: (2025)
par: Wang, Haoyu, et autres
Publié: (2025)
OneActor: Consistent Character Generation via Cluster-Conditioned Guidance
par: Wang, Jiahao, et autres
Publié: (2024)
par: Wang, Jiahao, et autres
Publié: (2024)
Thinking in Frames: How Visual Context and Test-Time Scaling Empower Video Reasoning
par: Li, Chengzu, et autres
Publié: (2026)
par: Li, Chengzu, et autres
Publié: (2026)
Improving Generalized Visual Grounding with Instance-aware Joint Learning
par: Dai, Ming, et autres
Publié: (2025)
par: Dai, Ming, et autres
Publié: (2025)
Data Generation Scheme for Thermal Modality with Edge-Guided Adversarial Conditional Diffusion Model
par: Zhu, Guoqing, et autres
Publié: (2024)
par: Zhu, Guoqing, et autres
Publié: (2024)
Guiding Noisy Label Conditional Diffusion Models with Score-based Discriminator Correction
par: Cong, Dat Nguyen, et autres
Publié: (2025)
par: Cong, Dat Nguyen, et autres
Publié: (2025)
Diff-2-in-1: Bridging Generation and Dense Perception with Diffusion Models
par: Zheng, Shuhong, et autres
Publié: (2024)
par: Zheng, Shuhong, et autres
Publié: (2024)
Manifold-Aware Exploration for Reinforcement Learning in Video Generation
par: Zheng, Mingzhe, et autres
Publié: (2026)
par: Zheng, Mingzhe, et autres
Publié: (2026)
Learning to Rematch Mismatched Pairs for Robust Cross-Modal Retrieval
par: Han, Haochen, et autres
Publié: (2024)
par: Han, Haochen, et autres
Publié: (2024)
Self-Ensemble Post Learning for Noisy Domain Generalization
par: Lu, Wang, et autres
Publié: (2025)
par: Lu, Wang, et autres
Publié: (2025)
ACDiT: Interpolating Autoregressive Conditional Modeling and Diffusion Transformer
par: Hu, Jinyi, et autres
Publié: (2024)
par: Hu, Jinyi, et autres
Publié: (2024)
CCDM: Continuous Conditional Diffusion Models for Image Generation
par: Ding, Xin, et autres
Publié: (2024)
par: Ding, Xin, et autres
Publié: (2024)
Diffusion Image Generation with Explicit Modeling of Data Manifold Geometry
par: Xue, Duoduo, et autres
Publié: (2026)
par: Xue, Duoduo, et autres
Publié: (2026)
Exploring Effective Factors for Improving Visual In-Context Learning
par: Sun, Yanpeng, et autres
Publié: (2023)
par: Sun, Yanpeng, et autres
Publié: (2023)
AortaDiff: Volume-Guided Conditional Diffusion Models for Multi-Branch Aortic Surface Generation
par: An, Delin, et autres
Publié: (2025)
par: An, Delin, et autres
Publié: (2025)
Establishing Stochastic Object Models from Noisy Data via Ambient Measurement-Integrated Diffusion
par: Lei, Xiaoning, et autres
Publié: (2025)
par: Lei, Xiaoning, et autres
Publié: (2025)
Guiding Visual Autoregressive Models through Spectrum Weakening
par: Wang, Chaoyang, et autres
Publié: (2025)
par: Wang, Chaoyang, et autres
Publié: (2025)
Documents similaires
-
Unlocking the Potential of Grounding DINO in Videos: Parameter-Efficient Adaptation for Limited-Data Spatial-Temporal Localization
par: Wang, Zanyi, et autres
Publié: (2026) -
Deforming Videos to Masks: Flow Matching for Referring Video Segmentation
par: Wang, Zanyi, et autres
Publié: (2025) -
No Other Representation Component Is Needed: Diffusion Transformers Can Provide Representation Guidance by Themselves
par: Jiang, Dengyang, et autres
Publié: (2025) -
SRA 2: Variational Autoencoder Self-Representation Alignment for Efficient Diffusion Training
par: Wang, Mengmeng, et autres
Publié: (2026) -
Low-Biased General Annotated Dataset Generation
par: Jiang, Dengyang, et autres
Publié: (2024)