Lipschitz Singularities in Diffusion Models
Fuente:
arXiv
Saved in:
| Main Authors: | Yang, Zhantao, Feng, Ruili, Zhang, Han, Shen, Yujun, Zhu, Kai, Huang, Lianghua, Zhang, Yifei, Liu, Yu, Zhao, Deli, Zhou, Jingren, Cheng, Fan |
|---|---|
| Format: | Preprint |
| Published: |
2023
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
AnyDoor: Zero-shot Object-level Image Customization
by: Chen, Xi, et al.
Published: (2023)
by: Chen, Xi, et al.
Published: (2023)
Instability in Diffusion ODEs: An Explanation for Inaccurate Image Reconstruction
by: Zhang, Han, et al.
Published: (2025)
by: Zhang, Han, et al.
Published: (2025)
Addressing the ID-Matching Challenge in Long Video Captioning
by: Yang, Zhantao, et al.
Published: (2025)
by: Yang, Zhantao, et al.
Published: (2025)
ChatDiT: A Training-Free Baseline for Task-Agnostic Free-Form Chatting with Diffusion Transformers
by: Huang, Lianghua, et al.
Published: (2024)
by: Huang, Lianghua, et al.
Published: (2024)
Ranni: Taming Text-to-Image Diffusion for Accurate Instruction Following
by: Feng, Yutong, et al.
Published: (2023)
by: Feng, Yutong, et al.
Published: (2023)
Group Diffusion Transformers are Unsupervised Multitask Learners
by: Huang, Lianghua, et al.
Published: (2024)
by: Huang, Lianghua, et al.
Published: (2024)
In-Context LoRA for Diffusion Transformers
by: Huang, Lianghua, et al.
Published: (2024)
by: Huang, Lianghua, et al.
Published: (2024)
FlashFace: Human Image Personalization with High-fidelity Identity Preservation
by: Zhang, Shilong, et al.
Published: (2024)
by: Zhang, Shilong, et al.
Published: (2024)
MAMBO-G: Magnitude-Aware Mitigation for Boosted Guidance
by: Zhu, Shangwen, et al.
Published: (2025)
by: Zhu, Shangwen, et al.
Published: (2025)
Towards More Accurate Diffusion Model Acceleration with A Timestep Tuner
by: Xia, Mengfei, et al.
Published: (2023)
by: Xia, Mengfei, et al.
Published: (2023)
BACON: Improving Clarity of Image Captions via Bag-of-Concept Graphs
by: Yang, Zhantao, et al.
Published: (2024)
by: Yang, Zhantao, et al.
Published: (2024)
RTGen: Generating Region-Text Pairs for Open-Vocabulary Object Detection
by: Chen, Fangyi, et al.
Published: (2024)
by: Chen, Fangyi, et al.
Published: (2024)
Scanning Only Once: An End-to-end Framework for Fast Temporal Grounding in Long Videos
by: Pan, Yulin, et al.
Published: (2023)
by: Pan, Yulin, et al.
Published: (2023)
InFusion: Inpainting 3D Gaussians via Learning Depth Completion from Diffusion Prior
by: Liu, Zhiheng, et al.
Published: (2024)
by: Liu, Zhiheng, et al.
Published: (2024)
UKnow: A Unified Knowledge Protocol with Multimodal Knowledge Graph Datasets for Reasoning and Vision-Language Pre-Training
by: Gong, Biao, et al.
Published: (2023)
by: Gong, Biao, et al.
Published: (2023)
ACE: All-round Creator and Editor Following Instructions via Diffusion Transformer
by: Han, Zhen, et al.
Published: (2024)
by: Han, Zhen, et al.
Published: (2024)
Artistic Intelligence: A Diffusion-Based Framework for High-Fidelity Landscape Painting Synthesis
by: Yang, Wanggong, et al.
Published: (2024)
by: Yang, Wanggong, et al.
Published: (2024)
Prototype Clustered Diffusion Models for Versatile Inverse Problems
by: Zhang, Jinghao, et al.
Published: (2024)
by: Zhang, Jinghao, et al.
Published: (2024)
Unlock Pose Diversity: Accurate and Efficient Implicit Keypoint-based Spatiotemporal Diffusion for Audio-driven Talking Portrait
by: Yang, Chaolong, et al.
Published: (2025)
by: Yang, Chaolong, et al.
Published: (2025)
DreamLIP: Language-Image Pre-training with Long Captions
by: Zheng, Kecheng, et al.
Published: (2024)
by: Zheng, Kecheng, et al.
Published: (2024)
Dynamic Diffusion Transformer
by: Zhao, Wangbo, et al.
Published: (2024)
by: Zhao, Wangbo, et al.
Published: (2024)
DiffDoctor: Diagnosing Image Diffusion Models Before Treating
by: Wang, Yiyang, et al.
Published: (2025)
by: Wang, Yiyang, et al.
Published: (2025)
Learning Temporally Consistent Video Depth from Video Diffusion Priors
by: Shao, Jiahao, et al.
Published: (2024)
by: Shao, Jiahao, et al.
Published: (2024)
RAIN: Real-time Animation of Infinite Video Stream
by: Shu, Zhilei, et al.
Published: (2024)
by: Shu, Zhilei, et al.
Published: (2024)
DiffGS: Functional Gaussian Splatting Diffusion
by: Zhou, Junsheng, et al.
Published: (2024)
by: Zhou, Junsheng, et al.
Published: (2024)
Limited-Angle Tomography Reconstruction via Projector Guided 3D Diffusion
by: Deng, Zhantao, et al.
Published: (2025)
by: Deng, Zhantao, et al.
Published: (2025)
Unleashing the Potential of the Semantic Latent Space in Diffusion Models for Image Dehazing
by: Yang, Zizheng, et al.
Published: (2025)
by: Yang, Zizheng, et al.
Published: (2025)
SRDiffusion: Accelerate Video Diffusion Inference via Sketching-Rendering Cooperation
by: Cheng, Shenggan, et al.
Published: (2025)
by: Cheng, Shenggan, et al.
Published: (2025)
ACE++: Instruction-Based Image Creation and Editing via Context-Aware Content Filling
by: Mao, Chaojie, et al.
Published: (2025)
by: Mao, Chaojie, et al.
Published: (2025)
SANA 1.5: Efficient Scaling of Training-Time and Inference-Time Compute in Linear Diffusion Transformer
by: Xie, Enze, et al.
Published: (2025)
by: Xie, Enze, et al.
Published: (2025)
Tackling the Singularities at the Endpoints of Time Intervals in Diffusion Models
by: Zhang, Pengze, et al.
Published: (2024)
by: Zhang, Pengze, et al.
Published: (2024)
Learning Visual Generative Priors without Text
by: Ma, Shuailei, et al.
Published: (2024)
by: Ma, Shuailei, et al.
Published: (2024)
IDEA-Bench: How Far are Generative Models from Professional Designing?
by: Liang, Chen, et al.
Published: (2024)
by: Liang, Chen, et al.
Published: (2024)
M-IDoL: Information Decomposition for Modality-Specific and Diverse Representation Learning in Medical Foundation Model
by: Liu, Yihang, et al.
Published: (2026)
by: Liu, Yihang, et al.
Published: (2026)
Learning Procedural-aware Video Representations through State-Grounded Hierarchy Unfolding
by: Zhao, Jinghan, et al.
Published: (2025)
by: Zhao, Jinghan, et al.
Published: (2025)
CLIP-Mamba: CLIP Pretrained Mamba Models with OOD and Hessian Evaluation
by: Huang, Weiquan, et al.
Published: (2024)
by: Huang, Weiquan, et al.
Published: (2024)
VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs
by: Cheng, Zesen, et al.
Published: (2024)
by: Cheng, Zesen, et al.
Published: (2024)
Hierarchical Salient Patch Identification for Interpretable Fundus Disease Localization
by: Peng, Yitao, et al.
Published: (2024)
by: Peng, Yitao, et al.
Published: (2024)
ProtoSolo: Interpretable Image Classification via Single-Prototype Activation
by: Peng, Yitao, et al.
Published: (2025)
by: Peng, Yitao, et al.
Published: (2025)
Consistency Diffusion Models for Single-Image 3D Reconstruction with Priors
by: Jiang, Chenru, et al.
Published: (2025)
by: Jiang, Chenru, et al.
Published: (2025)
Similar Items
-
AnyDoor: Zero-shot Object-level Image Customization
by: Chen, Xi, et al.
Published: (2023) -
Instability in Diffusion ODEs: An Explanation for Inaccurate Image Reconstruction
by: Zhang, Han, et al.
Published: (2025) -
Addressing the ID-Matching Challenge in Long Video Captioning
by: Yang, Zhantao, et al.
Published: (2025) -
ChatDiT: A Training-Free Baseline for Task-Agnostic Free-Form Chatting with Diffusion Transformers
by: Huang, Lianghua, et al.
Published: (2024) -
Ranni: Taming Text-to-Image Diffusion for Accurate Instruction Following
by: Feng, Yutong, et al.
Published: (2023)