Diff-Aid: Inference-time Adaptive Interaction Denoising for Rectified Text-to-Image Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Binglei, Yang, Mengping, Tan, Zhiyu, Zhang, Junping, Li, Hao |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Unraveling MMDiT Blocks: Training-free Analysis and Enhancement of Text-conditioned Diffusion
par: Li, Binglei, et autres
Publié: (2026)
par: Li, Binglei, et autres
Publié: (2026)
DiverseDiT: Towards Diverse Representation Learning in Diffusion Transformers
par: Yang, Mengping, et autres
Publié: (2026)
par: Yang, Mengping, et autres
Publié: (2026)
An Empirical Study and Analysis of Text-to-Image Generation Using Large Language Model-Powered Textual Representation
par: Tan, Zhiyu, et autres
Publié: (2024)
par: Tan, Zhiyu, et autres
Publié: (2024)
EVALALIGN: Supervised Fine-Tuning Multimodal LLMs with Human-Aligned Data for Evaluating Text-to-Image Models
par: Tan, Zhiyu, et autres
Publié: (2024)
par: Tan, Zhiyu, et autres
Publié: (2024)
Dual-IPO: Dual-Iterative Preference Optimization for Text-to-Video Generation
par: Yang, Xiaomeng, et autres
Publié: (2025)
par: Yang, Xiaomeng, et autres
Publié: (2025)
Omni-Video: Democratizing Unified Video Understanding and Generation
par: Tan, Zhiyu, et autres
Publié: (2025)
par: Tan, Zhiyu, et autres
Publié: (2025)
Cockatiel: Ensembling Synthetic and Human Preferenced Training for Detailed Video Caption
par: Qin, Luozheng, et autres
Publié: (2025)
par: Qin, Luozheng, et autres
Publié: (2025)
FoundDiff: Foundational Diffusion Model for Generalizable Low-Dose CT Denoising
par: Chen, Zhihao, et autres
Publié: (2025)
par: Chen, Zhihao, et autres
Publié: (2025)
Uni-cot: Towards Unified Chain-of-Thought Reasoning Across Text and Vision
par: Qin, Luozheng, et autres
Publié: (2025)
par: Qin, Luozheng, et autres
Publié: (2025)
InstanceAssemble: Layout-Aware Image Generation via Instance Assembling Attention
par: Xiang, Qiang, et autres
Publié: (2025)
par: Xiang, Qiang, et autres
Publié: (2025)
VidGen-1M: A Large-Scale Dataset for Text-to-video Generation
par: Tan, Zhiyu, et autres
Publié: (2024)
par: Tan, Zhiyu, et autres
Publié: (2024)
Attention Calibration for Disentangled Text-to-Image Personalization
par: Zhang, Yanbing, et autres
Publié: (2024)
par: Zhang, Yanbing, et autres
Publié: (2024)
E2ED^2:Direct Mapping from Noise to Data for Enhanced Diffusion Models
par: Tan, Zhiyu, et autres
Publié: (2024)
par: Tan, Zhiyu, et autres
Publié: (2024)
CoreDiff: Contextual Error-Modulated Generalized Diffusion Model for Low-Dose CT Denoising and Generalization
par: Gao, Qi, et autres
Publié: (2023)
par: Gao, Qi, et autres
Publié: (2023)
Omni-Video 2: Scaling MLLM-Conditioned Diffusion for Unified Video Generation and Editing
par: Yang, Hao, et autres
Publié: (2026)
par: Yang, Hao, et autres
Publié: (2026)
Text-to-Image Rectified Flow as Plug-and-Play Priors
par: Yang, Xiaofeng, et autres
Publié: (2024)
par: Yang, Xiaofeng, et autres
Publié: (2024)
Check, Locate, Rectify: A Training-Free Layout Calibration System for Text-to-Image Generation
par: Gong, Biao, et autres
Publié: (2023)
par: Gong, Biao, et autres
Publié: (2023)
Golden RPG: Confidence-Adaptive Region-Aware Noise for Compositional Text-to-Image Generation
par: Li, Hao
Publié: (2026)
par: Li, Hao
Publié: (2026)
Beyond Fixed Inference: Quantitative Flow Matching for Adaptive Image Denoising
par: Duan, Jigang, et autres
Publié: (2026)
par: Duan, Jigang, et autres
Publié: (2026)
Diff-Tracker: Text-to-Image Diffusion Models are Unsupervised Trackers
par: Zhang, Zhengbo, et autres
Publié: (2024)
par: Zhang, Zhengbo, et autres
Publié: (2024)
AsyncDiff: Asynchronous Timestep Conditioning for Enhanced Text-to-Image Diffusion Inference
par: Xu, Longhuan, et autres
Publié: (2025)
par: Xu, Longhuan, et autres
Publié: (2025)
FocusDiff: Advancing Fine-Grained Text-Image Alignment for Autoregressive Visual Generation through RL
par: Pan, Kaihang, et autres
Publié: (2025)
par: Pan, Kaihang, et autres
Publié: (2025)
Asynchronous Denoising Diffusion Models for Aligning Text-to-Image Generation
par: Hu, Zijing, et autres
Publié: (2025)
par: Hu, Zijing, et autres
Publié: (2025)
Denoising, Fast and Slow: Difficulty-Aware Adaptive Sampling for Image Generation
par: Schusterbauer, Johannes, et autres
Publié: (2026)
par: Schusterbauer, Johannes, et autres
Publié: (2026)
LiFT: Leveraging Human Feedback for Text-to-Video Model Alignment
par: Wang, Yibin, et autres
Publié: (2024)
par: Wang, Yibin, et autres
Publié: (2024)
Delta Rectified Flow Sampling for Text-to-Image Editing
par: Beaudouin, Gaspard, et autres
Publié: (2025)
par: Beaudouin, Gaspard, et autres
Publié: (2025)
Image Synthesis under Limited Data: A Survey and Taxonomy
par: Yang, Mengping, et autres
Publié: (2023)
par: Yang, Mengping, et autres
Publié: (2023)
ViewDiff: 3D-Consistent Image Generation with Text-to-Image Models
par: Höllein, Lukas, et autres
Publié: (2024)
par: Höllein, Lukas, et autres
Publié: (2024)
DNAEdit: Direct Noise Alignment for Text-Guided Rectified Flow Editing
par: Xie, Chenxi, et autres
Publié: (2025)
par: Xie, Chenxi, et autres
Publié: (2025)
Efficient Rectified Flow for Image Fusion
par: Wang, Zirui, et autres
Publié: (2025)
par: Wang, Zirui, et autres
Publié: (2025)
DiffChat: Learning to Chat with Text-to-Image Synthesis Models for Interactive Image Creation
par: Wang, Jiapeng, et autres
Publié: (2024)
par: Wang, Jiapeng, et autres
Publié: (2024)
Rectifying Latent Space for Generative Single-Image Reflection Removal
par: Li, Mingjia, et autres
Publié: (2025)
par: Li, Mingjia, et autres
Publié: (2025)
Diff-MM: Exploring Pre-trained Text-to-Image Generation Model for Unified Multi-modal Object Tracking
par: Xuan, Shiyu, et autres
Publié: (2025)
par: Xuan, Shiyu, et autres
Publié: (2025)
Adaptively Clustering Neighbor Elements for Image-Text Generation
par: Wang, Zihua, et autres
Publié: (2023)
par: Wang, Zihua, et autres
Publié: (2023)
SWIFT: Prompt-Adaptive Memory for Efficient Interactive Long Video Generation
par: Tan, Shanwen, et autres
Publié: (2026)
par: Tan, Shanwen, et autres
Publié: (2026)
DiffVL: Diffusion-Based Visual Localization on 2D Maps via BEV-Conditioned GPS Denoising
par: Gao, Li, et autres
Publié: (2025)
par: Gao, Li, et autres
Publié: (2025)
AsyncDiff: Parallelizing Diffusion Models by Asynchronous Denoising
par: Chen, Zigeng, et autres
Publié: (2024)
par: Chen, Zigeng, et autres
Publié: (2024)
AnaMoDiff: 2D Analogical Motion Diffusion via Disentangled Denoising
par: Tanveer, Maham, et autres
Publié: (2024)
par: Tanveer, Maham, et autres
Publié: (2024)
Rectified Diffusion: Straightness Is Not Your Need in Rectified Flow
par: Wang, Fu-Yun, et autres
Publié: (2024)
par: Wang, Fu-Yun, et autres
Publié: (2024)
InstantEdit: Text-Guided Few-Step Image Editing with Piecewise Rectified Flow
par: Gong, Yiming, et autres
Publié: (2025)
par: Gong, Yiming, et autres
Publié: (2025)
Documents similaires
-
Unraveling MMDiT Blocks: Training-free Analysis and Enhancement of Text-conditioned Diffusion
par: Li, Binglei, et autres
Publié: (2026) -
DiverseDiT: Towards Diverse Representation Learning in Diffusion Transformers
par: Yang, Mengping, et autres
Publié: (2026) -
An Empirical Study and Analysis of Text-to-Image Generation Using Large Language Model-Powered Textual Representation
par: Tan, Zhiyu, et autres
Publié: (2024) -
EVALALIGN: Supervised Fine-Tuning Multimodal LLMs with Human-Aligned Data for Evaluating Text-to-Image Models
par: Tan, Zhiyu, et autres
Publié: (2024) -
Dual-IPO: Dual-Iterative Preference Optimization for Text-to-Video Generation
par: Yang, Xiaomeng, et autres
Publié: (2025)