DynamicControl: Adaptive Condition Selection for Improved Text-to-Image Generation
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | He, Qingdong, Peng, Jinlong, Xu, Pengcheng, Jiang, Boyuan, Hu, Xiaobin, Luo, Donghao, Liu, Yong, Wang, Yabiao, Wang, Chengjie, Li, Xiangtai, Zhang, Jiangning |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
PointRWKV: Efficient RWKV-Like Model for Hierarchical Point Cloud Learning
von: He, Qingdong, et al.
Veröffentlicht: (2024)
von: He, Qingdong, et al.
Veröffentlicht: (2024)
Unveil Inversion and Invariance in Flow Transformer for Versatile Image Editing
von: Xu, Pengcheng, et al.
Veröffentlicht: (2024)
von: Xu, Pengcheng, et al.
Veröffentlicht: (2024)
FitDiT: Advancing the Authentic Garment Details for High-fidelity Virtual Try-on
von: Jiang, Boyuan, et al.
Veröffentlicht: (2024)
von: Jiang, Boyuan, et al.
Veröffentlicht: (2024)
Reasoning to Edit: Hypothetical Instruction-Based Image Editing with Visual Reasoning
von: He, Qingdong, et al.
Veröffentlicht: (2025)
von: He, Qingdong, et al.
Veröffentlicht: (2025)
PixelPonder: Dynamic Patch Adaptation for Enhanced Multi-Conditional Text-to-Image Generation
von: Pan, Yanjie, et al.
Veröffentlicht: (2025)
von: Pan, Yanjie, et al.
Veröffentlicht: (2025)
EATFormer: Improving Vision Transformer Inspired by Evolutionary Algorithm
von: Zhang, Jiangning, et al.
Veröffentlicht: (2022)
von: Zhang, Jiangning, et al.
Veröffentlicht: (2022)
PointSeg: A Training-Free Paradigm for 3D Scene Segmentation via Foundation Models
von: He, Qingdong, et al.
Veröffentlicht: (2024)
von: He, Qingdong, et al.
Veröffentlicht: (2024)
AdapNet: Adaptive Noise-Based Network for Low-Quality Image Retrieval
von: Zhang, Sihe, et al.
Veröffentlicht: (2024)
von: Zhang, Sihe, et al.
Veröffentlicht: (2024)
The devil is in the details: Enhancing Video Virtual Try-On via Keyframe-Driven Details Injection
von: He, Qingdong, et al.
Veröffentlicht: (2025)
von: He, Qingdong, et al.
Veröffentlicht: (2025)
Open-Vocabulary SAM3D: Towards Training-free Open-Vocabulary 3D Scene Understanding
von: Tai, Hanchen, et al.
Veröffentlicht: (2024)
von: Tai, Hanchen, et al.
Veröffentlicht: (2024)
Towards Generalized Multi-Image Editing for Unified Multimodal Models
von: Xu, Pengcheng, et al.
Veröffentlicht: (2026)
von: Xu, Pengcheng, et al.
Veröffentlicht: (2026)
UniM-OV3D: Uni-Modality Open-Vocabulary 3D Scene Understanding with Fine-Grained Feature Representation
von: He, Qingdong, et al.
Veröffentlicht: (2024)
von: He, Qingdong, et al.
Veröffentlicht: (2024)
NoiseBoost: Alleviating Hallucination with Noise Perturbation for Multimodal Large Language Models
von: Wu, Kai, et al.
Veröffentlicht: (2024)
von: Wu, Kai, et al.
Veröffentlicht: (2024)
MARRS: Masked Autoregressive Unit-based Reaction Synthesis
von: Wang, Yabiao, et al.
Veröffentlicht: (2025)
von: Wang, Yabiao, et al.
Veröffentlicht: (2025)
DiffuMatting: Synthesizing Arbitrary Objects with Matting-level Annotation
von: Hu, Xiaobin, et al.
Veröffentlicht: (2024)
von: Hu, Xiaobin, et al.
Veröffentlicht: (2024)
PiT: Progressive Diffusion Transformer
von: Wu, Jiafu, et al.
Veröffentlicht: (2025)
von: Wu, Jiafu, et al.
Veröffentlicht: (2025)
Transform Trained Transformer: Accelerating Naive 4K Video Generation Over 10$\times$
von: Zhang, Jiangning, et al.
Veröffentlicht: (2025)
von: Zhang, Jiangning, et al.
Veröffentlicht: (2025)
ArtWeaver: Advanced Dynamic Style Integration via Diffusion Model
von: Xu, Chengming, et al.
Veröffentlicht: (2024)
von: Xu, Chengming, et al.
Veröffentlicht: (2024)
EMOv2: Pushing 5M Vision Model Frontier
von: Zhang, Jiangning, et al.
Veröffentlicht: (2024)
von: Zhang, Jiangning, et al.
Veröffentlicht: (2024)
Mamba-YOLO-World: Marrying YOLO-World with Mamba for Open-Vocabulary Detection
von: Wang, Haoxuan, et al.
Veröffentlicht: (2024)
von: Wang, Haoxuan, et al.
Veröffentlicht: (2024)
Reference Twice: A Simple and Unified Baseline for Few-Shot Instance Segmentation
von: Han, Yue, et al.
Veröffentlicht: (2023)
von: Han, Yue, et al.
Veröffentlicht: (2023)
Exploring Plain ViT Reconstruction for Multi-class Unsupervised Anomaly Detection
von: Zhang, Jiangning, et al.
Veröffentlicht: (2023)
von: Zhang, Jiangning, et al.
Veröffentlicht: (2023)
A Comprehensive Library for Benchmarking Multi-class Visual Anomaly Detection
von: Zhang, Jiangning, et al.
Veröffentlicht: (2024)
von: Zhang, Jiangning, et al.
Veröffentlicht: (2024)
Leveraging Fine-Grained Information and Noise Decoupling for Remote Sensing Change Detection
von: Du, Qiangang, et al.
Veröffentlicht: (2024)
von: Du, Qiangang, et al.
Veröffentlicht: (2024)
UniCombine: Unified Multi-Conditional Combination with Diffusion Transformer
von: Wang, Haoxuan, et al.
Veröffentlicht: (2025)
von: Wang, Haoxuan, et al.
Veröffentlicht: (2025)
Towards One-step Causal Video Generation via Adversarial Self-Distillation
von: Yang, Yongqi, et al.
Veröffentlicht: (2025)
von: Yang, Yongqi, et al.
Veröffentlicht: (2025)
VTBench: Comprehensive Benchmark Suite Towards Real-World Virtual Try-on Models
von: Xiaobin, Hu, et al.
Veröffentlicht: (2025)
von: Xiaobin, Hu, et al.
Veröffentlicht: (2025)
HumanVideo-MME: Benchmarking MLLMs for Human-Centric Video Understanding
von: Cai, Yuxuan, et al.
Veröffentlicht: (2025)
von: Cai, Yuxuan, et al.
Veröffentlicht: (2025)
Exploring Real&Synthetic Dataset and Linear Attention in Image Restoration
von: Du, Yuzhen, et al.
Veröffentlicht: (2024)
von: Du, Yuzhen, et al.
Veröffentlicht: (2024)
TokenAR: Multiple Subject Generation via Autoregressive Token-level enhancement
von: Sun, Haiyue, et al.
Veröffentlicht: (2025)
von: Sun, Haiyue, et al.
Veröffentlicht: (2025)
Human-MME: A Holistic Evaluation Benchmark for Human-Centric Multimodal Large Language Models
von: Liu, Yuansen, et al.
Veröffentlicht: (2025)
von: Liu, Yuansen, et al.
Veröffentlicht: (2025)
Spatial-Temporal Decoupled Reference Conditioning for Identity-Preserving Text-to-Video Generation
von: Chen, Yuheng, et al.
Veröffentlicht: (2026)
von: Chen, Yuheng, et al.
Veröffentlicht: (2026)
Identity-Preserving Text-to-Video Generation Guided by Simple yet Effective Spatial-Temporal Decoupled Representations
von: Wang, Yuji, et al.
Veröffentlicht: (2025)
von: Wang, Yuji, et al.
Veröffentlicht: (2025)
FFP-300K: Scaling First-Frame Propagation for Generalizable Video Editing
von: Huang, Xijie, et al.
Veröffentlicht: (2026)
von: Huang, Xijie, et al.
Veröffentlicht: (2026)
Sonic: Shifting Focus to Global Audio Perception in Portrait Animation
von: Ji, Xiaozhong, et al.
Veröffentlicht: (2024)
von: Ji, Xiaozhong, et al.
Veröffentlicht: (2024)
VTON-HandFit: Virtual Try-on for Arbitrary Hand Pose Guided by Hand Priors Embedding
von: Liang, Yujie, et al.
Veröffentlicht: (2024)
von: Liang, Yujie, et al.
Veröffentlicht: (2024)
CustAny: Customizing Anything from A Single Example
von: Kong, Lingjie, et al.
Veröffentlicht: (2024)
von: Kong, Lingjie, et al.
Veröffentlicht: (2024)
Omni-Customizer: End-to-End MultiModal Customization for Joint Audio-Video Generation
von: Chen, Yuheng, et al.
Veröffentlicht: (2026)
von: Chen, Yuheng, et al.
Veröffentlicht: (2026)
Learning Multi-view Anomaly Detection with Efficient Adaptive Selection
von: He, Haoyang, et al.
Veröffentlicht: (2024)
von: He, Haoyang, et al.
Veröffentlicht: (2024)
LLM-Oriented Token-Adaptive Knowledge Distillation
von: Xie, Xurong, et al.
Veröffentlicht: (2025)
von: Xie, Xurong, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
PointRWKV: Efficient RWKV-Like Model for Hierarchical Point Cloud Learning
von: He, Qingdong, et al.
Veröffentlicht: (2024) -
Unveil Inversion and Invariance in Flow Transformer for Versatile Image Editing
von: Xu, Pengcheng, et al.
Veröffentlicht: (2024) -
FitDiT: Advancing the Authentic Garment Details for High-fidelity Virtual Try-on
von: Jiang, Boyuan, et al.
Veröffentlicht: (2024) -
Reasoning to Edit: Hypothetical Instruction-Based Image Editing with Visual Reasoning
von: He, Qingdong, et al.
Veröffentlicht: (2025) -
PixelPonder: Dynamic Patch Adaptation for Enhanced Multi-Conditional Text-to-Image Generation
von: Pan, Yanjie, et al.
Veröffentlicht: (2025)