Dynamic Frequency Modulation for Controllable Text-driven Image Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Shi, Tiandong, Zhao, Ling, Qi, Ji, Ma, Jiayi, Peng, Chengli |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
FICGen: Frequency-Inspired Contextual Disentanglement for Layout-driven Degraded Image Generation
par: Wang, Wenzhuang, et autres
Publié: (2025)
par: Wang, Wenzhuang, et autres
Publié: (2025)
Frequency-Controlled Diffusion Model for Versatile Text-Guided Image-to-Image Translation
par: Gao, Xiang, et autres
Publié: (2024)
par: Gao, Xiang, et autres
Publié: (2024)
Seeing It Before It Happens: In-Generation NSFW Detection for Diffusion-Based Text-to-Image Models
par: Yang, Fan, et autres
Publié: (2025)
par: Yang, Fan, et autres
Publié: (2025)
DynamicControl: Adaptive Condition Selection for Improved Text-to-Image Generation
par: He, Qingdong, et autres
Publié: (2024)
par: He, Qingdong, et autres
Publié: (2024)
Synergistic Dual Spatial-aware Generation of Image-to-Text and Text-to-Image
par: Zhao, Yu, et autres
Publié: (2024)
par: Zhao, Yu, et autres
Publié: (2024)
Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model
par: Liu, Chenyang, et autres
Publié: (2025)
par: Liu, Chenyang, et autres
Publié: (2025)
Text-DiFuse: An Interactive Multi-Modal Image Fusion Framework based on Text-modulated Diffusion Model
par: Zhang, Hao, et autres
Publié: (2024)
par: Zhang, Hao, et autres
Publié: (2024)
Image Captioning via Dynamic Path Customization
par: Ma, Yiwei, et autres
Publié: (2024)
par: Ma, Yiwei, et autres
Publié: (2024)
Exploring Phrase-Level Grounding with Text-to-Image Diffusion Model
par: Yang, Danni, et autres
Publié: (2024)
par: Yang, Danni, et autres
Publié: (2024)
X-Oscar: A Progressive Framework for High-quality Text-guided 3D Animatable Avatar Generation
par: Ma, Yiwei, et autres
Publié: (2024)
par: Ma, Yiwei, et autres
Publié: (2024)
InsightTok: Improving Text and Face Fidelity in Discrete Tokenization for Autoregressive Image Generation
par: Yue, Yang, et autres
Publié: (2026)
par: Yue, Yang, et autres
Publié: (2026)
Text-IF: Leveraging Semantic Text Guidance for Degradation-Aware and Interactive Image Fusion
par: Yi, Xunpeng, et autres
Publié: (2024)
par: Yi, Xunpeng, et autres
Publié: (2024)
DyCoRM: Dynamic Criterion-Aware Reward Modeling for Text-to-Image Generation
par: Qian, Jiaying, et autres
Publié: (2026)
par: Qian, Jiaying, et autres
Publié: (2026)
Visual Concept-driven Image Generation with Text-to-Image Diffusion Model
par: Rahman, Tanzila, et autres
Publié: (2024)
par: Rahman, Tanzila, et autres
Publié: (2024)
X-Dreamer: Creating High-quality 3D Content by Bridging the Domain Gap Between Text-to-2D and Text-to-3D Generation
par: Ma, Yiwei, et autres
Publié: (2023)
par: Ma, Yiwei, et autres
Publié: (2023)
MIGC: Multi-Instance Generation Controller for Text-to-Image Synthesis
par: Zhou, Dewei, et autres
Publié: (2024)
par: Zhou, Dewei, et autres
Publié: (2024)
MICON-Bench: Benchmarking and Enhancing Multi-Image Context Image Generation in Unified Multimodal Models
par: Wu, Mingrui, et autres
Publié: (2026)
par: Wu, Mingrui, et autres
Publié: (2026)
Residual Prior-driven Frequency-aware Network for Image Fusion
par: Zheng, Guan, et autres
Publié: (2025)
par: Zheng, Guan, et autres
Publié: (2025)
Identity-Preserving Text-to-Video Generation via Training-Free Prompt, Image, and Guidance Enhancement
par: Gao, Jiayi, et autres
Publié: (2025)
par: Gao, Jiayi, et autres
Publié: (2025)
Exploring Timeline Control for Facial Motion Generation
par: Ma, Yifeng, et autres
Publié: (2025)
par: Ma, Yifeng, et autres
Publié: (2025)
Dynamic Prompt Optimizing for Text-to-Image Generation
par: Mo, Wenyi, et autres
Publié: (2024)
par: Mo, Wenyi, et autres
Publié: (2024)
Beat: Bi-directional One-to-Many Embedding Alignment for Text-based Person Retrieval
par: Ma, Yiwei, et autres
Publié: (2024)
par: Ma, Yiwei, et autres
Publié: (2024)
RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation
par: Pang, Lexi, et autres
Publié: (2025)
par: Pang, Lexi, et autres
Publié: (2025)
Local Conditional Controlling for Text-to-Image Diffusion Models
par: Zhao, Yibo, et autres
Publié: (2023)
par: Zhao, Yibo, et autres
Publié: (2023)
Mixed Degradation Image Restoration via Local Dynamic Optimization and Conditional Embedding
par: Gu, Yubin, et autres
Publié: (2024)
par: Gu, Yubin, et autres
Publié: (2024)
FlexEControl: Flexible and Efficient Multimodal Control for Text-to-Image Generation
par: He, Xuehai, et autres
Publié: (2024)
par: He, Xuehai, et autres
Publié: (2024)
EmotiCrafter: Text-to-Emotional-Image Generation based on Valence-Arousal Model
par: Dang, Shengqi, et autres
Publié: (2025)
par: Dang, Shengqi, et autres
Publié: (2025)
FAM Diffusion: Frequency and Attention Modulation for High-Resolution Image Generation with Stable Diffusion
par: Yang, Haosen, et autres
Publié: (2024)
par: Yang, Haosen, et autres
Publié: (2024)
Lumina-mGPT: Illuminate Flexible Photorealistic Text-to-Image Generation with Multimodal Generative Pretraining
par: Liu, Dongyang, et autres
Publié: (2024)
par: Liu, Dongyang, et autres
Publié: (2024)
CIR-CoT: Towards Interpretable Composed Image Retrieval via End-to-End Chain-of-Thought Reasoning
par: Lin, Weihuang, et autres
Publié: (2025)
par: Lin, Weihuang, et autres
Publié: (2025)
Equilibrated Diffusion: Frequency-aware Textual Embedding for Equilibrated Image Customization
par: Ma, Liyuan, et autres
Publié: (2026)
par: Ma, Liyuan, et autres
Publié: (2026)
PixelPonder: Dynamic Patch Adaptation for Enhanced Multi-Conditional Text-to-Image Generation
par: Pan, Yanjie, et autres
Publié: (2025)
par: Pan, Yanjie, et autres
Publié: (2025)
Any-to-3D Generation via Hybrid Diffusion Supervision
par: Fan, Yijun, et autres
Publié: (2024)
par: Fan, Yijun, et autres
Publié: (2024)
TextOVSR: Text-Guided Real-World Opera Video Super-Resolution
par: Chang, Hua, et autres
Publié: (2026)
par: Chang, Hua, et autres
Publié: (2026)
Text-Animator: Controllable Visual Text Video Generation
par: Liu, Lin, et autres
Publié: (2024)
par: Liu, Lin, et autres
Publié: (2024)
MLLM-Selector: Necessity and Diversity-driven High-Value Data Selection for Enhanced Visual Instruction Tuning
par: Ma, Yiwei, et autres
Publié: (2025)
par: Ma, Yiwei, et autres
Publié: (2025)
Learning to Sample Effective and Diverse Prompts for Text-to-Image Generation
par: Yun, Taeyoung, et autres
Publié: (2025)
par: Yun, Taeyoung, et autres
Publié: (2025)
ID-EA: Identity-driven Text Enhancement and Adaptation with Textual Inversion for Personalized Text-to-Image Generation
par: Jin, Hyun-Jun, et autres
Publié: (2025)
par: Jin, Hyun-Jun, et autres
Publié: (2025)
EvoIR: Towards All-in-One Image Restoration via Evolutionary Frequency Modulation
par: Ma, Jiaqi, et autres
Publié: (2025)
par: Ma, Jiaqi, et autres
Publié: (2025)
IFAdapter: Instance Feature Control for Grounded Text-to-Image Generation
par: Wu, Yinwei, et autres
Publié: (2024)
par: Wu, Yinwei, et autres
Publié: (2024)
Documents similaires
-
FICGen: Frequency-Inspired Contextual Disentanglement for Layout-driven Degraded Image Generation
par: Wang, Wenzhuang, et autres
Publié: (2025) -
Frequency-Controlled Diffusion Model for Versatile Text-Guided Image-to-Image Translation
par: Gao, Xiang, et autres
Publié: (2024) -
Seeing It Before It Happens: In-Generation NSFW Detection for Diffusion-Based Text-to-Image Models
par: Yang, Fan, et autres
Publié: (2025) -
DynamicControl: Adaptive Condition Selection for Improved Text-to-Image Generation
par: He, Qingdong, et autres
Publié: (2024) -
Synergistic Dual Spatial-aware Generation of Image-to-Text and Text-to-Image
par: Zhao, Yu, et autres
Publié: (2024)