IFAdapter: Instance Feature Control for Grounded Text-to-Image Generation
Fuente:
arXiv
Guardado en:
| Autores principales: | Wu, Yinwei, Zhou, Xianpan, Ma, Bing, Su, Xuefeng, Ma, Kai, Wang, Xinchao |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
In-Video Instructions: Visual Signals as Generative Control
por: Fang, Gongfan, et al.
Publicado: (2025)
por: Fang, Gongfan, et al.
Publicado: (2025)
Text-based Aerial-Ground Person Retrieval
por: Zhou, Xinyu, et al.
Publicado: (2025)
por: Zhou, Xinyu, et al.
Publicado: (2025)
Grounding Text-to-Image Diffusion Models for Controlled High-Quality Image Generation
por: Süleyman, Ahmad, et al.
Publicado: (2025)
por: Süleyman, Ahmad, et al.
Publicado: (2025)
Remix-DiT: Mixing Diffusion Transformers for Multi-Expert Denoising
por: Fang, Gongfan, et al.
Publicado: (2024)
por: Fang, Gongfan, et al.
Publicado: (2024)
Gather and Trace: Rethinking Video TextVQA from an Instance-oriented Perspective
por: Zhang, Yan, et al.
Publicado: (2025)
por: Zhang, Yan, et al.
Publicado: (2025)
InstanceDiffusion: Instance-level Control for Image Generation
por: Wang, Xudong, et al.
Publicado: (2024)
por: Wang, Xudong, et al.
Publicado: (2024)
Dynamic Prompt Optimizing for Text-to-Image Generation
por: Mo, Wenyi, et al.
Publicado: (2024)
por: Mo, Wenyi, et al.
Publicado: (2024)
Revolutionizing Text-to-Image Retrieval as Autoregressive Token-to-Voken Generation
por: Li, Yongqi, et al.
Publicado: (2024)
por: Li, Yongqi, et al.
Publicado: (2024)
ID-Aligner: Enhancing Identity-Preserving Text-to-Image Generation with Reward Feedback Learning
por: Chen, Weifeng, et al.
Publicado: (2024)
por: Chen, Weifeng, et al.
Publicado: (2024)
InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption
por: Fan, Tiehan, et al.
Publicado: (2024)
por: Fan, Tiehan, et al.
Publicado: (2024)
IVLMap: Instance-Aware Visual Language Grounding for Consumer Robot Navigation
por: Huang, Jiacui, et al.
Publicado: (2024)
por: Huang, Jiacui, et al.
Publicado: (2024)
ConciseHint: Boosting Efficient Reasoning via Continuous Concise Hints during Generation
por: Tang, Siao, et al.
Publicado: (2025)
por: Tang, Siao, et al.
Publicado: (2025)
RaDL: Relation-aware Disentangled Learning for Multi-Instance Text-to-Image Generation
por: Park, Geon, et al.
Publicado: (2025)
por: Park, Geon, et al.
Publicado: (2025)
ANOLE: An Open, Autoregressive, Native Large Multimodal Models for Interleaved Image-Text Generation
por: Chern, Ethan, et al.
Publicado: (2024)
por: Chern, Ethan, et al.
Publicado: (2024)
Attention Prompting on Image for Large Vision-Language Models
por: Yu, Runpeng, et al.
Publicado: (2024)
por: Yu, Runpeng, et al.
Publicado: (2024)
World-To-Image: Grounding Text-to-Image Generation with Agent-Driven World Knowledge
por: Son, Moo Hyun, et al.
Publicado: (2025)
por: Son, Moo Hyun, et al.
Publicado: (2025)
Reasoning in the Dark: Interleaved Vision-Text Reasoning in Latent Space
por: Chen, Chao, et al.
Publicado: (2025)
por: Chen, Chao, et al.
Publicado: (2025)
FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation
por: Wang, Yuanzhi, et al.
Publicado: (2026)
por: Wang, Yuanzhi, et al.
Publicado: (2026)
Tiger200K: Manually Curated High Visual Quality Video Dataset from UGC Platform
por: Zhou, Xianpan
Publicado: (2025)
por: Zhou, Xianpan
Publicado: (2025)
AsyncDiff: Parallelizing Diffusion Models by Asynchronous Denoising
por: Chen, Zigeng, et al.
Publicado: (2024)
por: Chen, Zigeng, et al.
Publicado: (2024)
Relation Rectification in Diffusion Model
por: Wu, Yinwei, et al.
Publicado: (2024)
por: Wu, Yinwei, et al.
Publicado: (2024)
FairQueue: Rethinking Prompt Learning for Fair Text-to-Image Generation
por: Teo, Christopher T. H, et al.
Publicado: (2024)
por: Teo, Christopher T. H, et al.
Publicado: (2024)
MIGC: Multi-Instance Generation Controller for Text-to-Image Synthesis
por: Zhou, Dewei, et al.
Publicado: (2024)
por: Zhou, Dewei, et al.
Publicado: (2024)
SpatialReward: Verifiable Spatial Reward Modeling for Fine-Grained Spatial Consistency in Text-to-Image Generation
por: Zhou, Sashuai, et al.
Publicado: (2026)
por: Zhou, Sashuai, et al.
Publicado: (2026)
PathM3: A Multimodal Multi-Task Multiple Instance Learning Framework for Whole Slide Image Classification and Captioning
por: Zhou, Qifeng, et al.
Publicado: (2024)
por: Zhou, Qifeng, et al.
Publicado: (2024)
FMaMIL: Frequency-Driven Mamba Multi-Instance Learning for Weakly Supervised Lesion Segmentation in Medical Images
por: Cheng, Hangbei, et al.
Publicado: (2025)
por: Cheng, Hangbei, et al.
Publicado: (2025)
TIMA: Text-Image Mutual Awareness for Balancing Zero-Shot Adversarial Robustness and Generalization Ability
por: Ma, Fengji, et al.
Publicado: (2024)
por: Ma, Fengji, et al.
Publicado: (2024)
GCE-MIL: Faithful and Recoverable Evidence for Multiple Instance Learning in Whole-Slide Imaging
por: Li, Xiangyu, et al.
Publicado: (2026)
por: Li, Xiangyu, et al.
Publicado: (2026)
Video-Infinity: Distributed Long Video Generation
por: Tan, Zhenxiong, et al.
Publicado: (2024)
por: Tan, Zhenxiong, et al.
Publicado: (2024)
Integrated Image-Text Based on Semi-supervised Learning for Small Sample Instance Segmentation
por: Chi, Ruting, et al.
Publicado: (2024)
por: Chi, Ruting, et al.
Publicado: (2024)
Few-shot Implicit Function Generation via Equivariance
por: Huang, Suizhi, et al.
Publicado: (2025)
por: Huang, Suizhi, et al.
Publicado: (2025)
VideoTemp-o3: Harmonizing Temporal Grounding and Video Understanding in Agentic Thinking-with-Videos
por: Liu, Wenqi, et al.
Publicado: (2026)
por: Liu, Wenqi, et al.
Publicado: (2026)
Instance-aware Image Colorization with Controllable Textual Descriptions and Segmentation Masks
por: An, Yanru, et al.
Publicado: (2025)
por: An, Yanru, et al.
Publicado: (2025)
Learn where to Click from Yourself: On-Policy Self-Distillation for GUI Grounding
por: Zhang, Yan, et al.
Publicado: (2026)
por: Zhang, Yan, et al.
Publicado: (2026)
WithAnyone: Towards Controllable and ID Consistent Image Generation
por: Xu, Hengyuan, et al.
Publicado: (2025)
por: Xu, Hengyuan, et al.
Publicado: (2025)
CGC: Compositional Grounded Contrast for Fine-Grained Multi-Image Understanding
por: Zheng, Lihao, et al.
Publicado: (2026)
por: Zheng, Lihao, et al.
Publicado: (2026)
Implicit Preference Alignment for Human Image Animation
por: Wang, Yuanzhi, et al.
Publicado: (2026)
por: Wang, Yuanzhi, et al.
Publicado: (2026)
Scale Up Composed Image Retrieval Learning via Modification Text Generation
por: Zhou, Yinan, et al.
Publicado: (2025)
por: Zhou, Yinan, et al.
Publicado: (2025)
OminiControl2: Efficient Conditioning for Diffusion Transformers
por: Tan, Zhenxiong, et al.
Publicado: (2025)
por: Tan, Zhenxiong, et al.
Publicado: (2025)
Continuous Expert Assembly: Instance-Conditioned Low-Rank Residuals for All-in-One Image Restoration
por: He, Haisen, et al.
Publicado: (2026)
por: He, Haisen, et al.
Publicado: (2026)
Ejemplares similares
-
In-Video Instructions: Visual Signals as Generative Control
por: Fang, Gongfan, et al.
Publicado: (2025) -
Text-based Aerial-Ground Person Retrieval
por: Zhou, Xinyu, et al.
Publicado: (2025) -
Grounding Text-to-Image Diffusion Models for Controlled High-Quality Image Generation
por: Süleyman, Ahmad, et al.
Publicado: (2025) -
Remix-DiT: Mixing Diffusion Transformers for Multi-Expert Denoising
por: Fang, Gongfan, et al.
Publicado: (2024) -
Gather and Trace: Rethinking Video TextVQA from an Instance-oriented Perspective
por: Zhang, Yan, et al.
Publicado: (2025)