Instilling Multi-round Thinking to Text-guided Image Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zeng, Lidong, Zheng, Zhedong, Wei, Yinwei, Chua, Tat-seng |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Composed Image Retrieval with Text Feedback via Multi-grained Uncertainty Regularization
par: Chen, Yiyang, et autres
Publié: (2022)
par: Chen, Yiyang, et autres
Publié: (2022)
Synergizing Understanding and Generation with Interleaved Analyzing-Drafting Thinking
par: Wu, Shengqiong, et autres
Publié: (2026)
par: Wu, Shengqiong, et autres
Publié: (2026)
Towards Natural Language-Guided Drones: GeoText-1652 Benchmark with Spatial Relation Matching
par: Chu, Meng, et autres
Publié: (2023)
par: Chu, Meng, et autres
Publié: (2023)
3D Magic Mirror: Clothing Reconstruction from a Single Image via a Causal Perspective
par: Zheng, Zhedong, et autres
Publié: (2022)
par: Zheng, Zhedong, et autres
Publié: (2022)
Revolutionizing Text-to-Image Retrieval as Autoregressive Token-to-Voken Generation
par: Li, Yongqi, et autres
Publié: (2024)
par: Li, Yongqi, et autres
Publié: (2024)
Learning 4D Panoptic Scene Graph Generation from Rich 2D Visual Scene
par: Wu, Shengqiong, et autres
Publié: (2025)
par: Wu, Shengqiong, et autres
Publié: (2025)
Multiple-environment Self-adaptive Network for Aerial-view Geo-localization
par: Wang, Tingyu, et autres
Publié: (2022)
par: Wang, Tingyu, et autres
Publié: (2022)
Compose Your Aesthetics: Empowering Text-to-Image Models with the Principles of Art
par: Jin, Zhe, et autres
Publié: (2025)
par: Jin, Zhe, et autres
Publié: (2025)
AnomalyLMM: Bridging Generative Knowledge and Discriminative Retrieval for Text-Based Person Anomaly Search
par: Ju, Hao, et autres
Publié: (2025)
par: Ju, Hao, et autres
Publié: (2025)
RIGI: Rectifying Image-to-3D Generation Inconsistency via Uncertainty-aware Learning
par: Wang, Jiacheng, et autres
Publié: (2024)
par: Wang, Jiacheng, et autres
Publié: (2024)
Can Vision-Language Models Think from the Sky? Unifying UAV Reasoning and Generation
par: Sun, Jintao, et autres
Publié: (2026)
par: Sun, Jintao, et autres
Publié: (2026)
Beyond Walking: A Large-Scale Image-Text Benchmark for Text-based Person Anomaly Search
par: Yang, Shuyu, et autres
Publié: (2024)
par: Yang, Shuyu, et autres
Publié: (2024)
Harnessing Weak Pair Uncertainty for Text-based Person Search
par: Sun, Jintao, et autres
Publié: (2026)
par: Sun, Jintao, et autres
Publié: (2026)
Efficient Explicit Joint-level Interaction Modeling with Mamba for Text-guided HOI Generation
par: Huang, Guohong, et autres
Publié: (2025)
par: Huang, Guohong, et autres
Publié: (2025)
OmniHuman-1.5: Instilling an Active Mind in Avatars via Cognitive Simulation
par: Jiang, Jianwen, et autres
Publié: (2025)
par: Jiang, Jianwen, et autres
Publié: (2025)
Reinforcing Video Reasoning with Focused Thinking
par: Dang, Jisheng, et autres
Publié: (2025)
par: Dang, Jisheng, et autres
Publié: (2025)
Dynamic Multimodal Fusion via Meta-Learning Towards Micro-Video Recommendation
par: Liu, Han, et autres
Publié: (2025)
par: Liu, Han, et autres
Publié: (2025)
CAMeL: Cross-modality Adaptive Meta-Learning for Text-based Person Retrieval
par: Yu, Hang, et autres
Publié: (2025)
par: Yu, Hang, et autres
Publié: (2025)
Discriminative Probing and Tuning for Text-to-Image Generation
par: Qu, Leigang, et autres
Publié: (2024)
par: Qu, Leigang, et autres
Publié: (2024)
Cocktail: Mixing Multi-Modality Controls for Text-Conditional Image Generation
par: Hu, Minghui, et autres
Publié: (2023)
par: Hu, Minghui, et autres
Publié: (2023)
Universal Scene Graph Generation
par: Wu, Shengqiong, et autres
Publié: (2025)
par: Wu, Shengqiong, et autres
Publié: (2025)
IFAdapter: Instance Feature Control for Grounded Text-to-Image Generation
par: Wu, Yinwei, et autres
Publié: (2024)
par: Wu, Yinwei, et autres
Publié: (2024)
CLIP-SR: Collaborative Linguistic and Image Processing for Super-Resolution
par: Hu, Bingwen, et autres
Publié: (2024)
par: Hu, Bingwen, et autres
Publié: (2024)
Ctrl-U: Robust Conditional Image Generation via Uncertainty-aware Reward Modeling
par: Zhang, Guiyu, et autres
Publié: (2024)
par: Zhang, Guiyu, et autres
Publié: (2024)
WeatherPrompt: Multi-modality Representation Learning for All-Weather Drone Visual Geo-Localization
par: Wen, Jiahao, et autres
Publié: (2025)
par: Wen, Jiahao, et autres
Publié: (2025)
Minimizing the Pretraining Gap: Domain-aligned Text-Based Person Retrieval
par: Yang, Shuyu, et autres
Publié: (2025)
par: Yang, Shuyu, et autres
Publié: (2025)
TIGeR: Text-Instructed Generation and Refinement for Template-Free Hand-Object Interaction
par: Huang, Yiyao, et autres
Publié: (2025)
par: Huang, Yiyao, et autres
Publié: (2025)
Towards Scalable Video Anomaly Retrieval: A Synthetic Video-Text Benchmark
par: Yang, Shuyu, et autres
Publié: (2025)
par: Yang, Shuyu, et autres
Publié: (2025)
Collaborative Group: Composed Image Retrieval via Consensus Learning from Noisy Annotations
par: Zhang, Xu, et autres
Publié: (2023)
par: Zhang, Xu, et autres
Publié: (2023)
A Unified Approach for Text- and Image-guided 4D Scene Generation
par: Zheng, Yufeng, et autres
Publié: (2023)
par: Zheng, Yufeng, et autres
Publié: (2023)
Thinking with Blueprints: Assisting Vision-Language Models in Spatial Reasoning via Structured Object Representation
par: Ma, Weijian, et autres
Publié: (2026)
par: Ma, Weijian, et autres
Publié: (2026)
Scale Up Composed Image Retrieval Learning via Modification Text Generation
par: Zhou, Yinan, et autres
Publié: (2025)
par: Zhou, Yinan, et autres
Publié: (2025)
Turing Patterns for Multimedia: Reaction-Diffusion Multi-Modal Fusion for Language-Guided Video Moment Retrieval
par: Fang, Xiang, et autres
Publié: (2026)
par: Fang, Xiang, et autres
Publié: (2026)
From Data Deluge to Data Curation: A Filtering-WoRA Paradigm for Efficient Text-based Person Search
par: Sun, Jintao, et autres
Publié: (2024)
par: Sun, Jintao, et autres
Publié: (2024)
InsertNeRF: Instilling Generalizability into NeRF with HyperNet Modules
par: Bao, Yanqi, et autres
Publié: (2023)
par: Bao, Yanqi, et autres
Publié: (2023)
Text-guided Controllable Diffusion for Realistic Camouflage Images Generation
par: Qian, Yuhang, et autres
Publié: (2025)
par: Qian, Yuhang, et autres
Publié: (2025)
ResetEdit: Precise Text-guided Editing of Generated Image via Resettable Starting Latent
par: Wang, Hanyi, et autres
Publié: (2026)
par: Wang, Hanyi, et autres
Publié: (2026)
TOUCH: Text-guided Controllable Generation of Free-Form Hand-Object Interactions
par: Han, Guangyi, et autres
Publié: (2025)
par: Han, Guangyi, et autres
Publié: (2025)
Dysen-VDM: Empowering Dynamics-aware Text-to-Video Diffusion with LLMs
par: Fei, Hao, et autres
Publié: (2023)
par: Fei, Hao, et autres
Publié: (2023)
Zero-1-to-A: Zero-Shot One Image to Animatable Head Avatars Using Video Diffusion
par: Zhou, Zhenglin, et autres
Publié: (2025)
par: Zhou, Zhenglin, et autres
Publié: (2025)
Documents similaires
-
Composed Image Retrieval with Text Feedback via Multi-grained Uncertainty Regularization
par: Chen, Yiyang, et autres
Publié: (2022) -
Synergizing Understanding and Generation with Interleaved Analyzing-Drafting Thinking
par: Wu, Shengqiong, et autres
Publié: (2026) -
Towards Natural Language-Guided Drones: GeoText-1652 Benchmark with Spatial Relation Matching
par: Chu, Meng, et autres
Publié: (2023) -
3D Magic Mirror: Clothing Reconstruction from a Single Image via a Causal Perspective
par: Zheng, Zhedong, et autres
Publié: (2022) -
Revolutionizing Text-to-Image Retrieval as Autoregressive Token-to-Voken Generation
par: Li, Yongqi, et autres
Publié: (2024)