SpotActor: Training-Free Layout-Controlled Consistent Image Generation
Fuente:
arXiv
Saved in:
| Main Authors: | Wang, Jiahao, Yan, Caixia, Zhang, Weizhan, Lin, Haonan, Wang, Mengmeng, Dai, Guang, Gong, Tieliang, Sun, Hao, Wang, Jingdong |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
OneActor: Consistent Character Generation via Cluster-Conditioned Guidance
by: Wang, Jiahao, et al.
Published: (2024)
by: Wang, Jiahao, et al.
Published: (2024)
SSMG: Spatial-Semantic Map Guided Diffusion Model for Free-form Layout-to-Image Generation
by: Jia, Chengyou, et al.
Published: (2023)
by: Jia, Chengyou, et al.
Published: (2023)
Flipped Classroom: Aligning Teacher Attention with Student in Generalized Category Discovery
by: Lin, Haonan, et al.
Published: (2024)
by: Lin, Haonan, et al.
Published: (2024)
Accelerating Non-Maximum Suppression: A Graph Theory Perspective
by: Si, King-Siong, et al.
Published: (2024)
by: Si, King-Siong, et al.
Published: (2024)
Schedule Your Edit: A Simple yet Effective Diffusion Noise Schedule for Image Editing
by: Lin, Haonan, et al.
Published: (2024)
by: Lin, Haonan, et al.
Published: (2024)
DepthArb: Training-Free Depth-Arbitrated Generation for Occlusion-Robust Image Synthesis
by: Niu, Hongjin, et al.
Published: (2026)
by: Niu, Hongjin, et al.
Published: (2026)
Towards the Generalization of Multi-view Learning: An Information-theoretical Analysis
by: Wen, Wen, et al.
Published: (2025)
by: Wen, Wen, et al.
Published: (2025)
DreamSalon: A Staged Diffusion Framework for Preserving Identity-Context in Editable Face Generation
by: Lin, Haonan, et al.
Published: (2024)
by: Lin, Haonan, et al.
Published: (2024)
How Does Distribution Matching Help Domain Generalization: An Information-theoretic Analysis
by: Dong, Yuxin, et al.
Published: (2024)
by: Dong, Yuxin, et al.
Published: (2024)
Information-Theoretic Generalization Bounds of Replay-based Continual Learning
by: Wen, Wen, et al.
Published: (2025)
by: Wen, Wen, et al.
Published: (2025)
EchoShot: Multi-Shot Portrait Video Generation
by: Wang, Jiahao, et al.
Published: (2025)
by: Wang, Jiahao, et al.
Published: (2025)
AnyID: Ultra-Fidelity Universal Identity-Preserving Video Generation from Any Visual References
by: Wang, Jiahao, et al.
Published: (2026)
by: Wang, Jiahao, et al.
Published: (2026)
MVGSR: Multi-View Consistent 3D Gaussian Super-Resolution via Epipolar Guidance
by: Zhang, Kaizhe, et al.
Published: (2025)
by: Zhang, Kaizhe, et al.
Published: (2025)
Zero-Painter: Training-Free Layout Control for Text-to-Image Synthesis
by: Ohanyan, Marianna, et al.
Published: (2024)
by: Ohanyan, Marianna, et al.
Published: (2024)
TriCLIP-3D: A Unified Parameter-Efficient Framework for Tri-Modal 3D Visual Grounding based on CLIP
by: Li, Fan, et al.
Published: (2025)
by: Li, Fan, et al.
Published: (2025)
Low-Biased General Annotated Dataset Generation
by: Jiang, Dengyang, et al.
Published: (2024)
by: Jiang, Dengyang, et al.
Published: (2024)
ConsistCompose: Unified Multimodal Layout Control for Image Composition
by: Shi, Xuanke, et al.
Published: (2025)
by: Shi, Xuanke, et al.
Published: (2025)
SRA 2: Variational Autoencoder Self-Representation Alignment for Efficient Diffusion Training
by: Wang, Mengmeng, et al.
Published: (2026)
by: Wang, Mengmeng, et al.
Published: (2026)
Exploring Time Conditioning in Diffusion Generative Models from Disjoint Noisy Data Manifolds
by: Li, Liuzhuozheng, et al.
Published: (2026)
by: Li, Liuzhuozheng, et al.
Published: (2026)
InfoSAM: Fine-Tuning the Segment Anything Model from An Information-Theoretic Perspective
by: Zhang, Yuanhong, et al.
Published: (2025)
by: Zhang, Yuanhong, et al.
Published: (2025)
DynamicID: Zero-Shot Multi-ID Image Personalization with Flexible Facial Editability
by: Hu, Xirui, et al.
Published: (2025)
by: Hu, Xirui, et al.
Published: (2025)
MagicGeo: Training-Free Text-Guided Geometric Diagram Generation
by: Wang, Junxiao, et al.
Published: (2025)
by: Wang, Junxiao, et al.
Published: (2025)
Check, Locate, Rectify: A Training-Free Layout Calibration System for Text-to-Image Generation
by: Gong, Biao, et al.
Published: (2023)
by: Gong, Biao, et al.
Published: (2023)
Training-Free Layout-to-Image Generation with Marginal Attention Constraints
by: Chen, Huancheng, et al.
Published: (2024)
by: Chen, Huancheng, et al.
Published: (2024)
MA-FSAR: Multimodal Adaptation of CLIP for Few-Shot Action Recognition
by: Xing, Jiazheng, et al.
Published: (2023)
by: Xing, Jiazheng, et al.
Published: (2023)
Timestep-Aware Correction for Quantized Diffusion Models
by: Yao, Yuzhe, et al.
Published: (2024)
by: Yao, Yuzhe, et al.
Published: (2024)
Control and Realism: Best of Both Worlds in Layout-to-Image without Training
by: Li, Bonan, et al.
Published: (2025)
by: Li, Bonan, et al.
Published: (2025)
Tile Classification Based Viewport Prediction with Multi-modal Fusion Transformer
by: Zhang, Zhihao, et al.
Published: (2023)
by: Zhang, Zhihao, et al.
Published: (2023)
Spot the Error: Non-autoregressive Graphic Layout Generation with Wireframe Locator
by: Lin, Jieru, et al.
Published: (2024)
by: Lin, Jieru, et al.
Published: (2024)
SciPostLayout: A Dataset for Layout Analysis and Layout Generation of Scientific Posters
by: Tanaka, Shohei, et al.
Published: (2024)
by: Tanaka, Shohei, et al.
Published: (2024)
GraphicsDreamer: Image to 3D Generation with Physical Consistency
by: Chen, Pei, et al.
Published: (2024)
by: Chen, Pei, et al.
Published: (2024)
Training-Free Consistent Text-to-Image Generation
by: Tewel, Yoad, et al.
Published: (2024)
by: Tewel, Yoad, et al.
Published: (2024)
ToLo: A Two-Stage, Training-Free Layout-To-Image Generation Framework For High-Overlap Layouts
by: Huang, Linhao, et al.
Published: (2025)
by: Huang, Linhao, et al.
Published: (2025)
Hierarchical Self-Prompting SAM: A Prompt-Free Medical Image Segmentation Framework
by: Zhang, Mengmeng, et al.
Published: (2025)
by: Zhang, Mengmeng, et al.
Published: (2025)
Visual Object Tracking across Diverse Data Modalities: A Review
by: Wang, Mengmeng, et al.
Published: (2024)
by: Wang, Mengmeng, et al.
Published: (2024)
BachVid: Training-Free Video Generation with Consistent Background and Character
by: Yan, Han, et al.
Published: (2025)
by: Yan, Han, et al.
Published: (2025)
IMAGHarmony: Controllable Image Editing with Consistent Object Quantity and Layout
by: Shen, Fei, et al.
Published: (2025)
by: Shen, Fei, et al.
Published: (2025)
MotionWeaver: Holistic 4D-Anchored Framework for Multi-Humanoid Image Animation
by: Hu, Xirui, et al.
Published: (2026)
by: Hu, Xirui, et al.
Published: (2026)
No Other Representation Component Is Needed: Diffusion Transformers Can Provide Representation Guidance by Themselves
by: Jiang, Dengyang, et al.
Published: (2025)
by: Jiang, Dengyang, et al.
Published: (2025)
Deforming Videos to Masks: Flow Matching for Referring Video Segmentation
by: Wang, Zanyi, et al.
Published: (2025)
by: Wang, Zanyi, et al.
Published: (2025)
Similar Items
-
OneActor: Consistent Character Generation via Cluster-Conditioned Guidance
by: Wang, Jiahao, et al.
Published: (2024) -
SSMG: Spatial-Semantic Map Guided Diffusion Model for Free-form Layout-to-Image Generation
by: Jia, Chengyou, et al.
Published: (2023) -
Flipped Classroom: Aligning Teacher Attention with Student in Generalized Category Discovery
by: Lin, Haonan, et al.
Published: (2024) -
Accelerating Non-Maximum Suppression: A Graph Theory Perspective
by: Si, King-Siong, et al.
Published: (2024) -
Schedule Your Edit: A Simple yet Effective Diffusion Noise Schedule for Image Editing
by: Lin, Haonan, et al.
Published: (2024)