MoGen: A Unified Collaborative Framework for Controllable Multi-Object Image Generation
Fuente:
arXiv
Saved in:
| Main Authors: | Li, Yanfeng, Sun, Yue, Fu, Keren, Im, Sio-Kei, Liu, Xiaoming, Zhai, Guangtao, Liu, Xiaohong, Tan, Tao |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Samba+: General and Accurate Salient Object Detection via A More Unified Mamba-based Framework
by: Zhao, Wenzhuo, et al.
Published: (2026)
by: Zhao, Wenzhuo, et al.
Published: (2026)
X-MoGen: Unified Motion Generation across Humans and Animals
by: Wang, Xuan, et al.
Published: (2025)
by: Wang, Xuan, et al.
Published: (2025)
MoEdit: On Learning Quantity Perception for Multi-object Image Editing
by: Li, Yanfeng, et al.
Published: (2025)
by: Li, Yanfeng, et al.
Published: (2025)
Consolidating Diffusion-Generated Video Detection with Unified Multimodal Forgery Learning
by: Liu, Xiaohong, et al.
Published: (2025)
by: Liu, Xiaohong, et al.
Published: (2025)
Re$^2$MoGen: Open-Vocabulary Motion Generation via LLM Reasoning and Physics-Aware Refinement
by: Zheng, Jiakun, et al.
Published: (2026)
by: Zheng, Jiakun, et al.
Published: (2026)
Face2QR: A Unified Framework for Aesthetic, Face-Preserving, and Scannable QR Code Generation
by: Cui, Xuehao, et al.
Published: (2024)
by: Cui, Xuehao, et al.
Published: (2024)
Charting the Path Forward: CT Image Quality Assessment -- An In-Depth Review
by: Xun, Siyi, et al.
Published: (2024)
by: Xun, Siyi, et al.
Published: (2024)
LayerT2V: A Unified Multi-Layer Video Generation Framework
by: Li, Guangzhao, et al.
Published: (2025)
by: Li, Guangzhao, et al.
Published: (2025)
FUMO: Prior-Modulated Diffusion for Single Image Reflection Removal
by: Xu, Telang, et al.
Published: (2026)
by: Xu, Telang, et al.
Published: (2026)
Generating pivot Gray codes for spanning trees of complete graphs in constant amortized time
by: Liu, Bowie, et al.
Published: (2025)
by: Liu, Bowie, et al.
Published: (2025)
Enhancing Test Time Adaptation with Few-shot Guidance
by: Luo, Siqi, et al.
Published: (2024)
by: Luo, Siqi, et al.
Published: (2024)
A$^2$-Edit: Precise Reference-Guided Image Editing of Arbitrary Objects and Ambiguous Masks
by: Zheng, Huayu, et al.
Published: (2026)
by: Zheng, Huayu, et al.
Published: (2026)
On Learning Multi-Modal Forgery Representation for Diffusion Generated Video Detection
by: Song, Xiufeng, et al.
Published: (2024)
by: Song, Xiufeng, et al.
Published: (2024)
HiSum: Hierarchical Topic‐Driven Approach for Role‐Oriented Dialogue Summarisation
by: Keyan Jin, et al.
Published: (2025)
by: Keyan Jin, et al.
Published: (2025)
A Unified Non-Parametric and Interpretable Point Cloud Analysis via t-FCW Graph Representation
by: Lai, Haijian, et al.
Published: (2026)
by: Lai, Haijian, et al.
Published: (2026)
EEmo-Logic: A Unified Dataset and Multi-Stage Framework for Comprehensive Image-Evoked Emotion Assessment
by: Gao, Lancheng, et al.
Published: (2026)
by: Gao, Lancheng, et al.
Published: (2026)
Omni$^2$: Unifying Omnidirectional Image Generation and Editing in an Omni Model
by: Yang, Liu, et al.
Published: (2025)
by: Yang, Liu, et al.
Published: (2025)
TSNN: A Non-parametric and Interpretable Framework for Traffic Time Series Forecasting
by: Liu, Bowen, et al.
Published: (2026)
by: Liu, Bowen, et al.
Published: (2026)
AttentionLut: Attention Fusion-based Canonical Polyadic LUT for Real-time Image Enhancement
by: Fu, Kang, et al.
Published: (2024)
by: Fu, Kang, et al.
Published: (2024)
Multi-Dimensional Quality Assessment for Text-to-3D Assets: Dataset and Model
by: Fu, Kang, et al.
Published: (2025)
by: Fu, Kang, et al.
Published: (2025)
Vision-Language Consistency Guided Multi-modal Prompt Learning for Blind AI Generated Image Quality Assessment
by: Fu, Jun, et al.
Published: (2024)
by: Fu, Jun, et al.
Published: (2024)
REF-VLM: Triplet-Based Referring Paradigm for Unified Visual Decoding
by: Tai, Yan, et al.
Published: (2025)
by: Tai, Yan, et al.
Published: (2025)
Low-Light Image Enhancement via Generative Perceptual Priors
by: Zhou, Han, et al.
Published: (2024)
by: Zhou, Han, et al.
Published: (2024)
Category-wise Fine-Tuning: Resisting Incorrect Pseudo-Labels in Multi-Label Image Classification with Partial Labels
by: Chong, Chak Fong, et al.
Published: (2024)
by: Chong, Chak Fong, et al.
Published: (2024)
HiFi-Mesh: High-Fidelity Efficient 3D Mesh Generation via Compact Autoregressive Dependence
by: Li, Yanfeng, et al.
Published: (2026)
by: Li, Yanfeng, et al.
Published: (2026)
DiffStega: Towards Universal Training-Free Coverless Image Steganography with Diffusion Models
by: Yang, Yiwei, et al.
Published: (2024)
by: Yang, Yiwei, et al.
Published: (2024)
Towards Effective User Attribution for Latent Diffusion Models via Watermark-Informed Blending
by: Pan, Yongyang, et al.
Published: (2024)
by: Pan, Yongyang, et al.
Published: (2024)
AMIF: Authorizable Medical Image Fusion Model with Built-in Authentication
by: Song, Jie, et al.
Published: (2026)
by: Song, Jie, et al.
Published: (2026)
Learning Hazing to Dehazing: Towards Realistic Haze Generation for Real-World Image Dehazing
by: Wang, Ruiyi, et al.
Published: (2025)
by: Wang, Ruiyi, et al.
Published: (2025)
GLARE: Low Light Image Enhancement via Generative Latent Feature based Codebook Retrieval
by: Zhou, Han, et al.
Published: (2024)
by: Zhou, Han, et al.
Published: (2024)
ManipShield: A Unified Framework for Image Manipulation Detection, Localization and Explanation
by: Xu, Zitong, et al.
Published: (2025)
by: Xu, Zitong, et al.
Published: (2025)
Adaptive Quantum Scaling Model for Histogram Distribution-based Quantum Watermarking
by: Xing, Zheng, et al.
Published: (2025)
by: Xing, Zheng, et al.
Published: (2025)
Resolution-Agnostic Neural Compression for High-Fidelity Portrait Video Conferencing via Implicit Radiance Fields
by: Li, Yifei, et al.
Published: (2024)
by: Li, Yifei, et al.
Published: (2024)
Text2QR: Harmonizing Aesthetic Customization and Scanning Robustness for Text-Guided QR Code Generation
by: Wu, Guangyang, et al.
Published: (2024)
by: Wu, Guangyang, et al.
Published: (2024)
Rethinking Vision-Language Model in Face Forensics: Multi-Modal Interpretable Forged Face Detector
by: Guo, Xiao, et al.
Published: (2025)
by: Guo, Xiao, et al.
Published: (2025)
HazeCLIP: Towards Language Guided Real-World Image Dehazing
by: Wang, Ruiyi, et al.
Published: (2024)
by: Wang, Ruiyi, et al.
Published: (2024)
UniMo: Unifying 2D Video and 3D Human Motion with an Autoregressive Framework
by: Pang, Youxin, et al.
Published: (2025)
by: Pang, Youxin, et al.
Published: (2025)
UNQA: Unified No-Reference Quality Assessment for Audio, Image, Video, and Audio-Visual Content
by: Cao, Yuqin, et al.
Published: (2024)
by: Cao, Yuqin, et al.
Published: (2024)
Reasoning or Not? A Comprehensive Evaluation of Reasoning LLMs for Dialogue Summarization
by: Jin, Keyan, et al.
Published: (2025)
by: Jin, Keyan, et al.
Published: (2025)
Language-guided Hierarchical Fine-grained Image Forgery Detection and Localization
by: Guo, Xiao, et al.
Published: (2024)
by: Guo, Xiao, et al.
Published: (2024)
Similar Items
-
Samba+: General and Accurate Salient Object Detection via A More Unified Mamba-based Framework
by: Zhao, Wenzhuo, et al.
Published: (2026) -
X-MoGen: Unified Motion Generation across Humans and Animals
by: Wang, Xuan, et al.
Published: (2025) -
MoEdit: On Learning Quantity Perception for Multi-object Image Editing
by: Li, Yanfeng, et al.
Published: (2025) -
Consolidating Diffusion-Generated Video Detection with Unified Multimodal Forgery Learning
by: Liu, Xiaohong, et al.
Published: (2025) -
Re$^2$MoGen: Open-Vocabulary Motion Generation via LLM Reasoning and Physics-Aware Refinement
by: Zheng, Jiakun, et al.
Published: (2026)