A Unified and Controllable Framework for Layered Image Generation with Visual Effects
Fuente:
arXiv
Guardado en:
| Autores principales: | Yang, Jinrui, Liu, Qing, Li, Yijun, Ren, Mengwei, Zhang, Letian, Lin, Zhe, Xie, Cihang, Zhou, Yuyin |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Generative Image Layer Decomposition with Visual Effects
por: Yang, Jinrui, et al.
Publicado: (2024)
por: Yang, Jinrui, et al.
Publicado: (2024)
GPT-IMAGE-EDIT-1.5M: A Million-Scale, GPT-Generated Image Dataset
por: Wang, Yuhan, et al.
Publicado: (2025)
por: Wang, Yuhan, et al.
Publicado: (2025)
OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning
por: Liu, Yanqing, et al.
Publicado: (2025)
por: Liu, Yanqing, et al.
Publicado: (2025)
Scaling White-Box Transformers for Vision
por: Yang, Jinrui, et al.
Publicado: (2024)
por: Yang, Jinrui, et al.
Publicado: (2024)
$\texttt{Complex-Edit}$: CoT-Like Instruction Generation for Complexity-Controllable Image Editing Benchmark
por: Yang, Siwei, et al.
Publicado: (2025)
por: Yang, Siwei, et al.
Publicado: (2025)
LayerFusion: Harmonized Multi-Layer Text-to-Image Generation with Generative Priors
por: Dalva, Yusuf, et al.
Publicado: (2024)
por: Dalva, Yusuf, et al.
Publicado: (2024)
Sculpting Holistic 3D Representation in Contrastive Language-Image-3D Pre-training
por: Gao, Yipeng, et al.
Publicado: (2023)
por: Gao, Yipeng, et al.
Publicado: (2023)
How Long Can Unified Multimodal Models Generate Images Reliably? Taming Long-Horizon Interleaved Image Generation via Context Curation
por: Chen, Haoyu, et al.
Publicado: (2026)
por: Chen, Haoyu, et al.
Publicado: (2026)
Scaling Laws in Patchification: An Image Is Worth 50,176 Tokens And More
por: Wang, Feng, et al.
Publicado: (2025)
por: Wang, Feng, et al.
Publicado: (2025)
ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation
por: Peng, Cihang, et al.
Publicado: (2025)
por: Peng, Cihang, et al.
Publicado: (2025)
Story-Iter: A Training-free Iterative Paradigm for Long Story Visualization
por: Mao, Jiawei, et al.
Publicado: (2024)
por: Mao, Jiawei, et al.
Publicado: (2024)
Decoupled Residual Denoising Diffusion Models for Unified and Data Efficient Image-to-Image Translation
por: Lin, Ziyue, et al.
Publicado: (2026)
por: Lin, Ziyue, et al.
Publicado: (2026)
HQ-Edit: A High-Quality Dataset for Instruction-based Image Editing
por: Hui, Mude, et al.
Publicado: (2024)
por: Hui, Mude, et al.
Publicado: (2024)
EditVerse: Unifying Image and Video Editing and Generation with In-Context Learning
por: Ju, Xuan, et al.
Publicado: (2025)
por: Ju, Xuan, et al.
Publicado: (2025)
3D-TransUNet for Brain Metastases Segmentation in the BraTS2023 Challenge
por: Yang, Siwei, et al.
Publicado: (2024)
por: Yang, Siwei, et al.
Publicado: (2024)
What If We Recaption Billions of Web Images with LLaMA-3?
por: Li, Xianhang, et al.
Publicado: (2024)
por: Li, Xianhang, et al.
Publicado: (2024)
Kestrel: Grounding Self-Refinement for LVLM Hallucination Mitigation
por: Mao, Jiawei, et al.
Publicado: (2026)
por: Mao, Jiawei, et al.
Publicado: (2026)
Mamba-R: Vision Mamba ALSO Needs Registers
por: Wang, Feng, et al.
Publicado: (2024)
por: Wang, Feng, et al.
Publicado: (2024)
Medical Vision Generalist: Unifying Medical Imaging Tasks in Context
por: Ren, Sucheng, et al.
Publicado: (2024)
por: Ren, Sucheng, et al.
Publicado: (2024)
M-VAR: Decoupled Scale-wise Autoregressive Modeling for High-Quality Image Generation
por: Ren, Sucheng, et al.
Publicado: (2024)
por: Ren, Sucheng, et al.
Publicado: (2024)
Adventurer: Optimizing Vision Mamba Architecture Designs for Efficiency
por: Wang, Feng, et al.
Publicado: (2024)
por: Wang, Feng, et al.
Publicado: (2024)
ARFlow: Autoregressive Flow with Hybrid Linear Attention
por: Hui, Mude, et al.
Publicado: (2025)
por: Hui, Mude, et al.
Publicado: (2025)
Rejuvenating image-GPT as Strong Visual Representation Learners
por: Ren, Sucheng, et al.
Publicado: (2023)
por: Ren, Sucheng, et al.
Publicado: (2023)
Filter & Align: Leveraging Human Knowledge to Curate Image-Text Data
por: Zhang, Lei, et al.
Publicado: (2023)
por: Zhang, Lei, et al.
Publicado: (2023)
Both Semantics and Reconstruction Matter: Making Representation Encoders Ready for Text-to-Image Generation and Editing
por: Zhang, Shilong, et al.
Publicado: (2025)
por: Zhang, Shilong, et al.
Publicado: (2025)
Omni-MMSI: Toward Identity-attributed Social Interaction Understanding
por: Li, Xinpeng, et al.
Publicado: (2026)
por: Li, Xinpeng, et al.
Publicado: (2026)
HBridge: H-Shape Bridging of Heterogeneous Experts for Unified Multimodal Understanding and Generation
por: Wang, Xiang, et al.
Publicado: (2025)
por: Wang, Xiang, et al.
Publicado: (2025)
MedTrinity-25M: A Large-scale Multimodal Dataset with Multigranular Annotations for Medicine
por: Xie, Yunfei, et al.
Publicado: (2024)
por: Xie, Yunfei, et al.
Publicado: (2024)
L2B: Learning to Bootstrap Robust Models for Combating Label Noise
por: Zhou, Yuyin, et al.
Publicado: (2022)
por: Zhou, Yuyin, et al.
Publicado: (2022)
Text-Animator: Controllable Visual Text Video Generation
por: Liu, Lin, et al.
Publicado: (2024)
por: Liu, Lin, et al.
Publicado: (2024)
Omni-Effects: Unified and Spatially-Controllable Visual Effects Generation
por: Mao, Fangyuan, et al.
Publicado: (2025)
por: Mao, Fangyuan, et al.
Publicado: (2025)
Double Visual Defense: Adversarial Pre-training and Instruction Tuning for Improving Vision-Language Model Robustness
por: Wang, Zeyu, et al.
Publicado: (2025)
por: Wang, Zeyu, et al.
Publicado: (2025)
CLIPS: An Enhanced CLIP Framework for Learning with Synthetic Captions
por: Liu, Yanqing, et al.
Publicado: (2024)
por: Liu, Yanqing, et al.
Publicado: (2024)
CAST: Modeling Visual State Transitions for Consistent Video Retrieval
por: Liu, Yanqing, et al.
Publicado: (2026)
por: Liu, Yanqing, et al.
Publicado: (2026)
LightFusion: A Light-weighted, Double Fusion Framework for Unified Multimodal Understanding and Generation
por: Wang, Zeyu, et al.
Publicado: (2025)
por: Wang, Zeyu, et al.
Publicado: (2025)
MedFrameQA: A Multi-Image Medical VQA Benchmark for Clinical Reasoning
por: Yu, Suhao, et al.
Publicado: (2025)
por: Yu, Suhao, et al.
Publicado: (2025)
A Comprehensive Analysis of Mamba for 3D Volumetric Medical Image Segmentation
por: Wang, Chaohan, et al.
Publicado: (2025)
por: Wang, Chaohan, et al.
Publicado: (2025)
MG-MotionLLM: A Unified Framework for Motion Comprehension and Generation across Multiple Granularities
por: Wu, Bizhu, et al.
Publicado: (2025)
por: Wu, Bizhu, et al.
Publicado: (2025)
CoDA: From Text-to-Image Diffusion Models to Training-Free Dataset Distillation
por: Zhou, Letian, et al.
Publicado: (2025)
por: Zhou, Letian, et al.
Publicado: (2025)
Baking Gaussian Splatting into Diffusion Denoiser for Fast and Scalable Single-stage Image-to-3D Generation and Reconstruction
por: Cai, Yuanhao, et al.
Publicado: (2024)
por: Cai, Yuanhao, et al.
Publicado: (2024)
Ejemplares similares
-
Generative Image Layer Decomposition with Visual Effects
por: Yang, Jinrui, et al.
Publicado: (2024) -
GPT-IMAGE-EDIT-1.5M: A Million-Scale, GPT-Generated Image Dataset
por: Wang, Yuhan, et al.
Publicado: (2025) -
OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning
por: Liu, Yanqing, et al.
Publicado: (2025) -
Scaling White-Box Transformers for Vision
por: Yang, Jinrui, et al.
Publicado: (2024) -
$\texttt{Complex-Edit}$: CoT-Like Instruction Generation for Complexity-Controllable Image Editing Benchmark
por: Yang, Siwei, et al.
Publicado: (2025)