BlobCtrl: Taming Controllable Blob for Element-level Image Editing
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Yaowei, Li, Lingen, Zhang, Zhaoyang, Li, Xiaoyu, Wang, Guangzhi, Li, Hongxiang, Cun, Xiaodong, Shan, Ying, Zou, Yuexian |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Image Conductor: Precision Control for Interactive Video Synthesis
di: Li, Yaowei, et al.
Pubblicazione: (2024)
di: Li, Yaowei, et al.
Pubblicazione: (2024)
DiTCtrl: Exploring Attention Control in Multi-Modal Diffusion Transformer for Tuning-Free Multi-Prompt Longer Video Generation
di: Cai, Minghong, et al.
Pubblicazione: (2024)
di: Cai, Minghong, et al.
Pubblicazione: (2024)
MotionCtrl: A Unified and Flexible Motion Controller for Video Generation
di: Wang, Zhouxia, et al.
Pubblicazione: (2023)
di: Wang, Zhouxia, et al.
Pubblicazione: (2023)
FairyGen: Storied Cartoon Video from a Single Child-Drawn Character
di: Zheng, Jiayi, et al.
Pubblicazione: (2025)
di: Zheng, Jiayi, et al.
Pubblicazione: (2025)
VideoPainter: Any-length Video Inpainting and Editing with Plug-and-Play Context Control
di: Bian, Yuxuan, et al.
Pubblicazione: (2025)
di: Bian, Yuxuan, et al.
Pubblicazione: (2025)
GenCompositor: Generative Video Compositing with Diffusion Transformer
di: Yang, Shuzhou, et al.
Pubblicazione: (2025)
di: Yang, Shuzhou, et al.
Pubblicazione: (2025)
AFL-Net: Integrating Audio, Facial, and Lip Modalities with a Two-step Cross-attention for Robust Speaker Diarization in the Wild
di: Yin, Yongkang, et al.
Pubblicazione: (2023)
di: Yin, Yongkang, et al.
Pubblicazione: (2023)
Taming Flow-based I2V Models for Creative Video Editing
di: Kong, Xianghao, et al.
Pubblicazione: (2025)
di: Kong, Xianghao, et al.
Pubblicazione: (2025)
BrushEdit: All-In-One Image Inpainting and Editing
di: Li, Yaowei, et al.
Pubblicazione: (2024)
di: Li, Yaowei, et al.
Pubblicazione: (2024)
Unbiased Video Scene Graph Generation via Visual and Semantic Dual Debiasing
di: Li, Yanjun, et al.
Pubblicazione: (2025)
di: Li, Yanjun, et al.
Pubblicazione: (2025)
Visual Autoregressive Modeling for Instruction-Guided Image Editing
di: Mao, Qingyang, et al.
Pubblicazione: (2025)
di: Mao, Qingyang, et al.
Pubblicazione: (2025)
FlexiAct: Towards Flexible Action Control in Heterogeneous Scenarios
di: Zhang, Shiyi, et al.
Pubblicazione: (2025)
di: Zhang, Shiyi, et al.
Pubblicazione: (2025)
SmartFreeEdit: Mask-Free Spatial-Aware Image Editing with Complex Instruction Understanding
di: Sun, Qianqian, et al.
Pubblicazione: (2025)
di: Sun, Qianqian, et al.
Pubblicazione: (2025)
3D Gaussian Editing with A Single Image
di: Luo, Guan, et al.
Pubblicazione: (2024)
di: Luo, Guan, et al.
Pubblicazione: (2024)
LMM4Edit: Benchmarking and Evaluating Multimodal Image Editing with LMMs
di: Xu, Zitong, et al.
Pubblicazione: (2025)
di: Xu, Zitong, et al.
Pubblicazione: (2025)
ToonComposer: Streamlining Cartoon Production with Generative Post-Keyframing
di: Li, Lingen, et al.
Pubblicazione: (2025)
di: Li, Lingen, et al.
Pubblicazione: (2025)
FlowVid: Taming Imperfect Optical Flows for Consistent Video-to-Video Synthesis
di: Liang, Feng, et al.
Pubblicazione: (2023)
di: Liang, Feng, et al.
Pubblicazione: (2023)
REMAC: Reference-Based Martian Asymmetrical Image Compression
di: Ding, Qing, et al.
Pubblicazione: (2026)
di: Ding, Qing, et al.
Pubblicazione: (2026)
BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations
di: Feng, Weixi, et al.
Pubblicazione: (2025)
di: Feng, Weixi, et al.
Pubblicazione: (2025)
SmartSplat: Feature-Smart Gaussians for Scalable Compression of Ultra-High-Resolution Images
di: Li, Linfei, et al.
Pubblicazione: (2025)
di: Li, Linfei, et al.
Pubblicazione: (2025)
AI Blob! LLM-Driven Recontextualization of Italian Television Archives
di: Balestri, Roberto
Pubblicazione: (2025)
di: Balestri, Roberto
Pubblicazione: (2025)
VCoME: Verbal Video Composition with Multimodal Editing Effects
di: Gong, Weibo, et al.
Pubblicazione: (2024)
di: Gong, Weibo, et al.
Pubblicazione: (2024)
Mono3DVG-EnSD: Enhanced Spatial-aware and Dimension-decoupled Text Encoding for Monocular 3D Visual Grounding
di: Li, Yuzhen, et al.
Pubblicazione: (2025)
di: Li, Yuzhen, et al.
Pubblicazione: (2025)
CoPRS: Learning Positional Prior from Chain-of-Thought for Reasoning Segmentation
di: Lu, Zhenyu, et al.
Pubblicazione: (2025)
di: Lu, Zhenyu, et al.
Pubblicazione: (2025)
A Tri-Dynamic Preprocessing Framework for UGC Video Compression
di: Zhao, Fei, et al.
Pubblicazione: (2025)
di: Zhao, Fei, et al.
Pubblicazione: (2025)
A Preprocessing Framework for Video Machine Vision under Compression
di: Zhao, Fei, et al.
Pubblicazione: (2025)
di: Zhao, Fei, et al.
Pubblicazione: (2025)
EditHF-1M: A Million-Scale Rich Human Preference Feedback for Image Editing
di: Xu, Zitong, et al.
Pubblicazione: (2026)
di: Xu, Zitong, et al.
Pubblicazione: (2026)
SegTalker: Segmentation-based Talking Face Generation with Mask-guided Local Editing
di: Xiong, Lingyu, et al.
Pubblicazione: (2024)
di: Xiong, Lingyu, et al.
Pubblicazione: (2024)
Region-Constraint In-Context Generation for Instructional Video Editing
di: Zhang, Zhongwei, et al.
Pubblicazione: (2025)
di: Zhang, Zhongwei, et al.
Pubblicazione: (2025)
DanceCamAnimator: Keyframe-Based Controllable 3D Dance Camera Synthesis
di: Wang, Zixuan, et al.
Pubblicazione: (2024)
di: Wang, Zixuan, et al.
Pubblicazione: (2024)
IC-Custom: Diverse Image Customization via In-Context Learning
di: Li, Yaowei, et al.
Pubblicazione: (2025)
di: Li, Yaowei, et al.
Pubblicazione: (2025)
InstructVid2Vid: Controllable Video Editing with Natural Language Instructions
di: Qin, Bosheng, et al.
Pubblicazione: (2023)
di: Qin, Bosheng, et al.
Pubblicazione: (2023)
EditMGT: Unleashing Potentials of Masked Generative Transformers in Image Editing
di: Chow, Wei, et al.
Pubblicazione: (2025)
di: Chow, Wei, et al.
Pubblicazione: (2025)
ChatVTG: Video Temporal Grounding via Chat with Video Dialogue Large Language Models
di: Qu, Mengxue, et al.
Pubblicazione: (2024)
di: Qu, Mengxue, et al.
Pubblicazione: (2024)
HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer
di: Cai, Qi, et al.
Pubblicazione: (2026)
di: Cai, Qi, et al.
Pubblicazione: (2026)
Continual Panoptic Perception: Towards Multi-modal Incremental Interpretation of Remote Sensing Images
di: Yuan, Bo, et al.
Pubblicazione: (2024)
di: Yuan, Bo, et al.
Pubblicazione: (2024)
Asynchronous Blob Tracker for Event Cameras
di: Wang, Ziwei, et al.
Pubblicazione: (2023)
di: Wang, Ziwei, et al.
Pubblicazione: (2023)
Deep Shape-Texture Statistics for Completely Blind Image Quality Evaluation
di: Li, Yixuan, et al.
Pubblicazione: (2024)
di: Li, Yixuan, et al.
Pubblicazione: (2024)
StableDub: Taming Diffusion Prior for Generalized and Efficient Visual Dubbing
di: Chen, Liyang, et al.
Pubblicazione: (2025)
di: Chen, Liyang, et al.
Pubblicazione: (2025)
Patch-level Sounding Object Tracking for Audio-Visual Question Answering
di: Li, Zhangbin, et al.
Pubblicazione: (2024)
di: Li, Zhangbin, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Image Conductor: Precision Control for Interactive Video Synthesis
di: Li, Yaowei, et al.
Pubblicazione: (2024) -
DiTCtrl: Exploring Attention Control in Multi-Modal Diffusion Transformer for Tuning-Free Multi-Prompt Longer Video Generation
di: Cai, Minghong, et al.
Pubblicazione: (2024) -
MotionCtrl: A Unified and Flexible Motion Controller for Video Generation
di: Wang, Zhouxia, et al.
Pubblicazione: (2023) -
FairyGen: Storied Cartoon Video from a Single Child-Drawn Character
di: Zheng, Jiayi, et al.
Pubblicazione: (2025) -
VideoPainter: Any-length Video Inpainting and Editing with Plug-and-Play Context Control
di: Bian, Yuxuan, et al.
Pubblicazione: (2025)