MFTF: Mask-free Training-free Object Level Layout Control Diffusion Model
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Yang, Shan |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Unified Auto-Encoding with Masked Diffusion
par: Hansen-Estruch, Philippe, et autres
Publié: (2024)
par: Hansen-Estruch, Philippe, et autres
Publié: (2024)
Disrupting Diffusion: Token-Level Attention Erasure Attack against Diffusion-based Customization
par: Liu, Yisu, et autres
Publié: (2024)
par: Liu, Yisu, et autres
Publié: (2024)
SITUATE -- Synthetic Object Counting Dataset for VLM training
par: Peinl, René, et autres
Publié: (2026)
par: Peinl, René, et autres
Publié: (2026)
Demo-Pose: Depth-Monocular Modality Fusion For Object Pose Estimation
par: Agarwal, Rachit, et autres
Publié: (2026)
par: Agarwal, Rachit, et autres
Publié: (2026)
Evaluation of Environmental Conditions on Object Detection using Oriented Bounding Boxes for AR Applications
par: Li, Vladislav, et autres
Publié: (2023)
par: Li, Vladislav, et autres
Publié: (2023)
Image Segmentation and Classification of E-waste for Training Robots for Waste Segregation
par: Tripathi, Prakriti
Publié: (2025)
par: Tripathi, Prakriti
Publié: (2025)
Unsupervised Decomposition and Recombination with Discriminator-Driven Diffusion Models
par: Wang, Archer, et autres
Publié: (2026)
par: Wang, Archer, et autres
Publié: (2026)
Sora as a World Model? A Complete Survey on Text-to-Video Generation
par: Puspitasari, Fachrina Dewi, et autres
Publié: (2024)
par: Puspitasari, Fachrina Dewi, et autres
Publié: (2024)
Implicit Location-Caption Alignment via Complementary Masking for Weakly-Supervised Dense Video Captioning
par: Ge, Shiping, et autres
Publié: (2024)
par: Ge, Shiping, et autres
Publié: (2024)
FrescoDiffusion: 4K Image-to-Video with Prior-Regularized Tiled Diffusion
par: Caselles-Dupré, Hugo, et autres
Publié: (2026)
par: Caselles-Dupré, Hugo, et autres
Publié: (2026)
GenMatter: Perceiving Physical Objects with Generative Matter Models
par: Li, Eric, et autres
Publié: (2026)
par: Li, Eric, et autres
Publié: (2026)
3DCity-LLM: Empowering Multi-modality Large Language Models for 3D City-scale Perception and Understanding
par: Chen, Yiping, et autres
Publié: (2026)
par: Chen, Yiping, et autres
Publié: (2026)
EvoPrune: Early-Stage Visual Token Pruning for Efficient MLLMs
par: Chen, Yuhao, et autres
Publié: (2026)
par: Chen, Yuhao, et autres
Publié: (2026)
Fre-Res: Frequency-Residual Video Token Compression for Efficient Video MLLMs
par: Feng, Yigui, et autres
Publié: (2026)
par: Feng, Yigui, et autres
Publié: (2026)
Siamese Networks for Cat Re-Identification: Exploring Neural Models for Cat Instance Recognition
par: Trein, Tobias, et autres
Publié: (2025)
par: Trein, Tobias, et autres
Publié: (2025)
From Prompt to Production:Automating Brand-Safe Marketing Imagery with Text-to-Image Models
par: Atighehchian, Parmida, et autres
Publié: (2026)
par: Atighehchian, Parmida, et autres
Publié: (2026)
ProtoFlow: Interpretable and Robust Surgical Workflow Modeling with Learned Dynamic Scene Graph Prototypes
par: Holm, Felix, et autres
Publié: (2025)
par: Holm, Felix, et autres
Publié: (2025)
OmniVideo-R1: Reinforcing Audio-visual Reasoning with Query Intention and Modality Attention
par: Chen, Zhangquan, et autres
Publié: (2026)
par: Chen, Zhangquan, et autres
Publié: (2026)
BugNIST -- a Large Volumetric Dataset for Object Detection under Domain Shift
par: Jensen, Patrick Møller, et autres
Publié: (2023)
par: Jensen, Patrick Møller, et autres
Publié: (2023)
Efficient Image Pre-Training with Siamese Cropped Masked Autoencoders
par: Eymaël, Alexandre, et autres
Publié: (2024)
par: Eymaël, Alexandre, et autres
Publié: (2024)
A Two-Stage, Object-Centric Deep Learning Framework for Robust Exam Cheating Detection
par: Le, Van-Truong, et autres
Publié: (2026)
par: Le, Van-Truong, et autres
Publié: (2026)
Think with 3D: Geometric Imagination Grounded Spatial Reasoning from Limited Views
par: Chen, Zhangquan, et autres
Publié: (2025)
par: Chen, Zhangquan, et autres
Publié: (2025)
Appearance-based gaze estimation enhanced with synthetic images using deep neural networks
par: Herashchenko, Dmytro, et autres
Publié: (2023)
par: Herashchenko, Dmytro, et autres
Publié: (2023)
Attentive VQ-VAE
par: Hoyos, Angello, et autres
Publié: (2023)
par: Hoyos, Angello, et autres
Publié: (2023)
TexTailor: Customized Text-aligned Texturing via Effective Resampling
par: Lee, Suin, et autres
Publié: (2025)
par: Lee, Suin, et autres
Publié: (2025)
SIFThinker: Spatially-Aware Image Focus for Visual Reasoning
par: Chen, Zhangquan, et autres
Publié: (2025)
par: Chen, Zhangquan, et autres
Publié: (2025)
CLIP Embeddings for AI-Generated Image Detection: A Few-Shot Study with Lightweight Classifier
par: Ou, Ziyang
Publié: (2025)
par: Ou, Ziyang
Publié: (2025)
Rethinking Multimodal Point Cloud Completion: A Completion-by-Correction Perspective
par: Luo, Wang, et autres
Publié: (2025)
par: Luo, Wang, et autres
Publié: (2025)
CoMViT: An Efficient Vision Backbone for Supervised Classification in Medical Imaging
par: Safdar, Aon, et autres
Publié: (2025)
par: Safdar, Aon, et autres
Publié: (2025)
Next-Generation License Plate Detection and Recognition System using YOLOv8
par: Amin, Arslan, et autres
Publié: (2025)
par: Amin, Arslan, et autres
Publié: (2025)
VSI: Visual Subtitle Integration for Keyframe Selection to enhance Long Video Understanding
par: He, Jianxiang, et autres
Publié: (2025)
par: He, Jianxiang, et autres
Publié: (2025)
Instruction-based Image Editing with Planning, Reasoning, and Generation
par: Ji, Liya, et autres
Publié: (2026)
par: Ji, Liya, et autres
Publié: (2026)
Robust Visual Question Answering: Datasets, Methods, and Future Challenges
par: Ma, Jie, et autres
Publié: (2023)
par: Ma, Jie, et autres
Publié: (2023)
Scalable Face Security Vision Foundation Model for Deepfake, Diffusion, and Spoofing Detection
par: Wang, Gaojian, et autres
Publié: (2025)
par: Wang, Gaojian, et autres
Publié: (2025)
Dynamic Residual Encoding with Slide-Level Contrastive Learning for End-to-End Whole Slide Image Representation
par: Jin, Jing, et autres
Publié: (2025)
par: Jin, Jing, et autres
Publié: (2025)
Adaptive Self-Training for Object Detection
par: Vandeghen, Renaud, et autres
Publié: (2022)
par: Vandeghen, Renaud, et autres
Publié: (2022)
Multi-modal Loop Closure Detection with Foundation Models in Severely Unstructured Environments
par: Gonzalez, Laura Alejandra Encinar, et autres
Publié: (2025)
par: Gonzalez, Laura Alejandra Encinar, et autres
Publié: (2025)
Conscious Gaze: Adaptive Attention Mechanisms for Hallucination Mitigation in Vision-Language Models
par: Bu, Weijue, et autres
Publié: (2025)
par: Bu, Weijue, et autres
Publié: (2025)
Beyond Visual Understanding: Introducing PARROT-360V for Vision Language Model Benchmarking
par: Khurdula, Harsha Vardhan, et autres
Publié: (2024)
par: Khurdula, Harsha Vardhan, et autres
Publié: (2024)
CrossVLA: Cross-Paradigm Post-Training and Inference Optimization for Vision-Language-Action Models
par: Liu, Zhi
Publié: (2026)
par: Liu, Zhi
Publié: (2026)
Documents similaires
-
Unified Auto-Encoding with Masked Diffusion
par: Hansen-Estruch, Philippe, et autres
Publié: (2024) -
Disrupting Diffusion: Token-Level Attention Erasure Attack against Diffusion-based Customization
par: Liu, Yisu, et autres
Publié: (2024) -
SITUATE -- Synthetic Object Counting Dataset for VLM training
par: Peinl, René, et autres
Publié: (2026) -
Demo-Pose: Depth-Monocular Modality Fusion For Object Pose Estimation
par: Agarwal, Rachit, et autres
Publié: (2026) -
Evaluation of Environmental Conditions on Object Detection using Oriented Bounding Boxes for AR Applications
par: Li, Vladislav, et autres
Publié: (2023)