Omni-Attribute: Open-vocabulary Attribute Encoder for Visual Concept Personalization
Fuente:
arXiv
Salvato in:
| Autori principali: | Chen, Tsai-Shien, Siarohin, Aliaksandr, Qian, Gordon Guocheng, Wang, Kuan-Chieh Jackson, Nemchinov, Egor, Haji-Ali, Moayed, Guler, Riza Alp, Menapace, Willi, Skorokhodov, Ivan, Kag, Anil, Zhu, Jun-Yan, Tulyakov, Sergey |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
One Model, Many Budgets: Elastic Latent Interfaces for Diffusion Transformers
di: Haji-Ali, Moayed, et al.
Pubblicazione: (2026)
di: Haji-Ali, Moayed, et al.
Pubblicazione: (2026)
Hierarchical Patch Diffusion Models for High-Resolution Video Generation
di: Skorokhodov, Ivan, et al.
Pubblicazione: (2024)
di: Skorokhodov, Ivan, et al.
Pubblicazione: (2024)
Improving Progressive Generation with Decomposable Flow Matching
di: Haji-Ali, Moayed, et al.
Pubblicazione: (2025)
di: Haji-Ali, Moayed, et al.
Pubblicazione: (2025)
Sprint: Sparse-Dense Residual Fusion for Efficient Diffusion Transformers
di: Park, Dogyun, et al.
Pubblicazione: (2025)
di: Park, Dogyun, et al.
Pubblicazione: (2025)
H3AE: High Compression, High Speed, and High Quality AutoEncoder for Video Diffusion Models
di: Wu, Yushu, et al.
Pubblicazione: (2025)
di: Wu, Yushu, et al.
Pubblicazione: (2025)
DenseDPO: Fine-Grained Temporal Preference Optimization for Video Diffusion Models
di: Wu, Ziyi, et al.
Pubblicazione: (2025)
di: Wu, Ziyi, et al.
Pubblicazione: (2025)
VIMI: Grounding Video Generation through Multi-modal Instruction
di: Fang, Yuwei, et al.
Pubblicazione: (2024)
di: Fang, Yuwei, et al.
Pubblicazione: (2024)
AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation
di: Haji-Ali, Moayed, et al.
Pubblicazione: (2024)
di: Haji-Ali, Moayed, et al.
Pubblicazione: (2024)
Snap Video: Scaled Spatiotemporal Transformers for Text-to-Video Synthesis
di: Menapace, Willi, et al.
Pubblicazione: (2024)
di: Menapace, Willi, et al.
Pubblicazione: (2024)
Taming Data and Transformers for Audio Generation
di: Haji-Ali, Moayed, et al.
Pubblicazione: (2024)
di: Haji-Ali, Moayed, et al.
Pubblicazione: (2024)
ComposeMe: Attribute-Specific Image Prompts for Controllable Human Image Generation
di: Qian, Guocheng Gordon, et al.
Pubblicazione: (2025)
di: Qian, Guocheng Gordon, et al.
Pubblicazione: (2025)
AC3D: Analyzing and Improving 3D Camera Control in Video Diffusion Transformers
di: Bahmani, Sherwin, et al.
Pubblicazione: (2024)
di: Bahmani, Sherwin, et al.
Pubblicazione: (2024)
AsCAN: Asymmetric Convolution-Attention Networks for Efficient Recognition and Generation
di: Kag, Anil, et al.
Pubblicazione: (2024)
di: Kag, Anil, et al.
Pubblicazione: (2024)
AlphaFlow: Understanding and Improving MeanFlow Models
di: Zhang, Huijie, et al.
Pubblicazione: (2025)
di: Zhang, Huijie, et al.
Pubblicazione: (2025)
Dynamic Concepts Personalization from Single Videos
di: Abdal, Rameen, et al.
Pubblicazione: (2025)
di: Abdal, Rameen, et al.
Pubblicazione: (2025)
EgoEdit: Dataset, Real-Time Streaming Model, and Benchmark for Egocentric Video Editing
di: Li, Runjia, et al.
Pubblicazione: (2025)
di: Li, Runjia, et al.
Pubblicazione: (2025)
Improving the Diffusability of Autoencoders
di: Skorokhodov, Ivan, et al.
Pubblicazione: (2025)
di: Skorokhodov, Ivan, et al.
Pubblicazione: (2025)
Mind the Time: Temporally-Controlled Multi-Event Video Generation
di: Wu, Ziyi, et al.
Pubblicazione: (2024)
di: Wu, Ziyi, et al.
Pubblicazione: (2024)
Taming Diffusion Transformer for Efficient Mobile Video Generation in Seconds
di: Wu, Yushu, et al.
Pubblicazione: (2025)
di: Wu, Yushu, et al.
Pubblicazione: (2025)
SF-V: Single Forward Video Generation Model
di: Zhang, Zhixing, et al.
Pubblicazione: (2024)
di: Zhang, Zhixing, et al.
Pubblicazione: (2024)
Multi-subject Open-set Personalization in Video Generation
di: Chen, Tsai-Shien, et al.
Pubblicazione: (2025)
di: Chen, Tsai-Shien, et al.
Pubblicazione: (2025)
SPAD : Spatially Aware Multiview Diffusers
di: Kant, Yash, et al.
Pubblicazione: (2024)
di: Kant, Yash, et al.
Pubblicazione: (2024)
Promptable Game Models: Text-Guided Game Simulation via Masked Diffusion Models
di: Menapace, Willi, et al.
Pubblicazione: (2023)
di: Menapace, Willi, et al.
Pubblicazione: (2023)
AlcheMinT: Fine-grained Temporal Control for Multi-Reference Consistent Video Generation
di: Girish, Sharath, et al.
Pubblicazione: (2025)
di: Girish, Sharath, et al.
Pubblicazione: (2025)
LayerComposer: Multi-Human Personalized Generation via Layered Canvas
di: Qian, Guocheng Gordon, et al.
Pubblicazione: (2025)
di: Qian, Guocheng Gordon, et al.
Pubblicazione: (2025)
VD3D: Taming Large Video Diffusion Transformers for 3D Camera Control
di: Bahmani, Sherwin, et al.
Pubblicazione: (2024)
di: Bahmani, Sherwin, et al.
Pubblicazione: (2024)
4Real-Video: Learning Generalizable Photo-Realistic 4D Video Diffusion
di: Wang, Chaoyang, et al.
Pubblicazione: (2024)
di: Wang, Chaoyang, et al.
Pubblicazione: (2024)
4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation
di: Wang, Chaoyang, et al.
Pubblicazione: (2025)
di: Wang, Chaoyang, et al.
Pubblicazione: (2025)
Diffusion-DRF: Free, Rich, and Differentiable Reward for Video Diffusion Fine-Tuning
di: Wang, Yifan, et al.
Pubblicazione: (2026)
di: Wang, Yifan, et al.
Pubblicazione: (2026)
Panda-70M: Captioning 70M Videos with Multiple Cross-Modality Teachers
di: Chen, Tsai-Shien, et al.
Pubblicazione: (2024)
di: Chen, Tsai-Shien, et al.
Pubblicazione: (2024)
Canvas-to-Image: Compositional Image Generation with Multimodal Controls
di: Dalva, Yusuf, et al.
Pubblicazione: (2025)
di: Dalva, Yusuf, et al.
Pubblicazione: (2025)
4Real: Towards Photorealistic 4D Scene Generation via Video Diffusion Models
di: Yu, Heng, et al.
Pubblicazione: (2024)
di: Yu, Heng, et al.
Pubblicazione: (2024)
Omni-ID: Holistic Identity Representation Designed for Generative Tasks
di: Qian, Guocheng, et al.
Pubblicazione: (2024)
di: Qian, Guocheng, et al.
Pubblicazione: (2024)
Diffusion Priors for Dynamic View Synthesis from Monocular Videos
di: Wang, Chaoyang, et al.
Pubblicazione: (2024)
di: Wang, Chaoyang, et al.
Pubblicazione: (2024)
EasyV2V: A High-quality Instruction-based Video Editing Framework
di: Mai, Jinjie, et al.
Pubblicazione: (2025)
di: Mai, Jinjie, et al.
Pubblicazione: (2025)
Video Motion Transfer with Diffusion Transformers
di: Pondaven, Alexander, et al.
Pubblicazione: (2024)
di: Pondaven, Alexander, et al.
Pubblicazione: (2024)
HyperHuman: Hyper-Realistic Human Generation with Latent Structural Diffusion
di: Liu, Xian, et al.
Pubblicazione: (2023)
di: Liu, Xian, et al.
Pubblicazione: (2023)
EFlow: Fast Few-Step Video Generator Training from Scratch via Efficient Solution Flow
di: Park, Dogyun, et al.
Pubblicazione: (2026)
di: Park, Dogyun, et al.
Pubblicazione: (2026)
Context-self contrastive pretraining for crop type semantic segmentation
di: Tarasiou, Michail, et al.
Pubblicazione: (2021)
di: Tarasiou, Michail, et al.
Pubblicazione: (2021)
OmniView: An All-Seeing Diffusion Model for 3D and 4D View Synthesis
di: Fan, Xiang, et al.
Pubblicazione: (2025)
di: Fan, Xiang, et al.
Pubblicazione: (2025)
Documenti analoghi
-
One Model, Many Budgets: Elastic Latent Interfaces for Diffusion Transformers
di: Haji-Ali, Moayed, et al.
Pubblicazione: (2026) -
Hierarchical Patch Diffusion Models for High-Resolution Video Generation
di: Skorokhodov, Ivan, et al.
Pubblicazione: (2024) -
Improving Progressive Generation with Decomposable Flow Matching
di: Haji-Ali, Moayed, et al.
Pubblicazione: (2025) -
Sprint: Sparse-Dense Residual Fusion for Efficient Diffusion Transformers
di: Park, Dogyun, et al.
Pubblicazione: (2025) -
H3AE: High Compression, High Speed, and High Quality AutoEncoder for Video Diffusion Models
di: Wu, Yushu, et al.
Pubblicazione: (2025)