UniVST: A Unified Framework for Training-free Localized Video Style Transfer
Fuente:
arXiv
Guardado en:
| Autores principales: | Song, Quanjian, Lin, Mingbao, Zhan, Wengyi, Yan, Shuicheng, Cao, Liujuan, Ji, Rongrong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
DiffusionTrend: A Minimalist Approach to Virtual Fashion Try-On
por: Zhan, Wengyi, et al.
Publicado: (2024)
por: Zhan, Wengyi, et al.
Publicado: (2024)
CutDiffusion: A Simple, Fast, Cheap, and Strong Diffusion Extrapolation Method
por: Lin, Mingbao, et al.
Publicado: (2024)
por: Lin, Mingbao, et al.
Publicado: (2024)
UniPTS: A Unified Framework for Proficient Post-Training Sparsity
por: Xie, Jingjing, et al.
Publicado: (2024)
por: Xie, Jingjing, et al.
Publicado: (2024)
Parallel Vision Token Scheduling for Fast and Accurate Multimodal LMMs Inference
por: Zhan, Wengyi, et al.
Publicado: (2025)
por: Zhan, Wengyi, et al.
Publicado: (2025)
AccDiffusion v2: Towards More Accurate Higher-Resolution Diffusion Extrapolation
por: Lin, Zhihang, et al.
Publicado: (2024)
por: Lin, Zhihang, et al.
Publicado: (2024)
LightMotion: A Light and Tuning-free Method for Simulating Camera Motion in Video Generation
por: Song, Quanjian, et al.
Publicado: (2025)
por: Song, Quanjian, et al.
Publicado: (2025)
AnySR: Realizing Image Super-Resolution as Any-Scale, Any-Resource
por: Zhan, Wengyi, et al.
Publicado: (2024)
por: Zhan, Wengyi, et al.
Publicado: (2024)
ObjectAdd: Adding Objects into Image via a Training-Free Diffusion Modification Fashion
por: Zhang, Ziyue, et al.
Publicado: (2024)
por: Zhang, Ziyue, et al.
Publicado: (2024)
EasyInv: Toward Fast and Better DDIM Inversion
por: Zhang, Ziyue, et al.
Publicado: (2024)
por: Zhang, Ziyue, et al.
Publicado: (2024)
Advancing Multimodal Large Language Models with Quantization-Aware Scale Learning for Efficient Adaptation
por: Xie, Jingjing, et al.
Publicado: (2024)
por: Xie, Jingjing, et al.
Publicado: (2024)
FashionChameleon: Towards Real-Time and Interactive Human-Garment Video Customization
por: Song, Quanjian, et al.
Publicado: (2026)
por: Song, Quanjian, et al.
Publicado: (2026)
AccDiffusion: An Accurate Method for Higher-Resolution Image Generation
por: Lin, Zhihang, et al.
Publicado: (2024)
por: Lin, Zhihang, et al.
Publicado: (2024)
HUWSOD: Holistic Self-training for Unified Weakly Supervised Object Detection
por: Cao, Liujuan, et al.
Publicado: (2024)
por: Cao, Liujuan, et al.
Publicado: (2024)
StyDeco: Unsupervised Style Transfer with Distilling Priors and Semantic Decoupling
por: Yang, Yuanlin, et al.
Publicado: (2025)
por: Yang, Yuanlin, et al.
Publicado: (2025)
Boosting Multimodal Large Language Models with Visual Tokens Withdrawal for Rapid Inference
por: Lin, Zhihang, et al.
Publicado: (2024)
por: Lin, Zhihang, et al.
Publicado: (2024)
Purifying, Labeling, and Utilizing: A High-Quality Pipeline for Small Object Detection
por: Wang, Siwei, et al.
Publicado: (2025)
por: Wang, Siwei, et al.
Publicado: (2025)
I&S-ViT: An Inclusive & Stable Method for Pushing the Limit of Post-Training ViTs Quantization
por: Zhong, Yunshan, et al.
Publicado: (2023)
por: Zhong, Yunshan, et al.
Publicado: (2023)
What You Perceive Is What You Conceive: A Cognition-Inspired Framework for Open Vocabulary Image Segmentation
por: Lin, Jianghang, et al.
Publicado: (2025)
por: Lin, Jianghang, et al.
Publicado: (2025)
Spatial Re-parameterization for N:M Sparsity
por: Zhang, Yuxin, et al.
Publicado: (2023)
por: Zhang, Yuxin, et al.
Publicado: (2023)
Test-Time Temporal Sampling for Efficient MLLM Video Understanding
por: Wang, Kaibin, et al.
Publicado: (2025)
por: Wang, Kaibin, et al.
Publicado: (2025)
Depth-Guided Semi-Supervised Instance Segmentation
por: Chen, Xin, et al.
Publicado: (2024)
por: Chen, Xin, et al.
Publicado: (2024)
Inter2Former: Dynamic Hybrid Attention for Efficient High-Precision Interactive
por: Huang, You, et al.
Publicado: (2025)
por: Huang, You, et al.
Publicado: (2025)
HRSeg: High-Resolution Visual Perception and Enhancement for Reasoning Segmentation
por: Lin, Weihuang, et al.
Publicado: (2025)
por: Lin, Weihuang, et al.
Publicado: (2025)
SynergyAmodal: Deocclude Anything with Text Control
por: Li, Xinyang, et al.
Publicado: (2025)
por: Li, Xinyang, et al.
Publicado: (2025)
S$^2$Teacher: Step-by-step Teacher for Sparsely Annotated Oriented Object Detection
por: Lin, Yu, et al.
Publicado: (2025)
por: Lin, Yu, et al.
Publicado: (2025)
UniBioTransfer: A Unified Framework for Multiple Biometrics Transfer
por: Sun, Caiyi, et al.
Publicado: (2026)
por: Sun, Caiyi, et al.
Publicado: (2026)
LocalStyleFool: Regional Video Style Transfer Attack Using Segment Anything Model
por: Cao, Yuxin, et al.
Publicado: (2024)
por: Cao, Yuxin, et al.
Publicado: (2024)
DiffusionFace: Towards a Comprehensive Dataset for Diffusion-Based Face Forgery Analysis
por: Chen, Zhongxi, et al.
Publicado: (2024)
por: Chen, Zhongxi, et al.
Publicado: (2024)
Pseudo-Label Quality Decoupling and Correction for Semi-Supervised Instance Segmentation
por: Lin, Jianghang, et al.
Publicado: (2025)
por: Lin, Jianghang, et al.
Publicado: (2025)
FocSAM: Delving Deeply into Focused Objects in Segmenting Anything
por: Huang, You, et al.
Publicado: (2024)
por: Huang, You, et al.
Publicado: (2024)
GOI: Find 3D Gaussians of Interest with an Optimizable Open-vocabulary Semantic-space Hyperplane
por: Qu, Yansong, et al.
Publicado: (2024)
por: Qu, Yansong, et al.
Publicado: (2024)
HRSAM: Efficient Interactive Segmentation in High-Resolution Images
por: Huang, You, et al.
Publicado: (2024)
por: Huang, You, et al.
Publicado: (2024)
Knowing Where to Focus: Attention-Guided Alignment for Text-based Person Search
por: Tan, Lei, et al.
Publicado: (2024)
por: Tan, Lei, et al.
Publicado: (2024)
PartFormer: Awakening Latent Diverse Representation from Vision Transformer for Object Re-Identification
por: Tan, Lei, et al.
Publicado: (2024)
por: Tan, Lei, et al.
Publicado: (2024)
More Clear, More Flexible, More Precise: A Comprehensive Oriented Object Detection benchmark for UAV
por: Ye, Kai, et al.
Publicado: (2025)
por: Ye, Kai, et al.
Publicado: (2025)
WorldWander: Bridging Egocentric and Exocentric Worlds in Video Generation
por: Song, Quanjian, et al.
Publicado: (2025)
por: Song, Quanjian, et al.
Publicado: (2025)
UniMMVSR: A Unified Multi-Modal Framework for Cascaded Video Super-Resolution
por: Du, Shian, et al.
Publicado: (2025)
por: Du, Shian, et al.
Publicado: (2025)
HieraVid: Hierarchical Token Pruning for Fast Video Large Language Models
por: Guo, Yansong, et al.
Publicado: (2026)
por: Guo, Yansong, et al.
Publicado: (2026)
PixDLM: A Dual-Path Multimodal Language Model for UAV Reasoning Segmentation
por: Ke, Shuyan, et al.
Publicado: (2026)
por: Ke, Shuyan, et al.
Publicado: (2026)
Seeing World Dynamics in a Nutshell
por: Shen, Qiuhong, et al.
Publicado: (2025)
por: Shen, Qiuhong, et al.
Publicado: (2025)
Ejemplares similares
-
DiffusionTrend: A Minimalist Approach to Virtual Fashion Try-On
por: Zhan, Wengyi, et al.
Publicado: (2024) -
CutDiffusion: A Simple, Fast, Cheap, and Strong Diffusion Extrapolation Method
por: Lin, Mingbao, et al.
Publicado: (2024) -
UniPTS: A Unified Framework for Proficient Post-Training Sparsity
por: Xie, Jingjing, et al.
Publicado: (2024) -
Parallel Vision Token Scheduling for Fast and Accurate Multimodal LMMs Inference
por: Zhan, Wengyi, et al.
Publicado: (2025) -
AccDiffusion v2: Towards More Accurate Higher-Resolution Diffusion Extrapolation
por: Lin, Zhihang, et al.
Publicado: (2024)