MAGREF: Masked Guidance for Any-Reference Video Generation with Subject Disentanglement
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Deng, Yufan, Yin, Yuanyang, Guo, Xun, Wang, Yizhi, Fang, Jacob Zhiyuan, Yuan, Shenghai, Yang, Yiding, Wang, Angtian, Liu, Bo, Huang, Haibin, Ma, Chongyang |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
CINEMA: Coherent Multi-Subject Video Generation via MLLM-Based Guidance
par: Deng, Yufan, et autres
Publié: (2025)
par: Deng, Yufan, et autres
Publié: (2025)
ATI: Any Trajectory Instruction for Controllable Video Generation
par: Wang, Angtian, et autres
Publié: (2025)
par: Wang, Angtian, et autres
Publié: (2025)
Focal Guidance: Unlocking Controllability from Semantic-Weak Layers in Video Diffusion Models
par: Yin, Yuanyang, et autres
Publié: (2026)
par: Yin, Yuanyang, et autres
Publié: (2026)
VIVA: VLM-Guided Instruction-Based Video Editing with Reward Optimization
par: Cong, Xiaoyan, et autres
Publié: (2025)
par: Cong, Xiaoyan, et autres
Publié: (2025)
HECTOR: Hybrid Editable Compositional Object References for Video Generation
par: Zhang, Guofeng, et autres
Publié: (2026)
par: Zhang, Guofeng, et autres
Publié: (2026)
TGT: Text-Grounded Trajectories for Locally Controlled Video Generation
par: Zhang, Guofeng, et autres
Publié: (2025)
par: Zhang, Guofeng, et autres
Publié: (2025)
Helios: Real Real-Time Long Video Generation Model
par: Yuan, Shenghai, et autres
Publié: (2026)
par: Yuan, Shenghai, et autres
Publié: (2026)
OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation
par: Yuan, Shenghai, et autres
Publié: (2025)
par: Yuan, Shenghai, et autres
Publié: (2025)
DreamSwapV: Mask-guided Subject Swapping for Any Customized Video Editing
par: Wang, Weitao, et autres
Publié: (2025)
par: Wang, Weitao, et autres
Publié: (2025)
I2V-Adapter: A General Image-to-Video Adapter for Diffusion Models
par: Guo, Xun, et autres
Publié: (2023)
par: Guo, Xun, et autres
Publié: (2023)
Envision: Embodied Visual Planning via Goal-Imagery Video Diffusion
par: Gu, Yuming, et autres
Publié: (2025)
par: Gu, Yuming, et autres
Publié: (2025)
FSVideo: Fast Speed Video Diffusion Model in a Highly-Compressed Latent Space
par: FSVideo Team, et autres
Publié: (2026)
par: FSVideo Team, et autres
Publié: (2026)
Any-to-Bokeh: Arbitrary-Subject Video Refocusing with Video Diffusion Model
par: Yang, Yang, et autres
Publié: (2025)
par: Yang, Yang, et autres
Publié: (2025)
AnyStory: Towards Unified Single and Multiple Subject Personalization in Text-to-Image Generation
par: He, Junjie, et autres
Publié: (2025)
par: He, Junjie, et autres
Publié: (2025)
StoryMem: Multi-shot Long Video Storytelling with Memory
par: Zhang, Kaiwen, et autres
Publié: (2025)
par: Zhang, Kaiwen, et autres
Publié: (2025)
Refer to Any Segmentation Mask Group With Vision-Language Prompts
par: Cao, Shengcao, et autres
Publié: (2025)
par: Cao, Shengcao, et autres
Publié: (2025)
AnyID: Ultra-Fidelity Universal Identity-Preserving Video Generation from Any Visual References
par: Wang, Jiahao, et autres
Publié: (2026)
par: Wang, Jiahao, et autres
Publié: (2026)
OmniInsert: Mask-Free Video Insertion of Any Reference via Diffusion Transformer Models
par: Chen, Jinshu, et autres
Publié: (2025)
par: Chen, Jinshu, et autres
Publié: (2025)
Comp-Attn: Present-and-Align Attention for Compositional Video Generation
par: Zhang, Hongyu, et autres
Publié: (2025)
par: Zhang, Hongyu, et autres
Publié: (2025)
SFA: Scan, Focus, and Amplify toward Guidance-aware Answering for Video TextVQA
par: He, Haibin, et autres
Publié: (2025)
par: He, Haibin, et autres
Publié: (2025)
Deforming Videos to Masks: Flow Matching for Referring Video Segmentation
par: Wang, Zanyi, et autres
Publié: (2025)
par: Wang, Zanyi, et autres
Publié: (2025)
SAMTok: Representing Any Mask with Two Words
par: Zhou, Yikang, et autres
Publié: (2026)
par: Zhou, Yikang, et autres
Publié: (2026)
AnyImageNav: Any-View Geometry for Precise Last-Meter Image-Goal Navigation
par: Deng, Yijie, et autres
Publié: (2026)
par: Deng, Yijie, et autres
Publié: (2026)
Structurally Prune Anything: Any Architecture, Any Framework, Any Time
par: Wang, Xun, et autres
Publié: (2024)
par: Wang, Xun, et autres
Publié: (2024)
ASTRA: Enhancing Multi-Subject Generation with Retrieval-Augmented Pose Guidance and Disentangled Position Embedding
par: Xia, Tianze, et autres
Publié: (2026)
par: Xia, Tianze, et autres
Publié: (2026)
FreeTuner: Any Subject in Any Style with Training-free Diffusion
par: Xu, Youcan, et autres
Publié: (2024)
par: Xu, Youcan, et autres
Publié: (2024)
AnyCharV: Bootstrap Controllable Character Video Generation with Fine-to-Coarse Guidance
par: Wang, Zhao, et autres
Publié: (2025)
par: Wang, Zhao, et autres
Publié: (2025)
Proactive Guidance of Multi-Turn Conversation in Industrial Search
par: Li, Xiaoyu, et autres
Publié: (2025)
par: Li, Xiaoyu, et autres
Publié: (2025)
3D UAV Trajectory Estimation and Classification from Internet Videos via Language Model
par: Lei, Haoxiang, et autres
Publié: (2026)
par: Lei, Haoxiang, et autres
Publié: (2026)
CORE: Contrastive Masked Feature Reconstruction on Graphs
par: Bo, Jianyuan, et autres
Publié: (2025)
par: Bo, Jianyuan, et autres
Publié: (2025)
Distributed Invariant Kalman Filter for Cooperative Localization using Matrix Lie Groups
par: Zhou, Yizhi, et autres
Publié: (2024)
par: Zhou, Yizhi, et autres
Publié: (2024)
DiLA: Disentangled Latent Action World Models
par: Zhang, Tianqiu, et autres
Publié: (2026)
par: Zhang, Tianqiu, et autres
Publié: (2026)
Semantic Flow: Learning Semantic Field of Dynamic Scenes from Monocular Videos
par: Tian, Fengrui, et autres
Publié: (2024)
par: Tian, Fengrui, et autres
Publié: (2024)
AugRefer: Advancing 3D Visual Grounding via Cross-Modal Augmentation and Spatial Relation-based Referring
par: Wang, Xinyi, et autres
Publié: (2025)
par: Wang, Xinyi, et autres
Publié: (2025)
Disentangling Masked Autoencoders for Unsupervised Domain Generalization
par: Zhang, An, et autres
Publié: (2024)
par: Zhang, An, et autres
Publié: (2024)
Kaleido: Open-Sourced Multi-Subject Reference Video Generation Model
par: Zhang, Zhenxing, et autres
Publié: (2025)
par: Zhang, Zhenxing, et autres
Publié: (2025)
Compositional 4D Dynamic Scenes Understanding with Physics Priors for Video Question Answering
par: Wang, Xingrui, et autres
Publié: (2024)
par: Wang, Xingrui, et autres
Publié: (2024)
AnyEnhance: A Unified Generative Model with Prompt-Guidance and Self-Critic for Voice Enhancement
par: Zhang, Junan, et autres
Publié: (2025)
par: Zhang, Junan, et autres
Publié: (2025)
HumanNet: Scaling Human-centric Video Learning to One Million Hours
par: Deng, Yufan, et autres
Publié: (2026)
par: Deng, Yufan, et autres
Publié: (2026)
Synergising Computational and Design Thinking in Design Education: A Dual‐Process Framework to Enhancing Creativity and Appropriateness
par: Weizhen Wang, et autres
Publié: (2026)
par: Weizhen Wang, et autres
Publié: (2026)
Documents similaires
-
CINEMA: Coherent Multi-Subject Video Generation via MLLM-Based Guidance
par: Deng, Yufan, et autres
Publié: (2025) -
ATI: Any Trajectory Instruction for Controllable Video Generation
par: Wang, Angtian, et autres
Publié: (2025) -
Focal Guidance: Unlocking Controllability from Semantic-Weak Layers in Video Diffusion Models
par: Yin, Yuanyang, et autres
Publié: (2026) -
VIVA: VLM-Guided Instruction-Based Video Editing with Reward Optimization
par: Cong, Xiaoyan, et autres
Publié: (2025) -
HECTOR: Hybrid Editable Compositional Object References for Video Generation
par: Zhang, Guofeng, et autres
Publié: (2026)