ASTRA: Let Arbitrary Subjects Transform in Video Editing
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Shen, Fei, Xu, Weihao, Yan, Rui, Zhang, Dong, Shu, Xiangbo, Tang, Jinhui, Zhao, Maocheng |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Locality-aware Cross-modal Correspondence Learning for Dense Audio-Visual Events Localization
par: Xing, Ling, et autres
Publié: (2024)
par: Xing, Ling, et autres
Publié: (2024)
EventCrab: Harnessing Frame and Point Synergy for Event-based Action Recognition and Beyond
par: Cao, Meiqi, et autres
Publié: (2024)
par: Cao, Meiqi, et autres
Publié: (2024)
Vision-centric Token Compression in Large Language Model
par: Xing, Ling, et autres
Publié: (2025)
par: Xing, Ling, et autres
Publié: (2025)
Spatio-temporal Decoupled Knowledge Compensator for Few-Shot Action Recognition
par: Qu, Hongyu, et autres
Publié: (2026)
par: Qu, Hongyu, et autres
Publié: (2026)
Spatiotemporal-Untrammelled Mixture of Experts for Multi-Person Motion Prediction
par: Yin, Zheng, et autres
Publié: (2025)
par: Yin, Zheng, et autres
Publié: (2025)
FTMoMamba: Motion Generation with Frequency and Text State Space Models
par: Li, Chengjian, et autres
Publié: (2024)
par: Li, Chengjian, et autres
Publié: (2024)
IMAGHarmony: Controllable Image Editing with Consistent Object Quantity and Layout
par: Shen, Fei, et autres
Publié: (2025)
par: Shen, Fei, et autres
Publié: (2025)
ASTRA: An Action Spotting TRAnsformer for Soccer Videos
par: Xarles, Artur, et autres
Publié: (2024)
par: Xarles, Artur, et autres
Publié: (2024)
ASTRA: Enhancing Multi-Subject Generation with Retrieval-Augmented Pose Guidance and Disentangled Position Embedding
par: Xia, Tianze, et autres
Publié: (2026)
par: Xia, Tianze, et autres
Publié: (2026)
R-Genie: Reasoning-Guided Generative Image Editing
par: Zhang, Dong, et autres
Publié: (2025)
par: Zhang, Dong, et autres
Publié: (2025)
OmniGaze: Reward-inspired Generalizable Gaze Estimation In The Wild
par: Qu, Hongyu, et autres
Publié: (2025)
par: Qu, Hongyu, et autres
Publié: (2025)
Attack-Augmentation Mixing-Contrastive Skeletal Representation Learning
par: Xu, Binqian, et autres
Publié: (2023)
par: Xu, Binqian, et autres
Publié: (2023)
GPT4Ego: Unleashing the Potential of Pre-trained Models for Zero-Shot Egocentric Action Recognition
par: Dai, Guangzhao, et autres
Publié: (2024)
par: Dai, Guangzhao, et autres
Publié: (2024)
TEST-V: TEst-time Support-set Tuning for Zero-shot Video Classification
par: Yan, Rui, et autres
Publié: (2025)
par: Yan, Rui, et autres
Publié: (2025)
FedMLLM: Federated Fine-tuning MLLM on Multimodal Heterogeneity Data
par: Xu, Binqian, et autres
Publié: (2024)
par: Xu, Binqian, et autres
Publié: (2024)
Mitigating Query Selection Bias in Referring Video Object Segmentation
par: Zhang, Dingwei, et autres
Publié: (2025)
par: Zhang, Dingwei, et autres
Publié: (2025)
DreamSwapV: Mask-guided Subject Swapping for Any Customized Video Editing
par: Wang, Weitao, et autres
Publié: (2025)
par: Wang, Weitao, et autres
Publié: (2025)
DIVE: Taming DINO for Subject-Driven Video Editing
par: Huang, Yi, et autres
Publié: (2024)
par: Huang, Yi, et autres
Publié: (2024)
Reasoning to Align: Implicit Reasoning in Diffusion Transformers for Video Editing
par: Li, Yan, et autres
Publié: (2026)
par: Li, Yan, et autres
Publié: (2026)
StableV2V: Stablizing Shape Consistency in Video-to-Video Editing
par: Liu, Chang, et autres
Publié: (2024)
par: Liu, Chang, et autres
Publié: (2024)
Any-to-Bokeh: Arbitrary-Subject Video Refocusing with Video Diffusion Model
par: Yang, Yang, et autres
Publié: (2025)
par: Yang, Yang, et autres
Publié: (2025)
Diverse Semantics-Guided Feature Alignment and Decoupling for Visible-Infrared Person Re-Identification
par: Dong, Neng, et autres
Publié: (2025)
par: Dong, Neng, et autres
Publié: (2025)
Embedding and Enriching Explicit Semantics for Visible-Infrared Person Re-Identification
par: Dong, Neng, et autres
Publié: (2024)
par: Dong, Neng, et autres
Publié: (2024)
MultiMotion: Multi Subject Video Motion Transfer via Video Diffusion Transformer
par: Liu, Penghui, et autres
Publié: (2025)
par: Liu, Penghui, et autres
Publié: (2025)
Let Your Video Listen to Your Music!
par: Zhang, Xinyu, et autres
Publié: (2025)
par: Zhang, Xinyu, et autres
Publié: (2025)
ColorMNet: A Memory-based Deep Spatial-Temporal Feature Propagation Network for Video Colorization
par: Yang, Yixin, et autres
Publié: (2024)
par: Yang, Yixin, et autres
Publié: (2024)
Diffusion-Guided Knowledge Distillation for Weakly-Supervised Low-Light Semantic Segmentation
par: Wang, Chunyan, et autres
Publié: (2025)
par: Wang, Chunyan, et autres
Publié: (2025)
Collaborative Feedback Discriminative Propagation for Video Super-Resolution
par: Li, Hao, et autres
Publié: (2024)
par: Li, Hao, et autres
Publié: (2024)
Video4Edit: Viewing Image Editing as a Degenerate Temporal Process
par: Li, Xiaofan, et autres
Publié: (2025)
par: Li, Xiaofan, et autres
Publié: (2025)
Discrete Wavelet Transform-Based Capsule Network for Hyperspectral Image Classification
par: Gao, Zhiqiang, et autres
Publié: (2025)
par: Gao, Zhiqiang, et autres
Publié: (2025)
AdaFPP: Adapt-Focused Bi-Propagating Prototype Learning for Panoramic Activity Recognition
par: Cao, Meiqi, et autres
Publié: (2024)
par: Cao, Meiqi, et autres
Publié: (2024)
MVP-Shot: Multi-Velocity Progressive-Alignment Framework for Few-Shot Action Recognition
par: Qu, Hongyu, et autres
Publié: (2024)
par: Qu, Hongyu, et autres
Publié: (2024)
Arbitrary Generative Video Interpolation
par: Zhang, Guozhen, et autres
Publié: (2025)
par: Zhang, Guozhen, et autres
Publié: (2025)
Kernel-Aware Graph Prompt Learning for Few-Shot Anomaly Detection
par: Tao, Fenfang, et autres
Publié: (2024)
par: Tao, Fenfang, et autres
Publié: (2024)
STAF: 3D Human Mesh Recovery from Video with Spatio-Temporal Alignment Fusion
par: Yao, Wei, et autres
Publié: (2024)
par: Yao, Wei, et autres
Publié: (2024)
VideoCoF: Unified Video Editing with Temporal Reasoner
par: Yang, Xiangpeng, et autres
Publié: (2025)
par: Yang, Xiangpeng, et autres
Publié: (2025)
FLUX-Text: A Simple and Advanced Diffusion Transformer Baseline for Scene Text Editing
par: Lan, Rui, et autres
Publié: (2025)
par: Lan, Rui, et autres
Publié: (2025)
SSR-Encoder: Encoding Selective Subject Representation for Subject-Driven Generation
par: Zhang, Yuxuan, et autres
Publié: (2023)
par: Zhang, Yuxuan, et autres
Publié: (2023)
MaskINT: Video Editing via Interpolative Non-autoregressive Masked Transformers
par: Ma, Haoyu, et autres
Publié: (2023)
par: Ma, Haoyu, et autres
Publié: (2023)
Freditor: High-Fidelity and Transferable NeRF Editing by Frequency Decomposition
par: He, Yisheng, et autres
Publié: (2024)
par: He, Yisheng, et autres
Publié: (2024)
Documents similaires
-
Locality-aware Cross-modal Correspondence Learning for Dense Audio-Visual Events Localization
par: Xing, Ling, et autres
Publié: (2024) -
EventCrab: Harnessing Frame and Point Synergy for Event-based Action Recognition and Beyond
par: Cao, Meiqi, et autres
Publié: (2024) -
Vision-centric Token Compression in Large Language Model
par: Xing, Ling, et autres
Publié: (2025) -
Spatio-temporal Decoupled Knowledge Compensator for Few-Shot Action Recognition
par: Qu, Hongyu, et autres
Publié: (2026) -
Spatiotemporal-Untrammelled Mixture of Experts for Multi-Person Motion Prediction
par: Yin, Zheng, et autres
Publié: (2025)