RASA: Replace Anyone, Say Anything -- A Training-Free Framework for Audio-Driven and Universal Portrait Video Editing
Fuente:
arXiv
Guardado en:
| Autores principales: | Pan, Tianrui, Liu, Lin, Liu, Jie, Zhang, Xiaopeng, Tang, Jie, Wu, Gangshan, Tian, Qi |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
In-the-wild Audio Spatialization with Flexible Text-guided Localization
por: Pan, Tianrui, et al.
Publicado: (2025)
por: Pan, Tianrui, et al.
Publicado: (2025)
RAVSS: Robust Audio-Visual Speech Separation in Multi-Speaker Scenarios with Missing Visual Cues
por: Pan, Tianrui, et al.
Publicado: (2024)
por: Pan, Tianrui, et al.
Publicado: (2024)
Towards Practical Real-Time Low-Latency Music Source Separation
por: Wu, Junyu, et al.
Publicado: (2025)
por: Wu, Junyu, et al.
Publicado: (2025)
SayAnything: Audio-Driven Lip Synchronization with Conditional Video Diffusion
por: Ma, Junxian, et al.
Publicado: (2025)
por: Ma, Junxian, et al.
Publicado: (2025)
Replace Anyone in Videos
por: Wang, Xiang, et al.
Publicado: (2024)
por: Wang, Xiang, et al.
Publicado: (2024)
CATANet: Efficient Content-Aware Token Aggregation for Lightweight Image Super-Resolution
por: Liu, Xin, et al.
Publicado: (2025)
por: Liu, Xin, et al.
Publicado: (2025)
Pure-Pass: Fine-Grained, Adaptive Masking for Dynamic Token-Mixing Routing in Lightweight Image Super-Resolution
por: Wu, Junyu, et al.
Publicado: (2025)
por: Wu, Junyu, et al.
Publicado: (2025)
FlowPortrait: Reinforcement Learning for Audio-Driven Portrait Video Generation
por: Tan, Weiting, et al.
Publicado: (2026)
por: Tan, Weiting, et al.
Publicado: (2026)
Reasoning to Align: Implicit Reasoning in Diffusion Transformers for Video Editing
por: Li, Yan, et al.
Publicado: (2026)
por: Li, Yan, et al.
Publicado: (2026)
AnomalyR1: A GRPO-based End-to-end MLLM for Industrial Anomaly Detection
por: Chao, Yuhao, et al.
Publicado: (2025)
por: Chao, Yuhao, et al.
Publicado: (2025)
PerformRecast: Expression and Head Pose Disentanglement for Portrait Video Editing
por: Liang, Jiadong, et al.
Publicado: (2026)
por: Liang, Jiadong, et al.
Publicado: (2026)
EMO: Emote Portrait Alive -- Generating Expressive Portrait Videos with Audio2Video Diffusion Model under Weak Conditions
por: Tian, Linrui, et al.
Publicado: (2024)
por: Tian, Linrui, et al.
Publicado: (2024)
Sketch and Refine: Towards Fast and Accurate Lane Detection
por: Chen, Chao, et al.
Publicado: (2024)
por: Chen, Chao, et al.
Publicado: (2024)
Say Anything with Any Style
por: Tan, Shuai, et al.
Publicado: (2024)
por: Tan, Shuai, et al.
Publicado: (2024)
KV-Edit: Training-Free Image Editing for Precise Background Preservation
por: Zhu, Tianrui, et al.
Publicado: (2025)
por: Zhu, Tianrui, et al.
Publicado: (2025)
AutoLUT: LUT-Based Image Super-Resolution with Automatic Sampling and Adaptive Residual Learning
por: Xu, Yuheng, et al.
Publicado: (2025)
por: Xu, Yuheng, et al.
Publicado: (2025)
Unleashing the Temporal-Spatial Reasoning Capacity of GPT for Training-Free Audio and Language Referenced Video Object Segmentation
por: Huang, Shaofei, et al.
Publicado: (2024)
por: Huang, Shaofei, et al.
Publicado: (2024)
ChatAnyone: Stylized Real-time Portrait Video Generation with Hierarchical Motion Diffusion Model
por: Qi, Jinwei, et al.
Publicado: (2025)
por: Qi, Jinwei, et al.
Publicado: (2025)
GMTalker: Gaussian Mixture-based Audio-Driven Emotional Talking Video Portraits
por: Xia, Yibo, et al.
Publicado: (2023)
por: Xia, Yibo, et al.
Publicado: (2023)
AudioEditor: A Training-Free Diffusion-Based Audio Editing Framework
por: Jia, Yuhang, et al.
Publicado: (2024)
por: Jia, Yuhang, et al.
Publicado: (2024)
AudioX: A Unified Framework for Anything-to-Audio Generation
por: Tian, Zeyue, et al.
Publicado: (2025)
por: Tian, Zeyue, et al.
Publicado: (2025)
ZeroSep: Separate Anything in Audio with Zero Training
por: Huang, Chao, et al.
Publicado: (2025)
por: Huang, Chao, et al.
Publicado: (2025)
Occlusion-Aware Physics-Semantic Keyframe Selection for Robust Video Editing
por: Liu, Lin, et al.
Publicado: (2026)
por: Liu, Lin, et al.
Publicado: (2026)
GLAD: Generative Language-Assisted Visual Tracking for Low-Semantic Templates
por: Luo, Xingyu, et al.
Publicado: (2026)
por: Luo, Xingyu, et al.
Publicado: (2026)
Qffusion: Controllable Portrait Video Editing via Quadrant-Grid Attention Learning
por: Li, Maomao, et al.
Publicado: (2025)
por: Li, Maomao, et al.
Publicado: (2025)
AudioScenic: Audio-Driven Video Scene Editing
por: Shen, Kaixin, et al.
Publicado: (2024)
por: Shen, Kaixin, et al.
Publicado: (2024)
AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation
por: Wei, Huawei, et al.
Publicado: (2024)
por: Wei, Huawei, et al.
Publicado: (2024)
Refining Alignment Framework for Diffusion Models with Intermediate-Step Preference Ranking
por: Ren, Jie, et al.
Publicado: (2025)
por: Ren, Jie, et al.
Publicado: (2025)
Disentangled Textual Priors for Diffusion-based Image Super-Resolution
por: Jiang, Lei, et al.
Publicado: (2026)
por: Jiang, Lei, et al.
Publicado: (2026)
O-DisCo-Edit: Object Distortion Control for Unified Realistic Video Editing
por: Chen, Yuqing, et al.
Publicado: (2025)
por: Chen, Yuqing, et al.
Publicado: (2025)
Audio-visual Event Localization on Portrait Mode Short Videos
por: Liu, Wuyang, et al.
Publicado: (2025)
por: Liu, Wuyang, et al.
Publicado: (2025)
ViSAudio: End-to-End Video-Driven Binaural Spatial Audio Generation
por: Zhang, Mengchen, et al.
Publicado: (2025)
por: Zhang, Mengchen, et al.
Publicado: (2025)
Teller: Real-Time Streaming Audio-Driven Portrait Animation with Autoregressive Motion Generation
por: Zhen, Dingcheng, et al.
Publicado: (2025)
por: Zhen, Dingcheng, et al.
Publicado: (2025)
GTPT: Group-based Token Pruning Transformer for Efficient Human Pose Estimation
por: Wang, Haonan, et al.
Publicado: (2024)
por: Wang, Haonan, et al.
Publicado: (2024)
Unleashing Hierarchical Reasoning: An LLM-Driven Framework for Training-Free Referring Video Object Segmentation
por: Zhao, Bingrui, et al.
Publicado: (2025)
por: Zhao, Bingrui, et al.
Publicado: (2025)
Stable Video-Driven Portraits
por: R., Mallikarjun B., et al.
Publicado: (2025)
por: R., Mallikarjun B., et al.
Publicado: (2025)
KAN-SAM: Kolmogorov-Arnold Network Guided Segment Anything Model for RGB-T Salient Object Detection
por: Li, Xingyuan, et al.
Publicado: (2025)
por: Li, Xingyuan, et al.
Publicado: (2025)
MoEE: Mixture of Emotion Experts for Audio-Driven Portrait Animation
por: Liu, Huaize, et al.
Publicado: (2025)
por: Liu, Huaize, et al.
Publicado: (2025)
UniTalking: A Unified Audio-Video Framework for Talking Portrait Generation
por: Li, Hebeizi, et al.
Publicado: (2026)
por: Li, Hebeizi, et al.
Publicado: (2026)
Portrait Video Editing Empowered by Multimodal Generative Priors
por: Gao, Xuan, et al.
Publicado: (2024)
por: Gao, Xuan, et al.
Publicado: (2024)
Ejemplares similares
-
In-the-wild Audio Spatialization with Flexible Text-guided Localization
por: Pan, Tianrui, et al.
Publicado: (2025) -
RAVSS: Robust Audio-Visual Speech Separation in Multi-Speaker Scenarios with Missing Visual Cues
por: Pan, Tianrui, et al.
Publicado: (2024) -
Towards Practical Real-Time Low-Latency Music Source Separation
por: Wu, Junyu, et al.
Publicado: (2025) -
SayAnything: Audio-Driven Lip Synchronization with Conditional Video Diffusion
por: Ma, Junxian, et al.
Publicado: (2025) -
Replace Anyone in Videos
por: Wang, Xiang, et al.
Publicado: (2024)