AudioScenic: Audio-Driven Video Scene Editing
Fuente:
arXiv
Salvato in:
| Autori principali: | Shen, Kaixin, Quan, Ruijie, Zhu, Linchao, Xiao, Jun, Yang, Yi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
CLIP4STR: A Simple Baseline for Scene Text Recognition with Pre-trained Vision-Language Model
di: Zhao, Shuai, et al.
Pubblicazione: (2023)
di: Zhao, Shuai, et al.
Pubblicazione: (2023)
TarPro: Targeted Protection against Malicious Image Editing
di: Shen, Kaixin, et al.
Pubblicazione: (2025)
di: Shen, Kaixin, et al.
Pubblicazione: (2025)
VideoGrain: Modulating Space-Time Attention for Multi-grained Video Editing
di: Yang, Xiangpeng, et al.
Pubblicazione: (2025)
di: Yang, Xiangpeng, et al.
Pubblicazione: (2025)
EVA: Zero-shot Accurate Attributes and Multi-Object Video Editing
di: Yang, Xiangpeng, et al.
Pubblicazione: (2024)
di: Yang, Xiangpeng, et al.
Pubblicazione: (2024)
JoyGen: Audio-Driven 3D Depth-Aware Talking-Face Video Editing
di: Wang, Qili, et al.
Pubblicazione: (2025)
di: Wang, Qili, et al.
Pubblicazione: (2025)
UniGeo: Unifying Geometric Guidance for Camera-Controllable Image Editing via Video Models
di: Jiang, Hong, et al.
Pubblicazione: (2026)
di: Jiang, Hong, et al.
Pubblicazione: (2026)
InstructAV2AV: Instruction-Guided Audio-Video Joint Editing
di: Zheng, Haojie, et al.
Pubblicazione: (2026)
di: Zheng, Haojie, et al.
Pubblicazione: (2026)
DGL: Dynamic Global-Local Prompt Tuning for Text-Video Retrieval
di: Yang, Xiangpeng, et al.
Pubblicazione: (2024)
di: Yang, Xiangpeng, et al.
Pubblicazione: (2024)
GPD: Guided Progressive Distillation for Fast and High-Quality Video Generation
di: Liang, Xiao, et al.
Pubblicazione: (2026)
di: Liang, Xiao, et al.
Pubblicazione: (2026)
Wan-S2V: Audio-Driven Cinematic Video Generation
di: Gao, Xin, et al.
Pubblicazione: (2025)
di: Gao, Xin, et al.
Pubblicazione: (2025)
Insert Anything: Image Insertion via In-Context Editing in DiT
di: Song, Wensong, et al.
Pubblicazione: (2025)
di: Song, Wensong, et al.
Pubblicazione: (2025)
FreeLong: Training-Free Long Video Generation with SpectralBlend Temporal Attention
di: Lu, Yu, et al.
Pubblicazione: (2024)
di: Lu, Yu, et al.
Pubblicazione: (2024)
Video Editing for Audio-Visual Dubbing
di: Manela, Binyamin, et al.
Pubblicazione: (2025)
di: Manela, Binyamin, et al.
Pubblicazione: (2025)
AVI-Edit: Audio-sync Video Instance Editing with Granularity-Aware Mask Refiner
di: Zheng, Haojie, et al.
Pubblicazione: (2025)
di: Zheng, Haojie, et al.
Pubblicazione: (2025)
Shape2Scene: 3D Scene Representation Learning Through Pre-training on Shape Data
di: Feng, Tuo, et al.
Pubblicazione: (2024)
di: Feng, Tuo, et al.
Pubblicazione: (2024)
SonicDiffusion: Audio-Driven Image Generation and Editing with Pretrained Diffusion Models
di: Biner, Burak Can, et al.
Pubblicazione: (2024)
di: Biner, Burak Can, et al.
Pubblicazione: (2024)
EasyGenNet: An Efficient Framework for Audio-Driven Gesture Video Generation Based on Diffusion Model
di: Li, Renda, et al.
Pubblicazione: (2025)
di: Li, Renda, et al.
Pubblicazione: (2025)
Audio-Infused Automatic Image Colorization by Exploiting Audio Scene Semantics
di: Zhao, Pengcheng, et al.
Pubblicazione: (2024)
di: Zhao, Pengcheng, et al.
Pubblicazione: (2024)
SayAnything: Audio-Driven Lip Synchronization with Conditional Video Diffusion
di: Ma, Junxian, et al.
Pubblicazione: (2025)
di: Ma, Junxian, et al.
Pubblicazione: (2025)
SkyReels-V4: Multi-modal Video-Audio Generation, Inpainting and Editing model
di: Chen, Guibin, et al.
Pubblicazione: (2026)
di: Chen, Guibin, et al.
Pubblicazione: (2026)
Audio-Visual Camera Pose Estimation with Passive Scene Sounds and In-the-Wild Video
di: Adebi, Daniel, et al.
Pubblicazione: (2025)
di: Adebi, Daniel, et al.
Pubblicazione: (2025)
MC-Bench: A Benchmark for Multi-Context Visual Grounding in the Era of MLLMs
di: Xu, Yunqiu, et al.
Pubblicazione: (2024)
di: Xu, Yunqiu, et al.
Pubblicazione: (2024)
AV-Unified: A Unified Framework for Audio-visual Scene Understanding
di: Li, Guangyao, et al.
Pubblicazione: (2026)
di: Li, Guangyao, et al.
Pubblicazione: (2026)
MUG: Pseudo Labeling Augmented Audio-Visual Mamba Network for Audio-Visual Video Parsing
di: Wang, Langyu, et al.
Pubblicazione: (2025)
di: Wang, Langyu, et al.
Pubblicazione: (2025)
HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters
di: Chen, Yi, et al.
Pubblicazione: (2025)
di: Chen, Yi, et al.
Pubblicazione: (2025)
Hear the Scene: Audio-Enhanced Text Spotting
di: Li, Jing, et al.
Pubblicazione: (2024)
di: Li, Jing, et al.
Pubblicazione: (2024)
Audio-Driven Talking Face Video Generation with Joint Uncertainty Learning
di: Xie, Yifan, et al.
Pubblicazione: (2025)
di: Xie, Yifan, et al.
Pubblicazione: (2025)
StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation
di: Tu, Shuyuan, et al.
Pubblicazione: (2025)
di: Tu, Shuyuan, et al.
Pubblicazione: (2025)
Audio-driven High-resolution Seamless Talking Head Video Editing via StyleGAN
di: Su, Jiacheng, et al.
Pubblicazione: (2024)
di: Su, Jiacheng, et al.
Pubblicazione: (2024)
Sound Sparks Motion: Audio and Text Tuning for Video Editing
di: Razlighi, AmirHossein Naghi, et al.
Pubblicazione: (2026)
di: Razlighi, AmirHossein Naghi, et al.
Pubblicazione: (2026)
Exploiting Temporal Audio-Visual Correlation Embedding for Audio-Driven One-Shot Talking Head Animation
di: Xu, Zhihua, et al.
Pubblicazione: (2025)
di: Xu, Zhihua, et al.
Pubblicazione: (2025)
Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation
di: Kong, Zhe, et al.
Pubblicazione: (2025)
di: Kong, Zhe, et al.
Pubblicazione: (2025)
GMTalker: Gaussian Mixture-based Audio-Driven Emotional Talking Video Portraits
di: Xia, Yibo, et al.
Pubblicazione: (2023)
di: Xia, Yibo, et al.
Pubblicazione: (2023)
EMO2: End-Effector Guided Audio-Driven Avatar Video Generation
di: Tian, Linrui, et al.
Pubblicazione: (2025)
di: Tian, Linrui, et al.
Pubblicazione: (2025)
FlexSelect: Flexible Token Selection for Efficient Long Video Understanding
di: Zhang, Yunzhu, et al.
Pubblicazione: (2025)
di: Zhang, Yunzhu, et al.
Pubblicazione: (2025)
LINK: Adaptive Modality Interaction for Audio-Visual Video Parsing
di: Wang, Langyu, et al.
Pubblicazione: (2024)
di: Wang, Langyu, et al.
Pubblicazione: (2024)
Audio-Guided Visual Editing with Complex Multi-Modal Prompts
di: Kim, Hyeonyu, et al.
Pubblicazione: (2025)
di: Kim, Hyeonyu, et al.
Pubblicazione: (2025)
RASA: Replace Anyone, Say Anything -- A Training-Free Framework for Audio-Driven and Universal Portrait Video Editing
di: Pan, Tianrui, et al.
Pubblicazione: (2025)
di: Pan, Tianrui, et al.
Pubblicazione: (2025)
AV-DiT: Efficient Audio-Visual Diffusion Transformer for Joint Audio and Video Generation
di: Wang, Kai, et al.
Pubblicazione: (2024)
di: Wang, Kai, et al.
Pubblicazione: (2024)
SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers
di: Fei, Zhengcong, et al.
Pubblicazione: (2025)
di: Fei, Zhengcong, et al.
Pubblicazione: (2025)
Documenti analoghi
-
CLIP4STR: A Simple Baseline for Scene Text Recognition with Pre-trained Vision-Language Model
di: Zhao, Shuai, et al.
Pubblicazione: (2023) -
TarPro: Targeted Protection against Malicious Image Editing
di: Shen, Kaixin, et al.
Pubblicazione: (2025) -
VideoGrain: Modulating Space-Time Attention for Multi-grained Video Editing
di: Yang, Xiangpeng, et al.
Pubblicazione: (2025) -
EVA: Zero-shot Accurate Attributes and Multi-Object Video Editing
di: Yang, Xiangpeng, et al.
Pubblicazione: (2024) -
JoyGen: Audio-Driven 3D Depth-Aware Talking-Face Video Editing
di: Wang, Qili, et al.
Pubblicazione: (2025)