StyleDubber: Towards Multi-Scale Style Learning for Movie Dubbing
Fuente:
arXiv
Salvato in:
| Autori principali: | Cong, Gaoxiang, Qi, Yuankai, Li, Liang, Beheshti, Amin, Zhang, Zhedong, Hengel, Anton van den, Yang, Ming-Hsuan, Yan, Chenggang, Huang, Qingming |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
FlowDubber: Movie Dubbing with LLM-based Semantic-aware Learning and Flow Matching based Voice Enhancing
di: Cong, Gaoxiang, et al.
Pubblicazione: (2025)
di: Cong, Gaoxiang, et al.
Pubblicazione: (2025)
EmoDubber: Towards High Quality and Emotion Controllable Movie Dubbing
di: Cong, Gaoxiang, et al.
Pubblicazione: (2024)
di: Cong, Gaoxiang, et al.
Pubblicazione: (2024)
InstructDubber: Instruction-based Alignment for Zero-shot Movie Dubbing
di: Zhang, Zhedong, et al.
Pubblicazione: (2025)
di: Zhang, Zhedong, et al.
Pubblicazione: (2025)
Prosody-Enhanced Acoustic Pre-training and Acoustic-Disentangled Prosody Adapting for Movie Dubbing
di: Zhang, Zhedong, et al.
Pubblicazione: (2025)
di: Zhang, Zhedong, et al.
Pubblicazione: (2025)
CoSyncDiT: Cognitive Synchronous Diffusion Transformer for Movie Dubbing
di: Cong, Gaoxiang, et al.
Pubblicazione: (2026)
di: Cong, Gaoxiang, et al.
Pubblicazione: (2026)
MM-MovieDubber: Towards Multi-Modal Learning for Multi-Modal Movie Dubbing
di: Zheng, Junjie, et al.
Pubblicazione: (2025)
di: Zheng, Junjie, et al.
Pubblicazione: (2025)
The Devil is in the Distributions: Explicit Modeling of Scene Content is Key in Zero-Shot Video Captioning
di: Tian, Mingkai, et al.
Pubblicazione: (2025)
di: Tian, Mingkai, et al.
Pubblicazione: (2025)
Towards Expressive Video Dubbing with Multiscale Multimodal Context Interaction
di: Zhao, Yuan, et al.
Pubblicazione: (2024)
di: Zhao, Yuan, et al.
Pubblicazione: (2024)
DeepDubber-V1: Towards High Quality and Dialogue, Narration, Monologue Adaptive Movie Dubbing Via Multi-Modal Chain-of-Thoughts Reasoning Guidance
di: Zheng, Junjie, et al.
Pubblicazione: (2025)
di: Zheng, Junjie, et al.
Pubblicazione: (2025)
ProgRoCC: A Progressive Approach to Rough Crowd Counting
di: Jiang, Shengqin, et al.
Pubblicazione: (2025)
di: Jiang, Shengqin, et al.
Pubblicazione: (2025)
Tracking the Unstable: Appearance-Guided Motion Modeling for Robust Multi-Object Tracking in UAV-Captured Videos
di: Ma, Jianbo, et al.
Pubblicazione: (2025)
di: Ma, Jianbo, et al.
Pubblicazione: (2025)
SketchThinker-R1: Towards Efficient Sketch-Style Reasoning in Large Multimodal Models
di: Zhang, Ruiyang, et al.
Pubblicazione: (2026)
di: Zhang, Ruiyang, et al.
Pubblicazione: (2026)
RETTA: Retrieval-Enhanced Test-Time Adaptation for Zero-Shot Video Captioning
di: Ma, Yunchuan, et al.
Pubblicazione: (2024)
di: Ma, Yunchuan, et al.
Pubblicazione: (2024)
Scaling up Multi-domain Semantic Segmentation with Sentence Embeddings
di: Yin, Wei, et al.
Pubblicazione: (2022)
di: Yin, Wei, et al.
Pubblicazione: (2022)
Generating High-quality Symbolic Music Using Fine-grained Discriminators
di: Zhang, Zhedong, et al.
Pubblicazione: (2024)
di: Zhang, Zhedong, et al.
Pubblicazione: (2024)
ViewFusion: Towards Multi-View Consistency via Interpolated Denoising
di: Yang, Xianghui, et al.
Pubblicazione: (2024)
di: Yang, Xianghui, et al.
Pubblicazione: (2024)
Natural Language-Oriented Programming (NLOP): Towards Democratizing Software Creation
di: Beheshti, Amin
Pubblicazione: (2024)
di: Beheshti, Amin
Pubblicazione: (2024)
DiFlowDubber: Discrete Flow Matching for Automated Video Dubbing via Cross-Modal Alignment and Synchronization
di: Nguyen, Ngoc-Son, et al.
Pubblicazione: (2026)
di: Nguyen, Ngoc-Son, et al.
Pubblicazione: (2026)
Towards Authentic Movie Dubbing with Retrieve-Augmented Director-Actor Interaction Learning
di: Liu, Rui, et al.
Pubblicazione: (2025)
di: Liu, Rui, et al.
Pubblicazione: (2025)
SDVPT: Semantic-Driven Visual Prompt Tuning for Open-World Object Counting
di: Zhao, Yiming, et al.
Pubblicazione: (2025)
di: Zhao, Yiming, et al.
Pubblicazione: (2025)
Joint Multi-scale Cross-lingual Speaking Style Transfer with Bidirectional Attention Mechanism for Automatic Dubbing
di: Li, Jingbei, et al.
Pubblicazione: (2023)
di: Li, Jingbei, et al.
Pubblicazione: (2023)
Adapter-Enhanced Semantic Prompting for Continual Learning
di: Yin, Baocai, et al.
Pubblicazione: (2024)
di: Yin, Baocai, et al.
Pubblicazione: (2024)
HAM: A Training-Free Style Transfer Approach via Heterogeneous Attention Modulation for Diffusion Models
di: He, Yeqi, et al.
Pubblicazione: (2026)
di: He, Yeqi, et al.
Pubblicazione: (2026)
Multimodal Visual Surrogate Compression for Alzheimer's Disease Classification
di: Ding, Dexuan, et al.
Pubblicazione: (2026)
di: Ding, Dexuan, et al.
Pubblicazione: (2026)
StyleQoRA: Quality-Aware Low-Rank Adaptation for Few-Shot Multi-Style Editing
di: Cao, Cong, et al.
Pubblicazione: (2025)
di: Cao, Cong, et al.
Pubblicazione: (2025)
StyleTailor: Towards Personalized Fashion Styling via Hierarchical Negative Feedback
di: Ma, Hongbo, et al.
Pubblicazione: (2025)
di: Ma, Hongbo, et al.
Pubblicazione: (2025)
One-for-All: Towards Universal Domain Translation with a Single StyleGAN
di: Du, Yong, et al.
Pubblicazione: (2023)
di: Du, Yong, et al.
Pubblicazione: (2023)
Collaborative Temporal Consistency Learning for Point-supervised Natural Language Video Localization
di: Tao, Zhuo, et al.
Pubblicazione: (2025)
di: Tao, Zhuo, et al.
Pubblicazione: (2025)
RanPAC: Random Projections and Pre-trained Models for Continual Learning
di: McDonnell, Mark D., et al.
Pubblicazione: (2023)
di: McDonnell, Mark D., et al.
Pubblicazione: (2023)
Towards Higher Effective Rank in Parameter-efficient Fine-tuning using Khatri--Rao Product
di: Albert, Paul, et al.
Pubblicazione: (2025)
di: Albert, Paul, et al.
Pubblicazione: (2025)
Knowledge Composition using Task Vectors with Learned Anisotropic Scaling
di: Zhang, Frederic Z., et al.
Pubblicazione: (2024)
di: Zhang, Frederic Z., et al.
Pubblicazione: (2024)
Style-Preserving Lip Sync via Audio-Aware Style Reference
di: Zhong, Weizhi, et al.
Pubblicazione: (2024)
di: Zhong, Weizhi, et al.
Pubblicazione: (2024)
Confident Sinkhorn Allocation for Pseudo-Labeling
di: Nguyen, Vu, et al.
Pubblicazione: (2022)
di: Nguyen, Vu, et al.
Pubblicazione: (2022)
Points-to-3D: Structure-Aware 3D Generation with Point Cloud Priors
di: Xia, Jiatong, et al.
Pubblicazione: (2026)
di: Xia, Jiatong, et al.
Pubblicazione: (2026)
Context-aware Difference Distilling for Multi-change Captioning
di: Tu, Yunbin, et al.
Pubblicazione: (2024)
di: Tu, Yunbin, et al.
Pubblicazione: (2024)
Pluggable Style Representation Learning for Multi-Style Transfer
di: Liu, Hongda, et al.
Pubblicazione: (2025)
di: Liu, Hongda, et al.
Pubblicazione: (2025)
Learning to Reason and Navigate: Parameter Efficient Action Planning with Large Language Models
di: Mohammadi, Bahram, et al.
Pubblicazione: (2025)
di: Mohammadi, Bahram, et al.
Pubblicazione: (2025)
Distractors-Immune Representation Learning with Cross-modal Contrastive Regularization for Change Captioning
di: Tu, Yunbin, et al.
Pubblicazione: (2024)
di: Tu, Yunbin, et al.
Pubblicazione: (2024)
OmniStyle: Filtering High Quality Style Transfer Data at Scale
di: Wang, Ye, et al.
Pubblicazione: (2025)
di: Wang, Ye, et al.
Pubblicazione: (2025)
Scaling Painting Style Transfer
di: Galerne, Bruno, et al.
Pubblicazione: (2022)
di: Galerne, Bruno, et al.
Pubblicazione: (2022)
Documenti analoghi
-
FlowDubber: Movie Dubbing with LLM-based Semantic-aware Learning and Flow Matching based Voice Enhancing
di: Cong, Gaoxiang, et al.
Pubblicazione: (2025) -
EmoDubber: Towards High Quality and Emotion Controllable Movie Dubbing
di: Cong, Gaoxiang, et al.
Pubblicazione: (2024) -
InstructDubber: Instruction-based Alignment for Zero-shot Movie Dubbing
di: Zhang, Zhedong, et al.
Pubblicazione: (2025) -
Prosody-Enhanced Acoustic Pre-training and Acoustic-Disentangled Prosody Adapting for Movie Dubbing
di: Zhang, Zhedong, et al.
Pubblicazione: (2025) -
CoSyncDiT: Cognitive Synchronous Diffusion Transformer for Movie Dubbing
di: Cong, Gaoxiang, et al.
Pubblicazione: (2026)