ecVoice: Audio Text Extraction and Optimization of Video Based on Idioms Similarity Replacement
Fuente:
arXiv
Salvato in:
| Autore principale: | Lin, Jinwei |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
HybridVC: Efficient Voice Style Conversion with Text and Audio Prompts
di: Niu, Xinlei, et al.
Pubblicazione: (2024)
di: Niu, Xinlei, et al.
Pubblicazione: (2024)
SyncFlow: Toward Temporally Aligned Joint Audio-Video Generation from Text
di: Liu, Haohe, et al.
Pubblicazione: (2024)
di: Liu, Haohe, et al.
Pubblicazione: (2024)
V2A-DPO: Omni-Preference Optimization for Video-to-Audio Generation
di: Chan, Nolan, et al.
Pubblicazione: (2026)
di: Chan, Nolan, et al.
Pubblicazione: (2026)
RVCBench: Benchmarking the Robustness of Voice Cloning Across Modern Audio Generation Models
di: Jin, Ruinan, et al.
Pubblicazione: (2026)
di: Jin, Ruinan, et al.
Pubblicazione: (2026)
StereoFoley: Object-Aware Stereo Audio Generation from Video
di: Karchkhadze, Tornike, et al.
Pubblicazione: (2025)
di: Karchkhadze, Tornike, et al.
Pubblicazione: (2025)
Beyond Video-to-SFX: Video to Audio Synthesis with Environmentally Aware Speech
di: Niu, Xinlei, et al.
Pubblicazione: (2025)
di: Niu, Xinlei, et al.
Pubblicazione: (2025)
Rhythmic Foley: A Framework For Seamless Audio-Visual Alignment In Video-to-Audio Synthesis
di: Huang, Zhiqi, et al.
Pubblicazione: (2024)
di: Huang, Zhiqi, et al.
Pubblicazione: (2024)
Plug-and-Steer: Decoupling Separation and Selection in Audio-Visual Target Speaker Extraction
di: Kwak, Doyeop, et al.
Pubblicazione: (2026)
di: Kwak, Doyeop, et al.
Pubblicazione: (2026)
LoVA: Long-form Video-to-Audio Generation
di: Cheng, Xin, et al.
Pubblicazione: (2024)
di: Cheng, Xin, et al.
Pubblicazione: (2024)
SAVGBench: Benchmarking Spatially Aligned Audio-Video Generation
di: Shimada, Kazuki, et al.
Pubblicazione: (2024)
di: Shimada, Kazuki, et al.
Pubblicazione: (2024)
Efficient Video to Audio Mapper with Visual Scene Detection
di: Yi, Mingjing, et al.
Pubblicazione: (2024)
di: Yi, Mingjing, et al.
Pubblicazione: (2024)
Optimizing Feature Extraction for Symbolic Music
di: Simonetta, Federico, et al.
Pubblicazione: (2023)
di: Simonetta, Federico, et al.
Pubblicazione: (2023)
Zero-Shot Fake Video Detection by Audio-Visual Consistency
di: Li, Xiaolou, et al.
Pubblicazione: (2024)
di: Li, Xiaolou, et al.
Pubblicazione: (2024)
pTSE-T: Presentation Target Speaker Extraction using Unaligned Text Cues
di: Jiang, Ziyang, et al.
Pubblicazione: (2024)
di: Jiang, Ziyang, et al.
Pubblicazione: (2024)
STA-V2A: Video-to-Audio Generation with Semantic and Temporal Alignment
di: Ren, Yong, et al.
Pubblicazione: (2024)
di: Ren, Yong, et al.
Pubblicazione: (2024)
SONIQUE: Video Background Music Generation Using Unpaired Audio-Visual Data
di: Zhang, Liqian, et al.
Pubblicazione: (2024)
di: Zhang, Liqian, et al.
Pubblicazione: (2024)
Semantically consistent Video-to-Audio Generation using Multimodal Language Large Model
di: Chen, Gehui, et al.
Pubblicazione: (2024)
di: Chen, Gehui, et al.
Pubblicazione: (2024)
DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis
di: Tian, Wenjie, et al.
Pubblicazione: (2025)
di: Tian, Wenjie, et al.
Pubblicazione: (2025)
PerformSinger: Multimodal Singing Voice Synthesis Leveraging Synchronized Lip Cues from Singing Performance Videos
di: Gu, Ke, et al.
Pubblicazione: (2025)
di: Gu, Ke, et al.
Pubblicazione: (2025)
Trusted Fake Audio Detection Based on Dirichlet Distribution
di: Ding, Chi, et al.
Pubblicazione: (2025)
di: Ding, Chi, et al.
Pubblicazione: (2025)
Attentive-based Multi-level Feature Fusion for Voice Disorder Diagnosis
di: Shen, Lipeng, et al.
Pubblicazione: (2024)
di: Shen, Lipeng, et al.
Pubblicazione: (2024)
Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model
di: Ren, Yong, et al.
Pubblicazione: (2025)
di: Ren, Yong, et al.
Pubblicazione: (2025)
Voice Evaluation of Reasoning Ability: Diagnosing the Modality-Induced Performance Gap
di: Lin, Yueqian, et al.
Pubblicazione: (2025)
di: Lin, Yueqian, et al.
Pubblicazione: (2025)
FGAS: Fixed Decoder Network-Based Audio Steganography with Adversarial Perturbation Generation
di: Yan, Jialin, et al.
Pubblicazione: (2025)
di: Yan, Jialin, et al.
Pubblicazione: (2025)
Video-Guided Text-to-Music Generation Using Public Domain Movie Collections
di: Kim, Haven, et al.
Pubblicazione: (2025)
di: Kim, Haven, et al.
Pubblicazione: (2025)
Audio-Language Models for Audio-Centric Tasks: A Systematic Survey
di: Su, Yi, et al.
Pubblicazione: (2025)
di: Su, Yi, et al.
Pubblicazione: (2025)
Robust Wake Word Spotting With Frame-Level Cross-Modal Attention Based Audio-Visual Conformer
di: Wang, Haoxu, et al.
Pubblicazione: (2024)
di: Wang, Haoxu, et al.
Pubblicazione: (2024)
SVDD 2024: The Inaugural Singing Voice Deepfake Detection Challenge
di: Zhang, You, et al.
Pubblicazione: (2024)
di: Zhang, You, et al.
Pubblicazione: (2024)
Towards Source Attribution of Singing Voice Deepfake with Multimodal Foundation Models
di: Phukan, Orchid Chetia, et al.
Pubblicazione: (2025)
di: Phukan, Orchid Chetia, et al.
Pubblicazione: (2025)
Face-Voice Association for Audiovisual Active Speaker Detection in Egocentric Recordings
di: Clarke, Jason, et al.
Pubblicazione: (2025)
di: Clarke, Jason, et al.
Pubblicazione: (2025)
Building Audio-Visual Digital Twins with Smartphones
di: Lan, Zitong, et al.
Pubblicazione: (2025)
di: Lan, Zitong, et al.
Pubblicazione: (2025)
Resource-Efficient Reference-Free Evaluation of Audio Captions
di: Mahfuz, Rehana, et al.
Pubblicazione: (2024)
di: Mahfuz, Rehana, et al.
Pubblicazione: (2024)
Cinematic Audio Source Separation Using Visual Cues
di: Zhang, Kang, et al.
Pubblicazione: (2026)
di: Zhang, Kang, et al.
Pubblicazione: (2026)
REWIND: Speech Time Reversal for Enhancing Speaker Representations in Diffusion-based Voice Conversion
di: Biyani, Ishan D., et al.
Pubblicazione: (2025)
di: Biyani, Ishan D., et al.
Pubblicazione: (2025)
Multimodal Emotion Recognition from Raw Audio with Sinc-convolution
di: Zhang, Xiaohui, et al.
Pubblicazione: (2024)
di: Zhang, Xiaohui, et al.
Pubblicazione: (2024)
Sound-VECaps: Improving Audio Generation with Visual Enhanced Captions
di: Yuan, Yi, et al.
Pubblicazione: (2024)
di: Yuan, Yi, et al.
Pubblicazione: (2024)
DSCLAP: Domain-Specific Contrastive Language-Audio Pre-Training
di: Liu, Shengqiang, et al.
Pubblicazione: (2024)
di: Liu, Shengqiang, et al.
Pubblicazione: (2024)
VERSA: A Versatile Evaluation Toolkit for Speech, Audio, and Music
di: Shi, Jiatong, et al.
Pubblicazione: (2024)
di: Shi, Jiatong, et al.
Pubblicazione: (2024)
Audio-Visual Speaker Tracking: Progress, Challenges, and Future Directions
di: Zhao, Jinzheng, et al.
Pubblicazione: (2023)
di: Zhao, Jinzheng, et al.
Pubblicazione: (2023)
Audio-Visual Speech Separation via Bottleneck Iterative Network
di: Zhang, Sidong, et al.
Pubblicazione: (2025)
di: Zhang, Sidong, et al.
Pubblicazione: (2025)
Documenti analoghi
-
HybridVC: Efficient Voice Style Conversion with Text and Audio Prompts
di: Niu, Xinlei, et al.
Pubblicazione: (2024) -
SyncFlow: Toward Temporally Aligned Joint Audio-Video Generation from Text
di: Liu, Haohe, et al.
Pubblicazione: (2024) -
V2A-DPO: Omni-Preference Optimization for Video-to-Audio Generation
di: Chan, Nolan, et al.
Pubblicazione: (2026) -
RVCBench: Benchmarking the Robustness of Voice Cloning Across Modern Audio Generation Models
di: Jin, Ruinan, et al.
Pubblicazione: (2026) -
StereoFoley: Object-Aware Stereo Audio Generation from Video
di: Karchkhadze, Tornike, et al.
Pubblicazione: (2025)