DeepAudio-V1:Towards Multi-Modal Multi-Stage End-to-End Video to Speech and Audio Generation
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Haomin, Liu, Chang, Zheng, Junjie, Chen, Zihao, Ding, Chaofan, Di, Xinhan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
DeepSound-V1: Start to Think Step-by-Step in the Audio Generation from Videos
di: Liang, Yunming, et al.
Pubblicazione: (2025)
di: Liang, Yunming, et al.
Pubblicazione: (2025)
DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis
di: Tian, Wenjie, et al.
Pubblicazione: (2025)
di: Tian, Wenjie, et al.
Pubblicazione: (2025)
Multiple Consistency-guided Test-Time Adaptation for Contrastive Audio-Language Models with Unlabeled Audio
di: Chen, Gongyu, et al.
Pubblicazione: (2024)
di: Chen, Gongyu, et al.
Pubblicazione: (2024)
LD-LAudio-V1: Video-to-Long-Form-Audio Generation Extension with Dual Lightweight Adapters
di: Zhang, Haomin, et al.
Pubblicazione: (2025)
di: Zhang, Haomin, et al.
Pubblicazione: (2025)
Bailing-TTS: Chinese Dialectal Speech Synthesis Towards Human-like Spontaneous Representation
di: Di, Xinhan, et al.
Pubblicazione: (2024)
di: Di, Xinhan, et al.
Pubblicazione: (2024)
Towards Video to Piano Music Generation with Chain-of-Perform Support Benchmarks
di: Liu, Chang, et al.
Pubblicazione: (2025)
di: Liu, Chang, et al.
Pubblicazione: (2025)
Enhance Generation Quality of Flow Matching V2A Model via Multi-Step CoT-Like Guidance and Combined Preference Optimization
di: Zhang, Haomin, et al.
Pubblicazione: (2025)
di: Zhang, Haomin, et al.
Pubblicazione: (2025)
Diff-SAGe: End-to-End Spatial Audio Generation Using Diffusion Models
di: Kushwaha, Saksham Singh, et al.
Pubblicazione: (2024)
di: Kushwaha, Saksham Singh, et al.
Pubblicazione: (2024)
Baichuan-Audio: A Unified Framework for End-to-End Speech Interaction
di: Li, Tianpeng, et al.
Pubblicazione: (2025)
di: Li, Tianpeng, et al.
Pubblicazione: (2025)
Meta-Learning in Audio and Speech Processing: An End to End Comprehensive Review
di: Raimon, Athul, et al.
Pubblicazione: (2024)
di: Raimon, Athul, et al.
Pubblicazione: (2024)
Survey of End-to-End Multi-Speaker Automatic Speech Recognition for Monaural Audio
di: He, Xinlu, et al.
Pubblicazione: (2025)
di: He, Xinlu, et al.
Pubblicazione: (2025)
Leveraging Synthetic Audio Data for End-to-End Low-Resource Speech Translation
di: Moslem, Yasmin
Pubblicazione: (2024)
di: Moslem, Yasmin
Pubblicazione: (2024)
RawBMamba: End-to-End Bidirectional State Space Model for Audio Deepfake Detection
di: Chen, Yujie, et al.
Pubblicazione: (2024)
di: Chen, Yujie, et al.
Pubblicazione: (2024)
audio2chart: End to End Audio Transcription into playable Guitar Hero charts
di: Tripodi, Riccardo
Pubblicazione: (2025)
di: Tripodi, Riccardo
Pubblicazione: (2025)
UniAudio: An Audio Foundation Model Toward Universal Audio Generation
di: Yang, Dongchao, et al.
Pubblicazione: (2023)
di: Yang, Dongchao, et al.
Pubblicazione: (2023)
Quality-Aware End-to-End Audio-Visual Neural Speaker Diarization
di: He, Mao-Kui, et al.
Pubblicazione: (2024)
di: He, Mao-Kui, et al.
Pubblicazione: (2024)
YingSound: Video-Guided Sound Effects Generation with Multi-modal Chain-of-Thought Controls
di: Chen, Zihao, et al.
Pubblicazione: (2024)
di: Chen, Zihao, et al.
Pubblicazione: (2024)
Step-Audio-AQAA: a Fully End-to-End Expressive Large Audio Language Model
di: Huang, Ailin, et al.
Pubblicazione: (2025)
di: Huang, Ailin, et al.
Pubblicazione: (2025)
Exploiting Audio-Visual Features with Pretrained AV-HuBERT for Multi-Modal Dysarthric Speech Reconstruction
di: Chen, Xueyuan, et al.
Pubblicazione: (2024)
di: Chen, Xueyuan, et al.
Pubblicazione: (2024)
An Efficient End-to-End Approach to Noise Invariant Speech Features via Multi-Task Learning
di: Guimarães, Heitor R., et al.
Pubblicazione: (2024)
di: Guimarães, Heitor R., et al.
Pubblicazione: (2024)
R2-SVC: Towards Real-World Robust and Expressive Zero-shot Singing Voice Conversion
di: Zheng, Junjie, et al.
Pubblicazione: (2025)
di: Zheng, Junjie, et al.
Pubblicazione: (2025)
WMCodec: End-to-End Neural Speech Codec with Deep Watermarking for Authenticity Verification
di: Zhou, Junzuo, et al.
Pubblicazione: (2024)
di: Zhou, Junzuo, et al.
Pubblicazione: (2024)
AudioEval: Automatic Dual-Perspective and Multi-Dimensional Evaluation of Text-to-Audio-Generation
di: Wang, Hui, et al.
Pubblicazione: (2025)
di: Wang, Hui, et al.
Pubblicazione: (2025)
Amphion: An Open-Source Audio, Music and Speech Generation Toolkit
di: Zhang, Xueyao, et al.
Pubblicazione: (2023)
di: Zhang, Xueyao, et al.
Pubblicazione: (2023)
AudioGenie-Reasoner: A Training-Free Multi-Agent Framework for Coarse-to-Fine Audio Deep Reasoning
di: Rong, Yan, et al.
Pubblicazione: (2025)
di: Rong, Yan, et al.
Pubblicazione: (2025)
Improving Audio Spectrogram Transformers for Sound Event Detection Through Multi-Stage Training
di: Schmid, Florian, et al.
Pubblicazione: (2024)
di: Schmid, Florian, et al.
Pubblicazione: (2024)
AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning
di: Zhang, Daning, et al.
Pubblicazione: (2025)
di: Zhang, Daning, et al.
Pubblicazione: (2025)
AudioComposer: Towards Fine-grained Audio Generation with Natural Language Descriptions
di: Wang, Yuanyuan, et al.
Pubblicazione: (2024)
di: Wang, Yuanyuan, et al.
Pubblicazione: (2024)
LongCat-Audio-Codec: An Audio Tokenizer and Detokenizer Solution Designed for Speech Large Language Models
di: Zhao, Xiaohan, et al.
Pubblicazione: (2025)
di: Zhao, Xiaohan, et al.
Pubblicazione: (2025)
Interpreting End-to-End Deep Learning Models for Speech Source Localization Using Layer-wise Relevance Propagation
di: Comanducci, Luca, et al.
Pubblicazione: (2024)
di: Comanducci, Luca, et al.
Pubblicazione: (2024)
Jointly Recognizing Speech and Singing Voices Based on Multi-Task Audio Source Separation
di: Bai, Ye, et al.
Pubblicazione: (2024)
di: Bai, Ye, et al.
Pubblicazione: (2024)
End-to-End Real-World Polyphonic Piano Audio-to-Score Transcription with Hierarchical Decoding
di: Zeng, Wei, et al.
Pubblicazione: (2024)
di: Zeng, Wei, et al.
Pubblicazione: (2024)
AudioLCM: Text-to-Audio Generation with Latent Consistency Models
di: Liu, Huadai, et al.
Pubblicazione: (2024)
di: Liu, Huadai, et al.
Pubblicazione: (2024)
Self-Supervised Multi-View Learning for Disentangled Music Audio Representations
di: Wilkins, Julia, et al.
Pubblicazione: (2024)
di: Wilkins, Julia, et al.
Pubblicazione: (2024)
BANC: Towards Efficient Binaural Audio Neural Codec for Overlapping Speech
di: Ratnarajah, Anton, et al.
Pubblicazione: (2023)
di: Ratnarajah, Anton, et al.
Pubblicazione: (2023)
MT2KD: Towards A General-Purpose Encoder for Speech, Speaker, and Audio Events
di: Yang, Xiaoyu, et al.
Pubblicazione: (2024)
di: Yang, Xiaoyu, et al.
Pubblicazione: (2024)
Investigating Neural Audio Codecs for Speech Language Model-Based Speech Generation
di: Li, Jiaqi, et al.
Pubblicazione: (2024)
di: Li, Jiaqi, et al.
Pubblicazione: (2024)
End-to-End Diarization utilizing Attractor Deep Clustering
di: Palzer, David, et al.
Pubblicazione: (2025)
di: Palzer, David, et al.
Pubblicazione: (2025)
SpeechRefiner: Towards Perceptual Quality Refinement for Front-End Algorithms
di: Li, Sirui, et al.
Pubblicazione: (2025)
di: Li, Sirui, et al.
Pubblicazione: (2025)
Bridging The Multi-Modality Gaps of Audio, Visual and Linguistic for Speech Enhancement
di: Lin, Meng-Ping, et al.
Pubblicazione: (2025)
di: Lin, Meng-Ping, et al.
Pubblicazione: (2025)
Documenti analoghi
-
DeepSound-V1: Start to Think Step-by-Step in the Audio Generation from Videos
di: Liang, Yunming, et al.
Pubblicazione: (2025) -
DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis
di: Tian, Wenjie, et al.
Pubblicazione: (2025) -
Multiple Consistency-guided Test-Time Adaptation for Contrastive Audio-Language Models with Unlabeled Audio
di: Chen, Gongyu, et al.
Pubblicazione: (2024) -
LD-LAudio-V1: Video-to-Long-Form-Audio Generation Extension with Dual Lightweight Adapters
di: Zhang, Haomin, et al.
Pubblicazione: (2025) -
Bailing-TTS: Chinese Dialectal Speech Synthesis Towards Human-like Spontaneous Representation
di: Di, Xinhan, et al.
Pubblicazione: (2024)