Who is Authentic Speaker
Fuente:
arXiv
Salvato in:
| Autore principale: | Huang, Qiang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SpeakerLLM: A Speaker-Specialized Audio-LLM for Speaker Understanding and Verification Reasoning
di: Nam, KiHyun, et al.
Pubblicazione: (2026)
di: Nam, KiHyun, et al.
Pubblicazione: (2026)
Retrieval-Augmented Text-to-Audio Generation
di: Yuan, Yi, et al.
Pubblicazione: (2023)
di: Yuan, Yi, et al.
Pubblicazione: (2023)
MSAC: Multiple Speech Attribute Control Method for Reliable Speech Emotion Recognition
di: Pan, Yu, et al.
Pubblicazione: (2023)
di: Pan, Yu, et al.
Pubblicazione: (2023)
YuE: Scaling Open Foundation Models for Long-Form Music Generation
di: Yuan, Ruibin, et al.
Pubblicazione: (2025)
di: Yuan, Ruibin, et al.
Pubblicazione: (2025)
Leveraging Pre-Trained Autoencoders for Interpretable Prototype Learning of Music Audio
di: Alonso-Jiménez, Pablo, et al.
Pubblicazione: (2024)
di: Alonso-Jiménez, Pablo, et al.
Pubblicazione: (2024)
Frechet Music Distance: A Metric For Generative Symbolic Music Evaluation
di: Retkowski, Jan, et al.
Pubblicazione: (2024)
di: Retkowski, Jan, et al.
Pubblicazione: (2024)
Early Joint Learning of Emotion Information Makes MultiModal Model Understand You Better
di: Ge, Mengying, et al.
Pubblicazione: (2024)
di: Ge, Mengying, et al.
Pubblicazione: (2024)
Transfer Learning in Vocal Education: Technical Evaluation of Limited Samples Describing Mezzo-soprano
di: Hou, Zhenyi, et al.
Pubblicazione: (2024)
di: Hou, Zhenyi, et al.
Pubblicazione: (2024)
BandCondiNet: Parallel Transformers-based Conditional Popular Music Generation with Multi-View Features
di: Luo, Jing, et al.
Pubblicazione: (2024)
di: Luo, Jing, et al.
Pubblicazione: (2024)
A Survey of Foundation Models for Music Understanding
di: Li, Wenjun, et al.
Pubblicazione: (2024)
di: Li, Wenjun, et al.
Pubblicazione: (2024)
Integrating IP Broadcasting with Audio Tags: Workflow and Challenges
di: Burchett-Vass, Rhys, et al.
Pubblicazione: (2024)
di: Burchett-Vass, Rhys, et al.
Pubblicazione: (2024)
MidiTok Visualizer: a tool for visualization and analysis of tokenized MIDI symbolic music
di: Wiszenko, Michał, et al.
Pubblicazione: (2024)
di: Wiszenko, Michał, et al.
Pubblicazione: (2024)
A Multi-Stream Fusion Approach with One-Class Learning for Audio-Visual Deepfake Detection
di: Lee, Kyungbok, et al.
Pubblicazione: (2024)
di: Lee, Kyungbok, et al.
Pubblicazione: (2024)
EmoReg: Directional Latent Vector Modeling for Emotional Intensity Regularization in Diffusion-based Voice Conversion
di: Gudmalwar, Ashishkumar, et al.
Pubblicazione: (2024)
di: Gudmalwar, Ashishkumar, et al.
Pubblicazione: (2024)
DreamHead: Learning Spatial-Temporal Correspondence via Hierarchical Diffusion for Audio-driven Talking Head Synthesis
di: Hong, Fa-Ting, et al.
Pubblicazione: (2024)
di: Hong, Fa-Ting, et al.
Pubblicazione: (2024)
StyleSpeech: Parameter-efficient Fine Tuning for Pre-trained Controllable Text-to-Speech
di: Lou, Haowei, et al.
Pubblicazione: (2024)
di: Lou, Haowei, et al.
Pubblicazione: (2024)
MusicMagus: Zero-Shot Text-to-Music Editing via Diffusion Models
di: Zhang, Yixiao, et al.
Pubblicazione: (2024)
di: Zhang, Yixiao, et al.
Pubblicazione: (2024)
PIAST: A Multimodal Piano Dataset with Audio, Symbolic and Text
di: Bang, Hayeon, et al.
Pubblicazione: (2024)
di: Bang, Hayeon, et al.
Pubblicazione: (2024)
Analyzing the Impact of Splicing Artifacts in Partially Fake Speech Signals
di: Negroni, Viola, et al.
Pubblicazione: (2024)
di: Negroni, Viola, et al.
Pubblicazione: (2024)
SVDD Challenge 2024: A Singing Voice Deepfake Detection Challenge Evaluation Plan
di: Zhang, You, et al.
Pubblicazione: (2024)
di: Zhang, You, et al.
Pubblicazione: (2024)
Towards Assessing Data Replication in Music Generation with Music Similarity Metrics on Raw Audio
di: Batlle-Roca, Roser, et al.
Pubblicazione: (2024)
di: Batlle-Roca, Roser, et al.
Pubblicazione: (2024)
Diseño de sonido para producciones audiovisuales e historias sonoras en el aula. Hacia una docencia creativa mediante el uso de herramientas inteligentes
di: Civit, Miguel, et al.
Pubblicazione: (2024)
di: Civit, Miguel, et al.
Pubblicazione: (2024)
Unveiling Visual Biases in Audio-Visual Localization Benchmarks
di: Chen, Liangyu, et al.
Pubblicazione: (2024)
di: Chen, Liangyu, et al.
Pubblicazione: (2024)
SHMamba: Structured Hyperbolic State Space Model for Audio-Visual Question Answering
di: Yang, Zhe, et al.
Pubblicazione: (2024)
di: Yang, Zhe, et al.
Pubblicazione: (2024)
On the Design of Diffusion-based Neural Speech Codecs
di: Foti, Pietro, et al.
Pubblicazione: (2025)
di: Foti, Pietro, et al.
Pubblicazione: (2025)
CoComposer: LLM Multi-agent Collaborative Music Composition
di: Xing, Peiwen, et al.
Pubblicazione: (2025)
di: Xing, Peiwen, et al.
Pubblicazione: (2025)
Emotion-Aware Speech Generation with Character-Specific Voices for Comics
di: Qian, Zhiwen, et al.
Pubblicazione: (2025)
di: Qian, Zhiwen, et al.
Pubblicazione: (2025)
Learning What To Hear: Boosting Sound-Source Association For Robust Audiovisual Instance Segmentation
di: Seo, Jinbae, et al.
Pubblicazione: (2025)
di: Seo, Jinbae, et al.
Pubblicazione: (2025)
LPIPS-AttnWav2Lip: Generic Audio-Driven lip synchronization for Talking Head Generation in the Wild
di: Chen, Zhipeng, et al.
Pubblicazione: (2026)
di: Chen, Zhipeng, et al.
Pubblicazione: (2026)
Towards Generating Diverse Audio Captions via Adversarial Training
di: Mei, Xinhao, et al.
Pubblicazione: (2022)
di: Mei, Xinhao, et al.
Pubblicazione: (2022)
Deciphering GunType Hierarchy through Acoustic Analysis of Gunshot Recordings
di: Shah, Ankit, et al.
Pubblicazione: (2025)
di: Shah, Ankit, et al.
Pubblicazione: (2025)
OmniCustom: Sync Audio-Video Customization Via Joint Audio-Video Generation Model
di: Li, Maomao, et al.
Pubblicazione: (2026)
di: Li, Maomao, et al.
Pubblicazione: (2026)
Controllable Video-to-Music Generation with Multiple Time-Varying Conditions
di: Wu, Junxian, et al.
Pubblicazione: (2025)
di: Wu, Junxian, et al.
Pubblicazione: (2025)
AudioRole: An Audio Dataset for Character Role-Playing in Large Language Models
di: Li, Wenyu, et al.
Pubblicazione: (2025)
di: Li, Wenyu, et al.
Pubblicazione: (2025)
Neural Style Transfer for Audio Spectograms
di: Verma, Prateek, et al.
Pubblicazione: (2018)
di: Verma, Prateek, et al.
Pubblicazione: (2018)
Embedding Alignment in Code Generation for Audio
di: Kouteili, Sam, et al.
Pubblicazione: (2025)
di: Kouteili, Sam, et al.
Pubblicazione: (2025)
From Sound to Sight: Towards AI-authored Music Videos
di: Vitasovic, Leo, et al.
Pubblicazione: (2025)
di: Vitasovic, Leo, et al.
Pubblicazione: (2025)
FreeAudio: Training-Free Timing Planning for Controllable Long-Form Text-to-Audio Generation
di: Jiang, Yuxuan, et al.
Pubblicazione: (2025)
di: Jiang, Yuxuan, et al.
Pubblicazione: (2025)
Separate Anything You Describe
di: Liu, Xubo, et al.
Pubblicazione: (2023)
di: Liu, Xubo, et al.
Pubblicazione: (2023)
Leveraging Pre-trained AudioLDM for Sound Generation: A Benchmark Study
di: Yuan, Yi, et al.
Pubblicazione: (2023)
di: Yuan, Yi, et al.
Pubblicazione: (2023)
Documenti analoghi
-
SpeakerLLM: A Speaker-Specialized Audio-LLM for Speaker Understanding and Verification Reasoning
di: Nam, KiHyun, et al.
Pubblicazione: (2026) -
Retrieval-Augmented Text-to-Audio Generation
di: Yuan, Yi, et al.
Pubblicazione: (2023) -
MSAC: Multiple Speech Attribute Control Method for Reliable Speech Emotion Recognition
di: Pan, Yu, et al.
Pubblicazione: (2023) -
YuE: Scaling Open Foundation Models for Long-Form Music Generation
di: Yuan, Ruibin, et al.
Pubblicazione: (2025) -
Leveraging Pre-Trained Autoencoders for Interpretable Prototype Learning of Music Audio
di: Alonso-Jiménez, Pablo, et al.
Pubblicazione: (2024)