U-SAM: An audio language Model for Unified Speech, Audio, and Music Understanding
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Ziqian, Xia, Xianjun, Zhu, Xinfa, Xie, Lei |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MPO: Multidimensional Preference Optimization for Language Model-based Text-to-Speech
di: Xia, Kangxiang, et al.
Pubblicazione: (2025)
di: Xia, Kangxiang, et al.
Pubblicazione: (2025)
S$^2$Voice: Style-Aware Autoregressive Modeling with Enhanced Conditioning for Singing Style Conversion
di: Wang, Ziqian, et al.
Pubblicazione: (2026)
di: Wang, Ziqian, et al.
Pubblicazione: (2026)
Do Music Source Separation Models Preserve Spatial Information in Binaural Audio?
di: Namballa, Richa, et al.
Pubblicazione: (2025)
di: Namballa, Richa, et al.
Pubblicazione: (2025)
SELM: Speech Enhancement Using Discrete Tokens and Language Models
di: Wang, Ziqian, et al.
Pubblicazione: (2023)
di: Wang, Ziqian, et al.
Pubblicazione: (2023)
Significance of Chirp MFCC as a Feature in Speech and Audio Applications
di: Joysingh, S. Johanan, et al.
Pubblicazione: (2024)
di: Joysingh, S. Johanan, et al.
Pubblicazione: (2024)
CosyAudio: Improving Audio Generation with Confidence Scores and Synthetic Captions
di: Zhu, Xinfa, et al.
Pubblicazione: (2025)
di: Zhu, Xinfa, et al.
Pubblicazione: (2025)
Synthetic training set generation using text-to-audio models for environmental sound classification
di: Ronchini, Francesca, et al.
Pubblicazione: (2024)
di: Ronchini, Francesca, et al.
Pubblicazione: (2024)
Bridging the Gap: Integrating Pre-trained Speech Enhancement and Recognition Models for Robust Speech Recognition
di: Wang, Kuan-Chen, et al.
Pubblicazione: (2024)
di: Wang, Kuan-Chen, et al.
Pubblicazione: (2024)
MusicHiFi: Fast High-Fidelity Stereo Vocoding
di: Zhu, Ge, et al.
Pubblicazione: (2024)
di: Zhu, Ge, et al.
Pubblicazione: (2024)
Why some audio signal short-time Fourier transform coefficients have nonuniform phase distributions
di: Voran, Stephen D.
Pubblicazione: (2024)
di: Voran, Stephen D.
Pubblicazione: (2024)
Accent-VITS:accent transfer for end-to-end TTS
di: Ma, Linhan, et al.
Pubblicazione: (2023)
di: Ma, Linhan, et al.
Pubblicazione: (2023)
SoundSpring: Loss-Resilient Audio Transceiver with Dual-Functional Masked Language Modeling
di: Yao, Shengshi, et al.
Pubblicazione: (2025)
di: Yao, Shengshi, et al.
Pubblicazione: (2025)
FlowSE: Efficient and High-Quality Speech Enhancement via Flow Matching
di: Wang, Ziqian, et al.
Pubblicazione: (2025)
di: Wang, Ziqian, et al.
Pubblicazione: (2025)
Aliasing-Free Neural Audio Synthesis
di: Gu, Yicheng, et al.
Pubblicazione: (2025)
di: Gu, Yicheng, et al.
Pubblicazione: (2025)
BR-ASR: Efficient and Scalable Bias Retrieval Framework for Contextual Biasing ASR in Speech LLM
di: Gong, Xun, et al.
Pubblicazione: (2025)
di: Gong, Xun, et al.
Pubblicazione: (2025)
Llasa+: Free Lunch for Accelerated and Streaming Llama-Based Speech Synthesis
di: Tian, Wenjie, et al.
Pubblicazione: (2025)
di: Tian, Wenjie, et al.
Pubblicazione: (2025)
Musical Source Separation of Brazilian Percussion
di: Namballa, Richa, et al.
Pubblicazione: (2025)
di: Namballa, Richa, et al.
Pubblicazione: (2025)
Boosting Multi-Speaker Expressive Speech Synthesis with Semi-supervised Contrastive Learning
di: Zhu, Xinfa, et al.
Pubblicazione: (2023)
di: Zhu, Xinfa, et al.
Pubblicazione: (2023)
AutoMashup: Automatic Music Mashups Creation
di: Delabaere, Marine, et al.
Pubblicazione: (2025)
di: Delabaere, Marine, et al.
Pubblicazione: (2025)
Musical Score Following using Statistical Inference
di: Cowley, Josephine
Pubblicazione: (2025)
di: Cowley, Josephine
Pubblicazione: (2025)
Conditioning and Sampling in Variational Diffusion Models for Speech Super-Resolution
di: Yu, Chin-Yun, et al.
Pubblicazione: (2022)
di: Yu, Chin-Yun, et al.
Pubblicazione: (2022)
A Survey of Advancing Audio Super-Resolution and Bandwidth Extension from Discriminative to Generative Models
di: Yang, Ningyuan, et al.
Pubblicazione: (2026)
di: Yang, Ningyuan, et al.
Pubblicazione: (2026)
AffectSpeech: A Large-Scale Emotional Speech Dataset with Fine-Grained Textual Descriptions for Speech Emotion Captioning and Synthesis
di: Qi, Tianhua, et al.
Pubblicazione: (2026)
di: Qi, Tianhua, et al.
Pubblicazione: (2026)
A Study on Speech Assessment with Visual Cues
di: Ahmed, Shafique, et al.
Pubblicazione: (2025)
di: Ahmed, Shafique, et al.
Pubblicazione: (2025)
How Does Instrumental Music Help SingFake Detection?
di: Chen, Xuanjun, et al.
Pubblicazione: (2025)
di: Chen, Xuanjun, et al.
Pubblicazione: (2025)
Toward Universal Speech Enhancement for Diverse Input Conditions
di: Zhang, Wangyou, et al.
Pubblicazione: (2023)
di: Zhang, Wangyou, et al.
Pubblicazione: (2023)
Audio signal interpolation using optimal transportation of spectrograms
di: Valdivia, David, et al.
Pubblicazione: (2025)
di: Valdivia, David, et al.
Pubblicazione: (2025)
Confidence-Based Self-Training for EMG-to-Speech: Leveraging Synthetic EMG for Robust Modeling
di: Chen, Xiaodan, et al.
Pubblicazione: (2025)
di: Chen, Xiaodan, et al.
Pubblicazione: (2025)
Reverse Engineering of Music Mixing Graphs with Differentiable Processors and Iterative Pruning
di: Lee, Sungho, et al.
Pubblicazione: (2025)
di: Lee, Sungho, et al.
Pubblicazione: (2025)
Semantic Communications for Speech Recognition
di: Weng, Zhenzi, et al.
Pubblicazione: (2021)
di: Weng, Zhenzi, et al.
Pubblicazione: (2021)
Towards Improved Objective Perceptual Audio Quality Assessment -- Part 1: A Novel Data-Driven Cognitive Model
di: Delgado, Pablo M., et al.
Pubblicazione: (2024)
di: Delgado, Pablo M., et al.
Pubblicazione: (2024)
Low-Complexity Neural Wind Noise Reduction for Audio Recordings
di: Eftekhari, Hesam, et al.
Pubblicazione: (2025)
di: Eftekhari, Hesam, et al.
Pubblicazione: (2025)
Beyond Identity: A Generalizable Approach for Deepfake Audio Detection
di: Ahmadiadli, Yasaman, et al.
Pubblicazione: (2025)
di: Ahmadiadli, Yasaman, et al.
Pubblicazione: (2025)
Note-Level Singing Melody Transcription for Time-Aligned Musical Score Generation
di: Kim, Leekyung, et al.
Pubblicazione: (2025)
di: Kim, Leekyung, et al.
Pubblicazione: (2025)
Wavelet-Based Time-Frequency Fingerprinting for Feature Extraction of Traditional Irish Music
di: Shore, Noah
Pubblicazione: (2025)
di: Shore, Noah
Pubblicazione: (2025)
Vec-Tok-VC+: Residual-enhanced Robust Zero-shot Voice Conversion with Progressive Constraints in a Dual-mode Training Strategy
di: Ma, Linhan, et al.
Pubblicazione: (2024)
di: Ma, Linhan, et al.
Pubblicazione: (2024)
Generative Deep Learning and Signal Processing for Data Augmentation of Cardiac Auscultation Signals: Improving Model Robustness Using Synthetic Audio
di: Abbott, Leigh, et al.
Pubblicazione: (2024)
di: Abbott, Leigh, et al.
Pubblicazione: (2024)
Lessons Learned from the URGENT 2024 Speech Enhancement Challenge
di: Zhang, Wangyou, et al.
Pubblicazione: (2025)
di: Zhang, Wangyou, et al.
Pubblicazione: (2025)
LiSenNet: Lightweight Sub-band and Dual-Path Modeling for Real-Time Speech Enhancement
di: Yan, Haoyin, et al.
Pubblicazione: (2024)
di: Yan, Haoyin, et al.
Pubblicazione: (2024)
Interpolation Filter Design for Sample Rate Independent Audio Effect RNNs
di: Carson, Alistair, et al.
Pubblicazione: (2024)
di: Carson, Alistair, et al.
Pubblicazione: (2024)
Documenti analoghi
-
MPO: Multidimensional Preference Optimization for Language Model-based Text-to-Speech
di: Xia, Kangxiang, et al.
Pubblicazione: (2025) -
S$^2$Voice: Style-Aware Autoregressive Modeling with Enhanced Conditioning for Singing Style Conversion
di: Wang, Ziqian, et al.
Pubblicazione: (2026) -
Do Music Source Separation Models Preserve Spatial Information in Binaural Audio?
di: Namballa, Richa, et al.
Pubblicazione: (2025) -
SELM: Speech Enhancement Using Discrete Tokens and Language Models
di: Wang, Ziqian, et al.
Pubblicazione: (2023) -
Significance of Chirp MFCC as a Feature in Speech and Audio Applications
di: Joysingh, S. Johanan, et al.
Pubblicazione: (2024)