Learning to assess subjective impressions from speech
Fuente:
arXiv
Salvato in:
| Autori principali: | Kondo, Yuto, Kameoka, Hirokazu, Tanaka, Kou, Kaneko, Takuhiro, Harada, Noboru |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
LatentVoiceGrad: Nonparallel Voice Conversion with Latent Diffusion/Flow-Matching Models
di: Kameoka, Hirokazu, et al.
Pubblicazione: (2025)
di: Kameoka, Hirokazu, et al.
Pubblicazione: (2025)
Rethinking Mean Opinion Scores in Speech Quality Assessment: Aggregation through Quantized Distribution Fitting
di: Kondo, Yuto, et al.
Pubblicazione: (2025)
di: Kondo, Yuto, et al.
Pubblicazione: (2025)
Selecting N-lowest scores for training MOS prediction models
di: Kondo, Yuto, et al.
Pubblicazione: (2025)
di: Kondo, Yuto, et al.
Pubblicazione: (2025)
JIS: A Speech Corpus of Japanese Idol Speakers with Various Speaking Styles
di: Kondo, Yuto, et al.
Pubblicazione: (2025)
di: Kondo, Yuto, et al.
Pubblicazione: (2025)
Vocoder-Projected Feature Discriminator
di: Kaneko, Takuhiro, et al.
Pubblicazione: (2025)
di: Kaneko, Takuhiro, et al.
Pubblicazione: (2025)
FasterVoiceGrad: Faster One-step Diffusion-Based Voice Conversion with Adversarial Diffusion Conversion Distillation
di: Kaneko, Takuhiro, et al.
Pubblicazione: (2025)
di: Kaneko, Takuhiro, et al.
Pubblicazione: (2025)
MeanVoiceFlow: One-step Nonparallel Voice Conversion with Mean Flows
di: Kaneko, Takuhiro, et al.
Pubblicazione: (2026)
di: Kaneko, Takuhiro, et al.
Pubblicazione: (2026)
FastVoiceGrad: One-step Diffusion-Based Voice Conversion with Adversarial Conditional Diffusion Distillation
di: Kaneko, Takuhiro, et al.
Pubblicazione: (2024)
di: Kaneko, Takuhiro, et al.
Pubblicazione: (2024)
Training Generative Adversarial Network-Based Vocoder with Limited Data Using Augmentation-Conditional Discriminator
di: Kaneko, Takuhiro, et al.
Pubblicazione: (2024)
di: Kaneko, Takuhiro, et al.
Pubblicazione: (2024)
VoiceGrad: Non-Parallel Any-to-Many Voice Conversion with Annealed Langevin Dynamics
di: Kameoka, Hirokazu, et al.
Pubblicazione: (2020)
di: Kameoka, Hirokazu, et al.
Pubblicazione: (2020)
GE2E-AC: Generalized End-to-End Loss Training for Accent Classification
di: Watanabe, Chihiro, et al.
Pubblicazione: (2024)
di: Watanabe, Chihiro, et al.
Pubblicazione: (2024)
6DoF SELD: Sound Event Localization and Detection Using Microphones and Motion Tracking Sensors on self-motioning human
di: Yasuda, Masahiro, et al.
Pubblicazione: (2024)
di: Yasuda, Masahiro, et al.
Pubblicazione: (2024)
Unrestricted Global Phase Bias-Aware Single-channel Speech Enhancement with Conformer-based Metric GAN
di: Zhang, Shiqi, et al.
Pubblicazione: (2024)
di: Zhang, Shiqi, et al.
Pubblicazione: (2024)
Relationship between objective and subjective perceptual measures of speech in individuals with head and neck cancer
di: Halpern, Bence Mark, et al.
Pubblicazione: (2025)
di: Halpern, Bence Mark, et al.
Pubblicazione: (2025)
Acousto-optic reconstruction of exterior sound field based on concentric circle sampling with circular harmonic expansion
di: Nguyen, Phuc Duc, et al.
Pubblicazione: (2023)
di: Nguyen, Phuc Duc, et al.
Pubblicazione: (2023)
Refining Knowledge Transfer on Audio-Image Temporal Agreement for Audio-Text Cross Retrieval
di: Tsubaki, Shunsuke, et al.
Pubblicazione: (2024)
di: Tsubaki, Shunsuke, et al.
Pubblicazione: (2024)
Towards explainable reference-free speech intelligibility evaluation of people with pathological speech
di: Halpern, Bence Mark, et al.
Pubblicazione: (2026)
di: Halpern, Bence Mark, et al.
Pubblicazione: (2026)
Masked Modeling Duo: Towards a Universal Audio Pre-training Framework
di: Niizumi, Daisuke, et al.
Pubblicazione: (2024)
di: Niizumi, Daisuke, et al.
Pubblicazione: (2024)
Exploring Pre-trained General-purpose Audio Representations for Heart Murmur Detection
di: Niizumi, Daisuke, et al.
Pubblicazione: (2024)
di: Niizumi, Daisuke, et al.
Pubblicazione: (2024)
Baseline Systems and Evaluation Metrics for Spatial Semantic Segmentation of Sound Scenes
di: Nguyen, Binh Thien, et al.
Pubblicazione: (2025)
di: Nguyen, Binh Thien, et al.
Pubblicazione: (2025)
SoundSil-DS: Deep Denoising and Segmentation of Sound-field Images with Silhouettes
di: Tanigawa, Risako, et al.
Pubblicazione: (2024)
di: Tanigawa, Risako, et al.
Pubblicazione: (2024)
Objective and subjective evaluation of speech enhancement methods in the UDASE task of the 7th CHiME challenge
di: Leglaive, Simon, et al.
Pubblicazione: (2024)
di: Leglaive, Simon, et al.
Pubblicazione: (2024)
M2D-CLAP: Masked Modeling Duo Meets CLAP for Learning General-purpose Audio-Language Representation
di: Niizumi, Daisuke, et al.
Pubblicazione: (2024)
di: Niizumi, Daisuke, et al.
Pubblicazione: (2024)
Target matching based generative model for speech enhancement
di: Wang, Taihui, et al.
Pubblicazione: (2025)
di: Wang, Taihui, et al.
Pubblicazione: (2025)
CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer
di: Takeuchi, Daiki, et al.
Pubblicazione: (2025)
di: Takeuchi, Daiki, et al.
Pubblicazione: (2025)
Investigating training objective for flow matching-based speech enhancement
di: Yang, Liusha, et al.
Pubblicazione: (2025)
di: Yang, Liusha, et al.
Pubblicazione: (2025)
Formula-Supervised Sound Event Detection: Pre-Training Without Real Data
di: Shibata, Yuto, et al.
Pubblicazione: (2025)
di: Shibata, Yuto, et al.
Pubblicazione: (2025)
emg2speech: Synthesizing speech from electromyography using self-supervised speech models
di: Gowda, Harshavardhana T., et al.
Pubblicazione: (2025)
di: Gowda, Harshavardhana T., et al.
Pubblicazione: (2025)
Rethinking Masking Strategies for Masked Prediction-based Audio Self-supervised Learning
di: Niizumi, Daisuke, et al.
Pubblicazione: (2026)
di: Niizumi, Daisuke, et al.
Pubblicazione: (2026)
Gen-SER: When the generative model meets speech emotion recognition
di: Wang, Taihui, et al.
Pubblicazione: (2026)
di: Wang, Taihui, et al.
Pubblicazione: (2026)
Description and Discussion on DCASE 2026 Challenge Task 2: Noise-aware Unsupervised Anomalous Sound Detection for Machine Condition Monitoring
di: Nishida, Tomoya, et al.
Pubblicazione: (2026)
di: Nishida, Tomoya, et al.
Pubblicazione: (2026)
XPPG-PCA: Reference-free automatic speech severity evaluation with principal components
di: Halpern, Bence Mark, et al.
Pubblicazione: (2025)
di: Halpern, Bence Mark, et al.
Pubblicazione: (2025)
An interpretable speech foundation model for depression detection by revealing prediction-relevant acoustic features from long speech
di: Deng, Qingkun, et al.
Pubblicazione: (2024)
di: Deng, Qingkun, et al.
Pubblicazione: (2024)
Towards noise-robust speech inversion through multi-task learning with speech enhancement
di: Tabatabaee, Saba, et al.
Pubblicazione: (2026)
di: Tabatabaee, Saba, et al.
Pubblicazione: (2026)
Structure from Collision
di: Kaneko, Takuhiro
Pubblicazione: (2025)
di: Kaneko, Takuhiro
Pubblicazione: (2025)
Reference-free automatic speech severity evaluation using acoustic unit language modelling
di: Halpern, Bence Mark, et al.
Pubblicazione: (2025)
di: Halpern, Bence Mark, et al.
Pubblicazione: (2025)
A long-form single-speaker real-time MRI speech dataset and benchmark
di: Foley, Sean, et al.
Pubblicazione: (2025)
di: Foley, Sean, et al.
Pubblicazione: (2025)
On the relationship between speech and hearing
di: Umesh, Srinivasan, et al.
Pubblicazione: (2024)
di: Umesh, Srinivasan, et al.
Pubblicazione: (2024)
Robust fine-tuning of speech recognition models via model merging: application to disordered speech
di: Ducorroy, Alexandre, et al.
Pubblicazione: (2025)
di: Ducorroy, Alexandre, et al.
Pubblicazione: (2025)
Towards robust paralinguistic assessment for real-world mobile health (mHealth) monitoring: an initial study of reverberation effects on speech
di: Dineley, Judith, et al.
Pubblicazione: (2023)
di: Dineley, Judith, et al.
Pubblicazione: (2023)
Documenti analoghi
-
LatentVoiceGrad: Nonparallel Voice Conversion with Latent Diffusion/Flow-Matching Models
di: Kameoka, Hirokazu, et al.
Pubblicazione: (2025) -
Rethinking Mean Opinion Scores in Speech Quality Assessment: Aggregation through Quantized Distribution Fitting
di: Kondo, Yuto, et al.
Pubblicazione: (2025) -
Selecting N-lowest scores for training MOS prediction models
di: Kondo, Yuto, et al.
Pubblicazione: (2025) -
JIS: A Speech Corpus of Japanese Idol Speakers with Various Speaking Styles
di: Kondo, Yuto, et al.
Pubblicazione: (2025) -
Vocoder-Projected Feature Discriminator
di: Kaneko, Takuhiro, et al.
Pubblicazione: (2025)