Tessellated Linear Model for Age Prediction from Voice
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Alharthi, Dareen, Zamani, Mahsa, Raj, Bhiksha, Singh, Rita |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Human Voice is Unique
par: Singh, Rita, et autres
Publié: (2025)
par: Singh, Rita, et autres
Publié: (2025)
PAM: Prompting Audio-Language Models for Audio Quality Assessment
par: Deshmukh, Soham, et autres
Publié: (2024)
par: Deshmukh, Soham, et autres
Publié: (2024)
Domain Adaptation for Contrastive Audio-Language Models
par: Deshmukh, Soham, et autres
Publié: (2024)
par: Deshmukh, Soham, et autres
Publié: (2024)
RelUNet: Relative Channel Fusion U-Net for Multichannel Speech Enhancement
par: Aldarmaki, Ibrahim, et autres
Publié: (2024)
par: Aldarmaki, Ibrahim, et autres
Publié: (2024)
Improving Speaker Representations Using Contrastive Losses on Multi-scale Features
par: Dixit, Satvik, et autres
Publié: (2024)
par: Dixit, Satvik, et autres
Publié: (2024)
WhisperRT -- Turning Whisper into a Causal Streaming Model
par: Krichli, Tomer, et autres
Publié: (2025)
par: Krichli, Tomer, et autres
Publié: (2025)
SELM: Enhancing Speech Emotion Recognition for Out-of-Domain Scenarios
par: Bukhari, Hazim, et autres
Publié: (2024)
par: Bukhari, Hazim, et autres
Publié: (2024)
What Do Speech Foundation Models Not Learn About Speech?
par: Waheed, Abdul, et autres
Publié: (2024)
par: Waheed, Abdul, et autres
Publié: (2024)
ADIFF: Explaining audio difference using natural language
par: Deshmukh, Soham, et autres
Publié: (2025)
par: Deshmukh, Soham, et autres
Publié: (2025)
Mellow: a small audio language model for reasoning
par: Deshmukh, Soham, et autres
Publié: (2025)
par: Deshmukh, Soham, et autres
Publié: (2025)
Improving Membership Inference in ASR Model Auditing with Perturbed Loss Features
par: Teixeira, Francisco, et autres
Publié: (2024)
par: Teixeira, Francisco, et autres
Publié: (2024)
Objective Measurements of Voice Quality
par: Dhamyal, Hira, et autres
Publié: (2024)
par: Dhamyal, Hira, et autres
Publié: (2024)
Audio Entailment: Assessing Deductive Reasoning for Audio Understanding
par: Deshmukh, Soham, et autres
Publié: (2024)
par: Deshmukh, Soham, et autres
Publié: (2024)
OpenVoice: Versatile Instant Voice Cloning
par: Qin, Zengyi, et autres
Publié: (2023)
par: Qin, Zengyi, et autres
Publié: (2023)
Evaluating Echo State Network for Parkinson's Disease Prediction using Voice Features
par: Hosseininian, Seyedeh Zahra Seyedi, et autres
Publié: (2024)
par: Hosseininian, Seyedeh Zahra Seyedi, et autres
Publié: (2024)
MACE: Leveraging Audio for Evaluating Audio Captioning Systems
par: Dixit, Satvik, et autres
Publié: (2024)
par: Dixit, Satvik, et autres
Publié: (2024)
SVSNet+: Enhancing Speaker Voice Similarity Assessment Models with Representations from Speech Foundation Models
par: Yin, Chun, et autres
Publié: (2024)
par: Yin, Chun, et autres
Publié: (2024)
NaturalVoices: A Large-Scale, Spontaneous and Emotional Podcast Dataset for Voice Conversion
par: Du, Zongyang, et autres
Publié: (2025)
par: Du, Zongyang, et autres
Publié: (2025)
VANPY: Voice Analysis Framework
par: Koushnir, Gregory, et autres
Publié: (2025)
par: Koushnir, Gregory, et autres
Publié: (2025)
Deciphering GunType Hierarchy through Acoustic Analysis of Gunshot Recordings
par: Shah, Ankit, et autres
Publié: (2025)
par: Shah, Ankit, et autres
Publié: (2025)
Voice-Driven Mortality Prediction in Hospitalized Heart Failure Patients: A Machine Learning Approach Enhanced with Diagnostic Biomarkers
par: Ahmadli, Nihat, et autres
Publié: (2024)
par: Ahmadli, Nihat, et autres
Publié: (2024)
Compact Neural TTS Voices for Accessibility
par: Jain, Kunal, et autres
Publié: (2025)
par: Jain, Kunal, et autres
Publié: (2025)
Discrete Optimal Transport and Voice Conversion
par: Selitskiy, Anton, et autres
Publié: (2025)
par: Selitskiy, Anton, et autres
Publié: (2025)
Speech to Speech Synthesis for Voice Impersonation
par: Johnson, Bjorn, et autres
Publié: (2026)
par: Johnson, Bjorn, et autres
Publié: (2026)
Speech Robust Bench: A Robustness Benchmark For Speech Recognition
par: Shah, Muhammad A., et autres
Publié: (2024)
par: Shah, Muhammad A., et autres
Publié: (2024)
Improving Generalization for AI-Synthesized Voice Detection
par: Ren, Hainan, et autres
Publié: (2024)
par: Ren, Hainan, et autres
Publié: (2024)
BiSinger: Bilingual Singing Voice Synthesis
par: Zhou, Huali, et autres
Publié: (2023)
par: Zhou, Huali, et autres
Publié: (2023)
Zero-shot Voice Conversion with Diffusion Transformers
par: Liu, Songting
Publié: (2024)
par: Liu, Songting
Publié: (2024)
Optimal Transport Maps are Good Voice Converters
par: Asadulaev, Arip, et autres
Publié: (2024)
par: Asadulaev, Arip, et autres
Publié: (2024)
Towards Robust Assessment of Pathological Voices via Combined Low-Level Descriptors and Foundation Model Representations
par: Ariyanti, Whenty, et autres
Publié: (2025)
par: Ariyanti, Whenty, et autres
Publié: (2025)
A Concept-based approach to Voice Disorder Detection
par: Ghia, Davide, et autres
Publié: (2025)
par: Ghia, Davide, et autres
Publié: (2025)
Challenges in Automated Processing of Speech from Child Wearables: The Case of Voice Type Classifier
par: Kunze, Tarek, et autres
Publié: (2025)
par: Kunze, Tarek, et autres
Publié: (2025)
DiffAnon: Diffusion-based Prosody Control for Voice Anonymization
par: Ulgen, Ismail Rasim, et autres
Publié: (2026)
par: Ulgen, Ismail Rasim, et autres
Publié: (2026)
Voice Signal Processing for Machine Learning. The Case of Speaker Isolation
par: Ganchev, Radan
Publié: (2024)
par: Ganchev, Radan
Publié: (2024)
On the Generation and Removal of Speaker Adversarial Perturbation for Voice-Privacy Protection
par: Guo, Chenyang, et autres
Publié: (2024)
par: Guo, Chenyang, et autres
Publié: (2024)
StreamVC: Real-Time Low-Latency Voice Conversion
par: Yang, Yang, et autres
Publié: (2024)
par: Yang, Yang, et autres
Publié: (2024)
Discrete Unit based Masking for Improving Disentanglement in Voice Conversion
par: Lee, Philip H., et autres
Publié: (2024)
par: Lee, Philip H., et autres
Publié: (2024)
Multi-modal Adversarial Training for Zero-Shot Voice Cloning
par: Janiczek, John, et autres
Publié: (2024)
par: Janiczek, John, et autres
Publié: (2024)
SiFiSinger: A High-Fidelity End-to-End Singing Voice Synthesizer based on Source-filter Model
par: Cui, Jianwei, et autres
Publié: (2024)
par: Cui, Jianwei, et autres
Publié: (2024)
EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge
par: Manku, Ruskin Raj, et autres
Publié: (2025)
par: Manku, Ruskin Raj, et autres
Publié: (2025)
Documents similaires
-
Human Voice is Unique
par: Singh, Rita, et autres
Publié: (2025) -
PAM: Prompting Audio-Language Models for Audio Quality Assessment
par: Deshmukh, Soham, et autres
Publié: (2024) -
Domain Adaptation for Contrastive Audio-Language Models
par: Deshmukh, Soham, et autres
Publié: (2024) -
RelUNet: Relative Channel Fusion U-Net for Multichannel Speech Enhancement
par: Aldarmaki, Ibrahim, et autres
Publié: (2024) -
Improving Speaker Representations Using Contrastive Losses on Multi-scale Features
par: Dixit, Satvik, et autres
Publié: (2024)