Distilled HuBERT for Mobile Speech Emotion Recognition: A Cross-Corpus Validation Study
Fuente:
arXiv
Salvato in:
| Autore principale: | Ismail, Saifelden M. |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Measuring Robustness of Speech Recognition from MEG Signals Under Distribution Shift
di: Chien, Sheng-You, et al.
Pubblicazione: (2026)
di: Chien, Sheng-You, et al.
Pubblicazione: (2026)
ParaNoise-SV: Integrated Approach for Noise-Robust Speaker Verification with Parallel Joint Learning of Speech Enhancement and Noise Extraction
di: Kim, Minu, et al.
Pubblicazione: (2025)
di: Kim, Minu, et al.
Pubblicazione: (2025)
VocSim: A Training-free Benchmark for Zero-shot Content Identity in Single-source Audio
di: Basha, Maris, et al.
Pubblicazione: (2025)
di: Basha, Maris, et al.
Pubblicazione: (2025)
VoiceSHIELD-Small: Real-Time Malicious Speech Detection and Transcription
di: Ranjan, Sumit, et al.
Pubblicazione: (2026)
di: Ranjan, Sumit, et al.
Pubblicazione: (2026)
What Would GPT Click: Practical Effects of Human-AI Behavioral Misalignment and the Cost of Synthetic Participants in User Experience
di: Kuric, Eduard, et al.
Pubblicazione: (2026)
di: Kuric, Eduard, et al.
Pubblicazione: (2026)
Deep Feed-Forward Neural Network for Bangla Isolated Speech Recognition
di: Bhadra, Dipayan, et al.
Pubblicazione: (2025)
di: Bhadra, Dipayan, et al.
Pubblicazione: (2025)
Improving Cross-Lingual Phonetic Representation of Low-Resource Languages Through Language Similarity Analysis
di: Kim, Minu, et al.
Pubblicazione: (2025)
di: Kim, Minu, et al.
Pubblicazione: (2025)
Adaptive Edge-Cloud Inference for Speech-to-Action Systems Using ASR and Large Language Models
di: Torkamani, Mohammad Jalili, et al.
Pubblicazione: (2025)
di: Torkamani, Mohammad Jalili, et al.
Pubblicazione: (2025)
Emotional Voice Messages (EMOVOME) database: emotion recognition in spontaneous voice messages
di: Zaragozá, Lucía Gómez, et al.
Pubblicazione: (2024)
di: Zaragozá, Lucía Gómez, et al.
Pubblicazione: (2024)
Evaluating Prompting Strategies for Chart Question Answering with Large Language Models
di: Naikar, Ruthuparna, et al.
Pubblicazione: (2026)
di: Naikar, Ruthuparna, et al.
Pubblicazione: (2026)
Improving Speech Recognition Accuracy Using Custom Language Models with the Vosk Toolkit
di: Soni, Aniket Abhishek
Pubblicazione: (2025)
di: Soni, Aniket Abhishek
Pubblicazione: (2025)
Thaka at KSAA-2026 Task 2: Regularized Fine-Tuning for Arabic Speech Diacritization
di: Alamr, Meshal, et al.
Pubblicazione: (2026)
di: Alamr, Meshal, et al.
Pubblicazione: (2026)
Prevailing Research Areas for Music AI in the Era of Foundation Models
di: Wei, Megan, et al.
Pubblicazione: (2024)
di: Wei, Megan, et al.
Pubblicazione: (2024)
Documenting SME Processes with Conversational AI: From Tacit Knowledge to BPMN
di: Radhakrishnan, Unnikrishnan
Pubblicazione: (2025)
di: Radhakrishnan, Unnikrishnan
Pubblicazione: (2025)
Delayed Fusion: Integrating Large Language Models into First-Pass Decoding in End-to-end Speech Recognition
di: Hori, Takaaki, et al.
Pubblicazione: (2025)
di: Hori, Takaaki, et al.
Pubblicazione: (2025)
STRUM: A Spectral Transcription and Rhythm Understanding Model for End-to-End Generation of Playable Rhythm-Game Charts
di: Opria, Joshua
Pubblicazione: (2026)
di: Opria, Joshua
Pubblicazione: (2026)
Mixer Metaphors: audio interfaces for non-musical applications
di: McNamara, Tace, et al.
Pubblicazione: (2025)
di: McNamara, Tace, et al.
Pubblicazione: (2025)
A Reflective Storytelling Agent for Older Adults: Integrating Argumentation Schemes and Argument Mining in LLM-Based Personalised Narratives
di: Baskar, Jayalakshmi, et al.
Pubblicazione: (2026)
di: Baskar, Jayalakshmi, et al.
Pubblicazione: (2026)
The Silicon Mirror: Dynamic Behavioral Gating for Anti-Sycophancy in LLM Agents
di: Shah, Harshee Jignesh
Pubblicazione: (2026)
di: Shah, Harshee Jignesh
Pubblicazione: (2026)
Evaluating 5W3H Structured Prompting for Intent Alignment in Human-AI Interaction
di: Gang, Peng
Pubblicazione: (2026)
di: Gang, Peng
Pubblicazione: (2026)
Fine-Tuning Large Audio-Language Models with LoRA for Precise Temporal Localization of Prolonged Exposure Therapy Elements
di: BN, Suhas, et al.
Pubblicazione: (2025)
di: BN, Suhas, et al.
Pubblicazione: (2025)
Predicting Upcoming Stuttering Events from Three-Second Audio: Stratified Evaluation Reveals Severity-Selective Precursors, and the Model Deploys Fully On-Device
di: Kozak, Nazar
Pubblicazione: (2026)
di: Kozak, Nazar
Pubblicazione: (2026)
PRISMA: Preference-Reinforced Self-Training Approach for Interpretable Emotionally Intelligent Negotiation Dialogues
di: Kajare, Prajwal Vijay, et al.
Pubblicazione: (2026)
di: Kajare, Prajwal Vijay, et al.
Pubblicazione: (2026)
An End-to-End Approach for Korean Wakeword Systems with Speaker Authentication
di: Seo, Geonwoo
Pubblicazione: (2025)
di: Seo, Geonwoo
Pubblicazione: (2025)
Real-World En Call Center Transcripts Dataset with PII Redaction
di: Dao, Ha, et al.
Pubblicazione: (2025)
di: Dao, Ha, et al.
Pubblicazione: (2025)
Detection of Personal Data in Structured Datasets Using a Large Language Model
di: Ntwali, Albert Agisha, et al.
Pubblicazione: (2025)
di: Ntwali, Albert Agisha, et al.
Pubblicazione: (2025)
Leveraging large multimodal models for audio-video deepfake detection: a pilot study
di: Cao, Songjun, et al.
Pubblicazione: (2026)
di: Cao, Songjun, et al.
Pubblicazione: (2026)
Project Riley: Multimodal Multi-Agent LLM Collaboration with Emotional Reasoning and Voting
di: Ortigoso, Ana Rita, et al.
Pubblicazione: (2025)
di: Ortigoso, Ana Rita, et al.
Pubblicazione: (2025)
Deep Interest Mining for Intent-Enriched Semantic IDs in Multimodal Generative Recommendation
di: Zeng, Yangchen, et al.
Pubblicazione: (2026)
di: Zeng, Yangchen, et al.
Pubblicazione: (2026)
Pipeline and Dataset Generation for Automated Fact-checking in Almost Any Language
di: Drchal, Jan, et al.
Pubblicazione: (2023)
di: Drchal, Jan, et al.
Pubblicazione: (2023)
Automating Clinical Information Retrieval from Finnish Electronic Health Records Using Large Language Models
di: Saukkoriipi, Mikko, et al.
Pubblicazione: (2026)
di: Saukkoriipi, Mikko, et al.
Pubblicazione: (2026)
Singing Timbre Popularity Assessment Based on Multimodal Large Foundation Model
di: Wang, Zihao, et al.
Pubblicazione: (2025)
di: Wang, Zihao, et al.
Pubblicazione: (2025)
BEAT: Tokenizing and Generating Symbolic Music by Uniform Temporal Steps
di: Qian, Lekai, et al.
Pubblicazione: (2026)
di: Qian, Lekai, et al.
Pubblicazione: (2026)
MaskClip: Detachable Clip-on Piezoelectric Sensing of Mask Surface Vibrations for Real-time Noise-Robust Speech Input
di: Hiraki, Hirotaka, et al.
Pubblicazione: (2025)
di: Hiraki, Hirotaka, et al.
Pubblicazione: (2025)
Emotions in the Loop: A Survey of Affective Computing for Emotional Support
di: Hegde, Karishma, et al.
Pubblicazione: (2025)
di: Hegde, Karishma, et al.
Pubblicazione: (2025)
Impact of Phonetics on Speaker Identity in Adversarial Voice Attack
di: Dar, Daniyal Kabir, et al.
Pubblicazione: (2025)
di: Dar, Daniyal Kabir, et al.
Pubblicazione: (2025)
Named entity recognition for Serbian legal documents: Design, methodology and dataset development
di: Kalušev, Vladimir, et al.
Pubblicazione: (2025)
di: Kalušev, Vladimir, et al.
Pubblicazione: (2025)
Multilingual Multi-Label Emotion Classification at Scale with Synthetic Data
di: Borisov, Vadim
Pubblicazione: (2026)
di: Borisov, Vadim
Pubblicazione: (2026)
OrganicHAR: Towards Activity Discovery in Organic Settings for Privacy Preserving Sensors Using Efficient Video Analysis
di: Patidar, Prasoon, et al.
Pubblicazione: (2026)
di: Patidar, Prasoon, et al.
Pubblicazione: (2026)
Does Structured Intent Representation Generalize? A Cross-Language, Cross-Model Empirical Study of 5W3H Prompting
di: Gang, Peng
Pubblicazione: (2026)
di: Gang, Peng
Pubblicazione: (2026)
Documenti analoghi
-
Measuring Robustness of Speech Recognition from MEG Signals Under Distribution Shift
di: Chien, Sheng-You, et al.
Pubblicazione: (2026) -
ParaNoise-SV: Integrated Approach for Noise-Robust Speaker Verification with Parallel Joint Learning of Speech Enhancement and Noise Extraction
di: Kim, Minu, et al.
Pubblicazione: (2025) -
VocSim: A Training-free Benchmark for Zero-shot Content Identity in Single-source Audio
di: Basha, Maris, et al.
Pubblicazione: (2025) -
VoiceSHIELD-Small: Real-Time Malicious Speech Detection and Transcription
di: Ranjan, Sumit, et al.
Pubblicazione: (2026) -
What Would GPT Click: Practical Effects of Human-AI Behavioral Misalignment and the Cost of Synthetic Participants in User Experience
di: Kuric, Eduard, et al.
Pubblicazione: (2026)