Evaluating Speech-in-Speech Perception via a Humanoid Robot
Fuente:
arXiv
Guardado en:
| Autores principales: | Meyer, Luke, Araiza-Illan, Gloria, Rachman, Laura, Gaudrain, Etienne, Baskent, Deniz |
|---|---|
| Formato: | Preprint |
| Publicado: |
2023
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Automated speech audiometry: Can it work using open-source pre-trained Kaldi-NL automatic speech recognition?
por: Araiza-Illan, Gloria, et al.
Publicado: (2023)
por: Araiza-Illan, Gloria, et al.
Publicado: (2023)
Theoretical Framework for the Optimization of Microphone Array Configuration for Humanoid Robot Audition
por: Tourbabin, Vladimir, et al.
Publicado: (2024)
por: Tourbabin, Vladimir, et al.
Publicado: (2024)
Direction of Arrival Estimation Using Microphone Array Processing for Moving Humanoid Robots
por: Tourbabin, Vladimir, et al.
Publicado: (2024)
por: Tourbabin, Vladimir, et al.
Publicado: (2024)
Personalized Speech Emotion Recognition in Human-Robot Interaction using Vision Transformers
por: Mishra, Ruchik, et al.
Publicado: (2024)
por: Mishra, Ruchik, et al.
Publicado: (2024)
Long-Term, Store-Front Robotics: Interactive Music for Robotic Arm, Caxixi and Frame Drums
por: Savery, Richard, et al.
Publicado: (2024)
por: Savery, Richard, et al.
Publicado: (2024)
SpeechLLM-as-Judges: Towards General and Interpretable Speech Quality Evaluation
por: Wang, Hui, et al.
Publicado: (2025)
por: Wang, Hui, et al.
Publicado: (2025)
Objective and Subjective Evaluation of Diffusion-Based Speech Enhancement for Dysarthric Speech
por: de Groot, Dimme, et al.
Publicado: (2025)
por: de Groot, Dimme, et al.
Publicado: (2025)
SpeechBERTScore: Reference-Aware Automatic Evaluation of Speech Generation Leveraging NLP Evaluation Metrics
por: Saeki, Takaaki, et al.
Publicado: (2024)
por: Saeki, Takaaki, et al.
Publicado: (2024)
Single-Microphone-Based Sound Source Localization for Mobile Robots in Reverberant Environments
por: Wang, Jiang, et al.
Publicado: (2025)
por: Wang, Jiang, et al.
Publicado: (2025)
Evaluating Text-to-Speech Synthesis from a Large Discrete Token-based Speech Language Model
por: Wang, Siyang, et al.
Publicado: (2024)
por: Wang, Siyang, et al.
Publicado: (2024)
Evaluating Self-Supervised Speech Models via Text-Based LLMS
por: Maekaku, Takashi, et al.
Publicado: (2025)
por: Maekaku, Takashi, et al.
Publicado: (2025)
DualSpeechLM: Towards Unified Speech Understanding and Generation via Dual Speech Token Modeling with Large Language Models
por: Wang, Yuanyuan, et al.
Publicado: (2025)
por: Wang, Yuanyuan, et al.
Publicado: (2025)
MSceneSpeech: A Multi-Scene Speech Dataset For Expressive Speech Synthesis
por: Yang, Qian, et al.
Publicado: (2024)
por: Yang, Qian, et al.
Publicado: (2024)
Evaluating Speech Enhancement Systems Through Listening Effort
por: Gelderblom, Femke B., et al.
Publicado: (2024)
por: Gelderblom, Femke B., et al.
Publicado: (2024)
SonicSense: Object Perception from In-Hand Acoustic Vibration
por: Liu, Jiaxun, et al.
Publicado: (2024)
por: Liu, Jiaxun, et al.
Publicado: (2024)
EmoQ: Speech Emotion Recognition via Speech-Aware Q-Former and Large Language Model
por: Yang, Yiqing, et al.
Publicado: (2025)
por: Yang, Yiqing, et al.
Publicado: (2025)
S2ST-Omni: Hierarchical Language-Aware SpeechLLM Adaptation for Multilingual Speech-to-Speech Translation
por: Pan, Yu, et al.
Publicado: (2025)
por: Pan, Yu, et al.
Publicado: (2025)
Zero Shot Text to Speech Augmentation for Automatic Speech Recognition on Low-Resource Accented Speech Corpora
por: Nespoli, Francesco, et al.
Publicado: (2024)
por: Nespoli, Francesco, et al.
Publicado: (2024)
Self-Supervised Speech Quality Assessment (S3QA): Leveraging Speech Foundation Models for a Scalable Speech Quality Metric
por: Ogg, Mattson, et al.
Publicado: (2025)
por: Ogg, Mattson, et al.
Publicado: (2025)
A Neural Speech Codec for Noise Robust Speech Coding
por: Huang, Jiayi, et al.
Publicado: (2023)
por: Huang, Jiayi, et al.
Publicado: (2023)
Robust Speech Recognition with Schrödinger Bridge-Based Speech Enhancement
por: Nasretdinov, Rauf, et al.
Publicado: (2025)
por: Nasretdinov, Rauf, et al.
Publicado: (2025)
TraceableSpeech: Towards Proactively Traceable Text-to-Speech with Watermarking
por: Zhou, Junzuo, et al.
Publicado: (2024)
por: Zhou, Junzuo, et al.
Publicado: (2024)
FleSpeech: Flexibly Controllable Speech Generation with Various Prompts
por: Li, Hanzhao, et al.
Publicado: (2025)
por: Li, Hanzhao, et al.
Publicado: (2025)
Textless and Non-Parallel Speech-to-Speech Emotion Style Transfer
por: Dutta, Soumya, et al.
Publicado: (2025)
por: Dutta, Soumya, et al.
Publicado: (2025)
NAST: Noise Aware Speech Tokenization for Speech Language Models
por: Messica, Shoval, et al.
Publicado: (2024)
por: Messica, Shoval, et al.
Publicado: (2024)
LiveSpeech: Low-Latency Zero-shot Text-to-Speech via Autoregressive Modeling of Audio Discrete Codes
por: Dang, Trung, et al.
Publicado: (2024)
por: Dang, Trung, et al.
Publicado: (2024)
Low-latency Speech Enhancement via Speech Token Generation
por: Xue, Huaying, et al.
Publicado: (2023)
por: Xue, Huaying, et al.
Publicado: (2023)
Distinguishing Neural Speech Synthesis Models Through Fingerprints in Speech Waveforms
por: Zhang, Chu Yuan, et al.
Publicado: (2023)
por: Zhang, Chu Yuan, et al.
Publicado: (2023)
Analysis of Self-Supervised Speech Models on Children's Speech and Infant Vocalizations
por: Li, Jialu, et al.
Publicado: (2024)
por: Li, Jialu, et al.
Publicado: (2024)
Advancing Electrolaryngeal Speech Enhancement Through Speech-Text Representation Learning
por: Ma, Ding, et al.
Publicado: (2026)
por: Ma, Ding, et al.
Publicado: (2026)
Efficient Long-Form Speech Recognition for General Speech In-Context Learning
por: Yen, Hao, et al.
Publicado: (2024)
por: Yen, Hao, et al.
Publicado: (2024)
Comparison of Speech Tasks in Human Expert and Machine Detection of Parkinson's Disease
por: Plantinga, Peter, et al.
Publicado: (2025)
por: Plantinga, Peter, et al.
Publicado: (2025)
Unsupervised Multi-channel Speech Dereverberation via Diffusion
por: Wu, Yulun, et al.
Publicado: (2025)
por: Wu, Yulun, et al.
Publicado: (2025)
MiniMax-Speech: Intrinsic Zero-Shot Text-to-Speech with a Learnable Speaker Encoder
por: Zhang, Bowen, et al.
Publicado: (2025)
por: Zhang, Bowen, et al.
Publicado: (2025)
In-Materia Speech Recognition
por: Zolfagharinejad, Mohamadreza, et al.
Publicado: (2024)
por: Zolfagharinejad, Mohamadreza, et al.
Publicado: (2024)
DrawSpeech: Expressive Speech Synthesis Using Prosodic Sketches as Control Conditions
por: Chen, Weidong, et al.
Publicado: (2025)
por: Chen, Weidong, et al.
Publicado: (2025)
Continual Test-time Adaptation for End-to-end Speech Recognition on Noisy Speech
por: Lin, Guan-Ting, et al.
Publicado: (2024)
por: Lin, Guan-Ting, et al.
Publicado: (2024)
Using Speech Foundational Models in Loss Functions for Hearing Aid Speech Enhancement
por: Sutherland, Robert, et al.
Publicado: (2024)
por: Sutherland, Robert, et al.
Publicado: (2024)
ShiftySpeech: A Large-Scale Synthetic Speech Dataset with Distribution Shifts
por: Garg, Ashi, et al.
Publicado: (2025)
por: Garg, Ashi, et al.
Publicado: (2025)
ToneUnit: A Speech Discretization Approach for Tonal Language Speech Synthesis
por: Tao, Dehua, et al.
Publicado: (2024)
por: Tao, Dehua, et al.
Publicado: (2024)
Ejemplares similares
-
Automated speech audiometry: Can it work using open-source pre-trained Kaldi-NL automatic speech recognition?
por: Araiza-Illan, Gloria, et al.
Publicado: (2023) -
Theoretical Framework for the Optimization of Microphone Array Configuration for Humanoid Robot Audition
por: Tourbabin, Vladimir, et al.
Publicado: (2024) -
Direction of Arrival Estimation Using Microphone Array Processing for Moving Humanoid Robots
por: Tourbabin, Vladimir, et al.
Publicado: (2024) -
Personalized Speech Emotion Recognition in Human-Robot Interaction using Vision Transformers
por: Mishra, Ruchik, et al.
Publicado: (2024) -
Long-Term, Store-Front Robotics: Interactive Music for Robotic Arm, Caxixi and Frame Drums
por: Savery, Richard, et al.
Publicado: (2024)