Human or Machine? A Preliminary Turing Test for Speech-to-Speech Interaction
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Xiang, Gao, Jiabao, Lin, Sipei, Zhou, Xuan, Zhang, Chi, Cheng, Bo, Han, Jiale, Wang, Benyou |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Soundwave: Less is More for Speech-Text Alignment in LLMs
por: Zhang, Yuhao, et al.
Publicado: (2025)
por: Zhang, Yuhao, et al.
Publicado: (2025)
EchoX: Towards Mitigating Acoustic-Semantic Gap via Echo Training for Speech-to-Speech LLMs
por: Zhang, Yuhao, et al.
Publicado: (2025)
por: Zhang, Yuhao, et al.
Publicado: (2025)
SLM-SS: Speech Language Model for Generative Speech Separation
por: Li, Tianhua, et al.
Publicado: (2026)
por: Li, Tianhua, et al.
Publicado: (2026)
SpeechJudge: Towards Human-Level Judgment for Speech Naturalness
por: Zhang, Xueyao, et al.
Publicado: (2025)
por: Zhang, Xueyao, et al.
Publicado: (2025)
Interactive ASR: Towards Human-Like Interaction and Semantic Coherence Evaluation for Agentic Speech Recognition
por: Wang, Peng, et al.
Publicado: (2026)
por: Wang, Peng, et al.
Publicado: (2026)
SlimSpeech: Lightweight and Efficient Text-to-Speech with Slim Rectified Flow
por: Wang, Kaidi, et al.
Publicado: (2025)
por: Wang, Kaidi, et al.
Publicado: (2025)
Fake Speech Wild: Detecting Deepfake Speech on Social Media Platform
por: Xie, Yuankun, et al.
Publicado: (2025)
por: Xie, Yuankun, et al.
Publicado: (2025)
Audio Turing Test: Benchmarking the Human-likeness of Large Language Model-based Text-to-Speech Systems in Chinese
por: Wang, Xihuai, et al.
Publicado: (2025)
por: Wang, Xihuai, et al.
Publicado: (2025)
Speech-DRAME: A Framework for Human-Aligned Benchmarks in Speech Role-Play
por: Shi, Jiatong, et al.
Publicado: (2025)
por: Shi, Jiatong, et al.
Publicado: (2025)
Leveraging Unit Language Guidance to Advance Speech Modeling in Textless Speech-to-Speech Translation
por: Zhang, Yuhao, et al.
Publicado: (2025)
por: Zhang, Yuhao, et al.
Publicado: (2025)
UniSS: Unified Expressive Speech-to-Speech Translation with Your Voice
por: Cheng, Sitong, et al.
Publicado: (2025)
por: Cheng, Sitong, et al.
Publicado: (2025)
EMO-TTA: Improving Test-Time Adaptation of Audio-Language Models for Speech Emotion Recognition
por: Shi, Jiacheng, et al.
Publicado: (2025)
por: Shi, Jiacheng, et al.
Publicado: (2025)
MF-Speech: Achieving Fine-Grained and Compositional Control in Speech Generation via Factor Disentanglement
por: Yu, Xinyue, et al.
Publicado: (2025)
por: Yu, Xinyue, et al.
Publicado: (2025)
DDSP-QbE++: Improving Speech Quality for Speech Anonymisation for Atypical Speech
por: Ghosh, Suhita, et al.
Publicado: (2026)
por: Ghosh, Suhita, et al.
Publicado: (2026)
Roadmap towards Superhuman Speech Understanding using Large Language Models
por: Bu, Fan, et al.
Publicado: (2024)
por: Bu, Fan, et al.
Publicado: (2024)
GSRM: Generative Speech Reward Model for Speech RLHF
por: Shen, Maohao, et al.
Publicado: (2026)
por: Shen, Maohao, et al.
Publicado: (2026)
Unveiling the Best Practices for Applying Speech Foundation Models to Speech Intelligibility Prediction for Hearing-Impaired People
por: Zhou, Haoshuai, et al.
Publicado: (2025)
por: Zhou, Haoshuai, et al.
Publicado: (2025)
SyncSpeech: Efficient and Low-Latency Text-to-Speech based on Temporal Masked Transformer
por: Sheng, Zhengyan, et al.
Publicado: (2025)
por: Sheng, Zhengyan, et al.
Publicado: (2025)
Towards Explicit Acoustic Evidence Perception in Audio LLMs for Speech Deepfake Detection
por: Guo, Xiaoxuan, et al.
Publicado: (2026)
por: Guo, Xiaoxuan, et al.
Publicado: (2026)
Understanding Frechet Speech Distance for Synthetic Speech Quality Evaluation
por: Kim, June-Woo, et al.
Publicado: (2026)
por: Kim, June-Woo, et al.
Publicado: (2026)
ActorMind: Emulating Human Actor Reasoning for Speech Role-Playing
por: Chen, Xi, et al.
Publicado: (2026)
por: Chen, Xi, et al.
Publicado: (2026)
Towards Robust Speech Deepfake Detection via Human-Inspired Reasoning
por: Dvirniak, Artem, et al.
Publicado: (2026)
por: Dvirniak, Artem, et al.
Publicado: (2026)
Large Speech Model Enabled Semantic Communication
por: Tian, Yun, et al.
Publicado: (2025)
por: Tian, Yun, et al.
Publicado: (2025)
Dynamic Fusion Multimodal Network for SpeechWellness Detection
por: Sun, Wenqiang, et al.
Publicado: (2025)
por: Sun, Wenqiang, et al.
Publicado: (2025)
SpeechQualityLLM: LLM-Based Multimodal Assessment of Speech Quality
por: Monjur, Mahathir, et al.
Publicado: (2025)
por: Monjur, Mahathir, et al.
Publicado: (2025)
Quantize More, Lose Less: Autoregressive Generation from Residually Quantized Speech Representations
por: Han, Yichen, et al.
Publicado: (2025)
por: Han, Yichen, et al.
Publicado: (2025)
An Effective Context-Balanced Adaptation Approach for Long-Tailed Speech Recognition
por: Wang, Yi-Cheng, et al.
Publicado: (2024)
por: Wang, Yi-Cheng, et al.
Publicado: (2024)
Enabling Automatic Disordered Speech Recognition: An Impaired Speech Dataset in the Akan Language
por: Wiafe, Isaac, et al.
Publicado: (2026)
por: Wiafe, Isaac, et al.
Publicado: (2026)
PSCodec: A Series of High-Fidelity Low-bitrate Neural Speech Codecs Leveraging Prompt Encoders
por: Pan, Yu, et al.
Publicado: (2024)
por: Pan, Yu, et al.
Publicado: (2024)
Speech-Audio Compositional Attacks on Multimodal LLMs and Their Mitigation with SALMONN-Guard
por: Yang, Yudong, et al.
Publicado: (2025)
por: Yang, Yudong, et al.
Publicado: (2025)
Clustering and Mining Accented Speech for Inclusive and Fair Speech Recognition
por: Kim, Jaeyoung, et al.
Publicado: (2024)
por: Kim, Jaeyoung, et al.
Publicado: (2024)
MoVE: Translating Laughter and Tears via Mixture of Vocalization Experts in Speech-to-Speech Translation
por: Chen, Szu-Chi, et al.
Publicado: (2026)
por: Chen, Szu-Chi, et al.
Publicado: (2026)
AST: Adaptive, Seamless, and Training-Free Precise Speech Editing
por: Lv, Sihan, et al.
Publicado: (2026)
por: Lv, Sihan, et al.
Publicado: (2026)
ArtiFree: Detecting and Reducing Generative Artifacts in Diffusion-based Speech Enhancement
por: Chhaglani, Bhawana, et al.
Publicado: (2025)
por: Chhaglani, Bhawana, et al.
Publicado: (2025)
Speech-to-Speech Translation with Discrete-Unit-Based Style Transfer
por: Wang, Yongqi, et al.
Publicado: (2023)
por: Wang, Yongqi, et al.
Publicado: (2023)
EmoSpeech: A Corpus of Emotionally Rich and Contextually Detailed Speech Annotations
por: Bian, Weizhen, et al.
Publicado: (2024)
por: Bian, Weizhen, et al.
Publicado: (2024)
Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding
por: Lin, Zijian, et al.
Publicado: (2025)
por: Lin, Zijian, et al.
Publicado: (2025)
No Audiogram: Leveraging Existing Scores for Personalized Speech Intelligibility Prediction
por: Zhou, Haoshuai, et al.
Publicado: (2025)
por: Zhou, Haoshuai, et al.
Publicado: (2025)
Continuous Telemonitoring of Heart Failure using Personalised Speech Dynamics
por: Pan, Yue, et al.
Publicado: (2026)
por: Pan, Yue, et al.
Publicado: (2026)
DialogueAgents: A Hybrid Agent-Based Speech Synthesis Framework for Multi-Party Dialogue
por: Li, Xiang, et al.
Publicado: (2025)
por: Li, Xiang, et al.
Publicado: (2025)
Ejemplares similares
-
Soundwave: Less is More for Speech-Text Alignment in LLMs
por: Zhang, Yuhao, et al.
Publicado: (2025) -
EchoX: Towards Mitigating Acoustic-Semantic Gap via Echo Training for Speech-to-Speech LLMs
por: Zhang, Yuhao, et al.
Publicado: (2025) -
SLM-SS: Speech Language Model for Generative Speech Separation
por: Li, Tianhua, et al.
Publicado: (2026) -
SpeechJudge: Towards Human-Level Judgment for Speech Naturalness
por: Zhang, Xueyao, et al.
Publicado: (2025) -
Interactive ASR: Towards Human-Like Interaction and Semantic Coherence Evaluation for Agentic Speech Recognition
por: Wang, Peng, et al.
Publicado: (2026)