Moravec's Paradox: Towards an Auditory Turing Test
Fuente:
arXiv
Guardado en:
| Autores principales: | Noever, David, McKee, Forrest |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Scaling Auditory Cognition via Test-Time Compute in Audio Language Models
por: Dang, Ting, et al.
Publicado: (2025)
por: Dang, Ting, et al.
Publicado: (2025)
Auditory Intelligence: Understanding the World Through Sound
por: Nam, Hyeonuk
Publicado: (2025)
por: Nam, Hyeonuk
Publicado: (2025)
APG-MOS: Auditory Perception Guided-MOS Predictor for Synthetic Speech
por: Lian, Zhicheng, et al.
Publicado: (2025)
por: Lian, Zhicheng, et al.
Publicado: (2025)
The MUSE Benchmark: Probing Music Perception and Auditory Relational Reasoning in Audio LLMS
por: Carone, Brandon James, et al.
Publicado: (2025)
por: Carone, Brandon James, et al.
Publicado: (2025)
A General Close-loop Predictive Coding Framework for Auditory Working Memory
por: Yuan, Zhongju, et al.
Publicado: (2025)
por: Yuan, Zhongju, et al.
Publicado: (2025)
SAKE: Towards Editing Auditory Attribute Knowledge of Large Audio-Language Models
por: Yang, Chih-Kai, et al.
Publicado: (2025)
por: Yang, Chih-Kai, et al.
Publicado: (2025)
SWIM: Short-Window CNN Integrated with Mamba for EEG-Based Auditory Spatial Attention Decoding
por: Zhang, Ziyang, et al.
Publicado: (2024)
por: Zhang, Ziyang, et al.
Publicado: (2024)
Towards Controllable Audio Texture Morphing
por: Gupta, Chitralekha, et al.
Publicado: (2023)
por: Gupta, Chitralekha, et al.
Publicado: (2023)
Decoding Ambiguous Emotions with Test-Time Scaling in Audio-Language Models
por: Jia, Hong, et al.
Publicado: (2026)
por: Jia, Hong, et al.
Publicado: (2026)
Towards Deep Active Learning in Avian Bioacoustics
por: Rauch, Lukas, et al.
Publicado: (2024)
por: Rauch, Lukas, et al.
Publicado: (2024)
ACES: Accent Subspaces for Coupling, Explanations, and Stress-Testing in Automatic Speech Recognition
por: Parekh, Swapnil
Publicado: (2026)
por: Parekh, Swapnil
Publicado: (2026)
DARNet: Dual Attention Refinement Network with Spatiotemporal Construction for Auditory Attention Detection
por: Yan, Sheng, et al.
Publicado: (2024)
por: Yan, Sheng, et al.
Publicado: (2024)
Speech Denoising with Auditory Models
por: Saddler, Mark R., et al.
Publicado: (2020)
por: Saddler, Mark R., et al.
Publicado: (2020)
TTMBA: Towards Text To Multiple Sources Binaural Audio Generation
por: He, Yuxuan, et al.
Publicado: (2025)
por: He, Yuxuan, et al.
Publicado: (2025)
FlexSED: Towards Open-Vocabulary Sound Event Detection
por: Hai, Jiarui, et al.
Publicado: (2025)
por: Hai, Jiarui, et al.
Publicado: (2025)
Towards Attention-based Contrastive Learning for Audio Spoof Detection
por: Goel, Chirag, et al.
Publicado: (2024)
por: Goel, Chirag, et al.
Publicado: (2024)
Toward Efficient Speech Emotion Recognition via Spectral Learning and Attention
por: Lee, HyeYoung, et al.
Publicado: (2025)
por: Lee, HyeYoung, et al.
Publicado: (2025)
XMusic: Towards a Generalized and Controllable Symbolic Music Generation Framework
por: Tian, Sida, et al.
Publicado: (2025)
por: Tian, Sida, et al.
Publicado: (2025)
Quantum-Inspired Audio Unlearning: Towards Privacy-Preserving Voice Biometrics
por: Pathak, Shreyansh, et al.
Publicado: (2025)
por: Pathak, Shreyansh, et al.
Publicado: (2025)
Towards Unified Music Emotion Recognition across Dimensional and Categorical Models
por: Kang, Jaeyong, et al.
Publicado: (2025)
por: Kang, Jaeyong, et al.
Publicado: (2025)
Toward end-to-end interpretable convolutional neural networks for waveform signals
por: Vu, Linh, et al.
Publicado: (2024)
por: Vu, Linh, et al.
Publicado: (2024)
Speech-Forensics: Towards Comprehensive Synthetic Speech Dataset Establishment and Analysis
por: Ji, Zhoulin, et al.
Publicado: (2024)
por: Ji, Zhoulin, et al.
Publicado: (2024)
Towards Leveraging Contrastively Pretrained Neural Audio Embeddings for Recommender Tasks
por: Grötschla, Florian, et al.
Publicado: (2024)
por: Grötschla, Florian, et al.
Publicado: (2024)
Towards Lightweight and Stable Zero-shot TTS with Self-distilled Representation Disentanglement
por: Chen, Qianniu, et al.
Publicado: (2025)
por: Chen, Qianniu, et al.
Publicado: (2025)
Neural Codec Source Tracing: Toward Comprehensive Attribution in Open-Set Condition
por: Xie, Yuankun, et al.
Publicado: (2025)
por: Xie, Yuankun, et al.
Publicado: (2025)
Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion
por: Akti, Seymanur, et al.
Publicado: (2025)
por: Akti, Seymanur, et al.
Publicado: (2025)
Does it Chug? Towards a Data-Driven Understanding of Guitar Tone Description
por: Sutar, Pratik, et al.
Publicado: (2024)
por: Sutar, Pratik, et al.
Publicado: (2024)
AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models
por: Yang, Chih-Kai, et al.
Publicado: (2025)
por: Yang, Chih-Kai, et al.
Publicado: (2025)
MELT: Towards Automated Multimodal Emotion Data Annotation by Leveraging LLM Embedded Knowledge
por: Jing, Xin, et al.
Publicado: (2025)
por: Jing, Xin, et al.
Publicado: (2025)
Towards Unified Neural Decoding of Perceived, Spoken and Imagined Speech from EEG Signals
por: Lee, Jung-Sun, et al.
Publicado: (2024)
por: Lee, Jung-Sun, et al.
Publicado: (2024)
Towards Improving NAM-to-Speech Synthesis Intelligibility using Self-Supervised Speech Models
por: Shah, Neil, et al.
Publicado: (2024)
por: Shah, Neil, et al.
Publicado: (2024)
SoulX-Singer: Towards High-Quality Zero-Shot Singing Voice Synthesis
por: Qian, Jiale, et al.
Publicado: (2026)
por: Qian, Jiale, et al.
Publicado: (2026)
Towards Effective and Efficient Non-autoregressive Decoding Using Block-based Attention Mask
por: Wang, Tianzi, et al.
Publicado: (2024)
por: Wang, Tianzi, et al.
Publicado: (2024)
CosyVoice 3: Towards In-the-wild Speech Generation via Scaling-up and Post-training
por: Du, Zhihao, et al.
Publicado: (2025)
por: Du, Zhihao, et al.
Publicado: (2025)
R2-SVC: Towards Real-World Robust and Expressive Zero-shot Singing Voice Conversion
por: Zheng, Junjie, et al.
Publicado: (2025)
por: Zheng, Junjie, et al.
Publicado: (2025)
Towards Hallucination-Free Music: A Reinforcement Learning Preference Optimization Framework for Reliable Song Generation
por: Zhang, Huaicheng, et al.
Publicado: (2025)
por: Zhang, Huaicheng, et al.
Publicado: (2025)
HQ-SVC: Towards High-Quality Zero-Shot Singing Voice Conversion in Low-Resource Scenarios
por: Bai, Bingsong, et al.
Publicado: (2025)
por: Bai, Bingsong, et al.
Publicado: (2025)
FusionAudio-1.2M: Towards Fine-grained Audio Captioning with Multimodal Contextual Fusion
por: Chen, Shunian, et al.
Publicado: (2025)
por: Chen, Shunian, et al.
Publicado: (2025)
Toward Improving Synthetic Audio Spoofing Detection Robustness via Meta-Learning and Disentangled Training With Adversarial Examples
por: Wang, Zhenyu, et al.
Publicado: (2024)
por: Wang, Zhenyu, et al.
Publicado: (2024)
Towards Enhanced Classification of Abnormal Lung sound in Multi-breath: A Light Weight Multi-label and Multi-head Attention Classification Method
por: Chua, Yi-Wei, et al.
Publicado: (2024)
por: Chua, Yi-Wei, et al.
Publicado: (2024)
Ejemplares similares
-
Scaling Auditory Cognition via Test-Time Compute in Audio Language Models
por: Dang, Ting, et al.
Publicado: (2025) -
Auditory Intelligence: Understanding the World Through Sound
por: Nam, Hyeonuk
Publicado: (2025) -
APG-MOS: Auditory Perception Guided-MOS Predictor for Synthetic Speech
por: Lian, Zhicheng, et al.
Publicado: (2025) -
The MUSE Benchmark: Probing Music Perception and Auditory Relational Reasoning in Audio LLMS
por: Carone, Brandon James, et al.
Publicado: (2025) -
A General Close-loop Predictive Coding Framework for Auditory Working Memory
por: Yuan, Zhongju, et al.
Publicado: (2025)