Predicting Global HRTFs From Scanned Head Geometry Using Deep Learning and Compact Representations
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Yuxiang, Zhang, You, Duan, Zhiyao, Bocko, Mark |
|---|---|
| Formato: | Preprint |
| Publicado: |
2022
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
A Probabilistic Fusion Framework for Spoofing Aware Speaker Verification
por: Zhang, You, et al.
Publicado: (2022)
por: Zhang, You, et al.
Publicado: (2022)
Towards Perception-Informed Latent HRTF Representations
por: Zhang, You, et al.
Publicado: (2025)
por: Zhang, You, et al.
Publicado: (2025)
PartialEdit: Identifying Partial Deepfakes in the Era of Neural Speech Editing
por: Zhang, You, et al.
Publicado: (2025)
por: Zhang, You, et al.
Publicado: (2025)
UR Channel-Robust Synthetic Speech Detection System for ASVspoof 2021
por: Chen, Xinhui, et al.
Publicado: (2021)
por: Chen, Xinhui, et al.
Publicado: (2021)
An Empirical Study on Channel Effects for Synthetic Voice Spoofing Countermeasure Systems
por: Zhang, You, et al.
Publicado: (2021)
por: Zhang, You, et al.
Publicado: (2021)
ControlVC: Zero-Shot Voice Conversion with Time-Varying Controls on Pitch and Speed
por: Chen, Meiying, et al.
Publicado: (2022)
por: Chen, Meiying, et al.
Publicado: (2022)
A Multi-Stream Fusion Approach with One-Class Learning for Audio-Visual Deepfake Detection
por: Lee, Kyungbok, et al.
Publicado: (2024)
por: Lee, Kyungbok, et al.
Publicado: (2024)
Generating Novel and Realistic Speakers for Voice Conversion
por: Chen, Meiying Melissa, et al.
Publicado: (2025)
por: Chen, Meiying Melissa, et al.
Publicado: (2025)
Cacophony: An Improved Contrastive Audio-Text Model
por: Zhu, Ge, et al.
Publicado: (2024)
por: Zhu, Ge, et al.
Publicado: (2024)
Audio Generation Through Score-Based Generative Modeling: Design Principles and Implementation
por: Zhu, Ge, et al.
Publicado: (2025)
por: Zhu, Ge, et al.
Publicado: (2025)
A Data-Driven Exploration of Elevation Cues in HRTFs: An Explainable AI Perspective Across Multiple Datasets
por: De Rus, Juan Antonio, et al.
Publicado: (2025)
por: De Rus, Juan Antonio, et al.
Publicado: (2025)
SingFake: Singing Voice Deepfake Detection
por: Zang, Yongyi, et al.
Publicado: (2023)
por: Zang, Yongyi, et al.
Publicado: (2023)
Overview of Speaker Modeling and Its Applications: From the Lens of Deep Speaker Representation Learning
por: Wang, Shuai, et al.
Publicado: (2024)
por: Wang, Shuai, et al.
Publicado: (2024)
SVDD 2024: The Inaugural Singing Voice Deepfake Detection Challenge
por: Zhang, You, et al.
Publicado: (2024)
por: Zhang, You, et al.
Publicado: (2024)
EchoScan: Scanning Complex Room Geometries via Acoustic Echoes
por: Yeon, Inmo, et al.
Publicado: (2023)
por: Yeon, Inmo, et al.
Publicado: (2023)
Compositional Audio Representation Learning
por: Sridhar, Sripathi, et al.
Publicado: (2024)
por: Sridhar, Sripathi, et al.
Publicado: (2024)
Head-Related Transfer Function Individualization Using Anthropometric Features and Spatially Independent Latent Representation
por: Niu, Ryan, et al.
Publicado: (2025)
por: Niu, Ryan, et al.
Publicado: (2025)
Scoring Time Intervals using Non-Hierarchical Transformer For Automatic Piano Transcription
por: Yan, Yujia, et al.
Publicado: (2024)
por: Yan, Yujia, et al.
Publicado: (2024)
Toward Fully Self-Supervised Multi-Pitch Estimation
por: Cwitkowitz, Frank, et al.
Publicado: (2024)
por: Cwitkowitz, Frank, et al.
Publicado: (2024)
Investigating an Overfitting and Degeneration Phenomenon in Self-Supervised Multi-Pitch Estimation
por: Cwitkowitz, Frank, et al.
Publicado: (2025)
por: Cwitkowitz, Frank, et al.
Publicado: (2025)
Conan: A Chunkwise Online Network for Zero-Shot Adaptive Voice Conversion
por: Zhang, Yu, et al.
Publicado: (2025)
por: Zhang, Yu, et al.
Publicado: (2025)
MusicHiFi: Fast High-Fidelity Stereo Vocoding
por: Zhu, Ge, et al.
Publicado: (2024)
por: Zhu, Ge, et al.
Publicado: (2024)
Sound Field Reconstruction Using a Compact Acoustics-informed Neural Network
por: Ma, Fei, et al.
Publicado: (2024)
por: Ma, Fei, et al.
Publicado: (2024)
Head Orientation Estimation with Distributed Microphones Using Speech Radiation Patterns
por: Müller, Kaspar, et al.
Publicado: (2023)
por: Müller, Kaspar, et al.
Publicado: (2023)
Learning Disentangled Speech Representations with Contrastive Learning and Time-Invariant Retrieval
por: Deng, Yimin, et al.
Publicado: (2024)
por: Deng, Yimin, et al.
Publicado: (2024)
Improving Short Utterance Anti-Spoofing with AASIST2
por: Zhang, Yuxiang, et al.
Publicado: (2023)
por: Zhang, Yuxiang, et al.
Publicado: (2023)
Deep Speech Synthesis from Multimodal Articulatory Representations
por: Wu, Peter, et al.
Publicado: (2024)
por: Wu, Peter, et al.
Publicado: (2024)
Selective-Memory Meta-Learning with Environment Representations for Sound Event Localization and Detection
por: Hu, Jinbo, et al.
Publicado: (2023)
por: Hu, Jinbo, et al.
Publicado: (2023)
Self-Distillation Prototypes Network: Learning Robust Speaker Representations without Supervision
por: Chen, Yafeng, et al.
Publicado: (2024)
por: Chen, Yafeng, et al.
Publicado: (2024)
Self-Distillation Prototypes Network: Learning Robust Speaker Representations without Supervision
por: Chen, Yafeng, et al.
Publicado: (2023)
por: Chen, Yafeng, et al.
Publicado: (2023)
Learning Expressive Disentangled Speech Representations with Soft Speech Units and Adversarial Style Augmentation
por: Deng, Yimin, et al.
Publicado: (2024)
por: Deng, Yimin, et al.
Publicado: (2024)
CtrSVDD: A Benchmark Dataset and Baseline Analysis for Controlled Singing Voice Deepfake Detection
por: Zang, Yongyi, et al.
Publicado: (2024)
por: Zang, Yongyi, et al.
Publicado: (2024)
Learning Arousal-Valence Representation from Categorical Emotion Labels of Speech
por: Zhou, Enting, et al.
Publicado: (2023)
por: Zhou, Enting, et al.
Publicado: (2023)
Adaptive Speech Emotion Representation Learning Based On Dynamic Graph
por: Gao, Yingxue, et al.
Publicado: (2024)
por: Gao, Yingxue, et al.
Publicado: (2024)
Generating Data with Text-to-Speech and Large-Language Models for Conversational Speech Recognition
por: Cornell, Samuele, et al.
Publicado: (2024)
por: Cornell, Samuele, et al.
Publicado: (2024)
Feasibility of Mental Health Triage Call Priority Prediction Using Machine Learning
por: Rana, Rajib, et al.
Publicado: (2024)
por: Rana, Rajib, et al.
Publicado: (2024)
Progressive Residual Extraction based Pre-training for Speech Representation Learning
por: Wang, Tianrui, et al.
Publicado: (2024)
por: Wang, Tianrui, et al.
Publicado: (2024)
ASRRL-TTS: Agile Speaker Representation Reinforcement Learning for Text-to-Speech Speaker Adaptation
por: Fu, Ruibo, et al.
Publicado: (2024)
por: Fu, Ruibo, et al.
Publicado: (2024)
Automatic Live Music Song Identification Using Multi-level Deep Sequence Similarity Learning
por: Hakala, Aapo, et al.
Publicado: (2025)
por: Hakala, Aapo, et al.
Publicado: (2025)
3D Room Geometry Inference from Multichannel Room Impulse Response using Deep Neural Network
por: Yeon, Inmo, et al.
Publicado: (2024)
por: Yeon, Inmo, et al.
Publicado: (2024)
Ejemplares similares
-
A Probabilistic Fusion Framework for Spoofing Aware Speaker Verification
por: Zhang, You, et al.
Publicado: (2022) -
Towards Perception-Informed Latent HRTF Representations
por: Zhang, You, et al.
Publicado: (2025) -
PartialEdit: Identifying Partial Deepfakes in the Era of Neural Speech Editing
por: Zhang, You, et al.
Publicado: (2025) -
UR Channel-Robust Synthetic Speech Detection System for ASVspoof 2021
por: Chen, Xinhui, et al.
Publicado: (2021) -
An Empirical Study on Channel Effects for Synthetic Voice Spoofing Countermeasure Systems
por: Zhang, You, et al.
Publicado: (2021)