Guardado en:
| Autores principales: | Zhang, Yucong, Zou, Xin, Yang, Jinshan, Chen, Wenjun, Liu, Juan, Liang, Faya, Li, Ming |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2409.03597 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Toward Multimodal Industrial Fault Analysis: A Single-Speed Chain Conveyor Dataset with Audio and Vibration Signals
por: Chen, Zhang, et al.
Publicado: (2026)
por: Chen, Zhang, et al.
Publicado: (2026)
Enhancing Child Vocalization Classification with Phonetically-Tuned Embeddings for Assisting Autism Diagnosis
por: Li, Jialu, et al.
Publicado: (2023)
por: Li, Jialu, et al.
Publicado: (2023)
Mel-RoFormer for Vocal Separation and Vocal Melody Transcription
por: Wang, Ju-Chiang, et al.
Publicado: (2024)
por: Wang, Ju-Chiang, et al.
Publicado: (2024)
Analysis of Self-Supervised Speech Models on Children's Speech and Infant Vocalizations
por: Li, Jialu, et al.
Publicado: (2024)
por: Li, Jialu, et al.
Publicado: (2024)
ECHO: Frequency-aware Hierarchical Encoding for Variable-length Signals
por: Zhang, Yucong, et al.
Publicado: (2025)
por: Zhang, Yucong, et al.
Publicado: (2025)
CVSM: Contrastive Vocal Similarity Modeling
por: Garoufis, Christos, et al.
Publicado: (2025)
por: Garoufis, Christos, et al.
Publicado: (2025)
RMVPE: A Robust Model for Vocal Pitch Estimation in Polyphonic Music
por: Wei, Haojie, et al.
Publicado: (2023)
por: Wei, Haojie, et al.
Publicado: (2023)
Biodenoising: Animal Vocalization Denoising without Access to Clean Data
por: Miron, Marius, et al.
Publicado: (2024)
por: Miron, Marius, et al.
Publicado: (2024)
VocalAgent: Large Language Models for Vocal Health Diagnostics with Safety-Aware Evaluation
por: Kim, Yubin, et al.
Publicado: (2025)
por: Kim, Yubin, et al.
Publicado: (2025)
Melodic and Metrical Elements of Expressiveness in Hindustani Vocal Music
por: Bhake, Yash, et al.
Publicado: (2025)
por: Bhake, Yash, et al.
Publicado: (2025)
Auditory Representation Effective for Estimating Vocal Tract Information
por: Irino, Toshio, et al.
Publicado: (2023)
por: Irino, Toshio, et al.
Publicado: (2023)
Spectral Mapping of Singing Voices: U-Net-Assisted Vocal Segmentation
por: Sorrenti, Adam
Publicado: (2024)
por: Sorrenti, Adam
Publicado: (2024)
HSDreport: Heart Sound Diagnosis with Echocardiography Reports
por: Zhao, Zihan, et al.
Publicado: (2024)
por: Zhao, Zihan, et al.
Publicado: (2024)
A Reliable and Efficient Detection Pipeline for Rodent Ultrasonic Vocalizations
por: Anis, Sabah Shahnoor, et al.
Publicado: (2025)
por: Anis, Sabah Shahnoor, et al.
Publicado: (2025)
Drum-to-Vocal Percussion Sound Conversion and Its Evaluation Methodology
por: Nobukawa, Rinka, et al.
Publicado: (2025)
por: Nobukawa, Rinka, et al.
Publicado: (2025)
DJCM: A Deep Joint Cascade Model for Singing Voice Separation and Vocal Pitch Estimation
por: Wei, Haojie, et al.
Publicado: (2024)
por: Wei, Haojie, et al.
Publicado: (2024)
voc2vec: A Foundation Model for Non-Verbal Vocalization
por: Koudounas, Alkis, et al.
Publicado: (2025)
por: Koudounas, Alkis, et al.
Publicado: (2025)
Hearing Health in Home Healthcare: Leveraging LLMs for Illness Scoring and ALMs for Vocal Biomarker Extraction
por: Chen, Yu-Wen, et al.
Publicado: (2025)
por: Chen, Yu-Wen, et al.
Publicado: (2025)
Learning Vocal-Tract Area and Radiation with a Physics-Informed Webster Model
por: Lu, Minhui, et al.
Publicado: (2026)
por: Lu, Minhui, et al.
Publicado: (2026)
DiffVox: A Differentiable Model for Capturing and Analysing Vocal Effects Distributions
por: Yu, Chin-Yun, et al.
Publicado: (2025)
por: Yu, Chin-Yun, et al.
Publicado: (2025)
Improving Audio-Text Retrieval via Hierarchical Cross-Modal Interaction and Auxiliary Captions
por: Xin, Yifei, et al.
Publicado: (2023)
por: Xin, Yifei, et al.
Publicado: (2023)
PoolingVQ: A VQVAE Variant for Reducing Audio Redundancy and Boosting Multi-Modal Fusion in Music Emotion Analysis
por: Zou, Dinghao, et al.
Publicado: (2025)
por: Zou, Dinghao, et al.
Publicado: (2025)
Live Vocal Extraction from K-pop Performances
por: Kim, Yujin, et al.
Publicado: (2025)
por: Kim, Yujin, et al.
Publicado: (2025)
Relating the Neural Representations of Vocalized, Mimed, and Imagined Speech
por: Maghsoudi, Maryam, et al.
Publicado: (2026)
por: Maghsoudi, Maryam, et al.
Publicado: (2026)
Computational Extraction of Intonation and Tuning Systems from Multiple Microtonal Monophonic Vocal Recordings with Diverse Modes
por: Shafiei, Sepideh, et al.
Publicado: (2025)
por: Shafiei, Sepideh, et al.
Publicado: (2025)
Audio-text Retrieval with Transformer-based Hierarchical Alignment and Disentangled Cross-modal Representation
por: Xin, Yifei, et al.
Publicado: (2024)
por: Xin, Yifei, et al.
Publicado: (2024)
Extract and Diffuse: Latent Integration for Improved Diffusion-based Speech and Vocal Enhancement
por: Yang, Yudong, et al.
Publicado: (2024)
por: Yang, Yudong, et al.
Publicado: (2024)
Temporally Heterogeneous Graph Contrastive Learning for Multimodal Acoustic event Classification
por: Chen, Yuanjian, et al.
Publicado: (2025)
por: Chen, Yuanjian, et al.
Publicado: (2025)
Beyond Acoustic Sparsity and Linguistic Bias: A Prompt-Free Paradigm for Mispronunciation Detection and Diagnosis
por: Geng, Haopeng, et al.
Publicado: (2026)
por: Geng, Haopeng, et al.
Publicado: (2026)
MNV-17: A High-Quality Performative Mandarin Dataset for Nonverbal Vocalization Recognition in Speech
por: Mai, Jialong, et al.
Publicado: (2025)
por: Mai, Jialong, et al.
Publicado: (2025)
Towards the Synthesis of Non-speech Vocalizations
por: Hoq, Enjamamul, et al.
Publicado: (2024)
por: Hoq, Enjamamul, et al.
Publicado: (2024)
Bird Vocalization Embedding Extraction Using Self-Supervised Disentangled Representation Learning
por: Shi, Runwu, et al.
Publicado: (2024)
por: Shi, Runwu, et al.
Publicado: (2024)
VocalCrypt: Novel Active Defense Against Deepfake Voice Based on Masking Effect
por: Fei, Qingyuan, et al.
Publicado: (2025)
por: Fei, Qingyuan, et al.
Publicado: (2025)
DiveSound: LLM-Assisted Automatic Taxonomy Construction for Diverse Audio Generation
por: Li, Baihan, et al.
Publicado: (2024)
por: Li, Baihan, et al.
Publicado: (2024)
Transfer Learning in Vocal Education: Technical Evaluation of Limited Samples Describing Mezzo-soprano
por: Hou, Zhenyi, et al.
Publicado: (2024)
por: Hou, Zhenyi, et al.
Publicado: (2024)
Learning Physiology-Informed Vocal Spectrotemporal Representations for Speech Emotion Recognition
por: Zhang, Xu, et al.
Publicado: (2026)
por: Zhang, Xu, et al.
Publicado: (2026)
Beyond Discrete Categories: Multi-Task Valence-Arousal Modeling for Pet Vocalization Analysis
por: Huang, Junyao, et al.
Publicado: (2025)
por: Huang, Junyao, et al.
Publicado: (2025)
Few-Shot Bioacoustic Event Detection with Frame-Level Embedding Learning System
por: Zhao, PengYuan, et al.
Publicado: (2024)
por: Zhao, PengYuan, et al.
Publicado: (2024)
FADI-AEC: Fast Score Based Diffusion Model Guided by Far-end Signal for Acoustic Echo Cancellation
por: Liu, Yang, et al.
Publicado: (2024)
por: Liu, Yang, et al.
Publicado: (2024)
Semantically consistent Video-to-Audio Generation using Multimodal Language Large Model
por: Chen, Gehui, et al.
Publicado: (2024)
por: Chen, Gehui, et al.
Publicado: (2024)
Ejemplares similares
-
Toward Multimodal Industrial Fault Analysis: A Single-Speed Chain Conveyor Dataset with Audio and Vibration Signals
por: Chen, Zhang, et al.
Publicado: (2026) -
Enhancing Child Vocalization Classification with Phonetically-Tuned Embeddings for Assisting Autism Diagnosis
por: Li, Jialu, et al.
Publicado: (2023) -
Mel-RoFormer for Vocal Separation and Vocal Melody Transcription
por: Wang, Ju-Chiang, et al.
Publicado: (2024) -
Analysis of Self-Supervised Speech Models on Children's Speech and Infant Vocalizations
por: Li, Jialu, et al.
Publicado: (2024) -
ECHO: Frequency-aware Hierarchical Encoding for Variable-length Signals
por: Zhang, Yucong, et al.
Publicado: (2025)