Pitch Contour Exploration Across Audio Domains: A Vision-Based Transfer Learning Approach
Fuente:
arXiv
Salvato in:
| Autori principali: | Abeßer, Jakob, Schwär, Simon, Müller, Meinard |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Harmonic Summation-Based Robust Pitch Estimation in Noisy and Reverberant Environments
di: Singh, Anup, et al.
Pubblicazione: (2025)
di: Singh, Anup, et al.
Pubblicazione: (2025)
Neurodyne: Neural Pitch Manipulation with Representation Learning and Cycle-Consistency GAN
di: Gu, Yicheng, et al.
Pubblicazione: (2025)
di: Gu, Yicheng, et al.
Pubblicazione: (2025)
Visual and audio scene classification for detecting discrepancies in video: a baseline method and experimental protocol
di: Apostolidis, Konstantinos, et al.
Pubblicazione: (2024)
di: Apostolidis, Konstantinos, et al.
Pubblicazione: (2024)
Adversarial Multi-Task Learning for Disentangling Timbre and Pitch in Singing Voice Synthesis
di: Kim, Tae-Woo, et al.
Pubblicazione: (2022)
di: Kim, Tae-Woo, et al.
Pubblicazione: (2022)
Improving Neural Pitch Estimation with SWIPE Kernels
di: Marttila, David, et al.
Pubblicazione: (2025)
di: Marttila, David, et al.
Pubblicazione: (2025)
Cross-domain Neural Pitch and Periodicity Estimation
di: Morrison, Max, et al.
Pubblicazione: (2023)
di: Morrison, Max, et al.
Pubblicazione: (2023)
Transferable Adversarial Attacks on Audio Deepfake Detection
di: Farooq, Muhammad Umar, et al.
Pubblicazione: (2025)
di: Farooq, Muhammad Umar, et al.
Pubblicazione: (2025)
Domain Adaptation for Contrastive Audio-Language Models
di: Deshmukh, Soham, et al.
Pubblicazione: (2024)
di: Deshmukh, Soham, et al.
Pubblicazione: (2024)
CONTUNER: Singing Voice Beautifying with Pitch and Expressiveness Condition
di: Wang, Jianzong, et al.
Pubblicazione: (2024)
di: Wang, Jianzong, et al.
Pubblicazione: (2024)
Refining Knowledge Transfer on Audio-Image Temporal Agreement for Audio-Text Cross Retrieval
di: Tsubaki, Shunsuke, et al.
Pubblicazione: (2024)
di: Tsubaki, Shunsuke, et al.
Pubblicazione: (2024)
A Transversal Study of Fundamental Frequency Contours in Parkinsonian Voices
di: Rodriguez-Perez, Pablo, et al.
Pubblicazione: (2024)
di: Rodriguez-Perez, Pablo, et al.
Pubblicazione: (2024)
RMVPE: A Robust Model for Vocal Pitch Estimation in Polyphonic Music
di: Wei, Haojie, et al.
Pubblicazione: (2023)
di: Wei, Haojie, et al.
Pubblicazione: (2023)
Pitch Imperfect: Detecting Audio Deepfakes Through Acoustic Prosodic Analysis
di: Warren, Kevin, et al.
Pubblicazione: (2025)
di: Warren, Kevin, et al.
Pubblicazione: (2025)
Decoding Speaker-Normalized Pitch from EEG for Mandarin Perception
di: Chen, Jiaxin, et al.
Pubblicazione: (2025)
di: Chen, Jiaxin, et al.
Pubblicazione: (2025)
PESTO: Pitch Estimation with Self-supervised Transposition-equivariant Objective
di: Riou, Alain, et al.
Pubblicazione: (2023)
di: Riou, Alain, et al.
Pubblicazione: (2023)
Periodicity Pitch Detection in Complex Harmonies on EEG Timeline Data
di: Heinze, Maria, et al.
Pubblicazione: (2020)
di: Heinze, Maria, et al.
Pubblicazione: (2020)
A Lightweight Slot-Attention Framework for Multi-Instrument Multi-Pitch Estimation
di: Taenzer, Michael
Pubblicazione: (2026)
di: Taenzer, Michael
Pubblicazione: (2026)
Janssen 2.0: Audio Inpainting in the Time-frequency Domain
di: Mokrý, Ondřej, et al.
Pubblicazione: (2024)
di: Mokrý, Ondřej, et al.
Pubblicazione: (2024)
Audio Inpainting in Time-Frequency Domain with Phase-Aware Prior
di: Balušík, Peter, et al.
Pubblicazione: (2026)
di: Balušík, Peter, et al.
Pubblicazione: (2026)
AudioEditor: A Training-Free Diffusion-Based Audio Editing Framework
di: Jia, Yuhang, et al.
Pubblicazione: (2024)
di: Jia, Yuhang, et al.
Pubblicazione: (2024)
Audio Avatar Fingerprinting: An Approach for Authorized Use of Voice Cloning in the Era of Synthetic Audio
di: Gerstner, Candice R.
Pubblicazione: (2026)
di: Gerstner, Candice R.
Pubblicazione: (2026)
UniCodec: Unified Audio Codec with Single Domain-Adaptive Codebook
di: Jiang, Yidi, et al.
Pubblicazione: (2025)
di: Jiang, Yidi, et al.
Pubblicazione: (2025)
Multimodal Assessment of Speech Impairment in ALS Using Audio-Visual and Machine Learning Approaches
di: Pierotti, Francesco, et al.
Pubblicazione: (2025)
di: Pierotti, Francesco, et al.
Pubblicazione: (2025)
Enhancing Expressive Voice Conversion with Discrete Pitch-Conditioned Flow Matching Model
di: Zuo, Jialong, et al.
Pubblicazione: (2025)
di: Zuo, Jialong, et al.
Pubblicazione: (2025)
Gaussian Flow Bridges for Audio Domain Transfer with Unpaired Data
di: Moliner, Eloi, et al.
Pubblicazione: (2024)
di: Moliner, Eloi, et al.
Pubblicazione: (2024)
Noise-Robust DSP-Assisted Neural Pitch Estimation with Very Low Complexity
di: Subramani, Krishna, et al.
Pubblicazione: (2023)
di: Subramani, Krishna, et al.
Pubblicazione: (2023)
TSE-PI: Target Sound Extraction under Reverberant Environments with Pitch Information
di: Wang, Yiwen, et al.
Pubblicazione: (2024)
di: Wang, Yiwen, et al.
Pubblicazione: (2024)
Pitch-and-Spectrum-Aware Singing Quality Assessment with Bias Correction and Model Fusion
di: Shi, Yu-Fei, et al.
Pubblicazione: (2024)
di: Shi, Yu-Fei, et al.
Pubblicazione: (2024)
DJCM: A Deep Joint Cascade Model for Singing Voice Separation and Vocal Pitch Estimation
di: Wei, Haojie, et al.
Pubblicazione: (2024)
di: Wei, Haojie, et al.
Pubblicazione: (2024)
Vision Language Models Are Few-Shot Audio Spectrogram Classifiers
di: Dixit, Satvik, et al.
Pubblicazione: (2024)
di: Dixit, Satvik, et al.
Pubblicazione: (2024)
Continuous Audio Language Models
di: Rouard, Simon, et al.
Pubblicazione: (2025)
di: Rouard, Simon, et al.
Pubblicazione: (2025)
Diffusion-Based Audio Inpainting
di: Moliner, Eloi, et al.
Pubblicazione: (2023)
di: Moliner, Eloi, et al.
Pubblicazione: (2023)
AudioCIL: A Python Toolbox for Audio Class-Incremental Learning with Multiple Scenes
di: Xu, Qisheng, et al.
Pubblicazione: (2024)
di: Xu, Qisheng, et al.
Pubblicazione: (2024)
ST-ITO: Controlling Audio Effects for Style Transfer with Inference-Time Optimization
di: Steinmetz, Christian J., et al.
Pubblicazione: (2024)
di: Steinmetz, Christian J., et al.
Pubblicazione: (2024)
STFTCodec: High-Fidelity Audio Compression through Time-Frequency Domain Representation
di: Feng, Tao, et al.
Pubblicazione: (2025)
di: Feng, Tao, et al.
Pubblicazione: (2025)
SONAR: Self-Distilled Continual Pre-training for Domain Adaptive Audio Representation
di: Zhang, Yizhou, et al.
Pubblicazione: (2025)
di: Zhang, Yizhou, et al.
Pubblicazione: (2025)
ControlVC: Zero-Shot Voice Conversion with Time-Varying Controls on Pitch and Speed
di: Chen, Meiying, et al.
Pubblicazione: (2022)
di: Chen, Meiying, et al.
Pubblicazione: (2022)
Leveraging Mamba with Full-Face Vision for Audio-Visual Speech Enhancement
di: Chao, Rong, et al.
Pubblicazione: (2025)
di: Chao, Rong, et al.
Pubblicazione: (2025)
MLAAD: The Multi-Language Audio Anti-Spoofing Dataset
di: Müller, Nicolas M., et al.
Pubblicazione: (2024)
di: Müller, Nicolas M., et al.
Pubblicazione: (2024)
Compositional Audio Representation Learning
di: Sridhar, Sripathi, et al.
Pubblicazione: (2024)
di: Sridhar, Sripathi, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Harmonic Summation-Based Robust Pitch Estimation in Noisy and Reverberant Environments
di: Singh, Anup, et al.
Pubblicazione: (2025) -
Neurodyne: Neural Pitch Manipulation with Representation Learning and Cycle-Consistency GAN
di: Gu, Yicheng, et al.
Pubblicazione: (2025) -
Visual and audio scene classification for detecting discrepancies in video: a baseline method and experimental protocol
di: Apostolidis, Konstantinos, et al.
Pubblicazione: (2024) -
Adversarial Multi-Task Learning for Disentangling Timbre and Pitch in Singing Voice Synthesis
di: Kim, Tae-Woo, et al.
Pubblicazione: (2022) -
Improving Neural Pitch Estimation with SWIPE Kernels
di: Marttila, David, et al.
Pubblicazione: (2025)