Guitar Tone Morphing by Diffusion-based Model
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chen, Kuan-Yu, Chen, Kuan-Lin, Yu, Yu-Chieh, Ding, Jian-Jiun |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Bloodroot: When Watermarking Turns Poisonous For Stealthy Backdoor
par: Chen, Kuan-Yu, et autres
Publié: (2025)
par: Chen, Kuan-Yu, et autres
Publié: (2025)
SeamlessEdit: Background Noise Aware Zero-Shot Speech Editing with in-Context Enhancement
par: Chen, Kuan-Yu, et autres
Publié: (2025)
par: Chen, Kuan-Yu, et autres
Publié: (2025)
Generation of Musical Timbres using a Text-Guided Diffusion Model
par: Yuan, Weixuan, et autres
Publié: (2025)
par: Yuan, Weixuan, et autres
Publié: (2025)
Self-Improvement for Audio Large Language Model using Unlabeled Speech
par: Wang, Shaowen, et autres
Publié: (2025)
par: Wang, Shaowen, et autres
Publié: (2025)
MAIN-VC: Lightweight Speech Representation Disentanglement for One-shot Voice Conversion
par: Li, Pengcheng, et autres
Publié: (2024)
par: Li, Pengcheng, et autres
Publié: (2024)
Window Size Versus Accuracy Experiments in Voice Activity Detectors
par: McKinnon, Max, et autres
Publié: (2026)
par: McKinnon, Max, et autres
Publié: (2026)
ParaNoise-SV: Integrated Approach for Noise-Robust Speaker Verification with Parallel Joint Learning of Speech Enhancement and Noise Extraction
par: Kim, Minu, et autres
Publié: (2025)
par: Kim, Minu, et autres
Publié: (2025)
Make Some Noise: Towards LLM audio reasoning and generation using sound tokens
par: Mehta, Shivam, et autres
Publié: (2025)
par: Mehta, Shivam, et autres
Publié: (2025)
SemAlignVC: Enhancing zero-shot timbre conversion using semantic alignment
par: Mehta, Shivam, et autres
Publié: (2025)
par: Mehta, Shivam, et autres
Publié: (2025)
SFMS-ALR: Script-First Multilingual Speech Synthesis with Adaptive Locale Resolution
par: Donepudi, Dharma Teja
Publié: (2025)
par: Donepudi, Dharma Teja
Publié: (2025)
Taming Audio VAEs via Target-KL Regularization
par: Seetharaman, Prem, et autres
Publié: (2026)
par: Seetharaman, Prem, et autres
Publié: (2026)
Should you use a probabilistic duration model in TTS? Probably! Especially for spontaneous speech
par: Mehta, Shivam, et autres
Publié: (2024)
par: Mehta, Shivam, et autres
Publié: (2024)
An audio-to-analysis pipeline with certified transcription for information-theoretic profiling of the piano repertoire
par: Jalbert-Desforges, Fred
Publié: (2026)
par: Jalbert-Desforges, Fred
Publié: (2026)
PerceiverS: A Multi-Scale Perceiver with Effective Segmentation for Long-Term Expressive Symbolic Music Generation
par: Yi, Yungang, et autres
Publié: (2024)
par: Yi, Yungang, et autres
Publié: (2024)
The Binding Effect: Analyzing How Multi-Dimensional Cues Form Gender Bias in Instruction TTS
par: Chen, Kuan-Yu, et autres
Publié: (2026)
par: Chen, Kuan-Yu, et autres
Publié: (2026)
Prevailing Research Areas for Music AI in the Era of Foundation Models
par: Wei, Megan, et autres
Publié: (2024)
par: Wei, Megan, et autres
Publié: (2024)
AURA: Agent for Understanding, Reasoning, and Automated Tool Use in Voice-Driven Tasks
par: Maben, Leander Melroy, et autres
Publié: (2025)
par: Maben, Leander Melroy, et autres
Publié: (2025)
Improving Cross-Lingual Phonetic Representation of Low-Resource Languages Through Language Similarity Analysis
par: Kim, Minu, et autres
Publié: (2025)
par: Kim, Minu, et autres
Publié: (2025)
Reciprocal Latent Fields for Precomputed Sound Propagation
par: Seuté, Hugo, et autres
Publié: (2026)
par: Seuté, Hugo, et autres
Publié: (2026)
Less Stress, More Privacy: Stress Detection on Anonymized Speech of Air Traffic Controllers
par: Viswanathan, Janaki, et autres
Publié: (2025)
par: Viswanathan, Janaki, et autres
Publié: (2025)
Deep Feed-Forward Neural Network for Bangla Isolated Speech Recognition
par: Bhadra, Dipayan, et autres
Publié: (2025)
par: Bhadra, Dipayan, et autres
Publié: (2025)
Matcha-TTS: A fast TTS architecture with conditional flow matching
par: Mehta, Shivam, et autres
Publié: (2023)
par: Mehta, Shivam, et autres
Publié: (2023)
STRUM: A Spectral Transcription and Rhythm Understanding Model for End-to-End Generation of Playable Rhythm-Game Charts
par: Opria, Joshua
Publié: (2026)
par: Opria, Joshua
Publié: (2026)
SonicVerse: Multi-Task Learning for Music Feature-Informed Captioning
par: Chopra, Anuradha, et autres
Publié: (2025)
par: Chopra, Anuradha, et autres
Publié: (2025)
Graph Connectionist Temporal Classification for Phoneme Recognition
par: Grafé, Henry, et autres
Publié: (2025)
par: Grafé, Henry, et autres
Publié: (2025)
Multi-View Multi-Task Modeling with Speech Foundation Models for Speech Forensic Tasks
par: Phukan, Orchid Chetia, et autres
Publié: (2024)
par: Phukan, Orchid Chetia, et autres
Publié: (2024)
Investigating Prosodic Signatures via Speech Pre-Trained Models for Audio Deepfake Source Attribution
par: Phukan, Orchid Chetia, et autres
Publié: (2024)
par: Phukan, Orchid Chetia, et autres
Publié: (2024)
Strong Alone, Stronger Together: Synergizing Modality-Binding Foundation Models with Optimal Transport for Non-Verbal Emotion Recognition
par: Phukan, Orchid Chetia, et autres
Publié: (2024)
par: Phukan, Orchid Chetia, et autres
Publié: (2024)
M6(GPT)3: Generating Multitrack Modifiable Multi-Minute MIDI Music from Text using Genetic algorithms, Probabilistic methods and GPT Models in any Progression and Time Signature
par: Poćwiardowski, Jakub, et autres
Publié: (2024)
par: Poćwiardowski, Jakub, et autres
Publié: (2024)
Beyond Speech and More: Investigating the Emergent Ability of Speech Foundation Models for Classifying Physiological Time-Series Signals
par: Phukan, Orchid Chetia, et autres
Publié: (2024)
par: Phukan, Orchid Chetia, et autres
Publié: (2024)
Avengers Assemble: Amalgamation of Non-Semantic Features for Depression Detection
par: Phukan, Orchid Chetia, et autres
Publié: (2024)
par: Phukan, Orchid Chetia, et autres
Publié: (2024)
SeQuiFi: Mitigating Catastrophic Forgetting in Speech Emotion Recognition with Sequential Class-Finetuning
par: Jain, Sarthak, et autres
Publié: (2024)
par: Jain, Sarthak, et autres
Publié: (2024)
Representation Loss Minimization with Randomized Selection Strategy for Efficient Environmental Fake Audio Detection
par: Phukan, Orchid Chetia, et autres
Publié: (2024)
par: Phukan, Orchid Chetia, et autres
Publié: (2024)
Quantization for OpenAI's Whisper Models: A Comparative Analysis
par: Andreyev, Allison
Publié: (2025)
par: Andreyev, Allison
Publié: (2025)
Fine-Tuning Large Audio-Language Models with LoRA for Precise Temporal Localization of Prolonged Exposure Therapy Elements
par: BN, Suhas, et autres
Publié: (2025)
par: BN, Suhas, et autres
Publié: (2025)
MaskClip: Detachable Clip-on Piezoelectric Sensing of Mask Surface Vibrations for Real-time Noise-Robust Speech Input
par: Hiraki, Hirotaka, et autres
Publié: (2025)
par: Hiraki, Hirotaka, et autres
Publié: (2025)
Matlab-based Epoch Extraction for Speaker Differentiation
par: Li, Kunlun, et autres
Publié: (2024)
par: Li, Kunlun, et autres
Publié: (2024)
The evolution of inharmonicity and noisiness in contemporary popular music
par: Deruty, Emmanuel, et autres
Publié: (2024)
par: Deruty, Emmanuel, et autres
Publié: (2024)
Are Music Foundation Models Better at Singing Voice Deepfake Detection? Far-Better Fuse them with Speech Foundation Models
par: Phukan, Orchid Chetia, et autres
Publié: (2024)
par: Phukan, Orchid Chetia, et autres
Publié: (2024)
Neural Proxies for Sound Synthesizers: Learning Perceptually Informed Preset Representations
par: Combes, Paolo, et autres
Publié: (2025)
par: Combes, Paolo, et autres
Publié: (2025)
Documents similaires
-
Bloodroot: When Watermarking Turns Poisonous For Stealthy Backdoor
par: Chen, Kuan-Yu, et autres
Publié: (2025) -
SeamlessEdit: Background Noise Aware Zero-Shot Speech Editing with in-Context Enhancement
par: Chen, Kuan-Yu, et autres
Publié: (2025) -
Generation of Musical Timbres using a Text-Guided Diffusion Model
par: Yuan, Weixuan, et autres
Publié: (2025) -
Self-Improvement for Audio Large Language Model using Unlabeled Speech
par: Wang, Shaowen, et autres
Publié: (2025) -
MAIN-VC: Lightweight Speech Representation Disentanglement for One-shot Voice Conversion
par: Li, Pengcheng, et autres
Publié: (2024)