FxSearcher: gradient-free text-driven audio transformation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ki, Hojoon, Kim, Jongsuk, Kwon, Minchan, Kim, Junmo |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
FairASR: Fair Audio Contrastive Learning for Automatic Speech Recognition
par: Kim, Jongsuk, et autres
Publié: (2025)
par: Kim, Jongsuk, et autres
Publié: (2025)
AVCap: Leveraging Audio-Visual Features as Text Tokens for Captioning
par: Kim, Jongsuk, et autres
Publié: (2024)
par: Kim, Jongsuk, et autres
Publié: (2024)
EDTC: enhance depth of text comprehension in automated audio captioning
par: Tan, Liwen, et autres
Publié: (2024)
par: Tan, Liwen, et autres
Publié: (2024)
Data-driven grapheme-to-phoneme representations for a lexicon-free text-to-speech
par: Garg, Abhinav, et autres
Publié: (2024)
par: Garg, Abhinav, et autres
Publié: (2024)
STASE: A spatialized text-to-audio synthesis engine for music generation
par: Chi, Tutti, et autres
Publié: (2025)
par: Chi, Tutti, et autres
Publié: (2025)
RELATE: Subjective evaluation dataset for automatic evaluation of relevance between text and audio
par: Kanamori, Yusuke, et autres
Publié: (2025)
par: Kanamori, Yusuke, et autres
Publié: (2025)
Fx-Encoder++: Extracting Instrument-Wise Audio Effects Representations from Mixtures
par: Yeh, Yen-Tung, et autres
Publié: (2025)
par: Yeh, Yen-Tung, et autres
Publié: (2025)
PyNeuralFx: A Python Package for Neural Audio Effect Modeling
par: Yeh, Yen-Tung, et autres
Publié: (2024)
par: Yeh, Yen-Tung, et autres
Publié: (2024)
A Stabilized Hybrid Active Noise Control Algorithm of GFANC and FxNLMS with Online Clustering
par: Luo, Zhengding, et autres
Publié: (2026)
par: Luo, Zhengding, et autres
Publié: (2026)
Semi-intrusive audio evaluation: Casting non-intrusive assessment as a multi-modal text prediction task
par: Coldenhoff, Jozef, et autres
Publié: (2024)
par: Coldenhoff, Jozef, et autres
Publié: (2024)
Scaling up masked audio encoder learning for general audio classification
par: Dinkel, Heinrich, et autres
Publié: (2024)
par: Dinkel, Heinrich, et autres
Publié: (2024)
Synthetic training set generation using text-to-audio models for environmental sound classification
par: Ronchini, Francesca, et autres
Publié: (2024)
par: Ronchini, Francesca, et autres
Publié: (2024)
A SOUND APPROACH: Using Large Language Models to generate audio descriptions for egocentric text-audio retrieval
par: Oncescu, Andreea-Maria, et autres
Publié: (2024)
par: Oncescu, Andreea-Maria, et autres
Publié: (2024)
GLAP: General contrastive audio-text pretraining across domains and languages
par: Dinkel, Heinrich, et autres
Publié: (2025)
par: Dinkel, Heinrich, et autres
Publié: (2025)
InfiniteAudio: Infinite-Length Audio Generation with Consistency
par: Jung, Chaeyoung, et autres
Publié: (2025)
par: Jung, Chaeyoung, et autres
Publié: (2025)
Towards audio language modeling -- an overview
par: Wu, Haibin, et autres
Publié: (2024)
par: Wu, Haibin, et autres
Publié: (2024)
TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet
par: Jeong, Jaeseok, et autres
Publié: (2025)
par: Jeong, Jaeseok, et autres
Publié: (2025)
Are audio DeepFake detection models polyglots?
par: Marek, Bartłomiej, et autres
Publié: (2024)
par: Marek, Bartłomiej, et autres
Publié: (2024)
MBCodec:Thorough disentangle for high-fidelity audio compression
par: Zhang, Ruonan, et autres
Publié: (2025)
par: Zhang, Ruonan, et autres
Publié: (2025)
Real-time implementation of vibrato transfer as an audio effect
par: Hyrkas, Jeremy
Publié: (2025)
par: Hyrkas, Jeremy
Publié: (2025)
Tweaking autoregressive methods for inpainting of gaps in audio signals
par: Mokrý, Ondřej, et autres
Publié: (2024)
par: Mokrý, Ondřej, et autres
Publié: (2024)
Why some audio signal short-time Fourier transform coefficients have nonuniform phase distributions
par: Voran, Stephen D.
Publié: (2024)
par: Voran, Stephen D.
Publié: (2024)
Exploring compressibility of transformer based text-to-music (TTM) models
par: Moschopoulos, Vasileios, et autres
Publié: (2024)
par: Moschopoulos, Vasileios, et autres
Publié: (2024)
Speaker anonymization using neural audio codec language models
par: Panariello, Michele, et autres
Publié: (2023)
par: Panariello, Michele, et autres
Publié: (2023)
Regularized autoregressive modeling and its application to audio signal reconstruction
par: Mokrý, Ondřej, et autres
Publié: (2024)
par: Mokrý, Ondřej, et autres
Publié: (2024)
Deep learning based spatial aliasing reduction in beamforming for audio capture
par: Guzik, Mateusz, et autres
Publié: (2025)
par: Guzik, Mateusz, et autres
Publié: (2025)
Human-CLAP: Human-perception-based contrastive language-audio pretraining
par: Takano, Taisei, et autres
Publié: (2025)
par: Takano, Taisei, et autres
Publié: (2025)
AxLSTMs: learning self-supervised audio representations with xLSTMs
par: Yadav, Sarthak, et autres
Publié: (2024)
par: Yadav, Sarthak, et autres
Publié: (2024)
Enhancement by postfiltering for speech and audio coding in ad-hoc sensor networks
par: Das, Sneha, et autres
Publié: (2020)
par: Das, Sneha, et autres
Publié: (2020)
DashengTokenizer: One layer is enough for unified audio understanding and generation
par: Dinkel, Heinrich, et autres
Publié: (2026)
par: Dinkel, Heinrich, et autres
Publié: (2026)
Modeling strategies for speech enhancement in the latent space of a neural audio codec
par: Kammoun, Sofiene, et autres
Publié: (2025)
par: Kammoun, Sofiene, et autres
Publié: (2025)
ICGAN: An implicit conditioning method for interpretable feature control of neural audio synthesis
par: Liu, Yunyi, et autres
Publié: (2024)
par: Liu, Yunyi, et autres
Publié: (2024)
A robust audio deepfake detection system via multi-view feature
par: Yang, Yujie, et autres
Publié: (2024)
par: Yang, Yujie, et autres
Publié: (2024)
Reconstructing the Charlie Parker Omnibook using an audio-to-score automatic transcription pipeline
par: Riley, Xavier, et autres
Publié: (2024)
par: Riley, Xavier, et autres
Publié: (2024)
Exploring trends in audio mixes and masters: Insights from a dataset analysis
par: Mourgela, Angeliki, et autres
Publié: (2024)
par: Mourgela, Angeliki, et autres
Publié: (2024)
ACAVCaps: Enabling large-scale training for fine-grained and diverse audio understanding
par: Niu, Yadong, et autres
Publié: (2026)
par: Niu, Yadong, et autres
Publié: (2026)
WavJEPA: Semantic learning unlocks robust audio foundation models for raw waveforms
par: Yuksel, Goksenin, et autres
Publié: (2025)
par: Yuksel, Goksenin, et autres
Publié: (2025)
audio2chart: End to End Audio Transcription into playable Guitar Hero charts
par: Tripodi, Riccardo
Publié: (2025)
par: Tripodi, Riccardo
Publié: (2025)
A tunable binaural audio telepresence system capable of balancing immersive and enhanced modes
par: Hsu, Yicheng, et autres
Publié: (2024)
par: Hsu, Yicheng, et autres
Publié: (2024)
Codec-SUPERB @ SLT 2024: A lightweight benchmark for neural audio codec models
par: Wu, Haibin, et autres
Publié: (2024)
par: Wu, Haibin, et autres
Publié: (2024)
Documents similaires
-
FairASR: Fair Audio Contrastive Learning for Automatic Speech Recognition
par: Kim, Jongsuk, et autres
Publié: (2025) -
AVCap: Leveraging Audio-Visual Features as Text Tokens for Captioning
par: Kim, Jongsuk, et autres
Publié: (2024) -
EDTC: enhance depth of text comprehension in automated audio captioning
par: Tan, Liwen, et autres
Publié: (2024) -
Data-driven grapheme-to-phoneme representations for a lexicon-free text-to-speech
par: Garg, Abhinav, et autres
Publié: (2024) -
STASE: A spatialized text-to-audio synthesis engine for music generation
par: Chi, Tutti, et autres
Publié: (2025)