Audio Texture Manipulation by Exemplar-Based Analogy
Fuente:
arXiv
Salvato in:
| Autori principali: | Cheng, Kan Jen, Li, Tingle, Anumanchipalli, Gopala |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Self-Supervised Audio-Visual Soundscape Stylization
di: Li, Tingle, et al.
Pubblicazione: (2024)
di: Li, Tingle, et al.
Pubblicazione: (2024)
Sounding that Object: Interactive Object-Aware Image to Audio Generation
di: Li, Tingle, et al.
Pubblicazione: (2025)
di: Li, Tingle, et al.
Pubblicazione: (2025)
Speech After Gender: A Trans-Feminine Perspective on Next Steps for Speech Science and Technology
di: Netzorg, Robin, et al.
Pubblicazione: (2024)
di: Netzorg, Robin, et al.
Pubblicazione: (2024)
Unsupervised TTS Acoustic Modeling for TTS with Conditional Disentangled Sequential VAE
di: Lian, Jiachen, et al.
Pubblicazione: (2022)
di: Lian, Jiachen, et al.
Pubblicazione: (2022)
Music Boomerang: Reusing Diffusion Models for Data Augmentation and Audio Manipulation
di: Fichtinger, Alexander, et al.
Pubblicazione: (2025)
di: Fichtinger, Alexander, et al.
Pubblicazione: (2025)
An Unsupervised Domain Adaptation Method for Locating Manipulated Region in partially fake Audio
di: Zeng, Siding, et al.
Pubblicazione: (2024)
di: Zeng, Siding, et al.
Pubblicazione: (2024)
Estimated Audio-Caption Correspondences Improve Language-Based Audio Retrieval
di: Primus, Paul, et al.
Pubblicazione: (2024)
di: Primus, Paul, et al.
Pubblicazione: (2024)
AnalyticKWS: Towards Exemplar-Free Analytic Class Incremental Learning for Small-footprint Keyword Spotting
di: Xiao, Yang, et al.
Pubblicazione: (2025)
di: Xiao, Yang, et al.
Pubblicazione: (2025)
Bridging The Multi-Modality Gaps of Audio, Visual and Linguistic for Speech Enhancement
di: Lin, Meng-Ping, et al.
Pubblicazione: (2025)
di: Lin, Meng-Ping, et al.
Pubblicazione: (2025)
Modeling Analog Dynamic Range Compressors using Deep Learning and State-space Models
di: Yin, Hanzhi, et al.
Pubblicazione: (2024)
di: Yin, Hanzhi, et al.
Pubblicazione: (2024)
A2SB: Audio-to-Audio Schrodinger Bridges
di: Kong, Zhifeng, et al.
Pubblicazione: (2025)
di: Kong, Zhifeng, et al.
Pubblicazione: (2025)
TACOS: Temporally-aligned Audio CaptiOnS for Language-Audio Pretraining
di: Primus, Paul, et al.
Pubblicazione: (2025)
di: Primus, Paul, et al.
Pubblicazione: (2025)
Zero Shot Audio to Audio Emotion Transfer With Speaker Disentanglement
di: Dutta, Soumya, et al.
Pubblicazione: (2024)
di: Dutta, Soumya, et al.
Pubblicazione: (2024)
Blind Audio Bandwidth Extension: A Diffusion-Based Zero-Shot Approach
di: Moliner, Eloi, et al.
Pubblicazione: (2023)
di: Moliner, Eloi, et al.
Pubblicazione: (2023)
Zero-Shot Unsupervised and Text-Based Audio Editing Using DDPM Inversion
di: Manor, Hila, et al.
Pubblicazione: (2024)
di: Manor, Hila, et al.
Pubblicazione: (2024)
The Rarity of Musical Audio Signals Within the Space of Possible Audio Generation
di: Collins, Nick
Pubblicazione: (2024)
di: Collins, Nick
Pubblicazione: (2024)
Fusing Audio and Metadata Embeddings Improves Language-based Audio Retrieval
di: Primus, Paul, et al.
Pubblicazione: (2024)
di: Primus, Paul, et al.
Pubblicazione: (2024)
CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer
di: Takeuchi, Daiki, et al.
Pubblicazione: (2025)
di: Takeuchi, Daiki, et al.
Pubblicazione: (2025)
Audio Match Cutting: Finding and Creating Matching Audio Transitions in Movies and Videos
di: Fedorishin, Dennis, et al.
Pubblicazione: (2024)
di: Fedorishin, Dennis, et al.
Pubblicazione: (2024)
Text-Independent Speaker Identification Using Audio Looping With Margin Based Loss Functions
di: Garcia, Elliot Q C, et al.
Pubblicazione: (2025)
di: Garcia, Elliot Q C, et al.
Pubblicazione: (2025)
An Enhanced Audio Feature Tailored for Anomalous Sound Detection Based on Pre-trained Models
di: Zhong, Guirui, et al.
Pubblicazione: (2025)
di: Zhong, Guirui, et al.
Pubblicazione: (2025)
Generating Sample-Based Musical Instruments Using Neural Audio Codec Language Models
di: Nercessian, Shahan, et al.
Pubblicazione: (2024)
di: Nercessian, Shahan, et al.
Pubblicazione: (2024)
uaMix-MAE: Efficient Tuning of Pretrained Audio Transformers with Unsupervised Audio Mixtures
di: Tabassum, Afrina, et al.
Pubblicazione: (2024)
di: Tabassum, Afrina, et al.
Pubblicazione: (2024)
Multi-bit Audio Watermarking
di: Lanzendörfer, Luca A., et al.
Pubblicazione: (2025)
di: Lanzendörfer, Luca A., et al.
Pubblicazione: (2025)
Unsupervised Composable Representations for Audio
di: Bindi, Giovanni, et al.
Pubblicazione: (2024)
di: Bindi, Giovanni, et al.
Pubblicazione: (2024)
Diffusion Models for Audio Restoration
di: Lemercier, Jean-Marie, et al.
Pubblicazione: (2024)
di: Lemercier, Jean-Marie, et al.
Pubblicazione: (2024)
Instabilities in Convnets for Raw Audio
di: Haider, Daniel, et al.
Pubblicazione: (2023)
di: Haider, Daniel, et al.
Pubblicazione: (2023)
Automatic Contextual Audio Denoising
di: Luong, Diep, et al.
Pubblicazione: (2026)
di: Luong, Diep, et al.
Pubblicazione: (2026)
"I am bad": Interpreting Stealthy, Universal and Robust Audio Jailbreaks in Audio-Language Models
di: Gupta, Isha, et al.
Pubblicazione: (2025)
di: Gupta, Isha, et al.
Pubblicazione: (2025)
Enhancing Audio-Language Models through Self-Supervised Post-Training with Text-Audio Pairs
di: Sinha, Anshuman, et al.
Pubblicazione: (2024)
di: Sinha, Anshuman, et al.
Pubblicazione: (2024)
Can Synthetic Audio From Generative Foundation Models Assist Audio Recognition and Speech Modeling?
di: Feng, Tiantian, et al.
Pubblicazione: (2024)
di: Feng, Tiantian, et al.
Pubblicazione: (2024)
Audio Flamingo: A Novel Audio Language Model with Few-Shot Learning and Dialogue Abilities
di: Kong, Zhifeng, et al.
Pubblicazione: (2024)
di: Kong, Zhifeng, et al.
Pubblicazione: (2024)
Sylber: Syllabic Embedding Representation of Speech from Raw Audio
di: Cho, Cheol Jun, et al.
Pubblicazione: (2024)
di: Cho, Cheol Jun, et al.
Pubblicazione: (2024)
Aligning Audio Captions with Human Preferences
di: Hegde, Kartik, et al.
Pubblicazione: (2025)
di: Hegde, Kartik, et al.
Pubblicazione: (2025)
Audio Decoding by Inverse Problem Solving
di: T., Pedro J. Villasana, et al.
Pubblicazione: (2024)
di: T., Pedro J. Villasana, et al.
Pubblicazione: (2024)
Does Audio Deepfake Detection Generalize?
di: Müller, Nicolas M., et al.
Pubblicazione: (2022)
di: Müller, Nicolas M., et al.
Pubblicazione: (2022)
DeCoR: Defy Knowledge Forgetting by Predicting Earlier Audio Codes
di: Jiang, Xilin, et al.
Pubblicazione: (2023)
di: Jiang, Xilin, et al.
Pubblicazione: (2023)
Geo-ATBench: A Benchmark for Geospatial Audio Tagging with Geospatial Semantic Context
di: Hou, Yuanbo, et al.
Pubblicazione: (2026)
di: Hou, Yuanbo, et al.
Pubblicazione: (2026)
Learning to Upsample and Upmix Audio in the Latent Domain
di: Bralios, Dimitrios, et al.
Pubblicazione: (2025)
di: Bralios, Dimitrios, et al.
Pubblicazione: (2025)
Audio Geolocation: A Natural Sounds Benchmark
di: Chasmai, Mustafa, et al.
Pubblicazione: (2025)
di: Chasmai, Mustafa, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Self-Supervised Audio-Visual Soundscape Stylization
di: Li, Tingle, et al.
Pubblicazione: (2024) -
Sounding that Object: Interactive Object-Aware Image to Audio Generation
di: Li, Tingle, et al.
Pubblicazione: (2025) -
Speech After Gender: A Trans-Feminine Perspective on Next Steps for Speech Science and Technology
di: Netzorg, Robin, et al.
Pubblicazione: (2024) -
Unsupervised TTS Acoustic Modeling for TTS with Conditional Disentangled Sequential VAE
di: Lian, Jiachen, et al.
Pubblicazione: (2022) -
Music Boomerang: Reusing Diffusion Models for Data Augmentation and Audio Manipulation
di: Fichtinger, Alexander, et al.
Pubblicazione: (2025)