Audio Editing with Non-Rigid Text Prompts
Fuente:
arXiv
Guardado en:
| Autores principales: | Paissan, Francesco, Della Libera, Luca, Wang, Zhepei, Ravanelli, Mirco, Smaragdis, Paris, Subakan, Cem |
|---|---|
| Formato: | Preprint |
| Publicado: |
2023
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Listenable Maps for Zero-Shot Audio Classifiers
por: Paissan, Francesco, et al.
Publicado: (2024)
por: Paissan, Francesco, et al.
Publicado: (2024)
FocalCodec: Low-Bitrate Speech Coding via Focal Modulation Networks
por: Della Libera, Luca, et al.
Publicado: (2025)
por: Della Libera, Luca, et al.
Publicado: (2025)
Listenable Maps for Audio Classifiers
por: Paissan, Francesco, et al.
Publicado: (2024)
por: Paissan, Francesco, et al.
Publicado: (2024)
Autoregressive Speech Enhancement via Acoustic Tokens
por: Della Libera, Luca, et al.
Publicado: (2025)
por: Della Libera, Luca, et al.
Publicado: (2025)
Focal Modulation Networks for Interpretable Sound Classification
por: Della Libera, Luca, et al.
Publicado: (2024)
por: Della Libera, Luca, et al.
Publicado: (2024)
FocalCodec-Stream: Streaming Low-Bitrate Speech Coding via Causal Distillation
por: Della Libera, Luca, et al.
Publicado: (2025)
por: Della Libera, Luca, et al.
Publicado: (2025)
LMAC-TD: Producing Time Domain Explanations for Audio Classifiers
por: Mancini, Eleonora, et al.
Publicado: (2024)
por: Mancini, Eleonora, et al.
Publicado: (2024)
LL-SDR: Low-Latency Speech enhancement through Discrete Representations
por: Li, Jingyi, et al.
Publicado: (2026)
por: Li, Jingyi, et al.
Publicado: (2026)
Investigating the Effectiveness of Explainability Methods in Parkinson's Detection from Speech
por: Mancini, Eleonora, et al.
Publicado: (2024)
por: Mancini, Eleonora, et al.
Publicado: (2024)
Resource-Efficient Separation Transformer
por: Della Libera, Luca, et al.
Publicado: (2022)
por: Della Libera, Luca, et al.
Publicado: (2022)
On Class Separability Pitfalls In Audio-Text Contrastive Zero-Shot Learning
por: Tavares, Tiago, et al.
Publicado: (2024)
por: Tavares, Tiago, et al.
Publicado: (2024)
LiSTEN: Learning Soft Token Embeddings for Neural Audio LLMs
por: Mousavi, Pooneh, et al.
Publicado: (2025)
por: Mousavi, Pooneh, et al.
Publicado: (2025)
DASB - Discrete Audio and Speech Benchmark
por: Mousavi, Pooneh, et al.
Publicado: (2024)
por: Mousavi, Pooneh, et al.
Publicado: (2024)
Toward Faithful Explanations in Acoustic Anomaly Detection
por: Elrashid, Maab, et al.
Publicado: (2026)
por: Elrashid, Maab, et al.
Publicado: (2026)
Exploring Token-Space Manipulation in Latent Audio Tokenizers
por: Paissan, Francesco, et al.
Publicado: (2026)
por: Paissan, Francesco, et al.
Publicado: (2026)
How Should We Extract Discrete Audio Tokens from Self-Supervised Models?
por: Mousavi, Pooneh, et al.
Publicado: (2024)
por: Mousavi, Pooneh, et al.
Publicado: (2024)
Listen First, Then Answer: Timestamp-Grounded Speech Reasoning
por: Jeong, Jihoon, et al.
Publicado: (2026)
por: Jeong, Jihoon, et al.
Publicado: (2026)
ALAS: Measuring Latent Speech-Text Alignment For Spoken Language Understanding In Multimodal LLMs
por: Mousavi, Pooneh, et al.
Publicado: (2025)
por: Mousavi, Pooneh, et al.
Publicado: (2025)
Learning to Upsample and Upmix Audio in the Latent Domain
por: Bralios, Dimitrios, et al.
Publicado: (2025)
por: Bralios, Dimitrios, et al.
Publicado: (2025)
Investigating Faithfulness in Large Audio Language Models
por: Mousavi, Pooneh, et al.
Publicado: (2025)
por: Mousavi, Pooneh, et al.
Publicado: (2025)
Re-Bottleneck: Latent Re-Structuring for Neural Audio Autoencoders
por: Bralios, Dimitrios, et al.
Publicado: (2025)
por: Bralios, Dimitrios, et al.
Publicado: (2025)
Phoneme Discretized Saliency Maps for Explainable Detection of AI-Generated Voice
por: Gupta, Shubham, et al.
Publicado: (2024)
por: Gupta, Shubham, et al.
Publicado: (2024)
Dynamic HumTrans: Humming Transcription Using CNNs and Dynamic Programming
por: Gupta, Shubham, et al.
Publicado: (2024)
por: Gupta, Shubham, et al.
Publicado: (2024)
Virtual Consistency for Audio Editing
por: Cervera, Matthieu, et al.
Publicado: (2025)
por: Cervera, Matthieu, et al.
Publicado: (2025)
Rethinking Non-Negative Matrix Factorization with Implicit Neural Representations
por: Subramani, Krishna, et al.
Publicado: (2024)
por: Subramani, Krishna, et al.
Publicado: (2024)
Combolutional Neural Networks
por: Churchwell, Cameron, et al.
Publicado: (2025)
por: Churchwell, Cameron, et al.
Publicado: (2025)
Adaptive Slimming for Scalable and Efficient Speech Enhancement
por: Miccini, Riccardo, et al.
Publicado: (2025)
por: Miccini, Riccardo, et al.
Publicado: (2025)
tinyCLAP: Distilling Constrastive Language-Audio Pretrained Models
por: Paissan, Francesco, et al.
Publicado: (2023)
por: Paissan, Francesco, et al.
Publicado: (2023)
Sound Source Separation Using Latent Variational Block-Wise Disentanglement
por: Helwani, Karim, et al.
Publicado: (2024)
por: Helwani, Karim, et al.
Publicado: (2024)
SKILL: Similarity-aware Knowledge distILLation for Speech Self-Supervised Learning
por: Zampierin, Luca, et al.
Publicado: (2024)
por: Zampierin, Luca, et al.
Publicado: (2024)
Beyond Fixed Frames: Dynamic Character-Aligned Speech Tokenization
por: Della Libera, Luca, et al.
Publicado: (2026)
por: Della Libera, Luca, et al.
Publicado: (2026)
PromptSep: Generative Audio Separation via Multimodal Prompting
por: Wen, Yutong, et al.
Publicado: (2025)
por: Wen, Yutong, et al.
Publicado: (2025)
Speech Self-Supervised Representations Benchmarking: a Case for Larger Probing Heads
por: Zaiem, Salah, et al.
Publicado: (2023)
por: Zaiem, Salah, et al.
Publicado: (2023)
Zero-Shot Unsupervised and Text-Based Audio Editing Using DDPM Inversion
por: Manor, Hila, et al.
Publicado: (2024)
por: Manor, Hila, et al.
Publicado: (2024)
WavSLM: Single-Stream Speech Language Modeling via WavLM Distillation
por: Della Libera, Luca, et al.
Publicado: (2026)
por: Della Libera, Luca, et al.
Publicado: (2026)
Scaling Up Adaptive Filter Optimizers
por: Casebeer, Jonah, et al.
Publicado: (2024)
por: Casebeer, Jonah, et al.
Publicado: (2024)
Prompt-guided Precise Audio Editing with Diffusion Models
por: Xu, Manjie, et al.
Publicado: (2024)
por: Xu, Manjie, et al.
Publicado: (2024)
ProGRes: Prompted Generative Rescoring on ASR n-Best
por: Tur, Ada Defne, et al.
Publicado: (2024)
por: Tur, Ada Defne, et al.
Publicado: (2024)
What Are They Doing? Joint Audio-Speech Co-Reasoning
por: Wang, Yingzhi, et al.
Publicado: (2024)
por: Wang, Yingzhi, et al.
Publicado: (2024)
Gencho: Room Impulse Response Generation from Reverberant Speech and Text via Diffusion Transformers
por: Lin, Jackie, et al.
Publicado: (2026)
por: Lin, Jackie, et al.
Publicado: (2026)
Ejemplares similares
-
Listenable Maps for Zero-Shot Audio Classifiers
por: Paissan, Francesco, et al.
Publicado: (2024) -
FocalCodec: Low-Bitrate Speech Coding via Focal Modulation Networks
por: Della Libera, Luca, et al.
Publicado: (2025) -
Listenable Maps for Audio Classifiers
por: Paissan, Francesco, et al.
Publicado: (2024) -
Autoregressive Speech Enhancement via Acoustic Tokens
por: Della Libera, Luca, et al.
Publicado: (2025) -
Focal Modulation Networks for Interpretable Sound Classification
por: Della Libera, Luca, et al.
Publicado: (2024)