EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing
Fuente:
arXiv
Guardado en:
| Autores principales: | Sioros, Vassilis, Potamianos, Alexandros, Paraskevopoulos, Giorgos |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Perceptual Musical Features for Interpretable Audio Tagging
por: Lyberatos, Vassilis, et al.
Publicado: (2023)
por: Lyberatos, Vassilis, et al.
Publicado: (2023)
MSDA: Combining Pseudo-labeling and Self-Supervision for Unsupervised Domain Adaptation in ASR
por: Damianos, Dimitrios, et al.
Publicado: (2025)
por: Damianos, Dimitrios, et al.
Publicado: (2025)
Go witheFlow: Real-time Emotion Driven Audio Effects Modulation
por: Dervakos, Edmund, et al.
Publicado: (2025)
por: Dervakos, Edmund, et al.
Publicado: (2025)
CultureMERT: Continual Pre-Training for Cross-Cultural Music Representation Learning
por: Kanatas, Angelos-Nikolaos, et al.
Publicado: (2025)
por: Kanatas, Angelos-Nikolaos, et al.
Publicado: (2025)
SonoEdit: Null-Space Constrained Knowledge Editing for Pronunciation Correction in LLM-Based TTS
por: Singh, Ayush Pratap, et al.
Publicado: (2026)
por: Singh, Ayush Pratap, et al.
Publicado: (2026)
MLCA-AVSR: Multi-Layer Cross Attention Fusion based Audio-Visual Speech Recognition
por: Wang, He, et al.
Publicado: (2024)
por: Wang, He, et al.
Publicado: (2024)
Arrange, Inpaint, and Refine: Steerable Long-term Music Audio Generation and Editing via Content-based Controls
por: Lin, Liwei, et al.
Publicado: (2024)
por: Lin, Liwei, et al.
Publicado: (2024)
LC-Protonets: Multi-Label Few-Shot Learning for World Music Audio Tagging
por: Papaioannou, Charilaos, et al.
Publicado: (2024)
por: Papaioannou, Charilaos, et al.
Publicado: (2024)
MusiConGen: Rhythm and Chord Control for Transformer-Based Text-to-Music Generation
por: Lan, Yun-Han, et al.
Publicado: (2024)
por: Lan, Yun-Han, et al.
Publicado: (2024)
Audio Prompt Adapter: Unleashing Music Editing Abilities for Text-to-Music with Lightweight Finetuning
por: Tsai, Fang-Duo, et al.
Publicado: (2024)
por: Tsai, Fang-Duo, et al.
Publicado: (2024)
HierCon: Hierarchical Contrastive Attention for Audio Deepfake Detection
por: Liang, Zhili Nicholas, et al.
Publicado: (2026)
por: Liang, Zhili Nicholas, et al.
Publicado: (2026)
Towards Attention-based Contrastive Learning for Audio Spoof Detection
por: Goel, Chirag, et al.
Publicado: (2024)
por: Goel, Chirag, et al.
Publicado: (2024)
AHAMask: Reliable Task Specification for Large Audio Language Models without Instructions
por: Guo, Yiwei, et al.
Publicado: (2025)
por: Guo, Yiwei, et al.
Publicado: (2025)
Cross-Domain Audio Deepfake Detection: Dataset and Analysis
por: Li, Yuang, et al.
Publicado: (2024)
por: Li, Yuang, et al.
Publicado: (2024)
Enhancing Partially Spoofed Audio Localization with Boundary-aware Attention Mechanism
por: Zhong, Jiafeng, et al.
Publicado: (2024)
por: Zhong, Jiafeng, et al.
Publicado: (2024)
Towards Controllable Audio Texture Morphing
por: Gupta, Chitralekha, et al.
Publicado: (2023)
por: Gupta, Chitralekha, et al.
Publicado: (2023)
JASTIN: Aligning LLMs for Zero-Shot Audio and Speech Evaluation via Natural Language Instructions
por: Zhang, Leying, et al.
Publicado: (2026)
por: Zhang, Leying, et al.
Publicado: (2026)
Guiding Audio Editing with Audio Language Model
por: Lan, Zitong, et al.
Publicado: (2025)
por: Lan, Zitong, et al.
Publicado: (2025)
Plug-and-Play Co-Occurring Face Attention for Robust Audio-Visual Speaker Extraction
por: Pan, Zexu, et al.
Publicado: (2025)
por: Pan, Zexu, et al.
Publicado: (2025)
Generalizable Audio-Visual Navigation via Binaural Difference Attention and Action Transition Prediction
por: Li, Jia, et al.
Publicado: (2026)
por: Li, Jia, et al.
Publicado: (2026)
AudioGenX: Explainability on Text-to-Audio Generative Models
por: Kang, Hyunju, et al.
Publicado: (2025)
por: Kang, Hyunju, et al.
Publicado: (2025)
Cross-Attention with Confidence Weighting for Multi-Channel Audio Alignment
por: Nihal, Ragib Amin, et al.
Publicado: (2025)
por: Nihal, Ragib Amin, et al.
Publicado: (2025)
MusicLIME: Explainable Multimodal Music Understanding
por: Sotirou, Theodoros, et al.
Publicado: (2024)
por: Sotirou, Theodoros, et al.
Publicado: (2024)
AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder
por: Sadok, Samir, et al.
Publicado: (2025)
por: Sadok, Samir, et al.
Publicado: (2025)
Fundamental Survey on Neuromorphic Based Audio Classification
por: Basu, Amlan, et al.
Publicado: (2025)
por: Basu, Amlan, et al.
Publicado: (2025)
Audio Mamba: Pretrained Audio State Space Model For Audio Tagging
por: Lin, Jiaju, et al.
Publicado: (2024)
por: Lin, Jiaju, et al.
Publicado: (2024)
CORD: Bridging the Audio-Text Reasoning Gap via Weighted On-policy Cross-modal Distillation
por: Hu, Jing, et al.
Publicado: (2026)
por: Hu, Jing, et al.
Publicado: (2026)
LoSATok: Low-dimensional Semantic-Acoustic Tokenizer for Cross-Domain Audio Understanding and Generation
por: Zhang, Zhisheng, et al.
Publicado: (2026)
por: Zhang, Zhisheng, et al.
Publicado: (2026)
NeuroSpex: Neuro-Guided Speaker Extraction with Cross-Modal Attention
por: De Silva, Dashanka, et al.
Publicado: (2024)
por: De Silva, Dashanka, et al.
Publicado: (2024)
Audio Atlas: Visualizing and Exploring Audio Datasets
por: Lanzendörfer, Luca A., et al.
Publicado: (2024)
por: Lanzendörfer, Luca A., et al.
Publicado: (2024)
Region-Based Optimization in Continual Learning for Audio Deepfake Detection
por: Chen, Yujie, et al.
Publicado: (2024)
por: Chen, Yujie, et al.
Publicado: (2024)
Example-Based Framework for Perceptually Guided Audio Texture Generation
por: Kamath, Purnima, et al.
Publicado: (2023)
por: Kamath, Purnima, et al.
Publicado: (2023)
Representation-Regularized Convolutional Audio Transformer for Audio Understanding
por: Han, Bing, et al.
Publicado: (2026)
por: Han, Bing, et al.
Publicado: (2026)
Audio Spatially-Guided Fusion for Audio-Visual Navigation
por: Zhou, Xinyu, et al.
Publicado: (2026)
por: Zhou, Xinyu, et al.
Publicado: (2026)
EnCLAP: Combining Neural Audio Codec and Audio-Text Joint Embedding for Automated Audio Captioning
por: Kim, Jaeyeon, et al.
Publicado: (2024)
por: Kim, Jaeyeon, et al.
Publicado: (2024)
AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion
por: Zhao, Junqi, et al.
Publicado: (2025)
por: Zhao, Junqi, et al.
Publicado: (2025)
DreamAudio: Customized Text-to-Audio Generation with Diffusion Models
por: Yuan, Yi, et al.
Publicado: (2025)
por: Yuan, Yi, et al.
Publicado: (2025)
Comprehensive Evaluation of CNN-Based Audio Tagging Models on Resource-Constrained Devices
por: Grau-Haro, Jordi, et al.
Publicado: (2025)
por: Grau-Haro, Jordi, et al.
Publicado: (2025)
Audio Mamba: Bidirectional State Space Model for Audio Representation Learning
por: Erol, Mehmet Hamza, et al.
Publicado: (2024)
por: Erol, Mehmet Hamza, et al.
Publicado: (2024)
AudioScene: Integrating Object-Event Audio into 3D Scenes
por: Yuan, Shuaihang, et al.
Publicado: (2025)
por: Yuan, Shuaihang, et al.
Publicado: (2025)
Ejemplares similares
-
Perceptual Musical Features for Interpretable Audio Tagging
por: Lyberatos, Vassilis, et al.
Publicado: (2023) -
MSDA: Combining Pseudo-labeling and Self-Supervision for Unsupervised Domain Adaptation in ASR
por: Damianos, Dimitrios, et al.
Publicado: (2025) -
Go witheFlow: Real-time Emotion Driven Audio Effects Modulation
por: Dervakos, Edmund, et al.
Publicado: (2025) -
CultureMERT: Continual Pre-Training for Cross-Cultural Music Representation Learning
por: Kanatas, Angelos-Nikolaos, et al.
Publicado: (2025) -
SonoEdit: Null-Space Constrained Knowledge Editing for Pronunciation Correction in LLM-Based TTS
por: Singh, Ayush Pratap, et al.
Publicado: (2026)