Discrete optimal transport is a strong audio adversarial attack
Fuente:
arXiv
Guardado en:
| Autores principales: | Selitskiy, Anton, Shahriyar, Akib, Prakasan, Jishnuraj |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Discrete Optimal Transport and Voice Conversion
por: Selitskiy, Anton, et al.
Publicado: (2025)
por: Selitskiy, Anton, et al.
Publicado: (2025)
Mellow: a small audio language model for reasoning
por: Deshmukh, Soham, et al.
Publicado: (2025)
por: Deshmukh, Soham, et al.
Publicado: (2025)
ADIFF: Explaining audio difference using natural language
por: Deshmukh, Soham, et al.
Publicado: (2025)
por: Deshmukh, Soham, et al.
Publicado: (2025)
To what extent can ASV systems naturally defend against spoofing attacks?
por: Jung, Jee-weon, et al.
Publicado: (2024)
por: Jung, Jee-weon, et al.
Publicado: (2024)
AudioMAE++: learning better masked audio representations with SwiGLU FFNs
por: Yadav, Sarthak, et al.
Publicado: (2025)
por: Yadav, Sarthak, et al.
Publicado: (2025)
GRAM: Spatial general-purpose audio representation models for real-world applications
por: Yuksel, Goksenin, et al.
Publicado: (2025)
por: Yuksel, Goksenin, et al.
Publicado: (2025)
Making deep neural networks work for medical audio: representation, compression and domain adaptation
por: Onu, Charles C
Publicado: (2025)
por: Onu, Charles C
Publicado: (2025)
An overview of neural architectures for self-supervised audio representation learning from masked spectrograms
por: Yadav, Sarthak, et al.
Publicado: (2025)
por: Yadav, Sarthak, et al.
Publicado: (2025)
AISTAT lab system for DCASE2025 Task6: Language-based audio retrieval
por: Kim, Hyun Jun, et al.
Publicado: (2025)
por: Kim, Hyun Jun, et al.
Publicado: (2025)
Enhanced Sound Event Localization and Detection in Real 360-degree audio-visual soundscapes
por: Roman, Adrian S., et al.
Publicado: (2024)
por: Roman, Adrian S., et al.
Publicado: (2024)
DualSpec: Text-to-spatial-audio Generation via Dual-Spectrogram Guided Diffusion Model
por: Zhao, Lei, et al.
Publicado: (2025)
por: Zhao, Lei, et al.
Publicado: (2025)
Where are we in audio deepfake detection? A systematic analysis over generative and detection models
por: Li, Xiang, et al.
Publicado: (2024)
por: Li, Xiang, et al.
Publicado: (2024)
Omni-CLST: Error-aware Curriculum Learning with guided Selective chain-of-Thought for audio question answering
por: Zhao, Jinghua, et al.
Publicado: (2025)
por: Zhao, Jinghua, et al.
Publicado: (2025)
A sound description: Exploring prompt templates and class descriptions to enhance zero-shot audio classification
por: Olvera, Michel, et al.
Publicado: (2024)
por: Olvera, Michel, et al.
Publicado: (2024)
Spectrogram features for audio and speech analysis
por: McLoughlin, Ian, et al.
Publicado: (2026)
por: McLoughlin, Ian, et al.
Publicado: (2026)
Sustaining model performance for covid-19 detection from dynamic audio data: Development and evaluation of a comprehensive drift-adaptive framework
por: Ganitidis, Theofanis, et al.
Publicado: (2024)
por: Ganitidis, Theofanis, et al.
Publicado: (2024)
Discriminating real and synthetic super-resolved audio samples using embedding-based classifiers
por: Silaev, Mikhail, et al.
Publicado: (2026)
por: Silaev, Mikhail, et al.
Publicado: (2026)
The X-LANCE Technical Report for Interspeech 2024 Speech Processing Using Discrete Speech Unit Challenge
por: Guo, Yiwei, et al.
Publicado: (2024)
por: Guo, Yiwei, et al.
Publicado: (2024)
DASB - Discrete Audio and Speech Benchmark
por: Mousavi, Pooneh, et al.
Publicado: (2024)
por: Mousavi, Pooneh, et al.
Publicado: (2024)
Recomposer: Event-roll-guided generative audio editing
por: Ellis, Daniel P. W., et al.
Publicado: (2025)
por: Ellis, Daniel P. W., et al.
Publicado: (2025)
Controllable Accent Normalization via Discrete Diffusion
por: Bai, Qibing, et al.
Publicado: (2026)
por: Bai, Qibing, et al.
Publicado: (2026)
Forensic deepfake audio detection using segmental speech features
por: Yang, Tianle, et al.
Publicado: (2025)
por: Yang, Tianle, et al.
Publicado: (2025)
NatureLM-audio: an Audio-Language Foundation Model for Bioacoustics
por: Robinson, David, et al.
Publicado: (2024)
por: Robinson, David, et al.
Publicado: (2024)
Decoding Order Matters in Autoregressive Speech Synthesis
por: Zhao, Minghui, et al.
Publicado: (2026)
por: Zhao, Minghui, et al.
Publicado: (2026)
LSCodec: Low-Bitrate and Speaker-Decoupled Discrete Speech Codec
por: Guo, Yiwei, et al.
Publicado: (2024)
por: Guo, Yiwei, et al.
Publicado: (2024)
Speech-to-Speech Translation with Discrete-Unit-Based Style Transfer
por: Wang, Yongqi, et al.
Publicado: (2023)
por: Wang, Yongqi, et al.
Publicado: (2023)
Exploring bat song syllable representations in self-supervised audio encoders
por: Kloots, Marianne de Heer, et al.
Publicado: (2024)
por: Kloots, Marianne de Heer, et al.
Publicado: (2024)
End-to-end audio-visual learning for cochlear implant sound coding simulations in noisy environments
por: Lin, Meng-Ping, et al.
Publicado: (2025)
por: Lin, Meng-Ping, et al.
Publicado: (2025)
AEROMamba: An efficient architecture for audio super-resolution using generative adversarial networks and state space models
por: Abreu, Wallace, et al.
Publicado: (2024)
por: Abreu, Wallace, et al.
Publicado: (2024)
MUGEN: Evaluating and Improving Multi-audio Understanding of Large Audio-Language Models
por: Yang, Chih-Kai, et al.
Publicado: (2026)
por: Yang, Chih-Kai, et al.
Publicado: (2026)
Beyond Discrete Categories: Multi-Task Valence-Arousal Modeling for Pet Vocalization Analysis
por: Huang, Junyao, et al.
Publicado: (2025)
por: Huang, Junyao, et al.
Publicado: (2025)
HH-Codec: High Compression High-fidelity Discrete Neural Codec for Spoken Language Modeling
por: Xue, Rongkun, et al.
Publicado: (2025)
por: Xue, Rongkun, et al.
Publicado: (2025)
Discl-VC: Disentangled Discrete Tokens and In-Context Learning for Controllable Zero-Shot Voice Conversion
por: Wang, Kaidi, et al.
Publicado: (2025)
por: Wang, Kaidi, et al.
Publicado: (2025)
Composer Style-specific Symbolic Music Generation Using Vector Quantized Discrete Diffusion Models
por: Zhang, Jincheng, et al.
Publicado: (2023)
por: Zhang, Jincheng, et al.
Publicado: (2023)
vec2wav 2.0: Advancing Voice Conversion via Discrete Token Vocoders
por: Guo, Yiwei, et al.
Publicado: (2024)
por: Guo, Yiwei, et al.
Publicado: (2024)
Supervised contrastive learning from weakly-labeled audio segments for musical version matching
por: Serrà, Joan, et al.
Publicado: (2025)
por: Serrà, Joan, et al.
Publicado: (2025)
Discriminant audio properties in deep learning based respiratory insufficiency detection in Brazilian Portuguese
por: Gauy, Marcelo Matheus, et al.
Publicado: (2024)
por: Gauy, Marcelo Matheus, et al.
Publicado: (2024)
DurFlex-EVC: Duration-Flexible Emotional Voice Conversion Leveraging Discrete Representations without Text Alignment
por: Oh, Hyung-Seok, et al.
Publicado: (2024)
por: Oh, Hyung-Seok, et al.
Publicado: (2024)
Bahasa Harmony: A Comprehensive Dataset for Bahasa Text-to-Speech Synthesis with Discrete Codec Modeling of EnGen-TTS
por: Susladkar, Onkar Kishor, et al.
Publicado: (2024)
por: Susladkar, Onkar Kishor, et al.
Publicado: (2024)
Online incremental learning for audio classification using a pretrained audio model
por: Mulimani, Manjunath, et al.
Publicado: (2025)
por: Mulimani, Manjunath, et al.
Publicado: (2025)
Ejemplares similares
-
Discrete Optimal Transport and Voice Conversion
por: Selitskiy, Anton, et al.
Publicado: (2025) -
Mellow: a small audio language model for reasoning
por: Deshmukh, Soham, et al.
Publicado: (2025) -
ADIFF: Explaining audio difference using natural language
por: Deshmukh, Soham, et al.
Publicado: (2025) -
To what extent can ASV systems naturally defend against spoofing attacks?
por: Jung, Jee-weon, et al.
Publicado: (2024) -
AudioMAE++: learning better masked audio representations with SwiGLU FFNs
por: Yadav, Sarthak, et al.
Publicado: (2025)