RawTFNet: A Lightweight CNN Architecture for Speech Anti-spoofing
Fuente:
arXiv
Salvato in:
| Autori principali: | Xiao, Yang, Dang, Ting, Das, Rohan Kumar |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Nes2Net: A Lightweight Nested Architecture for Foundation Model Driven Speech Anti-spoofing
di: Liu, Tianchi, et al.
Pubblicazione: (2025)
di: Liu, Tianchi, et al.
Pubblicazione: (2025)
Amplifying Artifacts with Speech Enhancement in Voice Anti-spoofing
di: Trachu, Thanapat, et al.
Pubblicazione: (2025)
di: Trachu, Thanapat, et al.
Pubblicazione: (2025)
TF-Mamba: A Time-Frequency Network for Sound Source Localization
di: Xiao, Yang, et al.
Pubblicazione: (2024)
di: Xiao, Yang, et al.
Pubblicazione: (2024)
XLSR-Mamba: A Dual-Column Bidirectional State Space Model for Spoofing Attack Detection
di: Xiao, Yang, et al.
Pubblicazione: (2024)
di: Xiao, Yang, et al.
Pubblicazione: (2024)
Listen, Analyze, and Adapt to Learn New Attacks: An Exemplar-Free Class Incremental Learning Method for Audio Deepfake Source Tracing
di: Xiao, Yang, et al.
Pubblicazione: (2025)
di: Xiao, Yang, et al.
Pubblicazione: (2025)
Where's That Voice Coming? Continual Learning for Sound Source Localization
di: Xiao, Yang, et al.
Pubblicazione: (2024)
di: Xiao, Yang, et al.
Pubblicazione: (2024)
UCIL: An Unsupervised Class Incremental Learning Approach for Sound Event Detection
di: Xiao, Yang, et al.
Pubblicazione: (2024)
di: Xiao, Yang, et al.
Pubblicazione: (2024)
WildDESED: An LLM-Powered Dataset for Wild Domestic Environment Sound Event Detection System
di: Xiao, Yang, et al.
Pubblicazione: (2024)
di: Xiao, Yang, et al.
Pubblicazione: (2024)
Multi-modal Speech Enhancement with Limited Electromyography Channels
di: Feng, Fuyuan, et al.
Pubblicazione: (2025)
di: Feng, Fuyuan, et al.
Pubblicazione: (2025)
Rethinking Continual Learning for Speech and Audio: A Representation-Centric Taxonomy and Open Problems
di: Xiao, Yang, et al.
Pubblicazione: (2026)
di: Xiao, Yang, et al.
Pubblicazione: (2026)
Can Emotion Fool Anti-spoofing?
di: Mahapatra, Aurosweta, et al.
Pubblicazione: (2025)
di: Mahapatra, Aurosweta, et al.
Pubblicazione: (2025)
CompSpoof: A Dataset and Joint Learning Framework for Component-Level Audio Anti-spoofing Countermeasures
di: Zhang, Xueping, et al.
Pubblicazione: (2025)
di: Zhang, Xueping, et al.
Pubblicazione: (2025)
Multilingual Source Tracing of Speech Deepfakes: A First Benchmark
di: Xuan, Xi, et al.
Pubblicazione: (2025)
di: Xuan, Xi, et al.
Pubblicazione: (2025)
Study of Lightweight Transformer Architectures for Single-Channel Speech Enhancement
di: Zhao, Haixin, et al.
Pubblicazione: (2025)
di: Zhao, Haixin, et al.
Pubblicazione: (2025)
Attentive Merging of Hidden Embeddings from Pre-trained Speech Model for Anti-spoofing Detection
di: Pan, Zihan, et al.
Pubblicazione: (2024)
di: Pan, Zihan, et al.
Pubblicazione: (2024)
AdaKWS: Towards Robust Keyword Spotting with Test-Time Adaptation
di: Xiao, Yang, et al.
Pubblicazione: (2025)
di: Xiao, Yang, et al.
Pubblicazione: (2025)
FMSG-JLESS Submission for DCASE 2024 Task4 on Sound Event Detection with Heterogeneous Training Dataset and Potentially Missing Labels
di: Xiao, Yang, et al.
Pubblicazione: (2024)
di: Xiao, Yang, et al.
Pubblicazione: (2024)
Leveraging LLM and Text-Queried Separation for Noise-Robust Sound Event Detection
di: Yin, Han, et al.
Pubblicazione: (2024)
di: Yin, Han, et al.
Pubblicazione: (2024)
Enhancing Anti-spoofing Countermeasures Robustness through Joint Optimization and Transfer Learning
di: Wang, Yikang, et al.
Pubblicazione: (2024)
di: Wang, Yikang, et al.
Pubblicazione: (2024)
Device Feature based on Graph Fourier Transformation with Logarithmic Processing For Detection of Replay Speech Attacks
di: He, Mingrui, et al.
Pubblicazione: (2024)
di: He, Mingrui, et al.
Pubblicazione: (2024)
Low-Latency Neural Speech Phase Prediction based on Parallel Estimation Architecture and Anti-Wrapping Losses for Speech Generation Tasks
di: Ai, Yang, et al.
Pubblicazione: (2024)
di: Ai, Yang, et al.
Pubblicazione: (2024)
Token-Level Logits Matter: A Closer Look at Speech Foundation Models for Ambiguous Emotion Recognition
di: Halim, Jule Valendo, et al.
Pubblicazione: (2025)
di: Halim, Jule Valendo, et al.
Pubblicazione: (2025)
A Fast and Lightweight Model for Causal Audio-Visual Speech Separation
di: Sang, Wendi, et al.
Pubblicazione: (2025)
di: Sang, Wendi, et al.
Pubblicazione: (2025)
Adaptive Convolution for CNN-based Speech Enhancement Models
di: Wang, Dahan, et al.
Pubblicazione: (2025)
di: Wang, Dahan, et al.
Pubblicazione: (2025)
Adapting Where It Matters: Depth-Aware Adaptation for Efficient Multilingual Speech Recognition in Low-Resource Languages
di: Xiao, Yang, et al.
Pubblicazione: (2026)
di: Xiao, Yang, et al.
Pubblicazione: (2026)
ToneUnit: A Speech Discretization Approach for Tonal Language Speech Synthesis
di: Tao, Dehua, et al.
Pubblicazione: (2024)
di: Tao, Dehua, et al.
Pubblicazione: (2024)
Speech Emotion Detection Based on MFCC and CNN-LSTM Architecture
di: Ouyang, Qianhe
Pubblicazione: (2025)
di: Ouyang, Qianhe
Pubblicazione: (2025)
Reverse Attention for Lightweight Speech Enhancement on Edge Devices
di: Ojha, Shuubham, et al.
Pubblicazione: (2025)
di: Ojha, Shuubham, et al.
Pubblicazione: (2025)
LPGNet: A Lightweight Network with Parallel Attention and Gated Fusion for Multimodal Emotion Recognition
di: He, Zhining, et al.
Pubblicazione: (2025)
di: He, Zhining, et al.
Pubblicazione: (2025)
PolyBench: A Benchmark for Compositional Reasoning in Polyphonic Audio
di: Chen, Yuanjian, et al.
Pubblicazione: (2026)
di: Chen, Yuanjian, et al.
Pubblicazione: (2026)
LiveSpeech: Low-Latency Zero-shot Text-to-Speech via Autoregressive Modeling of Audio Discrete Codes
di: Dang, Trung, et al.
Pubblicazione: (2024)
di: Dang, Trung, et al.
Pubblicazione: (2024)
GALD-SE: Guided Anisotropic Lightweight Diffusion for Efficient Speech Enhancement
di: Wang, Chengzhong, et al.
Pubblicazione: (2024)
di: Wang, Chengzhong, et al.
Pubblicazione: (2024)
A Lightweight Fourier-based Network for Binaural Speech Enhancement with Spatial Cue Preservation
di: Lu, Xikun, et al.
Pubblicazione: (2025)
di: Lu, Xikun, et al.
Pubblicazione: (2025)
Continual Adaptation for Pacific Indigenous Speech Recognition
di: Xiao, Yang, et al.
Pubblicazione: (2026)
di: Xiao, Yang, et al.
Pubblicazione: (2026)
EmoFormer: A Text-Independent Speech Emotion Recognition using a Hybrid Transformer-CNN model
di: Hasan, Rashedul, et al.
Pubblicazione: (2025)
di: Hasan, Rashedul, et al.
Pubblicazione: (2025)
VoiceTailor: Lightweight Plug-In Adapter for Diffusion-Based Personalized Text-to-Speech
di: Kim, Heeseung, et al.
Pubblicazione: (2024)
di: Kim, Heeseung, et al.
Pubblicazione: (2024)
Test-Time Adaptation for Speech Emotion Recognition
di: Dong, Jiaheng, et al.
Pubblicazione: (2026)
di: Dong, Jiaheng, et al.
Pubblicazione: (2026)
Exploring Text-Queried Sound Event Detection with Audio Source Separation
di: Yin, Han, et al.
Pubblicazione: (2024)
di: Yin, Han, et al.
Pubblicazione: (2024)
Examining the Interplay Between Privacy and Fairness for Speech Processing: A Review and Perspective
di: Leschanowsky, Anna, et al.
Pubblicazione: (2024)
di: Leschanowsky, Anna, et al.
Pubblicazione: (2024)
AntiDeepFake: AI for Deep Fake Speech Recognition
di: Togootogtokh, Enkhtogtokh, et al.
Pubblicazione: (2024)
di: Togootogtokh, Enkhtogtokh, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Nes2Net: A Lightweight Nested Architecture for Foundation Model Driven Speech Anti-spoofing
di: Liu, Tianchi, et al.
Pubblicazione: (2025) -
Amplifying Artifacts with Speech Enhancement in Voice Anti-spoofing
di: Trachu, Thanapat, et al.
Pubblicazione: (2025) -
TF-Mamba: A Time-Frequency Network for Sound Source Localization
di: Xiao, Yang, et al.
Pubblicazione: (2024) -
XLSR-Mamba: A Dual-Column Bidirectional State Space Model for Spoofing Attack Detection
di: Xiao, Yang, et al.
Pubblicazione: (2024) -
Listen, Analyze, and Adapt to Learn New Attacks: An Exemplar-Free Class Incremental Learning Method for Audio Deepfake Source Tracing
di: Xiao, Yang, et al.
Pubblicazione: (2025)