Temporal Information Reconstruction and Non-Aligned Residual in Spiking Neural Networks for Speech Classification
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Qi, Wang, Huamin, Shen, Hangchi, Duan, Shukai, Wen, Shiping, Huang, Tingwen |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
A Neural Speech Codec for Noise Robust Speech Coding
di: Huang, Jiayi, et al.
Pubblicazione: (2023)
di: Huang, Jiayi, et al.
Pubblicazione: (2023)
PartialEdit: Identifying Partial Deepfakes in the Era of Neural Speech Editing
di: Zhang, You, et al.
Pubblicazione: (2025)
di: Zhang, You, et al.
Pubblicazione: (2025)
Frame-Aligned Fusion of Canary and WavLM for Non-Intrusive Intelligibility Prediction of Hearing-Aid-Processed Speech
di: Nakazawa, Kazushi
Pubblicazione: (2026)
di: Nakazawa, Kazushi
Pubblicazione: (2026)
CodecMOS-Accent: A MOS Benchmark of Resynthesized and TTS Speech from Neural Codecs Across English Accents
di: Huang, Wen-Chin, et al.
Pubblicazione: (2026)
di: Huang, Wen-Chin, et al.
Pubblicazione: (2026)
Bridging Speech Emotion Recognition and Personality: Dataset and Temporal Interaction Condition Network
di: Gao, Yuan, et al.
Pubblicazione: (2025)
di: Gao, Yuan, et al.
Pubblicazione: (2025)
Advancing Speech Quality Assessment Through Scientific Challenges and Open-source Activities
di: Huang, Wen-Chin
Pubblicazione: (2025)
di: Huang, Wen-Chin
Pubblicazione: (2025)
Neural Directed Speech Enhancement with Dual Microphone Array in High Noise Scenario
di: Wen, Wen, et al.
Pubblicazione: (2024)
di: Wen, Wen, et al.
Pubblicazione: (2024)
Plugin Speech Enhancement: A Universal Speech Enhancement Framework Inspired by Dynamic Neural Network
di: Chen, Yanan, et al.
Pubblicazione: (2024)
di: Chen, Yanan, et al.
Pubblicazione: (2024)
Residual Learning for Neural Ambisonics Encoders
di: Deppisch, Thomas, et al.
Pubblicazione: (2026)
di: Deppisch, Thomas, et al.
Pubblicazione: (2026)
CodecSlime: Temporal Redundancy Compression of Neural Speech Codec via Dynamic Frame Rate
di: Wang, Hankun, et al.
Pubblicazione: (2025)
di: Wang, Hankun, et al.
Pubblicazione: (2025)
Emotion Neural Transducer for Fine-Grained Speech Emotion Recognition
di: Shen, Siyuan, et al.
Pubblicazione: (2024)
di: Shen, Siyuan, et al.
Pubblicazione: (2024)
The TEA-ASLP System for Multilingual Conversational Speech Recognition and Speech Diarization in MLC-SLM 2025 Challenge
di: Xue, Hongfei, et al.
Pubblicazione: (2025)
di: Xue, Hongfei, et al.
Pubblicazione: (2025)
PURE Codec: Progressive Unfolding of Residual Entropy for Speech Codec Learning
di: Shi, Jiatong, et al.
Pubblicazione: (2025)
di: Shi, Jiatong, et al.
Pubblicazione: (2025)
Progressive Residual Extraction based Pre-training for Speech Representation Learning
di: Wang, Tianrui, et al.
Pubblicazione: (2024)
di: Wang, Tianrui, et al.
Pubblicazione: (2024)
Magnetoencephalography (MEG) Based Non-Invasive Chinese Speech Decoding
di: Jia, Zhihong, et al.
Pubblicazione: (2025)
di: Jia, Zhihong, et al.
Pubblicazione: (2025)
Towards Ultra-Low-Power Neuromorphic Speech Enhancement with Spiking-FullSubNet
di: Hao, Xiang, et al.
Pubblicazione: (2024)
di: Hao, Xiang, et al.
Pubblicazione: (2024)
Temporally Heterogeneous Graph Contrastive Learning for Multimodal Acoustic event Classification
di: Chen, Yuanjian, et al.
Pubblicazione: (2025)
di: Chen, Yuanjian, et al.
Pubblicazione: (2025)
Efficient Sound Field Reconstruction with Conditional Invertible Neural Networks
di: Karakonstantis, Xenofon, et al.
Pubblicazione: (2024)
di: Karakonstantis, Xenofon, et al.
Pubblicazione: (2024)
Music-Aligned Holistic 3D Dance Generation via Hierarchical Motion Modeling
di: Li, Xiaojie, et al.
Pubblicazione: (2025)
di: Li, Xiaojie, et al.
Pubblicazione: (2025)
ESC: Efficient Speech Coding with Cross-Scale Residual Vector Quantized Transformers
di: Gu, Yuzhe, et al.
Pubblicazione: (2024)
di: Gu, Yuzhe, et al.
Pubblicazione: (2024)
PrimeK-Net: Multi-scale Spectral Learning via Group Prime-Kernel Convolutional Neural Networks for Single Channel Speech Enhancement
di: Lin, Zizhen, et al.
Pubblicazione: (2025)
di: Lin, Zizhen, et al.
Pubblicazione: (2025)
Multi-band Frequency Reconstruction for Neural Psychoacoustic Coding
di: Ng, Dianwen, et al.
Pubblicazione: (2025)
di: Ng, Dianwen, et al.
Pubblicazione: (2025)
URGENT-PK: Perceptually-Aligned Ranking Model Designed for Speech Enhancement Competition
di: Wang, Jiahe, et al.
Pubblicazione: (2025)
di: Wang, Jiahe, et al.
Pubblicazione: (2025)
SuperCodec: A Neural Speech Codec with Selective Back-Projection Network
di: Zheng, Youqiang, et al.
Pubblicazione: (2024)
di: Zheng, Youqiang, et al.
Pubblicazione: (2024)
Textless and Non-Parallel Speech-to-Speech Emotion Style Transfer
di: Dutta, Soumya, et al.
Pubblicazione: (2025)
di: Dutta, Soumya, et al.
Pubblicazione: (2025)
SpeechAlign: Aligning Speech Generation to Human Preferences
di: Zhang, Dong, et al.
Pubblicazione: (2024)
di: Zhang, Dong, et al.
Pubblicazione: (2024)
SpeechFake: A Large-Scale Multilingual Speech Deepfake Dataset Incorporating Cutting-Edge Generation Methods
di: Huang, Wen, et al.
Pubblicazione: (2025)
di: Huang, Wen, et al.
Pubblicazione: (2025)
Neural Vocoders as Speech Enhancers
di: Li, Andong, et al.
Pubblicazione: (2025)
di: Li, Andong, et al.
Pubblicazione: (2025)
Personalized Neural Speech Codec
di: Jang, Inseon, et al.
Pubblicazione: (2024)
di: Jang, Inseon, et al.
Pubblicazione: (2024)
Sound Field Reconstruction Using a Compact Acoustics-informed Neural Network
di: Ma, Fei, et al.
Pubblicazione: (2024)
di: Ma, Fei, et al.
Pubblicazione: (2024)
MOS-Bench: Benchmarking Generalization Abilities of Subjective Speech Quality Assessment Models
di: Huang, Wen-Chin, et al.
Pubblicazione: (2024)
di: Huang, Wen-Chin, et al.
Pubblicazione: (2024)
Distinguishing Neural Speech Synthesis Models Through Fingerprints in Speech Waveforms
di: Zhang, Chu Yuan, et al.
Pubblicazione: (2023)
di: Zhang, Chu Yuan, et al.
Pubblicazione: (2023)
Speaker Anonymisation for Speech-based Suicide Risk Detection
di: Cui, Ziyun, et al.
Pubblicazione: (2025)
di: Cui, Ziyun, et al.
Pubblicazione: (2025)
SAC: Neural Speech Codec with Semantic-Acoustic Dual-Stream Quantization
di: Chen, Wenxi, et al.
Pubblicazione: (2025)
di: Chen, Wenxi, et al.
Pubblicazione: (2025)
From Sharpness to Better Generalization for Speech Deepfake Detection
di: Huang, Wen, et al.
Pubblicazione: (2025)
di: Huang, Wen, et al.
Pubblicazione: (2025)
A Multilingual Framework for Dysarthria: Detection, Severity Classification, Speech-to-Text, and Clean Speech Generation
di: Raghu, Ananya, et al.
Pubblicazione: (2025)
di: Raghu, Ananya, et al.
Pubblicazione: (2025)
TBDM-Net: Bidirectional Dense Networks with Gender Information for Speech Emotion Recognition
di: Striletchi, Vlad, et al.
Pubblicazione: (2024)
di: Striletchi, Vlad, et al.
Pubblicazione: (2024)
SHEET: A Multi-purpose Open-source Speech Human Evaluation Estimation Toolkit
di: Huang, Wen-Chin, et al.
Pubblicazione: (2025)
di: Huang, Wen-Chin, et al.
Pubblicazione: (2025)
SegAug: CTC-Aligned Segmented Augmentation For Robust RNN-Transducer Based Speech Recognition
di: Le, Khanh, et al.
Pubblicazione: (2025)
di: Le, Khanh, et al.
Pubblicazione: (2025)
Spectral Masking with Explicit Time-Context Windowing for Neural Network-Based Monaural Speech Enhancement
di: Fiorio, Luan Vinícius, et al.
Pubblicazione: (2024)
di: Fiorio, Luan Vinícius, et al.
Pubblicazione: (2024)
Documenti analoghi
-
A Neural Speech Codec for Noise Robust Speech Coding
di: Huang, Jiayi, et al.
Pubblicazione: (2023) -
PartialEdit: Identifying Partial Deepfakes in the Era of Neural Speech Editing
di: Zhang, You, et al.
Pubblicazione: (2025) -
Frame-Aligned Fusion of Canary and WavLM for Non-Intrusive Intelligibility Prediction of Hearing-Aid-Processed Speech
di: Nakazawa, Kazushi
Pubblicazione: (2026) -
CodecMOS-Accent: A MOS Benchmark of Resynthesized and TTS Speech from Neural Codecs Across English Accents
di: Huang, Wen-Chin, et al.
Pubblicazione: (2026) -
Bridging Speech Emotion Recognition and Personality: Dataset and Temporal Interaction Condition Network
di: Gao, Yuan, et al.
Pubblicazione: (2025)