IML-Spikeformer: Input-aware Multi-Level Spiking Transformer for Speech Processing
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Song, Zeyang, Zhang, Shimin, Chou, Yuhong, Wu, Jibin, Li, Haizhou |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction
par: Wu, Wenxuan, et autres
Publié: (2025)
par: Wu, Wenxuan, et autres
Publié: (2025)
Speech Separation with Pretrained Frontend to Minimize Domain Mismatch
par: Wang, Wupeng, et autres
Publié: (2024)
par: Wang, Wupeng, et autres
Publié: (2024)
$C^2$AV-TSE: Context and Confidence-aware Audio Visual Target Speaker Extraction
par: Wu, Wenxuan, et autres
Publié: (2025)
par: Wu, Wenxuan, et autres
Publié: (2025)
Human-Inspired Computing for Robust and Efficient Audio-Visual Speech Recognition
par: Liu, Qianhui, et autres
Publié: (2024)
par: Liu, Qianhui, et autres
Publié: (2024)
Improving Speech Enhancement by Integrating Inter-Channel and Band Features with Dual-branch Conformer
par: Li, Jizhen, et autres
Publié: (2024)
par: Li, Jizhen, et autres
Publié: (2024)
ELEGANCE: Efficient LLM Guidance for Audio-Visual Target Speech Extraction
par: Wu, Wenxuan, et autres
Publié: (2025)
par: Wu, Wenxuan, et autres
Publié: (2025)
Speech-to-See: End-to-End Speech-Driven Open-Set Object Detection
par: Lu, Wenhuan, et autres
Publié: (2025)
par: Lu, Wenhuan, et autres
Publié: (2025)
RAVSS: Robust Audio-Visual Speech Separation in Multi-Speaker Scenarios with Missing Visual Cues
par: Pan, Tianrui, et autres
Publié: (2024)
par: Pan, Tianrui, et autres
Publié: (2024)
Bridging The Multi-Modality Gaps of Audio, Visual and Linguistic for Speech Enhancement
par: Lin, Meng-Ping, et autres
Publié: (2025)
par: Lin, Meng-Ping, et autres
Publié: (2025)
Listening and Seeing Again: Generative Error Correction for Audio-Visual Speech Recognition
par: Liu, Rui, et autres
Publié: (2025)
par: Liu, Rui, et autres
Publié: (2025)
Multi-Task Corrupted Prediction for Learning Robust Audio-Visual Speech Representation
par: Kim, Sungnyun, et autres
Publié: (2025)
par: Kim, Sungnyun, et autres
Publié: (2025)
Spiking-LEAF: A Learnable Auditory front-end for Spiking Neural Networks
par: Song, Zeyang, et autres
Publié: (2023)
par: Song, Zeyang, et autres
Publié: (2023)
Stimulus Modality Matters: Impact of Perceptual Evaluations from Different Modalities on Speech Emotion Recognition System Performance
par: Chou, Huang-Cheng, et autres
Publié: (2024)
par: Chou, Huang-Cheng, et autres
Publié: (2024)
ARECHO: Autoregressive Evaluation via Chain-Based Hypothesis Optimization for Speech Multi-Metric Estimation
par: Shi, Jiatong, et autres
Publié: (2025)
par: Shi, Jiatong, et autres
Publié: (2025)
Low-latency Speech Enhancement via Speech Token Generation
par: Xue, Huaying, et autres
Publié: (2023)
par: Xue, Huaying, et autres
Publié: (2023)
VERSA: A Versatile Evaluation Toolkit for Speech, Audio, and Music
par: Shi, Jiatong, et autres
Publié: (2024)
par: Shi, Jiatong, et autres
Publié: (2024)
Efficient Speech Watermarking for Speech Synthesis via Progressive Knowledge Distillation
par: Cui, Yang, et autres
Publié: (2025)
par: Cui, Yang, et autres
Publié: (2025)
LSTMSE-Net: Long Short Term Speech Enhancement Network for Audio-visual Speech Enhancement
par: Jain, Arnav, et autres
Publié: (2024)
par: Jain, Arnav, et autres
Publié: (2024)
FastTalker: Jointly Generating Speech and Conversational Gestures from Text
par: Guo, Zixin, et autres
Publié: (2024)
par: Guo, Zixin, et autres
Publié: (2024)
Beyond Video-to-SFX: Video to Audio Synthesis with Environmentally Aware Speech
par: Niu, Xinlei, et autres
Publié: (2025)
par: Niu, Xinlei, et autres
Publié: (2025)
Preserving Speaker Information in Direct Speech-to-Speech Translation with Non-Autoregressive Generation and Pretraining
par: Zhou, Rui, et autres
Publié: (2024)
par: Zhou, Rui, et autres
Publié: (2024)
Audio-Visual Speech Separation via Bottleneck Iterative Network
par: Zhang, Sidong, et autres
Publié: (2025)
par: Zhang, Sidong, et autres
Publié: (2025)
LCB-net: Long-Context Biasing for Audio-Visual Speech Recognition
par: Yu, Fan, et autres
Publié: (2024)
par: Yu, Fan, et autres
Publié: (2024)
Multimodal Speech Enhancement Using Burst Propagation
par: Raza, Mohsin, et autres
Publié: (2022)
par: Raza, Mohsin, et autres
Publié: (2022)
CoAVT: A Cognition-Inspired Unified Audio-Visual-Text Pre-Training Model for Multimodal Processing
par: Yue, Xianghu, et autres
Publié: (2024)
par: Yue, Xianghu, et autres
Publié: (2024)
Conformer-based Ultrasound-to-Speech Conversion
par: Ibrahimov, Ibrahim, et autres
Publié: (2025)
par: Ibrahimov, Ibrahim, et autres
Publié: (2025)
pyAMPACT: A Score-Audio Alignment Toolkit for Performance Data Estimation and Multi-modal Processing
par: Devaney, Johanna, et autres
Publié: (2024)
par: Devaney, Johanna, et autres
Publié: (2024)
M$^{3}$V: A multi-modal multi-view approach for Device-Directed Speech Detection
par: Wang, Anna, et autres
Publié: (2024)
par: Wang, Anna, et autres
Publié: (2024)
Multimodal Emotion Coupling via Speech-to-Facial and Bodily Gestures in Dyadic Interaction
par: Herbuela, Von Ralph Dane Marquez, et autres
Publié: (2025)
par: Herbuela, Von Ralph Dane Marquez, et autres
Publié: (2025)
BERT-like Pre-training for Symbolic Piano Music Classification Tasks
par: Chou, Yi-Hui, et autres
Publié: (2021)
par: Chou, Yi-Hui, et autres
Publié: (2021)
Song Aesthetics Evaluation with Multi-Stem Attention and Hierarchical Uncertainty Modeling
par: Lv, Yishan, et autres
Publié: (2026)
par: Lv, Yishan, et autres
Publié: (2026)
Listening Between the Lines: Synthetic Speech Detection Disregarding Verbal Content
par: Salvi, Davide, et autres
Publié: (2024)
par: Salvi, Davide, et autres
Publié: (2024)
MART: Learning Hierarchical Music Audio Representations with Part-Whole Transformer
par: Yao, Dong, et autres
Publié: (2023)
par: Yao, Dong, et autres
Publié: (2023)
REWIND: Speech Time Reversal for Enhancing Speaker Representations in Diffusion-based Voice Conversion
par: Biyani, Ishan D., et autres
Publié: (2025)
par: Biyani, Ishan D., et autres
Publié: (2025)
DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis
par: Tian, Wenjie, et autres
Publié: (2025)
par: Tian, Wenjie, et autres
Publié: (2025)
Towards Streaming Synchronized Spatial Audio Generation via Autoregressive Diffusion Transformer
par: Lei, Ke, et autres
Publié: (2026)
par: Lei, Ke, et autres
Publié: (2026)
MiniMind-O Technical Report: An Open Small-Scale Speech-Native Omni Model
par: Gong, Jingyao
Publié: (2026)
par: Gong, Jingyao
Publié: (2026)
Robust LLM-based Audio-Visual Speech Recognition with Sparse Modality Alignment and Visual Unit-Guided Refinement
par: Su, Fei, et autres
Publié: (2026)
par: Su, Fei, et autres
Publié: (2026)
LoVA: Long-form Video-to-Audio Generation
par: Cheng, Xin, et autres
Publié: (2024)
par: Cheng, Xin, et autres
Publié: (2024)
Spectron: Target Speaker Extraction using Conditional Transformer with Adversarial Refinement
par: Bandyopadhyay, Tathagata
Publié: (2024)
par: Bandyopadhyay, Tathagata
Publié: (2024)
Documents similaires
-
Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction
par: Wu, Wenxuan, et autres
Publié: (2025) -
Speech Separation with Pretrained Frontend to Minimize Domain Mismatch
par: Wang, Wupeng, et autres
Publié: (2024) -
$C^2$AV-TSE: Context and Confidence-aware Audio Visual Target Speaker Extraction
par: Wu, Wenxuan, et autres
Publié: (2025) -
Human-Inspired Computing for Robust and Efficient Audio-Visual Speech Recognition
par: Liu, Qianhui, et autres
Publié: (2024) -
Improving Speech Enhancement by Integrating Inter-Channel and Band Features with Dual-branch Conformer
par: Li, Jizhen, et autres
Publié: (2024)