Enregistré dans:
| Auteurs principaux: | Li, Haoyang, Liu, Changsong, Rao, Wei, Shi, Hao, Sakti, Sakriani, Chng, Eng Siong |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2602.20967 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Learning Marmoset Vocal Patterns with a Masked Autoencoder for Robust Call Segmentation, Classification, and Caller Identification
par: Wu, Bin, et autres
Publié: (2024)
par: Wu, Bin, et autres
Publié: (2024)
SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition
par: Hirano, Yuta, et autres
Publié: (2025)
par: Hirano, Yuta, et autres
Publié: (2025)
Speech Enhancement Using Continuous Embeddings of Neural Audio Codec
par: Li, Haoyang, et autres
Publié: (2025)
par: Li, Haoyang, et autres
Publié: (2025)
Continual Learning Optimizations for Auto-regressive Decoder of Multilingual ASR systems
par: Kwok, Chin Yuen, et autres
Publié: (2024)
par: Kwok, Chin Yuen, et autres
Publié: (2024)
Bridging Speech and Text: Enhancing ASR with Pinyin-to-Character Pre-training in LLMs
par: Yuhang, Yang, et autres
Publié: (2024)
par: Yuhang, Yang, et autres
Publié: (2024)
Wav2code: Restore Clean Speech Representations via Codebook Lookup for Noise-Robust ASR
par: Hu, Yuchen, et autres
Publié: (2023)
par: Hu, Yuchen, et autres
Publié: (2023)
Hierarchical Self-Supervised Representation Learning for Depression Detection from Speech
par: Li, Yuxin, et autres
Publié: (2025)
par: Li, Yuxin, et autres
Publié: (2025)
LlamaPartialSpoof: An LLM-Driven Fake Speech Dataset Simulating Disinformation Generation
par: Luong, Hieu-Thi, et autres
Publié: (2024)
par: Luong, Hieu-Thi, et autres
Publié: (2024)
EASY: Emotion-aware Speaker Anonymization via Factorized Distillation
par: Yao, Jixun, et autres
Publié: (2025)
par: Yao, Jixun, et autres
Publié: (2025)
Analysis of Speaker Verification Performance Trade-offs with Neural Audio Codec Transmission
par: Thakur, Nirmalya Mallick, et autres
Publié: (2025)
par: Thakur, Nirmalya Mallick, et autres
Publié: (2025)
Indonesian-English Code-Switching Speech Synthesizer Utilizing Multilingual STEN-TTS and Bert LID
par: Handoyo, Ahmad Alfani, et autres
Publié: (2024)
par: Handoyo, Ahmad Alfani, et autres
Publié: (2024)
MULTI-Bench: A Multi-Turn Interactive Benchmark for Assessing Emotional Intelligence ability of Spoken Dialogue Models
par: Deng, Yayue, et autres
Publié: (2025)
par: Deng, Yayue, et autres
Publié: (2025)
On the Problem of Text-To-Speech Model Selection for Synthetic Data Generation in Automatic Speech Recognition
par: Rossenbach, Nick, et autres
Publié: (2024)
par: Rossenbach, Nick, et autres
Publié: (2024)
UniArray: Unified Spectral-Spatial Modeling for Array-Geometry-Agnostic Speech Separation
par: Chen, Weiguang, et autres
Publié: (2025)
par: Chen, Weiguang, et autres
Publié: (2025)
ICMC-ASR: The ICASSP 2024 In-Car Multi-Channel Automatic Speech Recognition Challenge
par: Wang, He, et autres
Publié: (2024)
par: Wang, He, et autres
Publié: (2024)
GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling
par: Yao, Jixun, et autres
Publié: (2025)
par: Yao, Jixun, et autres
Publié: (2025)
Room Impulse Responses help attackers to evade Deep Fake Detection
par: Luong, Hieu-Thi, et autres
Publié: (2024)
par: Luong, Hieu-Thi, et autres
Publié: (2024)
Temporal-Channel Modeling in Multi-head Self-Attention for Synthetic Speech Detection
par: Truong, Duc-Tuan, et autres
Publié: (2024)
par: Truong, Duc-Tuan, et autres
Publié: (2024)
Noise-Aware Speech Separation with Contrastive Learning
par: Zhang, Zizheng, et autres
Publié: (2023)
par: Zhang, Zizheng, et autres
Publié: (2023)
Robust Localization of Partially Fake Speech: Metrics and Out-of-Domain Evaluation
par: Luong, Hieu-Thi, et autres
Publié: (2025)
par: Luong, Hieu-Thi, et autres
Publié: (2025)
Multi-band Frequency Reconstruction for Neural Psychoacoustic Coding
par: Ng, Dianwen, et autres
Publié: (2025)
par: Ng, Dianwen, et autres
Publié: (2025)
Emphasized Non-Target Speaker Knowledge in Knowledge Distillation for Automatic Speaker Verification
par: Truong, Duc-Tuan, et autres
Publié: (2023)
par: Truong, Duc-Tuan, et autres
Publié: (2023)
A correlation-permutation approach for speech-music encoders model merging
par: Ritter-Gutierrez, Fabian, et autres
Publié: (2025)
par: Ritter-Gutierrez, Fabian, et autres
Publié: (2025)
Enhancing Indonesian Automatic Speech Recognition: Evaluating Multilingual Models with Diverse Speech Variabilities
par: Adila, Aulia, et autres
Publié: (2024)
par: Adila, Aulia, et autres
Publié: (2024)
Zero-shot Context Biasing with Trie-based Decoding using Synthetic Multi-Pronunciation
par: Liu, Changsong, et autres
Publié: (2025)
par: Liu, Changsong, et autres
Publié: (2025)
Noise-aware Speech Enhancement using Diffusion Probabilistic Model
par: Hu, Yuchen, et autres
Publié: (2023)
par: Hu, Yuchen, et autres
Publié: (2023)
Robust Zero-Shot Text-to-Speech Synthesis with Reverse Inference Optimization
par: Hu, Yuchen, et autres
Publié: (2024)
par: Hu, Yuchen, et autres
Publié: (2024)
Towards Audio Codec-based Speech Separation
par: Yip, Jia Qi, et autres
Publié: (2024)
par: Yip, Jia Qi, et autres
Publié: (2024)
Noro: Noise-Robust One-shot Voice Conversion with Hidden Speaker Representation Learning
par: He, Haorui, et autres
Publié: (2024)
par: He, Haorui, et autres
Publié: (2024)
Audio-CoT: Exploring Chain-of-Thought Reasoning in Large Audio Language Model
par: Ma, Ziyang, et autres
Publié: (2025)
par: Ma, Ziyang, et autres
Publié: (2025)
Enhancing Zero-shot Text-to-Speech Synthesis with Human Feedback
par: Chen, Chen, et autres
Publié: (2024)
par: Chen, Chen, et autres
Publié: (2024)
Listen Again and Choose the Right Answer: A New Paradigm for Automatic Speech Recognition with Large Language Models
par: Hu, Yuchen, et autres
Publié: (2024)
par: Hu, Yuchen, et autres
Publié: (2024)
Distilling a speech and music encoder with task arithmetic
par: Ritter-Gutierrez, Fabian, et autres
Publié: (2025)
par: Ritter-Gutierrez, Fabian, et autres
Publié: (2025)
Overlap-Adaptive Hybrid Speaker Diarization and ASR-Aware Observation Addition for MISP 2025 Challenge
par: Huang, Shangkun, et autres
Publié: (2025)
par: Huang, Shangkun, et autres
Publié: (2025)
Dataset-Distillation Generative Model for Speech Emotion Recognition
par: Ritter-Gutierrez, Fabian, et autres
Publié: (2024)
par: Ritter-Gutierrez, Fabian, et autres
Publié: (2024)
Summary on The Multilingual Conversational Speech Language Model Challenge: Datasets, Tasks, Baselines, and Methods
par: Mu, Bingshen, et autres
Publié: (2025)
par: Mu, Bingshen, et autres
Publié: (2025)
SPGM: Prioritizing Local Features for enhanced speech separation performance
par: Yip, Jia Qi, et autres
Publié: (2023)
par: Yip, Jia Qi, et autres
Publié: (2023)
Bi-directional Context-Enhanced Speech Large Language Models for Multilingual Conversational ASR
par: Peng, Yizhou, et autres
Publié: (2025)
par: Peng, Yizhou, et autres
Publié: (2025)
GenTranslate: Large Language Models are Generative Multilingual Speech and Machine Translators
par: Hu, Yuchen, et autres
Publié: (2024)
par: Hu, Yuchen, et autres
Publié: (2024)
VIBEVOICE-ASR Technical Report
par: Peng, Zhiliang, et autres
Publié: (2026)
par: Peng, Zhiliang, et autres
Publié: (2026)
Documents similaires
-
Learning Marmoset Vocal Patterns with a Masked Autoencoder for Robust Call Segmentation, Classification, and Caller Identification
par: Wu, Bin, et autres
Publié: (2024) -
SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition
par: Hirano, Yuta, et autres
Publié: (2025) -
Speech Enhancement Using Continuous Embeddings of Neural Audio Codec
par: Li, Haoyang, et autres
Publié: (2025) -
Continual Learning Optimizations for Auto-regressive Decoder of Multilingual ASR systems
par: Kwok, Chin Yuen, et autres
Publié: (2024) -
Bridging Speech and Text: Enhancing ASR with Pinyin-to-Character Pre-training in LLMs
par: Yuhang, Yang, et autres
Publié: (2024)