Loss Masking Is Not Needed in Decoder-only Transformer for Discrete-token-based ASR
Fuente:
arXiv
Guardado en:
| Autores principales: | Chen, Qian, Wang, Wen, Zhang, Qinglin, Zheng, Siqi, Zhang, Shiliang, Deng, Chong, Ma, Yukun, Yu, Hai, Liu, Jiaqing, Zhang, Chong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2023
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
OmniFlatten: An End-to-end GPT Model for Seamless Voice Conversation
por: Zhang, Qinglin, et al.
Publicado: (2024)
por: Zhang, Qinglin, et al.
Publicado: (2024)
Self-Distillation Prototypes Network: Learning Robust Speaker Representations without Supervision
por: Chen, Yafeng, et al.
Publicado: (2023)
por: Chen, Yafeng, et al.
Publicado: (2023)
HiFi-SR: A Unified Generative Transformer-Convolutional Adversarial Network for High-Fidelity Speech Super-Resolution
por: Zhao, Shengkui, et al.
Publicado: (2025)
por: Zhao, Shengkui, et al.
Publicado: (2025)
Are Transformers in Pre-trained LM A Good ASR Encoder? An Empirical Study
por: An, Keyu, et al.
Publicado: (2024)
por: An, Keyu, et al.
Publicado: (2024)
Improving Speaker Diarization using Semantic Information: Joint Pairwise Constraints Propagation
por: Cheng, Luyao, et al.
Publicado: (2023)
por: Cheng, Luyao, et al.
Publicado: (2023)
Self-Distillation Prototypes Network: Learning Robust Speaker Representations without Supervision
por: Chen, Yafeng, et al.
Publicado: (2024)
por: Chen, Yafeng, et al.
Publicado: (2024)
Say More with Less: Variable-Frame-Rate Speech Tokenization via Adaptive Clustering and Implicit Duration Coding
por: Zheng, Rui-Chen, et al.
Publicado: (2025)
por: Zheng, Rui-Chen, et al.
Publicado: (2025)
Conditional Latent Diffusion-Based Speech Enhancement Via Dual Context Learning
por: Zhao, Shengkui, et al.
Publicado: (2025)
por: Zhao, Shengkui, et al.
Publicado: (2025)
Exploring SSL Discrete Speech Features for Zipformer-based Contextual ASR
por: Cui, Mingyu, et al.
Publicado: (2024)
por: Cui, Mingyu, et al.
Publicado: (2024)
Online Audio-Visual Autoregressive Speaker Extraction
por: Pan, Zexu, et al.
Publicado: (2025)
por: Pan, Zexu, et al.
Publicado: (2025)
MossFormer2: Combining Transformer and RNN-Free Recurrent Network for Enhanced Time-Domain Monaural Speech Separation
por: Zhao, Shengkui, et al.
Publicado: (2023)
por: Zhao, Shengkui, et al.
Publicado: (2023)
FreeCodec: A disentangled neural speech codec with fewer tokens
por: Zheng, Youqiang, et al.
Publicado: (2024)
por: Zheng, Youqiang, et al.
Publicado: (2024)
Enhancing the Robustness of Contextual ASR to Varying Biasing Information Volumes Through Purified Semantic Correlation Joint Modeling
por: Gu, Yue, et al.
Publicado: (2025)
por: Gu, Yue, et al.
Publicado: (2025)
An Embarrassingly Simple Approach for LLM with Strong ASR Capacity
por: Ma, Ziyang, et al.
Publicado: (2024)
por: Ma, Ziyang, et al.
Publicado: (2024)
Pushing the Frontiers of Self-Distillation Prototypes Network with Dimension Regularization and Score Normalization
por: Chen, Yafeng, et al.
Publicado: (2025)
por: Chen, Yafeng, et al.
Publicado: (2025)
Speaker Adaptation for Quantised End-to-End ASR Models
por: Zhao, Qiuming, et al.
Publicado: (2024)
por: Zhao, Qiuming, et al.
Publicado: (2024)
The USTC-NERCSLIP Systems for The ICMC-ASR Challenge
por: Wu, Minghui, et al.
Publicado: (2024)
por: Wu, Minghui, et al.
Publicado: (2024)
Overlap-Adaptive Hybrid Speaker Diarization and ASR-Aware Observation Addition for MISP 2025 Challenge
por: Huang, Shangkun, et al.
Publicado: (2025)
por: Huang, Shangkun, et al.
Publicado: (2025)
Fewer-token Neural Speech Codec with Time-invariant Codes
por: Ren, Yong, et al.
Publicado: (2023)
por: Ren, Yong, et al.
Publicado: (2023)
Advanced Zero-Shot Text-to-Speech for Background Removal and Preservation with Controllable Masked Speech Prediction
por: Zhang, Leying, et al.
Publicado: (2025)
por: Zhang, Leying, et al.
Publicado: (2025)
Differentiable K-means for Fully-optimized Discrete Token-based ASR
por: Onda, Kentaro, et al.
Publicado: (2025)
por: Onda, Kentaro, et al.
Publicado: (2025)
Decoder-only Conformer with Modality-aware Sparse Mixtures of Experts for ASR
por: Lee, Jaeyoung, et al.
Publicado: (2026)
por: Lee, Jaeyoung, et al.
Publicado: (2026)
Plug-and-Play Co-Occurring Face Attention for Robust Audio-Visual Speaker Extraction
por: Pan, Zexu, et al.
Publicado: (2025)
por: Pan, Zexu, et al.
Publicado: (2025)
CUSIDE-T: Chunking, Simulating Future and Decoding for Transducer based Streaming ASR
por: Zhao, Wenbo, et al.
Publicado: (2024)
por: Zhao, Wenbo, et al.
Publicado: (2024)
UniCodec: Unified Audio Codec with Single Domain-Adaptive Codebook
por: Jiang, Yidi, et al.
Publicado: (2025)
por: Jiang, Yidi, et al.
Publicado: (2025)
Paraformer-v2: An improved non-autoregressive transformer for noise-robust speech recognition
por: An, Keyu, et al.
Publicado: (2024)
por: An, Keyu, et al.
Publicado: (2024)
Exploring Text-Queried Sound Event Detection with Audio Source Separation
por: Yin, Han, et al.
Publicado: (2024)
por: Yin, Han, et al.
Publicado: (2024)
SA-SOT: Speaker-Aware Serialized Output Training for Multi-Talker ASR
por: Fan, Zhiyun, et al.
Publicado: (2024)
por: Fan, Zhiyun, et al.
Publicado: (2024)
SAML: Speaker Adaptive Mixture of LoRA Experts for End-to-End ASR
por: Zhao, Qiuming, et al.
Publicado: (2024)
por: Zhao, Qiuming, et al.
Publicado: (2024)
BrainWhisperer: Leveraging Large-Scale ASR Models for Neural Speech Decoding
por: Boccato, Tommaso, et al.
Publicado: (2026)
por: Boccato, Tommaso, et al.
Publicado: (2026)
Masked Self-distilled Transducer-based Keyword Spotting with Semi-autoregressive Decoding
por: Xi, Yu, et al.
Publicado: (2025)
por: Xi, Yu, et al.
Publicado: (2025)
Index-ASR Technical Report
por: Song, Zheshu, et al.
Publicado: (2025)
por: Song, Zheshu, et al.
Publicado: (2025)
Decoder-only Architecture for Speech Recognition with CTC Prompts and Text Data Augmentation
por: Tsunoo, Emiru, et al.
Publicado: (2023)
por: Tsunoo, Emiru, et al.
Publicado: (2023)
SpecASR: Accelerating LLM-based Automatic Speech Recognition via Speculative Decoding
por: Wei, Linye, et al.
Publicado: (2025)
por: Wei, Linye, et al.
Publicado: (2025)
Decoding Strategies for Diffusion-Based ASR: A Systematic Evaluation of Confidence-Based Thresholding
por: Yeo, Jeong Hun, et al.
Publicado: (2026)
por: Yeo, Jeong Hun, et al.
Publicado: (2026)
SPGM: Prioritizing Local Features for enhanced speech separation performance
por: Yip, Jia Qi, et al.
Publicado: (2023)
por: Yip, Jia Qi, et al.
Publicado: (2023)
Enhancing Intelligibility for Generative Target Speech Extraction via Joint Optimization with Target Speaker ASR
por: Ma, Hao, et al.
Publicado: (2025)
por: Ma, Hao, et al.
Publicado: (2025)
Model-free Speculative Decoding for Transformer-based ASR with Token Map Drafting
por: Ho, Tuan Vu, et al.
Publicado: (2025)
por: Ho, Tuan Vu, et al.
Publicado: (2025)
Fun-Audio-Chat Technical Report
por: Tongyi Fun Team, et al.
Publicado: (2025)
por: Tongyi Fun Team, et al.
Publicado: (2025)
E-chat: Emotion-sensitive Spoken Dialogue System with Large Language Models
por: Xue, Hongfei, et al.
Publicado: (2023)
por: Xue, Hongfei, et al.
Publicado: (2023)
Ejemplares similares
-
OmniFlatten: An End-to-end GPT Model for Seamless Voice Conversation
por: Zhang, Qinglin, et al.
Publicado: (2024) -
Self-Distillation Prototypes Network: Learning Robust Speaker Representations without Supervision
por: Chen, Yafeng, et al.
Publicado: (2023) -
HiFi-SR: A Unified Generative Transformer-Convolutional Adversarial Network for High-Fidelity Speech Super-Resolution
por: Zhao, Shengkui, et al.
Publicado: (2025) -
Are Transformers in Pre-trained LM A Good ASR Encoder? An Empirical Study
por: An, Keyu, et al.
Publicado: (2024) -
Improving Speaker Diarization using Semantic Information: Joint Pairwise Constraints Propagation
por: Cheng, Luyao, et al.
Publicado: (2023)