ChunkFormer: Masked Chunking Conformer For Long-Form Speech Transcription
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Le, Khanh, Ho, Tuan Vu, Tran, Dung, Chau, Duc Thanh |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SegAug: CTC-Aligned Segmented Augmentation For Robust RNN-Transducer Based Speech Recognition
par: Le, Khanh, et autres
Publié: (2025)
par: Le, Khanh, et autres
Publié: (2025)
Improving Streaming Speech Recognition With Time-Shifted Contextual Attention And Dynamic Right Context Masking
par: Le, Khanh, et autres
Publié: (2025)
par: Le, Khanh, et autres
Publié: (2025)
MAGE: A Coarse-to-Fine Speech Enhancer with Masked Generative Model
par: Pham, The Hieu, et autres
Publié: (2025)
par: Pham, The Hieu, et autres
Publié: (2025)
SSCFormer: Push the Limit of Chunk-wise Conformer for Streaming ASR Using Sequentially Sampled Chunks and Chunked Causal Convolution
par: Wang, Fangyuan, et autres
Publié: (2022)
par: Wang, Fangyuan, et autres
Publié: (2022)
EfficientASR: Speech Recognition Network Compression via Attention Redundancy and Chunk-Level FFN Optimization
par: Wang, Jianzong, et autres
Publié: (2024)
par: Wang, Jianzong, et autres
Publié: (2024)
Dynamic Context-Aware Streaming Pretrained Language Model For Inverse Text Normalization
par: Ho, Luong, et autres
Publié: (2025)
par: Ho, Luong, et autres
Publié: (2025)
CUSIDE-T: Chunking, Simulating Future and Decoding for Transducer based Streaming ASR
par: Zhao, Wenbo, et autres
Publié: (2024)
par: Zhao, Wenbo, et autres
Publié: (2024)
Incremental FastPitch: Chunk-based High Quality Text to Speech
par: Du, Muyang, et autres
Publié: (2024)
par: Du, Muyang, et autres
Publié: (2024)
Chunked Attention-based Encoder-Decoder Model for Streaming Speech Recognition
par: Zeineldeen, Mohammad, et autres
Publié: (2023)
par: Zeineldeen, Mohammad, et autres
Publié: (2023)
Efficient and Robust Long-Form Speech Recognition with Hybrid H3-Conformer
par: Honda, Tomoki, et autres
Publié: (2024)
par: Honda, Tomoki, et autres
Publié: (2024)
Chunk Based Speech Pre-training with High Resolution Finite Scalar Quantization
par: Tang, Yun, et autres
Publié: (2025)
par: Tang, Yun, et autres
Publié: (2025)
Robust and Efficient Autoregressive Speech Synthesis with Dynamic Chunk-wise Prediction Policy
par: Li, Bohan, et autres
Publié: (2025)
par: Li, Bohan, et autres
Publié: (2025)
MerkleSpeech: Public-Key Verifiable, Chunk-Localised Speech Provenance via Perceptual Fingerprints and Merkle Commitments
par: Ono, Tatsunori
Publié: (2026)
par: Ono, Tatsunori
Publié: (2026)
LiveSpeech: Low-Latency Zero-shot Text-to-Speech via Autoregressive Modeling of Audio Discrete Codes
par: Dang, Trung, et autres
Publié: (2024)
par: Dang, Trung, et autres
Publié: (2024)
Hierarchical Decoding for Discrete Speech Synthesis with Multi-Resolution Spoof Detection
par: Zhao, Junchuan, et autres
Publié: (2026)
par: Zhao, Junchuan, et autres
Publié: (2026)
Stream-based Active Learning for Anomalous Sound Detection in Machine Condition Monitoring
par: Ho, Tuan Vu, et autres
Publié: (2024)
par: Ho, Tuan Vu, et autres
Publié: (2024)
Mel-RoFormer for Vocal Separation and Vocal Melody Transcription
par: Wang, Ju-Chiang, et autres
Publié: (2024)
par: Wang, Ju-Chiang, et autres
Publié: (2024)
Efficient Long-Form Speech Recognition for General Speech In-Context Learning
par: Yen, Hao, et autres
Publié: (2024)
par: Yen, Hao, et autres
Publié: (2024)
Qwen vs. Gemma Integration with Whisper: A Comparative Study in Multilingual SpeechLLM Systems
par: Nguyen, Tuan, et autres
Publié: (2025)
par: Nguyen, Tuan, et autres
Publié: (2025)
Zero-Shot Text-to-Speech from Continuous Text Streams
par: Dang, Trung, et autres
Publié: (2024)
par: Dang, Trung, et autres
Publié: (2024)
Pushing the Performance of Synthetic Speech Detection with Kolmogorov-Arnold Networks and Self-Supervised Learning Models
par: Phuong, Tuan Dat, et autres
Publié: (2025)
par: Phuong, Tuan Dat, et autres
Publié: (2025)
Prompting Whisper for Joint Speech Transcription and Diarization
par: Zamyrova, Mariia, et autres
Publié: (2026)
par: Zamyrova, Mariia, et autres
Publié: (2026)
Synthetic Data Domain Adaptation for ASR via LLM-based Text and Phonetic Respelling Augmentation
par: Yamashita, Natsuo, et autres
Publié: (2026)
par: Yamashita, Natsuo, et autres
Publié: (2026)
EmoQ: Speech Emotion Recognition via Speech-Aware Q-Former and Large Language Model
par: Yang, Yiqing, et autres
Publié: (2025)
par: Yang, Yiqing, et autres
Publié: (2025)
Meeting Recognition with Continuous Speech Separation and Transcription-Supported Diarization
par: von Neumann, Thilo, et autres
Publié: (2023)
par: von Neumann, Thilo, et autres
Publié: (2023)
AsyncSwitch: Asynchronous Text-Speech Adaptation for Code-Switched ASR
par: Nguyen, Tuan, et autres
Publié: (2025)
par: Nguyen, Tuan, et autres
Publié: (2025)
Continuous Learning of Transformer-based Audio Deepfake Detection
par: Le, Tuan Duy Nguyen, et autres
Publié: (2024)
par: Le, Tuan Duy Nguyen, et autres
Publié: (2024)
Leveraging Broadcast Media Subtitle Transcripts for Automatic Speech Recognition and Subtitling
par: Poncelet, Jakob, et autres
Publié: (2025)
par: Poncelet, Jakob, et autres
Publié: (2025)
Personalized Fine-Tuning with Controllable Synthetic Speech from LLM-Generated Transcripts for Dysarthric Speech Recognition
par: Wagner, Dominik, et autres
Publié: (2025)
par: Wagner, Dominik, et autres
Publié: (2025)
Speechless: Speech Instruction Training Without Speech for Low Resource Languages
par: Dao, Alan, et autres
Publié: (2025)
par: Dao, Alan, et autres
Publié: (2025)
A Comprehensive Survey with Critical Analysis for Deepfake Speech Detection
par: Pham, Lam, et autres
Publié: (2024)
par: Pham, Lam, et autres
Publié: (2024)
XLSR-Kanformer: A KAN-Intergrated model for Synthetic Speech Detection
par: Dat, Phuong Tuan, et autres
Publié: (2025)
par: Dat, Phuong Tuan, et autres
Publié: (2025)
LLM-ForcedAligner: A Non-Autoregressive and Accurate LLM-Based Forced Aligner for Multilingual and Long-Form Speech
par: Mu, Bingshen, et autres
Publié: (2026)
par: Mu, Bingshen, et autres
Publié: (2026)
Advanced Zero-Shot Text-to-Speech for Background Removal and Preservation with Controllable Masked Speech Prediction
par: Zhang, Leying, et autres
Publié: (2025)
par: Zhang, Leying, et autres
Publié: (2025)
Acoustic scattering AI for non-invasive object classifications: A case study on hair assessment
par: Hoang, Long-Vu, et autres
Publié: (2025)
par: Hoang, Long-Vu, et autres
Publié: (2025)
A Transcription Prompt-based Efficient Audio Large Language Model for Robust Speech Recognition
par: Li, Yangze, et autres
Publié: (2024)
par: Li, Yangze, et autres
Publié: (2024)
Exploring Prediction Targets in Masked Pre-Training for Speech Foundation Models
par: Chen, Li-Wei, et autres
Publié: (2024)
par: Chen, Li-Wei, et autres
Publié: (2024)
EmoFormer: A Text-Independent Speech Emotion Recognition using a Hybrid Transformer-CNN model
par: Hasan, Rashedul, et autres
Publié: (2025)
par: Hasan, Rashedul, et autres
Publié: (2025)
MossFormer2: Combining Transformer and RNN-Free Recurrent Network for Enhanced Time-Domain Monaural Speech Separation
par: Zhao, Shengkui, et autres
Publié: (2023)
par: Zhao, Shengkui, et autres
Publié: (2023)
Long-Form Speech Generation with Spoken Language Models
par: Park, Se Jin, et autres
Publié: (2024)
par: Park, Se Jin, et autres
Publié: (2024)
Documents similaires
-
SegAug: CTC-Aligned Segmented Augmentation For Robust RNN-Transducer Based Speech Recognition
par: Le, Khanh, et autres
Publié: (2025) -
Improving Streaming Speech Recognition With Time-Shifted Contextual Attention And Dynamic Right Context Masking
par: Le, Khanh, et autres
Publié: (2025) -
MAGE: A Coarse-to-Fine Speech Enhancer with Masked Generative Model
par: Pham, The Hieu, et autres
Publié: (2025) -
SSCFormer: Push the Limit of Chunk-wise Conformer for Streaming ASR Using Sequentially Sampled Chunks and Chunked Causal Convolution
par: Wang, Fangyuan, et autres
Publié: (2022) -
EfficientASR: Speech Recognition Network Compression via Attention Redundancy and Chunk-Level FFN Optimization
par: Wang, Jianzong, et autres
Publié: (2024)