Segmental Attention Decoding With Long Form Acoustic Encodings
Fuente:
arXiv
Salvato in:
| Autori principali: | Swietojanski, Pawel, Li, Xinwei, Xu, Mingbin, Hori, Takaaki, Can, Dogan, Zhuang, Xiaodan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Optimizing Contextual Speech Recognition Using Vector Quantization for Efficient Retrieval
di: Flemotomos, Nikolaos, et al.
Pubblicazione: (2024)
di: Flemotomos, Nikolaos, et al.
Pubblicazione: (2024)
Delayed Fusion: Integrating Large Language Models into First-Pass Decoding in End-to-end Speech Recognition
di: Hori, Takaaki, et al.
Pubblicazione: (2025)
di: Hori, Takaaki, et al.
Pubblicazione: (2025)
Beyond Decodability: Reconstructing Language Model Representations with an Encoding Probe
di: Shen, Gaofei, et al.
Pubblicazione: (2026)
di: Shen, Gaofei, et al.
Pubblicazione: (2026)
Optimizing Byte-level Representation for End-to-end ASR
di: Hsiao, Roger, et al.
Pubblicazione: (2024)
di: Hsiao, Roger, et al.
Pubblicazione: (2024)
Adapting Whisper for Code-Switching through Encoding Refining and Language-Aware Decoding
di: Zhao, Jiahui, et al.
Pubblicazione: (2024)
di: Zhao, Jiahui, et al.
Pubblicazione: (2024)
Segmentation-free Goodness of Pronunciation
di: Cao, Xinwei, et al.
Pubblicazione: (2025)
di: Cao, Xinwei, et al.
Pubblicazione: (2025)
Enhanced Hybrid Transducer and Attention Encoder Decoder with Text Data
di: Tang, Yun, et al.
Pubblicazione: (2025)
di: Tang, Yun, et al.
Pubblicazione: (2025)
Joint Beam Search Integrating CTC, Attention, and Transducer Decoders
di: Sudo, Yui, et al.
Pubblicazione: (2024)
di: Sudo, Yui, et al.
Pubblicazione: (2024)
Long-Form Speech Generation with Spoken Language Models
di: Park, Se Jin, et al.
Pubblicazione: (2024)
di: Park, Se Jin, et al.
Pubblicazione: (2024)
Error Correction by Paying Attention to Both Acoustic and Confidence References for Automatic Speech Recognition
di: Shu, Yuchun, et al.
Pubblicazione: (2024)
di: Shu, Yuchun, et al.
Pubblicazione: (2024)
MultiMed: Multilingual Medical Speech Recognition via Attention Encoder Decoder
di: Le-Duc, Khai, et al.
Pubblicazione: (2024)
di: Le-Duc, Khai, et al.
Pubblicazione: (2024)
Romanization Encoding For Multilingual ASR
di: Ding, Wen, et al.
Pubblicazione: (2024)
di: Ding, Wen, et al.
Pubblicazione: (2024)
MAD Speech: Measures of Acoustic Diversity of Speech
di: Futeral, Matthieu, et al.
Pubblicazione: (2024)
di: Futeral, Matthieu, et al.
Pubblicazione: (2024)
Long-Form End-to-End Speech Translation via Latent Alignment Segmentation
di: Polák, Peter, et al.
Pubblicazione: (2023)
di: Polák, Peter, et al.
Pubblicazione: (2023)
Encoding of lexical tone in self-supervised models of spoken language
di: Shen, Gaofei, et al.
Pubblicazione: (2024)
di: Shen, Gaofei, et al.
Pubblicazione: (2024)
Lightweight Audio Segmentation for Long-form Speech Translation
di: Lee, Jaesong, et al.
Pubblicazione: (2024)
di: Lee, Jaesong, et al.
Pubblicazione: (2024)
Pretraining End-to-End Keyword Search with Automatically Discovered Acoustic Units
di: Yusuf, Bolaji, et al.
Pubblicazione: (2024)
di: Yusuf, Bolaji, et al.
Pubblicazione: (2024)
Training and Inference Efficiency of Encoder-Decoder Speech Models
di: Żelasko, Piotr, et al.
Pubblicazione: (2025)
di: Żelasko, Piotr, et al.
Pubblicazione: (2025)
MauBERT: Universal Phonetic Inductive Biases for Few-Shot Acoustic Units Discovery
di: Tandazo, Angelo Ortiz, et al.
Pubblicazione: (2025)
di: Tandazo, Angelo Ortiz, et al.
Pubblicazione: (2025)
STACodec: Semantic Token Assignment for Balancing Acoustic Fidelity and Semantic Information in Audio Codecs
di: Zhang, Kaiyuan, et al.
Pubblicazione: (2026)
di: Zhang, Kaiyuan, et al.
Pubblicazione: (2026)
Towards Efficient Speech-Text Jointly Decoding within One Speech Language Model
di: Wu, Haibin, et al.
Pubblicazione: (2025)
di: Wu, Haibin, et al.
Pubblicazione: (2025)
Decoder-only Architecture for Streaming End-to-end Speech Recognition
di: Tsunoo, Emiru, et al.
Pubblicazione: (2024)
di: Tsunoo, Emiru, et al.
Pubblicazione: (2024)
Revisiting Acoustic Features for Robust ASR
di: Shah, Muhammad A., et al.
Pubblicazione: (2024)
di: Shah, Muhammad A., et al.
Pubblicazione: (2024)
YODAS: Youtube-Oriented Dataset for Audio and Speech
di: Li, Xinjian, et al.
Pubblicazione: (2024)
di: Li, Xinjian, et al.
Pubblicazione: (2024)
Improving ASR Contextual Biasing with Guided Attention
di: Tang, Jiyang, et al.
Pubblicazione: (2024)
di: Tang, Jiyang, et al.
Pubblicazione: (2024)
Zero-shot Context Biasing with Trie-based Decoding using Synthetic Multi-Pronunciation
di: Liu, Changsong, et al.
Pubblicazione: (2025)
di: Liu, Changsong, et al.
Pubblicazione: (2025)
Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding
di: Hsu, Tzu-wen, et al.
Pubblicazione: (2025)
di: Hsu, Tzu-wen, et al.
Pubblicazione: (2025)
Benchmarking Prosody Encoding in Discrete Speech Tokens
di: Onda, Kentaro, et al.
Pubblicazione: (2025)
di: Onda, Kentaro, et al.
Pubblicazione: (2025)
Longer is (Not Necessarily) Stronger: Punctuated Long-Sequence Training for Enhanced Speech Recognition and Translation
di: Koluguri, Nithin Rao, et al.
Pubblicazione: (2024)
di: Koluguri, Nithin Rao, et al.
Pubblicazione: (2024)
A Theoretical Framework for Acoustic Neighbor Embeddings
di: Jeon, Woojay
Pubblicazione: (2024)
di: Jeon, Woojay
Pubblicazione: (2024)
Exploring the Benefits of Tokenization of Discrete Acoustic Units
di: Dekel, Avihu, et al.
Pubblicazione: (2024)
di: Dekel, Avihu, et al.
Pubblicazione: (2024)
Solla: Towards a Speech-Oriented LLM That Hears Acoustic Context
di: Ao, Junyi, et al.
Pubblicazione: (2025)
di: Ao, Junyi, et al.
Pubblicazione: (2025)
Joint Transcription of Acoustic Guitar Strumming Directions and Chords
di: Murgul, Sebastian, et al.
Pubblicazione: (2025)
di: Murgul, Sebastian, et al.
Pubblicazione: (2025)
Salmon: A Suite for Acoustic Language Model Evaluation
di: Maimon, Gallil, et al.
Pubblicazione: (2024)
di: Maimon, Gallil, et al.
Pubblicazione: (2024)
Enhancing Automated Audio Captioning via Large Language Models with Optimized Audio Encoding
di: Liu, Jizhong, et al.
Pubblicazione: (2024)
di: Liu, Jizhong, et al.
Pubblicazione: (2024)
FluentEditor2: Text-based Speech Editing by Modeling Multi-Scale Acoustic and Prosody Consistency
di: Liu, Rui, et al.
Pubblicazione: (2024)
di: Liu, Rui, et al.
Pubblicazione: (2024)
Layer-Wise Analysis of Self-Supervised Acoustic Word Embeddings: A Study on Speech Emotion Recognition
di: Saliba, Alexandra, et al.
Pubblicazione: (2024)
di: Saliba, Alexandra, et al.
Pubblicazione: (2024)
PersonaTAB: Predicting Personality Traits using Textual, Acoustic, and Behavioral Cues in Fully-Duplex Speech Dialogs
di: Inoue, Sho, et al.
Pubblicazione: (2025)
di: Inoue, Sho, et al.
Pubblicazione: (2025)
Universal Acoustic Adversarial Attacks for Flexible Control of Speech-LLMs
di: Ma, Rao, et al.
Pubblicazione: (2025)
di: Ma, Rao, et al.
Pubblicazione: (2025)
Infusing Acoustic Pause Context into Text-Based Dementia Assessment
di: Braun, Franziska, et al.
Pubblicazione: (2024)
di: Braun, Franziska, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Optimizing Contextual Speech Recognition Using Vector Quantization for Efficient Retrieval
di: Flemotomos, Nikolaos, et al.
Pubblicazione: (2024) -
Delayed Fusion: Integrating Large Language Models into First-Pass Decoding in End-to-end Speech Recognition
di: Hori, Takaaki, et al.
Pubblicazione: (2025) -
Beyond Decodability: Reconstructing Language Model Representations with an Encoding Probe
di: Shen, Gaofei, et al.
Pubblicazione: (2026) -
Optimizing Byte-level Representation for End-to-end ASR
di: Hsiao, Roger, et al.
Pubblicazione: (2024) -
Adapting Whisper for Code-Switching through Encoding Refining and Language-Aware Decoding
di: Zhao, Jiahui, et al.
Pubblicazione: (2024)