StreamAtt: Direct Streaming Speech-to-Text Translation with Attention-based Audio History Selection
Fuente:
arXiv
Salvato in:
| Autori principali: | Papi, Sara, Gaido, Marco, Negri, Matteo, Bentivogli, Luisa |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SimulSeamless: FBK at IWSLT 2024 Simultaneous Speech Translation
di: Papi, Sara, et al.
Pubblicazione: (2024)
di: Papi, Sara, et al.
Pubblicazione: (2024)
AlignAtt: Using Attention-based Audio-Translation Alignments as a Guide for Simultaneous Speech Translation
di: Papi, Sara, et al.
Pubblicazione: (2023)
di: Papi, Sara, et al.
Pubblicazione: (2023)
Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison
di: Lam, Tsz Kin, et al.
Pubblicazione: (2025)
di: Lam, Tsz Kin, et al.
Pubblicazione: (2025)
SPES: Spectrogram Perturbation for Explainable Speech-to-Text Generation
di: Fucci, Dennis, et al.
Pubblicazione: (2024)
di: Fucci, Dennis, et al.
Pubblicazione: (2024)
MOSEL: 950,000 Hours of Speech Data for Open-Source Speech Foundation Model Training on EU Languages
di: Gaido, Marco, et al.
Pubblicazione: (2024)
di: Gaido, Marco, et al.
Pubblicazione: (2024)
SimulU: Training-free Policy for Long-form Simultaneous Speech-to-Speech Translation
di: Djanibekov, Amirbek, et al.
Pubblicazione: (2026)
di: Djanibekov, Amirbek, et al.
Pubblicazione: (2026)
Speech-MASSIVE: A Multilingual Speech Dataset for SLU and Beyond
di: Lee, Beomseok, et al.
Pubblicazione: (2024)
di: Lee, Beomseok, et al.
Pubblicazione: (2024)
Speech Foundation Models and Crowdsourcing for Efficient, High-Quality Data Collection
di: Lee, Beomseok, et al.
Pubblicazione: (2024)
di: Lee, Beomseok, et al.
Pubblicazione: (2024)
StreamUni: Achieving Streaming Speech Translation with a Unified Large Speech-Language Model
di: Guo, Shoutao, et al.
Pubblicazione: (2025)
di: Guo, Shoutao, et al.
Pubblicazione: (2025)
DiariST: Streaming Speech Translation with Speaker Diarization
di: Yang, Mu, et al.
Pubblicazione: (2023)
di: Yang, Mu, et al.
Pubblicazione: (2023)
How "Real" is Your Real-Time Simultaneous Speech-to-Text Translation System?
di: Papi, Sara, et al.
Pubblicazione: (2024)
di: Papi, Sara, et al.
Pubblicazione: (2024)
SpeakStream: Streaming Text-to-Speech with Interleaved Data
di: Bai, Richard He, et al.
Pubblicazione: (2025)
di: Bai, Richard He, et al.
Pubblicazione: (2025)
MFLA: Monotonic Finite Look-ahead Attention for Streaming Speech Recognition
di: Xia, Yinfeng, et al.
Pubblicazione: (2025)
di: Xia, Yinfeng, et al.
Pubblicazione: (2025)
StreamSpeech: Simultaneous Speech-to-Speech Translation with Multi-task Learning
di: Zhang, Shaolei, et al.
Pubblicazione: (2024)
di: Zhang, Shaolei, et al.
Pubblicazione: (2024)
Joint Optimization of Streaming and Non-Streaming Automatic Speech Recognition with Multi-Decoder and Knowledge Distillation
di: Shakeel, Muhammad, et al.
Pubblicazione: (2024)
di: Shakeel, Muhammad, et al.
Pubblicazione: (2024)
Cross-Attention is Half Explanation in Speech-to-Text Models
di: Papi, Sara, et al.
Pubblicazione: (2025)
di: Papi, Sara, et al.
Pubblicazione: (2025)
Zero-Shot Text-to-Speech from Continuous Text Streams
di: Dang, Trung, et al.
Pubblicazione: (2024)
di: Dang, Trung, et al.
Pubblicazione: (2024)
Adaptive Inner Speech-Text Alignment for LLM-based Speech Translation
di: Liu, Henglyu, et al.
Pubblicazione: (2025)
di: Liu, Henglyu, et al.
Pubblicazione: (2025)
StreamFlow: Streaming Flow Matching with Block-wise Guided Attention Mask for Speech Token Decoding
di: Guo, Dake, et al.
Pubblicazione: (2025)
di: Guo, Dake, et al.
Pubblicazione: (2025)
StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling
di: Wang, Hui, et al.
Pubblicazione: (2025)
di: Wang, Hui, et al.
Pubblicazione: (2025)
Direct Speech to Speech Translation: A Review
di: Sarim, Mohammad, et al.
Pubblicazione: (2025)
di: Sarim, Mohammad, et al.
Pubblicazione: (2025)
Streaming Audio Transformers for Online Audio Tagging
di: Dinkel, Heinrich, et al.
Pubblicazione: (2023)
di: Dinkel, Heinrich, et al.
Pubblicazione: (2023)
Lightweight Audio Segmentation for Long-form Speech Translation
di: Lee, Jaesong, et al.
Pubblicazione: (2024)
di: Lee, Jaesong, et al.
Pubblicazione: (2024)
Simul-Whisper: Attention-Guided Streaming Whisper with Truncation Detection
di: Wang, Haoyu, et al.
Pubblicazione: (2024)
di: Wang, Haoyu, et al.
Pubblicazione: (2024)
Scheduled Interleaved Speech-Text Training for Speech-to-Speech Translation with LLMs
di: Futami, Hayato, et al.
Pubblicazione: (2025)
di: Futami, Hayato, et al.
Pubblicazione: (2025)
Direct Speech-to-Speech Neural Machine Translation: A Survey
di: Gupta, Mahendra, et al.
Pubblicazione: (2024)
di: Gupta, Mahendra, et al.
Pubblicazione: (2024)
StreamAAD: Decoding Spatial Auditory Attention with a Streaming Architecture
di: Qiu, Zelin, et al.
Pubblicazione: (2024)
di: Qiu, Zelin, et al.
Pubblicazione: (2024)
Direct Simultaneous Translation Activation for Large Audio-Language Models
di: Zhang, Pei, et al.
Pubblicazione: (2025)
di: Zhang, Pei, et al.
Pubblicazione: (2025)
End-to-End Speech-to-Text Translation: A Survey
di: Sethiya, Nivedita, et al.
Pubblicazione: (2023)
di: Sethiya, Nivedita, et al.
Pubblicazione: (2023)
Dynamic Context-Aware Streaming Pretrained Language Model For Inverse Text Normalization
di: Ho, Luong, et al.
Pubblicazione: (2025)
di: Ho, Luong, et al.
Pubblicazione: (2025)
Stream RAG: Instant and Accurate Spoken Dialogue Systems with Streaming Tool Usage
di: Arora, Siddhant, et al.
Pubblicazione: (2025)
di: Arora, Siddhant, et al.
Pubblicazione: (2025)
Leveraging Synthetic Audio Data for End-to-End Low-Resource Speech Translation
di: Moslem, Yasmin
Pubblicazione: (2024)
di: Moslem, Yasmin
Pubblicazione: (2024)
Streaming Bilingual End-to-End ASR model using Attention over Multiple Softmax
di: Patil, Aditya, et al.
Pubblicazione: (2024)
di: Patil, Aditya, et al.
Pubblicazione: (2024)
Speech is More Than Words: Do Speech-to-Text Translation Systems Leverage Prosody?
di: Tsiamas, Ioannis, et al.
Pubblicazione: (2024)
di: Tsiamas, Ioannis, et al.
Pubblicazione: (2024)
Spiralformer: Low Latency Encoder for Streaming Speech Recognition with Circular Layer Skipping and Early Exiting
di: Tsunoo, Emiru, et al.
Pubblicazione: (2025)
di: Tsunoo, Emiru, et al.
Pubblicazione: (2025)
Efficient Streaming LLM for Speech Recognition
di: Jia, Junteng, et al.
Pubblicazione: (2024)
di: Jia, Junteng, et al.
Pubblicazione: (2024)
Improving Streaming Speech Recognition With Time-Shifted Contextual Attention And Dynamic Right Context Masking
di: Le, Khanh, et al.
Pubblicazione: (2025)
di: Le, Khanh, et al.
Pubblicazione: (2025)
Streaming Speaker Change Detection and Gender Classification for Transducer-Based Multi-Talker Speech Translation
di: Wang, Peidong, et al.
Pubblicazione: (2025)
di: Wang, Peidong, et al.
Pubblicazione: (2025)
Improving Speech Emotion Recognition in Under-Resourced Languages via Speech-to-Speech Translation with Bootstrapping Data Selection
di: Lin, Hsi-Che, et al.
Pubblicazione: (2024)
di: Lin, Hsi-Che, et al.
Pubblicazione: (2024)
Chunked Attention-based Encoder-Decoder Model for Streaming Speech Recognition
di: Zeineldeen, Mohammad, et al.
Pubblicazione: (2023)
di: Zeineldeen, Mohammad, et al.
Pubblicazione: (2023)
Documenti analoghi
-
SimulSeamless: FBK at IWSLT 2024 Simultaneous Speech Translation
di: Papi, Sara, et al.
Pubblicazione: (2024) -
AlignAtt: Using Attention-based Audio-Translation Alignments as a Guide for Simultaneous Speech Translation
di: Papi, Sara, et al.
Pubblicazione: (2023) -
Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison
di: Lam, Tsz Kin, et al.
Pubblicazione: (2025) -
SPES: Spectrogram Perturbation for Explainable Speech-to-Text Generation
di: Fucci, Dennis, et al.
Pubblicazione: (2024) -
MOSEL: 950,000 Hours of Speech Data for Open-Source Speech Foundation Model Training on EU Languages
di: Gaido, Marco, et al.
Pubblicazione: (2024)