Optimizing Rare Word Accuracy in Direct Speech Translation with a Retrieval-and-Demonstration Approach
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Siqi, Liu, Danni, Niehues, Jan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Conditions for Catastrophic Forgetting in Multilingual Translation
di: Liu, Danni, et al.
Pubblicazione: (2025)
di: Liu, Danni, et al.
Pubblicazione: (2025)
How Transferable are Attribute Controllers on Pretrained Multilingual Translation Models?
di: Liu, Danni, et al.
Pubblicazione: (2023)
di: Liu, Danni, et al.
Pubblicazione: (2023)
Middle-Layer Representation Alignment for Cross-Lingual Transfer in Fine-Tuned LLMs
di: Liu, Danni, et al.
Pubblicazione: (2025)
di: Liu, Danni, et al.
Pubblicazione: (2025)
Blending LLMs into Cascaded Speech Translation: KIT's Offline Speech Translation System for IWSLT 2024
di: Koneru, Sai, et al.
Pubblicazione: (2024)
di: Koneru, Sai, et al.
Pubblicazione: (2024)
How do Multimodal Foundation Models Encode Text and Speech? An Analysis of Cross-Lingual and Cross-Modal Representations
di: Lee, Hyunji, et al.
Pubblicazione: (2024)
di: Lee, Hyunji, et al.
Pubblicazione: (2024)
Language-Independent Representations Improve Zero-Shot Summarization
di: Solovyev, Vladimir, et al.
Pubblicazione: (2024)
di: Solovyev, Vladimir, et al.
Pubblicazione: (2024)
In-context Language Learning for Endangered Languages in Speech Recognition
di: Li, Zhaolin, et al.
Pubblicazione: (2025)
di: Li, Zhaolin, et al.
Pubblicazione: (2025)
RASST: Fast Cross-modal Retrieval-Augmented Simultaneous Speech Translation
di: Luo, Jiaxuan, et al.
Pubblicazione: (2026)
di: Luo, Jiaxuan, et al.
Pubblicazione: (2026)
KIT's Low-resource Speech Translation Systems for IWSLT2025: System Enhancement with Synthetic Data and Model Regularization
di: Li, Zhaolin, et al.
Pubblicazione: (2025)
di: Li, Zhaolin, et al.
Pubblicazione: (2025)
Contrastive Learning for Task-Independent SpeechLLM-Pretraining
di: Züfle, Maike, et al.
Pubblicazione: (2024)
di: Züfle, Maike, et al.
Pubblicazione: (2024)
End-to-End Evaluation for Low-Latency Simultaneous Speech Translation
di: Huber, Christian, et al.
Pubblicazione: (2023)
di: Huber, Christian, et al.
Pubblicazione: (2023)
KIT's Offline Speech Translation and Instruction Following Submission for IWSLT 2025
di: Koneru, Sai, et al.
Pubblicazione: (2025)
di: Koneru, Sai, et al.
Pubblicazione: (2025)
Hierarchical Policy Optimization for Simultaneous Translation of Unbounded Speech
di: Ouyang, Siqi, et al.
Pubblicazione: (2026)
di: Ouyang, Siqi, et al.
Pubblicazione: (2026)
OmniFusion: Simultaneous Multilingual Multimodal Translations via Modular Fusion
di: Koneru, Sai, et al.
Pubblicazione: (2025)
di: Koneru, Sai, et al.
Pubblicazione: (2025)
Augmenting Automatic Speech Recognition Models with Disfluency Detection
di: Amann, Robin, et al.
Pubblicazione: (2024)
di: Amann, Robin, et al.
Pubblicazione: (2024)
CMU's IWSLT 2025 Simultaneous Speech Translation System
di: Ouyang, Siqi, et al.
Pubblicazione: (2025)
di: Ouyang, Siqi, et al.
Pubblicazione: (2025)
Improving Rare Word Translation With Dictionaries and Attention Masking
di: Sible, Kenneth J., et al.
Pubblicazione: (2024)
di: Sible, Kenneth J., et al.
Pubblicazione: (2024)
Plug, Play, and Fuse: Zero-Shot Joint Decoding via Word-Level Re-ranking Across Diverse Vocabularies
di: Koneru, Sai, et al.
Pubblicazione: (2024)
di: Koneru, Sai, et al.
Pubblicazione: (2024)
Multimodal In-context Learning for ASR of Low-resource Languages
di: Li, Zhaolin, et al.
Pubblicazione: (2026)
di: Li, Zhaolin, et al.
Pubblicazione: (2026)
When Helpful Context Leaks: Privacy Risks in Domain-Adapted ASR
di: Züfle, Maike, et al.
Pubblicazione: (2026)
di: Züfle, Maike, et al.
Pubblicazione: (2026)
Contextual Refinement of Translations: Large Language Models for Sentence and Document-Level Post-Editing
di: Koneru, Sai, et al.
Pubblicazione: (2023)
di: Koneru, Sai, et al.
Pubblicazione: (2023)
Evaluating the IWSLT2023 Speech Translation Tasks: Human Annotations, Automatic Metrics, and Segmentation
di: Sperber, Matthias, et al.
Pubblicazione: (2024)
di: Sperber, Matthias, et al.
Pubblicazione: (2024)
SpeechQE: Estimating the Quality of Direct Speech Translation
di: Han, HyoJung, et al.
Pubblicazione: (2024)
di: Han, HyoJung, et al.
Pubblicazione: (2024)
Speech Editing -- a Summary
di: Kässmann, Tobias, et al.
Pubblicazione: (2024)
di: Kässmann, Tobias, et al.
Pubblicazione: (2024)
Early-Exit and Instant Confidence Translation Quality Estimation
di: Zouhar, Vilém, et al.
Pubblicazione: (2025)
di: Zouhar, Vilém, et al.
Pubblicazione: (2025)
InfiniSST: Simultaneous Translation of Unbounded Speech with Large Language Model
di: Ouyang, Siqi, et al.
Pubblicazione: (2025)
di: Ouyang, Siqi, et al.
Pubblicazione: (2025)
FASST: Fast LLM-based Simultaneous Speech Translation
di: Ouyang, Siqi, et al.
Pubblicazione: (2024)
di: Ouyang, Siqi, et al.
Pubblicazione: (2024)
Do Slides Help? Multi-modal Context for Automatic Transcription of Conference Talks
di: Sinhamahapatra, Supriti, et al.
Pubblicazione: (2025)
di: Sinhamahapatra, Supriti, et al.
Pubblicazione: (2025)
Unveiling the Role of Pretraining in Direct Speech Translation
di: Alastruey, Belen, et al.
Pubblicazione: (2024)
di: Alastruey, Belen, et al.
Pubblicazione: (2024)
Selective Demonstration Retrieval for Improved Implicit Hate Speech Detection
di: Kim, Yumin, et al.
Pubblicazione: (2025)
di: Kim, Yumin, et al.
Pubblicazione: (2025)
CA*: Addressing Evaluation Pitfalls in Computation-Aware Latency for Simultaneous Speech Translation
di: Xu, Xi, et al.
Pubblicazione: (2024)
di: Xu, Xi, et al.
Pubblicazione: (2024)
Simulstream: Open-Source Toolkit for Evaluation and Demonstration of Streaming Speech-to-Text Translation Systems
di: Gaido, Marco, et al.
Pubblicazione: (2025)
di: Gaido, Marco, et al.
Pubblicazione: (2025)
TARQ: Tail-Aware Reconstruction Quantization for Rare-Word Robust Automatic Speech Recognition
di: Wang, Xinyu, et al.
Pubblicazione: (2026)
di: Wang, Xinyu, et al.
Pubblicazione: (2026)
Direct Speech to Speech Translation: A Review
di: Sarim, Mohammad, et al.
Pubblicazione: (2025)
di: Sarim, Mohammad, et al.
Pubblicazione: (2025)
Talk2Ref: A Dataset for Reference Prediction from Scientific Talks
di: Broy, Frederik, et al.
Pubblicazione: (2025)
di: Broy, Frederik, et al.
Pubblicazione: (2025)
Word Level Timestamp Generation for Automatic Speech Recognition and Translation
di: Hu, Ke, et al.
Pubblicazione: (2025)
di: Hu, Ke, et al.
Pubblicazione: (2025)
Speech is More Than Words: Do Speech-to-Text Translation Systems Leverage Prosody?
di: Tsiamas, Ioannis, et al.
Pubblicazione: (2024)
di: Tsiamas, Ioannis, et al.
Pubblicazione: (2024)
Are Generative Models Underconfident? Better Quality Estimation with Boosted Model Probability
di: Dinh, Tu Anh, et al.
Pubblicazione: (2025)
di: Dinh, Tu Anh, et al.
Pubblicazione: (2025)
Sigmoid Head for Quality Estimation under Language Ambiguity
di: Dinh, Tu Anh, et al.
Pubblicazione: (2026)
di: Dinh, Tu Anh, et al.
Pubblicazione: (2026)
CMU's IWSLT 2024 Simultaneous Speech Translation System
di: Xu, Xi, et al.
Pubblicazione: (2024)
di: Xu, Xi, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Conditions for Catastrophic Forgetting in Multilingual Translation
di: Liu, Danni, et al.
Pubblicazione: (2025) -
How Transferable are Attribute Controllers on Pretrained Multilingual Translation Models?
di: Liu, Danni, et al.
Pubblicazione: (2023) -
Middle-Layer Representation Alignment for Cross-Lingual Transfer in Fine-Tuned LLMs
di: Liu, Danni, et al.
Pubblicazione: (2025) -
Blending LLMs into Cascaded Speech Translation: KIT's Offline Speech Translation System for IWSLT 2024
di: Koneru, Sai, et al.
Pubblicazione: (2024) -
How do Multimodal Foundation Models Encode Text and Speech? An Analysis of Cross-Lingual and Cross-Modal Representations
di: Lee, Hyunji, et al.
Pubblicazione: (2024)