End-to-End Evaluation for Low-Latency Simultaneous Speech Translation
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Huber, Christian, Dinh, Tu Anh, Mullov, Carlos, Pham, Ngoc Quan, Nguyen, Thai Binh, Retkowski, Fabian, Constantin, Stefan, Ugan, Enes Yavuz, Liu, Danni, Li, Zhaolin, Koneru, Sai, Niehues, Jan, Waibel, Alexander |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2023
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Blending LLMs into Cascaded Speech Translation: KIT's Offline Speech Translation System for IWSLT 2024
von: Koneru, Sai, et al.
Veröffentlicht: (2024)
von: Koneru, Sai, et al.
Veröffentlicht: (2024)
KIT's Low-resource Speech Translation Systems for IWSLT2025: System Enhancement with Synthetic Data and Model Regularization
von: Li, Zhaolin, et al.
Veröffentlicht: (2025)
von: Li, Zhaolin, et al.
Veröffentlicht: (2025)
BOOM: Beyond Only One Modality KIT's Multimodal Multilingual Lecture Companion
von: Koneru, Sai, et al.
Veröffentlicht: (2025)
von: Koneru, Sai, et al.
Veröffentlicht: (2025)
Weight Factorization and Centralization for Continual Learning in Speech Recognition
von: Ugan, Enes Yavuz, et al.
Veröffentlicht: (2025)
von: Ugan, Enes Yavuz, et al.
Veröffentlicht: (2025)
Bayesian Low-Rank Factorization for Robust Model Adaptation
von: Ugan, Enes Yavuz, et al.
Veröffentlicht: (2025)
von: Ugan, Enes Yavuz, et al.
Veröffentlicht: (2025)
Adapting Language Balance in Code-Switching Speech
von: Ugan, Enes Yavuz, et al.
Veröffentlicht: (2025)
von: Ugan, Enes Yavuz, et al.
Veröffentlicht: (2025)
PIER: A Novel Metric for Evaluating What Matters in Code-Switching
von: Ugan, Enes Yavuz, et al.
Veröffentlicht: (2025)
von: Ugan, Enes Yavuz, et al.
Veröffentlicht: (2025)
Decoupled Vocabulary Learning Enables Zero-Shot Translation from Unseen Languages
von: Mullov, Carlos, et al.
Veröffentlicht: (2024)
von: Mullov, Carlos, et al.
Veröffentlicht: (2024)
KIT's Offline Speech Translation and Instruction Following Submission for IWSLT 2025
von: Koneru, Sai, et al.
Veröffentlicht: (2025)
von: Koneru, Sai, et al.
Veröffentlicht: (2025)
MUSCAT: MUltilingual, SCientific ConversATion Benchmark
von: Sinhamahapatra, Supriti, et al.
Veröffentlicht: (2026)
von: Sinhamahapatra, Supriti, et al.
Veröffentlicht: (2026)
Titanic Calling: Low Bandwidth Video Conference from the Titanic Wreck
von: Eyiokur, Fevziye Irem, et al.
Veröffentlicht: (2024)
von: Eyiokur, Fevziye Irem, et al.
Veröffentlicht: (2024)
Beyond Transcripts: A Renewed Perspective on Audio Chaptering
von: Retkowski, Fabian, et al.
Veröffentlicht: (2026)
von: Retkowski, Fabian, et al.
Veröffentlicht: (2026)
Cocktail-Party Audio-Visual Speech Recognition
von: Nguyen, Thai-Binh, et al.
Veröffentlicht: (2025)
von: Nguyen, Thai-Binh, et al.
Veröffentlicht: (2025)
OmniFusion: Simultaneous Multilingual Multimodal Translations via Modular Fusion
von: Koneru, Sai, et al.
Veröffentlicht: (2025)
von: Koneru, Sai, et al.
Veröffentlicht: (2025)
Towards continually learning new languages
von: Pham, Ngoc-Quan, et al.
Veröffentlicht: (2022)
von: Pham, Ngoc-Quan, et al.
Veröffentlicht: (2022)
Predictive Speech Recognition and End-of-Utterance Detection Towards Spoken Dialog Systems
von: Zink, Oswald, et al.
Veröffentlicht: (2024)
von: Zink, Oswald, et al.
Veröffentlicht: (2024)
From Text Segmentation to Smart Chaptering: A Novel Benchmark for Structuring Video Transcriptions
von: Retkowski, Fabian, et al.
Veröffentlicht: (2024)
von: Retkowski, Fabian, et al.
Veröffentlicht: (2024)
Paragraph Segmentation Revisited: Towards a Standard Task for Structuring Speech
von: Retkowski, Fabian, et al.
Veröffentlicht: (2025)
von: Retkowski, Fabian, et al.
Veröffentlicht: (2025)
Zero-Shot Strategies for Length-Controllable Summarization
von: Retkowski, Fabian, et al.
Veröffentlicht: (2024)
von: Retkowski, Fabian, et al.
Veröffentlicht: (2024)
Are Generative Models Underconfident? Better Quality Estimation with Boosted Model Probability
von: Dinh, Tu Anh, et al.
Veröffentlicht: (2025)
von: Dinh, Tu Anh, et al.
Veröffentlicht: (2025)
Sigmoid Head for Quality Estimation under Language Ambiguity
von: Dinh, Tu Anh, et al.
Veröffentlicht: (2026)
von: Dinh, Tu Anh, et al.
Veröffentlicht: (2026)
Contextual Refinement of Translations: Large Language Models for Sentence and Document-Level Post-Editing
von: Koneru, Sai, et al.
Veröffentlicht: (2023)
von: Koneru, Sai, et al.
Veröffentlicht: (2023)
A Cocktail-Party Benchmark: Multi-Modal dataset and Comparative Evaluation Results
von: Nguyen, Thai-Binh, et al.
Veröffentlicht: (2025)
von: Nguyen, Thai-Binh, et al.
Veröffentlicht: (2025)
MSA-ASR: Efficient Multilingual Speaker Attribution with frozen ASR Models
von: Nguyen, Thai-Binh, et al.
Veröffentlicht: (2024)
von: Nguyen, Thai-Binh, et al.
Veröffentlicht: (2024)
Convoifilter: A case study of doing cocktail party speech recognition
von: Nguyen, Thai-Binh, et al.
Veröffentlicht: (2023)
von: Nguyen, Thai-Binh, et al.
Veröffentlicht: (2023)
Conditions for Catastrophic Forgetting in Multilingual Translation
von: Liu, Danni, et al.
Veröffentlicht: (2025)
von: Liu, Danni, et al.
Veröffentlicht: (2025)
How Transferable are Attribute Controllers on Pretrained Multilingual Translation Models?
von: Liu, Danni, et al.
Veröffentlicht: (2023)
von: Liu, Danni, et al.
Veröffentlicht: (2023)
The AI Co-Ethnographer: How Far Can Automation Take Qualitative Research?
von: Retkowski, Fabian, et al.
Veröffentlicht: (2025)
von: Retkowski, Fabian, et al.
Veröffentlicht: (2025)
Quality Estimation with $k$-nearest Neighbors and Automatic Evaluation for Model-specific Quality Estimation
von: Dinh, Tu Anh, et al.
Veröffentlicht: (2024)
von: Dinh, Tu Anh, et al.
Veröffentlicht: (2024)
SciEx: Benchmarking Large Language Models on Scientific Exams with Human Expert Grading and Automatic Grading
von: Dinh, Tu Anh, et al.
Veröffentlicht: (2024)
von: Dinh, Tu Anh, et al.
Veröffentlicht: (2024)
Summarizing Speech: A Comprehensive Survey
von: Retkowski, Fabian, et al.
Veröffentlicht: (2025)
von: Retkowski, Fabian, et al.
Veröffentlicht: (2025)
Recent Advances in End-to-End Simultaneous Speech Translation
von: Liu, Xiaoqian, et al.
Veröffentlicht: (2024)
von: Liu, Xiaoqian, et al.
Veröffentlicht: (2024)
Plug, Play, and Fuse: Zero-Shot Joint Decoding via Word-Level Re-ranking Across Diverse Vocabularies
von: Koneru, Sai, et al.
Veröffentlicht: (2024)
von: Koneru, Sai, et al.
Veröffentlicht: (2024)
Quality-Aware Decoding: Unifying Quality Estimation and Decoding
von: Koneru, Sai, et al.
Veröffentlicht: (2025)
von: Koneru, Sai, et al.
Veröffentlicht: (2025)
DDPG-E2E: A Novel Policy Gradient Approach for End-to-End Communication Systems
von: Zhang, Bolun, et al.
Veröffentlicht: (2024)
von: Zhang, Bolun, et al.
Veröffentlicht: (2024)
Towards End-to-End Application Slicing in Multi-access Edge Computing systems: Architecture Discussion and Proof-of-Concept
von: Bolettieri, Simone, et al.
Veröffentlicht: (2025)
von: Bolettieri, Simone, et al.
Veröffentlicht: (2025)
Knockout LLM Assessment: Using Large Language Models for Evaluations through Iterative Pairwise Comparisons
von: Sandan, Isik Baran, et al.
Veröffentlicht: (2025)
von: Sandan, Isik Baran, et al.
Veröffentlicht: (2025)
From Slides to Chatbots: Enhancing Large Language Models with University Course Materials
von: Dinh, Tu Anh, et al.
Veröffentlicht: (2025)
von: Dinh, Tu Anh, et al.
Veröffentlicht: (2025)
Accent conversion using discrete units with parallel data synthesized from controllable accented TTS
von: Nguyen, Tuan Nam, et al.
Veröffentlicht: (2024)
von: Nguyen, Tuan Nam, et al.
Veröffentlicht: (2024)
Optimizing Rare Word Accuracy in Direct Speech Translation with a Retrieval-and-Demonstration Approach
von: Li, Siqi, et al.
Veröffentlicht: (2024)
von: Li, Siqi, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Blending LLMs into Cascaded Speech Translation: KIT's Offline Speech Translation System for IWSLT 2024
von: Koneru, Sai, et al.
Veröffentlicht: (2024) -
KIT's Low-resource Speech Translation Systems for IWSLT2025: System Enhancement with Synthetic Data and Model Regularization
von: Li, Zhaolin, et al.
Veröffentlicht: (2025) -
BOOM: Beyond Only One Modality KIT's Multimodal Multilingual Lecture Companion
von: Koneru, Sai, et al.
Veröffentlicht: (2025) -
Weight Factorization and Centralization for Continual Learning in Speech Recognition
von: Ugan, Enes Yavuz, et al.
Veröffentlicht: (2025) -
Bayesian Low-Rank Factorization for Robust Model Adaptation
von: Ugan, Enes Yavuz, et al.
Veröffentlicht: (2025)