Making LLMs Better Many-to-Many Speech-to-Text Translators with Curriculum Learning
Fuente:
arXiv
Salvato in:
| Autori principali: | Du, Yexing, Pan, Youcheng, Ma, Ziyang, Yang, Bo, Yang, Yifan, Deng, Keqi, Chen, Xie, Xiang, Yang, Liu, Ming, Qin, Bing |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MCAT: Scaling Many-to-Many Speech-to-Text Translation with MLLMs to 70 Languages
di: Du, Yexing, et al.
Pubblicazione: (2025)
di: Du, Yexing, et al.
Pubblicazione: (2025)
Bandwidth-Efficient and Privacy-Preserving Edge-Cloud Many-to-Many Speech Translation
di: Du, Yexing, et al.
Pubblicazione: (2026)
di: Du, Yexing, et al.
Pubblicazione: (2026)
Scalable Multilingual Multimodal Machine Translation with Speech-Text Fusion
di: Du, Yexing, et al.
Pubblicazione: (2026)
di: Du, Yexing, et al.
Pubblicazione: (2026)
CCFQA: A Benchmark for Cross-Lingual and Cross-Modal Speech and Text Factuality Evaluation
di: Du, Yexing, et al.
Pubblicazione: (2025)
di: Du, Yexing, et al.
Pubblicazione: (2025)
SimulS2S-LLM: Unlocking Simultaneous Inference of Speech LLMs for Speech-to-Speech Translation
di: Deng, Keqi, et al.
Pubblicazione: (2025)
di: Deng, Keqi, et al.
Pubblicazione: (2025)
MCGA: A Multi-task Classical Chinese Literary Genre Audio Corpus
di: Du, Yexing, et al.
Pubblicazione: (2026)
di: Du, Yexing, et al.
Pubblicazione: (2026)
Textless Unit-to-Unit training for Many-to-Many Multilingual Speech-to-Speech Translation
di: Kim, Minsu, et al.
Pubblicazione: (2023)
di: Kim, Minsu, et al.
Pubblicazione: (2023)
ProjectEval: A Benchmark for Programming Agents Automated Evaluation on Project-Level Code Generation
di: Liu, Kaiyuan, et al.
Pubblicazione: (2025)
di: Liu, Kaiyuan, et al.
Pubblicazione: (2025)
Label-Synchronous Neural Transducer for E2E Simultaneous Speech Translation
di: Deng, Keqi, et al.
Pubblicazione: (2024)
di: Deng, Keqi, et al.
Pubblicazione: (2024)
Speech LLMs are Contextual Reasoning Transcribers
di: Deng, Keqi, et al.
Pubblicazione: (2026)
di: Deng, Keqi, et al.
Pubblicazione: (2026)
EnAnchored-X2X: English-Anchored Optimization for Many-to-Many Translation
di: Yang, Sen, et al.
Pubblicazione: (2025)
di: Yang, Sen, et al.
Pubblicazione: (2025)
Forget Many, Forget Right: Scalable and Precise Concept Unlearning in Diffusion Models
di: Deng, Kaiyuan, et al.
Pubblicazione: (2026)
di: Deng, Kaiyuan, et al.
Pubblicazione: (2026)
Position: Towards Responsible Evaluation for Text-to-Speech
di: Yang, Yifan, et al.
Pubblicazione: (2025)
di: Yang, Yifan, et al.
Pubblicazione: (2025)
k2SSL: A Faster and Better Framework for Self-Supervised Speech Representation Learning
di: Yang, Yifan, et al.
Pubblicazione: (2024)
di: Yang, Yifan, et al.
Pubblicazione: (2024)
Toucan: Many-to-Many Translation for 150 African Language Pairs
di: Elmadany, AbdelRahim, et al.
Pubblicazione: (2024)
di: Elmadany, AbdelRahim, et al.
Pubblicazione: (2024)
Revisiting Direct Speech-to-Text Translation with Speech LLMs: Better Scaling than CoT Prompting?
di: Pareras, Oriol, et al.
Pubblicazione: (2025)
di: Pareras, Oriol, et al.
Pubblicazione: (2025)
Towards Efficient CoT Distillation: Self-Guided Rationale Selector for Better Performance with Fewer Rationales
di: Yan, Jianzhi, et al.
Pubblicazione: (2025)
di: Yan, Jianzhi, et al.
Pubblicazione: (2025)
OpenSTBench: Beyond Semantic Evaluation for Speech Translation
di: An, Yanjie, et al.
Pubblicazione: (2026)
di: An, Yanjie, et al.
Pubblicazione: (2026)
EmoVoice: LLM-based Emotional Text-To-Speech Model with Freestyle Text Prompting
di: Yang, Guanrou, et al.
Pubblicazione: (2025)
di: Yang, Guanrou, et al.
Pubblicazione: (2025)
Modeling the One-to-Many Property in Open-Domain Dialogue with LLMs
di: Lee, Jing Yang, et al.
Pubblicazione: (2025)
di: Lee, Jing Yang, et al.
Pubblicazione: (2025)
Achieving >97% on GSM8K: Deeply Understanding the Problems Makes LLMs Better Solvers for Math Word Problems
di: Zhong, Qihuang, et al.
Pubblicazione: (2024)
di: Zhong, Qihuang, et al.
Pubblicazione: (2024)
VoiceFlow: Efficient Text-to-Speech with Rectified Flow Matching
di: Guo, Yiwei, et al.
Pubblicazione: (2023)
di: Guo, Yiwei, et al.
Pubblicazione: (2023)
F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching
di: Chen, Yushen, et al.
Pubblicazione: (2024)
di: Chen, Yushen, et al.
Pubblicazione: (2024)
Many-Turn Jailbreaking
di: Yang, Xianjun, et al.
Pubblicazione: (2025)
di: Yang, Xianjun, et al.
Pubblicazione: (2025)
Towards Boosting Many-to-Many Multilingual Machine Translation with Large Language Models
di: Gao, Pengzhi, et al.
Pubblicazione: (2024)
di: Gao, Pengzhi, et al.
Pubblicazione: (2024)
Interleaved Speech-Text Language Models for Simple Streaming Text-to-Speech Synthesis
di: Yang, Yifan, et al.
Pubblicazione: (2024)
di: Yang, Yifan, et al.
Pubblicazione: (2024)
GigaSpeech 2: An Evolving, Large-Scale and Multi-domain ASR Corpus for Low-Resource Languages with Automated Crawling, Transcription and Refinement
di: Yang, Yifan, et al.
Pubblicazione: (2024)
di: Yang, Yifan, et al.
Pubblicazione: (2024)
Primer‐Disk‐Enabled DNA Data Storage System with Index and Record‐Many‐Read‐Many Features
di: Jiaxiang Ma, et al.
Pubblicazione: (2025)
di: Jiaxiang Ma, et al.
Pubblicazione: (2025)
Chain of Strategy Optimization Makes Large Language Models Better Emotional Supporter
di: Zhao, Weixiang, et al.
Pubblicazione: (2025)
di: Zhao, Weixiang, et al.
Pubblicazione: (2025)
Self-Correction Makes LLMs Better Parsers
di: Zhang, Ziyan, et al.
Pubblicazione: (2025)
di: Zhang, Ziyan, et al.
Pubblicazione: (2025)
When Less Language is More: Language-Reasoning Disentanglement Makes LLMs Better Multilingual Reasoners
di: Zhao, Weixiang, et al.
Pubblicazione: (2025)
di: Zhao, Weixiang, et al.
Pubblicazione: (2025)
Winning in the Limit: Average-Case Committee Selection with Many Candidates
di: Lin, Yifan, et al.
Pubblicazione: (2026)
di: Lin, Yifan, et al.
Pubblicazione: (2026)
MultiMed-ST: Large-scale Many-to-many Multilingual Medical Speech Translation
di: Le-Duc, Khai, et al.
Pubblicazione: (2025)
di: Le-Duc, Khai, et al.
Pubblicazione: (2025)
Soft Language Identification for Language-Agnostic Many-to-One End-to-End Speech Translation
di: Wang, Peidong, et al.
Pubblicazione: (2024)
di: Wang, Peidong, et al.
Pubblicazione: (2024)
Label-Synchronous Neural Transducer for Adaptable Online E2E Speech Recognition
di: Deng, Keqi, et al.
Pubblicazione: (2023)
di: Deng, Keqi, et al.
Pubblicazione: (2023)
Many-body multipole indices revealed by the real-space dynamical mean-field theory
di: Yang, Guoao, et al.
Pubblicazione: (2024)
di: Yang, Guoao, et al.
Pubblicazione: (2024)
Learning to Route LLMs from Bandit Feedback: One Policy, Many Trade-offs
di: Wei, Wang, et al.
Pubblicazione: (2025)
di: Wei, Wang, et al.
Pubblicazione: (2025)
Multiple Choice Learning for Efficient Speech Separation with Many Speakers
di: Perera, David, et al.
Pubblicazione: (2024)
di: Perera, David, et al.
Pubblicazione: (2024)
Many-for-Many: Unify the Training of Multiple Video and Image Generation and Manipulation Tasks
di: Li, Ruibin, et al.
Pubblicazione: (2025)
di: Li, Ruibin, et al.
Pubblicazione: (2025)
Invariance under Structure Translation as the Origin of Host Immune Capacity Conservation from Noether's Theorem
di: Chen, Yexing, et al.
Pubblicazione: (2025)
di: Chen, Yexing, et al.
Pubblicazione: (2025)
Documenti analoghi
-
MCAT: Scaling Many-to-Many Speech-to-Text Translation with MLLMs to 70 Languages
di: Du, Yexing, et al.
Pubblicazione: (2025) -
Bandwidth-Efficient and Privacy-Preserving Edge-Cloud Many-to-Many Speech Translation
di: Du, Yexing, et al.
Pubblicazione: (2026) -
Scalable Multilingual Multimodal Machine Translation with Speech-Text Fusion
di: Du, Yexing, et al.
Pubblicazione: (2026) -
CCFQA: A Benchmark for Cross-Lingual and Cross-Modal Speech and Text Factuality Evaluation
di: Du, Yexing, et al.
Pubblicazione: (2025) -
SimulS2S-LLM: Unlocking Simultaneous Inference of Speech LLMs for Speech-to-Speech Translation
di: Deng, Keqi, et al.
Pubblicazione: (2025)