When End-to-End is Overkill: Rethinking Cascaded Speech-to-Text Translation
Fuente:
arXiv
Salvato in:
| Autori principali: | Min, Anna, Hu, Chenxu, Ren, Yi, Zhao, Hang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
A Unit-based System and Dataset for Expressive Direct Speech-to-Speech Translation
di: Min, Anna, et al.
Pubblicazione: (2025)
di: Min, Anna, et al.
Pubblicazione: (2025)
Recent Advances in End-to-End Simultaneous Speech Translation
di: Liu, Xiaoqian, et al.
Pubblicazione: (2024)
di: Liu, Xiaoqian, et al.
Pubblicazione: (2024)
A Non-autoregressive Generation Framework for End-to-End Simultaneous Speech-to-Speech Translation
di: Ma, Zhengrui, et al.
Pubblicazione: (2024)
di: Ma, Zhengrui, et al.
Pubblicazione: (2024)
Beat and Downbeat Tracking in Performance MIDI Using an End-to-End Transformer Architecture
di: Murgul, Sebastian, et al.
Pubblicazione: (2025)
di: Murgul, Sebastian, et al.
Pubblicazione: (2025)
LatentSpeech: Latent Diffusion for Text-To-Speech Generation
di: Lou, Haowei, et al.
Pubblicazione: (2024)
di: Lou, Haowei, et al.
Pubblicazione: (2024)
Exploring Acoustic Similarity in Emotional Speech and Music via Self-Supervised Representations
di: Sun, Yujia, et al.
Pubblicazione: (2024)
di: Sun, Yujia, et al.
Pubblicazione: (2024)
VoxEmo: Benchmarking Speech Emotion Recognition with Speech LLMs
di: Zhang, Hezhao, et al.
Pubblicazione: (2026)
di: Zhang, Hezhao, et al.
Pubblicazione: (2026)
Llasa: Scaling Train-Time and Inference-Time Compute for Llama-based Speech Synthesis
di: Ye, Zhen, et al.
Pubblicazione: (2025)
di: Ye, Zhen, et al.
Pubblicazione: (2025)
Zero-Shot End-to-End Spoken Language Understanding via Cross-Modal Selective Self-Training
di: He, Jianfeng, et al.
Pubblicazione: (2023)
di: He, Jianfeng, et al.
Pubblicazione: (2023)
Speech-to-See: End-to-End Speech-Driven Open-Set Object Detection
di: Lu, Wenhuan, et al.
Pubblicazione: (2025)
di: Lu, Wenhuan, et al.
Pubblicazione: (2025)
It's Never Too Late: Fusing Acoustic Information into Large Language Models for Automatic Speech Recognition
di: Chen, Chen, et al.
Pubblicazione: (2024)
di: Chen, Chen, et al.
Pubblicazione: (2024)
Mega-ASR: Towards In-the-wild^2 Speech Recognition via Scaling up Real-world Acoustic Simulation
di: Xie, Zhifei, et al.
Pubblicazione: (2026)
di: Xie, Zhifei, et al.
Pubblicazione: (2026)
StyleSpeech: Parameter-efficient Fine Tuning for Pre-trained Controllable Text-to-Speech
di: Lou, Haowei, et al.
Pubblicazione: (2024)
di: Lou, Haowei, et al.
Pubblicazione: (2024)
Bimodal Connection Attention Fusion for Speech Emotion Recognition
di: Luo, Jiachen, et al.
Pubblicazione: (2025)
di: Luo, Jiachen, et al.
Pubblicazione: (2025)
EmoBox: Multilingual Multi-corpus Speech Emotion Recognition Toolkit and Benchmark
di: Ma, Ziyang, et al.
Pubblicazione: (2024)
di: Ma, Ziyang, et al.
Pubblicazione: (2024)
Zero-Shot Cognitive Impairment Detection from Speech Using AudioLLM
di: Shahin, Mostafa, et al.
Pubblicazione: (2025)
di: Shahin, Mostafa, et al.
Pubblicazione: (2025)
Long-Form End-to-End Speech Translation via Latent Alignment Segmentation
di: Polák, Peter, et al.
Pubblicazione: (2023)
di: Polák, Peter, et al.
Pubblicazione: (2023)
Semi-Supervised Cognitive State Classification from Speech with Multi-View Pseudo-Labeling
di: Li, Yuanchao, et al.
Pubblicazione: (2024)
di: Li, Yuanchao, et al.
Pubblicazione: (2024)
Whispering LLaMA: A Cross-Modal Generative Error Correction Framework for Speech Recognition
di: Radhakrishnan, Srijith, et al.
Pubblicazione: (2023)
di: Radhakrishnan, Srijith, et al.
Pubblicazione: (2023)
MusiLingo: Bridging Music and Text with Pre-trained Language Models for Music Captioning and Query Response
di: Deng, Zihao, et al.
Pubblicazione: (2023)
di: Deng, Zihao, et al.
Pubblicazione: (2023)
G-STAR: End-to-End Global Speaker-Tracking Attributed Recognition
di: Peng, Jing, et al.
Pubblicazione: (2026)
di: Peng, Jing, et al.
Pubblicazione: (2026)
MLLM-based Speech Recognition: When and How is Multimodality Beneficial?
di: Guan, Yiwen, et al.
Pubblicazione: (2025)
di: Guan, Yiwen, et al.
Pubblicazione: (2025)
End-to-End Speech-to-Text Translation: A Survey
di: Sethiya, Nivedita, et al.
Pubblicazione: (2023)
di: Sethiya, Nivedita, et al.
Pubblicazione: (2023)
MSAC: Multiple Speech Attribute Control Method for Reliable Speech Emotion Recognition
di: Pan, Yu, et al.
Pubblicazione: (2023)
di: Pan, Yu, et al.
Pubblicazione: (2023)
DeepResonance: Enhancing Multimodal Music Understanding via Music-centric Multi-way Instruction Tuning
di: Mao, Zhuoyuan, et al.
Pubblicazione: (2025)
di: Mao, Zhuoyuan, et al.
Pubblicazione: (2025)
Cross-Modal Learning for Music-to-Music-Video Description Generation
di: Mao, Zhuoyuan, et al.
Pubblicazione: (2025)
di: Mao, Zhuoyuan, et al.
Pubblicazione: (2025)
OpenMU: Your Swiss Army Knife for Music Understanding
di: Zhao, Mengjie, et al.
Pubblicazione: (2024)
di: Zhao, Mengjie, et al.
Pubblicazione: (2024)
Representation Purification for End-to-End Speech Translation
di: Zhang, Chengwei, et al.
Pubblicazione: (2024)
di: Zhang, Chengwei, et al.
Pubblicazione: (2024)
TTS-Transducer: End-to-End Speech Synthesis with Neural Transducer
di: Bataev, Vladimir, et al.
Pubblicazione: (2025)
di: Bataev, Vladimir, et al.
Pubblicazione: (2025)
StarVC: A Unified Auto-Regressive Framework for Joint Text and Speech Generation in Voice Conversion
di: Li, Fengjin, et al.
Pubblicazione: (2025)
di: Li, Fengjin, et al.
Pubblicazione: (2025)
Retrieval-Augmented Text-to-Audio Generation
di: Yuan, Yi, et al.
Pubblicazione: (2023)
di: Yuan, Yi, et al.
Pubblicazione: (2023)
Quality-Aware End-to-End Audio-Visual Neural Speaker Diarization
di: He, Mao-Kui, et al.
Pubblicazione: (2024)
di: He, Mao-Kui, et al.
Pubblicazione: (2024)
UniSLU: Unified Spoken Language Understanding from Heterogeneous Cross-Task Datasets
di: Sheng, Zhichao, et al.
Pubblicazione: (2025)
di: Sheng, Zhichao, et al.
Pubblicazione: (2025)
An Embarrassingly Simple Approach for LLM with Strong ASR Capacity
di: Ma, Ziyang, et al.
Pubblicazione: (2024)
di: Ma, Ziyang, et al.
Pubblicazione: (2024)
Audio-FLAN: A Preliminary Release
di: Xue, Liumeng, et al.
Pubblicazione: (2025)
di: Xue, Liumeng, et al.
Pubblicazione: (2025)
Multi-Domain Audio Question Answering Benchmark Toward Acoustic Content Reasoning
di: Yang, Chao-Han Huck, et al.
Pubblicazione: (2025)
di: Yang, Chao-Han Huck, et al.
Pubblicazione: (2025)
Revise, Reason, and Recognize: LLM-Based Emotion Recognition via Emotion-Specific Prompts and ASR Error Correction
di: Li, Yuanchao, et al.
Pubblicazione: (2024)
di: Li, Yuanchao, et al.
Pubblicazione: (2024)
FastSAG: Towards Fast Non-Autoregressive Singing Accompaniment Generation
di: Chen, Jianyi, et al.
Pubblicazione: (2024)
di: Chen, Jianyi, et al.
Pubblicazione: (2024)
Beyond Single-Audio: Advancing Multi-Audio Processing in Audio Large Language Models
di: Chen, Yiming, et al.
Pubblicazione: (2024)
di: Chen, Yiming, et al.
Pubblicazione: (2024)
Survey of End-to-End Multi-Speaker Automatic Speech Recognition for Monaural Audio
di: He, Xinlu, et al.
Pubblicazione: (2025)
di: He, Xinlu, et al.
Pubblicazione: (2025)
Documenti analoghi
-
A Unit-based System and Dataset for Expressive Direct Speech-to-Speech Translation
di: Min, Anna, et al.
Pubblicazione: (2025) -
Recent Advances in End-to-End Simultaneous Speech Translation
di: Liu, Xiaoqian, et al.
Pubblicazione: (2024) -
A Non-autoregressive Generation Framework for End-to-End Simultaneous Speech-to-Speech Translation
di: Ma, Zhengrui, et al.
Pubblicazione: (2024) -
Beat and Downbeat Tracking in Performance MIDI Using an End-to-End Transformer Architecture
di: Murgul, Sebastian, et al.
Pubblicazione: (2025) -
LatentSpeech: Latent Diffusion for Text-To-Speech Generation
di: Lou, Haowei, et al.
Pubblicazione: (2024)