Chain of Correction for Full-text Speech Recognition with Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Tang, Zhiyuan, Wang, Dong, Zhou, Zhikai, Liu, Yong, Huang, Shen, Shang, Shidong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Full-text Error Correction for Chinese Speech Recognition with Large Language Model
di: Tang, Zhiyuan, et al.
Pubblicazione: (2024)
di: Tang, Zhiyuan, et al.
Pubblicazione: (2024)
Pinyin Regularization in Error Correction for Chinese Speech Recognition with Large Language Models
di: Tang, Zhiyuan, et al.
Pubblicazione: (2024)
di: Tang, Zhiyuan, et al.
Pubblicazione: (2024)
The TEA-ASLP System for Multilingual Conversational Speech Recognition and Speech Diarization in MLC-SLM 2025 Challenge
di: Xue, Hongfei, et al.
Pubblicazione: (2025)
di: Xue, Hongfei, et al.
Pubblicazione: (2025)
Multi-stage Large Language Model Correction for Speech Recognition
di: Pu, Jie, et al.
Pubblicazione: (2023)
di: Pu, Jie, et al.
Pubblicazione: (2023)
Investigating Decoder-only Large Language Models for Speech-to-text Translation
di: Huang, Chao-Wei, et al.
Pubblicazione: (2024)
di: Huang, Chao-Wei, et al.
Pubblicazione: (2024)
Dolphin: A Large-Scale Automatic Speech Recognition Model for Eastern Languages
di: Meng, Yangyang, et al.
Pubblicazione: (2025)
di: Meng, Yangyang, et al.
Pubblicazione: (2025)
SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models
di: Zhang, Xin, et al.
Pubblicazione: (2023)
di: Zhang, Xin, et al.
Pubblicazione: (2023)
Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition
di: Tseng, Yuan, et al.
Pubblicazione: (2025)
di: Tseng, Yuan, et al.
Pubblicazione: (2025)
Steering Language Model to Stable Speech Emotion Recognition via Contextual Perception and Chain of Thought
di: Zhao, Zhixian, et al.
Pubblicazione: (2025)
di: Zhao, Zhixian, et al.
Pubblicazione: (2025)
Customizing Speech Recognition Model with Large Language Model Feedback
di: Ling, Shaoshi, et al.
Pubblicazione: (2025)
di: Ling, Shaoshi, et al.
Pubblicazione: (2025)
Generating Data with Text-to-Speech and Large-Language Models for Conversational Speech Recognition
di: Cornell, Samuele, et al.
Pubblicazione: (2024)
di: Cornell, Samuele, et al.
Pubblicazione: (2024)
Pseudo2Real: Task Arithmetic for Pseudo-Label Correction in Automatic Speech Recognition
di: Lin, Yi-Cheng, et al.
Pubblicazione: (2025)
di: Lin, Yi-Cheng, et al.
Pubblicazione: (2025)
UCorrect: An Unsupervised Framework for Automatic Speech Recognition Error Correction
di: Guo, Jiaxin, et al.
Pubblicazione: (2024)
di: Guo, Jiaxin, et al.
Pubblicazione: (2024)
PAC: Pronunciation-Aware Contextualized Large Language Model-based Automatic Speech Recognition
di: Fu, Li, et al.
Pubblicazione: (2025)
di: Fu, Li, et al.
Pubblicazione: (2025)
Exploring Generative Error Correction for Dysarthric Speech Recognition
di: La Quatra, Moreno, et al.
Pubblicazione: (2025)
di: La Quatra, Moreno, et al.
Pubblicazione: (2025)
Exploring the Integration of Large Language Models into Automatic Speech Recognition Systems: An Empirical Study
di: Min, Zeping, et al.
Pubblicazione: (2023)
di: Min, Zeping, et al.
Pubblicazione: (2023)
ReHear: Iterative Pseudo-Label Refinement for Semi-Supervised Speech Recognition via Audio Large Language Models
di: Liu, Zefang, et al.
Pubblicazione: (2026)
di: Liu, Zefang, et al.
Pubblicazione: (2026)
MoshiRAG: Asynchronous Knowledge Retrieval for Full-Duplex Speech Language Models
di: Chien, Chung-Ming, et al.
Pubblicazione: (2026)
di: Chien, Chung-Ming, et al.
Pubblicazione: (2026)
Speech Recognition Rescoring with Large Speech-Text Foundation Models
di: Shivakumar, Prashanth Gurunath, et al.
Pubblicazione: (2024)
di: Shivakumar, Prashanth Gurunath, et al.
Pubblicazione: (2024)
Enhancing Speech Large Language Models through Reinforced Behavior Alignment
di: Liu, Yansong, et al.
Pubblicazione: (2025)
di: Liu, Yansong, et al.
Pubblicazione: (2025)
Boosting Large Language Model for Speech Synthesis: An Empirical Study
di: Hao, Hongkun, et al.
Pubblicazione: (2023)
di: Hao, Hongkun, et al.
Pubblicazione: (2023)
High-precision Voice Search Query Correction via Retrievable Speech-text Embedings
di: Li, Christopher, et al.
Pubblicazione: (2024)
di: Li, Christopher, et al.
Pubblicazione: (2024)
Evaluating Emotion Recognition in Spoken Language Models on Emotionally Incongruent Speech
di: Corrêa, Pedro, et al.
Pubblicazione: (2025)
di: Corrêa, Pedro, et al.
Pubblicazione: (2025)
SpeechGPT-Gen: Scaling Chain-of-Information Speech Generation
di: Zhang, Dong, et al.
Pubblicazione: (2024)
di: Zhang, Dong, et al.
Pubblicazione: (2024)
Sagalee: an Open Source Automatic Speech Recognition Dataset for Oromo Language
di: Abu, Turi, et al.
Pubblicazione: (2025)
di: Abu, Turi, et al.
Pubblicazione: (2025)
An End-to-End Speech Summarization Using Large Language Model
di: Shang, Hengchao, et al.
Pubblicazione: (2024)
di: Shang, Hengchao, et al.
Pubblicazione: (2024)
Speech Recognition Model Improves Text-to-Speech Synthesis using Fine-Grained Reward
di: Wang, Guansu, et al.
Pubblicazione: (2025)
di: Wang, Guansu, et al.
Pubblicazione: (2025)
Exploring Effective Distillation of Self-Supervised Speech Models for Automatic Speech Recognition
di: Wang, Yujin, et al.
Pubblicazione: (2022)
di: Wang, Yujin, et al.
Pubblicazione: (2022)
Granary: Speech Recognition and Translation Dataset in 25 European Languages
di: Koluguri, Nithin Rao, et al.
Pubblicazione: (2025)
di: Koluguri, Nithin Rao, et al.
Pubblicazione: (2025)
Enhancing Large Language Model-based Speech Recognition by Contextualization for Rare and Ambiguous Words
di: Nozawa, Kento, et al.
Pubblicazione: (2024)
di: Nozawa, Kento, et al.
Pubblicazione: (2024)
Speculative Speech Recognition by Audio-Prefixed Low-Rank Adaptation of Language Models
di: Yusuf, Bolaji, et al.
Pubblicazione: (2024)
di: Yusuf, Bolaji, et al.
Pubblicazione: (2024)
BLSP-Emo: Towards Empathetic Large Speech-Language Models
di: Wang, Chen, et al.
Pubblicazione: (2024)
di: Wang, Chen, et al.
Pubblicazione: (2024)
Emilia: An Extensive, Multilingual, and Diverse Speech Dataset for Large-Scale Speech Generation
di: He, Haorui, et al.
Pubblicazione: (2024)
di: He, Haorui, et al.
Pubblicazione: (2024)
Enhancing Dysarthric Speech Recognition for Unseen Speakers via Prototype-Based Adaptation
di: Wang, Shiyao, et al.
Pubblicazione: (2024)
di: Wang, Shiyao, et al.
Pubblicazione: (2024)
Benchmarking Automatic Speech Recognition Models for African Languages
di: Nahabwe, Alvin, et al.
Pubblicazione: (2025)
di: Nahabwe, Alvin, et al.
Pubblicazione: (2025)
S2SBench: A Benchmark for Quantifying Intelligence Degradation in Speech-to-Speech Large Language Models
di: Fang, Yuanbo, et al.
Pubblicazione: (2025)
di: Fang, Yuanbo, et al.
Pubblicazione: (2025)
MixedG2P-T5: G2P-free Speech Synthesis for Mixed-script texts using Speech Self-Supervised Learning and Language Model
di: Park, Joonyong, et al.
Pubblicazione: (2025)
di: Park, Joonyong, et al.
Pubblicazione: (2025)
SEAL: Speech Embedding Alignment Learning for Speech Large Language Model with Retrieval-Augmented Generation
di: Sun, Chunyu, et al.
Pubblicazione: (2025)
di: Sun, Chunyu, et al.
Pubblicazione: (2025)
Bi-directional Context-Enhanced Speech Large Language Models for Multilingual Conversational ASR
di: Peng, Yizhou, et al.
Pubblicazione: (2025)
di: Peng, Yizhou, et al.
Pubblicazione: (2025)
A Large Dataset of Spontaneous Speech with the Accent Spoken in São Paulo for Automatic Speech Recognition Evaluation
di: Lima, Rodrigo, et al.
Pubblicazione: (2024)
di: Lima, Rodrigo, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Full-text Error Correction for Chinese Speech Recognition with Large Language Model
di: Tang, Zhiyuan, et al.
Pubblicazione: (2024) -
Pinyin Regularization in Error Correction for Chinese Speech Recognition with Large Language Models
di: Tang, Zhiyuan, et al.
Pubblicazione: (2024) -
The TEA-ASLP System for Multilingual Conversational Speech Recognition and Speech Diarization in MLC-SLM 2025 Challenge
di: Xue, Hongfei, et al.
Pubblicazione: (2025) -
Multi-stage Large Language Model Correction for Speech Recognition
di: Pu, Jie, et al.
Pubblicazione: (2023) -
Investigating Decoder-only Large Language Models for Speech-to-text Translation
di: Huang, Chao-Wei, et al.
Pubblicazione: (2024)