ReHear: Iterative Pseudo-Label Refinement for Semi-Supervised Speech Recognition via Audio Large Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Liu, Zefang, Zhu, Chenyang, Cho, Sangwoo, Zhang, Shi-Xiong |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Iterative Prototype Refinement for Ambiguous Speech Emotion Recognition
von: Sun, Haoqin, et al.
Veröffentlicht: (2024)
von: Sun, Haoqin, et al.
Veröffentlicht: (2024)
Large Language Model Guided Decoding for Self-Supervised Speech Recognition
von: Cohen, Eyal, et al.
Veröffentlicht: (2025)
von: Cohen, Eyal, et al.
Veröffentlicht: (2025)
A Transcription Prompt-based Efficient Audio Large Language Model for Robust Speech Recognition
von: Li, Yangze, et al.
Veröffentlicht: (2024)
von: Li, Yangze, et al.
Veröffentlicht: (2024)
Few-Shot and Pseudo-Label Guided Speech Quality Evaluation with Large Language Models
von: Zezario, Ryandhimas E., et al.
Veröffentlicht: (2026)
von: Zezario, Ryandhimas E., et al.
Veröffentlicht: (2026)
The TMU System for the XACLE Challenge: Training Large Audio Language Models with CLAP Pseudo-Labels
von: Tsutsumi, Ayuto, et al.
Veröffentlicht: (2026)
von: Tsutsumi, Ayuto, et al.
Veröffentlicht: (2026)
Pseudo2Real: Task Arithmetic for Pseudo-Label Correction in Automatic Speech Recognition
von: Lin, Yi-Cheng, et al.
Veröffentlicht: (2025)
von: Lin, Yi-Cheng, et al.
Veröffentlicht: (2025)
Audio-Visual Feature Synchronization for Robust Speech Enhancement in Hearing Aids
von: Saleem, Nasir, et al.
Veröffentlicht: (2025)
von: Saleem, Nasir, et al.
Veröffentlicht: (2025)
Cross Pseudo-Labeling for Semi-Supervised Audio-Visual Source Localization
von: Guo, Yuxin, et al.
Veröffentlicht: (2024)
von: Guo, Yuxin, et al.
Veröffentlicht: (2024)
A Semi-spontaneous Dutch Speech Dataset for Speech Enhancement and Speech Recognition
von: de Groot, Dimme, et al.
Veröffentlicht: (2026)
von: de Groot, Dimme, et al.
Veröffentlicht: (2026)
Interpreting the Role of Visemes in Audio-Visual Speech Recognition
von: Papadopoulos, Aristeidis, et al.
Veröffentlicht: (2025)
von: Papadopoulos, Aristeidis, et al.
Veröffentlicht: (2025)
Unified Semi-Supervised Pipeline for Automatic Speech Recognition
von: Tadevosyan, Nune, et al.
Veröffentlicht: (2025)
von: Tadevosyan, Nune, et al.
Veröffentlicht: (2025)
Non-Intrusive Automatic Speech Recognition Refinement: A Survey
von: Peyghan, Mohammad Reza, et al.
Veröffentlicht: (2025)
von: Peyghan, Mohammad Reza, et al.
Veröffentlicht: (2025)
SuPseudo: A Pseudo-supervised Learning Method for Neural Speech Enhancement in Far-field Speech Recognition
von: Luo, Longjie, et al.
Veröffentlicht: (2025)
von: Luo, Longjie, et al.
Veröffentlicht: (2025)
Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models
von: Lin, Yuke, et al.
Veröffentlicht: (2025)
von: Lin, Yuke, et al.
Veröffentlicht: (2025)
Audio-Visual Speech Separation via Bottleneck Iterative Network
von: Zhang, Sidong, et al.
Veröffentlicht: (2025)
von: Zhang, Sidong, et al.
Veröffentlicht: (2025)
Semi-Supervised Cognitive State Classification from Speech with Multi-View Pseudo-Labeling
von: Li, Yuanchao, et al.
Veröffentlicht: (2024)
von: Li, Yuanchao, et al.
Veröffentlicht: (2024)
Adapting Speech Foundation Models for Unified Multimodal Speech Recognition with Large Language Models
von: Zhang, Jing-Xuan, et al.
Veröffentlicht: (2025)
von: Zhang, Jing-Xuan, et al.
Veröffentlicht: (2025)
Pseudo Strong Labels from Frame-Level Predictions for Weakly Supervised Sound Event Detection
von: Zhang, Yuliang, et al.
Veröffentlicht: (2025)
von: Zhang, Yuliang, et al.
Veröffentlicht: (2025)
BANC: Towards Efficient Binaural Audio Neural Codec for Overlapping Speech
von: Ratnarajah, Anton, et al.
Veröffentlicht: (2023)
von: Ratnarajah, Anton, et al.
Veröffentlicht: (2023)
Semantic-Emotional Resonance Embedding: A Semi-Supervised Paradigm for Cross-Lingual Speech Emotion Recognition
von: Zhao, Ya, et al.
Veröffentlicht: (2026)
von: Zhao, Ya, et al.
Veröffentlicht: (2026)
Streaming Speech Recognition with Decoder-Only Large Language Models and Latency Optimization
von: Wan, Genshun, et al.
Veröffentlicht: (2026)
von: Wan, Genshun, et al.
Veröffentlicht: (2026)
FairASR: Fair Audio Contrastive Learning for Automatic Speech Recognition
von: Kim, Jongsuk, et al.
Veröffentlicht: (2025)
von: Kim, Jongsuk, et al.
Veröffentlicht: (2025)
Attention-weighted Centered Kernel Alignment for Knowledge Distillation in Large Audio-Language Models Applied to Speech Emotion Recognition
von: Yang, Qingran, et al.
Veröffentlicht: (2026)
von: Yang, Qingran, et al.
Veröffentlicht: (2026)
Cross-Modal Bottleneck Fusion For Noise Robust Audio-Visual Speech Recognition
von: Ok, Seaone, et al.
Veröffentlicht: (2026)
von: Ok, Seaone, et al.
Veröffentlicht: (2026)
Enhancing Speech Large Language Models with Prompt-Aware Mixture of Audio Encoders
von: Shan, Weiqiao, et al.
Veröffentlicht: (2025)
von: Shan, Weiqiao, et al.
Veröffentlicht: (2025)
Uncovering the Visual Contribution in Audio-Visual Speech Recognition
von: Lin, Zhaofeng, et al.
Veröffentlicht: (2024)
von: Lin, Zhaofeng, et al.
Veröffentlicht: (2024)
Mitigating Subgroup Disparities in Multi-Label Speech Emotion Recognition: A Pseudo-Labeling and Unsupervised Learning Approach
von: Lin, Yi-Cheng, et al.
Veröffentlicht: (2025)
von: Lin, Yi-Cheng, et al.
Veröffentlicht: (2025)
EmoQ: Speech Emotion Recognition via Speech-Aware Q-Former and Large Language Model
von: Yang, Yiqing, et al.
Veröffentlicht: (2025)
von: Yang, Yiqing, et al.
Veröffentlicht: (2025)
Train Short, Infer Long: Speech-LLM Enables Zero-Shot Streamable Joint ASR and Diarization on Long Audio
von: Shi, Mohan, et al.
Veröffentlicht: (2025)
von: Shi, Mohan, et al.
Veröffentlicht: (2025)
Aligning Speech to Languages to Enhance Code-switching Speech Recognition
von: Liu, Hexin, et al.
Veröffentlicht: (2024)
von: Liu, Hexin, et al.
Veröffentlicht: (2024)
Few-shot Personalization via In-Context Learning for Speech Emotion Recognition based on Speech-Language Model
von: Ihori, Mana, et al.
Veröffentlicht: (2025)
von: Ihori, Mana, et al.
Veröffentlicht: (2025)
Pseudo Labels-based Neural Speech Enhancement for the AVSR Task in the MISP-Meeting Challenge
von: Luo, Longjie, et al.
Veröffentlicht: (2025)
von: Luo, Longjie, et al.
Veröffentlicht: (2025)
LCB-net: Long-Context Biasing for Audio-Visual Speech Recognition
von: Yu, Fan, et al.
Veröffentlicht: (2024)
von: Yu, Fan, et al.
Veröffentlicht: (2024)
Prosody as Supervision: Bridging the Non-Verbal--Verbal for Multilingual Speech Emotion Recognition
von: Girish, et al.
Veröffentlicht: (2026)
von: Girish, et al.
Veröffentlicht: (2026)
Generalizable Audio Deepfake Detection via Latent Space Refinement and Augmentation
von: Huang, Wen, et al.
Veröffentlicht: (2025)
von: Huang, Wen, et al.
Veröffentlicht: (2025)
Refining Self-Supervised Learnt Speech Representation using Brain Activations
von: Li, Hengyu, et al.
Veröffentlicht: (2024)
von: Li, Hengyu, et al.
Veröffentlicht: (2024)
Robust LLM-based Audio-Visual Speech Recognition with Sparse Modality Alignment and Visual Unit-Guided Refinement
von: Su, Fei, et al.
Veröffentlicht: (2026)
von: Su, Fei, et al.
Veröffentlicht: (2026)
Label-Synchronous Neural Transducer for Adaptable Online E2E Speech Recognition
von: Deng, Keqi, et al.
Veröffentlicht: (2023)
von: Deng, Keqi, et al.
Veröffentlicht: (2023)
LongCat-Audio-Codec: An Audio Tokenizer and Detokenizer Solution Designed for Speech Large Language Models
von: Zhao, Xiaohan, et al.
Veröffentlicht: (2025)
von: Zhao, Xiaohan, et al.
Veröffentlicht: (2025)
AudioSetCaps: An Enriched Audio-Caption Dataset using Automated Generation Pipeline with Large Audio and Language Models
von: Bai, Jisheng, et al.
Veröffentlicht: (2024)
von: Bai, Jisheng, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Iterative Prototype Refinement for Ambiguous Speech Emotion Recognition
von: Sun, Haoqin, et al.
Veröffentlicht: (2024) -
Large Language Model Guided Decoding for Self-Supervised Speech Recognition
von: Cohen, Eyal, et al.
Veröffentlicht: (2025) -
A Transcription Prompt-based Efficient Audio Large Language Model for Robust Speech Recognition
von: Li, Yangze, et al.
Veröffentlicht: (2024) -
Few-Shot and Pseudo-Label Guided Speech Quality Evaluation with Large Language Models
von: Zezario, Ryandhimas E., et al.
Veröffentlicht: (2026) -
The TMU System for the XACLE Challenge: Training Large Audio Language Models with CLAP Pseudo-Labels
von: Tsutsumi, Ayuto, et al.
Veröffentlicht: (2026)