Enregistré dans:
| Auteurs principaux: | Shi, Hao, Gao, Yuan, Lu, Xugang, Kawahara, Tatsuya |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2603.27205 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Exploration of Adapter for Noise Robust Automatic Speech Recognition
par: Shi, Hao, et autres
Publié: (2024)
par: Shi, Hao, et autres
Publié: (2024)
Combining Deterministic Enhanced Conditions with Dual-Streaming Encoding for Diffusion-Based Speech Enhancement
par: Shi, Hao, et autres
Publié: (2025)
par: Shi, Hao, et autres
Publié: (2025)
Serialized Speech Information Guidance with Overlapped Encoding Separation for Multi-Speaker Automatic Speech Recognition
par: Shi, Hao, et autres
Publié: (2024)
par: Shi, Hao, et autres
Publié: (2024)
Bridging Speech Emotion Recognition and Personality: Dataset and Temporal Interaction Condition Network
par: Gao, Yuan, et autres
Publié: (2025)
par: Gao, Yuan, et autres
Publié: (2025)
Distilling LLM Semantic Priors into Encoder-Only Multi-Talker ASR with Talker-Count Routing
par: Shi, Hao, et autres
Publié: (2026)
par: Shi, Hao, et autres
Publié: (2026)
ERM-MinMaxGAP: Benchmarking and Mitigating Gender Bias in Multilingual Multimodal Speech-LLM Emotion Recognition
par: Pang, Zi Haur, et autres
Publié: (2026)
par: Pang, Zi Haur, et autres
Publié: (2026)
Cross-Speaker Encoding Network for Multi-Talker Speech Recognition
par: Kang, Jiawen, et autres
Publié: (2024)
par: Kang, Jiawen, et autres
Publié: (2024)
Efficient and Robust Long-Form Speech Recognition with Hybrid H3-Conformer
par: Honda, Tomoki, et autres
Publié: (2024)
par: Honda, Tomoki, et autres
Publié: (2024)
Benchmarking Japanese Speech Recognition on ASR-LLM Setups with Multi-Pass Augmented Generative Error Correction
par: Ko, Yuka, et autres
Publié: (2024)
par: Ko, Yuka, et autres
Publié: (2024)
Empowering Whisper as a Joint Multi-Talker and Target-Talker Speech Recognition System
par: Meng, Lingwei, et autres
Publié: (2024)
par: Meng, Lingwei, et autres
Publié: (2024)
Two-Stage Adaptation for Non-Normative Speech Recognition: Revisiting Speaker-Independent Initialization for Personalization
par: Jiang, Shan, et autres
Publié: (2026)
par: Jiang, Shan, et autres
Publié: (2026)
Serialized Output Prompting for Large Language Model-based Multi-Talker Speech Recognition
par: Shi, Hao, et autres
Publié: (2025)
par: Shi, Hao, et autres
Publié: (2025)
Equipping LLM with Directional Multi-Talker Speech Understanding Capabilities
par: Lin, Ju, et autres
Publié: (2026)
par: Lin, Ju, et autres
Publié: (2026)
Retrieval-Augmented Speech Recognition Approach for Domain Challenges
par: Shen, Peng, et autres
Publié: (2025)
par: Shen, Peng, et autres
Publié: (2025)
An LLM Benchmark for Addressee Recognition in Multi-modal Multi-party Dialogue
par: Inoue, Koji, et autres
Publié: (2025)
par: Inoue, Koji, et autres
Publié: (2025)
Elevating Robust Multi-Talker ASR by Decoupling Speaker Separation and Speech Recognition
par: Yang, Yufeng, et autres
Publié: (2025)
par: Yang, Yufeng, et autres
Publié: (2025)
Disentangling Speakers in Multi-Talker Speech Recognition with Speaker-Aware CTC
par: Kang, Jiawen, et autres
Publié: (2024)
par: Kang, Jiawen, et autres
Publié: (2024)
Paralinguistic Emotion-Aware Validation Timing Detection in Japanese Empathetic Spoken Dialogue
par: Pang, Zi Haur, et autres
Publié: (2026)
par: Pang, Zi Haur, et autres
Publié: (2026)
Adapting Diarization-Conditioned Whisper for End-to-End Multi-Talker Speech Recognition
par: Kocour, Martin, et autres
Publié: (2025)
par: Kocour, Martin, et autres
Publié: (2025)
Hypothesis Clustering and Merging: Novel MultiTalker Speech Recognition with Speaker Tokens
par: Kashiwagi, Yosuke, et autres
Publié: (2024)
par: Kashiwagi, Yosuke, et autres
Publié: (2024)
Error Correction by Paying Attention to Both Acoustic and Confidence References for Automatic Speech Recognition
par: Shu, Yuchun, et autres
Publié: (2024)
par: Shu, Yuchun, et autres
Publié: (2024)
Modulation Feature Enhancement with a Multi-Stage Attention Network for Underwater Acoustic Target Recognition
par: Yu, Jiaping, et autres
Publié: (2026)
par: Yu, Jiaping, et autres
Publié: (2026)
MSF-SER: Enriching Acoustic Modeling with Multi-Granularity Semantics for Speech Emotion Recognition
par: Li, Haoxun, et autres
Publié: (2025)
par: Li, Haoxun, et autres
Publié: (2025)
Incorporating Talker Identity Aids With Improving Speech Recognition in Adversarial Environments
par: Alavilli, Sagarika, et autres
Publié: (2024)
par: Alavilli, Sagarika, et autres
Publié: (2024)
Speaker-Distinguishable CTC: Learning Speaker Distinction Using CTC for Multi-Talker Speech Recognition
par: Sakuma, Asahi, et autres
Publié: (2025)
par: Sakuma, Asahi, et autres
Publié: (2025)
Improving Practical Aspects of End-to-End Multi-Talker Speech Recognition for Online and Offline Scenarios
par: Subramanian, Aswin Shanmugam, et autres
Publié: (2025)
par: Subramanian, Aswin Shanmugam, et autres
Publié: (2025)
Diffusion-Based Speech Enhancement with Joint Generative and Predictive Decoders
par: Shi, Hao, et autres
Publié: (2023)
par: Shi, Hao, et autres
Publié: (2023)
Attention-Guided Adaptation for Code-Switching Speech Recognition
par: Aditya, Bobbi, et autres
Publié: (2023)
par: Aditya, Bobbi, et autres
Publié: (2023)
An Efficient Transfer Learning Method Based on Adapter with Local Attributes for Speech Emotion Recognition
par: Song, Haoyu, et autres
Publié: (2025)
par: Song, Haoyu, et autres
Publié: (2025)
Emotion-Aware Contrastive Adaptation Network for Source-Free Cross-Corpus Speech Emotion Recognition
par: Zhao, Yan, et autres
Publié: (2024)
par: Zhao, Yan, et autres
Publié: (2024)
Metadata-Enhanced Speech Emotion Recognition: Augmented Residual Integration and Co-Attention in Two-Stage Fine-Tuning
par: Wan, Zixiang, et autres
Publié: (2024)
par: Wan, Zixiang, et autres
Publié: (2024)
SONAR: Self-Distilled Continual Pre-training for Domain Adaptive Audio Representation
par: Zhang, Yizhou, et autres
Publié: (2025)
par: Zhang, Yizhou, et autres
Publié: (2025)
Channel Adaptation for Speaker Verification Using Optimal Transport with Pseudo Label
par: Yang, Wenhao, et autres
Publié: (2024)
par: Yang, Wenhao, et autres
Publié: (2024)
Advancing Robust Underwater Acoustic Target Recognition through Multi-task Learning and Multi-Gate Mixture-of-Experts
par: Xie, Yuan, et autres
Publié: (2024)
par: Xie, Yuan, et autres
Publié: (2024)
FUSE: Universal Speech Enhancement using Multi-Stage Fusion of Sparse Compression and Token Generation Models for the URGENT 2025 Challenge
par: Goswami, Nabarun, et autres
Publié: (2025)
par: Goswami, Nabarun, et autres
Publié: (2025)
EMO-TTA: Improving Test-Time Adaptation of Audio-Language Models for Speech Emotion Recognition
par: Shi, Jiacheng, et autres
Publié: (2025)
par: Shi, Jiacheng, et autres
Publié: (2025)
SlideAVSR: A Dataset of Paper Explanation Videos for Audio-Visual Speech Recognition
par: Wang, Hao, et autres
Publié: (2024)
par: Wang, Hao, et autres
Publié: (2024)
Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition
par: Zhao, Ruoyu, et autres
Publié: (2025)
par: Zhao, Ruoyu, et autres
Publié: (2025)
Attention-Based Beamformer For Multi-Channel Speech Enhancement
par: Bai, Jinglin, et autres
Publié: (2024)
par: Bai, Jinglin, et autres
Publié: (2024)
FLASepformer: Efficient Speech Separation with Gated Focused Linear Attention Transformer
par: Wang, Haoxu, et autres
Publié: (2025)
par: Wang, Haoxu, et autres
Publié: (2025)
Documents similaires
-
Exploration of Adapter for Noise Robust Automatic Speech Recognition
par: Shi, Hao, et autres
Publié: (2024) -
Combining Deterministic Enhanced Conditions with Dual-Streaming Encoding for Diffusion-Based Speech Enhancement
par: Shi, Hao, et autres
Publié: (2025) -
Serialized Speech Information Guidance with Overlapped Encoding Separation for Multi-Speaker Automatic Speech Recognition
par: Shi, Hao, et autres
Publié: (2024) -
Bridging Speech Emotion Recognition and Personality: Dataset and Temporal Interaction Condition Network
par: Gao, Yuan, et autres
Publié: (2025) -
Distilling LLM Semantic Priors into Encoder-Only Multi-Talker ASR with Talker-Count Routing
par: Shi, Hao, et autres
Publié: (2026)