Rare Word Recognition and Translation Without Fine-Tuning via Task Vector in Speech Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Jing, Ruihao, Gong, Cheng, Jiang, Yu, Zhu, Boyu, Liu, Shansong, Zhang, Chi, Zhang, Xiao-Lei, Li, Xuelong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
High-Fidelity Generative Audio Compression at 0.275kbps
por: Ma, Hao, et al.
Publicado: (2026)
por: Ma, Hao, et al.
Publicado: (2026)
$\text{M}^3\text{PDB}$: A Multimodal, Multi-Label, Multilingual Prompt Database for Speech Generation
por: Zhu, Boyu, et al.
Publicado: (2025)
por: Zhu, Boyu, et al.
Publicado: (2025)
AudioSpa: Spatializing Sound Events with Text
por: Feng, Linfeng, et al.
Publicado: (2025)
por: Feng, Linfeng, et al.
Publicado: (2025)
Selective Invocation for Multilingual ASR: A Cost-effective Approach Adapting to Speech Recognition Difficulty
por: Xue, Hongfei, et al.
Publicado: (2025)
por: Xue, Hongfei, et al.
Publicado: (2025)
Speech Emotion Recognition Using Fine-Tuned DWFormer:A Study on Track 1 of the IERPChallenge 2024
por: Wang, Honghong, et al.
Publicado: (2025)
por: Wang, Honghong, et al.
Publicado: (2025)
Enhancing Intelligibility for Generative Target Speech Extraction via Joint Optimization with Target Speaker ASR
por: Ma, Hao, et al.
Publicado: (2025)
por: Ma, Hao, et al.
Publicado: (2025)
Metadata-Enhanced Speech Emotion Recognition: Augmented Residual Integration and Co-Attention in Two-Stage Fine-Tuning
por: Wan, Zixiang, et al.
Publicado: (2024)
por: Wan, Zixiang, et al.
Publicado: (2024)
Personalized Fine-Tuning with Controllable Synthetic Speech from LLM-Generated Transcripts for Dysarthric Speech Recognition
por: Wagner, Dominik, et al.
Publicado: (2025)
por: Wagner, Dominik, et al.
Publicado: (2025)
Fine-Tuning Automatic Speech Recognition for People with Parkinson's: An Effective Strategy for Enhancing Speech Technology Accessibility
por: Zheng, Xiuwen, et al.
Publicado: (2024)
por: Zheng, Xiuwen, et al.
Publicado: (2024)
dLLM-ASR: A Faster Diffusion LLM-based Framework for Speech Recognition
por: Tian, Wenjie, et al.
Publicado: (2026)
por: Tian, Wenjie, et al.
Publicado: (2026)
Improving Rare-Word Recognition of Whisper in Zero-Shot Settings
por: Jogi, Yash, et al.
Publicado: (2025)
por: Jogi, Yash, et al.
Publicado: (2025)
Word Level Timestamp Generation for Automatic Speech Recognition and Translation
por: Hu, Ke, et al.
Publicado: (2025)
por: Hu, Ke, et al.
Publicado: (2025)
EfficientASR: Speech Recognition Network Compression via Attention Redundancy and Chunk-Level FFN Optimization
por: Wang, Jianzong, et al.
Publicado: (2024)
por: Wang, Jianzong, et al.
Publicado: (2024)
Diffusion-Based Adversarial Purification for Speaker Verification
por: Bai, Yibo, et al.
Publicado: (2023)
por: Bai, Yibo, et al.
Publicado: (2023)
Seeing the Context: Rich Visual Context-Aware Speech Recognition via Multimodal Reasoning
por: Tian, Wenjie, et al.
Publicado: (2026)
por: Tian, Wenjie, et al.
Publicado: (2026)
Persian Speech Emotion Recognition by Fine-Tuning Transformers
por: Shayaninasab, Minoo, et al.
Publicado: (2024)
por: Shayaninasab, Minoo, et al.
Publicado: (2024)
Enhancing Large Language Model-based Speech Recognition by Contextualization for Rare and Ambiguous Words
por: Nozawa, Kento, et al.
Publicado: (2024)
por: Nozawa, Kento, et al.
Publicado: (2024)
Learning Expressive Disentangled Speech Representations with Soft Speech Units and Adversarial Style Augmentation
por: Deng, Yimin, et al.
Publicado: (2024)
por: Deng, Yimin, et al.
Publicado: (2024)
Deep Learning Based Stage-wise Two-dimensional Speaker Localization with Large Ad-hoc Microphone Arrays
por: Liu, Shupei, et al.
Publicado: (2022)
por: Liu, Shupei, et al.
Publicado: (2022)
Enhancing Non-Core Language Instruction-Following in Speech LLMs via Semi-Implicit Cross-Lingual CoT Reasoning
por: Xue, Hongfei, et al.
Publicado: (2025)
por: Xue, Hongfei, et al.
Publicado: (2025)
Simultaneous Speech-to-Speech Translation Without Aligned Data
por: Labiausse, Tom, et al.
Publicado: (2026)
por: Labiausse, Tom, et al.
Publicado: (2026)
Emotion Neural Transducer for Fine-Grained Speech Emotion Recognition
por: Shen, Siyuan, et al.
Publicado: (2024)
por: Shen, Siyuan, et al.
Publicado: (2024)
A Domain Adaptation Framework for Speech Recognition Systems with Only Synthetic data
por: Tran, Minh, et al.
Publicado: (2025)
por: Tran, Minh, et al.
Publicado: (2025)
Towards Unsupervised Speech Recognition Without Pronunciation Models
por: Ni, Junrui, et al.
Publicado: (2024)
por: Ni, Junrui, et al.
Publicado: (2024)
Fine-Tuning ASR for Stuttered Speech: Personalized vs. Generalized Approaches
por: Mujtaba, Dena, et al.
Publicado: (2025)
por: Mujtaba, Dena, et al.
Publicado: (2025)
USM-Lite: Quantization and Sparsity Aware Fine-tuning for Speech Recognition with Universal Speech Models
por: Ding, Shaojin, et al.
Publicado: (2023)
por: Ding, Shaojin, et al.
Publicado: (2023)
Streaming Speech Recognition with Decoder-Only Large Language Models and Latency Optimization
por: Wan, Genshun, et al.
Publicado: (2026)
por: Wan, Genshun, et al.
Publicado: (2026)
A Lightweight Fourier-based Network for Binaural Speech Enhancement with Spatial Cue Preservation
por: Lu, Xikun, et al.
Publicado: (2025)
por: Lu, Xikun, et al.
Publicado: (2025)
Word-Level Emotional Expression Control in Zero-Shot Text-to-Speech Synthesis
por: Wang, Tianrui, et al.
Publicado: (2025)
por: Wang, Tianrui, et al.
Publicado: (2025)
EMO-SUPERB: An In-depth Look at Speech Emotion Recognition
por: Wu, Haibin, et al.
Publicado: (2024)
por: Wu, Haibin, et al.
Publicado: (2024)
Gradient Norm-based Fine-Tuning for Backdoor Defense in Automatic Speech Recognition
por: Zhou, Nanjun, et al.
Publicado: (2025)
por: Zhou, Nanjun, et al.
Publicado: (2025)
Findings of the 2024 Mandarin Stuttering Event Detection and Automatic Speech Recognition Challenge
por: Xue, Hongfei, et al.
Publicado: (2024)
por: Xue, Hongfei, et al.
Publicado: (2024)
S2ST-Omni: Hierarchical Language-Aware SpeechLLM Adaptation for Multilingual Speech-to-Speech Translation
por: Pan, Yu, et al.
Publicado: (2025)
por: Pan, Yu, et al.
Publicado: (2025)
ED-TTS: Multi-Scale Emotion Modeling using Cross-Domain Emotion Diarization for Emotional Speech Synthesis
por: Tang, Haobin, et al.
Publicado: (2024)
por: Tang, Haobin, et al.
Publicado: (2024)
EAD-VC: Enhancing Speech Auto-Disentanglement for Voice Conversion with IFUB Estimator and Joint Text-Guided Consistent Learning
por: Liang, Ziqi, et al.
Publicado: (2024)
por: Liang, Ziqi, et al.
Publicado: (2024)
Improving Speech Emotion Recognition in Under-Resourced Languages via Speech-to-Speech Translation with Bootstrapping Data Selection
por: Lin, Hsi-Che, et al.
Publicado: (2024)
por: Lin, Hsi-Che, et al.
Publicado: (2024)
RSET: Remapping-based Sorting Method for Emotion Transfer Speech Synthesis
por: Shi, Haoxiang, et al.
Publicado: (2024)
por: Shi, Haoxiang, et al.
Publicado: (2024)
Learning Disentangled Speech Representations with Contrastive Learning and Time-Invariant Retrieval
por: Deng, Yimin, et al.
Publicado: (2024)
por: Deng, Yimin, et al.
Publicado: (2024)
Vector Quantized Diffusion Model Based Speech Bandwidth Extension
por: Fang, Yuan, et al.
Publicado: (2024)
por: Fang, Yuan, et al.
Publicado: (2024)
Transcription-Free Fine-Tuning of Speech Separation Models for Noisy and Reverberant Multi-Speaker Automatic Speech Recognition
por: Ravenscroft, William, et al.
Publicado: (2024)
por: Ravenscroft, William, et al.
Publicado: (2024)
Ejemplares similares
-
High-Fidelity Generative Audio Compression at 0.275kbps
por: Ma, Hao, et al.
Publicado: (2026) -
$\text{M}^3\text{PDB}$: A Multimodal, Multi-Label, Multilingual Prompt Database for Speech Generation
por: Zhu, Boyu, et al.
Publicado: (2025) -
AudioSpa: Spatializing Sound Events with Text
por: Feng, Linfeng, et al.
Publicado: (2025) -
Selective Invocation for Multilingual ASR: A Cost-effective Approach Adapting to Speech Recognition Difficulty
por: Xue, Hongfei, et al.
Publicado: (2025) -
Speech Emotion Recognition Using Fine-Tuned DWFormer:A Study on Track 1 of the IERPChallenge 2024
por: Wang, Honghong, et al.
Publicado: (2025)