Active Learning of Non-semantic Speech Tasks with Pretrained Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Lee, Harlin, Saeed, Aaqib, Bertozzi, Andrea L. |
|---|---|
| Formato: | Preprint |
| Publicado: |
2022
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
StethoLM: Audio Language Model for Cardiopulmonary Analysis Across Clinical Tasks
por: Wang, Yishan, et al.
Publicado: (2026)
por: Wang, Yishan, et al.
Publicado: (2026)
Generative Speech Foundation Model Pretraining for High-Quality Speech Extraction and Restoration
por: Ku, Pin-Jui, et al.
Publicado: (2024)
por: Ku, Pin-Jui, et al.
Publicado: (2024)
Preserving Speaker Information in Direct Speech-to-Speech Translation with Non-Autoregressive Generation and Pretraining
por: Zhou, Rui, et al.
Publicado: (2024)
por: Zhou, Rui, et al.
Publicado: (2024)
Reducing the Gap Between Pretrained Speech Enhancement and Recognition Models Using a Real Speech-Trained Bridging Module
por: Cui, Zhongjian, et al.
Publicado: (2025)
por: Cui, Zhongjian, et al.
Publicado: (2025)
Active Learning for Text-to-Speech Synthesis with Informative Sample Collection
por: Seki, Kentaro, et al.
Publicado: (2025)
por: Seki, Kentaro, et al.
Publicado: (2025)
Active Learning with Task Adaptation Pre-training for Speech Emotion Recognition
por: Li, Dongyuan, et al.
Publicado: (2024)
por: Li, Dongyuan, et al.
Publicado: (2024)
Textless and Non-Parallel Speech-to-Speech Emotion Style Transfer
por: Dutta, Soumya, et al.
Publicado: (2025)
por: Dutta, Soumya, et al.
Publicado: (2025)
Multi-Task Pseudo-Label Learning for Non-Intrusive Speech Quality Assessment Model
por: Zezario, Ryandhimas E., et al.
Publicado: (2023)
por: Zezario, Ryandhimas E., et al.
Publicado: (2023)
Summary on The Multilingual Conversational Speech Language Model Challenge: Datasets, Tasks, Baselines, and Methods
por: Mu, Bingshen, et al.
Publicado: (2025)
por: Mu, Bingshen, et al.
Publicado: (2025)
Exploiting Audio-Visual Features with Pretrained AV-HuBERT for Multi-Modal Dysarthric Speech Reconstruction
por: Chen, Xueyuan, et al.
Publicado: (2024)
por: Chen, Xueyuan, et al.
Publicado: (2024)
RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive Language-Audio Pretraining For Speech Retrieval
por: Sun, Haoqin, et al.
Publicado: (2025)
por: Sun, Haoqin, et al.
Publicado: (2025)
An Efficient End-to-End Approach to Noise Invariant Speech Features via Multi-Task Learning
por: Guimarães, Heitor R., et al.
Publicado: (2024)
por: Guimarães, Heitor R., et al.
Publicado: (2024)
Compact Speech Translation Models via Discrete Speech Units Pretraining
por: Lam, Tsz Kin, et al.
Publicado: (2024)
por: Lam, Tsz Kin, et al.
Publicado: (2024)
Interpreting Pretrained Speech Models for Automatic Speech Assessment of Voice Disorders
por: Lau, Hok-Shing, et al.
Publicado: (2024)
por: Lau, Hok-Shing, et al.
Publicado: (2024)
Rethinking Speech Representation Aggregation in Speech Enhancement: A Phonetic Mutual Information Perspective
por: Han, Seungu, et al.
Publicado: (2026)
por: Han, Seungu, et al.
Publicado: (2026)
Retrieval Augmented Generation in Prompt-based Text-to-Speech Synthesis with Context-Aware Contrastive Language-Audio Pretraining
por: Xue, Jinlong, et al.
Publicado: (2024)
por: Xue, Jinlong, et al.
Publicado: (2024)
Rare Word Recognition and Translation Without Fine-Tuning via Task Vector in Speech Models
por: Jing, Ruihao, et al.
Publicado: (2025)
por: Jing, Ruihao, et al.
Publicado: (2025)
Multimodal Assessment of Speech Impairment in ALS Using Audio-Visual and Machine Learning Approaches
por: Pierotti, Francesco, et al.
Publicado: (2025)
por: Pierotti, Francesco, et al.
Publicado: (2025)
Analysis of Self-Supervised Speech Models on Children's Speech and Infant Vocalizations
por: Li, Jialu, et al.
Publicado: (2024)
por: Li, Jialu, et al.
Publicado: (2024)
AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning
por: Zhang, Daning, et al.
Publicado: (2025)
por: Zhang, Daning, et al.
Publicado: (2025)
Vox-Profile: A Speech Foundation Model Benchmark for Characterizing Diverse Speaker and Speech Traits
por: Feng, Tiantian, et al.
Publicado: (2025)
por: Feng, Tiantian, et al.
Publicado: (2025)
Comparison of Speech Tasks in Human Expert and Machine Detection of Parkinson's Disease
por: Plantinga, Peter, et al.
Publicado: (2025)
por: Plantinga, Peter, et al.
Publicado: (2025)
Trainingless Adaptation of Pretrained Models for Environmental Sound Classification
por: Tonami, Noriyuki, et al.
Publicado: (2024)
por: Tonami, Noriyuki, et al.
Publicado: (2024)
Naturalness-Aware Curriculum Learning with Dynamic Temperature for Speech Deepfake Detection
por: Kim, Taewoo, et al.
Publicado: (2025)
por: Kim, Taewoo, et al.
Publicado: (2025)
A Study on Zero-shot Non-intrusive Speech Assessment using Large Language Models
por: Zezario, Ryandhimas E., et al.
Publicado: (2024)
por: Zezario, Ryandhimas E., et al.
Publicado: (2024)
NOMAD: Unsupervised Learning of Perceptual Embeddings for Speech Enhancement and Non-matching Reference Audio Quality Assessment
por: Ragano, Alessandro, et al.
Publicado: (2023)
por: Ragano, Alessandro, et al.
Publicado: (2023)
Probing Self-supervised Learning Models with Target Speech Extraction
por: Peng, Junyi, et al.
Publicado: (2024)
por: Peng, Junyi, et al.
Publicado: (2024)
Low-Latency Neural Speech Phase Prediction based on Parallel Estimation Architecture and Anti-Wrapping Losses for Speech Generation Tasks
por: Ai, Yang, et al.
Publicado: (2024)
por: Ai, Yang, et al.
Publicado: (2024)
Few-step Adversarial Schrödinger Bridge for Generative Speech Enhancement
por: Han, Seungu, et al.
Publicado: (2025)
por: Han, Seungu, et al.
Publicado: (2025)
Improving Controllability and Editability for Pretrained Text-to-Music Generation Models
por: Zhang, Yixiao
Publicado: (2024)
por: Zhang, Yixiao
Publicado: (2024)
Magnetoencephalography (MEG) Based Non-Invasive Chinese Speech Decoding
por: Jia, Zhihong, et al.
Publicado: (2025)
por: Jia, Zhihong, et al.
Publicado: (2025)
Continual Test-time Adaptation for End-to-end Speech Recognition on Noisy Speech
por: Lin, Guan-Ting, et al.
Publicado: (2024)
por: Lin, Guan-Ting, et al.
Publicado: (2024)
Target Speech Extraction with Pre-trained Self-supervised Learning Models
por: Peng, Junyi, et al.
Publicado: (2024)
por: Peng, Junyi, et al.
Publicado: (2024)
Jointly Recognizing Speech and Singing Voices Based on Multi-Task Audio Source Separation
por: Bai, Ye, et al.
Publicado: (2024)
por: Bai, Ye, et al.
Publicado: (2024)
NEST: Self-supervised Fast Conformer as All-purpose Seasoning to Speech Processing Tasks
por: Huang, He, et al.
Publicado: (2024)
por: Huang, He, et al.
Publicado: (2024)
Pseudo Labels-based Neural Speech Enhancement for the AVSR Task in the MISP-Meeting Challenge
por: Luo, Longjie, et al.
Publicado: (2025)
por: Luo, Longjie, et al.
Publicado: (2025)
Dataset-Distillation Generative Model for Speech Emotion Recognition
por: Ritter-Gutierrez, Fabian, et al.
Publicado: (2024)
por: Ritter-Gutierrez, Fabian, et al.
Publicado: (2024)
Advancing Electrolaryngeal Speech Enhancement Through Speech-Text Representation Learning
por: Ma, Ding, et al.
Publicado: (2026)
por: Ma, Ding, et al.
Publicado: (2026)
Efficient Long-Form Speech Recognition for General Speech In-Context Learning
por: Yen, Hao, et al.
Publicado: (2024)
por: Yen, Hao, et al.
Publicado: (2024)
NAST: Noise Aware Speech Tokenization for Speech Language Models
por: Messica, Shoval, et al.
Publicado: (2024)
por: Messica, Shoval, et al.
Publicado: (2024)
Ejemplares similares
-
StethoLM: Audio Language Model for Cardiopulmonary Analysis Across Clinical Tasks
por: Wang, Yishan, et al.
Publicado: (2026) -
Generative Speech Foundation Model Pretraining for High-Quality Speech Extraction and Restoration
por: Ku, Pin-Jui, et al.
Publicado: (2024) -
Preserving Speaker Information in Direct Speech-to-Speech Translation with Non-Autoregressive Generation and Pretraining
por: Zhou, Rui, et al.
Publicado: (2024) -
Reducing the Gap Between Pretrained Speech Enhancement and Recognition Models Using a Real Speech-Trained Bridging Module
por: Cui, Zhongjian, et al.
Publicado: (2025) -
Active Learning for Text-to-Speech Synthesis with Informative Sample Collection
por: Seki, Kentaro, et al.
Publicado: (2025)