Set-theoretic solution for the tuning problem
Fuente:
arXiv
Salvato in:
| Autore principale: | Deriushkin, Vsevolod Vladimirovich |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Fine-tune the pretrained ATST model for sound event detection
di: Shao, Nian, et al.
Pubblicazione: (2023)
di: Shao, Nian, et al.
Pubblicazione: (2023)
Robust fine-tuning of speech recognition models via model merging: application to disordered speech
di: Ducorroy, Alexandre, et al.
Pubblicazione: (2025)
di: Ducorroy, Alexandre, et al.
Pubblicazione: (2025)
USM-Lite: Quantization and Sparsity Aware Fine-tuning for Speech Recognition with Universal Speech Models
di: Ding, Shaojin, et al.
Pubblicazione: (2023)
di: Ding, Shaojin, et al.
Pubblicazione: (2023)
Less Forgetting for Better Generalization: Exploring Continual-learning Fine-tuning Methods for Speech Self-supervised Representations
di: Zaiem, Salah, et al.
Pubblicazione: (2024)
di: Zaiem, Salah, et al.
Pubblicazione: (2024)
Enhancing Pre-trained ASR System Fine-tuning for Dysarthric Speech Recognition using Adversarial Data Augmentation
di: Wang, Huimeng, et al.
Pubblicazione: (2024)
di: Wang, Huimeng, et al.
Pubblicazione: (2024)
Open-Set Source Tracing of Audio Deepfake Systems
di: Klein, Nicholas, et al.
Pubblicazione: (2025)
di: Klein, Nicholas, et al.
Pubblicazione: (2025)
Improving Rare-Word Recognition of Whisper in Zero-Shot Settings
di: Jogi, Yash, et al.
Pubblicazione: (2025)
di: Jogi, Yash, et al.
Pubblicazione: (2025)
Machine Unlearning in Speech Emotion Recognition via Forget Set Alone
di: Ren, Zhao, et al.
Pubblicazione: (2025)
di: Ren, Zhao, et al.
Pubblicazione: (2025)
POPDG: Popular 3D Dance Generation with PopDanceSet
di: Luo, Zhenye, et al.
Pubblicazione: (2024)
di: Luo, Zhenye, et al.
Pubblicazione: (2024)
InsectSet459: an open dataset of insect sounds for bioacoustic machine learning
di: Faiß, Marius, et al.
Pubblicazione: (2025)
di: Faiß, Marius, et al.
Pubblicazione: (2025)
IITKGP-ABSP Submission to LRE22: Language Recognition in Low-Resource Settings
di: Dey, Spandan, et al.
Pubblicazione: (2025)
di: Dey, Spandan, et al.
Pubblicazione: (2025)
ASTAR-NTU solution to AudioMOS Challenge 2025 Track1
di: Ritter-Gutierrez, Fabian, et al.
Pubblicazione: (2025)
di: Ritter-Gutierrez, Fabian, et al.
Pubblicazione: (2025)
Unmixing the Crowd: Learning Mixture-to-Set Speaker Embeddings for Enrollment-Free Target Speech Extraction
di: Sidharth, FNU, et al.
Pubblicazione: (2026)
di: Sidharth, FNU, et al.
Pubblicazione: (2026)
Enhancing Open-Set Speaker Identification through Rapid Tuning with Speaker Reciprocal Points and Negative Sample
di: Chen, Zhiyong, et al.
Pubblicazione: (2024)
di: Chen, Zhiyong, et al.
Pubblicazione: (2024)
BLAT: Bootstrapping Language-Audio Pre-training based on AudioSet Tag-guided Synthetic Data
di: Xu, Xuenan, et al.
Pubblicazione: (2023)
di: Xu, Xuenan, et al.
Pubblicazione: (2023)
Deep Learning for Tuberculosis Screening in a High-burden Setting using Cough Analysis and Speech Foundation Models
di: Ma, Ning, et al.
Pubblicazione: (2025)
di: Ma, Ning, et al.
Pubblicazione: (2025)
Improving Anomalous Sound Detection through Pseudo-anomalous Set Selection and Pseudo-label Utilization under Unlabeled Conditions
di: Kuroyanagi, Ibuki, et al.
Pubblicazione: (2025)
di: Kuroyanagi, Ibuki, et al.
Pubblicazione: (2025)
Extending Whisper with prompt tuning to target-speaker ASR
di: Ma, Hao, et al.
Pubblicazione: (2023)
di: Ma, Hao, et al.
Pubblicazione: (2023)
Speech-to-See: End-to-End Speech-Driven Open-Set Object Detection
di: Lu, Wenhuan, et al.
Pubblicazione: (2025)
di: Lu, Wenhuan, et al.
Pubblicazione: (2025)
Completing Sets of Prototype Transfer Functions for Subspace-based Direction of Arrival Estimation of Multiple Speakers
di: Fejgin, Daniel, et al.
Pubblicazione: (2025)
di: Fejgin, Daniel, et al.
Pubblicazione: (2025)
SCORE: Self-supervised Correspondence Fine-tuning for Improved Content Representations
di: Meghanani, Amit, et al.
Pubblicazione: (2024)
di: Meghanani, Amit, et al.
Pubblicazione: (2024)
ESPnet-EZ: Python-only ESPnet for Easy Fine-tuning and Integration
di: Someki, Masao, et al.
Pubblicazione: (2024)
di: Someki, Masao, et al.
Pubblicazione: (2024)
Improving the Inclusivity of Dutch Speech Recognition by Fine-tuning Whisper on the JASMIN-CGN Corpus
di: Shekoufandeh, Golshid, et al.
Pubblicazione: (2025)
di: Shekoufandeh, Golshid, et al.
Pubblicazione: (2025)
Improving Spoken Language Modeling with Phoneme Classification: A Simple Fine-tuning Approach
di: Poli, Maxime, et al.
Pubblicazione: (2024)
di: Poli, Maxime, et al.
Pubblicazione: (2024)
Position-invariant Fine-tuning of Speech Enhancement Models with Self-supervised Speech Representations
di: Meghanani, Amit, et al.
Pubblicazione: (2026)
di: Meghanani, Amit, et al.
Pubblicazione: (2026)
Breaking the Transcription Bottleneck: Fine-tuning ASR Models for Extremely Low-Resource Fieldwork Languages
di: Liang, Siyu, et al.
Pubblicazione: (2025)
di: Liang, Siyu, et al.
Pubblicazione: (2025)
Improving Multilingual Speech Models on ML-SUPERB 2.0: Fine-tuning with Data Augmentation and LID-Aware CTC
di: Wang, Qingzheng, et al.
Pubblicazione: (2025)
di: Wang, Qingzheng, et al.
Pubblicazione: (2025)
A dual task learning approach to fine-tune a multilingual semantic speech encoder for Spoken Language Understanding
di: Laperrière, Gaëlle, et al.
Pubblicazione: (2024)
di: Laperrière, Gaëlle, et al.
Pubblicazione: (2024)
Melodia: Training-Free Music Editing Guided by Attention Probing in Diffusion Models
di: Yang, Yi, et al.
Pubblicazione: (2025)
di: Yang, Yi, et al.
Pubblicazione: (2025)
Adaptive Convolution for CNN-based Speech Enhancement Models
di: Wang, Dahan, et al.
Pubblicazione: (2025)
di: Wang, Dahan, et al.
Pubblicazione: (2025)
DOTA-ME-CS: Daily Oriented Text Audio-Mandarin English-Code Switching Dataset
di: Li, Yupei, et al.
Pubblicazione: (2025)
di: Li, Yupei, et al.
Pubblicazione: (2025)
UBGAN: Enhancing Coded Speech with Blind and Guided Bandwidth Extension
di: Gupta, Kishan, et al.
Pubblicazione: (2025)
di: Gupta, Kishan, et al.
Pubblicazione: (2025)
GDiffuSE: Diffusion-based speech enhancement with noise model guidance
di: Yanir, Efrayim, et al.
Pubblicazione: (2025)
di: Yanir, Efrayim, et al.
Pubblicazione: (2025)
Subjective quality evaluation of personalized own voice reconstruction systems
di: Ohlenbusch, Mattes, et al.
Pubblicazione: (2025)
di: Ohlenbusch, Mattes, et al.
Pubblicazione: (2025)
Fast-Converging Distributed Signal Estimation in Topology-Unconstrained Wireless Acoustic Sensor Networks
di: Didier, Paul, et al.
Pubblicazione: (2025)
di: Didier, Paul, et al.
Pubblicazione: (2025)
FlashSR: One-step Versatile Audio Super-resolution via Diffusion Distillation
di: Im, Jaekwon, et al.
Pubblicazione: (2025)
di: Im, Jaekwon, et al.
Pubblicazione: (2025)
An adaptive filter bank based neural network approach for time delay estimation and speech enhancement
di: Ma, Lu
Pubblicazione: (2025)
di: Ma, Lu
Pubblicazione: (2025)
Personalized Fine-Tuning with Controllable Synthetic Speech from LLM-Generated Transcripts for Dysarthric Speech Recognition
di: Wagner, Dominik, et al.
Pubblicazione: (2025)
di: Wagner, Dominik, et al.
Pubblicazione: (2025)
Pushing the Frontiers of Self-Distillation Prototypes Network with Dimension Regularization and Score Normalization
di: Chen, Yafeng, et al.
Pubblicazione: (2025)
di: Chen, Yafeng, et al.
Pubblicazione: (2025)
Uni-VERSA: Versatile Speech Assessment with a Unified Network
di: Shi, Jiatong, et al.
Pubblicazione: (2025)
di: Shi, Jiatong, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Fine-tune the pretrained ATST model for sound event detection
di: Shao, Nian, et al.
Pubblicazione: (2023) -
Robust fine-tuning of speech recognition models via model merging: application to disordered speech
di: Ducorroy, Alexandre, et al.
Pubblicazione: (2025) -
USM-Lite: Quantization and Sparsity Aware Fine-tuning for Speech Recognition with Universal Speech Models
di: Ding, Shaojin, et al.
Pubblicazione: (2023) -
Less Forgetting for Better Generalization: Exploring Continual-learning Fine-tuning Methods for Speech Self-supervised Representations
di: Zaiem, Salah, et al.
Pubblicazione: (2024) -
Enhancing Pre-trained ASR System Fine-tuning for Dysarthric Speech Recognition using Adversarial Data Augmentation
di: Wang, Huimeng, et al.
Pubblicazione: (2024)