JSQA: Speech Quality Assessment with Perceptually-Inspired Contrastive Pretraining Based on JND Audio Pairs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Fan, Junyi, Williamson, Donald |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Aligning Generative Speech Enhancement with Perceptual Feedback
par: Li, Haoyang, et autres
Publié: (2025)
par: Li, Haoyang, et autres
Publié: (2025)
CORN: Co-Trained Full- And No-Reference Speech Quality Assessment
par: Manocha, Pranay, et autres
Publié: (2023)
par: Manocha, Pranay, et autres
Publié: (2023)
Speech Enhancement Using Continuous Embeddings of Neural Audio Codec
par: Li, Haoyang, et autres
Publié: (2025)
par: Li, Haoyang, et autres
Publié: (2025)
Unbiased Sliced Wasserstein Kernels for High-Quality Audio Captioning
par: Luong, Manh, et autres
Publié: (2025)
par: Luong, Manh, et autres
Publié: (2025)
Perceptual implications of automatic anonymization in pathological speech
par: Arasteh, Soroosh Tayebi, et autres
Publié: (2025)
par: Arasteh, Soroosh Tayebi, et autres
Publié: (2025)
Multi-Microphone Speech Emotion Recognition using the Hierarchical Token-semantic Audio Transformer Architecture
par: Cohen, Ohad, et autres
Publié: (2024)
par: Cohen, Ohad, et autres
Publié: (2024)
Self-Supervised Speech Quality Estimation and Enhancement Using Only Clean Speech
par: Fu, Szu-Wei, et autres
Publié: (2024)
par: Fu, Szu-Wei, et autres
Publié: (2024)
A SUPERB-Style Benchmark of Self-Supervised Speech Models for Audio Deepfake Detection
par: Ali, Hashim, et autres
Publié: (2026)
par: Ali, Hashim, et autres
Publié: (2026)
aTENNuate: Optimized Real-time Speech Enhancement with Deep SSMs on Raw Audio
par: Pei, Yan Ru, et autres
Publié: (2024)
par: Pei, Yan Ru, et autres
Publié: (2024)
Scaling Ambiguity: Augmenting Human Annotation in Speech Emotion Recognition with Audio-Language Models
par: Zhang, Wenda, et autres
Publié: (2026)
par: Zhang, Wenda, et autres
Publié: (2026)
A Pre-training Framework that Encodes Noise Information for Speech Quality Assessment
par: Sultana, Subrina, et autres
Publié: (2024)
par: Sultana, Subrina, et autres
Publié: (2024)
Whisper-RIR-Mega: A Paired Clean-Reverberant Speech Benchmark for ASR Robustness to Room Acoustics
par: Goswami, Mandip
Publié: (2026)
par: Goswami, Mandip
Publié: (2026)
LongAudio-RAG: Event-Grounded Question Answering over Multi-Hour Long Audio
par: Vakada, Naveen, et autres
Publié: (2026)
par: Vakada, Naveen, et autres
Publié: (2026)
Scaling Speech Tokenizers with Diffusion Autoencoders
par: Wang, Yuancheng, et autres
Publié: (2026)
par: Wang, Yuancheng, et autres
Publié: (2026)
From KAN to GR-KAN: Advancing Speech Enhancement with KAN-Based Methodology
par: Li, Haoyang, et autres
Publié: (2024)
par: Li, Haoyang, et autres
Publié: (2024)
Let There Be Sound: Reconstructing High Quality Speech from Silent Videos
par: Kim, Ji-Hoon, et autres
Publié: (2023)
par: Kim, Ji-Hoon, et autres
Publié: (2023)
Can We Estimate Purchase Intention Based on Zero-shot Speech Emotion Recognition?
par: Nagase, Ryotaro, et autres
Publié: (2024)
par: Nagase, Ryotaro, et autres
Publié: (2024)
Schrödinger Bridge Mamba for One-Step Speech Enhancement
par: Yang, Jing, et autres
Publié: (2025)
par: Yang, Jing, et autres
Publié: (2025)
Towards Leveraging Contrastively Pretrained Neural Audio Embeddings for Recommender Tasks
par: Grötschla, Florian, et autres
Publié: (2024)
par: Grötschla, Florian, et autres
Publié: (2024)
Multi-Metric Preference Alignment for Generative Speech Restoration
par: Zhang, Junan, et autres
Publié: (2025)
par: Zhang, Junan, et autres
Publié: (2025)
Audio-Based Pedestrian Detection in the Presence of Vehicular Noise
par: Kim, Yonghyun, et autres
Publié: (2025)
par: Kim, Yonghyun, et autres
Publié: (2025)
Exploring and Applying Audio-Based Sentiment Analysis in Music
par: Jhanji, Etash
Publié: (2024)
par: Jhanji, Etash
Publié: (2024)
Purification Before Fusion: Toward Mask-Free Speech Enhancement for Robust Audio-Visual Speech Recognition
par: Wu, Linzhi, et autres
Publié: (2026)
par: Wu, Linzhi, et autres
Publié: (2026)
SAM Audio Judge: A Unified Multimodal Framework for Perceptual Evaluation of Audio Separation
par: Wang, Helin, et autres
Publié: (2026)
par: Wang, Helin, et autres
Publié: (2026)
Interpreting Pretrained Speech Models for Automatic Speech Assessment of Voice Disorders
par: Lau, Hok-Shing, et autres
Publié: (2024)
par: Lau, Hok-Shing, et autres
Publié: (2024)
Example-Based Framework for Perceptually Guided Audio Texture Generation
par: Kamath, Purnima, et autres
Publié: (2023)
par: Kamath, Purnima, et autres
Publié: (2023)
Guiding Audio Editing with Audio Language Model
par: Lan, Zitong, et autres
Publié: (2025)
par: Lan, Zitong, et autres
Publié: (2025)
GMS-CAVP: Improving Audio-Video Correspondence with Multi-Scale Contrastive and Generative Pretraining
par: Mo, Shentong, et autres
Publié: (2026)
par: Mo, Shentong, et autres
Publié: (2026)
A Data-Driven Diffusion-based Approach for Audio Deepfake Explanations
par: Grinberg, Petr, et autres
Publié: (2025)
par: Grinberg, Petr, et autres
Publié: (2025)
Efficient Parallel Audio Generation using Group Masked Language Modeling
par: Jeong, Myeonghun, et autres
Publié: (2024)
par: Jeong, Myeonghun, et autres
Publié: (2024)
VINP: Variational Bayesian Inference with Neural Speech Prior for Joint ASR-Effective Speech Dereverberation and Blind RIR Identification
par: Wang, Pengyu, et autres
Publié: (2025)
par: Wang, Pengyu, et autres
Publié: (2025)
TRAMBA: A Hybrid Transformer and Mamba Architecture for Practical Audio and Bone Conduction Speech Super Resolution and Enhancement on Mobile and Wearable Platforms
par: Sui, Yueyuan, et autres
Publié: (2024)
par: Sui, Yueyuan, et autres
Publié: (2024)
EchoMark: Perceptual Acoustic Environment Transfer with Watermark-Embedded Room Impulse Response
par: Huang, Chenpei, et autres
Publié: (2025)
par: Huang, Chenpei, et autres
Publié: (2025)
What Counts as Real? Speech Restoration and Voice Quality Conversion Pose New Challenges to Deepfake Detection
par: Satish, Shree Harsha Bokkahalli, et autres
Publié: (2026)
par: Satish, Shree Harsha Bokkahalli, et autres
Publié: (2026)
Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation
par: Tseng, Wei-Cheng, et autres
Publié: (2025)
par: Tseng, Wei-Cheng, et autres
Publié: (2025)
AudioGenX: Explainability on Text-to-Audio Generative Models
par: Kang, Hyunju, et autres
Publié: (2025)
par: Kang, Hyunju, et autres
Publié: (2025)
MORE: Multi-Objective Adversarial Attacks on Speech Recognition
par: Gao, Xiaoxue, et autres
Publié: (2026)
par: Gao, Xiaoxue, et autres
Publié: (2026)
Scaling Transformers for Low-Bitrate High-Quality Speech Coding
par: Parker, Julian D, et autres
Publié: (2024)
par: Parker, Julian D, et autres
Publié: (2024)
Gibberish is All You Need for Membership Inference Detection in Contrastive Language-Audio Pretraining
par: Cheng, Ruoxi, et autres
Publié: (2024)
par: Cheng, Ruoxi, et autres
Publié: (2024)
CMGAN: Conformer-Based Metric-GAN for Monaural Speech Enhancement
par: Abdulatif, Sherif, et autres
Publié: (2022)
par: Abdulatif, Sherif, et autres
Publié: (2022)
Documents similaires
-
Aligning Generative Speech Enhancement with Perceptual Feedback
par: Li, Haoyang, et autres
Publié: (2025) -
CORN: Co-Trained Full- And No-Reference Speech Quality Assessment
par: Manocha, Pranay, et autres
Publié: (2023) -
Speech Enhancement Using Continuous Embeddings of Neural Audio Codec
par: Li, Haoyang, et autres
Publié: (2025) -
Unbiased Sliced Wasserstein Kernels for High-Quality Audio Captioning
par: Luong, Manh, et autres
Publié: (2025) -
Perceptual implications of automatic anonymization in pathological speech
par: Arasteh, Soroosh Tayebi, et autres
Publié: (2025)