Audio-Visual Representation Learning via Knowledge Distillation from Speech Foundation Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Jing-Xuan, Wan, Genshun, Gao, Jianqing, Ling, Zhen-Hua |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Streaming Speech Recognition with Decoder-Only Large Language Models and Latency Optimization
par: Wan, Genshun, et autres
Publié: (2026)
par: Wan, Genshun, et autres
Publié: (2026)
Adapting Speech Foundation Models for Unified Multimodal Speech Recognition with Large Language Models
par: Zhang, Jing-Xuan, et autres
Publié: (2025)
par: Zhang, Jing-Xuan, et autres
Publié: (2025)
Deep CLAS: Deep Contextual Listen, Attend and Spell
par: Wang, Mengzhi, et autres
Publié: (2024)
par: Wang, Mengzhi, et autres
Publié: (2024)
USAD: Universal Speech and Audio Representation via Distillation
par: Chang, Heng-Jui, et autres
Publié: (2025)
par: Chang, Heng-Jui, et autres
Publié: (2025)
Low-Latency Neural Speech Phase Prediction based on Parallel Estimation Architecture and Anti-Wrapping Losses for Speech Generation Tasks
par: Ai, Yang, et autres
Publié: (2024)
par: Ai, Yang, et autres
Publié: (2024)
DAIEN-TTS: Disentangled Audio Infilling for Environment-Aware Text-to-Speech Synthesis
par: Lu, Ye-Xin, et autres
Publié: (2025)
par: Lu, Ye-Xin, et autres
Publié: (2025)
Attention-weighted Centered Kernel Alignment for Knowledge Distillation in Large Audio-Language Models Applied to Speech Emotion Recognition
par: Yang, Qingran, et autres
Publié: (2026)
par: Yang, Qingran, et autres
Publié: (2026)
SONAR: Self-Distilled Continual Pre-training for Domain Adaptive Audio Representation
par: Zhang, Yizhou, et autres
Publié: (2025)
par: Zhang, Yizhou, et autres
Publié: (2025)
Uncovering the Visual Contribution in Audio-Visual Speech Recognition
par: Lin, Zhaofeng, et autres
Publié: (2024)
par: Lin, Zhaofeng, et autres
Publié: (2024)
AVR: Synergizing Foundation Models for Audio-Visual Humor Detection
par: Sharma, Sarthak, et autres
Publié: (2024)
par: Sharma, Sarthak, et autres
Publié: (2024)
Efficient Audio Captioning with Encoder-Level Knowledge Distillation
par: Xu, Xuenan, et autres
Publié: (2024)
par: Xu, Xuenan, et autres
Publié: (2024)
Universal Preference-Score-based Pairwise Speech Quality Assessment
par: Shi, Yu-Fei, et autres
Publié: (2025)
par: Shi, Yu-Fei, et autres
Publié: (2025)
SECodec: Structural Entropy-based Compressive Speech Representation Codec for Speech Language Models
par: Wang, Linqin, et autres
Publié: (2024)
par: Wang, Linqin, et autres
Publié: (2024)
A Fast and Lightweight Model for Causal Audio-Visual Speech Separation
par: Sang, Wendi, et autres
Publié: (2025)
par: Sang, Wendi, et autres
Publié: (2025)
Explicit Estimation of Magnitude and Phase Spectra in Parallel for High-Quality Speech Enhancement
par: Lu, Ye-Xin, et autres
Publié: (2023)
par: Lu, Ye-Xin, et autres
Publié: (2023)
Adaptive Speech Emotion Representation Learning Based On Dynamic Graph
par: Gao, Yingxue, et autres
Publié: (2024)
par: Gao, Yingxue, et autres
Publié: (2024)
Audio-Visual Speech Separation via Bottleneck Iterative Network
par: Zhang, Sidong, et autres
Publié: (2025)
par: Zhang, Sidong, et autres
Publié: (2025)
AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning
par: Zhang, Daning, et autres
Publié: (2025)
par: Zhang, Daning, et autres
Publié: (2025)
Learning Expressive Disentangled Speech Representations with Soft Speech Units and Adversarial Style Augmentation
par: Deng, Yimin, et autres
Publié: (2024)
par: Deng, Yimin, et autres
Publié: (2024)
Structural and Statistical Audio Texture Knowledge Distillation for Acoustic Classification
par: Ritu, Jarin, et autres
Publié: (2025)
par: Ritu, Jarin, et autres
Publié: (2025)
Efficient Speech Watermarking for Speech Synthesis via Progressive Knowledge Distillation
par: Cui, Yang, et autres
Publié: (2025)
par: Cui, Yang, et autres
Publié: (2025)
Dynamic Frequency-Adaptive Knowledge Distillation for Speech Enhancement
par: Yuan, Xihao, et autres
Publié: (2025)
par: Yuan, Xihao, et autres
Publié: (2025)
Frequency-mix Knowledge Distillation for Fake Speech Detection
par: Fan, Cunhang, et autres
Publié: (2024)
par: Fan, Cunhang, et autres
Publié: (2024)
Rethinking Continual Learning for Speech and Audio: A Representation-Centric Taxonomy and Open Problems
par: Xiao, Yang, et autres
Publié: (2026)
par: Xiao, Yang, et autres
Publié: (2026)
Audio-Visual Speech Enhancement in Noisy Environments via Emotion-Based Contextual Cues
par: Hussain, Tassadaq, et autres
Publié: (2024)
par: Hussain, Tassadaq, et autres
Publié: (2024)
LongCat-Audio-Codec: An Audio Tokenizer and Detokenizer Solution Designed for Speech Large Language Models
par: Zhao, Xiaohan, et autres
Publié: (2025)
par: Zhao, Xiaohan, et autres
Publié: (2025)
Distil-DCCRN: A Small-footprint DCCRN Leveraging Feature-based Knowledge Distillation in Speech Enhancement
par: Han, Runduo, et autres
Publié: (2024)
par: Han, Runduo, et autres
Publié: (2024)
Multimodal Assessment of Speech Impairment in ALS Using Audio-Visual and Machine Learning Approaches
par: Pierotti, Francesco, et autres
Publié: (2025)
par: Pierotti, Francesco, et autres
Publié: (2025)
Learning Disentangled Speech Representations with Contrastive Learning and Time-Invariant Retrieval
par: Deng, Yimin, et autres
Publié: (2024)
par: Deng, Yimin, et autres
Publié: (2024)
Investigating Neural Audio Codecs for Speech Language Model-Based Speech Generation
par: Li, Jiaqi, et autres
Publié: (2024)
par: Li, Jiaqi, et autres
Publié: (2024)
Leveraging Local and Global Knowledge Integration with Time-Frequency Calibrated Distillation for Speech Enhancement
par: Cheng, Jiaming, et autres
Publié: (2025)
par: Cheng, Jiaming, et autres
Publié: (2025)
UniAudio: An Audio Foundation Model Toward Universal Audio Generation
par: Yang, Dongchao, et autres
Publié: (2023)
par: Yang, Dongchao, et autres
Publié: (2023)
Emotion-Aware Speech Self-Supervised Representation Learning with Intensity Knowledge
par: Liu, Rui, et autres
Publié: (2024)
par: Liu, Rui, et autres
Publié: (2024)
DCIM-AVSR : Efficient Audio-Visual Speech Recognition via Dual Conformer Interaction Module
par: Wang, Xinyu, et autres
Publié: (2024)
par: Wang, Xinyu, et autres
Publié: (2024)
Compositional Audio Representation Learning
par: Sridhar, Sripathi, et autres
Publié: (2024)
par: Sridhar, Sripathi, et autres
Publié: (2024)
MOSS-Audio-Tokenizer: Scaling Audio Tokenizers for Future Audio Foundation Models
par: Gong, Yitian, et autres
Publié: (2026)
par: Gong, Yitian, et autres
Publié: (2026)
Multi-Stage Speech Bandwidth Extension with Flexible Sampling Rate Control
par: Lu, Ye-Xin, et autres
Publié: (2024)
par: Lu, Ye-Xin, et autres
Publié: (2024)
Fast Text-to-Audio Generation with One-Step Sampling via Energy-Scoring and Auxiliary Contextual Representation Distillation
par: Huang, Kuan-Po, et autres
Publié: (2026)
par: Huang, Kuan-Po, et autres
Publié: (2026)
Leveraging Mamba with Full-Face Vision for Audio-Visual Speech Enhancement
par: Chao, Rong, et autres
Publié: (2025)
par: Chao, Rong, et autres
Publié: (2025)
XLAVS-R: Cross-Lingual Audio-Visual Speech Representation Learning for Noise-Robust Speech Perception
par: Han, HyoJung, et autres
Publié: (2024)
par: Han, HyoJung, et autres
Publié: (2024)
Documents similaires
-
Streaming Speech Recognition with Decoder-Only Large Language Models and Latency Optimization
par: Wan, Genshun, et autres
Publié: (2026) -
Adapting Speech Foundation Models for Unified Multimodal Speech Recognition with Large Language Models
par: Zhang, Jing-Xuan, et autres
Publié: (2025) -
Deep CLAS: Deep Contextual Listen, Attend and Spell
par: Wang, Mengzhi, et autres
Publié: (2024) -
USAD: Universal Speech and Audio Representation via Distillation
par: Chang, Heng-Jui, et autres
Publié: (2025) -
Low-Latency Neural Speech Phase Prediction based on Parallel Estimation Architecture and Anti-Wrapping Losses for Speech Generation Tasks
par: Ai, Yang, et autres
Publié: (2024)