Disentangling Textual and Acoustic Features of Neural Speech Representations
Fuente:
arXiv
Salvato in:
| Autori principali: | Mohebbi, Hosein, Chrupała, Grzegorz, Zuidema, Willem, Alishahi, Afra, Titov, Ivan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
On the reliability of feature attribution methods for speech classification
di: Shen, Gaofei, et al.
Pubblicazione: (2025)
di: Shen, Gaofei, et al.
Pubblicazione: (2025)
Beyond Decodability: Reconstructing Language Model Representations with an Encoding Probe
di: Shen, Gaofei, et al.
Pubblicazione: (2026)
di: Shen, Gaofei, et al.
Pubblicazione: (2026)
ProMode: A Speech Prosody Model Conditioned on Acoustic and Textual Inputs
di: Eren, Eray, et al.
Pubblicazione: (2025)
di: Eren, Eray, et al.
Pubblicazione: (2025)
Encoding of lexical tone in self-supervised models of spoken language
di: Shen, Gaofei, et al.
Pubblicazione: (2024)
di: Shen, Gaofei, et al.
Pubblicazione: (2024)
What do self-supervised speech models know about Dutch? Analyzing advantages of language-specific pre-training
di: Kloots, Marianne de Heer, et al.
Pubblicazione: (2025)
di: Kloots, Marianne de Heer, et al.
Pubblicazione: (2025)
Textually Pretrained Speech Language Models
di: Hassid, Michael, et al.
Pubblicazione: (2023)
di: Hassid, Michael, et al.
Pubblicazione: (2023)
Human-like Linguistic Biases in Neural Speech Models: Phonetic Categorization and Phonotactic Constraints in Wav2Vec2.0
di: Kloots, Marianne de Heer, et al.
Pubblicazione: (2024)
di: Kloots, Marianne de Heer, et al.
Pubblicazione: (2024)
PAST: Phonetic-Acoustic Speech Tokenizer
di: Har-Tuv, Nadav, et al.
Pubblicazione: (2025)
di: Har-Tuv, Nadav, et al.
Pubblicazione: (2025)
Investigating Disentanglement in a Phoneme-level Speech Codec for Prosody Modeling
di: Karapiperis, Sotirios, et al.
Pubblicazione: (2024)
di: Karapiperis, Sotirios, et al.
Pubblicazione: (2024)
Learning Disentangled Speech Representations
di: Brima, Yusuf, et al.
Pubblicazione: (2023)
di: Brima, Yusuf, et al.
Pubblicazione: (2023)
Towards the Next Frontier in Speech Representation Learning Using Disentanglement
di: Krishna, Varun, et al.
Pubblicazione: (2024)
di: Krishna, Varun, et al.
Pubblicazione: (2024)
Regularizing Learnable Feature Extraction for Automatic Speech Recognition
di: Vieting, Peter, et al.
Pubblicazione: (2025)
di: Vieting, Peter, et al.
Pubblicazione: (2025)
How Redundant Is the Transformer Stack in Speech Representation Models?
di: Dorszewski, Teresa, et al.
Pubblicazione: (2024)
di: Dorszewski, Teresa, et al.
Pubblicazione: (2024)
SpeechX: Neural Codec Language Model as a Versatile Speech Transformer
di: Wang, Xiaofei, et al.
Pubblicazione: (2023)
di: Wang, Xiaofei, et al.
Pubblicazione: (2023)
Benchmarking Representations for Speech, Music, and Acoustic Events
di: La Quatra, Moreno, et al.
Pubblicazione: (2024)
di: La Quatra, Moreno, et al.
Pubblicazione: (2024)
Early Attentive Sparsification Accelerates Neural Speech Transcription
di: Xu, Zifei, et al.
Pubblicazione: (2025)
di: Xu, Zifei, et al.
Pubblicazione: (2025)
Cascaded Cross-Modal Transformer for Audio-Textual Classification
di: Ristea, Nicolae-Catalin, et al.
Pubblicazione: (2024)
di: Ristea, Nicolae-Catalin, et al.
Pubblicazione: (2024)
PersonaTAB: Predicting Personality Traits using Textual, Acoustic, and Behavioral Cues in Fully-Duplex Speech Dialogs
di: Inoue, Sho, et al.
Pubblicazione: (2025)
di: Inoue, Sho, et al.
Pubblicazione: (2025)
CA-SSLR: Condition-Aware Self-Supervised Learning Representation for Generalized Speech Processing
di: Lu, Yen-Ju, et al.
Pubblicazione: (2024)
di: Lu, Yen-Ju, et al.
Pubblicazione: (2024)
Prosodic ABX: A Language-Agnostic Method for Measuring Prosodic Contrast in Speech Representations
di: Sun, Haitong, et al.
Pubblicazione: (2026)
di: Sun, Haitong, et al.
Pubblicazione: (2026)
EH-MAM: Easy-to-Hard Masked Acoustic Modeling for Self-Supervised Speech Representation Learning
di: Seth, Ashish, et al.
Pubblicazione: (2024)
di: Seth, Ashish, et al.
Pubblicazione: (2024)
Africa-Centric Self-Supervised Pre-Training for Multilingual Speech Representation in a Sub-Saharan Context
di: Caubrière, Antoine, et al.
Pubblicazione: (2024)
di: Caubrière, Antoine, et al.
Pubblicazione: (2024)
Utilizing Neural Transducers for Two-Stage Text-to-Speech via Semantic Token Prediction
di: Kim, Minchan, et al.
Pubblicazione: (2024)
di: Kim, Minchan, et al.
Pubblicazione: (2024)
Unsupervised TTS Acoustic Modeling for TTS with Conditional Disentangled Sequential VAE
di: Lian, Jiachen, et al.
Pubblicazione: (2022)
di: Lian, Jiachen, et al.
Pubblicazione: (2022)
Analyzing Speech Unit Selection for Textless Speech-to-Speech Translation
di: Duret, Jarod, et al.
Pubblicazione: (2024)
di: Duret, Jarod, et al.
Pubblicazione: (2024)
SimulTron: On-Device Simultaneous Speech to Speech Translation
di: Agranovich, Alex, et al.
Pubblicazione: (2024)
di: Agranovich, Alex, et al.
Pubblicazione: (2024)
Translatotron 3: Speech to Speech Translation with Monolingual Data
di: Nachmani, Eliya, et al.
Pubblicazione: (2023)
di: Nachmani, Eliya, et al.
Pubblicazione: (2023)
Speech Robust Bench: A Robustness Benchmark For Speech Recognition
di: Shah, Muhammad A., et al.
Pubblicazione: (2024)
di: Shah, Muhammad A., et al.
Pubblicazione: (2024)
Sortformer: A Novel Approach for Permutation-Resolved Speaker Supervision in Speech-to-Text Systems
di: Park, Taejin, et al.
Pubblicazione: (2024)
di: Park, Taejin, et al.
Pubblicazione: (2024)
Improving Acoustic Word Embeddings through Correspondence Training of Self-supervised Speech Representations
di: Meghanani, Amit, et al.
Pubblicazione: (2024)
di: Meghanani, Amit, et al.
Pubblicazione: (2024)
Universal Robust Speech Adaptation for Cross-Domain Speech Recognition and Enhancement
di: Wang, Chien-Chun, et al.
Pubblicazione: (2026)
di: Wang, Chien-Chun, et al.
Pubblicazione: (2026)
Speech Recognition With LLMs Adapted to Disordered Speech Using Reinforcement Learning
di: Nagpal, Chirag, et al.
Pubblicazione: (2024)
di: Nagpal, Chirag, et al.
Pubblicazione: (2024)
ParaMETA: Towards Learning Disentangled Paralinguistic Speaking Styles Representations from Speech
di: Lou, Haowei, et al.
Pubblicazione: (2026)
di: Lou, Haowei, et al.
Pubblicazione: (2026)
CoSTA: Code-Switched Speech Translation using Aligned Speech-Text Interleaving
di: Shankar, Bhavani, et al.
Pubblicazione: (2024)
di: Shankar, Bhavani, et al.
Pubblicazione: (2024)
On the Problem of Text-To-Speech Model Selection for Synthetic Data Generation in Automatic Speech Recognition
di: Rossenbach, Nick, et al.
Pubblicazione: (2024)
di: Rossenbach, Nick, et al.
Pubblicazione: (2024)
The ParlaSpeech Collection of Automatically Generated Speech and Text Datasets from Parliamentary Proceedings
di: Ljubešić, Nikola, et al.
Pubblicazione: (2024)
di: Ljubešić, Nikola, et al.
Pubblicazione: (2024)
A Joint Spectro-Temporal Relational Thinking Based Acoustic Modeling Framework
di: Nan, Zheng, et al.
Pubblicazione: (2024)
di: Nan, Zheng, et al.
Pubblicazione: (2024)
Modeling Overlapped Speech with Shuffles
di: Wiesner, Matthew, et al.
Pubblicazione: (2026)
di: Wiesner, Matthew, et al.
Pubblicazione: (2026)
Configurable Multilingual ASR with Speech Summary Representations
di: Zhu, Harrison, et al.
Pubblicazione: (2024)
di: Zhu, Harrison, et al.
Pubblicazione: (2024)
TTSDS -- Text-to-Speech Distribution Score
di: Minixhofer, Christoph, et al.
Pubblicazione: (2024)
di: Minixhofer, Christoph, et al.
Pubblicazione: (2024)
Documenti analoghi
-
On the reliability of feature attribution methods for speech classification
di: Shen, Gaofei, et al.
Pubblicazione: (2025) -
Beyond Decodability: Reconstructing Language Model Representations with an Encoding Probe
di: Shen, Gaofei, et al.
Pubblicazione: (2026) -
ProMode: A Speech Prosody Model Conditioned on Acoustic and Textual Inputs
di: Eren, Eray, et al.
Pubblicazione: (2025) -
Encoding of lexical tone in self-supervised models of spoken language
di: Shen, Gaofei, et al.
Pubblicazione: (2024) -
What do self-supervised speech models know about Dutch? Analyzing advantages of language-specific pre-training
di: Kloots, Marianne de Heer, et al.
Pubblicazione: (2025)