Provable Speech Attributes Conversion via Latent Independence
Fuente:
arXiv
Salvato in:
| Autori principali: | Svirsky, Jonathan, Lindenbaum, Ofir, Shaham, Uri |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Sparse Binarization for Fast Keyword Spotting
di: Svirsky, Jonathan, et al.
Pubblicazione: (2024)
di: Svirsky, Jonathan, et al.
Pubblicazione: (2024)
Interpretable Deep Clustering for Tabular Data
di: Svirsky, Jonathan, et al.
Pubblicazione: (2023)
di: Svirsky, Jonathan, et al.
Pubblicazione: (2023)
Subject-Independent Imagined Speech Detection via Cross-Subject Generalization and Calibration
di: Ko, Byung-Kwan, et al.
Pubblicazione: (2025)
di: Ko, Byung-Kwan, et al.
Pubblicazione: (2025)
MF-Speech: Achieving Fine-Grained and Compositional Control in Speech Generation via Factor Disentanglement
di: Yu, Xinyue, et al.
Pubblicazione: (2025)
di: Yu, Xinyue, et al.
Pubblicazione: (2025)
Discrete Speech Unit Extraction via Independent Component Analysis
di: Nakamura, Tomohiko, et al.
Pubblicazione: (2025)
di: Nakamura, Tomohiko, et al.
Pubblicazione: (2025)
Train Less, Infer Faster: Efficient Model Finetuning and Compression via Structured Sparsity
di: Svirsky, Jonathan, et al.
Pubblicazione: (2026)
di: Svirsky, Jonathan, et al.
Pubblicazione: (2026)
Speech Emotion Recognition via Entropy-Aware Score Selection
di: Chua, ChenYi, et al.
Pubblicazione: (2025)
di: Chua, ChenYi, et al.
Pubblicazione: (2025)
MSAC: Multiple Speech Attribute Control Method for Reliable Speech Emotion Recognition
di: Pan, Yu, et al.
Pubblicazione: (2023)
di: Pan, Yu, et al.
Pubblicazione: (2023)
DDSP-QbE++: Improving Speech Quality for Speech Anonymisation for Atypical Speech
di: Ghosh, Suhita, et al.
Pubblicazione: (2026)
di: Ghosh, Suhita, et al.
Pubblicazione: (2026)
Latent Space Disentanglement via Activation Steering for Interpretable Attribute Control in Symbolic Music Generation
di: Prokopiou, Ioannis, et al.
Pubblicazione: (2026)
di: Prokopiou, Ioannis, et al.
Pubblicazione: (2026)
Generalizable and Robust Spectral Method for Multi-view Representation Learning
di: Yacobi, Amitai, et al.
Pubblicazione: (2024)
di: Yacobi, Amitai, et al.
Pubblicazione: (2024)
Towards Robust Speech Deepfake Detection via Human-Inspired Reasoning
di: Dvirniak, Artem, et al.
Pubblicazione: (2026)
di: Dvirniak, Artem, et al.
Pubblicazione: (2026)
The First Voice Timbre Attribute Detection Challenge
di: Chen, Liping, et al.
Pubblicazione: (2025)
di: Chen, Liping, et al.
Pubblicazione: (2025)
Voice Privacy from an Attribute-based Perspective
di: Rahman, Mehtab Ur, et al.
Pubblicazione: (2026)
di: Rahman, Mehtab Ur, et al.
Pubblicazione: (2026)
Latent Fourier Transform
di: Wang, Mason, et al.
Pubblicazione: (2026)
di: Wang, Mason, et al.
Pubblicazione: (2026)
GSRM: Generative Speech Reward Model for Speech RLHF
di: Shen, Maohao, et al.
Pubblicazione: (2026)
di: Shen, Maohao, et al.
Pubblicazione: (2026)
Unifying Speech Recognition, Synthesis and Conversion with Autoregressive Transformers
di: Cai, Runyuan, et al.
Pubblicazione: (2026)
di: Cai, Runyuan, et al.
Pubblicazione: (2026)
Generalizable Speech Deepfake Detection via Information Bottleneck Enhanced Adversarial Alignment
di: Huang, Pu, et al.
Pubblicazione: (2025)
di: Huang, Pu, et al.
Pubblicazione: (2025)
Understanding Frechet Speech Distance for Synthetic Speech Quality Evaluation
di: Kim, June-Woo, et al.
Pubblicazione: (2026)
di: Kim, June-Woo, et al.
Pubblicazione: (2026)
SLM-SS: Speech Language Model for Generative Speech Separation
di: Li, Tianhua, et al.
Pubblicazione: (2026)
di: Li, Tianhua, et al.
Pubblicazione: (2026)
Unifying Speech Editing Detection and Content Localization via Prior-Enhanced Audio LLMs
di: Xue, Jun, et al.
Pubblicazione: (2026)
di: Xue, Jun, et al.
Pubblicazione: (2026)
Fake Speech Wild: Detecting Deepfake Speech on Social Media Platform
di: Xie, Yuankun, et al.
Pubblicazione: (2025)
di: Xie, Yuankun, et al.
Pubblicazione: (2025)
SpeechQualityLLM: LLM-Based Multimodal Assessment of Speech Quality
di: Monjur, Mahathir, et al.
Pubblicazione: (2025)
di: Monjur, Mahathir, et al.
Pubblicazione: (2025)
SlimSpeech: Lightweight and Efficient Text-to-Speech with Slim Rectified Flow
di: Wang, Kaidi, et al.
Pubblicazione: (2025)
di: Wang, Kaidi, et al.
Pubblicazione: (2025)
UniSS: Unified Expressive Speech-to-Speech Translation with Your Voice
di: Cheng, Sitong, et al.
Pubblicazione: (2025)
di: Cheng, Sitong, et al.
Pubblicazione: (2025)
Human or Machine? A Preliminary Turing Test for Speech-to-Speech Interaction
di: Li, Xiang, et al.
Pubblicazione: (2026)
di: Li, Xiang, et al.
Pubblicazione: (2026)
Assessment of Personality Dimensions Across Situations Using Conversational Speech
di: Zhang, Alice, et al.
Pubblicazione: (2025)
di: Zhang, Alice, et al.
Pubblicazione: (2025)
CodecFlow: Efficient Bandwidth Extension via Conditional Flow Matching in Neural Codec Latent Space
di: Zhang, Bowen, et al.
Pubblicazione: (2026)
di: Zhang, Bowen, et al.
Pubblicazione: (2026)
EmoAttack: Utilizing Emotional Voice Conversion for Speech Backdoor Attacks on Deep Speech Classification Models
di: Yao, Wenhan, et al.
Pubblicazione: (2024)
di: Yao, Wenhan, et al.
Pubblicazione: (2024)
Enabling Automatic Disordered Speech Recognition: An Impaired Speech Dataset in the Akan Language
di: Wiafe, Isaac, et al.
Pubblicazione: (2026)
di: Wiafe, Isaac, et al.
Pubblicazione: (2026)
Shortcut Flow Matching for Speech Enhancement: Step-Invariant flows via single stage training
di: Zhou, Naisong, et al.
Pubblicazione: (2025)
di: Zhou, Naisong, et al.
Pubblicazione: (2025)
SyncSpeech: Efficient and Low-Latency Text-to-Speech based on Temporal Masked Transformer
di: Sheng, Zhengyan, et al.
Pubblicazione: (2025)
di: Sheng, Zhengyan, et al.
Pubblicazione: (2025)
DiffCSS: Diverse and Expressive Conversational Speech Synthesis with Diffusion Models
di: wu, Weihao, et al.
Pubblicazione: (2025)
di: wu, Weihao, et al.
Pubblicazione: (2025)
Advancing NAM-to-Speech Conversion with Novel Methods and the MultiNAM Dataset
di: Shah, Neil, et al.
Pubblicazione: (2024)
di: Shah, Neil, et al.
Pubblicazione: (2024)
VoiceBridge: General Speech Restoration with One-step Latent Bridge Models
di: Zhang, Chi, et al.
Pubblicazione: (2025)
di: Zhang, Chi, et al.
Pubblicazione: (2025)
Long-Form End-to-End Speech Translation via Latent Alignment Segmentation
di: Polák, Peter, et al.
Pubblicazione: (2023)
di: Polák, Peter, et al.
Pubblicazione: (2023)
Latent-Mark: An Audio Watermark Robust to Neural Resynthesis
di: Chen, Yen-Shan, et al.
Pubblicazione: (2026)
di: Chen, Yen-Shan, et al.
Pubblicazione: (2026)
Speech Separation for Hearing-Impaired Children in the Classroom
di: Olalere, Feyisayo, et al.
Pubblicazione: (2025)
di: Olalere, Feyisayo, et al.
Pubblicazione: (2025)
Large Speech Model Enabled Semantic Communication
di: Tian, Yun, et al.
Pubblicazione: (2025)
di: Tian, Yun, et al.
Pubblicazione: (2025)
LatentSpeech: Latent Diffusion for Text-To-Speech Generation
di: Lou, Haowei, et al.
Pubblicazione: (2024)
di: Lou, Haowei, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Sparse Binarization for Fast Keyword Spotting
di: Svirsky, Jonathan, et al.
Pubblicazione: (2024) -
Interpretable Deep Clustering for Tabular Data
di: Svirsky, Jonathan, et al.
Pubblicazione: (2023) -
Subject-Independent Imagined Speech Detection via Cross-Subject Generalization and Calibration
di: Ko, Byung-Kwan, et al.
Pubblicazione: (2025) -
MF-Speech: Achieving Fine-Grained and Compositional Control in Speech Generation via Factor Disentanglement
di: Yu, Xinyue, et al.
Pubblicazione: (2025) -
Discrete Speech Unit Extraction via Independent Component Analysis
di: Nakamura, Tomohiko, et al.
Pubblicazione: (2025)