Speech Editing -- a Summary
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Kässmann, Tobias, Liu, Yining, Liu, Danni |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Configurable Multilingual ASR with Speech Summary Representations
par: Zhu, Harrison, et autres
Publié: (2024)
par: Zhu, Harrison, et autres
Publié: (2024)
VoiceCraft-X: Unifying Multilingual, Voice-Cloning Speech Synthesis and Speech Editing
par: Zheng, Zhisheng, et autres
Publié: (2025)
par: Zheng, Zhisheng, et autres
Publié: (2025)
FluentEditor2: Text-based Speech Editing by Modeling Multi-Scale Acoustic and Prosody Consistency
par: Liu, Rui, et autres
Publié: (2024)
par: Liu, Rui, et autres
Publié: (2024)
Sequential Editing for Lifelong Training of Speech Recognition Models
par: Kulshreshtha, Devang, et autres
Publié: (2024)
par: Kulshreshtha, Devang, et autres
Publié: (2024)
SummaryMixing: A Linear-Complexity Alternative to Self-Attention for Speech Recognition and Understanding
par: Parcollet, Titouan, et autres
Publié: (2023)
par: Parcollet, Titouan, et autres
Publié: (2023)
FASA: a Flexible and Automatic Speech Aligner for Extracting High-quality Aligned Children Speech Data
par: Liu, Dancheng, et autres
Publié: (2024)
par: Liu, Dancheng, et autres
Publié: (2024)
Fine-grained Speech Sentiment Analysis in Chinese Psychological Support Hotlines Based on Large-scale Pre-trained Model
par: Chen, Zhonglong, et autres
Publié: (2024)
par: Chen, Zhonglong, et autres
Publié: (2024)
StreamUni: Achieving Streaming Speech Translation with a Unified Large Speech-Language Model
par: Guo, Shoutao, et autres
Publié: (2025)
par: Guo, Shoutao, et autres
Publié: (2025)
Next Tokens Denoising for Speech Synthesis
par: Liu, Yanqing, et autres
Publié: (2025)
par: Liu, Yanqing, et autres
Publié: (2025)
Adaptive Inner Speech-Text Alignment for LLM-based Speech Translation
par: Liu, Henglyu, et autres
Publié: (2025)
par: Liu, Henglyu, et autres
Publié: (2025)
Large Language Models for Dysfluency Detection in Stuttered Speech
par: Wagner, Dominik, et autres
Publié: (2024)
par: Wagner, Dominik, et autres
Publié: (2024)
Intra- and Inter-modal Context Interaction Modeling for Conversational Speech Synthesis
par: Jia, Zhenqi, et autres
Publié: (2024)
par: Jia, Zhenqi, et autres
Publié: (2024)
OWSM-Biasing: Contextualizing Open Whisper-Style Speech Models for Automatic Speech Recognition with Dynamic Vocabulary
par: Sudo, Yui, et autres
Publié: (2025)
par: Sudo, Yui, et autres
Publié: (2025)
S2S-Arena: Evaluating Paralinguistic Instruction Following in Speech-to-Speech Models
par: Jiang, Feng, et autres
Publié: (2025)
par: Jiang, Feng, et autres
Publié: (2025)
Pairwise Evaluation of Accent Similarity in Speech Synthesis
par: Zhong, Jinzuomu, et autres
Publié: (2025)
par: Zhong, Jinzuomu, et autres
Publié: (2025)
Generative Expressive Conversational Speech Synthesis
par: Liu, Rui, et autres
Publié: (2024)
par: Liu, Rui, et autres
Publié: (2024)
Revisiting Self-supervised Learning of Speech Representation from a Mutual Information Perspective
par: Liu, Alexander H., et autres
Publié: (2024)
par: Liu, Alexander H., et autres
Publié: (2024)
PolySpeech: Exploring Unified Multitask Speech Models for Competitiveness with Single-task Models
par: Yang, Runyan, et autres
Publié: (2024)
par: Yang, Runyan, et autres
Publié: (2024)
MTP-S2UT: Enhancing Speech-to-Speech Translation Quality with Multi-token Prediction
par: Wang, Jianjin, et autres
Publié: (2025)
par: Wang, Jianjin, et autres
Publié: (2025)
S2SBench: A Benchmark for Quantifying Intelligence Degradation in Speech-to-Speech Large Language Models
par: Fang, Yuanbo, et autres
Publié: (2025)
par: Fang, Yuanbo, et autres
Publié: (2025)
Autoregressive Speech Synthesis without Vector Quantization
par: Meng, Lingwei, et autres
Publié: (2024)
par: Meng, Lingwei, et autres
Publié: (2024)
SEAL: Speech Embedding Alignment Learning for Speech Large Language Model with Retrieval-Augmented Generation
par: Sun, Chunyu, et autres
Publié: (2025)
par: Sun, Chunyu, et autres
Publié: (2025)
U-GIFT: Uncertainty-Guided Firewall for Toxic Speech in Few-Shot Scenario
par: Song, Jiaxin, et autres
Publié: (2025)
par: Song, Jiaxin, et autres
Publié: (2025)
USAD: Universal Speech and Audio Representation via Distillation
par: Chang, Heng-Jui, et autres
Publié: (2025)
par: Chang, Heng-Jui, et autres
Publié: (2025)
Post-decoder Biasing for End-to-End Speech Recognition of Multi-turn Medical Interview
par: Liu, Heyang, et autres
Publié: (2024)
par: Liu, Heyang, et autres
Publié: (2024)
SimpleSpeech 2: Towards Simple and Efficient Text-to-Speech with Flow-based Scalar Latent Transformer Diffusion Models
par: Yang, Dongchao, et autres
Publié: (2024)
par: Yang, Dongchao, et autres
Publié: (2024)
Leveraging Large Language Models for Spontaneous Speech-Based Suicide Risk Detection
par: Gao, Yifan, et autres
Publié: (2025)
par: Gao, Yifan, et autres
Publié: (2025)
Transcript-Prompted Whisper with Dictionary-Enhanced Decoding for Japanese Speech Annotation
par: Hu, Rui, et autres
Publié: (2025)
par: Hu, Rui, et autres
Publié: (2025)
DQ-Whisper: Joint Distillation and Quantization for Efficient Multilingual Speech Recognition
par: Shao, Hang, et autres
Publié: (2023)
par: Shao, Hang, et autres
Publié: (2023)
SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models
par: Zhang, Xin, et autres
Publié: (2023)
par: Zhang, Xin, et autres
Publié: (2023)
Scheduled Interleaved Speech-Text Training for Speech-to-Speech Translation with LLMs
par: Futami, Hayato, et autres
Publié: (2025)
par: Futami, Hayato, et autres
Publié: (2025)
Empowering Whisper as a Joint Multi-Talker and Target-Talker Speech Recognition System
par: Meng, Lingwei, et autres
Publié: (2024)
par: Meng, Lingwei, et autres
Publié: (2024)
Continuous Speech Tokenizer in Text To Speech
par: Li, Yixing, et autres
Publié: (2024)
par: Li, Yixing, et autres
Publié: (2024)
Scaling Speech-Text Pre-training with Synthetic Interleaved Data
par: Zeng, Aohan, et autres
Publié: (2024)
par: Zeng, Aohan, et autres
Publié: (2024)
Closing the Modality Reasoning Gap for Speech Large Language Models
par: Wang, Chaoren, et autres
Publié: (2026)
par: Wang, Chaoren, et autres
Publié: (2026)
Boosting Large Language Model for Speech Synthesis: An Empirical Study
par: Hao, Hongkun, et autres
Publié: (2023)
par: Hao, Hongkun, et autres
Publié: (2023)
Self-Powered LLM Modality Expansion for Large Speech-Text Models
par: Yu, Tengfei, et autres
Publié: (2024)
par: Yu, Tengfei, et autres
Publié: (2024)
StoryTTS: A Highly Expressive Text-to-Speech Dataset with Rich Textual Expressiveness Annotations
par: Liu, Sen, et autres
Publié: (2024)
par: Liu, Sen, et autres
Publié: (2024)
Swedish Whispers; Leveraging a Massive Speech Corpus for Swedish Speech Recognition
par: Vesterbacka, Leonora, et autres
Publié: (2025)
par: Vesterbacka, Leonora, et autres
Publié: (2025)
Modeling Sarcastic Speech: Semantic and Prosodic Cues in a Speech Synthesis Framework
par: Li, Zhu, et autres
Publié: (2025)
par: Li, Zhu, et autres
Publié: (2025)
Documents similaires
-
Configurable Multilingual ASR with Speech Summary Representations
par: Zhu, Harrison, et autres
Publié: (2024) -
VoiceCraft-X: Unifying Multilingual, Voice-Cloning Speech Synthesis and Speech Editing
par: Zheng, Zhisheng, et autres
Publié: (2025) -
FluentEditor2: Text-based Speech Editing by Modeling Multi-Scale Acoustic and Prosody Consistency
par: Liu, Rui, et autres
Publié: (2024) -
Sequential Editing for Lifelong Training of Speech Recognition Models
par: Kulshreshtha, Devang, et autres
Publié: (2024) -
SummaryMixing: A Linear-Complexity Alternative to Self-Attention for Speech Recognition and Understanding
par: Parcollet, Titouan, et autres
Publié: (2023)