AST: Adaptive, Seamless, and Training-Free Precise Speech Editing
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lv, Sihan, Jin, Yechen, Li, Zhen, Chen, Jintao, Zhang, Jinshan, Li, Ying, Yin, Jianwei, Xi, Meng |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
RIPRAG: Hack a Black-box Retrieval-Augmented Generation Question-Answering System with Reinforcement Learning
par: Xi, Meng, et autres
Publié: (2025)
par: Xi, Meng, et autres
Publié: (2025)
Seamless Dysfluent Speech Text Alignment for Disordered Speech Analysis
par: Ye, Zongli, et autres
Publié: (2025)
par: Ye, Zongli, et autres
Publié: (2025)
Effective and Efficient Mixed Precision Quantization of Speech Foundation Models
par: Xu, Haoning, et autres
Publié: (2025)
par: Xu, Haoning, et autres
Publié: (2025)
Large Speech Model Enabled Semantic Communication
par: Tian, Yun, et autres
Publié: (2025)
par: Tian, Yun, et autres
Publié: (2025)
Unifying Speech Editing Detection and Content Localization via Prior-Enhanced Audio LLMs
par: Xue, Jun, et autres
Publié: (2026)
par: Xue, Jun, et autres
Publié: (2026)
ActorMind: Emulating Human Actor Reasoning for Speech Role-Playing
par: Chen, Xi, et autres
Publié: (2026)
par: Chen, Xi, et autres
Publié: (2026)
RFM-Editing: Rectified Flow Matching for Text-guided Audio Editing
par: Gao, Liting, et autres
Publié: (2025)
par: Gao, Liting, et autres
Publié: (2025)
SLM-SS: Speech Language Model for Generative Speech Separation
par: Li, Tianhua, et autres
Publié: (2026)
par: Li, Tianhua, et autres
Publié: (2026)
ROSE: A Recognition-Oriented Speech Enhancement Framework in Air Traffic Control Using Multi-Objective Learning
par: Yu, Xincheng, et autres
Publié: (2023)
par: Yu, Xincheng, et autres
Publié: (2023)
Quantize More, Lose Less: Autoregressive Generation from Residually Quantized Speech Representations
par: Han, Yichen, et autres
Publié: (2025)
par: Han, Yichen, et autres
Publié: (2025)
ArtiFree: Detecting and Reducing Generative Artifacts in Diffusion-based Speech Enhancement
par: Chhaglani, Bhawana, et autres
Publié: (2025)
par: Chhaglani, Bhawana, et autres
Publié: (2025)
Addressing Gradient Misalignment in Data-Augmented Training for Robust Speech Deepfake Detection
par: Truong, Duc-Tuan, et autres
Publié: (2025)
par: Truong, Duc-Tuan, et autres
Publié: (2025)
Dynamic Fusion Multimodal Network for SpeechWellness Detection
par: Sun, Wenqiang, et autres
Publié: (2025)
par: Sun, Wenqiang, et autres
Publié: (2025)
EmoSteer-TTS: Fine-Grained and Training-Free Emotion-Controllable Text-to-Speech via Activation Steering
par: Xie, Tianxin, et autres
Publié: (2025)
par: Xie, Tianxin, et autres
Publié: (2025)
UniSS: Unified Expressive Speech-to-Speech Translation with Your Voice
par: Cheng, Sitong, et autres
Publié: (2025)
par: Cheng, Sitong, et autres
Publié: (2025)
SeamlessExpressiveLM: Speech Language Model for Expressive Speech-to-Speech Translation with Chain-of-Thought
par: Gong, Hongyu, et autres
Publié: (2024)
par: Gong, Hongyu, et autres
Publié: (2024)
Audio ControlNet for Fine-Grained Audio Generation and Editing
par: Zhu, Haina, et autres
Publié: (2026)
par: Zhu, Haina, et autres
Publié: (2026)
SimulSeamless: FBK at IWSLT 2024 Simultaneous Speech Translation
par: Papi, Sara, et autres
Publié: (2024)
par: Papi, Sara, et autres
Publié: (2024)
Temporal Contrastive Decoding: A Training-Free Method for Large Audio-Language Models
par: Li, Yanda, et autres
Publié: (2026)
par: Li, Yanda, et autres
Publié: (2026)
ElasticAST: An Audio Spectrogram Transformer for All Length and Resolutions
par: Feng, Jiu, et autres
Publié: (2024)
par: Feng, Jiu, et autres
Publié: (2024)
VoiceShop: A Unified Speech-to-Speech Framework for Identity-Preserving Zero-Shot Voice Editing
par: Anastassiou, Philip, et autres
Publié: (2024)
par: Anastassiou, Philip, et autres
Publié: (2024)
Serialized Output Training by Learned Dominance
par: Shi, Ying, et autres
Publié: (2024)
par: Shi, Ying, et autres
Publié: (2024)
SlimSpeech: Lightweight and Efficient Text-to-Speech with Slim Rectified Flow
par: Wang, Kaidi, et autres
Publié: (2025)
par: Wang, Kaidi, et autres
Publié: (2025)
Towards Emotionally Consistent Text-Based Speech Editing: Introducing EmoCorrector and The ECD-TSE Dataset
par: Liu, Rui, et autres
Publié: (2025)
par: Liu, Rui, et autres
Publié: (2025)
LoopGen: Training-Free Loopable Music Generation
par: Marincione, Davide, et autres
Publié: (2025)
par: Marincione, Davide, et autres
Publié: (2025)
LSZone: A Lightweight Spatial Information Modeling Architecture for Real-time In-car Multi-zone Speech Separation
par: Chen, Jun, et autres
Publié: (2025)
par: Chen, Jun, et autres
Publié: (2025)
EchoX: Towards Mitigating Acoustic-Semantic Gap via Echo Training for Speech-to-Speech LLMs
par: Zhang, Yuhao, et autres
Publié: (2025)
par: Zhang, Yuhao, et autres
Publié: (2025)
DOA: Training-Free Decoder-Only Attention Policy for Long-Form Simultaneous Translation with SpeechLLMs
par: Papi, Sara, et autres
Publié: (2026)
par: Papi, Sara, et autres
Publié: (2026)
Voice Attribute Editing with Text Prompt
par: Sheng, Zhengyan, et autres
Publié: (2024)
par: Sheng, Zhengyan, et autres
Publié: (2024)
Fake Speech Wild: Detecting Deepfake Speech on Social Media Platform
par: Xie, Yuankun, et autres
Publié: (2025)
par: Xie, Yuankun, et autres
Publié: (2025)
Human or Machine? A Preliminary Turing Test for Speech-to-Speech Interaction
par: Li, Xiang, et autres
Publié: (2026)
par: Li, Xiang, et autres
Publié: (2026)
Prompt-guided Precise Audio Editing with Diffusion Models
par: Xu, Manjie, et autres
Publié: (2024)
par: Xu, Manjie, et autres
Publié: (2024)
DSpAST: Disentangled Representations for Spatial Audio Reasoning with Large Language Models
par: Wilkinghoff, Kevin, et autres
Publié: (2025)
par: Wilkinghoff, Kevin, et autres
Publié: (2025)
SpeechJudge: Towards Human-Level Judgment for Speech Naturalness
par: Zhang, Xueyao, et autres
Publié: (2025)
par: Zhang, Xueyao, et autres
Publié: (2025)
Modality-Specific Speech Enhancement and Noise-Adaptive Fusion for Acoustic and Body-Conduction Microphone Framework
par: Kim, Yunsik, et autres
Publié: (2025)
par: Kim, Yunsik, et autres
Publié: (2025)
RAS: a Reliability Oriented Metric for Automatic Speech Recognition
par: Huang, Wenbin, et autres
Publié: (2026)
par: Huang, Wenbin, et autres
Publié: (2026)
VividVoice: A Unified Framework for Scene-Aware Visually-Driven Speech Synthesis
par: Ma, Chengyuan, et autres
Publié: (2026)
par: Ma, Chengyuan, et autres
Publié: (2026)
DiffEditor: Enhancing Speech Editing with Semantic Enrichment and Acoustic Consistency
par: Chen, Yang, et autres
Publié: (2024)
par: Chen, Yang, et autres
Publié: (2024)
Multi-Loss Learning for Speech Emotion Recognition with Energy-Adaptive Mixup and Frame-Level Attention
par: Wang, Cong, et autres
Publié: (2025)
par: Wang, Cong, et autres
Publié: (2025)
Semi-Supervised Diseased Detection from Speech Dialogues with Multi-Level Data Modeling
par: Li, Xingyuan, et autres
Publié: (2026)
par: Li, Xingyuan, et autres
Publié: (2026)
Documents similaires
-
RIPRAG: Hack a Black-box Retrieval-Augmented Generation Question-Answering System with Reinforcement Learning
par: Xi, Meng, et autres
Publié: (2025) -
Seamless Dysfluent Speech Text Alignment for Disordered Speech Analysis
par: Ye, Zongli, et autres
Publié: (2025) -
Effective and Efficient Mixed Precision Quantization of Speech Foundation Models
par: Xu, Haoning, et autres
Publié: (2025) -
Large Speech Model Enabled Semantic Communication
par: Tian, Yun, et autres
Publié: (2025) -
Unifying Speech Editing Detection and Content Localization via Prior-Enhanced Audio LLMs
par: Xue, Jun, et autres
Publié: (2026)