LTS-VoiceAgent: A Listen-Think-Speak Framework for Efficient Streaming Voice Interaction via Semantic Triggering and Incremental Reasoning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zou, Wenhao, Miao, Yuwei, Ma, Zhanyu, Xu, Jun, Gao, Jiuchong, Hao, Jinghua, He, Renqing, Xu, Jingwen |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
EchoVoices: Preserving Generational Voices and Memories for Seniors and Children
par: Xu, Haiying, et autres
Publié: (2025)
par: Xu, Haiying, et autres
Publié: (2025)
StreamVoice+: Evolving into End-to-end Streaming Zero-shot Voice Conversion
par: Wang, Zhichao, et autres
Publié: (2024)
par: Wang, Zhichao, et autres
Publié: (2024)
StreamVoice: Streamable Context-Aware Language Modeling for Real-time Zero-Shot Voice Conversion
par: Wang, Zhichao, et autres
Publié: (2024)
par: Wang, Zhichao, et autres
Publié: (2024)
Multichannel Voice Trigger Detection Based on Transform-average-concatenate
par: Higuchi, Takuya, et autres
Publié: (2023)
par: Higuchi, Takuya, et autres
Publié: (2023)
X-Voice: Enabling Everyone to Speak 30 Languages via Zero-Shot Cross-Lingual Voice Cloning
par: Xu, Rixi, et autres
Publié: (2026)
par: Xu, Rixi, et autres
Publié: (2026)
Leveraging Diverse Semantic-based Audio Pretrained Models for Singing Voice Conversion
par: Zhang, Xueyao, et autres
Publié: (2023)
par: Zhang, Xueyao, et autres
Publié: (2023)
Listen, Think, and Understand
par: Gong, Yuan, et autres
Publié: (2023)
par: Gong, Yuan, et autres
Publié: (2023)
Does Your Voice Assistant Remember? Analyzing Conversational Context Recall and Utilization in Voice Interaction Models
par: Kim, Heeseung, et autres
Publié: (2025)
par: Kim, Heeseung, et autres
Publié: (2025)
DualVC 2: Dynamic Masked Convolution for Unified Streaming and Non-Streaming Voice Conversion
par: Ning, Ziqian, et autres
Publié: (2023)
par: Ning, Ziqian, et autres
Publié: (2023)
Neural Concatenative Singing Voice Conversion: Rethinking Concatenation-Based Approach for One-Shot Singing Voice Conversion
par: Sha, Binzhu, et autres
Publié: (2023)
par: Sha, Binzhu, et autres
Publié: (2023)
MeanVC: Lightweight and Streaming Zero-Shot Voice Conversion via Mean Flows
par: Ma, Guobin, et autres
Publié: (2025)
par: Ma, Guobin, et autres
Publié: (2025)
Auden-Voice: General-Purpose Voice Encoder for Speech and Language Understanding
par: Huo, Mingyue, et autres
Publié: (2025)
par: Huo, Mingyue, et autres
Publié: (2025)
Human Voice is Unique
par: Singh, Rita, et autres
Publié: (2025)
par: Singh, Rita, et autres
Publié: (2025)
Phoenix-VAD: Streaming Semantic Endpoint Detection for Full-Duplex Speech Interaction
par: Wu, Weijie, et autres
Publié: (2025)
par: Wu, Weijie, et autres
Publié: (2025)
Residual Speaker Representation for One-Shot Voice Conversion
par: Xu, Le, et autres
Publié: (2023)
par: Xu, Le, et autres
Publié: (2023)
SynthVC: Leveraging Synthetic Data for End-to-End Low Latency Streaming Voice Conversion
par: Guo, Zhao, et autres
Publié: (2025)
par: Guo, Zhao, et autres
Publié: (2025)
Zero-Shot Sing Voice Conversion: built upon clustering-based phoneme representations
par: Zhou, Wangjin, et autres
Publié: (2024)
par: Zhou, Wangjin, et autres
Publié: (2024)
A Novel Semantic Compression Approach for Ultra-low Bandwidth Voice Communication
par: Collette, Ryan, et autres
Publié: (2025)
par: Collette, Ryan, et autres
Publié: (2025)
Spatial Voice Conversion: Voice Conversion Preserving Spatial Information and Non-target Signals
par: Seki, Kentaro, et autres
Publié: (2024)
par: Seki, Kentaro, et autres
Publié: (2024)
LatentVoiceGrad: Nonparallel Voice Conversion with Latent Diffusion/Flow-Matching Models
par: Kameoka, Hirokazu, et autres
Publié: (2025)
par: Kameoka, Hirokazu, et autres
Publié: (2025)
VoiceGrad: Non-Parallel Any-to-Many Voice Conversion with Annealed Langevin Dynamics
par: Kameoka, Hirokazu, et autres
Publié: (2020)
par: Kameoka, Hirokazu, et autres
Publié: (2020)
Voice-ENHANCE: Speech Restoration using a Diffusion-based Voice Conversion Framework
par: Byun, Kyungguen, et autres
Publié: (2025)
par: Byun, Kyungguen, et autres
Publié: (2025)
SingIt! Singer Voice Transformation
par: Eliav, Amit, et autres
Publié: (2024)
par: Eliav, Amit, et autres
Publié: (2024)
Controlling your Attributes in Voice
par: Li, Xuyuan, et autres
Publié: (2025)
par: Li, Xuyuan, et autres
Publié: (2025)
Objective Measurements of Voice Quality
par: Dhamyal, Hira, et autres
Publié: (2024)
par: Dhamyal, Hira, et autres
Publié: (2024)
OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion
par: Wang, Zhichao, et autres
Publié: (2026)
par: Wang, Zhichao, et autres
Publié: (2026)
Converting Anyone's Voice: End-to-End Expressive Voice Conversion with a Conditional Diffusion Model
par: Du, Zongyang, et autres
Publié: (2024)
par: Du, Zongyang, et autres
Publié: (2024)
TidyVoice: A Curated Multilingual Dataset for Speaker Verification Derived from Common Voice
par: Farhadipour, Aref, et autres
Publié: (2026)
par: Farhadipour, Aref, et autres
Publié: (2026)
Enhancing Polyglot Voices by Leveraging Cross-Lingual Fine-Tuning in Any-to-One Voice Conversion
par: Ruggiero, Giuseppe, et autres
Publié: (2024)
par: Ruggiero, Giuseppe, et autres
Publié: (2024)
Quantifying and Reducing Speaker Heterogeneity within the Common Voice Corpus for Phonetic Analysis
par: Zhang, Miao, et autres
Publié: (2025)
par: Zhang, Miao, et autres
Publié: (2025)
InstructSing: High-Fidelity Singing Voice Generation via Instructing Yourself
par: Zeng, Chang, et autres
Publié: (2024)
par: Zeng, Chang, et autres
Publié: (2024)
ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization
par: Ren, Pengyu, et autres
Publié: (2025)
par: Ren, Pengyu, et autres
Publié: (2025)
Voice Conversion for Lombard Speaking Style with Implicit and Explicit Acoustic Feature Conditioning
par: Woszczyk, Dominika, et autres
Publié: (2025)
par: Woszczyk, Dominika, et autres
Publié: (2025)
Voice Quality Dimensions as Interpretable Primitives for Speaking Style for Atypical Speech and Affect
par: Narain, Jaya, et autres
Publié: (2025)
par: Narain, Jaya, et autres
Publié: (2025)
UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models
par: Guan, Wenhao, et autres
Publié: (2025)
par: Guan, Wenhao, et autres
Publié: (2025)
StreamVC: Real-Time Low-Latency Voice Conversion
par: Yang, Yang, et autres
Publié: (2024)
par: Yang, Yang, et autres
Publié: (2024)
Revolutionizing Personalized Voice Synthesis: The Journey towards Emotional and Individual Authenticity with DIVSE (Dynamic Individual Voice Synthesis Engine)
par: Shi, Fan
Publié: (2023)
par: Shi, Fan
Publié: (2023)
DJCM: A Deep Joint Cascade Model for Singing Voice Separation and Vocal Pitch Estimation
par: Wei, Haojie, et autres
Publié: (2024)
par: Wei, Haojie, et autres
Publié: (2024)
The Third VoicePrivacy Challenge: Preserving Emotional Expressiveness and Linguistic Content in Voice Anonymization
par: Tomashenko, Natalia, et autres
Publié: (2026)
par: Tomashenko, Natalia, et autres
Publié: (2026)
TidyVoice 2026 Challenge Evaluation Plan
par: Farhadipour, Aref, et autres
Publié: (2026)
par: Farhadipour, Aref, et autres
Publié: (2026)
Documents similaires
-
EchoVoices: Preserving Generational Voices and Memories for Seniors and Children
par: Xu, Haiying, et autres
Publié: (2025) -
StreamVoice+: Evolving into End-to-end Streaming Zero-shot Voice Conversion
par: Wang, Zhichao, et autres
Publié: (2024) -
StreamVoice: Streamable Context-Aware Language Modeling for Real-time Zero-Shot Voice Conversion
par: Wang, Zhichao, et autres
Publié: (2024) -
Multichannel Voice Trigger Detection Based on Transform-average-concatenate
par: Higuchi, Takuya, et autres
Publié: (2023) -
X-Voice: Enabling Everyone to Speak 30 Languages via Zero-Shot Cross-Lingual Voice Cloning
par: Xu, Rixi, et autres
Publié: (2026)