Does Your Voice Assistant Remember? Analyzing Conversational Context Recall and Utilization in Voice Interaction Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Kim, Heeseung, Lee, Che Hyun, Park, Sangkwon, Yeom, Jiheum, Park, Nohil, Yu, Sangwon, Yoon, Sungroh |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
NanoVoice: Efficient Speaker-Adaptive Text-to-Speech for Multiple Speakers
por: Park, Nohil, et al.
Publicado: (2024)
por: Park, Nohil, et al.
Publicado: (2024)
VoiceGuider: Enhancing Out-of-Domain Performance in Parameter-Efficient Speaker-Adaptive Text-to-Speech via Autoguidance
por: Yeom, Jiheum, et al.
Publicado: (2024)
por: Yeom, Jiheum, et al.
Publicado: (2024)
VoiceTailor: Lightweight Plug-In Adapter for Diffusion-Based Personalized Text-to-Speech
por: Kim, Heeseung, et al.
Publicado: (2024)
por: Kim, Heeseung, et al.
Publicado: (2024)
SOVA-Bench: Benchmarking the Speech Conversation Ability for LLM-based Voice Assistant
por: Hou, Yixuan, et al.
Publicado: (2025)
por: Hou, Yixuan, et al.
Publicado: (2025)
StreamVoice: Streamable Context-Aware Language Modeling for Real-time Zero-Shot Voice Conversion
por: Wang, Zhichao, et al.
Publicado: (2024)
por: Wang, Zhichao, et al.
Publicado: (2024)
Voice Conversion with Diverse Intonation using Conditional Variational Auto-Encoder
por: Suh, Soobin, et al.
Publicado: (2025)
por: Suh, Soobin, et al.
Publicado: (2025)
VoicePrompter: Robust Zero-Shot Voice Conversion with Voice Prompt and Conditional Flow Matching
por: Choi, Ha-Yeong, et al.
Publicado: (2025)
por: Choi, Ha-Yeong, et al.
Publicado: (2025)
Spatial Voice Conversion: Voice Conversion Preserving Spatial Information and Non-target Signals
por: Seki, Kentaro, et al.
Publicado: (2024)
por: Seki, Kentaro, et al.
Publicado: (2024)
StreamVoice+: Evolving into End-to-end Streaming Zero-shot Voice Conversion
por: Wang, Zhichao, et al.
Publicado: (2024)
por: Wang, Zhichao, et al.
Publicado: (2024)
JoyVoice: Long-Context Conditioning for Anthropomorphic Multi-Speaker Conversational Synthesis
por: Yu, Fan, et al.
Publicado: (2025)
por: Yu, Fan, et al.
Publicado: (2025)
Neural Concatenative Singing Voice Conversion: Rethinking Concatenation-Based Approach for One-Shot Singing Voice Conversion
por: Sha, Binzhu, et al.
Publicado: (2023)
por: Sha, Binzhu, et al.
Publicado: (2023)
LatentVoiceGrad: Nonparallel Voice Conversion with Latent Diffusion/Flow-Matching Models
por: Kameoka, Hirokazu, et al.
Publicado: (2025)
por: Kameoka, Hirokazu, et al.
Publicado: (2025)
VoiceGrad: Non-Parallel Any-to-Many Voice Conversion with Annealed Langevin Dynamics
por: Kameoka, Hirokazu, et al.
Publicado: (2020)
por: Kameoka, Hirokazu, et al.
Publicado: (2020)
Voice-ENHANCE: Speech Restoration using a Diffusion-based Voice Conversion Framework
por: Byun, Kyungguen, et al.
Publicado: (2025)
por: Byun, Kyungguen, et al.
Publicado: (2025)
OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion
por: Wang, Zhichao, et al.
Publicado: (2026)
por: Wang, Zhichao, et al.
Publicado: (2026)
Converting Anyone's Voice: End-to-End Expressive Voice Conversion with a Conditional Diffusion Model
por: Du, Zongyang, et al.
Publicado: (2024)
por: Du, Zongyang, et al.
Publicado: (2024)
Enhancing Polyglot Voices by Leveraging Cross-Lingual Fine-Tuning in Any-to-One Voice Conversion
por: Ruggiero, Giuseppe, et al.
Publicado: (2024)
por: Ruggiero, Giuseppe, et al.
Publicado: (2024)
Generating Novel and Realistic Speakers for Voice Conversion
por: Chen, Meiying Melissa, et al.
Publicado: (2025)
por: Chen, Meiying Melissa, et al.
Publicado: (2025)
Residual Speaker Representation for One-Shot Voice Conversion
por: Xu, Le, et al.
Publicado: (2023)
por: Xu, Le, et al.
Publicado: (2023)
Voice Conversion-based Privacy through Adversarial Information Hiding
por: Webber, Jacob J, et al.
Publicado: (2024)
por: Webber, Jacob J, et al.
Publicado: (2024)
RAVE for Speech: Efficient Voice Conversion at High Sampling Rates
por: Bargum, Anders R., et al.
Publicado: (2024)
por: Bargum, Anders R., et al.
Publicado: (2024)
Disentangling the Prosody and Semantic Information with Pre-trained Model for In-Context Learning based Zero-Shot Voice Conversion
por: Chen, Zhengyang, et al.
Publicado: (2024)
por: Chen, Zhengyang, et al.
Publicado: (2024)
Advancing User-Voice Interaction: Exploring Emotion-Aware Voice Assistants Through a Role-Swapping Approach
por: Ma, Yong, et al.
Publicado: (2025)
por: Ma, Yong, et al.
Publicado: (2025)
VoiceBench: Benchmarking LLM-Based Voice Assistants
por: Chen, Yiming, et al.
Publicado: (2024)
por: Chen, Yiming, et al.
Publicado: (2024)
VC-ENHANCE: Speech Restoration with Integrated Noise Suppression and Voice Conversion
por: Byun, Kyungguen, et al.
Publicado: (2024)
por: Byun, Kyungguen, et al.
Publicado: (2024)
An Extensive Analysis of the Singing Voice Conversion Challenge 2025 Evaluation Results
por: Violeta, Lester Phillip, et al.
Publicado: (2025)
por: Violeta, Lester Phillip, et al.
Publicado: (2025)
End-to-End Zero-Shot Voice Conversion with Location-Variable Convolutions
por: Kang, Wonjune, et al.
Publicado: (2022)
por: Kang, Wonjune, et al.
Publicado: (2022)
SRC4VC: Smartphone-Recorded Corpus for Voice Conversion Benchmark
por: Saito, Yuki, et al.
Publicado: (2024)
por: Saito, Yuki, et al.
Publicado: (2024)
FreeSVC: Towards Zero-shot Multilingual Singing Voice Conversion
por: Ferreira, Alef Iury Siqueira, et al.
Publicado: (2025)
por: Ferreira, Alef Iury Siqueira, et al.
Publicado: (2025)
Evaluating Synthetic Command Attacks on Smart Voice Assistants
por: He, Zhengxian, et al.
Publicado: (2024)
por: He, Zhengxian, et al.
Publicado: (2024)
EchoVoices: Preserving Generational Voices and Memories for Seniors and Children
por: Xu, Haiying, et al.
Publicado: (2025)
por: Xu, Haiying, et al.
Publicado: (2025)
Auden-Voice: General-Purpose Voice Encoder for Speech and Language Understanding
por: Huo, Mingyue, et al.
Publicado: (2025)
por: Huo, Mingyue, et al.
Publicado: (2025)
Voice Conversion for Likability Control via Automated Rating of Speech Synthesis Corpora
por: Suda, Hitoshi, et al.
Publicado: (2025)
por: Suda, Hitoshi, et al.
Publicado: (2025)
Multi-level Temporal-channel Speaker Retrieval for Zero-shot Voice Conversion
por: Wang, Zhichao, et al.
Publicado: (2023)
por: Wang, Zhichao, et al.
Publicado: (2023)
PseudoVC: Improving One-shot Voice Conversion with Pseudo Paired Data
por: Cao, Songjun, et al.
Publicado: (2025)
por: Cao, Songjun, et al.
Publicado: (2025)
Enhancing Expressive Voice Conversion with Discrete Pitch-Conditioned Flow Matching Model
por: Zuo, Jialong, et al.
Publicado: (2025)
por: Zuo, Jialong, et al.
Publicado: (2025)
Leveraging Diverse Semantic-based Audio Pretrained Models for Singing Voice Conversion
por: Zhang, Xueyao, et al.
Publicado: (2023)
por: Zhang, Xueyao, et al.
Publicado: (2023)
Self-Supervised Singing Voice Pre-Training towards Speech-to-Singing Conversion
por: Li, Ruiqi, et al.
Publicado: (2024)
por: Li, Ruiqi, et al.
Publicado: (2024)
Discrete Optimal Transport and Voice Conversion
por: Selitskiy, Anton, et al.
Publicado: (2025)
por: Selitskiy, Anton, et al.
Publicado: (2025)
Human Voice is Unique
por: Singh, Rita, et al.
Publicado: (2025)
por: Singh, Rita, et al.
Publicado: (2025)
Ejemplares similares
-
NanoVoice: Efficient Speaker-Adaptive Text-to-Speech for Multiple Speakers
por: Park, Nohil, et al.
Publicado: (2024) -
VoiceGuider: Enhancing Out-of-Domain Performance in Parameter-Efficient Speaker-Adaptive Text-to-Speech via Autoguidance
por: Yeom, Jiheum, et al.
Publicado: (2024) -
VoiceTailor: Lightweight Plug-In Adapter for Diffusion-Based Personalized Text-to-Speech
por: Kim, Heeseung, et al.
Publicado: (2024) -
SOVA-Bench: Benchmarking the Speech Conversation Ability for LLM-based Voice Assistant
por: Hou, Yixuan, et al.
Publicado: (2025) -
StreamVoice: Streamable Context-Aware Language Modeling for Real-time Zero-Shot Voice Conversion
por: Wang, Zhichao, et al.
Publicado: (2024)