PersonaPlex: Voice and Role Control for Full Duplex Conversational Speech Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Roy, Rajarshi, Raiman, Jonathan, Lee, Sang-gil, Ene, Teodor-Dumitru, Kirby, Robert, Kim, Sungwon, Kim, Jaehyeon, Catanzaro, Bryan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
CircuitVAE: Efficient and Scalable Latent Circuit Optimization
por: Song, Jialin, et al.
Publicado: (2024)
por: Song, Jialin, et al.
Publicado: (2024)
VoiceTailor: Lightweight Plug-In Adapter for Diffusion-Based Personalized Text-to-Speech
por: Kim, Heeseung, et al.
Publicado: (2024)
por: Kim, Heeseung, et al.
Publicado: (2024)
ETTA: Elucidating the Design Space of Text-to-Audio Models
por: Lee, Sang-gil, et al.
Publicado: (2024)
por: Lee, Sang-gil, et al.
Publicado: (2024)
Effective Large Language Model Debugging with Best-first Tree Search
por: Song, Jialin, et al.
Publicado: (2024)
por: Song, Jialin, et al.
Publicado: (2024)
NV-Embed: Improved Techniques for Training LLMs as Generalist Embedding Models
por: Lee, Chankyu, et al.
Publicado: (2024)
por: Lee, Chankyu, et al.
Publicado: (2024)
VideoFDB: Evaluating Full-Duplex Vision-Speech Capabilities in Conversational Agents
por: Mazumdar, Amrita, et al.
Publicado: (2026)
por: Mazumdar, Amrita, et al.
Publicado: (2026)
Enabling Conversational Behavior Reasoning Capabilities in Full-Duplex Speech
por: Pan, Shuchang, et al.
Publicado: (2025)
por: Pan, Shuchang, et al.
Publicado: (2025)
Audio Flamingo Next: Next-Generation Open Audio-Language Models for Speech, Sound, and Music
por: Ghosh, Sreyan, et al.
Publicado: (2026)
por: Ghosh, Sreyan, et al.
Publicado: (2026)
Scaling NVIDIA's Multi-speaker Multi-lingual TTS Systems with Zero-Shot TTS to Indic Languages
por: Arora, Akshit, et al.
Publicado: (2024)
por: Arora, Akshit, et al.
Publicado: (2024)
ChatQA: Surpassing GPT-4 on Conversational QA and RAG
por: Liu, Zihan, et al.
Publicado: (2024)
por: Liu, Zihan, et al.
Publicado: (2024)
Audio Flamingo 3: Advancing Audio Intelligence with Fully Open Large Audio Language Models
por: Goel, Arushi, et al.
Publicado: (2025)
por: Goel, Arushi, et al.
Publicado: (2025)
Open-Source Full-Duplex Conversational Datasets for Natural and Interactive Speech Synthesis
por: Zhou, Zhitong, et al.
Publicado: (2025)
por: Zhou, Zhitong, et al.
Publicado: (2025)
F-Actor: Controllable Conversational Behaviour in Full-Duplex Models
por: Züfle, Maike, et al.
Publicado: (2026)
por: Züfle, Maike, et al.
Publicado: (2026)
MTR-DuplexBench: Towards a Comprehensive Evaluation of Multi-Round Conversations for Full-Duplex Speech Language Models
por: Zhang, He, et al.
Publicado: (2025)
por: Zhang, He, et al.
Publicado: (2025)
Hydrostatic-Based Proofs in Geometry
por: Kim, Jaehyeon
Publicado: (2025)
por: Kim, Jaehyeon
Publicado: (2025)
UniWav: Towards Unified Pre-training for Speech Representation Learning and Generation
por: Liu, Alexander H., et al.
Publicado: (2025)
por: Liu, Alexander H., et al.
Publicado: (2025)
$τ$-Voice: Benchmarking Full-Duplex Voice Agents on Real-World Domains
por: Ray, Soham, et al.
Publicado: (2026)
por: Ray, Soham, et al.
Publicado: (2026)
Full-Duplex-Bench v1.5: Evaluating Overlap Handling for Full-Duplex Speech Models
por: Lin, Guan-Ting, et al.
Publicado: (2025)
por: Lin, Guan-Ting, et al.
Publicado: (2025)
Improving Text-To-Audio Models with Synthetic Captions
por: Kong, Zhifeng, et al.
Publicado: (2024)
por: Kong, Zhifeng, et al.
Publicado: (2024)
Full-Duplex-Bench-v3: Benchmarking Tool Use for Full-Duplex Voice Agents Under Real-World Disfluency
por: Lin, Guan-Ting, et al.
Publicado: (2026)
por: Lin, Guan-Ting, et al.
Publicado: (2026)
PersonaKit (PK): A Plug-and-Play Platform for User Testing Diverse Roles in Full-Duplex Dialogue
por: Jeon, Hyunbae, et al.
Publicado: (2026)
por: Jeon, Hyunbae, et al.
Publicado: (2026)
DuplexMamba: Enhancing Real-time Speech Conversations with Duplex and Streaming Capabilities
por: Lu, Xiangyu, et al.
Publicado: (2025)
por: Lu, Xiangyu, et al.
Publicado: (2025)
DuplexSLA: A Full-Duplex Spoken Language Model with Synchronized Speech, Language, and Action
por: Zhang, Haoyang, et al.
Publicado: (2026)
por: Zhang, Haoyang, et al.
Publicado: (2026)
Assessing Economic Viability: A Comparative Analysis of Total Cost of Ownership for Domain-Adapted Large Language Models versus State-of-the-art Counterparts in Chip Design Coding Assistance
por: Sharma, Amit, et al.
Publicado: (2024)
por: Sharma, Amit, et al.
Publicado: (2024)
Synchronization and Turn-Taking in Full-Duplex Speech Dialogue Models
por: Riera, Pablo, et al.
Publicado: (2026)
por: Riera, Pablo, et al.
Publicado: (2026)
SoulX-Duplug: Plug-and-Play Streaming State Prediction Module for Realtime Full-Duplex Speech Conversation
por: Yan, Ruiqi, et al.
Publicado: (2026)
por: Yan, Ruiqi, et al.
Publicado: (2026)
Audio Flamingo 2: An Audio-Language Model with Long-Audio Understanding and Expert Reasoning Abilities
por: Ghosh, Sreyan, et al.
Publicado: (2025)
por: Ghosh, Sreyan, et al.
Publicado: (2025)
DuplexCascade: Full-Duplex Speech-to-Speech Dialogue with VAD-Free Cascaded ASR-LLM-TTS Pipeline and Micro-Turn Optimization
por: Yang, Jianing, et al.
Publicado: (2026)
por: Yang, Jianing, et al.
Publicado: (2026)
Privacy-Preserving End-to-End Full-Duplex Speech Dialogue Models
por: Kuzmin, Nikita, et al.
Publicado: (2026)
por: Kuzmin, Nikita, et al.
Publicado: (2026)
CLaM-TTS: Improving Neural Codec Language Model for Zero-Shot Text-to-Speech
por: Kim, Jaehyeon, et al.
Publicado: (2024)
por: Kim, Jaehyeon, et al.
Publicado: (2024)
A Dual-Branch Parallel Network for Speech Enhancement and Restoration
por: Yang, Da-Hee, et al.
Publicado: (2024)
por: Yang, Da-Hee, et al.
Publicado: (2024)
DiTTo-TTS: Diffusion Transformers for Scalable Text-to-Speech without Domain-Specific Factors
por: Lee, Keon, et al.
Publicado: (2024)
por: Lee, Keon, et al.
Publicado: (2024)
A2SB: Audio-to-Audio Schrodinger Bridges
por: Kong, Zhifeng, et al.
Publicado: (2025)
por: Kong, Zhifeng, et al.
Publicado: (2025)
Challenging the Evaluator: LLM Sycophancy Under User Rebuttal
por: Kim, Sungwon, et al.
Publicado: (2025)
por: Kim, Sungwon, et al.
Publicado: (2025)
MoshiRAG: Asynchronous Knowledge Retrieval for Full-Duplex Speech Language Models
por: Chien, Chung-Ming, et al.
Publicado: (2026)
por: Chien, Chung-Ming, et al.
Publicado: (2026)
Phoenix-VAD: Streaming Semantic Endpoint Detection for Full-Duplex Speech Interaction
por: Wu, Weijie, et al.
Publicado: (2025)
por: Wu, Weijie, et al.
Publicado: (2025)
RT-VC: Real-Time Zero-Shot Voice Conversion with Speech Articulatory Coding
por: Liu, Yisi, et al.
Publicado: (2025)
por: Liu, Yisi, et al.
Publicado: (2025)
Semantics-Division Duplexing: A Novel Full-Duplex Paradigm
por: Niu, Kai, et al.
Publicado: (2023)
por: Niu, Kai, et al.
Publicado: (2023)
Bidirectional Integrated Sensing and Communication: Full-Duplex or Half-Duplex?
por: Wang, Zhaolin, et al.
Publicado: (2022)
por: Wang, Zhaolin, et al.
Publicado: (2022)
P2VA: Converting Persona Descriptions into Voice Attributes for Fair and Controllable Text-to-Speech
por: Lee, Yejin, et al.
Publicado: (2025)
por: Lee, Yejin, et al.
Publicado: (2025)
Ejemplares similares
-
CircuitVAE: Efficient and Scalable Latent Circuit Optimization
por: Song, Jialin, et al.
Publicado: (2024) -
VoiceTailor: Lightweight Plug-In Adapter for Diffusion-Based Personalized Text-to-Speech
por: Kim, Heeseung, et al.
Publicado: (2024) -
ETTA: Elucidating the Design Space of Text-to-Audio Models
por: Lee, Sang-gil, et al.
Publicado: (2024) -
Effective Large Language Model Debugging with Best-first Tree Search
por: Song, Jialin, et al.
Publicado: (2024) -
NV-Embed: Improved Techniques for Training LLMs as Generalist Embedding Models
por: Lee, Chankyu, et al.
Publicado: (2024)