MD-ViSCo: A Unified Model for Multi-Directional Vital Sign Waveform Conversion
Fuente:
arXiv
Guardado en:
| Autores principales: | Meyer, Franck, Hur, Kyunghoon, Choi, Edward |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
RFWave: Multi-band Rectified Flow for Audio Waveform Reconstruction
por: Liu, Peng, et al.
Publicado: (2024)
por: Liu, Peng, et al.
Publicado: (2024)
Unifying Speech Recognition, Synthesis and Conversion with Autoregressive Transformers
por: Cai, Runyuan, et al.
Publicado: (2026)
por: Cai, Runyuan, et al.
Publicado: (2026)
Multichannel-to-Multichannel Target Sound Extraction Using Direction and Timestamp Clues
por: Choi, Dayun, et al.
Publicado: (2024)
por: Choi, Dayun, et al.
Publicado: (2024)
SoundCompass: Navigating Target Sound Extraction With Effective Directional Clue Integration In Complex Acoustic Scenes
por: Choi, Dayun, et al.
Publicado: (2025)
por: Choi, Dayun, et al.
Publicado: (2025)
ViSAGe: Video-to-Spatial Audio Generation
por: Kim, Jaeyeon, et al.
Publicado: (2025)
por: Kim, Jaeyeon, et al.
Publicado: (2025)
MulliVC: Multi-lingual Voice Conversion With Cycle Consistency
por: Huang, Jiawei, et al.
Publicado: (2024)
por: Huang, Jiawei, et al.
Publicado: (2024)
CoughViT: A Self-Supervised Vision Transformer for Cough Audio Representation Learning
por: Luong, Justin, et al.
Publicado: (2025)
por: Luong, Justin, et al.
Publicado: (2025)
Advancing NAM-to-Speech Conversion with Novel Methods and the MultiNAM Dataset
por: Shah, Neil, et al.
Publicado: (2024)
por: Shah, Neil, et al.
Publicado: (2024)
Multi-Speaker Conversational Audio Deepfake: Taxonomy, Dataset and Pilot Study
por: Ahmed, Alabi, et al.
Publicado: (2026)
por: Ahmed, Alabi, et al.
Publicado: (2026)
VibE-SVC: Vibrato Extraction with High-frequency F0 Contour for Singing Voice Conversion
por: Choi, Joon-Seung, et al.
Publicado: (2025)
por: Choi, Joon-Seung, et al.
Publicado: (2025)
ML-SAN: Multi-Level Speaker-Adaptive Network for Emotion Recognition in Conversations
por: Wang, Kexue, et al.
Publicado: (2026)
por: Wang, Kexue, et al.
Publicado: (2026)
A Framework for Synthetic Audio Conversations Generation using Large Language Models
por: Kyaw, Kaung Myat, et al.
Publicado: (2024)
por: Kyaw, Kaung Myat, et al.
Publicado: (2024)
PeriodWave: Multi-Period Flow Matching for High-Fidelity Waveform Generation
por: Lee, Sang-Hoon, et al.
Publicado: (2024)
por: Lee, Sang-Hoon, et al.
Publicado: (2024)
Real-Time Speech Enhancement via a Hybrid ViT: A Dual-Input Acoustic-Image Feature Fusion
por: Bahmei, Behnaz, et al.
Publicado: (2025)
por: Bahmei, Behnaz, et al.
Publicado: (2025)
MultiVerse: Efficient and Expressive Zero-Shot Multi-Task Text-to-Speech
por: Bak, Taejun, et al.
Publicado: (2024)
por: Bak, Taejun, et al.
Publicado: (2024)
EmoReg: Directional Latent Vector Modeling for Emotional Intensity Regularization in Diffusion-based Voice Conversion
por: Gudmalwar, Ashishkumar, et al.
Publicado: (2024)
por: Gudmalwar, Ashishkumar, et al.
Publicado: (2024)
LHQ-SVC: Lightweight and High Quality Singing Voice Conversion Modeling
por: Huang, Yubo, et al.
Publicado: (2024)
por: Huang, Yubo, et al.
Publicado: (2024)
DiffCSS: Diverse and Expressive Conversational Speech Synthesis with Diffusion Models
por: wu, Weihao, et al.
Publicado: (2025)
por: wu, Weihao, et al.
Publicado: (2025)
UltraEval-Audio: A Unified Framework for Comprehensive Evaluation of Audio Foundation Models
por: Shi, Qundong, et al.
Publicado: (2026)
por: Shi, Qundong, et al.
Publicado: (2026)
Accelerating Codec-based Speech Synthesis with Multi-Token Prediction and Speculative Decoding
por: Nguyen, Tan Dat, et al.
Publicado: (2024)
por: Nguyen, Tan Dat, et al.
Publicado: (2024)
Towards Unified Music Emotion Recognition across Dimensional and Categorical Models
por: Kang, Jaeyong, et al.
Publicado: (2025)
por: Kang, Jaeyong, et al.
Publicado: (2025)
VoicePrompter: Robust Zero-Shot Voice Conversion with Voice Prompt and Conditional Flow Matching
por: Choi, Ha-Yeong, et al.
Publicado: (2025)
por: Choi, Ha-Yeong, et al.
Publicado: (2025)
EmoAttack: Utilizing Emotional Voice Conversion for Speech Backdoor Attacks on Deep Speech Classification Models
por: Yao, Wenhan, et al.
Publicado: (2024)
por: Yao, Wenhan, et al.
Publicado: (2024)
Unispeaker: A Unified Approach for Multimodality-driven Speaker Generation
por: Sheng, Zhengyan, et al.
Publicado: (2025)
por: Sheng, Zhengyan, et al.
Publicado: (2025)
Parameter Selection for Analyzing Conversations with Autism Spectrum Disorder
por: Chowdhury, Tahiya, et al.
Publicado: (2024)
por: Chowdhury, Tahiya, et al.
Publicado: (2024)
Takin-VC: Expressive Zero-Shot Voice Conversion via Adaptive Hybrid Content Encoding and Enhanced Timbre Modeling
por: Yang, Yuguang, et al.
Publicado: (2024)
por: Yang, Yuguang, et al.
Publicado: (2024)
DPI-TTS: Directional Patch Interaction for Fast-Converging and Style Temporal Modeling in Text-to-Speech
por: Qi, Xin, et al.
Publicado: (2024)
por: Qi, Xin, et al.
Publicado: (2024)
DMOSpeech: Direct Metric Optimization via Distilled Diffusion Model in Zero-Shot Speech Synthesis
por: Li, Yingahao Aaron, et al.
Publicado: (2024)
por: Li, Yingahao Aaron, et al.
Publicado: (2024)
Disentangled Dual-Branch Graph Learning for Conversational Emotion Recognition
por: Guo, Chengling, et al.
Publicado: (2026)
por: Guo, Chengling, et al.
Publicado: (2026)
Assessment of Personality Dimensions Across Situations Using Conversational Speech
por: Zhang, Alice, et al.
Publicado: (2025)
por: Zhang, Alice, et al.
Publicado: (2025)
Convert and Speak: Zero-shot Accent Conversion with Minimum Supervision
por: Jia, Zhijun, et al.
Publicado: (2024)
por: Jia, Zhijun, et al.
Publicado: (2024)
AImoclips: A Benchmark for Evaluating Emotion Conveyance in Text-to-Music Generation
por: Go, Gyehun, et al.
Publicado: (2025)
por: Go, Gyehun, et al.
Publicado: (2025)
A Unified Speech LLM for Diarization and Speech Recognition in Multilingual Conversations
por: Saengthong, Phurich, et al.
Publicado: (2025)
por: Saengthong, Phurich, et al.
Publicado: (2025)
Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models
por: Lee, Kyowoon, et al.
Publicado: (2025)
por: Lee, Kyowoon, et al.
Publicado: (2025)
Unifying Streaming and Non-streaming Zipformer-based ASR
por: Sharma, Bidisha, et al.
Publicado: (2025)
por: Sharma, Bidisha, et al.
Publicado: (2025)
SPA-SVC: Self-supervised Pitch Augmentation for Singing Voice Conversion
por: Bai, Bingsong, et al.
Publicado: (2024)
por: Bai, Bingsong, et al.
Publicado: (2024)
EZ-VC: Easy Zero-shot Any-to-Any Voice Conversion
por: Joglekar, Advait, et al.
Publicado: (2025)
por: Joglekar, Advait, et al.
Publicado: (2025)
SelfVC: Voice Conversion With Iterative Refinement using Self Transformations
por: Neekhara, Paarth, et al.
Publicado: (2023)
por: Neekhara, Paarth, et al.
Publicado: (2023)
Non-autoregressive real-time Accent Conversion model with voice cloning
por: Nechaev, Vladimir, et al.
Publicado: (2024)
por: Nechaev, Vladimir, et al.
Publicado: (2024)
UAF: A Unified Audio Front-end LLM for Full-Duplex Speech Interaction
por: Li, Yadong, et al.
Publicado: (2026)
por: Li, Yadong, et al.
Publicado: (2026)
Ejemplares similares
-
RFWave: Multi-band Rectified Flow for Audio Waveform Reconstruction
por: Liu, Peng, et al.
Publicado: (2024) -
Unifying Speech Recognition, Synthesis and Conversion with Autoregressive Transformers
por: Cai, Runyuan, et al.
Publicado: (2026) -
Multichannel-to-Multichannel Target Sound Extraction Using Direction and Timestamp Clues
por: Choi, Dayun, et al.
Publicado: (2024) -
SoundCompass: Navigating Target Sound Extraction With Effective Directional Clue Integration In Complex Acoustic Scenes
por: Choi, Dayun, et al.
Publicado: (2025) -
ViSAGe: Video-to-Spatial Audio Generation
por: Kim, Jaeyeon, et al.
Publicado: (2025)