MAVFlow: Preserving Paralinguistic Elements with Conditional Flow Matching for Zero-Shot AV2AV Multilingual Translation
Fuente:
arXiv
Guardado en:
| Autores principales: | Cho, Sungwoo, Choi, Jeongsoo, Kim, Sungnyun, Yun, Se-Young |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
AV2AV: Direct Audio-Visual Speech to Audio-Visual Speech Translation with Unified Audio-Visual Speech Representation
por: Choi, Jeongsoo, et al.
Publicado: (2023)
por: Choi, Jeongsoo, et al.
Publicado: (2023)
Multi-Task Corrupted Prediction for Learning Robust Audio-Visual Speech Representation
por: Kim, Sungnyun, et al.
Publicado: (2025)
por: Kim, Sungnyun, et al.
Publicado: (2025)
Attentive AV-FusionNet: Audio-Visual Quality Prediction with Hybrid Attention
por: Salaj, Ina, et al.
Publicado: (2025)
por: Salaj, Ina, et al.
Publicado: (2025)
LRS-VoxMM: A benchmark for in-the-wild audio-visual speech recognition
por: Kwak, Doyeop, et al.
Publicado: (2026)
por: Kwak, Doyeop, et al.
Publicado: (2026)
MusFlow: Multimodal Music Generation via Conditional Flow Matching
por: Song, Jiahao, et al.
Publicado: (2025)
por: Song, Jiahao, et al.
Publicado: (2025)
AV-Surf: Surface-Enhanced Geometry-Aware Novel-View Acoustic Synthesis
por: Baek, Hadam, et al.
Publicado: (2025)
por: Baek, Hadam, et al.
Publicado: (2025)
$C^2$AV-TSE: Context and Confidence-aware Audio Visual Target Speaker Extraction
por: Wu, Wenxuan, et al.
Publicado: (2025)
por: Wu, Wenxuan, et al.
Publicado: (2025)
Zero-Shot Fake Video Detection by Audio-Visual Consistency
por: Li, Xiaolou, et al.
Publicado: (2024)
por: Li, Xiaolou, et al.
Publicado: (2024)
MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition
por: Kim, Sungnyun, et al.
Publicado: (2025)
por: Kim, Sungnyun, et al.
Publicado: (2025)
Resurfacing Paralinguistic Awareness in Large Audio Language Models
por: Yang, Hao, et al.
Publicado: (2026)
por: Yang, Hao, et al.
Publicado: (2026)
Preserving Speaker Information in Direct Speech-to-Speech Translation with Non-Autoregressive Generation and Pretraining
por: Zhou, Rui, et al.
Publicado: (2024)
por: Zhou, Rui, et al.
Publicado: (2024)
UniAV: Unified Audio-Visual Perception for Multi-Task Video Event Localization
por: Geng, Tiantian, et al.
Publicado: (2024)
por: Geng, Tiantian, et al.
Publicado: (2024)
AV-SUPERB: A Multi-Task Evaluation Benchmark for Audio-Visual Representation Models
por: Tseng, Yuan, et al.
Publicado: (2023)
por: Tseng, Yuan, et al.
Publicado: (2023)
AV-DTEC: Self-Supervised Audio-Visual Fusion for Drone Trajectory Estimation and Classification
por: Xiao, Zhenyuan, et al.
Publicado: (2024)
por: Xiao, Zhenyuan, et al.
Publicado: (2024)
Jamendo-QA: A Large-Scale Music Question Answering Dataset
por: Koh, Junyoung, et al.
Publicado: (2025)
por: Koh, Junyoung, et al.
Publicado: (2025)
Two Heads Are Better Than One: Audio-Visual Speech Error Correction with Dual Hypotheses
por: Kim, Sungnyun, et al.
Publicado: (2025)
por: Kim, Sungnyun, et al.
Publicado: (2025)
MMVA: Multimodal Matching Based on Valence and Arousal across Images, Music, and Musical Captions
por: Choi, Suhwan, et al.
Publicado: (2025)
por: Choi, Suhwan, et al.
Publicado: (2025)
SteerMusic: Enhanced Musical Consistency for Zero-shot Text-guided and Personalized Music Editing
por: Niu, Xinlei, et al.
Publicado: (2025)
por: Niu, Xinlei, et al.
Publicado: (2025)
Intelligent Text-Conditioned Music Generation
por: Xie, Zhouyao, et al.
Publicado: (2024)
por: Xie, Zhouyao, et al.
Publicado: (2024)
MusicMagus: Zero-Shot Text-to-Music Editing via Diffusion Models
por: Zhang, Yixiao, et al.
Publicado: (2024)
por: Zhang, Yixiao, et al.
Publicado: (2024)
AV-Lip-Sync+: Leveraging AV-HuBERT to Exploit Multimodal Inconsistency for Deepfake Detection of Frontal Face Videos
por: Shahzad, Sahibzada Adil, et al.
Publicado: (2023)
por: Shahzad, Sahibzada Adil, et al.
Publicado: (2023)
AKVSR: Audio Knowledge Empowered Visual Speech Recognition by Compressing Audio Knowledge of a Pretrained Model
por: Yeo, Jeong Hun, et al.
Publicado: (2023)
por: Yeo, Jeong Hun, et al.
Publicado: (2023)
Noise-Conditioned Mixture-of-Experts Framework for Robust Speaker Verification
por: Gu, Bin, et al.
Publicado: (2025)
por: Gu, Bin, et al.
Publicado: (2025)
ScripTONES: Sentiment-Conditioned Music Generation for Movie Scripts
por: Veerendranath, Vishruth, et al.
Publicado: (2024)
por: Veerendranath, Vishruth, et al.
Publicado: (2024)
Leveraging LLM Embeddings for Cross Dataset Label Alignment and Zero Shot Music Emotion Prediction
por: Liu, Renhang, et al.
Publicado: (2024)
por: Liu, Renhang, et al.
Publicado: (2024)
Talker-T2AV: Joint Talking Audio-Video Generation with Autoregressive Diffusion Modeling
por: Ye, Zhen, et al.
Publicado: (2026)
por: Ye, Zhen, et al.
Publicado: (2026)
Zero-Shot End-to-End Spoken Language Understanding via Cross-Modal Selective Self-Training
por: He, Jianfeng, et al.
Publicado: (2023)
por: He, Jianfeng, et al.
Publicado: (2023)
SyncFlow: Toward Temporally Aligned Joint Audio-Video Generation from Text
por: Liu, Haohe, et al.
Publicado: (2024)
por: Liu, Haohe, et al.
Publicado: (2024)
Zero-AVSR: Zero-Shot Audio-Visual Speech Recognition with LLMs by Learning Language-Agnostic Speech Representations
por: Yeo, Jeong Hun, et al.
Publicado: (2025)
por: Yeo, Jeong Hun, et al.
Publicado: (2025)
MusRec: Zero-Shot Text-to-Music Editing via Rectified Flow and Diffusion Transformers
por: Boudaghi, Ali, et al.
Publicado: (2025)
por: Boudaghi, Ali, et al.
Publicado: (2025)
CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation
por: Oh, Hyunwoo, et al.
Publicado: (2025)
por: Oh, Hyunwoo, et al.
Publicado: (2025)
Textless Unit-to-Unit training for Many-to-Many Multilingual Speech-to-Speech Translation
por: Kim, Minsu, et al.
Publicado: (2023)
por: Kim, Minsu, et al.
Publicado: (2023)
SongBloom: Coherent Song Generation via Interleaved Autoregressive Sketching and Diffusion Refinement
por: Yang, Chenyu, et al.
Publicado: (2025)
por: Yang, Chenyu, et al.
Publicado: (2025)
Target Speech Diarization with Multimodal Prompts
por: Jiang, Yidi, et al.
Publicado: (2024)
por: Jiang, Yidi, et al.
Publicado: (2024)
Iola Walker: A Mobile Footfall Detection System for Music Composition
por: James, William B.
Publicado: (2025)
por: James, William B.
Publicado: (2025)
LLaQo: Towards a Query-Based Coach in Expressive Music Performance Assessment
por: Zhang, Huan, et al.
Publicado: (2024)
por: Zhang, Huan, et al.
Publicado: (2024)
M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset
por: Wu, Shilong
Publicado: (2025)
por: Wu, Shilong
Publicado: (2025)
MOS-FAD: Improving Fake Audio Detection Via Automatic Mean Opinion Score Prediction
por: Zhou, Wangjin, et al.
Publicado: (2024)
por: Zhou, Wangjin, et al.
Publicado: (2024)
RenderBox: Expressive Performance Rendering with Text Control
por: Zhang, Huan, et al.
Publicado: (2025)
por: Zhang, Huan, et al.
Publicado: (2025)
Dialogue Understandability: Why are we streaming movies with subtitles?
por: Martinez, Helard Becerra, et al.
Publicado: (2024)
por: Martinez, Helard Becerra, et al.
Publicado: (2024)
Ejemplares similares
-
AV2AV: Direct Audio-Visual Speech to Audio-Visual Speech Translation with Unified Audio-Visual Speech Representation
por: Choi, Jeongsoo, et al.
Publicado: (2023) -
Multi-Task Corrupted Prediction for Learning Robust Audio-Visual Speech Representation
por: Kim, Sungnyun, et al.
Publicado: (2025) -
Attentive AV-FusionNet: Audio-Visual Quality Prediction with Hybrid Attention
por: Salaj, Ina, et al.
Publicado: (2025) -
LRS-VoxMM: A benchmark for in-the-wild audio-visual speech recognition
por: Kwak, Doyeop, et al.
Publicado: (2026) -
MusFlow: Multimodal Music Generation via Conditional Flow Matching
por: Song, Jiahao, et al.
Publicado: (2025)