Multimodal Segmentation for Vocal Tract Modeling
Fuente:
arXiv
Guardado en:
| Autores principales: | Jain, Rishi, Yu, Bohan, Wu, Peter, Prabhune, Tejas, Anumanchipalli, Gopala |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Coding Speech through Vocal Tract Kinematics
por: Cho, Cheol Jun, et al.
Publicado: (2024)
por: Cho, Cheol Jun, et al.
Publicado: (2024)
Self-Supervised Audio-Visual Soundscape Stylization
por: Li, Tingle, et al.
Publicado: (2024)
por: Li, Tingle, et al.
Publicado: (2024)
Open-Source Manually Annotated Vocal Tract Database for Automatic Segmentation from 3D MRI Using Deep Learning: Benchmarking 2D and 3D Convolutional and Transformer Networks
por: Erattakulangara, Subin, et al.
Publicado: (2025)
por: Erattakulangara, Subin, et al.
Publicado: (2025)
Sounding that Object: Interactive Object-Aware Image to Audio Generation
por: Li, Tingle, et al.
Publicado: (2025)
por: Li, Tingle, et al.
Publicado: (2025)
Unsupervised TTS Acoustic Modeling for TTS with Conditional Disentangled Sequential VAE
por: Lian, Jiachen, et al.
Publicado: (2022)
por: Lian, Jiachen, et al.
Publicado: (2022)
MUSE: A Run-Centric Platform for Multimodal Unified Safety Evaluation of Large Language Models
por: Wang, Zhongxi, et al.
Publicado: (2026)
por: Wang, Zhongxi, et al.
Publicado: (2026)
Modeling and Estimation of Vocal Tract and Glottal Source Parameters Using ARMAX-LF Model
por: Lia, Kai, et al.
Publicado: (2024)
por: Lia, Kai, et al.
Publicado: (2024)
Speech2rtMRI: Speech-Guided Diffusion Model for Real-time MRI Video of the Vocal Tract during Speech
por: Nguyen, Hong, et al.
Publicado: (2024)
por: Nguyen, Hong, et al.
Publicado: (2024)
Spectrogram-Based Detection of Auto-Tuned Vocals in Music Recordings
por: Gohari, Mahyar, et al.
Publicado: (2024)
por: Gohari, Mahyar, et al.
Publicado: (2024)
Robot Confirmation Generation and Action Planning Using Long-context Q-Former Integrated with Multimodal LLM
por: Hori, Chiori, et al.
Publicado: (2025)
por: Hori, Chiori, et al.
Publicado: (2025)
RapVerse: Coherent Vocals and Whole-Body Motions Generations from Text
por: Chen, Jiaben, et al.
Publicado: (2024)
por: Chen, Jiaben, et al.
Publicado: (2024)
Robust Audiovisual Speech Recognition Models with Mixture-of-Experts
por: Wu, Yihan, et al.
Publicado: (2024)
por: Wu, Yihan, et al.
Publicado: (2024)
Segment Beyond View: Handling Partially Missing Modality for Audio-Visual Semantic Segmentation
por: Wu, Renjie, et al.
Publicado: (2023)
por: Wu, Renjie, et al.
Publicado: (2023)
RankUp: Boosting Semi-Supervised Regression with an Auxiliary Ranking Classifier
por: Huang, Pin-Yen, et al.
Publicado: (2024)
por: Huang, Pin-Yen, et al.
Publicado: (2024)
Bootstrapping Audio-Visual Segmentation by Strengthening Audio Cues
por: Chen, Tianxiang, et al.
Publicado: (2024)
por: Chen, Tianxiang, et al.
Publicado: (2024)
Measuring Sound Symbolism in Audio-visual Models
por: Tseng, Wei-Cheng, et al.
Publicado: (2024)
por: Tseng, Wei-Cheng, et al.
Publicado: (2024)
AVMeme Exam: A Multimodal Multilingual Multicultural Benchmark for LLMs' Contextual and Cultural Knowledge and Thinking
por: Jiang, Xilin, et al.
Publicado: (2026)
por: Jiang, Xilin, et al.
Publicado: (2026)
Noise-Robust AV-ASR Using Visual Features Both in the Whisper Encoder and Decoder
por: Li, Zhengyang, et al.
Publicado: (2026)
por: Li, Zhengyang, et al.
Publicado: (2026)
Ming-Omni: A Unified Multimodal Model for Perception and Generation
por: AI, Inclusion, et al.
Publicado: (2025)
por: AI, Inclusion, et al.
Publicado: (2025)
Towards Multimodal Prediction of Spontaneous Humour: A Novel Dataset and First Results
por: Christ, Lukas, et al.
Publicado: (2022)
por: Christ, Lukas, et al.
Publicado: (2022)
Temporal Working Memory: Query-Guided Segment Refinement for Enhanced Multimodal Understanding
por: Diao, Xingjian, et al.
Publicado: (2025)
por: Diao, Xingjian, et al.
Publicado: (2025)
Modality-Inconsistent Continual Learning of Multimodal Large Language Models
por: Pian, Weiguo, et al.
Publicado: (2024)
por: Pian, Weiguo, et al.
Publicado: (2024)
Sylber: Syllabic Embedding Representation of Speech from Raw Audio
por: Cho, Cheol Jun, et al.
Publicado: (2024)
por: Cho, Cheol Jun, et al.
Publicado: (2024)
A Comprehensive Survey of Hallucination in Large Language, Image, Video and Audio Foundation Models
por: Sahoo, Pranab, et al.
Publicado: (2024)
por: Sahoo, Pranab, et al.
Publicado: (2024)
Dynamic Derivation and Elimination: Audio Visual Segmentation with Enhanced Audio Semantics
por: Liu, Chen, et al.
Publicado: (2025)
por: Liu, Chen, et al.
Publicado: (2025)
Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models
por: Lee, Seung-jae, et al.
Publicado: (2025)
por: Lee, Seung-jae, et al.
Publicado: (2025)
Omni-AVSR: Towards Unified Multimodal Speech Recognition with Large Language Models
por: Cappellazzo, Umberto, et al.
Publicado: (2025)
por: Cappellazzo, Umberto, et al.
Publicado: (2025)
JEP-KD: Joint-Embedding Predictive Architecture Based Knowledge Distillation for Visual Speech Recognition
por: Sun, Chang, et al.
Publicado: (2024)
por: Sun, Chang, et al.
Publicado: (2024)
Unboxing Engagement in YouTube Influencer Videos: An Attention-Based Approach
por: Rajaram, Prashant, et al.
Publicado: (2020)
por: Rajaram, Prashant, et al.
Publicado: (2020)
2D or not 2D: How Does the Dimensionality of Gesture Representation Affect 3D Co-Speech Gesture Generation?
por: Guichoux, Téo, et al.
Publicado: (2024)
por: Guichoux, Téo, et al.
Publicado: (2024)
Transcription and translation of videos using fine-tuned XLSR Wav2Vec2 on custom dataset and mBART
por: Tathe, Aniket, et al.
Publicado: (2024)
por: Tathe, Aniket, et al.
Publicado: (2024)
BanglaRobustNet: A Hybrid Denoising-Attention Architecture for Robust Bangla Speech Recognition
por: Ridoy, Md Sazzadul Islam, et al.
Publicado: (2026)
por: Ridoy, Md Sazzadul Islam, et al.
Publicado: (2026)
Bridging Ears and Eyes: Analyzing Audio and Visual Large Language Models to Humans in Visible Sound Recognition and Reducing Their Sensory Gap via Cross-Modal Distillation
por: Jiang, Xilin, et al.
Publicado: (2025)
por: Jiang, Xilin, et al.
Publicado: (2025)
ThinkSound: Chain-of-Thought Reasoning in Multimodal Large Language Models for Audio Generation and Editing
por: Liu, Huadai, et al.
Publicado: (2025)
por: Liu, Huadai, et al.
Publicado: (2025)
Better Spanish Emotion Recognition In-the-wild: Bringing Attention to Deep Spectrum Voice Analysis
por: Ortega-Beltrán, Elena, et al.
Publicado: (2024)
por: Ortega-Beltrán, Elena, et al.
Publicado: (2024)
ANIM-400K: A Large-Scale Dataset for Automated End-To-End Dubbing of Video
por: Cai, Kevin, et al.
Publicado: (2024)
por: Cai, Kevin, et al.
Publicado: (2024)
Qwen2.5-Omni Technical Report
por: Xu, Jin, et al.
Publicado: (2025)
por: Xu, Jin, et al.
Publicado: (2025)
Unsupervised Out-of-Distribution Dialect Detection with Mahalanobis Distance
por: Das, Sourya Dipta, et al.
Publicado: (2023)
por: Das, Sourya Dipta, et al.
Publicado: (2023)
Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model
por: Zhang, Shaolei, et al.
Publicado: (2025)
por: Zhang, Shaolei, et al.
Publicado: (2025)
Multimodal Fusion Method with Spatiotemporal Sequences and Relationship Learning for Valence-Arousal Estimation
por: Yu, Jun, et al.
Publicado: (2024)
por: Yu, Jun, et al.
Publicado: (2024)
Ejemplares similares
-
Coding Speech through Vocal Tract Kinematics
por: Cho, Cheol Jun, et al.
Publicado: (2024) -
Self-Supervised Audio-Visual Soundscape Stylization
por: Li, Tingle, et al.
Publicado: (2024) -
Open-Source Manually Annotated Vocal Tract Database for Automatic Segmentation from 3D MRI Using Deep Learning: Benchmarking 2D and 3D Convolutional and Transformer Networks
por: Erattakulangara, Subin, et al.
Publicado: (2025) -
Sounding that Object: Interactive Object-Aware Image to Audio Generation
por: Li, Tingle, et al.
Publicado: (2025) -
Unsupervised TTS Acoustic Modeling for TTS with Conditional Disentangled Sequential VAE
por: Lian, Jiachen, et al.
Publicado: (2022)