Multimodal Machine Learning Can Predict Videoconference Fluidity and Enjoyment
Fuente:
arXiv
Salvato in:
| Autori principali: | Chang, Andrew, Akkaraju, Viswadruth, Cogliano, Ray McFadden, Poeppel, David, Freeman, Dustin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Multimodal Fusion with Semi-Supervised Learning Minimizes Annotation Quantity for Modeling Videoconference Conversation Experience
di: Chang, Andrew, et al.
Pubblicazione: (2025)
di: Chang, Andrew, et al.
Pubblicazione: (2025)
Lessons Learned from Developing a Privacy-Preserving Multimodal Wearable for Local Voice-and-Vision Inference
di: Tussa, Yonatan, et al.
Pubblicazione: (2025)
di: Tussa, Yonatan, et al.
Pubblicazione: (2025)
PersonaCite: VoC-Grounded Interviewable Agentic Synthetic AI Personas for Verifiable User and Design Research
di: Truss, Mario
Pubblicazione: (2026)
di: Truss, Mario
Pubblicazione: (2026)
Leveraging Unlabeled Audio-Visual Data in Speech Emotion Recognition using Knowledge Distillation
di: Pendyala, Varsha, et al.
Pubblicazione: (2025)
di: Pendyala, Varsha, et al.
Pubblicazione: (2025)
CardioLive: Empowering Video Streaming with Online Cardiac Monitoring
di: Lyu, Sheng, et al.
Pubblicazione: (2025)
di: Lyu, Sheng, et al.
Pubblicazione: (2025)
Audio-Visual Approach For Multimodal Concurrent Speaker Detection
di: Eliav, Amit, et al.
Pubblicazione: (2024)
di: Eliav, Amit, et al.
Pubblicazione: (2024)
Towards Language-Independent Face-Voice Association with Multimodal Foundation Models
di: Farhadipour, Aref, et al.
Pubblicazione: (2025)
di: Farhadipour, Aref, et al.
Pubblicazione: (2025)
Multimodal sensor fusion for real-time location-dependent defect detection in laser-directed energy deposition
di: Chen, Lequn, et al.
Pubblicazione: (2023)
di: Chen, Lequn, et al.
Pubblicazione: (2023)
Attentive AV-FusionNet: Audio-Visual Quality Prediction with Hybrid Attention
di: Salaj, Ina, et al.
Pubblicazione: (2025)
di: Salaj, Ina, et al.
Pubblicazione: (2025)
DLIOS: An LLM-Augmented Real-Time Multi-Modal Interactive Enhancement Overlay System for Douyin Live Streaming
di: Wen, Shuide, et al.
Pubblicazione: (2026)
di: Wen, Shuide, et al.
Pubblicazione: (2026)
Enhancing Real-World Active Speaker Detection with Multi-Modal Extraction Pre-Training
di: Tao, Ruijie, et al.
Pubblicazione: (2024)
di: Tao, Ruijie, et al.
Pubblicazione: (2024)
BUT System Description for CHiME-9 MCoRec Challenge
di: Klement, Dominik, et al.
Pubblicazione: (2026)
di: Klement, Dominik, et al.
Pubblicazione: (2026)
Listening for "You": Enhancing Speech Image Retrieval via Target Speaker Extraction
di: Yang, Wenhao, et al.
Pubblicazione: (2025)
di: Yang, Wenhao, et al.
Pubblicazione: (2025)
Bounds on Agreement between Subjective and Objective Measurements
di: Pieper, Jaden, et al.
Pubblicazione: (2026)
di: Pieper, Jaden, et al.
Pubblicazione: (2026)
A Smart-Glasses for Emergency Medical Services via Multimodal Multitask Learning
di: Jin, Liuyi, et al.
Pubblicazione: (2025)
di: Jin, Liuyi, et al.
Pubblicazione: (2025)
CoAVT: A Cognition-Inspired Unified Audio-Visual-Text Pre-Training Model for Multimodal Processing
di: Yue, Xianghu, et al.
Pubblicazione: (2024)
di: Yue, Xianghu, et al.
Pubblicazione: (2024)
Beyond Correlation: Evaluating Multimedia Quality Models with the Constrained Concordance Index
di: Ragano, Alessandro, et al.
Pubblicazione: (2024)
di: Ragano, Alessandro, et al.
Pubblicazione: (2024)
KunquDB: An Attempt for Speaker Verification in the Chinese Opera Scenario
di: Zhou, Huali, et al.
Pubblicazione: (2024)
di: Zhou, Huali, et al.
Pubblicazione: (2024)
Interpretable Modeling of Articulatory Temporal Dynamics from real-time MRI for Phoneme Recognition
di: Park, Jay, et al.
Pubblicazione: (2025)
di: Park, Jay, et al.
Pubblicazione: (2025)
Improvement Of Audiovisual Quality Estimation Using A Nonlinear Autoregressive Exogenous Neural Network And Bitstream Parameters
di: Kossi, Koffi, et al.
Pubblicazione: (2024)
di: Kossi, Koffi, et al.
Pubblicazione: (2024)
The role of audio-visual integration in the time course of phonetic encoding in self-supervised speech models
di: Wang, Yi, et al.
Pubblicazione: (2025)
di: Wang, Yi, et al.
Pubblicazione: (2025)
Efficient Face Detection with Audio-Based Region Proposals for Human-Robot Interactions
di: Aris, William, et al.
Pubblicazione: (2023)
di: Aris, William, et al.
Pubblicazione: (2023)
Multimodal Biomarkers for Schizophrenia: Towards Individual Symptom Severity Estimation
di: Premananth, Gowtham, et al.
Pubblicazione: (2025)
di: Premananth, Gowtham, et al.
Pubblicazione: (2025)
Cluster-to-Predict Affect Contours from Speech
di: Kuşçu, Gökhan, et al.
Pubblicazione: (2024)
di: Kuşçu, Gökhan, et al.
Pubblicazione: (2024)
Multimodal Marvels of Deep Learning in Medical Diagnosis: A Comprehensive Review of COVID-19 Detection
di: Islam, Md Shofiqul, et al.
Pubblicazione: (2025)
di: Islam, Md Shofiqul, et al.
Pubblicazione: (2025)
Spoken question answering for visual queries
di: Shabtay, Nimrod, et al.
Pubblicazione: (2025)
di: Shabtay, Nimrod, et al.
Pubblicazione: (2025)
RestoreGrad: Signal Restoration Using Conditional Denoising Diffusion Models with Jointly Learned Prior
di: Lee, Ching-Hua, et al.
Pubblicazione: (2025)
di: Lee, Ching-Hua, et al.
Pubblicazione: (2025)
Efficient Test-Time Adaptation through Latent Subspace Coefficients Search
di: Luo, Xinyu, et al.
Pubblicazione: (2025)
di: Luo, Xinyu, et al.
Pubblicazione: (2025)
Bootstrapping Audiovisual Speech Recognition in Zero-AV-Resource Scenarios with Synthetic Visual Data
di: Buitrago, Pol, et al.
Pubblicazione: (2026)
di: Buitrago, Pol, et al.
Pubblicazione: (2026)
TACO: Training-free Sound Prompted Segmentation via Semantically Constrained Audio-visual CO-factorization
di: Malard, Hugo, et al.
Pubblicazione: (2024)
di: Malard, Hugo, et al.
Pubblicazione: (2024)
UNQA: Unified No-Reference Quality Assessment for Audio, Image, Video, and Audio-Visual Content
di: Cao, Yuqin, et al.
Pubblicazione: (2024)
di: Cao, Yuqin, et al.
Pubblicazione: (2024)
Audio-Visual Speaker Diarization: Current Databases, Approaches and Challenges
di: Mingote, Victoria, et al.
Pubblicazione: (2024)
di: Mingote, Victoria, et al.
Pubblicazione: (2024)
Coupling the Heart to Musical Machines
di: Easthope, Eric
Pubblicazione: (2025)
di: Easthope, Eric
Pubblicazione: (2025)
Cervical Auscultation Machine Learning for Dysphagia Assessment
di: Chia, An An, et al.
Pubblicazione: (2024)
di: Chia, An An, et al.
Pubblicazione: (2024)
BioSonix: Can Physics-Based Sonification Perceptualize Tissue Deformations From Tool Interactions?
di: Ruozzi, Veronica, et al.
Pubblicazione: (2025)
di: Ruozzi, Veronica, et al.
Pubblicazione: (2025)
Improving Multimodal Emotion Recognition by Leveraging Acoustic Adaptation and Visual Alignment
di: Zhao, Zhixian, et al.
Pubblicazione: (2024)
di: Zhao, Zhixian, et al.
Pubblicazione: (2024)
NeckCare: Preventing Tech Neck using Hearable-based Multimodal Sensing
di: Chhaglani, Bhawana, et al.
Pubblicazione: (2024)
di: Chhaglani, Bhawana, et al.
Pubblicazione: (2024)
How Private is Low-Frequency Speech Audio in the Wild? An Analysis of Verbal Intelligibility by Humans and Machines
di: Liu, Ailin, et al.
Pubblicazione: (2024)
di: Liu, Ailin, et al.
Pubblicazione: (2024)
Poster: Recognizing Hidden-in-the-Ear Private Key for Reliable Silent Speech Interface Using Multi-Task Learning
di: Dong, Xuefu, et al.
Pubblicazione: (2025)
di: Dong, Xuefu, et al.
Pubblicazione: (2025)
Silent Speech Sentence Recognition with Six-Axis Accelerometers using Conformer and CTC Algorithm
di: Xie, Yudong, et al.
Pubblicazione: (2025)
di: Xie, Yudong, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Multimodal Fusion with Semi-Supervised Learning Minimizes Annotation Quantity for Modeling Videoconference Conversation Experience
di: Chang, Andrew, et al.
Pubblicazione: (2025) -
Lessons Learned from Developing a Privacy-Preserving Multimodal Wearable for Local Voice-and-Vision Inference
di: Tussa, Yonatan, et al.
Pubblicazione: (2025) -
PersonaCite: VoC-Grounded Interviewable Agentic Synthetic AI Personas for Verifiable User and Design Research
di: Truss, Mario
Pubblicazione: (2026) -
Leveraging Unlabeled Audio-Visual Data in Speech Emotion Recognition using Knowledge Distillation
di: Pendyala, Varsha, et al.
Pubblicazione: (2025) -
CardioLive: Empowering Video Streaming with Online Cardiac Monitoring
di: Lyu, Sheng, et al.
Pubblicazione: (2025)