Del Visual al Auditivo: Sonorización de Escenas Guiada por Imagen
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Sánchez, María, Fernández, Laura, Arias, Julián, Cámara, Mateo, Comini, Giulia, Gabrys, Adam, Blanco, José Luis, Godino, Juan Ignacio, Hernández, Luis Alfonso |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Vivo : une approche multimodale de la synthese concatenative par corpus dans le cadre d'une oeuvre audiovisuelle immersive
par: Fayet, Mateo
Publié: (2024)
par: Fayet, Mateo
Publié: (2024)
Lightweight End-to-end Text-to-speech Synthesis for low resource on-device applications
par: Vecino, Biel Tura, et autres
Publié: (2025)
par: Vecino, Biel Tura, et autres
Publié: (2025)
Application of Whisper in Clinical Practice: the Post-Stroke Speech Assessment during a Naming Task
par: Davudova, Milena, et autres
Publié: (2025)
par: Davudova, Milena, et autres
Publié: (2025)
Uncovering the Visual Contribution in Audio-Visual Speech Recognition
par: Lin, Zhaofeng, et autres
Publié: (2024)
par: Lin, Zhaofeng, et autres
Publié: (2024)
Angular Distance Distribution Loss for Audio Classification
par: Almudévar, Antonio, et autres
Publié: (2024)
par: Almudévar, Antonio, et autres
Publié: (2024)
Online Audio-Visual Autoregressive Speaker Extraction
par: Pan, Zexu, et autres
Publié: (2025)
par: Pan, Zexu, et autres
Publié: (2025)
Vision Transformer Segmentation for Visual Bird Sound Denoising
par: Kumar, Sahil, et autres
Publié: (2024)
par: Kumar, Sahil, et autres
Publié: (2024)
Weighted Cross-entropy for Low-Resource Languages in Multilingual Speech Recognition
par: Piñeiro-Martín, Andrés, et autres
Publié: (2024)
par: Piñeiro-Martín, Andrés, et autres
Publié: (2024)
Decoding Vocal Articulations from Acoustic Latent Representations
par: Cámara, Mateo, et autres
Publié: (2024)
par: Cámara, Mateo, et autres
Publié: (2024)
ViT-TTS: Visual Text-to-Speech with Scalable Diffusion Transformer
par: Liu, Huadai, et autres
Publié: (2023)
par: Liu, Huadai, et autres
Publié: (2023)
AVR: Synergizing Foundation Models for Audio-Visual Humor Detection
par: Sharma, Sarthak, et autres
Publié: (2024)
par: Sharma, Sarthak, et autres
Publié: (2024)
A Fast and Lightweight Model for Causal Audio-Visual Speech Separation
par: Sang, Wendi, et autres
Publié: (2025)
par: Sang, Wendi, et autres
Publié: (2025)
Audio-Visual Target Speaker Extraction with Reverse Selective Auditory Attention
par: Tao, Ruijie, et autres
Publié: (2024)
par: Tao, Ruijie, et autres
Publié: (2024)
Autonomous Soundscape Augmentation with Multimodal Fusion of Visual and Participant-linked Inputs
par: Ooi, Kenneth, et autres
Publié: (2023)
par: Ooi, Kenneth, et autres
Publié: (2023)
BickGraphing: Web-Based Application for Visual Inspection of Audio Recordings
par: Seow, Kayley, et autres
Publié: (2026)
par: Seow, Kayley, et autres
Publié: (2026)
Leveraging Mamba with Full-Face Vision for Audio-Visual Speech Enhancement
par: Chao, Rong, et autres
Publié: (2025)
par: Chao, Rong, et autres
Publié: (2025)
Sound-Based Spin Estimation in Table Tennis: Dataset and Real-Time Classification Pipeline
par: Gossard, Thomas, et autres
Publié: (2024)
par: Gossard, Thomas, et autres
Publié: (2024)
Generating Diverse Audio-Visual 360 Soundscapes for Sound Event Localization and Detection
par: Roman, Adrian S., et autres
Publié: (2025)
par: Roman, Adrian S., et autres
Publié: (2025)
FlowAVSE: Efficient Audio-Visual Speech Enhancement with Conditional Flow Matching
par: Jung, Chaeyoung, et autres
Publié: (2024)
par: Jung, Chaeyoung, et autres
Publié: (2024)
Multimodal Assessment of Speech Impairment in ALS Using Audio-Visual and Machine Learning Approaches
par: Pierotti, Francesco, et autres
Publié: (2025)
par: Pierotti, Francesco, et autres
Publié: (2025)
Audio-Visual Speech Enhancement in Noisy Environments via Emotion-Based Contextual Cues
par: Hussain, Tassadaq, et autres
Publié: (2024)
par: Hussain, Tassadaq, et autres
Publié: (2024)
Robust Audio-Visual Target Speaker Extraction with Emotion-Aware Multiple Enrollment Fusion
par: Jin, Zhan, et autres
Publié: (2025)
par: Jin, Zhan, et autres
Publié: (2025)
Audio-Visual Representation Learning via Knowledge Distillation from Speech Foundation Models
par: Zhang, Jing-Xuan, et autres
Publié: (2025)
par: Zhang, Jing-Xuan, et autres
Publié: (2025)
Seeing the Context: Rich Visual Context-Aware Speech Recognition via Multimodal Reasoning
par: Tian, Wenjie, et autres
Publié: (2026)
par: Tian, Wenjie, et autres
Publié: (2026)
BWSNet: Automatic Perceptual Assessment of Audio Signals
par: Veillon, Clément Le Moine, et autres
Publié: (2023)
par: Veillon, Clément Le Moine, et autres
Publié: (2023)
Robust Audio-Visual Speech Enhancement: Correcting Misassignments in Complex Environments with Advanced Post-Processing
par: Ren, Wenze, et autres
Publié: (2024)
par: Ren, Wenze, et autres
Publié: (2024)
DCIM-AVSR : Efficient Audio-Visual Speech Recognition via Dual Conformer Interaction Module
par: Wang, Xinyu, et autres
Publié: (2024)
par: Wang, Xinyu, et autres
Publié: (2024)
VidMusician: Video-to-Music Generation with Semantic-Rhythmic Alignment via Hierarchical Visual Features
par: Li, Sifei, et autres
Publié: (2024)
par: Li, Sifei, et autres
Publié: (2024)
Accurate analysis of the pitch pulse-based magnitude/phase structure of natural vowels and assessment of three lightweight time/frequency voicing restoration methods
par: Ferreira, Aníbal J. S., et autres
Publié: (2025)
par: Ferreira, Aníbal J. S., et autres
Publié: (2025)
Two-stage Audio-Visual Target Speaker Extraction System for Real-Time Processing On Edge Device
par: Li, Zixuan, et autres
Publié: (2025)
par: Li, Zixuan, et autres
Publié: (2025)
Neural Speech Tracking in a Virtual Acoustic Environment: Audio-Visual Benefit for Unscripted Continuous Speech
par: Daeglau, Mareike, et autres
Publié: (2025)
par: Daeglau, Mareike, et autres
Publié: (2025)
Exploiting Audio-Visual Features with Pretrained AV-HuBERT for Multi-Modal Dysarthric Speech Reconstruction
par: Chen, Xueyuan, et autres
Publié: (2024)
par: Chen, Xueyuan, et autres
Publié: (2024)
AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning
par: Zhang, Daning, et autres
Publié: (2025)
par: Zhang, Daning, et autres
Publié: (2025)
A dataset and model for auditory scene recognition for hearing devices: AHEAD-DS and OpenYAMNet
par: Zhong, Henry, et autres
Publié: (2025)
par: Zhong, Henry, et autres
Publié: (2025)
Crowdsourcing MUSHRA Tests in the Age of Generative Speech Technologies: A Comparative Analysis of Subjective and Objective Testing Methods
par: Lechler, Laura, et autres
Publié: (2025)
par: Lechler, Laura, et autres
Publié: (2025)
AV-SSAN: Audio-Visual Selective DoA Estimation through Explicit Multi-Band Semantic-Spatial Alignment
par: Chen, Yu, et autres
Publié: (2025)
par: Chen, Yu, et autres
Publié: (2025)
Generating Symbolic Music from Natural Language Prompts using an LLM-Enhanced Dataset
par: Xu, Weihan, et autres
Publié: (2024)
par: Xu, Weihan, et autres
Publié: (2024)
Efficient Sound Field Reconstruction with Conditional Invertible Neural Networks
par: Karakonstantis, Xenofon, et autres
Publié: (2024)
par: Karakonstantis, Xenofon, et autres
Publié: (2024)
Music to Dance as Language Translation using Sequence Models
par: Correia, André, et autres
Publié: (2024)
par: Correia, André, et autres
Publié: (2024)
Neural Directional Filtering: Far-Field Directivity Control With a Small Microphone Array
par: Wechsler, Julian, et autres
Publié: (2024)
par: Wechsler, Julian, et autres
Publié: (2024)
Documents similaires
-
Vivo : une approche multimodale de la synthese concatenative par corpus dans le cadre d'une oeuvre audiovisuelle immersive
par: Fayet, Mateo
Publié: (2024) -
Lightweight End-to-end Text-to-speech Synthesis for low resource on-device applications
par: Vecino, Biel Tura, et autres
Publié: (2025) -
Application of Whisper in Clinical Practice: the Post-Stroke Speech Assessment during a Naming Task
par: Davudova, Milena, et autres
Publié: (2025) -
Uncovering the Visual Contribution in Audio-Visual Speech Recognition
par: Lin, Zhaofeng, et autres
Publié: (2024) -
Angular Distance Distribution Loss for Audio Classification
par: Almudévar, Antonio, et autres
Publié: (2024)