Character-aware audio-visual subtitling in context
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Huh, Jaesung, Zisserman, Andrew |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Look, Listen and Recognise: Character-Aware Audio-Visual Subtitling
par: Korbar, Bruno, et autres
Publié: (2024)
par: Korbar, Bruno, et autres
Publié: (2024)
Audio-visual video-to-speech synthesis with synthesized input audio
par: Kefalas, Triantafyllos, et autres
Publié: (2023)
par: Kefalas, Triantafyllos, et autres
Publié: (2023)
Synchformer: Efficient Synchronization from Sparse Cues
par: Iashin, Vladimir, et autres
Publié: (2024)
par: Iashin, Vladimir, et autres
Publié: (2024)
Circumventing shortcuts in audio-visual deepfake detection datasets with unsupervised learning
par: Smeu, Stefan, et autres
Publié: (2024)
par: Smeu, Stefan, et autres
Publié: (2024)
Large-scale unsupervised audio pre-training for video-to-speech synthesis
par: Kefalas, Triantafyllos, et autres
Publié: (2023)
par: Kefalas, Triantafyllos, et autres
Publié: (2023)
Epic-Sounds: A Large-scale Dataset of Actions That Sound
par: Huh, Jaesung, et autres
Publié: (2023)
par: Huh, Jaesung, et autres
Publié: (2023)
Developing an AI-based Integrated System for Bee Health Evaluation
par: Liang, Andrew
Publié: (2024)
par: Liang, Andrew
Publié: (2024)
Separating the "Chirp" from the "Chat": Self-supervised Visual Grounding of Sound and Language
par: Hamilton, Mark, et autres
Publié: (2024)
par: Hamilton, Mark, et autres
Publié: (2024)
The Sound of Water: Inferring Physical Properties from Pouring Liquids
par: Bagad, Piyush, et autres
Publié: (2024)
par: Bagad, Piyush, et autres
Publié: (2024)
pycnet-audio: A Python package to support bioacoustics data processing
par: Ruff, Zachary J., et autres
Publié: (2025)
par: Ruff, Zachary J., et autres
Publié: (2025)
Statistics-aware Audio-visual Deepfake Detector
par: Astrid, Marcella, et autres
Publié: (2024)
par: Astrid, Marcella, et autres
Publié: (2024)
Audio-visual Generalized Zero-shot Learning the Easy Way
par: Mo, Shentong, et autres
Publié: (2024)
par: Mo, Shentong, et autres
Publié: (2024)
Listen2Scene: Interactive material-aware binaural sound propagation for reconstructed 3D scenes
par: Ratnarajah, Anton, et autres
Publié: (2023)
par: Ratnarajah, Anton, et autres
Publié: (2023)
Images that Sound: Composing Images and Sounds on a Single Canvas
par: Chen, Ziyang, et autres
Publié: (2024)
par: Chen, Ziyang, et autres
Publié: (2024)
Ditto: Motion-Space Diffusion for Controllable Realtime Talking Head Synthesis
par: Li, Tianqi, et autres
Publié: (2024)
par: Li, Tianqi, et autres
Publié: (2024)
Addressing Representation Collapse in Vector Quantized Models with One Linear Layer
par: Zhu, Yongxin, et autres
Publié: (2024)
par: Zhu, Yongxin, et autres
Publié: (2024)
Exploring Federated Self-Supervised Learning for General Purpose Audio Understanding
par: Rehman, Yasar Abbas Ur, et autres
Publié: (2024)
par: Rehman, Yasar Abbas Ur, et autres
Publié: (2024)
Assessing the Robustness of Spectral Clustering for Deep Speaker Diarization
par: Raghav, Nikhil, et autres
Publié: (2024)
par: Raghav, Nikhil, et autres
Publié: (2024)
Exploring Green AI for Audio Deepfake Detection
par: Saha, Subhajit, et autres
Publié: (2024)
par: Saha, Subhajit, et autres
Publié: (2024)
Joint Multimodal Transformer for Emotion Recognition in the Wild
par: Waligora, Paul, et autres
Publié: (2024)
par: Waligora, Paul, et autres
Publié: (2024)
Dynamic Cross Attention for Audio-Visual Person Verification
par: Praveen, R. Gnana, et autres
Publié: (2024)
par: Praveen, R. Gnana, et autres
Publié: (2024)
Dynamic Modality and View Selection for Multimodal Emotion Recognition with Missing Modalities
par: Menon, Luciana Trinkaus, et autres
Publié: (2024)
par: Menon, Luciana Trinkaus, et autres
Publié: (2024)
An Eye for an Ear: Zero-shot Audio Description Leveraging an Image Captioner using Audiovisual Distribution Alignment
par: Malard, Hugo, et autres
Publié: (2024)
par: Malard, Hugo, et autres
Publié: (2024)
Integrating Audio, Visual, and Semantic Information for Enhanced Multimodal Speaker Diarization
par: Cheng, Luyao, et autres
Publié: (2024)
par: Cheng, Luyao, et autres
Publié: (2024)
The Solution for Temporal Sound Localisation Task of ICCV 1st Perception Test Challenge 2023
par: Huang, Yurui, et autres
Publié: (2024)
par: Huang, Yurui, et autres
Publié: (2024)
Towards reliable respiratory disease diagnosis based on cough sounds and vision transformers
par: Wang, Qian, et autres
Publié: (2024)
par: Wang, Qian, et autres
Publié: (2024)
MMAudio: Taming Multimodal Joint Training for High-Quality Video-to-Audio Synthesis
par: Cheng, Ho Kei, et autres
Publié: (2024)
par: Cheng, Ho Kei, et autres
Publié: (2024)
AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation
par: Haji-Ali, Moayed, et autres
Publié: (2024)
par: Haji-Ali, Moayed, et autres
Publié: (2024)
SEE-2-SOUND: Zero-Shot Spatial Environment-to-Spatial Sound
par: Dagli, Rishit, et autres
Publié: (2024)
par: Dagli, Rishit, et autres
Publié: (2024)
SoundBrush: Sound as a Brush for Visual Scene Editing
par: Sung-Bin, Kim, et autres
Publié: (2024)
par: Sung-Bin, Kim, et autres
Publié: (2024)
Attention-guided Spectrogram Sequence Modeling with CNNs for Music Genre Classification
par: Sridhar, Aditya
Publié: (2024)
par: Sridhar, Aditya
Publié: (2024)
When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining
par: Yeo, Juan, et autres
Publié: (2024)
par: Yeo, Juan, et autres
Publié: (2024)
Characterizing Continual Learning Scenarios and Strategies for Audio Analysis
par: Bhatt, Ruchi, et autres
Publié: (2024)
par: Bhatt, Ruchi, et autres
Publié: (2024)
Audio-Agent: Leveraging LLMs For Audio Generation, Editing and Composition
par: Wang, Zixuan, et autres
Publié: (2024)
par: Wang, Zixuan, et autres
Publié: (2024)
Deep Neural Networks for Automatic Speaker Recognition Do Not Learn Supra-Segmental Temporal Features
par: Neururer, Daniel, et autres
Publié: (2023)
par: Neururer, Daniel, et autres
Publié: (2023)
Acoustic Scene Classification: A Competition Review
par: Gharib, Shayan, et autres
Publié: (2018)
par: Gharib, Shayan, et autres
Publié: (2018)
Benchmarking Machine Learning Methods for Distributed Acoustic Sensing
par: Shi, Shuaikai, et autres
Publié: (2025)
par: Shi, Shuaikai, et autres
Publié: (2025)
MMAudioSep: Taming Video-to-Audio Generative Model Towards Video/Text-Queried Sound Separation
par: Takahashi, Akira, et autres
Publié: (2025)
par: Takahashi, Akira, et autres
Publié: (2025)
A High-Accuracy Optical Music Recognition Method Based on Bottleneck Residual Convolutions
par: Ma, Junwen, et autres
Publié: (2026)
par: Ma, Junwen, et autres
Publié: (2026)
Training-Free Voice Conversion with Factorized Optimal Transport
par: Lobashev, Alexander, et autres
Publié: (2025)
par: Lobashev, Alexander, et autres
Publié: (2025)
Documents similaires
-
Look, Listen and Recognise: Character-Aware Audio-Visual Subtitling
par: Korbar, Bruno, et autres
Publié: (2024) -
Audio-visual video-to-speech synthesis with synthesized input audio
par: Kefalas, Triantafyllos, et autres
Publié: (2023) -
Synchformer: Efficient Synchronization from Sparse Cues
par: Iashin, Vladimir, et autres
Publié: (2024) -
Circumventing shortcuts in audio-visual deepfake detection datasets with unsupervised learning
par: Smeu, Stefan, et autres
Publié: (2024) -
Large-scale unsupervised audio pre-training for video-to-speech synthesis
par: Kefalas, Triantafyllos, et autres
Publié: (2023)