Characterizing Continual Learning Scenarios and Strategies for Audio Analysis
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Bhatt, Ruchi, Kumari, Pratibha, Mahapatra, Dwarikanath, Saddik, Abdulmotaleb El, Saini, Mukesh |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Voice Cloning: Comprehensive Survey
par: Azzuni, Hussam, et autres
Publié: (2025)
par: Azzuni, Hussam, et autres
Publié: (2025)
TapToTab : Video-Based Guitar Tabs Generation using AI and Audio Analysis
par: Ghaleb, Ali, et autres
Publié: (2024)
par: Ghaleb, Ali, et autres
Publié: (2024)
CCStereo: Audio-Visual Contextual and Contrastive Learning for Binaural Audio Generation
par: Chen, Yuanhong, et autres
Publié: (2025)
par: Chen, Yuanhong, et autres
Publié: (2025)
Learning to Highlight Audio by Watching Movies
par: Huang, Chao, et autres
Publié: (2025)
par: Huang, Chao, et autres
Publié: (2025)
Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction
par: Yang, Shu-wen, et autres
Publié: (2025)
par: Yang, Shu-wen, et autres
Publié: (2025)
Audio-Visual Speech Enhancement In Complex Scenarios With Separation And Dereverberation Joint Modeling
par: Du, Jiarong, et autres
Publié: (2025)
par: Du, Jiarong, et autres
Publié: (2025)
Bootstrapping Audio-Visual Segmentation by Strengthening Audio Cues
par: Chen, Tianxiang, et autres
Publié: (2024)
par: Chen, Tianxiang, et autres
Publié: (2024)
Deep Active Audio Feature Learning in Resource-Constrained Environments
par: Mohaimenuzzaman, Md, et autres
Publié: (2023)
par: Mohaimenuzzaman, Md, et autres
Publié: (2023)
Learning Spatial Features from Audio-Visual Correspondence in Egocentric Videos
par: Majumder, Sagnik, et autres
Publié: (2023)
par: Majumder, Sagnik, et autres
Publié: (2023)
Dynamic Derivation and Elimination: Audio Visual Segmentation with Enhanced Audio Semantics
par: Liu, Chen, et autres
Publié: (2025)
par: Liu, Chen, et autres
Publié: (2025)
OmniAudio: Generating Spatial Audio from 360-Degree Video
par: Liu, Huadai, et autres
Publié: (2025)
par: Liu, Huadai, et autres
Publié: (2025)
DDAVS: Disentangled Audio Semantics and Delayed Bidirectional Alignment for Audio-Visual Segmentation
par: Tian, Jingqi, et autres
Publié: (2025)
par: Tian, Jingqi, et autres
Publié: (2025)
Multiple Consistency-guided Test-Time Adaptation for Contrastive Audio-Language Models with Unlabeled Audio
par: Chen, Gongyu, et autres
Publié: (2024)
par: Chen, Gongyu, et autres
Publié: (2024)
CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization
par: Bai, Detao, et autres
Publié: (2025)
par: Bai, Detao, et autres
Publié: (2025)
DeepAudio-V1:Towards Multi-Modal Multi-Stage End-to-End Video to Speech and Audio Generation
par: Zhang, Haomin, et autres
Publié: (2025)
par: Zhang, Haomin, et autres
Publié: (2025)
ECHO: Environmental Sound Classification with Hierarchical Ontology-guided Semi-Supervised Learning
par: Gupta, Pranav, et autres
Publié: (2024)
par: Gupta, Pranav, et autres
Publié: (2024)
ZeroSep: Separate Anything in Audio with Zero Training
par: Huang, Chao, et autres
Publié: (2025)
par: Huang, Chao, et autres
Publié: (2025)
As Good as It KAN Get: High-Fidelity Audio Representation
par: Marszałek, Patryk, et autres
Publié: (2025)
par: Marszałek, Patryk, et autres
Publié: (2025)
Siamese Vision Transformers are Scalable Audio-visual Learners
par: Lin, Yan-Bo, et autres
Publié: (2024)
par: Lin, Yan-Bo, et autres
Publié: (2024)
Seeing Speech and Sound: Distinguishing and Locating Audios in Visual Scenes
par: Ryu, Hyeonggon, et autres
Publié: (2025)
par: Ryu, Hyeonggon, et autres
Publié: (2025)
Look, Listen and Recognise: Character-Aware Audio-Visual Subtitling
par: Korbar, Bruno, et autres
Publié: (2024)
par: Korbar, Bruno, et autres
Publié: (2024)
JAM-Flow: Joint Audio-Motion Synthesis with Flow Matching
par: Kwon, Mingi, et autres
Publié: (2025)
par: Kwon, Mingi, et autres
Publié: (2025)
SONNET: Enhancing Time Delay Estimation by Leveraging Simulated Audio
par: Tegler, Erik, et autres
Publié: (2024)
par: Tegler, Erik, et autres
Publié: (2024)
UniSync: A Unified Framework for Audio-Visual Synchronization
par: Feng, Tao, et autres
Publié: (2025)
par: Feng, Tao, et autres
Publié: (2025)
Dual Audio-Centric Modality Coupling for Talking Head Generation
par: Fu, Ao, et autres
Publié: (2025)
par: Fu, Ao, et autres
Publié: (2025)
Audio-Visual Talker Localization in Video for Spatial Sound Reproduction
par: Berghi, Davide, et autres
Publié: (2024)
par: Berghi, Davide, et autres
Publié: (2024)
SoundWeaver: Semantic Warm-Starting for Text-to-Audio Diffusion Serving
par: Barik, Ayush, et autres
Publié: (2026)
par: Barik, Ayush, et autres
Publié: (2026)
UWAV: Uncertainty-weighted Weakly-supervised Audio-Visual Video Parsing
par: Lai, Yung-Hsuan, et autres
Publié: (2025)
par: Lai, Yung-Hsuan, et autres
Publié: (2025)
MoME: Mixture of Matryoshka Experts for Audio-Visual Speech Recognition
par: Cappellazzo, Umberto, et autres
Publié: (2025)
par: Cappellazzo, Umberto, et autres
Publié: (2025)
Synchronized Video-to-Audio Generation via Mel Quantization-Continuum Decomposition
par: Wang, Juncheng, et autres
Publié: (2025)
par: Wang, Juncheng, et autres
Publié: (2025)
Oceanship: A Large-Scale Dataset for Underwater Audio Target Recognition
par: Li, Zeyu, et autres
Publié: (2024)
par: Li, Zeyu, et autres
Publié: (2024)
Audio-Vision Contrastive Learning for Phonological Class Recognition
par: Liu, Daiqi, et autres
Publié: (2025)
par: Liu, Daiqi, et autres
Publié: (2025)
Audio-Visual Person Verification based on Recursive Fusion of Joint Cross-Attention
par: Praveen, R. Gnana, et autres
Publié: (2024)
par: Praveen, R. Gnana, et autres
Publié: (2024)
Pindrop it! Audio and Visual Deepfake Countermeasures for Robust Detection and Fine Grained-Localization
par: Klein, Nicholas, et autres
Publié: (2025)
par: Klein, Nicholas, et autres
Publié: (2025)
mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition
par: Rouditchenko, Andrew, et autres
Publié: (2025)
par: Rouditchenko, Andrew, et autres
Publié: (2025)
ASiT: Local-Global Audio Spectrogram vIsion Transformer for Event Classification
par: Atito, Sara, et autres
Publié: (2022)
par: Atito, Sara, et autres
Publié: (2022)
Both Ears Wide Open: Towards Language-Driven Spatial Audio Generation
par: Sun, Peiwen, et autres
Publié: (2024)
par: Sun, Peiwen, et autres
Publié: (2024)
SSAVSV: Towards Unified Model for Self-Supervised Audio-Visual Speaker Verification
par: Rajasekhar, Gnana Praveen, et autres
Publié: (2025)
par: Rajasekhar, Gnana Praveen, et autres
Publié: (2025)
Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models
par: Lee, Seung-jae, et autres
Publié: (2025)
par: Lee, Seung-jae, et autres
Publié: (2025)
Mitigating Attention Sinks and Massive Activations in Audio-Visual Speech Recognition with LLMs
par: Anand, et autres
Publié: (2025)
par: Anand, et autres
Publié: (2025)
Documents similaires
-
Voice Cloning: Comprehensive Survey
par: Azzuni, Hussam, et autres
Publié: (2025) -
TapToTab : Video-Based Guitar Tabs Generation using AI and Audio Analysis
par: Ghaleb, Ali, et autres
Publié: (2024) -
CCStereo: Audio-Visual Contextual and Contrastive Learning for Binaural Audio Generation
par: Chen, Yuanhong, et autres
Publié: (2025) -
Learning to Highlight Audio by Watching Movies
par: Huang, Chao, et autres
Publié: (2025) -
Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction
par: Yang, Shu-wen, et autres
Publié: (2025)