Siamese Vision Transformers are Scalable Audio-visual Learners
Fuente:
arXiv
Salvato in:
| Autori principali: | Lin, Yan-Bo, Bertasius, Gedas |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
VMAS: Video-to-Music Generation via Semantic Alignment in Web Music Videos
di: Lin, Yan-Bo, et al.
Pubblicazione: (2024)
di: Lin, Yan-Bo, et al.
Pubblicazione: (2024)
Zero-Shot Audio-Visual Editing via Cross-Modal Delta Denoising
di: Lin, Yan-Bo, et al.
Pubblicazione: (2025)
di: Lin, Yan-Bo, et al.
Pubblicazione: (2025)
Diffusion Models as Masked Audio-Video Learners
di: Nunez, Elvis, et al.
Pubblicazione: (2023)
di: Nunez, Elvis, et al.
Pubblicazione: (2023)
Large Language Models are Strong Audio-Visual Speech Recognition Learners
di: Cappellazzo, Umberto, et al.
Pubblicazione: (2024)
di: Cappellazzo, Umberto, et al.
Pubblicazione: (2024)
Statistics-aware Audio-visual Deepfake Detector
di: Astrid, Marcella, et al.
Pubblicazione: (2024)
di: Astrid, Marcella, et al.
Pubblicazione: (2024)
Contrastive Conditional Latent Diffusion for Audio-visual Segmentation
di: Mao, Yuxin, et al.
Pubblicazione: (2023)
di: Mao, Yuxin, et al.
Pubblicazione: (2023)
Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models
di: Lee, Seung-jae, et al.
Pubblicazione: (2025)
di: Lee, Seung-jae, et al.
Pubblicazione: (2025)
ASiT: Local-Global Audio Spectrogram vIsion Transformer for Event Classification
di: Atito, Sara, et al.
Pubblicazione: (2022)
di: Atito, Sara, et al.
Pubblicazione: (2022)
OmniAudio: Generating Spatial Audio from 360-Degree Video
di: Liu, Huadai, et al.
Pubblicazione: (2025)
di: Liu, Huadai, et al.
Pubblicazione: (2025)
Measuring Sound Symbolism in Audio-visual Models
di: Tseng, Wei-Cheng, et al.
Pubblicazione: (2024)
di: Tseng, Wei-Cheng, et al.
Pubblicazione: (2024)
FSSUAVL: A Discriminative Framework using Vision Models for Federated Self-Supervised Audio and Image Understanding
di: Rehman, Yasar Abbas Ur, et al.
Pubblicazione: (2025)
di: Rehman, Yasar Abbas Ur, et al.
Pubblicazione: (2025)
CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization
di: Bai, Detao, et al.
Pubblicazione: (2025)
di: Bai, Detao, et al.
Pubblicazione: (2025)
Synchronized Video-to-Audio Generation via Mel Quantization-Continuum Decomposition
di: Wang, Juncheng, et al.
Pubblicazione: (2025)
di: Wang, Juncheng, et al.
Pubblicazione: (2025)
Bootstrapping Audio-Visual Segmentation by Strengthening Audio Cues
di: Chen, Tianxiang, et al.
Pubblicazione: (2024)
di: Chen, Tianxiang, et al.
Pubblicazione: (2024)
CCStereo: Audio-Visual Contextual and Contrastive Learning for Binaural Audio Generation
di: Chen, Yuanhong, et al.
Pubblicazione: (2025)
di: Chen, Yuanhong, et al.
Pubblicazione: (2025)
Dynamic Derivation and Elimination: Audio Visual Segmentation with Enhanced Audio Semantics
di: Liu, Chen, et al.
Pubblicazione: (2025)
di: Liu, Chen, et al.
Pubblicazione: (2025)
Audio-Vision Contrastive Learning for Phonological Class Recognition
di: Liu, Daiqi, et al.
Pubblicazione: (2025)
di: Liu, Daiqi, et al.
Pubblicazione: (2025)
DDAVS: Disentangled Audio Semantics and Delayed Bidirectional Alignment for Audio-Visual Segmentation
di: Tian, Jingqi, et al.
Pubblicazione: (2025)
di: Tian, Jingqi, et al.
Pubblicazione: (2025)
Nexus: An Omni-Perceptive And -Interactive Model for Language, Audio, And Vision
di: Liu, Che, et al.
Pubblicazione: (2025)
di: Liu, Che, et al.
Pubblicazione: (2025)
Multiple Consistency-guided Test-Time Adaptation for Contrastive Audio-Language Models with Unlabeled Audio
di: Chen, Gongyu, et al.
Pubblicazione: (2024)
di: Chen, Gongyu, et al.
Pubblicazione: (2024)
AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation
di: Wang, Le, et al.
Pubblicazione: (2025)
di: Wang, Le, et al.
Pubblicazione: (2025)
Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction
di: Yang, Shu-wen, et al.
Pubblicazione: (2025)
di: Yang, Shu-wen, et al.
Pubblicazione: (2025)
Learning to Highlight Audio by Watching Movies
di: Huang, Chao, et al.
Pubblicazione: (2025)
di: Huang, Chao, et al.
Pubblicazione: (2025)
DeepAudio-V1:Towards Multi-Modal Multi-Stage End-to-End Video to Speech and Audio Generation
di: Zhang, Haomin, et al.
Pubblicazione: (2025)
di: Zhang, Haomin, et al.
Pubblicazione: (2025)
Draw an Audio: Leveraging Multi-Instruction for Video-to-Audio Synthesis
di: Yang, Qi, et al.
Pubblicazione: (2024)
di: Yang, Qi, et al.
Pubblicazione: (2024)
AISHELL6-whisper: A Chinese Mandarin Audio-visual Whisper Speech Dataset with Speech Recognition Baselines
di: Li, Cancan, et al.
Pubblicazione: (2025)
di: Li, Cancan, et al.
Pubblicazione: (2025)
Spiking Tucker Fusion Transformer for Audio-Visual Zero-Shot Learning
di: Li, Wenrui, et al.
Pubblicazione: (2024)
di: Li, Wenrui, et al.
Pubblicazione: (2024)
MA-AVT: Modality Alignment for Parameter-Efficient Audio-Visual Transformers
di: Mahmud, Tanvir, et al.
Pubblicazione: (2024)
di: Mahmud, Tanvir, et al.
Pubblicazione: (2024)
ZeroSep: Separate Anything in Audio with Zero Training
di: Huang, Chao, et al.
Pubblicazione: (2025)
di: Huang, Chao, et al.
Pubblicazione: (2025)
As Good as It KAN Get: High-Fidelity Audio Representation
di: Marszałek, Patryk, et al.
Pubblicazione: (2025)
di: Marszałek, Patryk, et al.
Pubblicazione: (2025)
RAP: Real-time Audio-driven Portrait Animation with Video Diffusion Transformer
di: Du, Fangyu, et al.
Pubblicazione: (2025)
di: Du, Fangyu, et al.
Pubblicazione: (2025)
Audio-visual video-to-speech synthesis with synthesized input audio
di: Kefalas, Triantafyllos, et al.
Pubblicazione: (2023)
di: Kefalas, Triantafyllos, et al.
Pubblicazione: (2023)
Multi-View Spectrogram Transformer for Respiratory Sound Classification
di: He, Wentao, et al.
Pubblicazione: (2023)
di: He, Wentao, et al.
Pubblicazione: (2023)
The LuViRA Dataset: Synchronized Vision, Radio, and Audio Sensors for Indoor Localization
di: Yaman, Ilayda, et al.
Pubblicazione: (2023)
di: Yaman, Ilayda, et al.
Pubblicazione: (2023)
Look, Listen and Recognise: Character-Aware Audio-Visual Subtitling
di: Korbar, Bruno, et al.
Pubblicazione: (2024)
di: Korbar, Bruno, et al.
Pubblicazione: (2024)
SONNET: Enhancing Time Delay Estimation by Leveraging Simulated Audio
di: Tegler, Erik, et al.
Pubblicazione: (2024)
di: Tegler, Erik, et al.
Pubblicazione: (2024)
Audio-Visual Talker Localization in Video for Spatial Sound Reproduction
di: Berghi, Davide, et al.
Pubblicazione: (2024)
di: Berghi, Davide, et al.
Pubblicazione: (2024)
Seeing Speech and Sound: Distinguishing and Locating Audios in Visual Scenes
di: Ryu, Hyeonggon, et al.
Pubblicazione: (2025)
di: Ryu, Hyeonggon, et al.
Pubblicazione: (2025)
JAM-Flow: Joint Audio-Motion Synthesis with Flow Matching
di: Kwon, Mingi, et al.
Pubblicazione: (2025)
di: Kwon, Mingi, et al.
Pubblicazione: (2025)
UniSync: A Unified Framework for Audio-Visual Synchronization
di: Feng, Tao, et al.
Pubblicazione: (2025)
di: Feng, Tao, et al.
Pubblicazione: (2025)
Documenti analoghi
-
VMAS: Video-to-Music Generation via Semantic Alignment in Web Music Videos
di: Lin, Yan-Bo, et al.
Pubblicazione: (2024) -
Zero-Shot Audio-Visual Editing via Cross-Modal Delta Denoising
di: Lin, Yan-Bo, et al.
Pubblicazione: (2025) -
Diffusion Models as Masked Audio-Video Learners
di: Nunez, Elvis, et al.
Pubblicazione: (2023) -
Large Language Models are Strong Audio-Visual Speech Recognition Learners
di: Cappellazzo, Umberto, et al.
Pubblicazione: (2024) -
Statistics-aware Audio-visual Deepfake Detector
di: Astrid, Marcella, et al.
Pubblicazione: (2024)