Multimodality Helps Unimodality: Cross-Modal Few-Shot Learning with Multimodal Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Lin, Zhiqiu, Yu, Samuel, Kuang, Zhiyi, Pathak, Deepak, Ramanan, Deva |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Efficient Audiovisual Speech Processing via MUTUD: Multimodal Training and Unimodal Deployment
di: Hong, Joanna, et al.
Pubblicazione: (2025)
di: Hong, Joanna, et al.
Pubblicazione: (2025)
Recursive Joint Cross-Modal Attention for Multimodal Fusion in Dimensional Emotion Recognition
di: Praveen, R. Gnana, et al.
Pubblicazione: (2024)
di: Praveen, R. Gnana, et al.
Pubblicazione: (2024)
Few-shot Acoustic Synthesis with Multimodal Flow Matching
di: Brunetto, Amandine
Pubblicazione: (2026)
di: Brunetto, Amandine
Pubblicazione: (2026)
Multimodal Fusion Method with Spatiotemporal Sequences and Relationship Learning for Valence-Arousal Estimation
di: Yu, Jun, et al.
Pubblicazione: (2024)
di: Yu, Jun, et al.
Pubblicazione: (2024)
Dynamic Modality and View Selection for Multimodal Emotion Recognition with Missing Modalities
di: Menon, Luciana Trinkaus, et al.
Pubblicazione: (2024)
di: Menon, Luciana Trinkaus, et al.
Pubblicazione: (2024)
Design and Development of Laughter Recognition System Based on Multimodal Fusion and Deep Learning
di: Zhao, Fuzheng, et al.
Pubblicazione: (2024)
di: Zhao, Fuzheng, et al.
Pubblicazione: (2024)
Omni-AVSR: Towards Unified Multimodal Speech Recognition with Large Language Models
di: Cappellazzo, Umberto, et al.
Pubblicazione: (2025)
di: Cappellazzo, Umberto, et al.
Pubblicazione: (2025)
Zero-Shot Audio-Visual Editing via Cross-Modal Delta Denoising
di: Lin, Yan-Bo, et al.
Pubblicazione: (2025)
di: Lin, Yan-Bo, et al.
Pubblicazione: (2025)
ThinkSound: Chain-of-Thought Reasoning in Multimodal Large Language Models for Audio Generation and Editing
di: Liu, Huadai, et al.
Pubblicazione: (2025)
di: Liu, Huadai, et al.
Pubblicazione: (2025)
The Universal Personalizer: Few-Shot Dysarthric Speech Recognition via Meta-Learning
di: Agarwal, Dhruuv, et al.
Pubblicazione: (2025)
di: Agarwal, Dhruuv, et al.
Pubblicazione: (2025)
Adaptive Multimodal Person Recognition: A Robust Framework for Handling Missing Modalities
di: Farhadipour, Aref, et al.
Pubblicazione: (2025)
di: Farhadipour, Aref, et al.
Pubblicazione: (2025)
A Survey on Cross-Modal Interaction Between Music and Multimodal Data
di: Li, Sifei, et al.
Pubblicazione: (2025)
di: Li, Sifei, et al.
Pubblicazione: (2025)
Multimodal Emotion Recognition and Sentiment Analysis in Multi-Party Conversation Contexts
di: Farhadipour, Aref, et al.
Pubblicazione: (2025)
di: Farhadipour, Aref, et al.
Pubblicazione: (2025)
Discrepancy-Aware Attention Network for Enhanced Audio-Visual Zero-Shot Learning
di: Yu, RunLin, et al.
Pubblicazione: (2024)
di: Yu, RunLin, et al.
Pubblicazione: (2024)
How Would It Sound? Material-Controlled Multimodal Acoustic Profile Generation for Indoor Scenes
di: Saad, Mahnoor Fatima, et al.
Pubblicazione: (2025)
di: Saad, Mahnoor Fatima, et al.
Pubblicazione: (2025)
Vision Language Models Are Few-Shot Audio Spectrogram Classifiers
di: Dixit, Satvik, et al.
Pubblicazione: (2024)
di: Dixit, Satvik, et al.
Pubblicazione: (2024)
HunyuanVideo-Foley: Multimodal Diffusion with Representation Alignment for High-Fidelity Foley Audio Generation
di: Shan, Sizhe, et al.
Pubblicazione: (2025)
di: Shan, Sizhe, et al.
Pubblicazione: (2025)
PSM: Learning Probabilistic Embeddings for Multi-scale Zero-Shot Soundscape Mapping
di: Khanal, Subash, et al.
Pubblicazione: (2024)
di: Khanal, Subash, et al.
Pubblicazione: (2024)
Few-Shot and Pseudo-Label Guided Speech Quality Evaluation with Large Language Models
di: Zezario, Ryandhimas E., et al.
Pubblicazione: (2026)
di: Zezario, Ryandhimas E., et al.
Pubblicazione: (2026)
Pilot-guided Multimodal Semantic Communication for Audio-Visual Event Localization
di: Yu, Fei, et al.
Pubblicazione: (2024)
di: Yu, Fei, et al.
Pubblicazione: (2024)
Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models
di: Lee, Seung-jae, et al.
Pubblicazione: (2025)
di: Lee, Seung-jae, et al.
Pubblicazione: (2025)
Few-Shot Bioacoustic Event Detection with Frame-Level Embedding Learning System
di: Zhao, PengYuan, et al.
Pubblicazione: (2024)
di: Zhao, PengYuan, et al.
Pubblicazione: (2024)
M&M: Multimodal-Multitask Model Integrating Audiovisual Cues in Cognitive Load Assessment
di: Nguyen-Phuoc, Long, et al.
Pubblicazione: (2024)
di: Nguyen-Phuoc, Long, et al.
Pubblicazione: (2024)
Ovi: Twin Backbone Cross-Modal Fusion for Audio-Video Generation
di: Low, Chetwin, et al.
Pubblicazione: (2025)
di: Low, Chetwin, et al.
Pubblicazione: (2025)
Zero-Shot Recognition of Dysarthric Speech Using Commercial Automatic Speech Recognition and Multimodal Large Language Models
di: Alsayegh, Ali, et al.
Pubblicazione: (2025)
di: Alsayegh, Ali, et al.
Pubblicazione: (2025)
Multimodal Music Generation with Explicit Bridges and Retrieval Augmentation
di: Wang, Baisen, et al.
Pubblicazione: (2024)
di: Wang, Baisen, et al.
Pubblicazione: (2024)
MCDubber: Multimodal Context-Aware Expressive Video Dubbing
di: Zhao, Yuan, et al.
Pubblicazione: (2024)
di: Zhao, Yuan, et al.
Pubblicazione: (2024)
Video-Guided Foley Sound Generation with Multimodal Controls
di: Chen, Ziyang, et al.
Pubblicazione: (2024)
di: Chen, Ziyang, et al.
Pubblicazione: (2024)
Digit Recognition using Multimodal Spiking Neural Networks
di: Bjorndahl, William, et al.
Pubblicazione: (2024)
di: Bjorndahl, William, et al.
Pubblicazione: (2024)
AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment
di: Cao, Yuqin, et al.
Pubblicazione: (2025)
di: Cao, Yuqin, et al.
Pubblicazione: (2025)
Multimodal Zero-Shot Framework for Deepfake Hate Speech Detection in Low-Resource Languages
di: Ranjan, Rishabh, et al.
Pubblicazione: (2025)
di: Ranjan, Rishabh, et al.
Pubblicazione: (2025)
AlignVSR: Audio-Visual Cross-Modal Alignment for Visual Speech Recognition
di: Liu, Zehua, et al.
Pubblicazione: (2024)
di: Liu, Zehua, et al.
Pubblicazione: (2024)
CoLM-DSR: Leveraging Neural Codec Language Modeling for Multi-Modal Dysarthric Speech Reconstruction
di: Chen, Xueyuan, et al.
Pubblicazione: (2024)
di: Chen, Xueyuan, et al.
Pubblicazione: (2024)
Art2Mus: Bridging Visual Arts and Music through Cross-Modal Generation
di: Rinaldi, Ivan, et al.
Pubblicazione: (2024)
di: Rinaldi, Ivan, et al.
Pubblicazione: (2024)
Adaptive Learning via a Negative Selection Strategy for Few-Shot Bioacoustic Event Detection
di: Chen, Yaxiong, et al.
Pubblicazione: (2024)
di: Chen, Yaxiong, et al.
Pubblicazione: (2024)
A Few-Shot Learning Approach for Sound Source Distance Estimation Using Relation Networks
di: Sobhdel, Amirreza, et al.
Pubblicazione: (2021)
di: Sobhdel, Amirreza, et al.
Pubblicazione: (2021)
MMTrail: A Multimodal Trailer Video Dataset with Language and Music Descriptions
di: Chi, Xiaowei, et al.
Pubblicazione: (2024)
di: Chi, Xiaowei, et al.
Pubblicazione: (2024)
Music Audio-Visual Question Answering Requires Specialized Multimodal Designs
di: You, Wenhao, et al.
Pubblicazione: (2025)
di: You, Wenhao, et al.
Pubblicazione: (2025)
RTFS-Net: Recurrent Time-Frequency Modelling for Efficient Audio-Visual Speech Separation
di: Pegg, Samuel, et al.
Pubblicazione: (2023)
di: Pegg, Samuel, et al.
Pubblicazione: (2023)
Combining Masked Language Modeling and Cross-Modal Contrastive Learning for Prosody-Aware TTS
di: Borodin, Kirill, et al.
Pubblicazione: (2026)
di: Borodin, Kirill, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Efficient Audiovisual Speech Processing via MUTUD: Multimodal Training and Unimodal Deployment
di: Hong, Joanna, et al.
Pubblicazione: (2025) -
Recursive Joint Cross-Modal Attention for Multimodal Fusion in Dimensional Emotion Recognition
di: Praveen, R. Gnana, et al.
Pubblicazione: (2024) -
Few-shot Acoustic Synthesis with Multimodal Flow Matching
di: Brunetto, Amandine
Pubblicazione: (2026) -
Multimodal Fusion Method with Spatiotemporal Sequences and Relationship Learning for Valence-Arousal Estimation
di: Yu, Jun, et al.
Pubblicazione: (2024) -
Dynamic Modality and View Selection for Multimodal Emotion Recognition with Missing Modalities
di: Menon, Luciana Trinkaus, et al.
Pubblicazione: (2024)