Audio-Visual Generalized Zero-Shot Learning using Pre-Trained Large Multi-Modal Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Kurzendörfer, David, Mercea, Otniel-Bogdan, Koepke, A. Sophia, Akata, Zeynep |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Time-, Memory- and Parameter-Efficient Visual Adaptation
di: Mercea, Otniel-Bogdan, et al.
Pubblicazione: (2024)
di: Mercea, Otniel-Bogdan, et al.
Pubblicazione: (2024)
Fantastic Gains and Where to Find Them: On the Existence and Prospect of General Knowledge Transfer between Any Pretrained Model
di: Roth, Karsten, et al.
Pubblicazione: (2023)
di: Roth, Karsten, et al.
Pubblicazione: (2023)
Training-free Uncertainty Guidance for Complex Visual Tasks with MLLMs
di: Kim, Sanghwan, et al.
Pubblicazione: (2025)
di: Kim, Sanghwan, et al.
Pubblicazione: (2025)
Zero-Shot Open-Vocabulary Tracking with Large Pre-Trained Models
di: Chu, Wen-Hsuan, et al.
Pubblicazione: (2023)
di: Chu, Wen-Hsuan, et al.
Pubblicazione: (2023)
Sparse Autoencoders are Topic Models
di: Girrbach, Leander, et al.
Pubblicazione: (2025)
di: Girrbach, Leander, et al.
Pubblicazione: (2025)
A Large Scale Analysis of Gender Biases in Text-to-Image Generative Models
di: Girrbach, Leander, et al.
Pubblicazione: (2025)
di: Girrbach, Leander, et al.
Pubblicazione: (2025)
LoFT: LoRA-fused Training Dataset Generation with Few-shot Guidance
di: Kim, Jae Myung, et al.
Pubblicazione: (2025)
di: Kim, Jae Myung, et al.
Pubblicazione: (2025)
Multi-Timescale Motion-Decoupled Spiking Transformer for Audio-Visual Zero-Shot Learning
di: Li, Wenrui, et al.
Pubblicazione: (2025)
di: Li, Wenrui, et al.
Pubblicazione: (2025)
Vision-by-Language for Training-Free Compositional Image Retrieval
di: Karthik, Shyamgopal, et al.
Pubblicazione: (2023)
di: Karthik, Shyamgopal, et al.
Pubblicazione: (2023)
Explaining CLIP Zero-shot Predictions Through Concepts
di: Ozdemir, Onat, et al.
Pubblicazione: (2026)
di: Ozdemir, Onat, et al.
Pubblicazione: (2026)
COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training
di: Kim, Sanghwan, et al.
Pubblicazione: (2024)
di: Kim, Sanghwan, et al.
Pubblicazione: (2024)
VGGSounder: Audio-Visual Evaluations for Foundation Models
di: Zverev, Daniil, et al.
Pubblicazione: (2025)
di: Zverev, Daniil, et al.
Pubblicazione: (2025)
Zero-Shot Video Semantic Segmentation based on Pre-Trained Diffusion Models
di: Wang, Qian, et al.
Pubblicazione: (2024)
di: Wang, Qian, et al.
Pubblicazione: (2024)
AutoAD-Zero: A Training-Free Framework for Zero-Shot Audio Description
di: Xie, Junyu, et al.
Pubblicazione: (2024)
di: Xie, Junyu, et al.
Pubblicazione: (2024)
ETHER: Efficient Finetuning of Large-Scale Models with Hyperplane Reflections
di: Bini, Massimo, et al.
Pubblicazione: (2024)
di: Bini, Massimo, et al.
Pubblicazione: (2024)
The Curse of Multi-Modalities: Evaluating Hallucinations of Large Multimodal Models across Language, Visual, and Audio
di: Leng, Sicong, et al.
Pubblicazione: (2024)
di: Leng, Sicong, et al.
Pubblicazione: (2024)
Visual and Semantic Prompt Collaboration for Generalized Zero-Shot Learning
di: Jiang, Huajie, et al.
Pubblicazione: (2025)
di: Jiang, Huajie, et al.
Pubblicazione: (2025)
Investigating Structural Pruning and Recovery Techniques for Compressing Multimodal Large Language Models: An Empirical Study
di: Huang, Yiran, et al.
Pubblicazione: (2025)
di: Huang, Yiran, et al.
Pubblicazione: (2025)
ZeroMamba: Exploring Visual State Space Model for Zero-Shot Learning
di: Hou, Wenjin, et al.
Pubblicazione: (2024)
di: Hou, Wenjin, et al.
Pubblicazione: (2024)
Zero-Shot Audio-Visual Editing via Cross-Modal Delta Denoising
di: Lin, Yan-Bo, et al.
Pubblicazione: (2025)
di: Lin, Yan-Bo, et al.
Pubblicazione: (2025)
Shot-by-Shot: Film-Grammar-Aware Training-Free Audio Description Generation
di: Xie, Junyu, et al.
Pubblicazione: (2025)
di: Xie, Junyu, et al.
Pubblicazione: (2025)
Rethinking Concept Bottleneck Models: From Pitfalls to Solutions
di: Tapli, Merve, et al.
Pubblicazione: (2026)
di: Tapli, Merve, et al.
Pubblicazione: (2026)
Visual-Augmented Dynamic Semantic Prototype for Generative Zero-Shot Learning
di: Hou, Wenjin, et al.
Pubblicazione: (2024)
di: Hou, Wenjin, et al.
Pubblicazione: (2024)
Distributed Zero-Shot Learning for Visual Recognition
di: Chen, Zhi, et al.
Pubblicazione: (2025)
di: Chen, Zhi, et al.
Pubblicazione: (2025)
ReNO: Enhancing One-step Text-to-Image Models through Reward-based Noise Optimization
di: Eyring, Luca, et al.
Pubblicazione: (2024)
di: Eyring, Luca, et al.
Pubblicazione: (2024)
Learning Visual Proxy for Compositional Zero-Shot Learning
di: Zhang, Shiyu, et al.
Pubblicazione: (2025)
di: Zhang, Shiyu, et al.
Pubblicazione: (2025)
Audio-Guided Visual Editing with Complex Multi-Modal Prompts
di: Kim, Hyeonyu, et al.
Pubblicazione: (2025)
di: Kim, Hyeonyu, et al.
Pubblicazione: (2025)
Reflecting on the State of Rehearsal-free Continual Learning with Pretrained Models
di: Thede, Lukas, et al.
Pubblicazione: (2024)
di: Thede, Lukas, et al.
Pubblicazione: (2024)
AVHBench: A Cross-Modal Hallucination Benchmark for Audio-Visual Large Language Models
di: Sung-Bin, Kim, et al.
Pubblicazione: (2024)
di: Sung-Bin, Kim, et al.
Pubblicazione: (2024)
Spiking Tucker Fusion Transformer for Audio-Visual Zero-Shot Learning
di: Li, Wenrui, et al.
Pubblicazione: (2024)
di: Li, Wenrui, et al.
Pubblicazione: (2024)
Scalable Ranked Preference Optimization for Text-to-Image Generation
di: Karthik, Shyamgopal, et al.
Pubblicazione: (2024)
di: Karthik, Shyamgopal, et al.
Pubblicazione: (2024)
Zero-Shot Video Restoration and Enhancement Using Pre-Trained Image Diffusion Model
di: Cao, Cong, et al.
Pubblicazione: (2024)
di: Cao, Cong, et al.
Pubblicazione: (2024)
Multi-Modal Soccer Scene Analysis with Masked Pre-Training
di: Peral, Marc, et al.
Pubblicazione: (2025)
di: Peral, Marc, et al.
Pubblicazione: (2025)
CapS-Adapter: Caption-based MultiModal Adapter in Zero-Shot Classification
di: Wang, Qijie, et al.
Pubblicazione: (2024)
di: Wang, Qijie, et al.
Pubblicazione: (2024)
It's Never Too Late: Noise Optimization for Collapse Recovery in Trained Diffusion Models
di: Harrington, Anne, et al.
Pubblicazione: (2025)
di: Harrington, Anne, et al.
Pubblicazione: (2025)
EgoCVR: An Egocentric Benchmark for Fine-Grained Composed Video Retrieval
di: Hummel, Thomas, et al.
Pubblicazione: (2024)
di: Hummel, Thomas, et al.
Pubblicazione: (2024)
Epsilon: Exploring Comprehensive Visual-Semantic Projection for Multi-Label Zero-Shot Learning
di: Liu, Ziming, et al.
Pubblicazione: (2024)
di: Liu, Ziming, et al.
Pubblicazione: (2024)
SUB: Benchmarking CBM Generalization via Synthetic Attribute Substitutions
di: Bader, Jessica, et al.
Pubblicazione: (2025)
di: Bader, Jessica, et al.
Pubblicazione: (2025)
VMAD: Visual-enhanced Multimodal Large Language Model for Zero-Shot Anomaly Detection
di: Deng, Huilin, et al.
Pubblicazione: (2024)
di: Deng, Huilin, et al.
Pubblicazione: (2024)
Boosting Audio-visual Zero-shot Learning with Large Language Models
di: Chen, Haoxing, et al.
Pubblicazione: (2023)
di: Chen, Haoxing, et al.
Pubblicazione: (2023)
Documenti analoghi
-
Time-, Memory- and Parameter-Efficient Visual Adaptation
di: Mercea, Otniel-Bogdan, et al.
Pubblicazione: (2024) -
Fantastic Gains and Where to Find Them: On the Existence and Prospect of General Knowledge Transfer between Any Pretrained Model
di: Roth, Karsten, et al.
Pubblicazione: (2023) -
Training-free Uncertainty Guidance for Complex Visual Tasks with MLLMs
di: Kim, Sanghwan, et al.
Pubblicazione: (2025) -
Zero-Shot Open-Vocabulary Tracking with Large Pre-Trained Models
di: Chu, Wen-Hsuan, et al.
Pubblicazione: (2023) -
Sparse Autoencoders are Topic Models
di: Girrbach, Leander, et al.
Pubblicazione: (2025)