Boosting Audio-visual Zero-shot Learning with Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Chen, Haoxing, Li, Yaohui, Hong, Yan, Huang, Zizheng, Xu, Zhuoer, Gu, Zhangxuan, Lan, Jun, Zhu, Huijia, Wang, Weiqiang |
|---|---|
| Format: | Preprint |
| Published: |
2023
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Conditional Prototype Rectification Prompt Learning
by: Chen, Haoxing, et al.
Published: (2024)
by: Chen, Haoxing, et al.
Published: (2024)
DeMamba: AI-Generated Video Detection on Million-Scale GenVideo Benchmark
by: Chen, Haoxing, et al.
Published: (2024)
by: Chen, Haoxing, et al.
Published: (2024)
Efficient Transfer Learning for Video-language Foundation Models
by: Chen, Haoxing, et al.
Published: (2024)
by: Chen, Haoxing, et al.
Published: (2024)
Stochastic Layer-Wise Shuffle for Improving Vision Mamba Training
by: Huang, Zizheng, et al.
Published: (2024)
by: Huang, Zizheng, et al.
Published: (2024)
Supervised Contrastive Learning for Snapshot Spectral Imaging Face Anti-Spoofing
by: Song, Chuanbiao, et al.
Published: (2024)
by: Song, Chuanbiao, et al.
Published: (2024)
Adaptive and Balanced Re-initialization for Long-timescale Continual Test-time Domain Adaptation
by: Wang, Yanshuo, et al.
Published: (2026)
by: Wang, Yanshuo, et al.
Published: (2026)
Maintain Plasticity in Long-timescale Continual Test-time Adaptation
by: Wang, Yanshuo, et al.
Published: (2024)
by: Wang, Yanshuo, et al.
Published: (2024)
Robustness in AI-Generated Detection: Enhancing Resistance to Adversarial Attacks
by: Haoxuan, Sun, et al.
Published: (2025)
by: Haoxuan, Sun, et al.
Published: (2025)
Dual-Adapter: Training-free Dual Adaptation for Few-shot Out-of-Distribution Detection
by: Chen, Xinyi, et al.
Published: (2024)
by: Chen, Xinyi, et al.
Published: (2024)
DomainGallery: Few-shot Domain-driven Image Generation by Attribute-centric Finetuning
by: Duan, Yuxuan, et al.
Published: (2024)
by: Duan, Yuxuan, et al.
Published: (2024)
Towards Explainable Fake Image Detection with Multi-Modal Large Language Models
by: Ji, Yikun, et al.
Published: (2025)
by: Ji, Yikun, et al.
Published: (2025)
The Devil is in the Few Shots: Iterative Visual Knowledge Completion for Few-shot Learning
by: Li, Yaohui, et al.
Published: (2024)
by: Li, Yaohui, et al.
Published: (2024)
DS-VTON: An Enhanced Dual-Scale Coarse-to-Fine Framework for Virtual Try-On
by: Sun, Xianbing, et al.
Published: (2025)
by: Sun, Xianbing, et al.
Published: (2025)
Generalizable and Adaptive Continual Learning Framework for AI-generated Image Detection
by: Wang, Hanyi, et al.
Published: (2026)
by: Wang, Hanyi, et al.
Published: (2026)
EMIT: Enhancing MLLMs for Industrial Anomaly Detection via Difficulty-Aware GRPO
by: Guan, Wei, et al.
Published: (2025)
by: Guan, Wei, et al.
Published: (2025)
Extremely Simple Out-of-distribution Detection for Audio-visual Generalized Zero-shot Learning
by: Liu, Yang, et al.
Published: (2025)
by: Liu, Yang, et al.
Published: (2025)
InterAnimate: Taming Region-aware Diffusion Model for Realistic Human Interaction Animation
by: Lin, Yukang, et al.
Published: (2025)
by: Lin, Yukang, et al.
Published: (2025)
Audio-visual Generalized Zero-shot Learning the Easy Way
by: Mo, Shentong, et al.
Published: (2024)
by: Mo, Shentong, et al.
Published: (2024)
Few-shot Calligraphy Style Learning
by: Chen, Fangda, et al.
Published: (2024)
by: Chen, Fangda, et al.
Published: (2024)
VideoVeritas: AI-Generated Video Detection via Perception Pretext Reinforcement Learning
by: Tan, Hao, et al.
Published: (2026)
by: Tan, Hao, et al.
Published: (2026)
Interpretable and Reliable Detection of AI-Generated Images via Grounded Reasoning in MLLMs
by: Ji, Yikun, et al.
Published: (2025)
by: Ji, Yikun, et al.
Published: (2025)
E-ANT: A Large-Scale Dataset for Efficient Automatic GUI NavigaTion
by: Wang, Ke, et al.
Published: (2024)
by: Wang, Ke, et al.
Published: (2024)
GALOT: Generative Active Learning via Optimizable Zero-shot Text-to-image Generation
by: Hong, Hanbin, et al.
Published: (2024)
by: Hong, Hanbin, et al.
Published: (2024)
Compositional Zero-shot Learning via Progressive Language-based Observations
by: Li, Lin, et al.
Published: (2023)
by: Li, Lin, et al.
Published: (2023)
Enhancing Zero-shot Counting via Language-guided Exemplar Learning
by: Wang, Mingjie, et al.
Published: (2024)
by: Wang, Mingjie, et al.
Published: (2024)
CLIP-driven Zero-shot Learning with Ambiguous Labels
by: Fan, Jinfu, et al.
Published: (2026)
by: Fan, Jinfu, et al.
Published: (2026)
Graph-guided Cross-composition Feature Disentanglement for Compositional Zero-shot Learning
by: Geng, Yuxia, et al.
Published: (2024)
by: Geng, Yuxia, et al.
Published: (2024)
Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models
by: Xing, Songlong, et al.
Published: (2026)
by: Xing, Songlong, et al.
Published: (2026)
Locate-Then-Examine: Grounded Region Reasoning Improves Detection of AI-Generated Images
by: Ji, Yikun, et al.
Published: (2025)
by: Ji, Yikun, et al.
Published: (2025)
PSVMA+: Exploring Multi-granularity Semantic-visual Adaption for Generalized Zero-shot Learning
by: Liu, Man, et al.
Published: (2024)
by: Liu, Man, et al.
Published: (2024)
COCO-Inpaint: A Benchmark for Detecting and Localizing Inpainting-Based Image Manipulations
by: Yan, Haozhen, et al.
Published: (2025)
by: Yan, Haozhen, et al.
Published: (2025)
GAMMA: Generalizable Alignment via Multi-task and Manipulation-Augmented Training for AI-Generated Image Detection
by: Yan, Haozhen, et al.
Published: (2025)
by: Yan, Haozhen, et al.
Published: (2025)
Dynamic Visual-semantic Alignment for Zero-shot Learning with Ambiguous Labels
by: Li, Jiangnan, et al.
Published: (2026)
by: Li, Jiangnan, et al.
Published: (2026)
Boosting Zero-shot Stereo Matching using Large-scale Mixed Images Sources in the Real World
by: Wang, Yuran, et al.
Published: (2025)
by: Wang, Yuran, et al.
Published: (2025)
Veritas: Generalizable Deepfake Detection via Pattern-Aware Reasoning
by: Tan, Hao, et al.
Published: (2025)
by: Tan, Hao, et al.
Published: (2025)
OAD-Promoter: Enhancing Zero-shot VQA using Large Language Models with Object Attribute Description
by: Xu, Quanxing, et al.
Published: (2025)
by: Xu, Quanxing, et al.
Published: (2025)
OmniZip: Audio-Guided Dynamic Token Compression for Fast Omnimodal Large Language Models
by: Tao, Keda, et al.
Published: (2025)
by: Tao, Keda, et al.
Published: (2025)
Benchmarking Vision-Language and Multimodal Large Language Models in Zero-shot and Few-shot Scenarios: A study on Christian Iconography
by: Spinaci, Gianmarco, et al.
Published: (2025)
by: Spinaci, Gianmarco, et al.
Published: (2025)
EchoingPixels: Cross-Modal Adaptive Token Reduction for Efficient Audio-Visual LLMs
by: Gong, Chao, et al.
Published: (2025)
by: Gong, Chao, et al.
Published: (2025)
Zero-shot Action Localization via the Confidence of Large Vision-Language Models
by: Aklilu, Josiah, et al.
Published: (2024)
by: Aklilu, Josiah, et al.
Published: (2024)
Similar Items
-
Conditional Prototype Rectification Prompt Learning
by: Chen, Haoxing, et al.
Published: (2024) -
DeMamba: AI-Generated Video Detection on Million-Scale GenVideo Benchmark
by: Chen, Haoxing, et al.
Published: (2024) -
Efficient Transfer Learning for Video-language Foundation Models
by: Chen, Haoxing, et al.
Published: (2024) -
Stochastic Layer-Wise Shuffle for Improving Vision Mamba Training
by: Huang, Zizheng, et al.
Published: (2024) -
Supervised Contrastive Learning for Snapshot Spectral Imaging Face Anti-Spoofing
by: Song, Chuanbiao, et al.
Published: (2024)