Troika: Multi-Path Cross-Modal Traction for Compositional Zero-Shot Learning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Huang, Siteng, Gong, Biao, Feng, Yutong, Zhang, Min, Lv, Yiliang, Wang, Donglin |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Focus-Consistent Multi-Level Aggregation for Compositional Zero-Shot Learning
par: Dai, Fengyuan, et autres
Publié: (2024)
par: Dai, Fengyuan, et autres
Publié: (2024)
Learning Disentangled Identifiers for Action-Customized Text-to-Image Generation
par: Huang, Siteng, et autres
Publié: (2023)
par: Huang, Siteng, et autres
Publié: (2023)
Cobra: Extending Mamba to Multi-Modal Large Language Model for Efficient Inference
par: Zhao, Han, et autres
Publié: (2024)
par: Zhao, Han, et autres
Publié: (2024)
Check, Locate, Rectify: A Training-Free Layout Calibration System for Text-to-Image Generation
par: Gong, Biao, et autres
Publié: (2023)
par: Gong, Biao, et autres
Publié: (2023)
Multi-Level Correlation Network For Few-Shot Image Classification
par: Dang, Yunkai, et autres
Publié: (2024)
par: Dang, Yunkai, et autres
Publié: (2024)
VGDiffZero: Text-to-image Diffusion Models Can Be Zero-shot Visual Grounders
par: Liu, Xuyang, et autres
Publié: (2023)
par: Liu, Xuyang, et autres
Publié: (2023)
Is Extending Modality The Right Path Towards Omni-Modality?
par: Zhu, Tinghui, et autres
Publié: (2025)
par: Zhu, Tinghui, et autres
Publié: (2025)
Shared and Private Information Learning in Multimodal Sentiment Analysis with Deep Modal Alignment and Self-supervised Multi-Task Learning
par: Lai, Songning, et autres
Publié: (2023)
par: Lai, Songning, et autres
Publié: (2023)
M2IST: Multi-Modal Interactive Side-Tuning for Efficient Referring Expression Comprehension
par: Liu, Xuyang, et autres
Publié: (2024)
par: Liu, Xuyang, et autres
Publié: (2024)
TikZero: Zero-Shot Text-Guided Graphics Program Synthesis
par: Belouadi, Jonas, et autres
Publié: (2025)
par: Belouadi, Jonas, et autres
Publié: (2025)
Enhancing Chest X-ray Classification through Knowledge Injection in Cross-Modality Learning
par: Yan, Yang, et autres
Publié: (2025)
par: Yan, Yang, et autres
Publié: (2025)
Large Multilingual Models Pivot Zero-Shot Multimodal Learning across Languages
par: Hu, Jinyi, et autres
Publié: (2023)
par: Hu, Jinyi, et autres
Publié: (2023)
Zero-Shot Action Recognition in Surveillance Videos
par: Pereira, Joao, et autres
Publié: (2024)
par: Pereira, Joao, et autres
Publié: (2024)
Deciphering Cross-Modal Alignment in Large Vision-Language Models with Modality Integration Rate
par: Huang, Qidong, et autres
Publié: (2024)
par: Huang, Qidong, et autres
Publié: (2024)
RadZero: Similarity-Based Cross-Attention for Explainable Vision-Language Alignment in Chest X-ray with Zero-Shot Multi-Task Capability
par: Park, Jonggwon, et autres
Publié: (2025)
par: Park, Jonggwon, et autres
Publié: (2025)
PiTe: Pixel-Temporal Alignment for Large Video-Language Model
par: Liu, Yang, et autres
Publié: (2024)
par: Liu, Yang, et autres
Publié: (2024)
Few-Shot Relation Extraction with Hybrid Visual Evidence
par: Gong, Jiaying, et autres
Publié: (2024)
par: Gong, Jiaying, et autres
Publié: (2024)
CAMS: Towards Compositional Zero-Shot Learning via Gated Cross-Attention and Multi-Space Disentanglement
par: Yang, Pan, et autres
Publié: (2025)
par: Yang, Pan, et autres
Publié: (2025)
Multi-Modal Multi-Granularity Tokenizer for Chu Bamboo Slip Scripts
par: Chen, Yingfa, et autres
Publié: (2024)
par: Chen, Yingfa, et autres
Publié: (2024)
CMAP: Cross-Modal Adaptive Prompting for Multi-Domain Task-Incremental Learning
par: Mandalika, Sriram
Publié: (2026)
par: Mandalika, Sriram
Publié: (2026)
MMGR: Multi-Modal Generative Reasoning
par: Cai, Zefan, et autres
Publié: (2025)
par: Cai, Zefan, et autres
Publié: (2025)
Learning Adaptive Reasoning Paths for Efficient Visual Reasoning
par: Huang, Yixu, et autres
Publié: (2026)
par: Huang, Yixu, et autres
Publié: (2026)
Investigating Prompting Techniques for Zero- and Few-Shot Visual Question Answering
par: Awal, Rabiul, et autres
Publié: (2023)
par: Awal, Rabiul, et autres
Publié: (2023)
Open-Source Image Editing Models Are Zero-Shot Vision Learners
par: Liu, Wei, et autres
Publié: (2026)
par: Liu, Wei, et autres
Publié: (2026)
Leveraging Entity Information for Cross-Modality Correlation Learning: The Entity-Guided Multimodal Summarization
par: Zhang, Yanghai, et autres
Publié: (2024)
par: Zhang, Yanghai, et autres
Publié: (2024)
ZALM3: Zero-Shot Enhancement of Vision-Language Alignment via In-Context Information in Multi-Turn Multimodal Medical Dialogue
par: Li, Zhangpu, et autres
Publié: (2024)
par: Li, Zhangpu, et autres
Publié: (2024)
ProFD: Prompt-Guided Feature Disentangling for Occluded Person Re-Identification
par: Cui, Can, et autres
Publié: (2024)
par: Cui, Can, et autres
Publié: (2024)
Zero-Shot Scene Understanding with Multimodal Large Language Models for Automated Vehicles
par: Elhenawy, Mohammed, et autres
Publié: (2025)
par: Elhenawy, Mohammed, et autres
Publié: (2025)
Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models
par: Xu, Jiacong, et autres
Publié: (2025)
par: Xu, Jiacong, et autres
Publié: (2025)
Spectral Prompt Tuning:Unveiling Unseen Classes for Zero-Shot Semantic Segmentation
par: Xu, Wenhao, et autres
Publié: (2023)
par: Xu, Wenhao, et autres
Publié: (2023)
Prompting Language-Informed Distribution for Compositional Zero-Shot Learning
par: Bao, Wentao, et autres
Publié: (2023)
par: Bao, Wentao, et autres
Publié: (2023)
Cross-Modal Adapter for Vision-Language Retrieval
par: Jiang, Haojun, et autres
Publié: (2022)
par: Jiang, Haojun, et autres
Publié: (2022)
TOMCAT: Test-time Comprehensive Knowledge Accumulation for Compositional Zero-Shot Learning
par: Yan, Xudong, et autres
Publié: (2025)
par: Yan, Xudong, et autres
Publié: (2025)
What Factors Affect Multi-Modal In-Context Learning? An In-Depth Exploration
par: Qin, Libo, et autres
Publié: (2024)
par: Qin, Libo, et autres
Publié: (2024)
Prompt-based Distribution Alignment for Unsupervised Domain Adaptation
par: Bai, Shuanghao, et autres
Publié: (2023)
par: Bai, Shuanghao, et autres
Publié: (2023)
MotionGPT3: Human Motion as a Second Modality
par: Zhu, Bingfan, et autres
Publié: (2025)
par: Zhu, Bingfan, et autres
Publié: (2025)
A Theory-Inspired Framework for Few-Shot Cross-Modal Sketch Person Re-Identification
par: Gong, Yunpeng, et autres
Publié: (2025)
par: Gong, Yunpeng, et autres
Publié: (2025)
Towards Zero-Shot Annotation of the Built Environment with Vision-Language Models (Vision Paper)
par: Han, Bin, et autres
Publié: (2024)
par: Han, Bin, et autres
Publié: (2024)
Prompt-Induced Score Variance in Zero-Shot Binary Vision-Language Safety Classification
par: Weng, Charles, et autres
Publié: (2026)
par: Weng, Charles, et autres
Publié: (2026)
InstructDoc: A Dataset for Zero-Shot Generalization of Visual Document Understanding with Instructions
par: Tanaka, Ryota, et autres
Publié: (2024)
par: Tanaka, Ryota, et autres
Publié: (2024)
Documents similaires
-
Focus-Consistent Multi-Level Aggregation for Compositional Zero-Shot Learning
par: Dai, Fengyuan, et autres
Publié: (2024) -
Learning Disentangled Identifiers for Action-Customized Text-to-Image Generation
par: Huang, Siteng, et autres
Publié: (2023) -
Cobra: Extending Mamba to Multi-Modal Large Language Model for Efficient Inference
par: Zhao, Han, et autres
Publié: (2024) -
Check, Locate, Rectify: A Training-Free Layout Calibration System for Text-to-Image Generation
par: Gong, Biao, et autres
Publié: (2023) -
Multi-Level Correlation Network For Few-Shot Image Classification
par: Dang, Yunkai, et autres
Publié: (2024)