Cross-Modal Self-Training: Aligning Images and Pointclouds to Learn Classification without Labels
Fuente:
arXiv
Salvato in:
| Autori principali: | Dharmasiri, Amaya, Naseer, Muzammal, Khan, Salman, Khan, Fahad Shahbaz |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Language Guided Domain Generalized Medical Image Segmentation
di: Kunhimon, Shahina, et al.
Pubblicazione: (2024)
di: Kunhimon, Shahina, et al.
Pubblicazione: (2024)
UniMed-CLIP: Towards a Unified Image-Text Pretraining Paradigm for Diverse Medical Imaging Modalities
di: Khattak, Muhammad Uzair, et al.
Pubblicazione: (2024)
di: Khattak, Muhammad Uzair, et al.
Pubblicazione: (2024)
Hierarchical Self-Supervised Adversarial Training for Robust Vision Models in Histopathology
di: Malik, Hashmat Shadab, et al.
Pubblicazione: (2025)
di: Malik, Hashmat Shadab, et al.
Pubblicazione: (2025)
VURF: A General-purpose Reasoning and Self-refinement Framework for Video Understanding
di: Mahmood, Ahmad, et al.
Pubblicazione: (2024)
di: Mahmood, Ahmad, et al.
Pubblicazione: (2024)
Hierarchical Text-to-Vision Self Supervised Alignment for Improved Histopathology Representation Learning
di: Watawana, Hasindri, et al.
Pubblicazione: (2024)
di: Watawana, Hasindri, et al.
Pubblicazione: (2024)
Enhancing Novel Object Detection via Cooperative Foundational Models
di: Bharadwaj, Rohit, et al.
Pubblicazione: (2023)
di: Bharadwaj, Rohit, et al.
Pubblicazione: (2023)
VANE-Bench: Video Anomaly Evaluation Benchmark for Conversational LMMs
di: Bharadwaj, Rohit, et al.
Pubblicazione: (2024)
di: Bharadwaj, Rohit, et al.
Pubblicazione: (2024)
Learnable Weight Initialization for Volumetric Medical Image Segmentation
di: Kunhimon, Shahina, et al.
Pubblicazione: (2023)
di: Kunhimon, Shahina, et al.
Pubblicazione: (2023)
MedContext: Learning Contextual Cues for Efficient Volumetric Medical Segmentation
di: Gani, Hanan, et al.
Pubblicazione: (2024)
di: Gani, Hanan, et al.
Pubblicazione: (2024)
Towards Evaluating the Robustness of Visual State Space Models
di: Malik, Hashmat Shadab, et al.
Pubblicazione: (2024)
di: Malik, Hashmat Shadab, et al.
Pubblicazione: (2024)
Align Your Prompts: Test-Time Prompting with Distribution Alignment for Zero-Shot Generalization
di: Hassan, Jameel, et al.
Pubblicazione: (2023)
di: Hassan, Jameel, et al.
Pubblicazione: (2023)
Video-GroundingDINO: Towards Open-Vocabulary Spatio-Temporal Video Grounding
di: Wasim, Syed Talal, et al.
Pubblicazione: (2023)
di: Wasim, Syed Talal, et al.
Pubblicazione: (2023)
ObjectCompose: Evaluating Resilience of Vision-Based Models on Object-to-Background Compositional Changes
di: Malik, Hashmat Shadab, et al.
Pubblicazione: (2024)
di: Malik, Hashmat Shadab, et al.
Pubblicazione: (2024)
Robust-LLaVA: On the Effectiveness of Large-Scale Robust Image Encoders for Multi-modal Large Language Models
di: Malik, Hashmat Shadab, et al.
Pubblicazione: (2025)
di: Malik, Hashmat Shadab, et al.
Pubblicazione: (2025)
Rethinking Transformers Pre-training for Multi-Spectral Satellite Imagery
di: Noman, Mubashir, et al.
Pubblicazione: (2024)
di: Noman, Mubashir, et al.
Pubblicazione: (2024)
BAPLe: Backdoor Attacks on Medical Foundational Models using Prompt Learning
di: Hanif, Asif, et al.
Pubblicazione: (2024)
di: Hanif, Asif, et al.
Pubblicazione: (2024)
Interpretable Zero-Shot Learning with Locally-Aligned Vision-Language Model
di: Chen, Shiming, et al.
Pubblicazione: (2025)
di: Chen, Shiming, et al.
Pubblicazione: (2025)
Multi-modal Generation via Cross-Modal In-Context Learning
di: Kumar, Amandeep, et al.
Pubblicazione: (2024)
di: Kumar, Amandeep, et al.
Pubblicazione: (2024)
Composed Video Retrieval via Enriched Context and Discriminative Embeddings
di: Thawakar, Omkar, et al.
Pubblicazione: (2024)
di: Thawakar, Omkar, et al.
Pubblicazione: (2024)
CDChat: A Large Multimodal Model for Remote Sensing Change Description
di: Noman, Mubashir, et al.
Pubblicazione: (2024)
di: Noman, Mubashir, et al.
Pubblicazione: (2024)
AgriCLIP: Adapting CLIP for Agriculture and Livestock via Domain-Specialized Cross-Model Alignment
di: Nawaz, Umair, et al.
Pubblicazione: (2024)
di: Nawaz, Umair, et al.
Pubblicazione: (2024)
How Good is my Video LMM? Complex Video Reasoning and Robustness Evaluation Suite for Video-LMMs
di: Khattak, Muhammad Uzair, et al.
Pubblicazione: (2024)
di: Khattak, Muhammad Uzair, et al.
Pubblicazione: (2024)
Multi-Granularity Language-Guided Training for Multi-Object Tracking
di: Li, Yuhao, et al.
Pubblicazione: (2024)
di: Li, Yuhao, et al.
Pubblicazione: (2024)
On Evaluating Adversarial Robustness of Volumetric Medical Segmentation Models
di: Malik, Hashmat Shadab, et al.
Pubblicazione: (2024)
di: Malik, Hashmat Shadab, et al.
Pubblicazione: (2024)
LLM Blueprint: Enabling Text-to-Image Generation with Complex and Detailed Prompts
di: Gani, Hanan, et al.
Pubblicazione: (2023)
di: Gani, Hanan, et al.
Pubblicazione: (2023)
Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models
di: Maaz, Muhammad, et al.
Pubblicazione: (2023)
di: Maaz, Muhammad, et al.
Pubblicazione: (2023)
Video-R2: Reinforcing Consistent and Grounded Reasoning in Multimodal Language Models
di: Maaz, Muhammad, et al.
Pubblicazione: (2025)
di: Maaz, Muhammad, et al.
Pubblicazione: (2025)
Progressive Semantic-Guided Vision Transformer for Zero-Shot Learning
di: Chen, Shiming, et al.
Pubblicazione: (2024)
di: Chen, Shiming, et al.
Pubblicazione: (2024)
GenZSL: Generative Zero-Shot Learning Via Inductive Variational Autoencoder
di: Chen, Shiming, et al.
Pubblicazione: (2025)
di: Chen, Shiming, et al.
Pubblicazione: (2025)
Discriminative Image Generation with Diffusion Models for Zero-Shot Learning
di: Fu, Dingjie, et al.
Pubblicazione: (2024)
di: Fu, Dingjie, et al.
Pubblicazione: (2024)
MedROV: Towards Real-Time Open-Vocabulary Detection Across Diverse Medical Imaging Modalities
di: Sheikh, Tooba Tehreem, et al.
Pubblicazione: (2025)
di: Sheikh, Tooba Tehreem, et al.
Pubblicazione: (2025)
Makeup-Guided Facial Privacy Protection via Untrained Neural Network Priors
di: Shamshad, Fahad, et al.
Pubblicazione: (2024)
di: Shamshad, Fahad, et al.
Pubblicazione: (2024)
ELGC-Net: Efficient Local-Global Context Aggregation for Remote Sensing Change Detection
di: Noman, Mubashir, et al.
Pubblicazione: (2024)
di: Noman, Mubashir, et al.
Pubblicazione: (2024)
Vocabulary-free Fine-grained Visual Recognition via Enriched Contextually Grounded Vision-Language Model
di: Demidov, Dmitry, et al.
Pubblicazione: (2025)
di: Demidov, Dmitry, et al.
Pubblicazione: (2025)
DEFT: Decompositional Efficient Fine-Tuning for Text-to-Image Models
di: Kumar, Komal, et al.
Pubblicazione: (2025)
di: Kumar, Komal, et al.
Pubblicazione: (2025)
Efficient Video Object Segmentation via Modulated Cross-Attention Memory
di: Shaker, Abdelrahman, et al.
Pubblicazione: (2024)
di: Shaker, Abdelrahman, et al.
Pubblicazione: (2024)
UNETR++: Delving into Efficient and Accurate 3D Medical Image Segmentation
di: Shaker, Abdelrahman, et al.
Pubblicazione: (2022)
di: Shaker, Abdelrahman, et al.
Pubblicazione: (2022)
AdaIR: Adaptive All-in-One Image Restoration via Frequency Mining and Modulation
di: Cui, Yuning, et al.
Pubblicazione: (2024)
di: Cui, Yuning, et al.
Pubblicazione: (2024)
GroupMamba: Efficient Group-Based Visual State Space Model
di: Shaker, Abdelrahman, et al.
Pubblicazione: (2024)
di: Shaker, Abdelrahman, et al.
Pubblicazione: (2024)
RainDiff: End-to-end Precipitation Nowcasting Via Token-wise Attention Diffusion
di: Nguyen, Thao, et al.
Pubblicazione: (2025)
di: Nguyen, Thao, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Language Guided Domain Generalized Medical Image Segmentation
di: Kunhimon, Shahina, et al.
Pubblicazione: (2024) -
UniMed-CLIP: Towards a Unified Image-Text Pretraining Paradigm for Diverse Medical Imaging Modalities
di: Khattak, Muhammad Uzair, et al.
Pubblicazione: (2024) -
Hierarchical Self-Supervised Adversarial Training for Robust Vision Models in Histopathology
di: Malik, Hashmat Shadab, et al.
Pubblicazione: (2025) -
VURF: A General-purpose Reasoning and Self-refinement Framework for Video Understanding
di: Mahmood, Ahmad, et al.
Pubblicazione: (2024) -
Hierarchical Text-to-Vision Self Supervised Alignment for Improved Histopathology Representation Learning
di: Watawana, Hasindri, et al.
Pubblicazione: (2024)