CLIP Can Understand Depth
Fuente:
arXiv
Salvato in:
| Autori principali: | Kim, Sohee, Kang, Jisu, Kim, Dunam, Lee, Seokju |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
AAPL: Adding Attributes to Prompt Learning for Vision-Language Models
di: Kim, Gahyeon, et al.
Pubblicazione: (2024)
di: Kim, Gahyeon, et al.
Pubblicazione: (2024)
Decoupling Augmentation Bias in Prompt Learning for Vision-Language Models
di: Kim, Gahyeon, et al.
Pubblicazione: (2025)
di: Kim, Gahyeon, et al.
Pubblicazione: (2025)
FFNet: MetaMixer-based Efficient Convolutional Mixer Design
di: Yun, Seokju, et al.
Pubblicazione: (2024)
di: Yun, Seokju, et al.
Pubblicazione: (2024)
TopP&R: Robust Support Estimation Approach for Evaluating Fidelity and Diversity in Generative Models
di: Kim, Pum Jun, et al.
Pubblicazione: (2023)
di: Kim, Pum Jun, et al.
Pubblicazione: (2023)
Memorization In Stable Diffusion Is Unexpectedly Driven by CLIP Embeddings
di: Kim, Bumjun, et al.
Pubblicazione: (2026)
di: Kim, Bumjun, et al.
Pubblicazione: (2026)
Fine-tuning CLIP Text Encoders with Two-step Paraphrasing
di: Kim, Hyunjae, et al.
Pubblicazione: (2024)
di: Kim, Hyunjae, et al.
Pubblicazione: (2024)
CellCLIP -- Learning Perturbation Effects in Cell Painting via Text-Guided Contrastive Learning
di: Lu, Mingyu, et al.
Pubblicazione: (2025)
di: Lu, Mingyu, et al.
Pubblicazione: (2025)
Captured by Captions: On Memorization and its Mitigation in CLIP Models
di: Wang, Wenhao, et al.
Pubblicazione: (2025)
di: Wang, Wenhao, et al.
Pubblicazione: (2025)
Look Every Frame All at Once: Video-Ma$^2$mba for Efficient Long-form Video Understanding with Multi-Axis Gradient Checkpointing
di: Lee, Hosu, et al.
Pubblicazione: (2024)
di: Lee, Hosu, et al.
Pubblicazione: (2024)
Can LLMs Deceive CLIP? Benchmarking Adversarial Compositionality of Pre-trained Multimodal Representation via Text Updates
di: Ahn, Jaewoo, et al.
Pubblicazione: (2025)
di: Ahn, Jaewoo, et al.
Pubblicazione: (2025)
Learning Generalizable Prompt for CLIP with Class Similarity Knowledge
di: Jung, Sehun, et al.
Pubblicazione: (2025)
di: Jung, Sehun, et al.
Pubblicazione: (2025)
DiffCLIP: Differential Attention Meets CLIP
di: Hammoud, Hasan Abed Al Kader, et al.
Pubblicazione: (2025)
di: Hammoud, Hasan Abed Al Kader, et al.
Pubblicazione: (2025)
CountCLIP -- [Re] Teaching CLIP to Count to Ten
di: Mestha, Harshvardhan, et al.
Pubblicazione: (2024)
di: Mestha, Harshvardhan, et al.
Pubblicazione: (2024)
TripleSumm: Adaptive Triple-Modality Fusion for Video Summarization
di: Kim, Sumin, et al.
Pubblicazione: (2026)
di: Kim, Sumin, et al.
Pubblicazione: (2026)
JUDO: A Juxtaposed Domain-Oriented Multimodal Reasoner for Industrial Anomaly QA
di: Kang, Hyunju, et al.
Pubblicazione: (2026)
di: Kang, Hyunju, et al.
Pubblicazione: (2026)
SeMoBridge: Semantic Modality Bridge for Efficient Few-Shot Adaptation of CLIP
di: Timmermann, Christoph, et al.
Pubblicazione: (2025)
di: Timmermann, Christoph, et al.
Pubblicazione: (2025)
WalkCLIP: Multimodal Learning for Urban Walkability Prediction
di: Xiang, Shilong, et al.
Pubblicazione: (2025)
di: Xiang, Shilong, et al.
Pubblicazione: (2025)
SynthCLIP: Are We Ready for a Fully Synthetic CLIP Training?
di: Hammoud, Hasan Abed Al Kader, et al.
Pubblicazione: (2024)
di: Hammoud, Hasan Abed Al Kader, et al.
Pubblicazione: (2024)
VeCLIP: Improving CLIP Training via Visual-enriched Captions
di: Lai, Zhengfeng, et al.
Pubblicazione: (2023)
di: Lai, Zhengfeng, et al.
Pubblicazione: (2023)
Composition Vision-Language Understanding via Segment and Depth Anything Model
di: Huo, Mingxiao, et al.
Pubblicazione: (2024)
di: Huo, Mingxiao, et al.
Pubblicazione: (2024)
Extending Foundational Monocular Depth Estimators to Fisheye Cameras with Calibration Tokens
di: Gangopadhyay, Suchisrit, et al.
Pubblicazione: (2025)
di: Gangopadhyay, Suchisrit, et al.
Pubblicazione: (2025)
Diffusion-Based Offline RL for Improved Decision-Making in Augmented ARC Task
di: Kim, Yunho, et al.
Pubblicazione: (2024)
di: Kim, Yunho, et al.
Pubblicazione: (2024)
ERGO: Efficient High-Resolution Visual Understanding for Vision-Language Models
di: Lee, Jewon, et al.
Pubblicazione: (2025)
di: Lee, Jewon, et al.
Pubblicazione: (2025)
VG3T: Visual Geometry Grounded Gaussian Transformer
di: Kim, Junho, et al.
Pubblicazione: (2025)
di: Kim, Junho, et al.
Pubblicazione: (2025)
An Image Grid Can Be Worth a Video: Zero-shot Video Question Answering Using a VLM
di: Kim, Wonkyun, et al.
Pubblicazione: (2024)
di: Kim, Wonkyun, et al.
Pubblicazione: (2024)
Variational Partial Group Convolutions for Input-Aware Partial Equivariance of Rotations and Color-Shifts
di: Kim, Hyunsu, et al.
Pubblicazione: (2024)
di: Kim, Hyunsu, et al.
Pubblicazione: (2024)
Where and How to Perturb: On the Design of Perturbation Guidance in Diffusion and Flow Models
di: Ahn, Donghoon, et al.
Pubblicazione: (2025)
di: Ahn, Donghoon, et al.
Pubblicazione: (2025)
FedWSQ: Efficient Federated Learning with Weight Standardization and Distribution-Aware Non-Uniform Quantization
di: Kim, Seung-Wook, et al.
Pubblicazione: (2025)
di: Kim, Seung-Wook, et al.
Pubblicazione: (2025)
ECOR: Explainable CLIP for Object Recognition
di: Rasekh, Ali, et al.
Pubblicazione: (2024)
di: Rasekh, Ali, et al.
Pubblicazione: (2024)
Interpreting Attention Heads for Image-to-Text Information Flow in Large Vision-Language Models
di: Kim, Jinyeong, et al.
Pubblicazione: (2025)
di: Kim, Jinyeong, et al.
Pubblicazione: (2025)
Interpreting CLIP with Hierarchical Sparse Autoencoders
di: Zaigrajew, Vladimir, et al.
Pubblicazione: (2025)
di: Zaigrajew, Vladimir, et al.
Pubblicazione: (2025)
Learning to Explore for Stochastic Gradient MCMC
di: Kim, SeungHyun, et al.
Pubblicazione: (2024)
di: Kim, SeungHyun, et al.
Pubblicazione: (2024)
LLM-CXR: Instruction-Finetuned LLM for CXR Image Understanding and Generation
di: Lee, Suhyeon, et al.
Pubblicazione: (2023)
di: Lee, Suhyeon, et al.
Pubblicazione: (2023)
Cross-Domain Synthetic-to-Real In-the-Wild Depth and Normal Estimation for 3D Scene Understanding
di: Bhanushali, Jay, et al.
Pubblicazione: (2022)
di: Bhanushali, Jay, et al.
Pubblicazione: (2022)
Implicit Inversion turns CLIP into a Decoder
di: D'Orazio, Antonio, et al.
Pubblicazione: (2025)
di: D'Orazio, Antonio, et al.
Pubblicazione: (2025)
Steering CLIP's vision transformer with sparse autoencoders
di: Joseph, Sonia, et al.
Pubblicazione: (2025)
di: Joseph, Sonia, et al.
Pubblicazione: (2025)
IDEA: Image Description Enhanced CLIP-Adapter
di: Ye, Zhipeng, et al.
Pubblicazione: (2025)
di: Ye, Zhipeng, et al.
Pubblicazione: (2025)
Constant Acceleration Flow
di: Park, Dogyun, et al.
Pubblicazione: (2024)
di: Park, Dogyun, et al.
Pubblicazione: (2024)
Domain-Invariant Per-Frame Feature Extraction for Cross-Domain Imitation Learning with Visual Observations
di: Kim, Minung, et al.
Pubblicazione: (2025)
di: Kim, Minung, et al.
Pubblicazione: (2025)
DiffBlender: Composable and Versatile Multimodal Text-to-Image Diffusion Models
di: Kim, Sungnyun, et al.
Pubblicazione: (2023)
di: Kim, Sungnyun, et al.
Pubblicazione: (2023)
Documenti analoghi
-
AAPL: Adding Attributes to Prompt Learning for Vision-Language Models
di: Kim, Gahyeon, et al.
Pubblicazione: (2024) -
Decoupling Augmentation Bias in Prompt Learning for Vision-Language Models
di: Kim, Gahyeon, et al.
Pubblicazione: (2025) -
FFNet: MetaMixer-based Efficient Convolutional Mixer Design
di: Yun, Seokju, et al.
Pubblicazione: (2024) -
TopP&R: Robust Support Estimation Approach for Evaluating Fidelity and Diversity in Generative Models
di: Kim, Pum Jun, et al.
Pubblicazione: (2023) -
Memorization In Stable Diffusion Is Unexpectedly Driven by CLIP Embeddings
di: Kim, Bumjun, et al.
Pubblicazione: (2026)