CLAY: Conditional Visual Similarity Modulation in Vision-Language Embedding Space
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lim, Sohwi, Hyoseok, Lee, Park, Jungjoon, Oh, Tae-Hyun |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Measurement-Consistent Langevin Corrector for Stabilizing Latent Diffusion Inverse Problem Solvers
par: Hyoseok, Lee, et autres
Publié: (2026)
par: Hyoseok, Lee, et autres
Publié: (2026)
ESC: Erasing Space Concept for Knowledge Deletion
par: Lee, Tae-Young, et autres
Publié: (2025)
par: Lee, Tae-Young, et autres
Publié: (2025)
VLM's Eye Examination: Instruct and Inspect Visual Competency of Vision Language Models
par: Hyeon-Woo, Nam, et autres
Publié: (2024)
par: Hyeon-Woo, Nam, et autres
Publié: (2024)
JointDiT: Enhancing RGB-Depth Joint Modeling with Diffusion Transformers
par: Byung-Ki, Kwon, et autres
Publié: (2025)
par: Byung-Ki, Kwon, et autres
Publié: (2025)
DarkQA: Benchmarking Vision-Language Models on Visual-Primitive Question Answering in Low-Light Indoor Scenes
par: Park, Yohan, et autres
Publié: (2025)
par: Park, Yohan, et autres
Publié: (2025)
LINGO-Space: Language-Conditioned Incremental Grounding for Space
par: Kim, Dohyun, et autres
Publié: (2024)
par: Kim, Dohyun, et autres
Publié: (2024)
SiNGER: A Clearer Voice Distills Vision Transformers Further
par: Yu, Geunhyeok, et autres
Publié: (2025)
par: Yu, Geunhyeok, et autres
Publié: (2025)
Skill-Conditioned Visual Geolocation for Vision-Language Models
par: Yang, Chenjie, et autres
Publié: (2026)
par: Yang, Chenjie, et autres
Publié: (2026)
ELITE: Efficient Gaussian Head Avatar from a Monocular Video via Learned Initialization and TEst-time Generative Adaptation
par: Youwang, Kim, et autres
Publié: (2026)
par: Youwang, Kim, et autres
Publié: (2026)
Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models
par: Chae, Hyunsik, et autres
Publié: (2025)
par: Chae, Hyunsik, et autres
Publié: (2025)
MUSE: Model-based Uncertainty-aware Similarity Estimation for zero-shot 2D Object Detection and Segmentation
par: Cho, Sungmin, et autres
Publié: (2025)
par: Cho, Sungmin, et autres
Publié: (2025)
mEOL: Training-Free Instruction-Guided Multimodal Embedder for Vector Graphics and Image Retrieval
par: Kim, Kyeong Seon, et autres
Publié: (2026)
par: Kim, Kyeong Seon, et autres
Publié: (2026)
Early Failure Detection and Intervention in Video Diffusion Models
par: Byung-Ki, Kwon, et autres
Publié: (2026)
par: Byung-Ki, Kwon, et autres
Publié: (2026)
Cure or Poison? Embedding Instructions Visually Alters Hallucination in Vision-Language Models
par: Wang, Zhaochen, et autres
Publié: (2025)
par: Wang, Zhaochen, et autres
Publié: (2025)
Nomic Embed Vision: Expanding the Latent Space
par: Nussbaum, Zach, et autres
Publié: (2024)
par: Nussbaum, Zach, et autres
Publié: (2024)
ERGO: Efficient High-Resolution Visual Understanding for Vision-Language Models
par: Lee, Jewon, et autres
Publié: (2025)
par: Lee, Jewon, et autres
Publié: (2025)
Scratching Visual Transformer's Back with Uniform Attention
par: Hyeon-Woo, Nam, et autres
Publié: (2022)
par: Hyeon-Woo, Nam, et autres
Publié: (2022)
Zero-shot Depth Completion via Test-time Alignment with Affine-invariant Depth Prior
par: Hyoseok, Lee, et autres
Publié: (2025)
par: Hyoseok, Lee, et autres
Publié: (2025)
FacEDiT: Unified Talking Face Editing and Generation via Facial Motion Infilling
par: Sung-Bin, Kim, et autres
Publié: (2025)
par: Sung-Bin, Kim, et autres
Publié: (2025)
FPRF: Feed-Forward Photorealistic Style Transfer of Large-Scale 3D Neural Radiance Fields
par: Kim, GeonU, et autres
Publié: (2024)
par: Kim, GeonU, et autres
Publié: (2024)
Paint-it: Text-to-Texture Synthesis via Deep Convolutional Texture Map Optimization and Physically-Based Rendering
par: Youwang, Kim, et autres
Publié: (2023)
par: Youwang, Kim, et autres
Publié: (2023)
Topological Alignment of Shared Vision-Language Embedding Space
par: You, Junwon, et autres
Publié: (2025)
par: You, Junwon, et autres
Publié: (2025)
Unveiling the Response of Large Vision-Language Models to Visually Absent Tokens
par: Kim, Sohee, et autres
Publié: (2025)
par: Kim, Sohee, et autres
Publié: (2025)
VLR-Bench: Multilingual Benchmark Dataset for Vision-Language Retrieval Augmented Generation
par: Lim, Hyeonseok, et autres
Publié: (2024)
par: Lim, Hyeonseok, et autres
Publié: (2024)
Semantic Similarity Score for Measuring Visual Similarity at Semantic Level
par: Fan, Senran, et autres
Publié: (2024)
par: Fan, Senran, et autres
Publié: (2024)
Towards Calibrated Robust Fine-Tuning of Vision-Language Models
par: Oh, Changdae, et autres
Publié: (2023)
par: Oh, Changdae, et autres
Publié: (2023)
Your Embedding Model is SMARTer Than You Think
par: Zhang, Jianrui, et autres
Publié: (2026)
par: Zhang, Jianrui, et autres
Publié: (2026)
Analyzing Diffusion and Autoregressive Vision Language Models in Multimodal Embedding Space
par: Wang, Zihang, et autres
Publié: (2026)
par: Wang, Zihang, et autres
Publié: (2026)
SEM: Sparse Embedding Modulation for Post-Hoc Debiasing of Vision-Language Models
par: Guimard, Quentin, et autres
Publié: (2026)
par: Guimard, Quentin, et autres
Publié: (2026)
Ego: Embedding-Guided Personalization of Vision-Language Models
par: Seifi, Soroush, et autres
Publié: (2026)
par: Seifi, Soroush, et autres
Publié: (2026)
DreamMotion: Space-Time Self-Similar Score Distillation for Zero-Shot Video Editing
par: Jeong, Hyeonho, et autres
Publié: (2024)
par: Jeong, Hyeonho, et autres
Publié: (2024)
VisAgent: Narrative-Preserving Story Visualization Framework
par: Kim, Seungkwon, et autres
Publié: (2025)
par: Kim, Seungkwon, et autres
Publié: (2025)
Local Concept Embeddings for Analysis of Concept Distributions in Vision DNN Feature Spaces
par: Mikriukov, Georgii, et autres
Publié: (2023)
par: Mikriukov, Georgii, et autres
Publié: (2023)
LPOI: Listwise Preference Optimization for Vision Language Models
par: Zadeh, Fatemeh Pesaran, et autres
Publié: (2025)
par: Zadeh, Fatemeh Pesaran, et autres
Publié: (2025)
SurgMLLMBench: A Multimodal Large Language Model Benchmark Dataset for Surgical Scene Understanding
par: Choi, Tae-Min, et autres
Publié: (2025)
par: Choi, Tae-Min, et autres
Publié: (2025)
Relational Visual Similarity
par: Nguyen, Thao, et autres
Publié: (2025)
par: Nguyen, Thao, et autres
Publié: (2025)
Non-Contrastive Vision-Language Learning with Predictive Embedding Alignment
par: Kuhn, Lukas, et autres
Publié: (2026)
par: Kuhn, Lukas, et autres
Publié: (2026)
TCP-SSM: Efficient Vision State Space Models with Token-Conditioned Poles
par: Shoouri, Sara, et autres
Publié: (2026)
par: Shoouri, Sara, et autres
Publié: (2026)
Simple Unsupervised Knowledge Distillation With Space Similarity
par: Singh, Aditya, et autres
Publié: (2024)
par: Singh, Aditya, et autres
Publié: (2024)
Zero-Shot Industrial Anomaly Segmentation with Image-Aware Prompt Generation
par: Park, SoYoung, et autres
Publié: (2025)
par: Park, SoYoung, et autres
Publié: (2025)
Documents similaires
-
Measurement-Consistent Langevin Corrector for Stabilizing Latent Diffusion Inverse Problem Solvers
par: Hyoseok, Lee, et autres
Publié: (2026) -
ESC: Erasing Space Concept for Knowledge Deletion
par: Lee, Tae-Young, et autres
Publié: (2025) -
VLM's Eye Examination: Instruct and Inspect Visual Competency of Vision Language Models
par: Hyeon-Woo, Nam, et autres
Publié: (2024) -
JointDiT: Enhancing RGB-Depth Joint Modeling with Diffusion Transformers
par: Byung-Ki, Kwon, et autres
Publié: (2025) -
DarkQA: Benchmarking Vision-Language Models on Visual-Primitive Question Answering in Low-Light Indoor Scenes
par: Park, Yohan, et autres
Publié: (2025)