Pix2Key: Controllable Open-Vocabulary Retrieval with Semantic Decomposition and Self-Supervised Visual Dictionary Learning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wei, Guoyizhe, Jiao, Yang, Xi, Nan, Huang, Zhishen, Meng, Jingjing, Chellappa, Rama, Gao, Yan |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ViT-Linearizer: Distilling Quadratic Knowledge into Linear-Time Vision Models
par: Wei, Guoyizhe, et autres
Publié: (2025)
par: Wei, Guoyizhe, et autres
Publié: (2025)
Learning to Prompt Your Domain for Vision-Language Models
par: Wei, Guoyizhe, et autres
Publié: (2023)
par: Wei, Guoyizhe, et autres
Publié: (2023)
DiffInf: Influence-Guided Diffusion for Supervision Alignment in Facial Attribute Learning
par: Pal, Basudha, et autres
Publié: (2026)
par: Pal, Basudha, et autres
Publié: (2026)
TOGA: Temporally Grounded Open-Ended Video QA with Weak Supervision
par: Gupta, Ayush, et autres
Publié: (2025)
par: Gupta, Ayush, et autres
Publié: (2025)
PixWizard: Versatile Image-to-Image Visual Assistant with Open-Language Instructions
par: Lin, Weifeng, et autres
Publié: (2024)
par: Lin, Weifeng, et autres
Publié: (2024)
Towards Open-Vocabulary Audio-Visual Event Localization
par: Zhou, Jinxing, et autres
Publié: (2024)
par: Zhou, Jinxing, et autres
Publié: (2024)
Template-based Multi-Domain Face Recognition
par: Nanduri, Anirudh, et autres
Publié: (2024)
par: Nanduri, Anirudh, et autres
Publié: (2024)
MimicGait: A Model Agnostic approach for Occluded Gait Recognition using Correlational Knowledge Distillation
par: Gupta, Ayush, et autres
Publié: (2025)
par: Gupta, Ayush, et autres
Publié: (2025)
CLR-Face: Conditional Latent Refinement for Blind Face Restoration Using Score-Based Diffusion Models
par: Suin, Maitreya, et autres
Publié: (2024)
par: Suin, Maitreya, et autres
Publié: (2024)
Open-Vocabulary Audio-Visual Semantic Segmentation
par: Guo, Ruohao, et autres
Publié: (2024)
par: Guo, Ruohao, et autres
Publié: (2024)
VILLS -- Video-Image Learning to Learn Semantics for Person Re-Identification
par: Huang, Siyuan, et autres
Publié: (2023)
par: Huang, Siyuan, et autres
Publié: (2023)
A Quantitative Evaluation of the Expressivity of BMI, Pose and Gender in Body Embeddings for Recognition and Identification
par: Pal, Basudha, et autres
Publié: (2025)
par: Pal, Basudha, et autres
Publié: (2025)
Mind the Gap: Bridging Occlusion in Gait Recognition via Residual Gap Correction
par: Gupta, Ayush, et autres
Publié: (2025)
par: Gupta, Ayush, et autres
Publié: (2025)
Cross-Spectral Body Recognition with Side Information Embedding: Benchmarks on LLCM and Analyzing Range-Induced Occlusions on IJB-MDF
par: Nanduri, Anirudh, et autres
Publié: (2025)
par: Nanduri, Anirudh, et autres
Publié: (2025)
Multi-Domain Biometric Recognition using Body Embeddings
par: Nanduri, Anirudh, et autres
Publié: (2025)
par: Nanduri, Anirudh, et autres
Publié: (2025)
Unlocking Textual and Visual Wisdom: Open-Vocabulary 3D Object Detection Enhanced by Comprehensive Guidance from Text and Image
par: Jiao, Pengkun, et autres
Publié: (2024)
par: Jiao, Pengkun, et autres
Publié: (2024)
RNN as Linear Transformer: A Closer Investigation into Representational Potentials of Visual Mamba Models
par: Yang, Timing, et autres
Publié: (2025)
par: Yang, Timing, et autres
Publié: (2025)
Structure-Aware Feature Rectification with Region Adjacency Graphs for Training-Free Open-Vocabulary Semantic Segmentation
par: Huang, Qiming, et autres
Publié: (2025)
par: Huang, Qiming, et autres
Publié: (2025)
AttrSeg: Open-Vocabulary Semantic Segmentation via Attribute Decomposition-Aggregation
par: Ma, Chaofan, et autres
Publié: (2023)
par: Ma, Chaofan, et autres
Publié: (2023)
LLMDet: Learning Strong Open-Vocabulary Object Detectors under the Supervision of Large Language Models
par: Fu, Shenghao, et autres
Publié: (2025)
par: Fu, Shenghao, et autres
Publié: (2025)
In Defense of Lazy Visual Grounding for Open-Vocabulary Semantic Segmentation
par: Kang, Dahyun, et autres
Publié: (2024)
par: Kang, Dahyun, et autres
Publié: (2024)
Semantic Library Adaptation: LoRA Retrieval and Fusion for Open-Vocabulary Semantic Segmentation
par: Qorbani, Reza, et autres
Publié: (2025)
par: Qorbani, Reza, et autres
Publié: (2025)
RANKVIDEO: Reasoning Reranking for Text-to-Video Retrieval
par: Skow, Tyler, et autres
Publié: (2026)
par: Skow, Tyler, et autres
Publié: (2026)
A Hierarchical Semantic Distillation Framework for Open-Vocabulary Object Detection
par: Fu, Shenghao, et autres
Publié: (2025)
par: Fu, Shenghao, et autres
Publié: (2025)
Zero-Shot Personalization of Objects via Textual Inversion
par: Roy, Aniket, et autres
Publié: (2026)
par: Roy, Aniket, et autres
Publié: (2026)
FusionRF: High-Fidelity Satellite Neural Radiance Fields from Multispectral and Panchromatic Acquisitions
par: Sprintson, Michael, et autres
Publié: (2024)
par: Sprintson, Michael, et autres
Publié: (2024)
Encoding of Demographic and Anatomical Information in Chest X-Ray-based Severe Left Ventricular Hypertrophy Classifiers
par: Pal, Basudha, et autres
Publié: (2025)
par: Pal, Basudha, et autres
Publié: (2025)
SPIQA: A Dataset for Multimodal Question Answering on Scientific Papers
par: Pramanick, Shraman, et autres
Publié: (2024)
par: Pramanick, Shraman, et autres
Publié: (2024)
Test-Time-Scaling for Zero-Shot Diagnosis with Visual-Language Reasoning
par: Byun, Ji Young, et autres
Publié: (2025)
par: Byun, Ji Young, et autres
Publié: (2025)
From Open-Vocabulary to Vocabulary-Free Semantic Segmentation
par: Reichard, Klara, et autres
Publié: (2025)
par: Reichard, Klara, et autres
Publié: (2025)
An Immersive Multi-Elevation Multi-Seasonal Dataset for 3D Reconstruction and Visualization
par: Liu, Xijun, et autres
Publié: (2024)
par: Liu, Xijun, et autres
Publié: (2024)
Attention to Trajectory: Trajectory-Aware Open-Vocabulary Tracking
par: Li, Yunhao, et autres
Publié: (2025)
par: Li, Yunhao, et autres
Publié: (2025)
Open-Vocabulary Semantic Segmentation with Image Embedding Balancing
par: Shan, Xiangheng, et autres
Publié: (2024)
par: Shan, Xiangheng, et autres
Publié: (2024)
OpenVidVRD: Open-Vocabulary Video Visual Relation Detection via Prompt-Driven Semantic Space Alignment
par: Liu, Qi, et autres
Publié: (2025)
par: Liu, Qi, et autres
Publié: (2025)
Collaborative Vision-Text Representation Optimizing for Open-Vocabulary Segmentation
par: Jiao, Siyu, et autres
Publié: (2024)
par: Jiao, Siyu, et autres
Publié: (2024)
ControlThinker: Unveiling Latent Semantics for Controllable Image Generation through Visual Reasoning
par: Han, Feng, et autres
Publié: (2025)
par: Han, Feng, et autres
Publié: (2025)
LMSeg: Unleashing the Power of Large-Scale Models for Open-Vocabulary Semantic Segmentation
par: Tang, Huadong, et autres
Publié: (2024)
par: Tang, Huadong, et autres
Publié: (2024)
Adapting Vision-Language Model with Fine-grained Semantics for Open-Vocabulary Segmentation
par: Chng, Yong Xien, et autres
Publié: (2024)
par: Chng, Yong Xien, et autres
Publié: (2024)
OpenESS: Event-based Semantic Scene Understanding with Open Vocabularies
par: Kong, Lingdong, et autres
Publié: (2024)
par: Kong, Lingdong, et autres
Publié: (2024)
Improving Visual Discriminability of CLIP for Training-Free Open-Vocabulary Semantic Segmentation
par: Zhou, Jinxin, et autres
Publié: (2025)
par: Zhou, Jinxin, et autres
Publié: (2025)
Documents similaires
-
ViT-Linearizer: Distilling Quadratic Knowledge into Linear-Time Vision Models
par: Wei, Guoyizhe, et autres
Publié: (2025) -
Learning to Prompt Your Domain for Vision-Language Models
par: Wei, Guoyizhe, et autres
Publié: (2023) -
DiffInf: Influence-Guided Diffusion for Supervision Alignment in Facial Attribute Learning
par: Pal, Basudha, et autres
Publié: (2026) -
TOGA: Temporally Grounded Open-Ended Video QA with Weak Supervision
par: Gupta, Ayush, et autres
Publié: (2025) -
PixWizard: Versatile Image-to-Image Visual Assistant with Open-Language Instructions
par: Lin, Weifeng, et autres
Publié: (2024)