OVMR: Open-Vocabulary Recognition with Multi-Modal References
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ma, Zehong, Zhang, Shiliang, Wei, Longhui, Tian, Qi |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Efficient Multi-modal Long Context Learning for Training-free Adaptation
par: Ma, Zehong, et autres
Publié: (2025)
par: Ma, Zehong, et autres
Publié: (2025)
MagCache: Fast Video Generation with Magnitude-Aware Cache
par: Ma, Zehong, et autres
Publié: (2025)
par: Ma, Zehong, et autres
Publié: (2025)
DeCo: Frequency-Decoupled Pixel Diffusion for End-to-End Image Generation
par: Ma, Zehong, et autres
Publié: (2025)
par: Ma, Zehong, et autres
Publié: (2025)
Multi-modal Reference Learning for Fine-grained Text-to-Image Retrieval
par: Ma, Zehong, et autres
Publié: (2025)
par: Ma, Zehong, et autres
Publié: (2025)
Boosting Segment Anything Model Towards Open-Vocabulary Learning
par: Han, Xumeng, et autres
Publié: (2023)
par: Han, Xumeng, et autres
Publié: (2023)
PixelGen: Improving Pixel Diffusion with Perceptual Supervision
par: Ma, Zehong, et autres
Publié: (2026)
par: Ma, Zehong, et autres
Publié: (2026)
Category-Adaptive Cross-Modal Semantic Refinement and Transfer for Open-Vocabulary Multi-Label Recognition
par: Liu, Haijing, et autres
Publié: (2024)
par: Liu, Haijing, et autres
Publié: (2024)
Exploring Open-Vocabulary Object Recognition in Images using CLIP
par: Chen, Wei Yu, et autres
Publié: (2026)
par: Chen, Wei Yu, et autres
Publié: (2026)
Learning to Generalize without Bias for Open-Vocabulary Action Recognition
par: Yu, Yating, et autres
Publié: (2025)
par: Yu, Yating, et autres
Publié: (2025)
DENOISER: Rethinking the Robustness for Open-Vocabulary Action Recognition
par: Cheng, Haozhe, et autres
Publié: (2024)
par: Cheng, Haozhe, et autres
Publié: (2024)
Decoupled Contrastive Learning for Long-Tailed Recognition
par: Xuan, Shiyu, et autres
Publié: (2024)
par: Xuan, Shiyu, et autres
Publié: (2024)
DART: Dual Adaptive Refinement Transfer for Open-Vocabulary Multi-Label Recognition
par: Liu, Haijing, et autres
Publié: (2025)
par: Liu, Haijing, et autres
Publié: (2025)
Backdoor Attacks on Open Vocabulary Object Detectors via Multi-Modal Prompt Tuning
par: Raj, Ankita, et autres
Publié: (2025)
par: Raj, Ankita, et autres
Publié: (2025)
Video-STAR: Reinforcing Open-Vocabulary Action Recognition with Tools
par: Yuan, Zhenlong, et autres
Publié: (2025)
par: Yuan, Zhenlong, et autres
Publié: (2025)
AnyPhoto: Multi-Person Identity Preserving Image Generation with ID Adaptive Modulation on Location Canvas
par: Yuan, Longhui
Publié: (2026)
par: Yuan, Longhui
Publié: (2026)
A Training-Free Framework for Open-Vocabulary Image Segmentation and Recognition with EfficientNet and CLIP
par: Dai, Ying, et autres
Publié: (2025)
par: Dai, Ying, et autres
Publié: (2025)
Recover and Match: Open-Vocabulary Multi-Label Recognition through Knowledge-Constrained Optimal Transport
par: Tan, Hao, et autres
Publié: (2025)
par: Tan, Hao, et autres
Publié: (2025)
Incorporating Visual Experts to Resolve the Information Loss in Multimodal Large Language Models
par: He, Xin, et autres
Publié: (2024)
par: He, Xin, et autres
Publié: (2024)
ODOV: Benchmark the Open-Domain Open-Vocabulary Object Detection
par: Zhang, Yupeng, et autres
Publié: (2025)
par: Zhang, Yupeng, et autres
Publié: (2025)
Rethinking CLIP-based Video Learners in Cross-Domain Open-Vocabulary Action Recognition
par: Lin, Kun-Yu, et autres
Publié: (2024)
par: Lin, Kun-Yu, et autres
Publié: (2024)
Classifying the Unknown: In-Context Learning for Open-Vocabulary Text and Symbol Recognition
par: Simon, Tom, et autres
Publié: (2025)
par: Simon, Tom, et autres
Publié: (2025)
Spatio-Temporal Similarity Volume Aggregation for Open-Vocabulary Action Recognition
par: So, Yerim, et autres
Publié: (2026)
par: So, Yerim, et autres
Publié: (2026)
Open Vocabulary Multi-Label Video Classification
par: Gupta, Rohit, et autres
Publié: (2024)
par: Gupta, Rohit, et autres
Publié: (2024)
Multi-Modal Prototypes for Open-World Semantic Segmentation
par: Yang, Yuhuan, et autres
Publié: (2023)
par: Yang, Yuhuan, et autres
Publié: (2023)
Hierarchical Cross-Modal Alignment for Open-Vocabulary 3D Object Detection
par: Zhao, Youjun, et autres
Publié: (2025)
par: Zhao, Youjun, et autres
Publié: (2025)
PSR: Scaling Multi-Subject Personalized Image Generation with Pairwise Subject-Consistency Rewards
par: Wang, Shulei, et autres
Publié: (2025)
par: Wang, Shulei, et autres
Publié: (2025)
ChatterBox: Multi-round Multimodal Referring and Grounding
par: Tian, Yunjie, et autres
Publié: (2024)
par: Tian, Yunjie, et autres
Publié: (2024)
OpenVidVRD: Open-Vocabulary Video Visual Relation Detection via Prompt-Driven Semantic Space Alignment
par: Liu, Qi, et autres
Publié: (2025)
par: Liu, Qi, et autres
Publié: (2025)
RADIO-ViPE: Online Tightly Coupled Multi-Modal Fusion for Open-Vocabulary Semantic SLAM in Dynamic Environments
par: Nasser, Zaid, et autres
Publié: (2026)
par: Nasser, Zaid, et autres
Publié: (2026)
LOVON: Legged Open-Vocabulary Object Navigator
par: Peng, Daojie, et autres
Publié: (2025)
par: Peng, Daojie, et autres
Publié: (2025)
Fine-Grained Open-Vocabulary Object Recognition via User-Guided Segmentation
par: Ahn, Jinwoo, et autres
Publié: (2024)
par: Ahn, Jinwoo, et autres
Publié: (2024)
Cross-Modal and Uncertainty-Aware Agglomeration for Open-Vocabulary 3D Scene Understanding
par: Li, Jinlong, et autres
Publié: (2025)
par: Li, Jinlong, et autres
Publié: (2025)
Understanding Multi-Granularity for Open-Vocabulary Part Segmentation
par: Choi, Jiho, et autres
Publié: (2024)
par: Choi, Jiho, et autres
Publié: (2024)
SKDF: A Simple Knowledge Distillation Framework for Distilling Open-Vocabulary Knowledge to Open-world Object Detector
par: Ma, Shuailei, et autres
Publié: (2023)
par: Ma, Shuailei, et autres
Publié: (2023)
COVD: Continual Open-Vocabulary Object Detection with Novel Concept Injection
par: Zhang, Yupeng, et autres
Publié: (2026)
par: Zhang, Yupeng, et autres
Publié: (2026)
From Open-Vocabulary to Vocabulary-Free Semantic Segmentation
par: Reichard, Klara, et autres
Publié: (2025)
par: Reichard, Klara, et autres
Publié: (2025)
Open-Vocabulary Scene Text Recognition via Pseudo-Image Labeling and Margin Loss
par: Ren, Xuhua, et autres
Publié: (2024)
par: Ren, Xuhua, et autres
Publié: (2024)
Open-Vocabulary Domain Generalization in Urban-Scene Segmentation
par: Zhao, Dong, et autres
Publié: (2026)
par: Zhao, Dong, et autres
Publié: (2026)
Thermal-Det: Language-Guided Cross-Modal Distillation for Open-Vocabulary Thermal Object Detection
par: Ranasinghe, Yasiru, et autres
Publié: (2026)
par: Ranasinghe, Yasiru, et autres
Publié: (2026)
Open-Vocabulary SAM3D: Towards Training-free Open-Vocabulary 3D Scene Understanding
par: Tai, Hanchen, et autres
Publié: (2024)
par: Tai, Hanchen, et autres
Publié: (2024)
Documents similaires
-
Efficient Multi-modal Long Context Learning for Training-free Adaptation
par: Ma, Zehong, et autres
Publié: (2025) -
MagCache: Fast Video Generation with Magnitude-Aware Cache
par: Ma, Zehong, et autres
Publié: (2025) -
DeCo: Frequency-Decoupled Pixel Diffusion for End-to-End Image Generation
par: Ma, Zehong, et autres
Publié: (2025) -
Multi-modal Reference Learning for Fine-grained Text-to-Image Retrieval
par: Ma, Zehong, et autres
Publié: (2025) -
Boosting Segment Anything Model Towards Open-Vocabulary Learning
par: Han, Xumeng, et autres
Publié: (2023)