Dual Pose-invariant Embeddings: Learning Category and Object-specific Discriminative Representations for Recognition and Retrieval
Fuente:
arXiv
Salvato in:
| Autori principali: | Sarkar, Rohan, Kak, Avinash |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
A Dataset and Framework for Learning State-invariant Object Representations
di: Sarkar, Rohan, et al.
Pubblicazione: (2024)
di: Sarkar, Rohan, et al.
Pubblicazione: (2024)
Embedding-based Retrieval in Multimodal Content Moderation
di: Liang, Hanzhong, et al.
Pubblicazione: (2025)
di: Liang, Hanzhong, et al.
Pubblicazione: (2025)
FOR: Finetuning for Object Level Open Vocabulary Image Retrieval
di: Levi, Hila, et al.
Pubblicazione: (2024)
di: Levi, Hila, et al.
Pubblicazione: (2024)
Object-Aware Query Perturbation for Cross-Modal Image-Text Retrieval
di: Sogi, Naoya, et al.
Pubblicazione: (2024)
di: Sogi, Naoya, et al.
Pubblicazione: (2024)
Maximal Matching Matters: Preventing Representation Collapse for Robust Cross-Modal Retrieval
di: Alomari, Hani, et al.
Pubblicazione: (2025)
di: Alomari, Hani, et al.
Pubblicazione: (2025)
Candidate Set Re-ranking for Composed Image Retrieval with Dual Multi-modal Encoder
di: Liu, Zheyuan, et al.
Pubblicazione: (2023)
di: Liu, Zheyuan, et al.
Pubblicazione: (2023)
Generalized Contrastive Learning for Multi-Modal Retrieval and Ranking
di: Zhu, Tianyu, et al.
Pubblicazione: (2024)
di: Zhu, Tianyu, et al.
Pubblicazione: (2024)
MOON Embedding: Multimodal Representation Learning for E-commerce Search Advertising
di: Fu, Chenghan, et al.
Pubblicazione: (2025)
di: Fu, Chenghan, et al.
Pubblicazione: (2025)
Online Learning via Memory: Retrieval-Augmented Detector Adaptation
di: Jian, Yanan, et al.
Pubblicazione: (2024)
di: Jian, Yanan, et al.
Pubblicazione: (2024)
Region-Point Joint Representation for Effective Trajectory Similarity Learning
di: Long, Hao, et al.
Pubblicazione: (2025)
di: Long, Hao, et al.
Pubblicazione: (2025)
Hierarchy-of-Visual-Words: a Learning-based Approach for Trademark Image Retrieval
di: Lourenço, Vítor N., et al.
Pubblicazione: (2019)
di: Lourenço, Vítor N., et al.
Pubblicazione: (2019)
Reasoning-Augmented Representations for Multimodal Retrieval
di: Zhang, Jianrui, et al.
Pubblicazione: (2026)
di: Zhang, Jianrui, et al.
Pubblicazione: (2026)
Evidential Transformers for Improved Image Retrieval
di: Dordevic, Danilo, et al.
Pubblicazione: (2024)
di: Dordevic, Danilo, et al.
Pubblicazione: (2024)
Multi-event Video-Text Retrieval
di: Zhang, Gengyuan, et al.
Pubblicazione: (2023)
di: Zhang, Gengyuan, et al.
Pubblicazione: (2023)
Compact Hypercube Embeddings for Fast Text-based Wildlife Observation Retrieval
di: Moummad, Ilyass, et al.
Pubblicazione: (2026)
di: Moummad, Ilyass, et al.
Pubblicazione: (2026)
Domain-invariant feature learning in brain MR imaging for content-based image retrieval
di: Tobari, Shuya, et al.
Pubblicazione: (2025)
di: Tobari, Shuya, et al.
Pubblicazione: (2025)
NanoVDR: Distilling a 2B Vision-Language Retriever into a 70M Text-Only Encoder for Visual Document Retrieval
di: Liu, Zhuchenyang, et al.
Pubblicazione: (2026)
di: Liu, Zhuchenyang, et al.
Pubblicazione: (2026)
$\texttt{InfoHier}$: Hierarchical Information Extraction via Encoding and Embedding
di: Zhang, Tianru, et al.
Pubblicazione: (2025)
di: Zhang, Tianru, et al.
Pubblicazione: (2025)
Revisiting Uncertainty: On Evidential Learning for Partially Relevant Video Retrieval
di: Li, Jun, et al.
Pubblicazione: (2026)
di: Li, Jun, et al.
Pubblicazione: (2026)
Metric Compatible Training for Online Backfilling in Large-Scale Retrieval
di: Seo, Seonguk, et al.
Pubblicazione: (2023)
di: Seo, Seonguk, et al.
Pubblicazione: (2023)
CaReBench: A Fine-Grained Benchmark for Video Captioning and Retrieval
di: Xu, Yifan, et al.
Pubblicazione: (2024)
di: Xu, Yifan, et al.
Pubblicazione: (2024)
Sync from the Sea: Retrieving Alignable Videos from Large-Scale Datasets
di: Dave, Ishan Rajendrakumar, et al.
Pubblicazione: (2024)
di: Dave, Ishan Rajendrakumar, et al.
Pubblicazione: (2024)
LD-DETR: Loop Decoder DEtection TRansformer for Video Moment Retrieval and Highlight Detection
di: Zhao, Pengcheng, et al.
Pubblicazione: (2025)
di: Zhao, Pengcheng, et al.
Pubblicazione: (2025)
MM-Embed: Universal Multimodal Retrieval with Multimodal LLMs
di: Lin, Sheng-Chieh, et al.
Pubblicazione: (2024)
di: Lin, Sheng-Chieh, et al.
Pubblicazione: (2024)
Re-ranking the Context for Multimodal Retrieval Augmented Generation
di: Mortaheb, Matin, et al.
Pubblicazione: (2025)
di: Mortaheb, Matin, et al.
Pubblicazione: (2025)
RAG-Check: Evaluating Multimodal Retrieval Augmented Generation Performance
di: Mortaheb, Matin, et al.
Pubblicazione: (2025)
di: Mortaheb, Matin, et al.
Pubblicazione: (2025)
Revisit Anything: Visual Place Recognition via Image Segment Retrieval
di: Garg, Kartik, et al.
Pubblicazione: (2024)
di: Garg, Kartik, et al.
Pubblicazione: (2024)
AdaTask: A Task-aware Adaptive Learning Rate Approach to Multi-task Learning
di: Yang, Enneng, et al.
Pubblicazione: (2022)
di: Yang, Enneng, et al.
Pubblicazione: (2022)
Self-Supervised Learning as Discrete Communication
di: Zaher, Kawtar, et al.
Pubblicazione: (2026)
di: Zaher, Kawtar, et al.
Pubblicazione: (2026)
Deep Learning for Technical Document Classification
di: Jiang, Shuo, et al.
Pubblicazione: (2021)
di: Jiang, Shuo, et al.
Pubblicazione: (2021)
Studying Illustrations in Manuscripts: An Efficient Deep-Learning Approach
di: Evron, Yoav, et al.
Pubblicazione: (2025)
di: Evron, Yoav, et al.
Pubblicazione: (2025)
Towards Universal Video Retrieval: Generalizing Video Embedding via Synthesized Multimodal Pyramid Curriculum
di: Guo, Zhuoning, et al.
Pubblicazione: (2025)
di: Guo, Zhuoning, et al.
Pubblicazione: (2025)
Understanding the Performance Plateau in Text-to-Video Retrieval: A Comprehensive Empirical and Linguistic Analysis
di: Pegia, Maria-Eirini, et al.
Pubblicazione: (2026)
di: Pegia, Maria-Eirini, et al.
Pubblicazione: (2026)
Transfer Learning with Self-Supervised Vision Transformers for Snake Identification
di: Miyaguchi, Anthony, et al.
Pubblicazione: (2024)
di: Miyaguchi, Anthony, et al.
Pubblicazione: (2024)
Decoupled Training: Return of Frustratingly Easy Multi-Domain Learning
di: Wang, Ximei, et al.
Pubblicazione: (2023)
di: Wang, Ximei, et al.
Pubblicazione: (2023)
Transfer Learning and Mixup for Fine-Grained Few-Shot Fungi Classification
di: Tam, Jason Kahei, et al.
Pubblicazione: (2025)
di: Tam, Jason Kahei, et al.
Pubblicazione: (2025)
Multimodal Inverse Attention Network with Intrinsic Discriminant Feature Exploitation for Fake News Detection
di: Zhang, Tianlin, et al.
Pubblicazione: (2025)
di: Zhang, Tianlin, et al.
Pubblicazione: (2025)
Towards Resource-Efficient Streaming of Large-Scale Medical Image Datasets for Deep Learning
di: Kulkarni, Pranav, et al.
Pubblicazione: (2023)
di: Kulkarni, Pranav, et al.
Pubblicazione: (2023)
LotusFilter: Fast Diverse Nearest Neighbor Search via a Learned Cutoff Table
di: Matsui, Yusuke
Pubblicazione: (2025)
di: Matsui, Yusuke
Pubblicazione: (2025)
MOON: Generative MLLM-based Multimodal Representation Learning for E-commerce Product Understanding
di: Zhang, Daoze, et al.
Pubblicazione: (2025)
di: Zhang, Daoze, et al.
Pubblicazione: (2025)
Documenti analoghi
-
A Dataset and Framework for Learning State-invariant Object Representations
di: Sarkar, Rohan, et al.
Pubblicazione: (2024) -
Embedding-based Retrieval in Multimodal Content Moderation
di: Liang, Hanzhong, et al.
Pubblicazione: (2025) -
FOR: Finetuning for Object Level Open Vocabulary Image Retrieval
di: Levi, Hila, et al.
Pubblicazione: (2024) -
Object-Aware Query Perturbation for Cross-Modal Image-Text Retrieval
di: Sogi, Naoya, et al.
Pubblicazione: (2024) -
Maximal Matching Matters: Preventing Representation Collapse for Robust Cross-Modal Retrieval
di: Alomari, Hani, et al.
Pubblicazione: (2025)