Composed Object Retrieval: Object-level Retrieval via Composed Expressions
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Tong, Yang, Guanyu, Liu, Nian, Han, Zongyan, Zhou, Jinxing, Khan, Salman, Khan, Fahad Shahbaz |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Composed Video Retrieval via Enriched Context and Discriminative Embeddings
por: Thawakar, Omkar, et al.
Publicado: (2024)
por: Thawakar, Omkar, et al.
Publicado: (2024)
ObjectCompose: Evaluating Resilience of Vision-Based Models on Object-to-Background Compositional Changes
por: Malik, Hashmat Shadab, et al.
Publicado: (2024)
por: Malik, Hashmat Shadab, et al.
Publicado: (2024)
Beyond Simple Edits: Composed Video Retrieval with Dense Modifications
por: Thawakar, Omkar, et al.
Publicado: (2025)
por: Thawakar, Omkar, et al.
Publicado: (2025)
Enhancing Novel Object Detection via Cooperative Foundational Models
por: Bharadwaj, Rohit, et al.
Publicado: (2023)
por: Bharadwaj, Rohit, et al.
Publicado: (2023)
CONDA: Condensed Deep Association Learning for Co-Salient Object Detection
por: Li, Long, et al.
Publicado: (2024)
por: Li, Long, et al.
Publicado: (2024)
Efficient Video Object Segmentation via Modulated Cross-Attention Memory
por: Shaker, Abdelrahman, et al.
Publicado: (2024)
por: Shaker, Abdelrahman, et al.
Publicado: (2024)
ComposeAnything: Composite Object Priors for Text-to-Image Generation
por: Khan, Zeeshan, et al.
Publicado: (2025)
por: Khan, Zeeshan, et al.
Publicado: (2025)
Diversity Has Always Been There in Your Visual Autoregressive Models
por: Wang, Tong, et al.
Publicado: (2025)
por: Wang, Tong, et al.
Publicado: (2025)
CoVR-R:Reason-Aware Composed Video Retrieval
por: Thawakar, Omkar, et al.
Publicado: (2026)
por: Thawakar, Omkar, et al.
Publicado: (2026)
AURORA:Augmented Understanding via Structured Reasoning and Reinforcement Learning for Reference Audio-Visual Segmentation
por: Luo, Ziyang, et al.
Publicado: (2025)
por: Luo, Ziyang, et al.
Publicado: (2025)
Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models
por: Maaz, Muhammad, et al.
Publicado: (2023)
por: Maaz, Muhammad, et al.
Publicado: (2023)
From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval
por: Wang, Yabing, et al.
Publicado: (2025)
por: Wang, Yabing, et al.
Publicado: (2025)
Learning Camouflaged Object Detection from Noisy Pseudo Label
por: Zhang, Jin, et al.
Publicado: (2024)
por: Zhang, Jin, et al.
Publicado: (2024)
A Sanity Check on Composed Image Retrieval
por: Liu, Yikun, et al.
Publicado: (2026)
por: Liu, Yikun, et al.
Publicado: (2026)
Zero-shot Composed Text-Image Retrieval
por: Liu, Yikun, et al.
Publicado: (2023)
por: Liu, Yikun, et al.
Publicado: (2023)
Interpretable Zero-Shot Learning with Locally-Aligned Vision-Language Model
por: Chen, Shiming, et al.
Publicado: (2025)
por: Chen, Shiming, et al.
Publicado: (2025)
Video-R2: Reinforcing Consistent and Grounded Reasoning in Multimodal Language Models
por: Maaz, Muhammad, et al.
Publicado: (2025)
por: Maaz, Muhammad, et al.
Publicado: (2025)
Language Guided Domain Generalized Medical Image Segmentation
por: Kunhimon, Shahina, et al.
Publicado: (2024)
por: Kunhimon, Shahina, et al.
Publicado: (2024)
Cross-Modal Self-Training: Aligning Images and Pointclouds to Learn Classification without Labels
por: Dharmasiri, Amaya, et al.
Publicado: (2024)
por: Dharmasiri, Amaya, et al.
Publicado: (2024)
Instance-Level Composed Image Retrieval
por: Psomas, Bill, et al.
Publicado: (2025)
por: Psomas, Bill, et al.
Publicado: (2025)
Zero Shot Composed Image Retrieval
por: Kakarla, Santhosh, et al.
Publicado: (2025)
por: Kakarla, Santhosh, et al.
Publicado: (2025)
Composed Image Retrieval for Remote Sensing
por: Psomas, Bill, et al.
Publicado: (2024)
por: Psomas, Bill, et al.
Publicado: (2024)
Vocabulary-free Fine-grained Visual Recognition via Enriched Contextually Grounded Vision-Language Model
por: Demidov, Dmitry, et al.
Publicado: (2025)
por: Demidov, Dmitry, et al.
Publicado: (2025)
Resolving Ambiguity in Composed Image Retrieval via Calibrated Interaction
por: Tran, Amsisan, et al.
Publicado: (2026)
por: Tran, Amsisan, et al.
Publicado: (2026)
Bring Your Dreams to Life: Continual Text-to-Video Customization
por: Dong, Jiahua, et al.
Publicado: (2025)
por: Dong, Jiahua, et al.
Publicado: (2025)
TAViS: Text-bridged Audio-Visual Segmentation with Foundation Models
por: Luo, Ziyang, et al.
Publicado: (2025)
por: Luo, Ziyang, et al.
Publicado: (2025)
Generating a Paracosm for Training-Free Zero-Shot Composed Image Retrieval
por: Wang, Tong, et al.
Publicado: (2026)
por: Wang, Tong, et al.
Publicado: (2026)
Underwater Object Detection Enhancement via Channel Stabilization
por: Ali, Muhammad, et al.
Publicado: (2024)
por: Ali, Muhammad, et al.
Publicado: (2024)
Open3DTrack: Towards Open-Vocabulary 3D Multi-Object Tracking
por: Ishaq, Ayesha, et al.
Publicado: (2024)
por: Ishaq, Ayesha, et al.
Publicado: (2024)
GenZSL: Generative Zero-Shot Learning Via Inductive Variational Autoencoder
por: Chen, Shiming, et al.
Publicado: (2025)
por: Chen, Shiming, et al.
Publicado: (2025)
Progressive Semantic-Guided Vision Transformer for Zero-Shot Learning
por: Chen, Shiming, et al.
Publicado: (2024)
por: Chen, Shiming, et al.
Publicado: (2024)
FasterVAR: Plug-and-Play Acceleration for Visual Autoregressive Models
por: Li, Senmao, et al.
Publicado: (2025)
por: Li, Senmao, et al.
Publicado: (2025)
Video-CoM: Interactive Video Reasoning via Chain of Manipulations
por: Rasheed, Hanoona, et al.
Publicado: (2025)
por: Rasheed, Hanoona, et al.
Publicado: (2025)
VURF: A General-purpose Reasoning and Self-refinement Framework for Video Understanding
por: Mahmood, Ahmad, et al.
Publicado: (2024)
por: Mahmood, Ahmad, et al.
Publicado: (2024)
VANE-Bench: Video Anomaly Evaluation Benchmark for Conversational LMMs
por: Bharadwaj, Rohit, et al.
Publicado: (2024)
por: Bharadwaj, Rohit, et al.
Publicado: (2024)
ELGC-Net: Efficient Local-Global Context Aggregation for Remote Sensing Change Detection
por: Noman, Mubashir, et al.
Publicado: (2024)
por: Noman, Mubashir, et al.
Publicado: (2024)
Imagine and Seek: Improving Composed Image Retrieval with an Imagined Proxy
por: Li, You, et al.
Publicado: (2024)
por: Li, You, et al.
Publicado: (2024)
Dual Relation Alignment for Composed Image Retrieval
por: Jiang, Xintong, et al.
Publicado: (2023)
por: Jiang, Xintong, et al.
Publicado: (2023)
HOMIE: Histopathology Omni-modal Embedding for Pathology Composed Retrieval
por: Zhou, Qifeng, et al.
Publicado: (2025)
por: Zhou, Qifeng, et al.
Publicado: (2025)
Towards Evaluating the Robustness of Visual State Space Models
por: Malik, Hashmat Shadab, et al.
Publicado: (2024)
por: Malik, Hashmat Shadab, et al.
Publicado: (2024)
Ejemplares similares
-
Composed Video Retrieval via Enriched Context and Discriminative Embeddings
por: Thawakar, Omkar, et al.
Publicado: (2024) -
ObjectCompose: Evaluating Resilience of Vision-Based Models on Object-to-Background Compositional Changes
por: Malik, Hashmat Shadab, et al.
Publicado: (2024) -
Beyond Simple Edits: Composed Video Retrieval with Dense Modifications
por: Thawakar, Omkar, et al.
Publicado: (2025) -
Enhancing Novel Object Detection via Cooperative Foundational Models
por: Bharadwaj, Rohit, et al.
Publicado: (2023) -
CONDA: Condensed Deep Association Learning for Co-Salient Object Detection
por: Li, Long, et al.
Publicado: (2024)