OLIVE: Object Level In-Context Visual Embeddings
Fuente:
arXiv
Salvato in:
| Autori principali: | Ossowski, Timothy, Hu, Junjie |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Prompting Large Vision-Language Models for Compositional Reasoning
di: Ossowski, Timothy, et al.
Pubblicazione: (2024)
di: Ossowski, Timothy, et al.
Pubblicazione: (2024)
Context-Aware Temporal Embedding of Objects in Video Data
di: Farhan, Ahnaf, et al.
Pubblicazione: (2024)
di: Farhan, Ahnaf, et al.
Pubblicazione: (2024)
Visual Grounding for Object-Level Generalization in Reinforcement Learning
di: Jiang, Haobin, et al.
Pubblicazione: (2024)
di: Jiang, Haobin, et al.
Pubblicazione: (2024)
Generalizable Object Re-Identification via Visual In-Context Prompting
di: Huang, Zhizhong, et al.
Pubblicazione: (2025)
di: Huang, Zhizhong, et al.
Pubblicazione: (2025)
Exploring Task-Level Optimal Prompts for Visual In-Context Learning
di: Zhu, Yan, et al.
Pubblicazione: (2025)
di: Zhu, Yan, et al.
Pubblicazione: (2025)
Towards Adaptive Open-Set Object Detection via Category-Level Collaboration Knowledge Mining
di: Ji, Yuqi, et al.
Pubblicazione: (2026)
di: Ji, Yuqi, et al.
Pubblicazione: (2026)
Improving Zero-Shot Object-Level Change Detection by Incorporating Visual Correspondence
di: Nguyen, Hung Huy, et al.
Pubblicazione: (2025)
di: Nguyen, Hung Huy, et al.
Pubblicazione: (2025)
UniPixel: Unified Object Referring and Segmentation for Pixel-Level Visual Reasoning
di: Liu, Ye, et al.
Pubblicazione: (2025)
di: Liu, Ye, et al.
Pubblicazione: (2025)
IBISAgent: Reinforcing Pixel-Level Visual Reasoning in MLLMs for Universal Biomedical Object Referring and Segmentation
di: Jiang, Yankai, et al.
Pubblicazione: (2026)
di: Jiang, Yankai, et al.
Pubblicazione: (2026)
Embedded Visual Prompt Tuning
di: Zu, Wenqiang, et al.
Pubblicazione: (2024)
di: Zu, Wenqiang, et al.
Pubblicazione: (2024)
Ref-AVS: Refer and Segment Objects in Audio-Visual Scenes
di: Wang, Yaoting, et al.
Pubblicazione: (2024)
di: Wang, Yaoting, et al.
Pubblicazione: (2024)
True Multimodal In-Context Learning Needs Attention to the Visual Context
di: Chen, Shuo, et al.
Pubblicazione: (2025)
di: Chen, Shuo, et al.
Pubblicazione: (2025)
Region-Level Context-Aware Multimodal Understanding
di: Wei, Hongliang, et al.
Pubblicazione: (2025)
di: Wei, Hongliang, et al.
Pubblicazione: (2025)
Uncertainty Quantification in Detection Transformers: Object-Level Calibration and Image-Level Reliability
di: Park, Young-Jin, et al.
Pubblicazione: (2024)
di: Park, Young-Jin, et al.
Pubblicazione: (2024)
FQ-PETR: Fully Quantized Position Embedding Transformation for Multi-View 3D Object Detection
di: Yu, Jiangyong, et al.
Pubblicazione: (2025)
di: Yu, Jiangyong, et al.
Pubblicazione: (2025)
TSOM: Small Object Motion Detection Neural Network Inspired by Avian Visual Circuit
di: Hu, Pignge, et al.
Pubblicazione: (2024)
di: Hu, Pignge, et al.
Pubblicazione: (2024)
LAGO: Language-Guided Adaptive Object-Region Focus for Zero-Shot Visual-Text Alignment
di: Hu, Junyi, et al.
Pubblicazione: (2026)
di: Hu, Junyi, et al.
Pubblicazione: (2026)
ContextGS: Compact 3D Gaussian Splatting with Anchor Level Context Model
di: Wang, Yufei, et al.
Pubblicazione: (2024)
di: Wang, Yufei, et al.
Pubblicazione: (2024)
Human-Object Interaction from Human-Level Instructions
di: Wu, Zhen, et al.
Pubblicazione: (2024)
di: Wu, Zhen, et al.
Pubblicazione: (2024)
From a Social Cognitive Perspective: Context-aware Visual Social Relationship Recognition
di: Wu, Shiwei, et al.
Pubblicazione: (2024)
di: Wu, Shiwei, et al.
Pubblicazione: (2024)
Object Attribute Matters in Visual Question Answering
di: Li, Peize, et al.
Pubblicazione: (2023)
di: Li, Peize, et al.
Pubblicazione: (2023)
Object Isolated Attention for Consistent Story Visualization
di: Luo, Xiangyang, et al.
Pubblicazione: (2025)
di: Luo, Xiangyang, et al.
Pubblicazione: (2025)
PictSure: Pretraining Embeddings Matters for In-Context Learning Image Classifiers
di: Schiesser, Lukas, et al.
Pubblicazione: (2025)
di: Schiesser, Lukas, et al.
Pubblicazione: (2025)
Visual Prompt Selection for In-Context Learning Segmentation
di: Suo, Wei, et al.
Pubblicazione: (2024)
di: Suo, Wei, et al.
Pubblicazione: (2024)
Towards Autonomous UAV Visual Object Search in City Space: Benchmark and Agentic Methodology
di: Ji, Yatai, et al.
Pubblicazione: (2025)
di: Ji, Yatai, et al.
Pubblicazione: (2025)
Hybrid Discriminative Attribute-Object Embedding Network for Compositional Zero-Shot Learning
di: Liu, Yang, et al.
Pubblicazione: (2024)
di: Liu, Yang, et al.
Pubblicazione: (2024)
HierLoc: Hyperbolic Entity Embeddings for Hierarchical Visual Geolocation
di: Gadi, Hari Krishna, et al.
Pubblicazione: (2026)
di: Gadi, Hari Krishna, et al.
Pubblicazione: (2026)
Learning Physical Dynamics for Object-centric Visual Prediction
di: Xu, Huilin, et al.
Pubblicazione: (2024)
di: Xu, Huilin, et al.
Pubblicazione: (2024)
RELO: Reinforcement Learning to Localize for Visual Object Tracking
di: Chen, Xin, et al.
Pubblicazione: (2026)
di: Chen, Xin, et al.
Pubblicazione: (2026)
MITracker: Multi-View Integration for Visual Object Tracking
di: Xu, Mengjie, et al.
Pubblicazione: (2025)
di: Xu, Mengjie, et al.
Pubblicazione: (2025)
Hands-on Evaluation of Visual Transformers for Object Recognition and Detection
di: Vlachogiannis, Dimitrios N., et al.
Pubblicazione: (2025)
di: Vlachogiannis, Dimitrios N., et al.
Pubblicazione: (2025)
FOCUS: Forcing In-Context Object Localization through Visual Support Constraints and Policy Optimization
di: Karim, Mohammed Asad, et al.
Pubblicazione: (2026)
di: Karim, Mohammed Asad, et al.
Pubblicazione: (2026)
CORE-3D: Context-aware Open-vocabulary Retrieval by Embeddings in 3D
di: Mirzaei, Mohamad Amin, et al.
Pubblicazione: (2025)
di: Mirzaei, Mohamad Amin, et al.
Pubblicazione: (2025)
Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning
di: Li, Zejun, et al.
Pubblicazione: (2025)
di: Li, Zejun, et al.
Pubblicazione: (2025)
CLAY: Conditional Visual Similarity Modulation in Vision-Language Embedding Space
di: Lim, Sohwi, et al.
Pubblicazione: (2026)
di: Lim, Sohwi, et al.
Pubblicazione: (2026)
Zero Shot Context-Based Object Segmentation using SLIP (SAM+CLIP)
di: Gundavarapu, Saaketh Koundinya, et al.
Pubblicazione: (2024)
di: Gundavarapu, Saaketh Koundinya, et al.
Pubblicazione: (2024)
Scale-Invariant Object Detection by Adaptive Convolution with Unified Global-Local Context
di: Singh, Amrita, et al.
Pubblicazione: (2024)
di: Singh, Amrita, et al.
Pubblicazione: (2024)
Mitigating Context Bias in Domain Adaptation for Object Detection using Mask Pooling
di: Son, Hojun, et al.
Pubblicazione: (2025)
di: Son, Hojun, et al.
Pubblicazione: (2025)
LSRM: High-Fidelity Object-Centric Reconstruction via Scaled Context Windows
di: Li, Zhengqin, et al.
Pubblicazione: (2026)
di: Li, Zhengqin, et al.
Pubblicazione: (2026)
A Study of Commonsense Reasoning over Visual Object Properties
di: Kolari, Abhishek, et al.
Pubblicazione: (2025)
di: Kolari, Abhishek, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Prompting Large Vision-Language Models for Compositional Reasoning
di: Ossowski, Timothy, et al.
Pubblicazione: (2024) -
Context-Aware Temporal Embedding of Objects in Video Data
di: Farhan, Ahnaf, et al.
Pubblicazione: (2024) -
Visual Grounding for Object-Level Generalization in Reinforcement Learning
di: Jiang, Haobin, et al.
Pubblicazione: (2024) -
Generalizable Object Re-Identification via Visual In-Context Prompting
di: Huang, Zhizhong, et al.
Pubblicazione: (2025) -
Exploring Task-Level Optimal Prompts for Visual In-Context Learning
di: Zhu, Yan, et al.
Pubblicazione: (2025)