ObjEmbed: Towards Universal Multimodal Object Embeddings
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Fu, Shenghao, Su, Yukun, Rao, Fengyun, Lyu, Jing, Xie, Xiaohua, Zheng, Wei-Shi |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
WeDetect: Fast Open-Vocabulary Object Detection as Retrieval
par: Fu, Shenghao, et autres
Publié: (2025)
par: Fu, Shenghao, et autres
Publié: (2025)
A Hierarchical Semantic Distillation Framework for Open-Vocabulary Object Detection
par: Fu, Shenghao, et autres
Publié: (2025)
par: Fu, Shenghao, et autres
Publié: (2025)
Beyond Chain-of-Thought: Rewrite as a Universal Interface for Generative Multimodal Embeddings
par: Wu, Peixi, et autres
Publié: (2026)
par: Wu, Peixi, et autres
Publié: (2026)
MM-CamObj: A Comprehensive Multimodal Dataset for Camouflaged Object Scenarios
par: Ruan, Jiacheng, et autres
Publié: (2024)
par: Ruan, Jiacheng, et autres
Publié: (2024)
WAVE: Learning Unified & Versatile Audio-Visual Embeddings with Multimodal LLM
par: Tang, Changli, et autres
Publié: (2025)
par: Tang, Changli, et autres
Publié: (2025)
ObjMST: An Object-Focused Multimodal Style Transfer Framework
par: Kamra, Chanda Grover, et autres
Publié: (2025)
par: Kamra, Chanda Grover, et autres
Publié: (2025)
LLMDet: Learning Strong Open-Vocabulary Object Detectors under the Supervision of Large Language Models
par: Fu, Shenghao, et autres
Publié: (2025)
par: Fu, Shenghao, et autres
Publié: (2025)
Frozen-DETR: Enhancing DETR with Image Understanding from Frozen Foundation Models
par: Fu, Shenghao, et autres
Publié: (2024)
par: Fu, Shenghao, et autres
Publié: (2024)
Spatial-Semantic Collaborative Cropping for User Generated Content
par: Su, Yukun, et autres
Publié: (2024)
par: Su, Yukun, et autres
Publié: (2024)
LOVE-R1: Advancing Long Video Understanding with an Adaptive Zoom-in Mechanism via Multi-Step Reasoning
par: Fu, Shenghao, et autres
Publié: (2025)
par: Fu, Shenghao, et autres
Publié: (2025)
Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs
par: Li, Qi, et autres
Publié: (2026)
par: Li, Qi, et autres
Publié: (2026)
Multi-Modal Generative Embedding Model
par: Ma, Feipeng, et autres
Publié: (2024)
par: Ma, Feipeng, et autres
Publié: (2024)
RzenEmbed: Towards Comprehensive Multimodal Retrieval
par: Jian, Weijian, et autres
Publié: (2025)
par: Jian, Weijian, et autres
Publié: (2025)
Learning Cross-View Object Correspondence via Cycle-Consistent Mask Prediction
par: Yan, Shannan, et autres
Publié: (2026)
par: Yan, Shannan, et autres
Publié: (2026)
D-ORCA: Dialogue-Centric Optimization for Robust Audio-Visual Captioning
par: Tang, Changli, et autres
Publié: (2026)
par: Tang, Changli, et autres
Publié: (2026)
Embedded Visual Prompt Tuning
par: Zu, Wenqiang, et autres
Publié: (2024)
par: Zu, Wenqiang, et autres
Publié: (2024)
Bridge Past and Future: Overcoming Information Asymmetry in Incremental Object Detection
par: Mo, Qijie, et autres
Publié: (2024)
par: Mo, Qijie, et autres
Publié: (2024)
ObjSplat: Geometry-Aware Gaussian Surfels for Active Object Reconstruction
par: Li, Yuetao, et autres
Publié: (2026)
par: Li, Yuetao, et autres
Publié: (2026)
ObjCtrl-2.5D: Training-free Object Control with Camera Poses
par: Wang, Zhouxia, et autres
Publié: (2024)
par: Wang, Zhouxia, et autres
Publié: (2024)
Instruction-augmented Multimodal Alignment for Image-Text and Element Matching
par: Yue, Xinli, et autres
Publié: (2025)
par: Yue, Xinli, et autres
Publié: (2025)
PLUME: Latent Reasoning Based Universal Multimodal Embedding
par: He, Chenwei, et autres
Publié: (2026)
par: He, Chenwei, et autres
Publié: (2026)
MMAR: Towards Lossless Multi-Modal Auto-Regressive Probabilistic Modeling
par: Yang, Jian, et autres
Publié: (2024)
par: Yang, Jian, et autres
Publié: (2024)
FreqPDE: Rethinking Positional Depth Embedding for Multi-View 3D Object Detection Transformers
par: Su, Haisheng, et autres
Publié: (2025)
par: Su, Haisheng, et autres
Publié: (2025)
Breaking the Modality Barrier: Universal Embedding Learning with Multimodal LLMs
par: Gu, Tiancheng, et autres
Publié: (2025)
par: Gu, Tiancheng, et autres
Publié: (2025)
ObjFiller3D: Scaling 3D Object Inpainting to Dense Multi-View Consistency
par: Feng, Haitang, et autres
Publié: (2025)
par: Feng, Haitang, et autres
Publié: (2025)
ObjVariantEnsemble: Advancing Point Cloud LLM Evaluation in Challenging Scenes with Subtly Distinguished Objects
par: Cao, Qihang, et autres
Publié: (2024)
par: Cao, Qihang, et autres
Publié: (2024)
Prototype Embedding Optimization for Human-Object Interaction Detection in Livestreaming
par: Zhang, Menghui, et autres
Publié: (2025)
par: Zhang, Menghui, et autres
Publié: (2025)
REVERSE: Reinforcing Evidence Verification and Search for Agentic Image geo-localization
par: Li, Yong, et autres
Publié: (2026)
par: Li, Yong, et autres
Publié: (2026)
VLM2GeoVec: Toward Universal Multimodal Embeddings for Remote Sensing
par: Aimar, Emanuel Sánchez, et autres
Publié: (2025)
par: Aimar, Emanuel Sánchez, et autres
Publié: (2025)
Embed-RL: Reinforcement Learning for Reasoning-Driven Multimodal Embeddings
par: Jiang, Haonan, et autres
Publié: (2026)
par: Jiang, Haonan, et autres
Publié: (2026)
WeMMU: Enhanced Bridging of Vision-Language Models and Diffusion Models via Noisy Query Tokens
par: Yang, Jian, et autres
Publié: (2025)
par: Yang, Jian, et autres
Publié: (2025)
ActionArt: Advancing Multimodal Large Models for Fine-Grained Human-Centric Video Understanding
par: Peng, Yi-Xing, et autres
Publié: (2025)
par: Peng, Yi-Xing, et autres
Publié: (2025)
ViSpeak: Visual Instruction Feedback in Streaming Videos
par: Fu, Shenghao, et autres
Publié: (2025)
par: Fu, Shenghao, et autres
Publié: (2025)
ObjBlur: A Curriculum Learning Approach With Progressive Object-Level Blurring for Improved Layout-to-Image Generation
par: Frolov, Stanislav, et autres
Publié: (2024)
par: Frolov, Stanislav, et autres
Publié: (2024)
URoPE: Universal Relative Position Embedding across Geometric Spaces
par: Xie, Yichen, et autres
Publié: (2026)
par: Xie, Yichen, et autres
Publié: (2026)
Elevating Visual Perception in Multimodal LLMs with Visual Embedding Distillation
par: Jain, Jitesh, et autres
Publié: (2024)
par: Jain, Jitesh, et autres
Publié: (2024)
Proxy-Embedding as an Adversarial Teacher: An Embedding-Guided Bidirectional Attack for Referring Expression Segmentation Models
par: Chen, Xingbai, et autres
Publié: (2025)
par: Chen, Xingbai, et autres
Publié: (2025)
From Detection to Association: Learning Discriminative Object Embeddings for Multi-Object Tracking
par: Shao, Yuqing, et autres
Publié: (2025)
par: Shao, Yuqing, et autres
Publié: (2025)
Object-Driven One-Shot Fine-tuning of Text-to-Image Diffusion with Prototypical Embedding
par: Lu, Jianxiang, et autres
Publié: (2024)
par: Lu, Jianxiang, et autres
Publié: (2024)
OPEN: Object-wise Position Embedding for Multi-view 3D Object Detection
par: Hou, Jinghua, et autres
Publié: (2024)
par: Hou, Jinghua, et autres
Publié: (2024)
Documents similaires
-
WeDetect: Fast Open-Vocabulary Object Detection as Retrieval
par: Fu, Shenghao, et autres
Publié: (2025) -
A Hierarchical Semantic Distillation Framework for Open-Vocabulary Object Detection
par: Fu, Shenghao, et autres
Publié: (2025) -
Beyond Chain-of-Thought: Rewrite as a Universal Interface for Generative Multimodal Embeddings
par: Wu, Peixi, et autres
Publié: (2026) -
MM-CamObj: A Comprehensive Multimodal Dataset for Camouflaged Object Scenarios
par: Ruan, Jiacheng, et autres
Publié: (2024) -
WAVE: Learning Unified & Versatile Audio-Visual Embeddings with Multimodal LLM
par: Tang, Changli, et autres
Publié: (2025)