End-to-end Open-vocabulary Video Visual Relationship Detection using Multi-modal Prompting
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Yongqi, Wu, Xinxiao, Yang, Shuo, Luo, Jiebo |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
METOR: A Unified Framework for Mutual Enhancement of Objects and Relationships in Open-vocabulary Video Visual Relationship Detection
di: Wang, Yongqi, et al.
Pubblicazione: (2025)
di: Wang, Yongqi, et al.
Pubblicazione: (2025)
LLM-enhanced Action-aware Multi-modal Prompt Tuning for Image-Text Matching
di: Tian, Mengxiao, et al.
Pubblicazione: (2025)
di: Tian, Mengxiao, et al.
Pubblicazione: (2025)
Data-free Multi-label Image Recognition via LLM-powered Prompt Tuning
di: Yang, Shuo, et al.
Pubblicazione: (2024)
di: Yang, Shuo, et al.
Pubblicazione: (2024)
Video Summarization using Denoising Diffusion Probabilistic Model
di: Shang, Zirui, et al.
Pubblicazione: (2024)
di: Shang, Zirui, et al.
Pubblicazione: (2024)
VideoXum: Cross-modal Visual and Textural Summarization of Videos
di: Lin, Jingyang, et al.
Pubblicazione: (2023)
di: Lin, Jingyang, et al.
Pubblicazione: (2023)
LLM-powered Query Expansion for Enhancing Boundary Prediction in Language-driven Action Localization
di: Shang, Zirui, et al.
Pubblicazione: (2025)
di: Shang, Zirui, et al.
Pubblicazione: (2025)
Simulate, Refocus and Ensemble: An Attention-Refocusing Scheme for Domain Generalization
di: Wang, Ziyi, et al.
Pubblicazione: (2025)
di: Wang, Ziyi, et al.
Pubblicazione: (2025)
DV-3DLane: End-to-end Multi-modal 3D Lane Detection with Dual-view Representation
di: Luo, Yueru, et al.
Pubblicazione: (2024)
di: Luo, Yueru, et al.
Pubblicazione: (2024)
X-Prompt: Multi-modal Visual Prompt for Video Object Segmentation
di: Guo, Pinxue, et al.
Pubblicazione: (2024)
di: Guo, Pinxue, et al.
Pubblicazione: (2024)
How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey
di: Qi, Yayun, et al.
Pubblicazione: (2024)
di: Qi, Yayun, et al.
Pubblicazione: (2024)
OpenVIS: Open-vocabulary Video Instance Segmentation
di: Guo, Pinxue, et al.
Pubblicazione: (2023)
di: Guo, Pinxue, et al.
Pubblicazione: (2023)
Open-World Human-Object Interaction Detection via Multi-modal Prompts
di: Yang, Jie, et al.
Pubblicazione: (2024)
di: Yang, Jie, et al.
Pubblicazione: (2024)
Customizing Visual Emotion Evaluation for MLLMs: An Open-vocabulary, Multifaceted, and Scalable Approach
di: Wu, Daiqing, et al.
Pubblicazione: (2025)
di: Wu, Daiqing, et al.
Pubblicazione: (2025)
METDrive: Multi-modal End-to-end Autonomous Driving with Temporal Guidance
di: Guo, Ziang, et al.
Pubblicazione: (2024)
di: Guo, Ziang, et al.
Pubblicazione: (2024)
Multi-Grained Cross-modal Alignment for Learning Open-vocabulary Semantic Segmentation from Text Supervision
di: Liu, Yajie, et al.
Pubblicazione: (2024)
di: Liu, Yajie, et al.
Pubblicazione: (2024)
Self-Prompting Diffusion Transformer for Open-Vocabulary Scene Text Editing via In-Context Learning
di: Li, Hongxi, et al.
Pubblicazione: (2026)
di: Li, Hongxi, et al.
Pubblicazione: (2026)
End4: End-to-end Denoising Diffusion for Diffusion-Based Inpainting Detection
di: Wang, Fei, et al.
Pubblicazione: (2025)
di: Wang, Fei, et al.
Pubblicazione: (2025)
Omni-Attribute: Open-vocabulary Attribute Encoder for Visual Concept Personalization
di: Chen, Tsai-Shien, et al.
Pubblicazione: (2025)
di: Chen, Tsai-Shien, et al.
Pubblicazione: (2025)
Chain-of-Thought Prompting for Demographic Inference with Large Multimodal Models
di: Yu, Yongsheng, et al.
Pubblicazione: (2024)
di: Yu, Yongsheng, et al.
Pubblicazione: (2024)
Scene-Graph ViT: End-to-End Open-Vocabulary Visual Relationship Detection
di: Salzmann, Tim, et al.
Pubblicazione: (2024)
di: Salzmann, Tim, et al.
Pubblicazione: (2024)
Relation-aware Hierarchical Prompt for Open-vocabulary Scene Graph Generation
di: Liu, Tao, et al.
Pubblicazione: (2024)
di: Liu, Tao, et al.
Pubblicazione: (2024)
Latent-Reframe: Enabling Camera Control for Video Diffusion Model without Training
di: Zhou, Zhenghong, et al.
Pubblicazione: (2024)
di: Zhou, Zhenghong, et al.
Pubblicazione: (2024)
Instance Brownian Bridge as Texts for Open-vocabulary Video Instance Segmentation
di: Cheng, Zesen, et al.
Pubblicazione: (2024)
di: Cheng, Zesen, et al.
Pubblicazione: (2024)
Compositional Caching for Training-free Open-vocabulary Attribute Detection
di: Garosi, Marco, et al.
Pubblicazione: (2025)
di: Garosi, Marco, et al.
Pubblicazione: (2025)
OpenVidVRD: Open-Vocabulary Video Visual Relation Detection via Prompt-Driven Semantic Space Alignment
di: Liu, Qi, et al.
Pubblicazione: (2025)
di: Liu, Qi, et al.
Pubblicazione: (2025)
End-to-end multi-modal product matching in fashion e-commerce
di: Tóth, Sándor, et al.
Pubblicazione: (2024)
di: Tóth, Sándor, et al.
Pubblicazione: (2024)
PromptFix: You Prompt and We Fix the Photo
di: Yu, Yongsheng, et al.
Pubblicazione: (2024)
di: Yu, Yongsheng, et al.
Pubblicazione: (2024)
Towards Open-ended Visual Quality Comparison
di: Wu, Haoning, et al.
Pubblicazione: (2024)
di: Wu, Haoning, et al.
Pubblicazione: (2024)
EVC-MF: End-to-end Video Captioning Network with Multi-scale Features
di: Niu, Tian-Zi, et al.
Pubblicazione: (2024)
di: Niu, Tian-Zi, et al.
Pubblicazione: (2024)
Multi-modal Attribute Prompting for Vision-Language Models
di: Liu, Xin, et al.
Pubblicazione: (2024)
di: Liu, Xin, et al.
Pubblicazione: (2024)
Video Emotion Open-vocabulary Recognition Based on Multimodal Large Language Model
di: Ge, Mengying, et al.
Pubblicazione: (2024)
di: Ge, Mengying, et al.
Pubblicazione: (2024)
MolParser: End-to-end Visual Recognition of Molecule Structures in the Wild
di: Fang, Xi, et al.
Pubblicazione: (2024)
di: Fang, Xi, et al.
Pubblicazione: (2024)
SHiNe: Semantic Hierarchy Nexus for Open-vocabulary Object Detection
di: Liu, Mingxuan, et al.
Pubblicazione: (2024)
di: Liu, Mingxuan, et al.
Pubblicazione: (2024)
Evolver: Chain-of-Evolution Prompting to Boost Large Multimodal Models for Hateful Meme Detection
di: Huang, Jinfa, et al.
Pubblicazione: (2024)
di: Huang, Jinfa, et al.
Pubblicazione: (2024)
Open-RGBT: Open-vocabulary RGB-T Zero-shot Semantic Segmentation in Open-world Environments
di: Yu, Meng, et al.
Pubblicazione: (2024)
di: Yu, Meng, et al.
Pubblicazione: (2024)
Visual Object Tracking on Multi-modal RGB-D Videos: A Review
di: Zhu, Xue-Feng, et al.
Pubblicazione: (2022)
di: Zhu, Xue-Feng, et al.
Pubblicazione: (2022)
V2Xum-LLM: Cross-Modal Video Summarization with Temporal Prompt Instruction Tuning
di: Hua, Hang, et al.
Pubblicazione: (2024)
di: Hua, Hang, et al.
Pubblicazione: (2024)
Unified-modal Salient Object Detection via Adaptive Prompt Learning
di: Wang, Kunpeng, et al.
Pubblicazione: (2023)
di: Wang, Kunpeng, et al.
Pubblicazione: (2023)
COMICS: End-to-end Bi-grained Contrastive Learning for Multi-face Forgery Detection
di: Zhang, Cong, et al.
Pubblicazione: (2023)
di: Zhang, Cong, et al.
Pubblicazione: (2023)
UniVA: Universal Video Agent towards Open-Source Next-Generation Video Generalist
di: Liang, Zhengyang, et al.
Pubblicazione: (2025)
di: Liang, Zhengyang, et al.
Pubblicazione: (2025)
Documenti analoghi
-
METOR: A Unified Framework for Mutual Enhancement of Objects and Relationships in Open-vocabulary Video Visual Relationship Detection
di: Wang, Yongqi, et al.
Pubblicazione: (2025) -
LLM-enhanced Action-aware Multi-modal Prompt Tuning for Image-Text Matching
di: Tian, Mengxiao, et al.
Pubblicazione: (2025) -
Data-free Multi-label Image Recognition via LLM-powered Prompt Tuning
di: Yang, Shuo, et al.
Pubblicazione: (2024) -
Video Summarization using Denoising Diffusion Probabilistic Model
di: Shang, Zirui, et al.
Pubblicazione: (2024) -
VideoXum: Cross-modal Visual and Textural Summarization of Videos
di: Lin, Jingyang, et al.
Pubblicazione: (2023)