Localizing Events in Videos with Multimodal Queries
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Gengyuan, Fok, Mang Ling Ada, Ma, Jialu, Xia, Yan, Cremers, Daniel, Torr, Philip, Tresp, Volker, Gu, Jindong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
True Multimodal In-Context Learning Needs Attention to the Visual Context
di: Chen, Shuo, et al.
Pubblicazione: (2025)
di: Chen, Shuo, et al.
Pubblicazione: (2025)
Multi-event Video-Text Retrieval
di: Zhang, Gengyuan, et al.
Pubblicazione: (2023)
di: Zhang, Gengyuan, et al.
Pubblicazione: (2023)
Self-Discovering Interpretable Diffusion Latent Directions for Responsible Text-to-Image Generation
di: Li, Hang, et al.
Pubblicazione: (2023)
di: Li, Hang, et al.
Pubblicazione: (2023)
Perceive, Query & Reason: Enhancing Video QA with Question-Guided Temporal Queries
di: Amoroso, Roberto, et al.
Pubblicazione: (2024)
di: Amoroso, Roberto, et al.
Pubblicazione: (2024)
Memory Helps, but Confabulation Misleads: Understanding Streaming Events in Videos with MLLMs
di: Zhang, Gengyuan, et al.
Pubblicazione: (2025)
di: Zhang, Gengyuan, et al.
Pubblicazione: (2025)
Multimodal Pragmatic Jailbreak on Text-to-image Models
di: Liu, Tong, et al.
Pubblicazione: (2024)
di: Liu, Tong, et al.
Pubblicazione: (2024)
When and Where do Events Switch in Multi-Event Video Generation?
di: Liao, Ruotong, et al.
Pubblicazione: (2025)
di: Liao, Ruotong, et al.
Pubblicazione: (2025)
AViLA: Asynchronous Vision-Language Agent for Streaming Multimodal Data Interaction
di: Zhang, Gengyuan, et al.
Pubblicazione: (2025)
di: Zhang, Gengyuan, et al.
Pubblicazione: (2025)
Can Multimodal Large Language Models Truly Perform Multimodal In-Context Learning?
di: Chen, Shuo, et al.
Pubblicazione: (2023)
di: Chen, Shuo, et al.
Pubblicazione: (2023)
VideoINSTA: Zero-shot Long Video Understanding via Informative Spatial-Temporal Reasoning with LLMs
di: Liao, Ruotong, et al.
Pubblicazione: (2024)
di: Liao, Ruotong, et al.
Pubblicazione: (2024)
Can Vision-Language Models be a Good Guesser? Exploring VLMs for Times and Location Reasoning
di: Zhang, Gengyuan, et al.
Pubblicazione: (2023)
di: Zhang, Gengyuan, et al.
Pubblicazione: (2023)
FedBiP: Heterogeneous One-Shot Federated Learning with Personalized Latent Diffusion Models
di: Chen, Haokun, et al.
Pubblicazione: (2024)
di: Chen, Haokun, et al.
Pubblicazione: (2024)
ReEXplore: Improving MLLMs for Embodied Exploration with Contextualized Retrospective Experience Replay
di: Zhang, Gengyuan, et al.
Pubblicazione: (2025)
di: Zhang, Gengyuan, et al.
Pubblicazione: (2025)
PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs
di: Wu, Yixuan, et al.
Pubblicazione: (2025)
di: Wu, Yixuan, et al.
Pubblicazione: (2025)
METok: Multi-Stage Event-based Token Compression for Efficient Long Video Understanding
di: Wang, Mengyue, et al.
Pubblicazione: (2025)
di: Wang, Mengyue, et al.
Pubblicazione: (2025)
Stop Reasoning! When Multimodal LLM with Chain-of-Thought Reasoning Meets Adversarial Image
di: Wang, Zefeng, et al.
Pubblicazione: (2024)
di: Wang, Zefeng, et al.
Pubblicazione: (2024)
AUVIC: Adversarial Unlearning of Visual Concepts for Multi-modal Large Language Models
di: Chen, Haokun, et al.
Pubblicazione: (2025)
di: Chen, Haokun, et al.
Pubblicazione: (2025)
An Image Is Worth 1000 Lies: Adversarial Transferability across Prompts on Vision-Language Models
di: Luo, Haochen, et al.
Pubblicazione: (2024)
di: Luo, Haochen, et al.
Pubblicazione: (2024)
Influencer Backdoor Attack on Semantic Segmentation
di: Lan, Haoheng, et al.
Pubblicazione: (2023)
di: Lan, Haoheng, et al.
Pubblicazione: (2023)
As Firm As Their Foundations: Can open-sourced foundation models be used to create adversarial examples for downstream tasks?
di: Hu, Anjun, et al.
Pubblicazione: (2024)
di: Hu, Anjun, et al.
Pubblicazione: (2024)
Which Model Generated This Image? A Model-Agnostic Approach for Origin Attribution
di: Liu, Fengyuan, et al.
Pubblicazione: (2024)
di: Liu, Fengyuan, et al.
Pubblicazione: (2024)
Provably Better Explanations with Optimized Aggregation of Feature Attributions
di: Decker, Thomas, et al.
Pubblicazione: (2024)
di: Decker, Thomas, et al.
Pubblicazione: (2024)
Improving Adversarial Transferability via Model Alignment
di: Ma, Avery, et al.
Pubblicazione: (2023)
di: Ma, Avery, et al.
Pubblicazione: (2023)
Learning Visual Prompts for Guiding the Attention of Vision Transformers
di: Rezaei, Razieh, et al.
Pubblicazione: (2024)
di: Rezaei, Razieh, et al.
Pubblicazione: (2024)
Visual Question Decomposition on Multimodal Large Language Models
di: Zhang, Haowei, et al.
Pubblicazione: (2024)
di: Zhang, Haowei, et al.
Pubblicazione: (2024)
Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models
di: Xing, Songlong, et al.
Pubblicazione: (2026)
di: Xing, Songlong, et al.
Pubblicazione: (2026)
Text2Loc: 3D Point Cloud Localization from Natural Language
di: Xia, Yan, et al.
Pubblicazione: (2023)
di: Xia, Yan, et al.
Pubblicazione: (2023)
Text2Loc++: Generalizing 3D Point Cloud Localization from Natural Language
di: Xia, Yan, et al.
Pubblicazione: (2025)
di: Xia, Yan, et al.
Pubblicazione: (2025)
Inducing High Energy-Latency of Large Vision-Language Models with Verbose Images
di: Gao, Kuofeng, et al.
Pubblicazione: (2024)
di: Gao, Kuofeng, et al.
Pubblicazione: (2024)
Energy-Latency Manipulation of Multi-modal Large Language Models via Verbose Samples
di: Gao, Kuofeng, et al.
Pubblicazione: (2024)
di: Gao, Kuofeng, et al.
Pubblicazione: (2024)
TrafficLoc: Localizing Traffic Surveillance Cameras in 3D Scenes
di: Xia, Yan, et al.
Pubblicazione: (2024)
di: Xia, Yan, et al.
Pubblicazione: (2024)
SparseAlign: A Fully Sparse Framework for Cooperative Object Detection
di: Yuan, Yunshuang, et al.
Pubblicazione: (2025)
di: Yuan, Yunshuang, et al.
Pubblicazione: (2025)
PRISM: Self-Pruning Intrinsic Selection Method for Training-Free Multimodal Data Selection
di: Bi, Jinhe, et al.
Pubblicazione: (2025)
di: Bi, Jinhe, et al.
Pubblicazione: (2025)
TRASE: Tracking-free 4D Segmentation and Editing
di: Li, Yun-Jin, et al.
Pubblicazione: (2024)
di: Li, Yun-Jin, et al.
Pubblicazione: (2024)
Multimodal Query-guided Object Localization
di: Tripathi, Aditay, et al.
Pubblicazione: (2022)
di: Tripathi, Aditay, et al.
Pubblicazione: (2022)
Learning Camera Movement Control from Real-World Drone Videos
di: Hou, Yunzhong, et al.
Pubblicazione: (2024)
di: Hou, Yunzhong, et al.
Pubblicazione: (2024)
Latent Guard: a Safety Framework for Text-to-image Generation
di: Liu, Runtao, et al.
Pubblicazione: (2024)
di: Liu, Runtao, et al.
Pubblicazione: (2024)
ControlEvents: Controllable Synthesis of Event Camera Datawith Foundational Prior from Image Diffusion Models
di: Hu, Yixuan, et al.
Pubblicazione: (2025)
di: Hu, Yixuan, et al.
Pubblicazione: (2025)
Learning to See through Illumination Extremes with Event Streaming in Multimodal Large Language Models
di: Zhang, Baoheng, et al.
Pubblicazione: (2026)
di: Zhang, Baoheng, et al.
Pubblicazione: (2026)
OpenDriveVLA: Towards End-to-end Autonomous Driving with Large Vision Language Action Model
di: Zhou, Xingcheng, et al.
Pubblicazione: (2025)
di: Zhou, Xingcheng, et al.
Pubblicazione: (2025)
Documenti analoghi
-
True Multimodal In-Context Learning Needs Attention to the Visual Context
di: Chen, Shuo, et al.
Pubblicazione: (2025) -
Multi-event Video-Text Retrieval
di: Zhang, Gengyuan, et al.
Pubblicazione: (2023) -
Self-Discovering Interpretable Diffusion Latent Directions for Responsible Text-to-Image Generation
di: Li, Hang, et al.
Pubblicazione: (2023) -
Perceive, Query & Reason: Enhancing Video QA with Question-Guided Temporal Queries
di: Amoroso, Roberto, et al.
Pubblicazione: (2024) -
Memory Helps, but Confabulation Misleads: Understanding Streaming Events in Videos with MLLMs
di: Zhang, Gengyuan, et al.
Pubblicazione: (2025)