Temporal Grounding of Activities using Multimodal Large Language Models
Fuente:
arXiv
Salvato in:
| Autore principale: | Song, Young Chol |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Grounded-VideoLLM: Sharpening Fine-grained Temporal Grounding in Video Large Language Models
di: Wang, Haibo, et al.
Pubblicazione: (2024)
di: Wang, Haibo, et al.
Pubblicazione: (2024)
Temporal Insight Enhancement: Mitigating Temporal Hallucination in Multimodal Large Language Models
di: Sun, Li, et al.
Pubblicazione: (2024)
di: Sun, Li, et al.
Pubblicazione: (2024)
GLaMM: Pixel Grounding Large Multimodal Model
di: Rasheed, Hanoona, et al.
Pubblicazione: (2023)
di: Rasheed, Hanoona, et al.
Pubblicazione: (2023)
Pixel-Grounded Retrieval for Knowledgeable Large Multimodal Models
di: Kim, Jeonghwan, et al.
Pubblicazione: (2026)
di: Kim, Jeonghwan, et al.
Pubblicazione: (2026)
Parameter-Efficient Fine-Tuning Medical Multimodal Large Language Models for Medical Visual Grounding
di: He, Jinlong, et al.
Pubblicazione: (2024)
di: He, Jinlong, et al.
Pubblicazione: (2024)
DiG: Differential Grounding for Enhancing Fine-Grained Perception in Multimodal Large Language Model
di: Tao, Zhou, et al.
Pubblicazione: (2025)
di: Tao, Zhou, et al.
Pubblicazione: (2025)
Geospatial-Temporal Sensemaking of Remote Sensing Activity Detections with Multimodal Large Language Model
di: Ramirez, David F., et al.
Pubblicazione: (2026)
di: Ramirez, David F., et al.
Pubblicazione: (2026)
Adversarial Prompt Injection Attack on Multimodal Large Language Models
di: Ding, Meiwen, et al.
Pubblicazione: (2026)
di: Ding, Meiwen, et al.
Pubblicazione: (2026)
VideoITG: Multimodal Video Understanding with Instructed Temporal Grounding
di: Wang, Shihao, et al.
Pubblicazione: (2025)
di: Wang, Shihao, et al.
Pubblicazione: (2025)
ForestPrune: High-ratio Visual Token Compression for Video Multimodal Large Language Models via Spatial-Temporal Forest Modeling
di: Ju, Shaobo, et al.
Pubblicazione: (2026)
di: Ju, Shaobo, et al.
Pubblicazione: (2026)
GeM-VG: Towards Generalized Multi-image Visual Grounding with Multimodal Large Language Models
di: Zheng, Shurong, et al.
Pubblicazione: (2026)
di: Zheng, Shurong, et al.
Pubblicazione: (2026)
MMR-AD: A Large-Scale Multimodal Dataset for Benchmarking General Anomaly Detection with Multimodal Large Language Models
di: Yao, Xincheng, et al.
Pubblicazione: (2026)
di: Yao, Xincheng, et al.
Pubblicazione: (2026)
Temporally-Grounded Language Generation: A Benchmark for Real-Time Vision-Language Models
di: Yu, Keunwoo Peter, et al.
Pubblicazione: (2025)
di: Yu, Keunwoo Peter, et al.
Pubblicazione: (2025)
Erase Persona, Forget Lore: Benchmarking Multimodal Copyright Unlearning in Large Vision Language Models
di: Kwon, JuneHyoung, et al.
Pubblicazione: (2026)
di: Kwon, JuneHyoung, et al.
Pubblicazione: (2026)
GPT-4 Enhanced Multimodal Grounding for Autonomous Driving: Leveraging Cross-Modal Attention with Large Language Models
di: Liao, Haicheng, et al.
Pubblicazione: (2023)
di: Liao, Haicheng, et al.
Pubblicazione: (2023)
Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding
di: Wang, Ye, et al.
Pubblicazione: (2025)
di: Wang, Ye, et al.
Pubblicazione: (2025)
Migician: Revealing the Magic of Free-Form Multi-Image Grounding in Multimodal Large Language Models
di: Li, You, et al.
Pubblicazione: (2025)
di: Li, You, et al.
Pubblicazione: (2025)
EventVL: Understand Event Streams via Multimodal Large Language Model
di: Li, Pengteng, et al.
Pubblicazione: (2025)
di: Li, Pengteng, et al.
Pubblicazione: (2025)
Towards Visual Text Grounding of Multimodal Large Language Model
di: Li, Ming, et al.
Pubblicazione: (2025)
di: Li, Ming, et al.
Pubblicazione: (2025)
Investigating Redundancy in Multimodal Large Language Models with Multiple Vision Encoders
di: Wang, Yizhou, et al.
Pubblicazione: (2025)
di: Wang, Yizhou, et al.
Pubblicazione: (2025)
Mamba-VMR: Multimodal Query Augmentation via Generated Videos for Precise Temporal Grounding
di: Sun, Yunzhuo, et al.
Pubblicazione: (2026)
di: Sun, Yunzhuo, et al.
Pubblicazione: (2026)
TrackTeller: Temporal Multimodal 3D Grounding for Behavior-Dependent Object References
di: Yu, Jiahong, et al.
Pubblicazione: (2025)
di: Yu, Jiahong, et al.
Pubblicazione: (2025)
Check Field Detection Agent (CFD-Agent) using Multimodal Large Language and Vision Language Models
di: Halder, Sourav, et al.
Pubblicazione: (2025)
di: Halder, Sourav, et al.
Pubblicazione: (2025)
LLM-RG: Referential Grounding in Outdoor Scenarios using Large Language Models
di: Saxena, Pranav, et al.
Pubblicazione: (2025)
di: Saxena, Pranav, et al.
Pubblicazione: (2025)
See&Trek: Training-Free Spatial Prompting for Multimodal Large Language Model
di: Li, Pengteng, et al.
Pubblicazione: (2025)
di: Li, Pengteng, et al.
Pubblicazione: (2025)
Emergent Visual Grounding in Large Multimodal Models Without Grounding Supervision
di: Cao, Shengcao, et al.
Pubblicazione: (2024)
di: Cao, Shengcao, et al.
Pubblicazione: (2024)
Gaussian Mixture Proposals with Pull-Push Learning Scheme to Capture Diverse Events for Weakly Supervised Temporal Video Grounding
di: Kim, Sunoh, et al.
Pubblicazione: (2023)
di: Kim, Sunoh, et al.
Pubblicazione: (2023)
Thinking Diffusion: Penalize and Guide Visual-Grounded Reasoning in Diffusion Multimodal Language Models
di: Kim, Keuntae, et al.
Pubblicazione: (2026)
di: Kim, Keuntae, et al.
Pubblicazione: (2026)
Groma: Localized Visual Tokenization for Grounding Multimodal Large Language Models
di: Ma, Chuofan, et al.
Pubblicazione: (2024)
di: Ma, Chuofan, et al.
Pubblicazione: (2024)
Factorized Learning for Temporally Grounded Video-Language Models
di: Zeng, Wenzheng, et al.
Pubblicazione: (2025)
di: Zeng, Wenzheng, et al.
Pubblicazione: (2025)
Efficient Multimodal Large Language Models: A Survey
di: Jin, Yizhang, et al.
Pubblicazione: (2024)
di: Jin, Yizhang, et al.
Pubblicazione: (2024)
On the Out-Of-Distribution Generalization of Multimodal Large Language Models
di: Zhang, Xingxuan, et al.
Pubblicazione: (2024)
di: Zhang, Xingxuan, et al.
Pubblicazione: (2024)
Toward Cognitive Supersensing in Multimodal Large Language Model
di: Li, Boyi, et al.
Pubblicazione: (2026)
di: Li, Boyi, et al.
Pubblicazione: (2026)
Speculative Decoding Reimagined for Multimodal Large Language Models
di: Lin, Luxi, et al.
Pubblicazione: (2025)
di: Lin, Luxi, et al.
Pubblicazione: (2025)
Contextual Object Detection with Multimodal Large Language Models
di: Zang, Yuhang, et al.
Pubblicazione: (2023)
di: Zang, Yuhang, et al.
Pubblicazione: (2023)
Jailbreaking Multimodal Large Language Models using Multi-Clip Video
di: Kang, Choongwon, et al.
Pubblicazione: (2026)
di: Kang, Choongwon, et al.
Pubblicazione: (2026)
SafePLUG: Empowering Multimodal LLMs with Pixel-Level Insight and Temporal Grounding for Traffic Accident Understanding
di: Sheng, Zihao, et al.
Pubblicazione: (2025)
di: Sheng, Zihao, et al.
Pubblicazione: (2025)
Large Language Model with Region-guided Referring and Grounding for CT Report Generation
di: Chen, Zhixuan, et al.
Pubblicazione: (2024)
di: Chen, Zhixuan, et al.
Pubblicazione: (2024)
S4-Driver: Scalable Self-Supervised Driving Multimodal Large Language Modelwith Spatio-Temporal Visual Representation
di: Xie, Yichen, et al.
Pubblicazione: (2025)
di: Xie, Yichen, et al.
Pubblicazione: (2025)
Reasoning-Guided Grounding: Elevating Video Anomaly Detection through Multimodal Large Language Models
di: Agarwal, Sakshi, et al.
Pubblicazione: (2026)
di: Agarwal, Sakshi, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Grounded-VideoLLM: Sharpening Fine-grained Temporal Grounding in Video Large Language Models
di: Wang, Haibo, et al.
Pubblicazione: (2024) -
Temporal Insight Enhancement: Mitigating Temporal Hallucination in Multimodal Large Language Models
di: Sun, Li, et al.
Pubblicazione: (2024) -
GLaMM: Pixel Grounding Large Multimodal Model
di: Rasheed, Hanoona, et al.
Pubblicazione: (2023) -
Pixel-Grounded Retrieval for Knowledgeable Large Multimodal Models
di: Kim, Jeonghwan, et al.
Pubblicazione: (2026) -
Parameter-Efficient Fine-Tuning Medical Multimodal Large Language Models for Medical Visual Grounding
di: He, Jinlong, et al.
Pubblicazione: (2024)