Elysium: Exploring Object-level Perception in Videos via MLLM
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Han, Wang, Yanjie, Ye, Yongjie, Nie, Yuxiang, Huang, Can |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Dynamic-VLM: Simple Dynamic Visual Token Compression for VideoLLM
di: Wang, Han, et al.
Pubblicazione: (2024)
di: Wang, Han, et al.
Pubblicazione: (2024)
Vision as LoRA
di: Wang, Han, et al.
Pubblicazione: (2025)
di: Wang, Han, et al.
Pubblicazione: (2025)
GloTSFormer: Global Video Text Spotting Transformer
di: Wang, Han, et al.
Pubblicazione: (2024)
di: Wang, Han, et al.
Pubblicazione: (2024)
POEM: Precise Object-level Editing via MLLM control
di: Schouten, Marco, et al.
Pubblicazione: (2025)
di: Schouten, Marco, et al.
Pubblicazione: (2025)
ChineseVideoBench: Benchmarking Multi-modal Large Models for Chinese Video Question Answering
di: Nie, Yuxiang, et al.
Pubblicazione: (2025)
di: Nie, Yuxiang, et al.
Pubblicazione: (2025)
Interaction-Consistent Object Removal via MLLM-Based Reasoning
di: Huang, Ching-Kai, et al.
Pubblicazione: (2026)
di: Huang, Ching-Kai, et al.
Pubblicazione: (2026)
Exo2Ego: Exocentric Knowledge Guided MLLM for Egocentric Video Understanding
di: Zhang, Haoyu, et al.
Pubblicazione: (2025)
di: Zhang, Haoyu, et al.
Pubblicazione: (2025)
Face-MLLM: A Large Face Perception Model
di: Sun, Haomiao, et al.
Pubblicazione: (2024)
di: Sun, Haomiao, et al.
Pubblicazione: (2024)
Syn-GRPO: Self-Evolving Data Synthesis for MLLM Perception Reasoning
di: Huang, Qihan, et al.
Pubblicazione: (2025)
di: Huang, Qihan, et al.
Pubblicazione: (2025)
RTV-Bench: Benchmarking MLLM Continuous Perception, Understanding and Reasoning through Real-Time Video
di: Xun, Shuhang, et al.
Pubblicazione: (2025)
di: Xun, Shuhang, et al.
Pubblicazione: (2025)
Efficient Motion-Aware Video MLLM
di: Zhao, Zijia, et al.
Pubblicazione: (2025)
di: Zhao, Zijia, et al.
Pubblicazione: (2025)
Test-Time Temporal Sampling for Efficient MLLM Video Understanding
di: Wang, Kaibin, et al.
Pubblicazione: (2025)
di: Wang, Kaibin, et al.
Pubblicazione: (2025)
MR-MLLM: Mutual Reinforcement of Multimodal Comprehension and Vision Perception
di: Wang, Guanqun, et al.
Pubblicazione: (2024)
di: Wang, Guanqun, et al.
Pubblicazione: (2024)
MLLM as Video Narrator: Mitigating Modality Imbalance in Video Moment Retrieval
di: Cai, Weitong, et al.
Pubblicazione: (2024)
di: Cai, Weitong, et al.
Pubblicazione: (2024)
Moodifier: MLLM-Enhanced Emotion-Driven Image Editing
di: Ye, Jiarong, et al.
Pubblicazione: (2025)
di: Ye, Jiarong, et al.
Pubblicazione: (2025)
CINEMA: Coherent Multi-Subject Video Generation via MLLM-Based Guidance
di: Deng, Yufan, et al.
Pubblicazione: (2025)
di: Deng, Yufan, et al.
Pubblicazione: (2025)
Video-Holmes: Can MLLM Think Like Holmes for Complex Video Reasoning?
di: Cheng, Junhao, et al.
Pubblicazione: (2025)
di: Cheng, Junhao, et al.
Pubblicazione: (2025)
PIP-MM: Pre-Integrating Prompt Information into Visual Encoding via Existing MLLM Structures
di: Wu, Tianxiang, et al.
Pubblicazione: (2024)
di: Wu, Tianxiang, et al.
Pubblicazione: (2024)
The Evolution of Video Anomaly Detection: A Unified Framework from DNN to MLLM
di: Gao, Shibo, et al.
Pubblicazione: (2025)
di: Gao, Shibo, et al.
Pubblicazione: (2025)
LVAgent: Long Video Understanding by Multi-Round Dynamical Collaboration of MLLM Agents
di: Chen, Boyu, et al.
Pubblicazione: (2025)
di: Chen, Boyu, et al.
Pubblicazione: (2025)
CaughtCheating: Is Your MLLM a Good Cheating Detective? Exploring the Boundary of Visual Perception and Reasoning
di: Li, Ming, et al.
Pubblicazione: (2025)
di: Li, Ming, et al.
Pubblicazione: (2025)
V-Stylist: Video Stylization via Collaboration and Reflection of MLLM Agents
di: Yue, Zhengrong, et al.
Pubblicazione: (2025)
di: Yue, Zhengrong, et al.
Pubblicazione: (2025)
LLM-Bootstrapped Targeted Finding Guidance for Factual MLLM-based Medical Report Generation
di: Yang, Cunyuan, et al.
Pubblicazione: (2026)
di: Yang, Cunyuan, et al.
Pubblicazione: (2026)
DrivePI: Spatial-aware 4D MLLM for Unified Autonomous Driving Understanding, Perception, Prediction and Planning
di: Liu, Zhe, et al.
Pubblicazione: (2025)
di: Liu, Zhe, et al.
Pubblicazione: (2025)
CAD-MLLM: Unifying Multimodality-Conditioned CAD Generation With MLLM
di: Xu, Jingwei, et al.
Pubblicazione: (2024)
di: Xu, Jingwei, et al.
Pubblicazione: (2024)
Online Reasoning Video Object Segmentation
di: Liu, Jinyuan, et al.
Pubblicazione: (2026)
di: Liu, Jinyuan, et al.
Pubblicazione: (2026)
Exploring Enhanced Contextual Information for Video-Level Object Tracking
di: Kang, Ben, et al.
Pubblicazione: (2024)
di: Kang, Ben, et al.
Pubblicazione: (2024)
BusterX: MLLM-Powered AI-Generated Video Forgery Detection and Explanation
di: Wen, Haiquan, et al.
Pubblicazione: (2025)
di: Wen, Haiquan, et al.
Pubblicazione: (2025)
Composed Object Retrieval: Object-level Retrieval via Composed Expressions
di: Wang, Tong, et al.
Pubblicazione: (2025)
di: Wang, Tong, et al.
Pubblicazione: (2025)
Exploring MLLM-Diffusion Information Transfer with MetaCanvas
di: Lin, Han, et al.
Pubblicazione: (2025)
di: Lin, Han, et al.
Pubblicazione: (2025)
CoopTrack: Exploring End-to-End Learning for Efficient Cooperative Sequential Perception
di: Zhong, Jiaru, et al.
Pubblicazione: (2025)
di: Zhong, Jiaru, et al.
Pubblicazione: (2025)
Progressive Video Condensation with MLLM Agent for Long-form Video Understanding
di: Yin, Yufei, et al.
Pubblicazione: (2026)
di: Yin, Yufei, et al.
Pubblicazione: (2026)
Bootstrapping MLLM for Weakly-Supervised Class-Agnostic Object Counting
di: Zhang, Xiaowen, et al.
Pubblicazione: (2026)
di: Zhang, Xiaowen, et al.
Pubblicazione: (2026)
MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection
di: Wang, Shuyu, et al.
Pubblicazione: (2025)
di: Wang, Shuyu, et al.
Pubblicazione: (2025)
MPerS: Dynamic MLLM MixExperts Perception-Guided Remote Sensing Scene Segmentation
di: Wang, Ziyi, et al.
Pubblicazione: (2026)
di: Wang, Ziyi, et al.
Pubblicazione: (2026)
Once Is Enough: Lightweight DiT-Based Video Virtual Try-On via One-Time Garment Appearance Injection
di: Pan, Yanjie, et al.
Pubblicazione: (2025)
di: Pan, Yanjie, et al.
Pubblicazione: (2025)
Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought
di: Huang, Chao, et al.
Pubblicazione: (2025)
di: Huang, Chao, et al.
Pubblicazione: (2025)
Survey on AI-Generated Media Detection: From Non-MLLM to MLLM
di: Zou, Yueying, et al.
Pubblicazione: (2025)
di: Zou, Yueying, et al.
Pubblicazione: (2025)
Dynamic in Static: Hybrid Visual Correspondence for Self-Supervised Video Object Segmentation
di: Pei, Gensheng, et al.
Pubblicazione: (2024)
di: Pei, Gensheng, et al.
Pubblicazione: (2024)
Real-Time Object Detection Meets DINOv3
di: Huang, Shihua, et al.
Pubblicazione: (2025)
di: Huang, Shihua, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Dynamic-VLM: Simple Dynamic Visual Token Compression for VideoLLM
di: Wang, Han, et al.
Pubblicazione: (2024) -
Vision as LoRA
di: Wang, Han, et al.
Pubblicazione: (2025) -
GloTSFormer: Global Video Text Spotting Transformer
di: Wang, Han, et al.
Pubblicazione: (2024) -
POEM: Precise Object-level Editing via MLLM control
di: Schouten, Marco, et al.
Pubblicazione: (2025) -
ChineseVideoBench: Benchmarking Multi-modal Large Models for Chinese Video Question Answering
di: Nie, Yuxiang, et al.
Pubblicazione: (2025)