EventGPT: Event Stream Understanding with Multimodal Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Liu, Shaoyu, Li, Jianing, Zhao, Guanghui, Zhang, Yunjian, Meng, Xin, Yu, Fei Richard, Ji, Xiangyang, Li, Ming |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
EventBench: Towards Comprehensive Benchmarking of Event-based MLLMs
di: Liu, Shaoyu, et al.
Pubblicazione: (2025)
di: Liu, Shaoyu, et al.
Pubblicazione: (2025)
EventFlash: Towards Efficient MLLMs for Event-Based Vision
di: Liu, Shaoyu, et al.
Pubblicazione: (2026)
di: Liu, Shaoyu, et al.
Pubblicazione: (2026)
EventVL: Understand Event Streams via Multimodal Large Language Model
di: Li, Pengteng, et al.
Pubblicazione: (2025)
di: Li, Pengteng, et al.
Pubblicazione: (2025)
Towards Understanding How Knowledge Evolves in Large Vision-Language Models
di: Wang, Sudong, et al.
Pubblicazione: (2025)
di: Wang, Sudong, et al.
Pubblicazione: (2025)
EventSTU: Event-Guided Efficient Spatio-Temporal Understanding for Video Large Language Models
di: Xu, Wenhao, et al.
Pubblicazione: (2025)
di: Xu, Wenhao, et al.
Pubblicazione: (2025)
Learning to See through Illumination Extremes with Event Streaming in Multimodal Large Language Models
di: Zhang, Baoheng, et al.
Pubblicazione: (2026)
di: Zhang, Baoheng, et al.
Pubblicazione: (2026)
Zebrafish Counting Using Event Stream Data
di: Chen, Qianghua, et al.
Pubblicazione: (2025)
di: Chen, Qianghua, et al.
Pubblicazione: (2025)
StreamForest: Efficient Online Video Understanding with Persistent Event Memory
di: Zeng, Xiangyu, et al.
Pubblicazione: (2025)
di: Zeng, Xiangyu, et al.
Pubblicazione: (2025)
Learning to Remove Lens Flare in Event Camera
di: Han, Haiqian, et al.
Pubblicazione: (2025)
di: Han, Haiqian, et al.
Pubblicazione: (2025)
Event-VStream: Event-Driven Real-Time Understanding for Long Video Streams
di: Guo, Zhenghui, et al.
Pubblicazione: (2026)
di: Guo, Zhenghui, et al.
Pubblicazione: (2026)
Event Voxel Set Transformer for Spatiotemporal Representation Learning on Event Streams
di: Xie, Bochen, et al.
Pubblicazione: (2023)
di: Xie, Bochen, et al.
Pubblicazione: (2023)
EventTracer: Fast Path Tracing-based Event Stream Rendering
di: Li, Zhenyang, et al.
Pubblicazione: (2025)
di: Li, Zhenyang, et al.
Pubblicazione: (2025)
Bilateral Event Mining and Complementary for Event Stream Super-Resolution
di: Huang, Zhilin, et al.
Pubblicazione: (2024)
di: Huang, Zhilin, et al.
Pubblicazione: (2024)
Towards Event-oriented Long Video Understanding
di: Du, Yifan, et al.
Pubblicazione: (2024)
di: Du, Yifan, et al.
Pubblicazione: (2024)
EvSign: Sign Language Recognition and Translation with Streaming Events
di: Zhang, Pengyu, et al.
Pubblicazione: (2024)
di: Zhang, Pengyu, et al.
Pubblicazione: (2024)
Adaptive Event Stream Slicing for Open-Vocabulary Event-Based Object Detection via Vision-Language Knowledge Distillation
di: Zhang, Jinchang, et al.
Pubblicazione: (2025)
di: Zhang, Jinchang, et al.
Pubblicazione: (2025)
Multimodal Collaboration Networks for Geospatial Vehicle Detection in Dense, Occluded, and Large-Scale Events
di: Wu, Xin, et al.
Pubblicazione: (2024)
di: Wu, Xin, et al.
Pubblicazione: (2024)
Semantic Alignment for Multimodal Large Language Models
di: Wu, Tao, et al.
Pubblicazione: (2024)
di: Wu, Tao, et al.
Pubblicazione: (2024)
GPT4Video: A Unified Multimodal Large Language Model for lnstruction-Followed Understanding and Safety-Aware Generation
di: Wang, Zhanyu, et al.
Pubblicazione: (2023)
di: Wang, Zhanyu, et al.
Pubblicazione: (2023)
GeoMotionGPT: Geometry-Aligned Motion Understanding with Large Language Models
di: Ye, Zhankai, et al.
Pubblicazione: (2026)
di: Ye, Zhankai, et al.
Pubblicazione: (2026)
RS-OOD: A Vision-Language Augmented Framework for Out-of-Distribution Detection in Remote Sensing
di: Wang, Chenhao, et al.
Pubblicazione: (2025)
di: Wang, Chenhao, et al.
Pubblicazione: (2025)
Memory Helps, but Confabulation Misleads: Understanding Streaming Events in Videos with MLLMs
di: Zhang, Gengyuan, et al.
Pubblicazione: (2025)
di: Zhang, Gengyuan, et al.
Pubblicazione: (2025)
Structural Prognostic Event Modeling for Multimodal Cancer Survival Analysis
di: Zhang, Yilan, et al.
Pubblicazione: (2025)
di: Zhang, Yilan, et al.
Pubblicazione: (2025)
EventGait: Towards Robust Gait Recognition with Event Streams
di: Xu, Senyan, et al.
Pubblicazione: (2026)
di: Xu, Senyan, et al.
Pubblicazione: (2026)
Event-Anchored Frame Selection for Effective Long-Video Understanding
di: Chen, Wang, et al.
Pubblicazione: (2026)
di: Chen, Wang, et al.
Pubblicazione: (2026)
OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning
di: Liang, Zhijia, et al.
Pubblicazione: (2026)
di: Liang, Zhijia, et al.
Pubblicazione: (2026)
Event Stream Filtering via Probability Flux Estimation
di: Chen, Jinze, et al.
Pubblicazione: (2025)
di: Chen, Jinze, et al.
Pubblicazione: (2025)
OpenEvents V1: Large-Scale Benchmark Dataset for Multimodal Event Grounding
di: Nguyen, Hieu, et al.
Pubblicazione: (2025)
di: Nguyen, Hieu, et al.
Pubblicazione: (2025)
DEGS: Deformable Event-based 3D Gaussian Splatting from RGB and Event Stream
di: He, Junhao, et al.
Pubblicazione: (2025)
di: He, Junhao, et al.
Pubblicazione: (2025)
IAD-GPT: Advancing Visual Knowledge in Multimodal Large Language Model for Industrial Anomaly Detection
di: Li, Zewen, et al.
Pubblicazione: (2025)
di: Li, Zewen, et al.
Pubblicazione: (2025)
Mitigating Hallucinations in Large Vision-Language Models via DPO: On-Policy Data Hold the Key
di: Yang, Zhihe, et al.
Pubblicazione: (2025)
di: Yang, Zhihe, et al.
Pubblicazione: (2025)
Streaming Detection of Queried Event Start
di: Eyzaguirre, Cristobal, et al.
Pubblicazione: (2024)
di: Eyzaguirre, Cristobal, et al.
Pubblicazione: (2024)
GS2E: Gaussian Splatting is an Effective Data Generator for Event Stream Generation
di: Li, Yuchen, et al.
Pubblicazione: (2025)
di: Li, Yuchen, et al.
Pubblicazione: (2025)
MMIU: Multimodal Multi-image Understanding for Evaluating Large Vision-Language Models
di: Meng, Fanqing, et al.
Pubblicazione: (2024)
di: Meng, Fanqing, et al.
Pubblicazione: (2024)
VisionGPT: Vision-Language Understanding Agent Using Generalized Multimodal Framework
di: Kelly, Chris, et al.
Pubblicazione: (2024)
di: Kelly, Chris, et al.
Pubblicazione: (2024)
CARE: Contrastive Alignment for ADL Recognition from Event-Triggered Sensor Streams
di: Zhao, Junhao, et al.
Pubblicazione: (2025)
di: Zhao, Junhao, et al.
Pubblicazione: (2025)
Streaming Long Video Understanding with Large Language Models
di: Qian, Rui, et al.
Pubblicazione: (2024)
di: Qian, Rui, et al.
Pubblicazione: (2024)
ExtraVAR: Stage-Aware RoPE Remapping for Resolution Extrapolation in Visual Autoregressive Models
di: Yan, Feihong, et al.
Pubblicazione: (2026)
di: Yan, Feihong, et al.
Pubblicazione: (2026)
Event Stream-based Sign Language Translation: A High-Definition Benchmark Dataset and A Novel Baseline
di: Wang, Shiao, et al.
Pubblicazione: (2024)
di: Wang, Shiao, et al.
Pubblicazione: (2024)
VidEvent: A Large Dataset for Understanding Dynamic Evolution of Events in Videos
di: Liang, Baoyu, et al.
Pubblicazione: (2025)
di: Liang, Baoyu, et al.
Pubblicazione: (2025)
Documenti analoghi
-
EventBench: Towards Comprehensive Benchmarking of Event-based MLLMs
di: Liu, Shaoyu, et al.
Pubblicazione: (2025) -
EventFlash: Towards Efficient MLLMs for Event-Based Vision
di: Liu, Shaoyu, et al.
Pubblicazione: (2026) -
EventVL: Understand Event Streams via Multimodal Large Language Model
di: Li, Pengteng, et al.
Pubblicazione: (2025) -
Towards Understanding How Knowledge Evolves in Large Vision-Language Models
di: Wang, Sudong, et al.
Pubblicazione: (2025) -
EventSTU: Event-Guided Efficient Spatio-Temporal Understanding for Video Large Language Models
di: Xu, Wenhao, et al.
Pubblicazione: (2025)