EventVL: Understand Event Streams via Multimodal Large Language Model
Fuente:
arXiv
Saved in:
| Main Authors: | Li, Pengteng, Lu, Yunfan, Song, Pinghao, Li, Wuyang, Yao, Huizai, Xiong, Hui |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
From Events to Clarity: The Event-Guided Diffusion Framework for Dehazing
by: Wang, Ling, et al.
Published: (2025)
by: Wang, Ling, et al.
Published: (2025)
See&Trek: Training-Free Spatial Prompting for Multimodal Large Language Model
by: Li, Pengteng, et al.
Published: (2025)
by: Li, Pengteng, et al.
Published: (2025)
From Events to Enhancement: A Survey on Event-Based Imaging Technologies
by: Lu, Yunfan, et al.
Published: (2025)
by: Lu, Yunfan, et al.
Published: (2025)
DeblurSplat: SfM-free 3D Gaussian Splatting with Event Camera for Robust Deblurring
by: Li, Pengteng, et al.
Published: (2025)
by: Li, Pengteng, et al.
Published: (2025)
Beyond Boundaries: Leveraging Vision Foundation Models for Source-Free Object Detection
by: Yao, Huizai, et al.
Published: (2025)
by: Yao, Huizai, et al.
Published: (2025)
SEE: See Everything Every Time -- Adaptive Brightness Adjustment for Broad Light Range Images via Events
by: Lu, Yunfan, et al.
Published: (2025)
by: Lu, Yunfan, et al.
Published: (2025)
HR-INR: Continuous Space-Time Video Super-Resolution via Event Camera
by: Lu, Yunfan, et al.
Published: (2024)
by: Lu, Yunfan, et al.
Published: (2024)
EventGPT: Event Stream Understanding with Multimodal Large Language Models
by: Liu, Shaoyu, et al.
Published: (2024)
by: Liu, Shaoyu, et al.
Published: (2024)
Innovator-VL: A Multimodal Large Language Model for Scientific Discovery
by: Wen, Zichen, et al.
Published: (2026)
by: Wen, Zichen, et al.
Published: (2026)
AndesVL Technical Report: An Efficient Mobile-side Multimodal Large Language Model
by: Jin, Zhiwei, et al.
Published: (2025)
by: Jin, Zhiwei, et al.
Published: (2025)
Event-VStream: Event-Driven Real-Time Understanding for Long Video Streams
by: Guo, Zhenghui, et al.
Published: (2026)
by: Guo, Zhenghui, et al.
Published: (2026)
EventSTU: Event-Guided Efficient Spatio-Temporal Understanding for Video Large Language Models
by: Xu, Wenhao, et al.
Published: (2025)
by: Xu, Wenhao, et al.
Published: (2025)
R1-ShareVL: Incentivizing Reasoning Capability of Multimodal Large Language Models via Share-GRPO
by: Yao, Huanjin, et al.
Published: (2025)
by: Yao, Huanjin, et al.
Published: (2025)
A-VL: Adaptive Attention for Large Vision-Language Models
by: Zhang, Junyang, et al.
Published: (2024)
by: Zhang, Junyang, et al.
Published: (2024)
CEIA: CLIP-Based Event-Image Alignment for Open-World Event-Based Understanding
by: Xu, Wenhao, et al.
Published: (2024)
by: Xu, Wenhao, et al.
Published: (2024)
Revisit Event Generation Model: Self-Supervised Learning of Event-to-Video Reconstruction with Implicit Neural Representations
by: Wang, Zipeng, et al.
Published: (2024)
by: Wang, Zipeng, et al.
Published: (2024)
VidEvent: A Large Dataset for Understanding Dynamic Evolution of Events in Videos
by: Liang, Baoyu, et al.
Published: (2025)
by: Liang, Baoyu, et al.
Published: (2025)
Audio-visual Event Localization on Portrait Mode Short Videos
by: Liu, Wuyang, et al.
Published: (2025)
by: Liu, Wuyang, et al.
Published: (2025)
Hybrid Event Frame Sensors: Modeling, Calibration, and Simulation
by: Lu, Yunfan, et al.
Published: (2025)
by: Lu, Yunfan, et al.
Published: (2025)
DynamicVL: Benchmarking Multimodal Large Language Models for Dynamic City Understanding
by: Xuan, Weihao, et al.
Published: (2025)
by: Xuan, Weihao, et al.
Published: (2025)
DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding
by: Wu, Zhiyu, et al.
Published: (2024)
by: Wu, Zhiyu, et al.
Published: (2024)
Learning to See through Illumination Extremes with Event Streaming in Multimodal Large Language Models
by: Zhang, Baoheng, et al.
Published: (2026)
by: Zhang, Baoheng, et al.
Published: (2026)
EventSTR: A Benchmark Dataset and Baselines for Event Stream based Scene Text Recognition
by: Wang, Xiao, et al.
Published: (2025)
by: Wang, Xiao, et al.
Published: (2025)
Adaptive Event Stream Slicing for Open-Vocabulary Event-Based Object Detection via Vision-Language Knowledge Distillation
by: Zhang, Jinchang, et al.
Published: (2025)
by: Zhang, Jinchang, et al.
Published: (2025)
Towards Robust Event-guided Low-Light Image Enhancement: A Large-Scale Real-World Event-Image Dataset and Novel Approach
by: Liang, Guoqiang, et al.
Published: (2024)
by: Liang, Guoqiang, et al.
Published: (2024)
Event Camera Demosaicing via Swin Transformer and Pixel-focus Loss
by: Lu, Yunfan, et al.
Published: (2024)
by: Lu, Yunfan, et al.
Published: (2024)
R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization
by: Zhang, Jingyi, et al.
Published: (2025)
by: Zhang, Jingyi, et al.
Published: (2025)
TimeChat: A Time-sensitive Multimodal Large Language Model for Long Video Understanding
by: Ren, Shuhuai, et al.
Published: (2023)
by: Ren, Shuhuai, et al.
Published: (2023)
VERHallu: Evaluating and Mitigating Event Relation Hallucination in Video Large Language Models
by: Zhang, Zefan, et al.
Published: (2026)
by: Zhang, Zefan, et al.
Published: (2026)
Cut to the Chase: Training-free Multimodal Summarization via Chain-of-Events
by: You, Xiaoxing, et al.
Published: (2026)
by: You, Xiaoxing, et al.
Published: (2026)
RE-VLM: Event-Augmented Vision-Language Model for Scene Understanding
by: Liu, Hanqing, et al.
Published: (2026)
by: Liu, Hanqing, et al.
Published: (2026)
Event USKT : U-State Space Model in Knowledge Transfer for Event Cameras
by: Lin, Yuhui, et al.
Published: (2024)
by: Lin, Yuhui, et al.
Published: (2024)
RGB-Event ISP: The Dataset and Benchmark
by: Lu, Yunfan, et al.
Published: (2025)
by: Lu, Yunfan, et al.
Published: (2025)
Qianfan-VL: Domain-Enhanced Universal Vision-Language Models
by: Dong, Daxiang, et al.
Published: (2025)
by: Dong, Daxiang, et al.
Published: (2025)
Enhancing Long Video Understanding via Hierarchical Event-Based Memory
by: Cheng, Dingxin, et al.
Published: (2024)
by: Cheng, Dingxin, et al.
Published: (2024)
EvRepSL: Event-Stream Representation via Self-Supervised Learning for Event-Based Vision
by: Qu, Qiang, et al.
Published: (2024)
by: Qu, Qiang, et al.
Published: (2024)
Agent0-VL: Exploring Self-Evolving Agent for Tool-Integrated Vision-Language Reasoning
by: Liu, Jiaqi, et al.
Published: (2025)
by: Liu, Jiaqi, et al.
Published: (2025)
UniINR: Event-guided Unified Rolling Shutter Correction, Deblurring, and Interpolation
by: LU, Yunfan, et al.
Published: (2023)
by: LU, Yunfan, et al.
Published: (2023)
Rice-VL: Evaluating Vision-Language Models for Cultural Understanding Across ASEAN Countries
by: Pranav, Tushar, et al.
Published: (2025)
by: Pranav, Tushar, et al.
Published: (2025)
R1-SyntheticVL: Is Synthetic Data from Generative Models Ready for Multimodal Large Language Model?
by: Zhang, Jingyi, et al.
Published: (2026)
by: Zhang, Jingyi, et al.
Published: (2026)
Similar Items
-
From Events to Clarity: The Event-Guided Diffusion Framework for Dehazing
by: Wang, Ling, et al.
Published: (2025) -
See&Trek: Training-Free Spatial Prompting for Multimodal Large Language Model
by: Li, Pengteng, et al.
Published: (2025) -
From Events to Enhancement: A Survey on Event-Based Imaging Technologies
by: Lu, Yunfan, et al.
Published: (2025) -
DeblurSplat: SfM-free 3D Gaussian Splatting with Event Camera for Robust Deblurring
by: Li, Pengteng, et al.
Published: (2025) -
Beyond Boundaries: Leveraging Vision Foundation Models for Source-Free Object Detection
by: Yao, Huizai, et al.
Published: (2025)