Towards Event-oriented Long Video Understanding
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Du, Yifan, Zhou, Kun, Huo, Yuqi, Li, Yifan, Zhao, Wayne Xin, Lu, Haoyu, Zhao, Zijia, Wang, Bingning, Chen, Weipeng, Wen, Ji-Rong |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Exploring the Design Space of Visual Context Representation in Video MLLMs
par: Du, Yifan, et autres
Publié: (2024)
par: Du, Yifan, et autres
Publié: (2024)
Needle In A Video Haystack: A Scalable Synthetic Evaluator for Video MLLMs
par: Zhao, Zijia, et autres
Publié: (2024)
par: Zhao, Zijia, et autres
Publié: (2024)
Memory-enhanced Retrieval Augmentation for Long Video Understanding
par: Yuan, Huaying, et autres
Publié: (2025)
par: Yuan, Huaying, et autres
Publié: (2025)
Spatio-Temporal Data Enhanced Vision-Language Model for Traffic Scene Understanding
par: Ma, Jingtian, et autres
Publié: (2025)
par: Ma, Jingtian, et autres
Publié: (2025)
Efficient Motion-Aware Video MLLM
par: Zhao, Zijia, et autres
Publié: (2025)
par: Zhao, Zijia, et autres
Publié: (2025)
Towards Unified Co-Speech Gesture Generation via Hierarchical Implicit Periodicity Learning
par: Guo, Xin, et autres
Publié: (2025)
par: Guo, Xin, et autres
Publié: (2025)
Generative Frame Sampler for Long Video Understanding
par: Yao, Linli, et autres
Publié: (2025)
par: Yao, Linli, et autres
Publié: (2025)
Virgo: A Preliminary Exploration on Reproducing o1-like MLLM
par: Du, Yifan, et autres
Publié: (2025)
par: Du, Yifan, et autres
Publié: (2025)
LongInsightBench: A Comprehensive Benchmark for Evaluating Omni-Modal Models on Human-Centric Long-Video Understanding
par: Han, ZhaoYang, et autres
Publié: (2025)
par: Han, ZhaoYang, et autres
Publié: (2025)
EdgeVision: Towards Collaborative Video Analytics on Distributed Edges for Performance Maximization
par: Gao, Guanyu, et autres
Publié: (2022)
par: Gao, Guanyu, et autres
Publié: (2022)
MMBench-Video: A Long-Form Multi-Shot Benchmark for Holistic Video Understanding
par: Fang, Xinyu, et autres
Publié: (2024)
par: Fang, Xinyu, et autres
Publié: (2024)
Video-EM: Event-Centric Episodic Memory for Long-Form Video Understanding
par: Wang, Yun, et autres
Publié: (2025)
par: Wang, Yun, et autres
Publié: (2025)
Video DataFlywheel: Resolving the Impossible Data Trinity in Video-Language Understanding
par: Wang, Xiao, et autres
Publié: (2024)
par: Wang, Xiao, et autres
Publié: (2024)
Towards Event Extraction from Speech with Contextual Clues
par: Kang, Jingqi, et autres
Publié: (2024)
par: Kang, Jingqi, et autres
Publié: (2024)
Laplacian Analysis Meets Dynamics Modelling: Gaussian Splatting for 4D Reconstruction
par: Zhou, Yifan, et autres
Publié: (2025)
par: Zhou, Yifan, et autres
Publié: (2025)
MV-Crafter: An Intelligent System for Music-guided Video Generation
par: Chen, Chuer, et autres
Publié: (2025)
par: Chen, Chuer, et autres
Publié: (2025)
Video2Roleplay: A Multimodal Dataset and Framework for Video-Guided Role-playing Agents
par: Zhang, Xueqiao, et autres
Publié: (2025)
par: Zhang, Xueqiao, et autres
Publié: (2025)
TCAN: Text-oriented Cross Attention Network for Multimodal Sentiment Analysis
par: Quan, Weize, et autres
Publié: (2024)
par: Quan, Weize, et autres
Publié: (2024)
Anchorage: Visual Analysis of Satisfaction in Customer Service Videos via Anchor Events
par: Wong, Kam Kwai, et autres
Publié: (2023)
par: Wong, Kam Kwai, et autres
Publié: (2023)
VideoCLIP-XL: Advancing Long Description Understanding for Video CLIP Models
par: Wang, Jiapeng, et autres
Publié: (2024)
par: Wang, Jiapeng, et autres
Publié: (2024)
LongVALE: Vision-Audio-Language-Event Benchmark Towards Time-Aware Omni-Modal Perception of Long Videos
par: Geng, Tiantian, et autres
Publié: (2024)
par: Geng, Tiantian, et autres
Publié: (2024)
Beyond Filtering: Adaptive Image-Text Quality Enhancement for MLLM Pretraining
par: Huang, Han, et autres
Publié: (2024)
par: Huang, Han, et autres
Publié: (2024)
ReTaKe: Reducing Temporal and Knowledge Redundancy for Long Video Understanding
par: Wang, Xiao, et autres
Publié: (2024)
par: Wang, Xiao, et autres
Publié: (2024)
Where to Focus: Query-Modulated Multimodal Keyframe Selection for Long Video Understanding
par: Wang, Shaoguang, et autres
Publié: (2026)
par: Wang, Shaoguang, et autres
Publié: (2026)
Towards Robust and Generalizable Continuous Space-Time Video Super-Resolution with Events
par: Wei, Shuoyan, et autres
Publié: (2025)
par: Wei, Shuoyan, et autres
Publié: (2025)
OneDiff: A Generalist Model for Image Difference Captioning
par: Hu, Erdong, et autres
Publié: (2024)
par: Hu, Erdong, et autres
Publié: (2024)
Extracting and Combining Abilities For Building Multi-lingual Ability-enhanced Large Language Models
par: Chen, Zhipeng, et autres
Publié: (2024)
par: Chen, Zhipeng, et autres
Publié: (2024)
Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing
par: Zhao, Pengcheng, et autres
Publié: (2024)
par: Zhao, Pengcheng, et autres
Publié: (2024)
Towards Understanding Camera Motions in Any Video
par: Lin, Zhiqiu, et autres
Publié: (2025)
par: Lin, Zhiqiu, et autres
Publié: (2025)
3DMIT: 3D Multi-modal Instruction Tuning for Scene Understanding
par: Li, Zeju, et autres
Publié: (2024)
par: Li, Zeju, et autres
Publié: (2024)
Towards Open-Vocabulary Audio-Visual Event Localization
par: Zhou, Jinxing, et autres
Publié: (2024)
par: Zhou, Jinxing, et autres
Publié: (2024)
UniCVR: From Alignment to Reranking for Unified Zero-Shot Composed Visual Retrieval
par: Wen, Haokun, et autres
Publié: (2026)
par: Wen, Haokun, et autres
Publié: (2026)
Multi-modal and Multi-scale Spatial Environment Understanding for Immersive Visual Text-to-Speech
par: Liu, Rui, et autres
Publié: (2024)
par: Liu, Rui, et autres
Publié: (2024)
OmniScript: Towards Audio-Visual Script Generation for Long-Form Cinematic Video
par: Pu, Junfu, et autres
Publié: (2026)
par: Pu, Junfu, et autres
Publié: (2026)
MMESGBench: Pioneering Multimodal Understanding and Complex Reasoning Benchmark for ESG Tasks
par: Zhang, Lei, et autres
Publié: (2025)
par: Zhang, Lei, et autres
Publié: (2025)
THE WASTIVE: An Interactive Ebb and Flow of Digital Fabrication Waste
par: Shan, Yifan, et autres
Publié: (2025)
par: Shan, Yifan, et autres
Publié: (2025)
Unveiling the Visual Rhetoric of Persuasive Cartography: A Case Study of the Design of Octopus Maps
par: Lin, Daocheng, et autres
Publié: (2025)
par: Lin, Daocheng, et autres
Publié: (2025)
Towards Robust Multimodal Sentiment Analysis with Incomplete Data
par: Zhang, Haoyu, et autres
Publié: (2024)
par: Zhang, Haoyu, et autres
Publié: (2024)
An Open Software Suite for Event-Based Video
par: Freeman, Andrew C.
Publié: (2024)
par: Freeman, Andrew C.
Publié: (2024)
TCC-Bench: Benchmarking the Traditional Chinese Culture Understanding Capabilities of MLLMs
par: Xu, Pengju, et autres
Publié: (2025)
par: Xu, Pengju, et autres
Publié: (2025)
Documents similaires
-
Exploring the Design Space of Visual Context Representation in Video MLLMs
par: Du, Yifan, et autres
Publié: (2024) -
Needle In A Video Haystack: A Scalable Synthetic Evaluator for Video MLLMs
par: Zhao, Zijia, et autres
Publié: (2024) -
Memory-enhanced Retrieval Augmentation for Long Video Understanding
par: Yuan, Huaying, et autres
Publié: (2025) -
Spatio-Temporal Data Enhanced Vision-Language Model for Traffic Scene Understanding
par: Ma, Jingtian, et autres
Publié: (2025) -
Efficient Motion-Aware Video MLLM
par: Zhao, Zijia, et autres
Publié: (2025)