EventFormer: A Node-graph Hierarchical Attention Transformer for Action-centric Video Event Prediction
Fuente:
arXiv
Salvato in:
| Autori principali: | Su, Qile, Zhu, Shoutai, Zhang, Shuai, Liang, Baoyu, Tong, Chao |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Video-CoE: Reinforcing Video Event Prediction via Chain of Events
di: Su, Qile, et al.
Pubblicazione: (2026)
di: Su, Qile, et al.
Pubblicazione: (2026)
Cross-Modal Transfer from Memes to Videos: Addressing Data Scarcity in Hateful Video Detection
di: Wang, Han, et al.
Pubblicazione: (2025)
di: Wang, Han, et al.
Pubblicazione: (2025)
Light Future: Multimodal Action Frame Prediction via InstructPix2Pix
di: Zhong, Zesen, et al.
Pubblicazione: (2025)
di: Zhong, Zesen, et al.
Pubblicazione: (2025)
AIM 2024 Challenge on Video Saliency Prediction: Methods and Results
di: Moskalenko, Andrey, et al.
Pubblicazione: (2024)
di: Moskalenko, Andrey, et al.
Pubblicazione: (2024)
NTIRE 2026 Challenge on Video Saliency Prediction: Methods and Results
di: Moskalenko, Andrey, et al.
Pubblicazione: (2026)
di: Moskalenko, Andrey, et al.
Pubblicazione: (2026)
SIA-OVD: Shape-Invariant Adapter for Bridging the Image-Region Gap in Open-Vocabulary Detection
di: Wang, Zishuo, et al.
Pubblicazione: (2024)
di: Wang, Zishuo, et al.
Pubblicazione: (2024)
Implicit Location-Caption Alignment via Complementary Masking for Weakly-Supervised Dense Video Captioning
di: Ge, Shiping, et al.
Pubblicazione: (2024)
di: Ge, Shiping, et al.
Pubblicazione: (2024)
ForensicFormer: Hierarchical Multi-Scale Reasoning for Cross-Domain Image Forgery Detection
di: Samson, Hema Hariharan
Pubblicazione: (2026)
di: Samson, Hema Hariharan
Pubblicazione: (2026)
Meaning over Motion: A Semantic-First Approach to 360° Viewport Prediction
di: Khah, Arman Nik, et al.
Pubblicazione: (2026)
di: Khah, Arman Nik, et al.
Pubblicazione: (2026)
Leum-VL Technical Report
di: He, Yuxuan, et al.
Pubblicazione: (2026)
di: He, Yuxuan, et al.
Pubblicazione: (2026)
A Hybrid Deterministic Framework for Named Entity Extraction in Broadcast News Video
di: Lucas, Andrea Filiberto, et al.
Pubblicazione: (2026)
di: Lucas, Andrea Filiberto, et al.
Pubblicazione: (2026)
Geo2Sound: A Scalable Geo-Aligned Framework for Soundscape Generation from Satellite Imagery
di: Wu, Kunlin, et al.
Pubblicazione: (2026)
di: Wu, Kunlin, et al.
Pubblicazione: (2026)
Gear-NeRF: Free-Viewpoint Rendering and Tracking with Motion-aware Spatio-Temporal Sampling
di: Liu, Xinhang, et al.
Pubblicazione: (2024)
di: Liu, Xinhang, et al.
Pubblicazione: (2024)
ActAlign: Zero-Shot Fine-Grained Video Classification via Language-Guided Sequence Alignment
di: Aghdam, Amir, et al.
Pubblicazione: (2025)
di: Aghdam, Amir, et al.
Pubblicazione: (2025)
AVControl: Efficient Framework for Training Audio-Visual Controls
di: Ben-Yosef, Matan, et al.
Pubblicazione: (2026)
di: Ben-Yosef, Matan, et al.
Pubblicazione: (2026)
Semantic2Graph: Graph-based Multi-modal Feature Fusion for Action Segmentation in Videos
di: Zhang, Junbin, et al.
Pubblicazione: (2022)
di: Zhang, Junbin, et al.
Pubblicazione: (2022)
Scene Detection Policies and Keyframe Extraction Strategies for Large-Scale Video Analysis
di: Korolkov, Vasilii
Pubblicazione: (2025)
di: Korolkov, Vasilii
Pubblicazione: (2025)
Automatic Detection of Intro and Credits in Video using CLIP and Multihead Attention
di: Korolkov, Vasilii, et al.
Pubblicazione: (2025)
di: Korolkov, Vasilii, et al.
Pubblicazione: (2025)
MemeCraft: Contextual and Stance-Driven Multimodal Meme Generation
di: Wang, Han, et al.
Pubblicazione: (2024)
di: Wang, Han, et al.
Pubblicazione: (2024)
3DGesPolicy: Phoneme-Aware Holistic Co-Speech Gesture Generation Based on Action Control
di: Sha, Xuanmeng, et al.
Pubblicazione: (2026)
di: Sha, Xuanmeng, et al.
Pubblicazione: (2026)
A Real-Time, Vision-Based System for Badminton Smash Speed Estimation on Mobile Devices
di: Huang, Diwen
Pubblicazione: (2025)
di: Huang, Diwen
Pubblicazione: (2025)
MetaErr: Towards Predicting Error Patterns in Deep Neural Networks
di: Totakura, Varun, et al.
Pubblicazione: (2026)
di: Totakura, Varun, et al.
Pubblicazione: (2026)
VidEvent: A Large Dataset for Understanding Dynamic Evolution of Events in Videos
di: Liang, Baoyu, et al.
Pubblicazione: (2025)
di: Liang, Baoyu, et al.
Pubblicazione: (2025)
ActNetFormer: Transformer-ResNet Hybrid Method for Semi-Supervised Action Recognition in Videos
di: Dass, Sharana Dharshikgan Suresh, et al.
Pubblicazione: (2024)
di: Dass, Sharana Dharshikgan Suresh, et al.
Pubblicazione: (2024)
CLIP-Joint-Detect: End-to-End Joint Training of Object Detectors with Contrastive Vision-Language Supervision
di: Raoufi, Behnam, et al.
Pubblicazione: (2025)
di: Raoufi, Behnam, et al.
Pubblicazione: (2025)
Video Event Reasoning and Prediction by Fusing World Knowledge from LLMs with Vision Foundation Models
di: Dubois, L'ea, et al.
Pubblicazione: (2025)
di: Dubois, L'ea, et al.
Pubblicazione: (2025)
A Roadmap for Multilingual, Multimodal Domain Independent Deception Detection
di: Boumber, Dainis, et al.
Pubblicazione: (2024)
di: Boumber, Dainis, et al.
Pubblicazione: (2024)
Context-Aware Network Based on Multi-scale Spatio-temporal Attention for Action Recognition in Videos
di: Li, Xiaoyang, et al.
Pubblicazione: (2025)
di: Li, Xiaoyang, et al.
Pubblicazione: (2025)
Perception-Consistency Multimodal Large Language Models Reasoning via Caption-Regularized Policy Optimization
di: Tu, Songjun, et al.
Pubblicazione: (2025)
di: Tu, Songjun, et al.
Pubblicazione: (2025)
Benchmarking and Bridging Emotion Conflicts for Multimodal Emotion Reasoning
di: Han, Zhiyuan, et al.
Pubblicazione: (2025)
di: Han, Zhiyuan, et al.
Pubblicazione: (2025)
Motion Attribution for Video Generation
di: Wu, Xindi, et al.
Pubblicazione: (2026)
di: Wu, Xindi, et al.
Pubblicazione: (2026)
AdSum: Two-stream Audio-visual Summarization for Automated Video Advertisement Clipping
di: Xie, Wen, et al.
Pubblicazione: (2025)
di: Xie, Wen, et al.
Pubblicazione: (2025)
FocusedAD: Character-centric Movie Audio Description
di: Ye, Xiaojun, et al.
Pubblicazione: (2025)
di: Ye, Xiaojun, et al.
Pubblicazione: (2025)
Labels or Input? Rethinking Augmentation in Multimodal Hate Detection
di: Singh, Sahajpreet, et al.
Pubblicazione: (2025)
di: Singh, Sahajpreet, et al.
Pubblicazione: (2025)
Graph-PiT: Enhancing Structural Coherence in Part-Based Image Synthesis via Graph Priors
di: Zhang, Junbin, et al.
Pubblicazione: (2026)
di: Zhang, Junbin, et al.
Pubblicazione: (2026)
Bridging Knowledge Gap Between Image Inpainting and Large-Area Visible Watermark Removal
di: Leng, Yicheng, et al.
Pubblicazione: (2025)
di: Leng, Yicheng, et al.
Pubblicazione: (2025)
EventFlow: Real-Time Neuromorphic Event-Driven Classification of Two-Phase Boiling Flow Regimes
di: Chang, Sanghyeon, et al.
Pubblicazione: (2025)
di: Chang, Sanghyeon, et al.
Pubblicazione: (2025)
Efficient and Privacy-Protecting Background Removal for 2D Video Streaming using iPhone 15 Pro Max LiDAR
di: Kinnevan, Jessica, et al.
Pubblicazione: (2025)
di: Kinnevan, Jessica, et al.
Pubblicazione: (2025)
Genflow Ad Studio: A Compound AI Architecture for Brand-Aligned, Self-Correcting Video Generation
di: Das, Debanshu, et al.
Pubblicazione: (2026)
di: Das, Debanshu, et al.
Pubblicazione: (2026)
An Empirical Study for Representations of Videos in Video Question Answering via MLLMs
di: Li, Zhi, et al.
Pubblicazione: (2025)
di: Li, Zhi, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Video-CoE: Reinforcing Video Event Prediction via Chain of Events
di: Su, Qile, et al.
Pubblicazione: (2026) -
Cross-Modal Transfer from Memes to Videos: Addressing Data Scarcity in Hateful Video Detection
di: Wang, Han, et al.
Pubblicazione: (2025) -
Light Future: Multimodal Action Frame Prediction via InstructPix2Pix
di: Zhong, Zesen, et al.
Pubblicazione: (2025) -
AIM 2024 Challenge on Video Saliency Prediction: Methods and Results
di: Moskalenko, Andrey, et al.
Pubblicazione: (2024) -
NTIRE 2026 Challenge on Video Saliency Prediction: Methods and Results
di: Moskalenko, Andrey, et al.
Pubblicazione: (2026)