StreamingEval: A Unified Evaluation Protocol towards Realistic Streaming Video Understanding
Fuente:
arXiv
Guardado en:
| Autores principales: | Tang, Guowei, Qian, Tianwen, Zheng, Huanran, Wang, Yifei, Wang, Xiaoling |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
StreamEQA: Towards Streaming Video Understanding for Embodied Scenarios
por: Wang, Yifei, et al.
Publicado: (2025)
por: Wang, Yifei, et al.
Publicado: (2025)
SSNVC: Single Stream Neural Video Compression with Implicit Temporal Information
por: Wang, Feng, et al.
Publicado: (2024)
por: Wang, Feng, et al.
Publicado: (2024)
A Survey on Generative AI and LLM for Video Generation, Understanding, and Streaming
por: Zhou, Pengyuan, et al.
Publicado: (2024)
por: Zhou, Pengyuan, et al.
Publicado: (2024)
Looking Backward: Streaming Video-to-Video Translation with Feature Banks
por: Liang, Feng, et al.
Publicado: (2024)
por: Liang, Feng, et al.
Publicado: (2024)
Adaptive 3D Gaussian Splatting Video Streaming
por: Gong, Han, et al.
Publicado: (2025)
por: Gong, Han, et al.
Publicado: (2025)
Viewport Prediction for Volumetric Video Streaming by Exploring Video Saliency and Trajectory Information
por: Li, Jie, et al.
Publicado: (2023)
por: Li, Jie, et al.
Publicado: (2023)
Hallo-Live: Real-Time Streaming Joint Audio-Video Avatar Generation with Asynchronous Dual-Stream and Human-Centric Preference Distillation
por: Li, Chunyu, et al.
Publicado: (2026)
por: Li, Chunyu, et al.
Publicado: (2026)
A Multimodal Transformer for Live Streaming Highlight Prediction
por: Deng, Jiaxin, et al.
Publicado: (2024)
por: Deng, Jiaxin, et al.
Publicado: (2024)
SwinGS: Sliding Window Gaussian Splatting for Volumetric Video Streaming with Arbitrary Length
por: Liu, Bangya, et al.
Publicado: (2024)
por: Liu, Bangya, et al.
Publicado: (2024)
High-Quality Live Video Streaming via Transcoding Time Prediction and Preset Selection
por: Shahre-Babak, Zahra Nabizadeh, et al.
Publicado: (2023)
por: Shahre-Babak, Zahra Nabizadeh, et al.
Publicado: (2023)
Learning Long-Range Action Representation by Two-Stream Mamba Pyramid Network for Figure Skating Assessment
por: Wang, Fengshun, et al.
Publicado: (2025)
por: Wang, Fengshun, et al.
Publicado: (2025)
Memory-enhanced Retrieval Augmentation for Long Video Understanding
por: Yuan, Huaying, et al.
Publicado: (2025)
por: Yuan, Huaying, et al.
Publicado: (2025)
TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos
por: Kong, Fanheng, et al.
Publicado: (2025)
por: Kong, Fanheng, et al.
Publicado: (2025)
Emotion-Qwen: A Unified Framework for Emotion and Vision Understanding
por: Huang, Dawei, et al.
Publicado: (2025)
por: Huang, Dawei, et al.
Publicado: (2025)
LapisGS: Layered Progressive 3D Gaussian Splatting for Adaptive Streaming
por: Shi, Yuang, et al.
Publicado: (2024)
por: Shi, Yuang, et al.
Publicado: (2024)
When Video Coding Meets Multimodal Large Language Models: A Unified Paradigm for Video Coding
por: Zhang, Pingping, et al.
Publicado: (2024)
por: Zhang, Pingping, et al.
Publicado: (2024)
Scalable Event-Based Video Streaming for Machines with MoQ
por: Freeman, Andrew C.
Publicado: (2025)
por: Freeman, Andrew C.
Publicado: (2025)
TMFNet: Two-Stream Multi-Channels Fusion Networks for Color Image Operation Chain Detection
por: Niu, Yakun, et al.
Publicado: (2024)
por: Niu, Yakun, et al.
Publicado: (2024)
Editing Physiological Signals in Videos Using Latent Representations
por: Zhou, Tianwen, et al.
Publicado: (2025)
por: Zhou, Tianwen, et al.
Publicado: (2025)
Multimodal Fake News Video Explanation: Dataset, Analysis and Evaluation
por: Chen, Lizhi, et al.
Publicado: (2025)
por: Chen, Lizhi, et al.
Publicado: (2025)
MuKV: Multi-Grained KV Cache Compression for Long Streaming Video Question-Answering
por: Xiao, Junbin, et al.
Publicado: (2026)
por: Xiao, Junbin, et al.
Publicado: (2026)
VIoTGPT: Learning to Schedule Vision Tools in LLMs towards Intelligent Video Internet of Things
por: Zhong, Yaoyao, et al.
Publicado: (2023)
por: Zhong, Yaoyao, et al.
Publicado: (2023)
FMNV: A Dataset of Media-Published News Videos for Fake News Detection
por: Wang, Yihao, et al.
Publicado: (2025)
por: Wang, Yihao, et al.
Publicado: (2025)
SequencePAR: Understanding Pedestrian Attributes via A Sequence Generation Paradigm
por: Jin, Jiandong, et al.
Publicado: (2023)
por: Jin, Jiandong, et al.
Publicado: (2023)
Where to Focus: Query-Modulated Multimodal Keyframe Selection for Long Video Understanding
por: Wang, Shaoguang, et al.
Publicado: (2026)
por: Wang, Shaoguang, et al.
Publicado: (2026)
Error Analyses of Auto-Regressive Video Diffusion Models: A Unified Framework
por: Wang, Jing, et al.
Publicado: (2025)
por: Wang, Jing, et al.
Publicado: (2025)
EVAN: Evolutional Video Streaming Adaptation via Neural Representation
por: Liu, Mufan, et al.
Publicado: (2024)
por: Liu, Mufan, et al.
Publicado: (2024)
VideoCLIP-XL: Advancing Long Description Understanding for Video CLIP Models
por: Wang, Jiapeng, et al.
Publicado: (2024)
por: Wang, Jiapeng, et al.
Publicado: (2024)
TimeLoc: A Unified End-to-End Framework for Precise Timestamp Localization in Long Videos
por: Zhang, Chen-Lin, et al.
Publicado: (2025)
por: Zhang, Chen-Lin, et al.
Publicado: (2025)
JavisDiT++: Unified Modeling and Optimization for Joint Audio-Video Generation
por: Liu, Kai, et al.
Publicado: (2026)
por: Liu, Kai, et al.
Publicado: (2026)
Generative Frame Sampler for Long Video Understanding
por: Yao, Linli, et al.
Publicado: (2025)
por: Yao, Linli, et al.
Publicado: (2025)
LongInsightBench: A Comprehensive Benchmark for Evaluating Omni-Modal Models on Human-Centric Long-Video Understanding
por: Han, ZhaoYang, et al.
Publicado: (2025)
por: Han, ZhaoYang, et al.
Publicado: (2025)
MMBench-Video: A Long-Form Multi-Shot Benchmark for Holistic Video Understanding
por: Fang, Xinyu, et al.
Publicado: (2024)
por: Fang, Xinyu, et al.
Publicado: (2024)
Towards Realistic Low-Light Image Enhancement via ISP Driven Data Modeling
por: Wang, Zhihua, et al.
Publicado: (2025)
por: Wang, Zhihua, et al.
Publicado: (2025)
Consistency-aware Fake Videos Detection on Short Video Platforms
por: Wang, Junxi, et al.
Publicado: (2025)
por: Wang, Junxi, et al.
Publicado: (2025)
MSVBench: Towards Human-Level Evaluation of Multi-Shot Video Generation
por: Shi, Haoyuan, et al.
Publicado: (2026)
por: Shi, Haoyuan, et al.
Publicado: (2026)
UniAnimate-DiT: Human Image Animation with Large-Scale Video Diffusion Transformer
por: Wang, Xiang, et al.
Publicado: (2025)
por: Wang, Xiang, et al.
Publicado: (2025)
Multi-Modal Image Fusion via Intervention-Stable Feature Learning
por: Wang, Xue, et al.
Publicado: (2026)
por: Wang, Xue, et al.
Publicado: (2026)
Can Video Diffusion Models Predict Past Frames? Bidirectional Cycle Consistency for Reversible Interpolation
por: Liu, Lingyu, et al.
Publicado: (2026)
por: Liu, Lingyu, et al.
Publicado: (2026)
Hybrid Local-Global Context Learning for Neural Video Compression
por: Zhai, Yongqi, et al.
Publicado: (2024)
por: Zhai, Yongqi, et al.
Publicado: (2024)
Ejemplares similares
-
StreamEQA: Towards Streaming Video Understanding for Embodied Scenarios
por: Wang, Yifei, et al.
Publicado: (2025) -
SSNVC: Single Stream Neural Video Compression with Implicit Temporal Information
por: Wang, Feng, et al.
Publicado: (2024) -
A Survey on Generative AI and LLM for Video Generation, Understanding, and Streaming
por: Zhou, Pengyuan, et al.
Publicado: (2024) -
Looking Backward: Streaming Video-to-Video Translation with Feature Banks
por: Liang, Feng, et al.
Publicado: (2024) -
Adaptive 3D Gaussian Splatting Video Streaming
por: Gong, Han, et al.
Publicado: (2025)