FluxMem: Adaptive Hierarchical Memory for Streaming Video Understanding
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Xie, Yiweng, He, Bo, Wang, Junke, Zheng, Xiangyu, Ye, Ziyi, Wu, Zuxuan |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
StreamMem: Query-Agnostic KV Cache Memory for Streaming Video Understanding
von: Yang, Yanlai, et al.
Veröffentlicht: (2025)
von: Yang, Yanlai, et al.
Veröffentlicht: (2025)
FreshMem: Brain-Inspired Frequency-Space Hybrid Memory for Streaming Video Understanding
von: Li, Kangcong, et al.
Veröffentlicht: (2026)
von: Li, Kangcong, et al.
Veröffentlicht: (2026)
Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding
von: Wu, Hang, et al.
Veröffentlicht: (2026)
von: Wu, Hang, et al.
Veröffentlicht: (2026)
Pix2Cap-COCO: Advancing Visual Comprehension via Pixel-Level Captioning
von: You, Zuyao, et al.
Veröffentlicht: (2025)
von: You, Zuyao, et al.
Veröffentlicht: (2025)
VideoLoom: A Video Large Language Model for Joint Spatial-Temporal Understanding
von: Shi, Jiapeng, et al.
Veröffentlicht: (2026)
von: Shi, Jiapeng, et al.
Veröffentlicht: (2026)
Shallow Features Matter: Hierarchical Memory with Heterogeneous Interaction for Unsupervised Video Object Segmentation
von: Xiangyu, Zheng, et al.
Veröffentlicht: (2025)
von: Xiangyu, Zheng, et al.
Veröffentlicht: (2025)
HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding
von: Zhang, Haowei, et al.
Veröffentlicht: (2026)
von: Zhang, Haowei, et al.
Veröffentlicht: (2026)
SpatialMem: Metric-Aligned Long-Horizon Video Memory for Language Grounding and QA
von: Zheng, Xinyi, et al.
Veröffentlicht: (2026)
von: Zheng, Xinyi, et al.
Veröffentlicht: (2026)
Enhancing Long Video Understanding via Hierarchical Event-Based Memory
von: Cheng, Dingxin, et al.
Veröffentlicht: (2024)
von: Cheng, Dingxin, et al.
Veröffentlicht: (2024)
VLA-Pro: Cross-Task Procedural Memory Transfer for Vision-Language-Action Models
von: Si, Shengyu, et al.
Veröffentlicht: (2026)
von: Si, Shengyu, et al.
Veröffentlicht: (2026)
Streaming Video Understanding and Multi-round Interaction with Memory-enhanced Knowledge
von: Xiong, Haomiao, et al.
Veröffentlicht: (2025)
von: Xiong, Haomiao, et al.
Veröffentlicht: (2025)
MemCam: Memory-Augmented Camera Control for Consistent Video Generation
von: Gao, Xinhang, et al.
Veröffentlicht: (2026)
von: Gao, Xinhang, et al.
Veröffentlicht: (2026)
StreamingBench: Assessing the Gap for MLLMs to Achieve Streaming Video Understanding
von: Lin, Junming, et al.
Veröffentlicht: (2024)
von: Lin, Junming, et al.
Veröffentlicht: (2024)
Video-EM: Event-Centric Episodic Memory for Long-Form Video Understanding
von: Wang, Yun, et al.
Veröffentlicht: (2025)
von: Wang, Yun, et al.
Veröffentlicht: (2025)
H2VU-Benchmark: A Comprehensive Benchmark for Hierarchical Holistic Video Understanding
von: Wu, Qi, et al.
Veröffentlicht: (2025)
von: Wu, Qi, et al.
Veröffentlicht: (2025)
EgoMemReason: A Memory-Driven Reasoning Benchmark for Long-Horizon Egocentric Video Understanding
von: Wang, Ziyang, et al.
Veröffentlicht: (2026)
von: Wang, Ziyang, et al.
Veröffentlicht: (2026)
SANA-Streaming: Real-time Streaming Video Editing with Hybrid Diffusion Transformer
von: Zhao, Yuyang, et al.
Veröffentlicht: (2026)
von: Zhao, Yuyang, et al.
Veröffentlicht: (2026)
VidLaDA: Bidirectional Diffusion Large Language Models for Efficient Video Understanding
von: He, Zhihao, et al.
Veröffentlicht: (2026)
von: He, Zhihao, et al.
Veröffentlicht: (2026)
OmniVid: A Generative Framework for Universal Video Understanding
von: Wang, Junke, et al.
Veröffentlicht: (2024)
von: Wang, Junke, et al.
Veröffentlicht: (2024)
StreamingTOM: Streaming Token Compression for Efficient Video Understanding
von: Chen, Xueyi, et al.
Veröffentlicht: (2025)
von: Chen, Xueyi, et al.
Veröffentlicht: (2025)
Em-Garde: A Propose-Match Framework for Proactive Streaming Video Understanding
von: Zheng, Yikai, et al.
Veröffentlicht: (2026)
von: Zheng, Yikai, et al.
Veröffentlicht: (2026)
MemOVCD: Training-Free Open-Vocabulary Change Detection via Cross-Temporal Memory Reasoning and Global-Local Adaptive Rectification
von: Kuang, Zuzheng, et al.
Veröffentlicht: (2026)
von: Kuang, Zuzheng, et al.
Veröffentlicht: (2026)
StreamingVLM: Real-Time Understanding for Infinite Video Streams
von: Xu, Ruyi, et al.
Veröffentlicht: (2025)
von: Xu, Ruyi, et al.
Veröffentlicht: (2025)
Adaptive Keyframe Sampling for Long Video Understanding
von: Tang, Xi, et al.
Veröffentlicht: (2025)
von: Tang, Xi, et al.
Veröffentlicht: (2025)
Visual Agentic Memory: Enabling Online Long Video Understanding via Online Indexing, Hierarchical Memory, and Agentic Retrieval
von: Li, Aiden Yiliu, et al.
Veröffentlicht: (2026)
von: Li, Aiden Yiliu, et al.
Veröffentlicht: (2026)
EventMemAgent: Hierarchical Event-Centric Memory for Online Video Understanding with Adaptive Tool Use
von: Wen, Siwei, et al.
Veröffentlicht: (2026)
von: Wen, Siwei, et al.
Veröffentlicht: (2026)
Event-VStream: Event-Driven Real-Time Understanding for Long Video Streams
von: Guo, Zhenghui, et al.
Veröffentlicht: (2026)
von: Guo, Zhenghui, et al.
Veröffentlicht: (2026)
TeleMem: Building Long-Term and Multimodal Memory for Agentic AI
von: Chen, Chunliang, et al.
Veröffentlicht: (2025)
von: Chen, Chunliang, et al.
Veröffentlicht: (2025)
PEARL: Personalized Streaming Video Understanding Model
von: Zheng, Yuanhong, et al.
Veröffentlicht: (2026)
von: Zheng, Yuanhong, et al.
Veröffentlicht: (2026)
AdaDiff: Adaptive Step Selection for Fast Diffusion Models
von: Zhang, Hui, et al.
Veröffentlicht: (2023)
von: Zhang, Hui, et al.
Veröffentlicht: (2023)
Mem4Nav: Boosting Vision-and-Language Navigation in Urban Environments with a Hierarchical Spatial-Cognition Long-Short Memory System
von: He, Lixuan, et al.
Veröffentlicht: (2025)
von: He, Lixuan, et al.
Veröffentlicht: (2025)
Response-G1: Explicit Scene Graph Modeling for Proactive Streaming Video Understanding
von: Ma, Ke, et al.
Veröffentlicht: (2026)
von: Ma, Ke, et al.
Veröffentlicht: (2026)
AdaCM$^2$: On Understanding Extremely Long-Term Video with Adaptive Cross-Modality Memory Reduction
von: Man, Yuanbin, et al.
Veröffentlicht: (2024)
von: Man, Yuanbin, et al.
Veröffentlicht: (2024)
Thinking in Streaming Video
von: Liu, Zikang, et al.
Veröffentlicht: (2026)
von: Liu, Zikang, et al.
Veröffentlicht: (2026)
STRIDE: When to Speak Meets Sequence Denoising for Streaming Video Understanding
von: Kim, Junho, et al.
Veröffentlicht: (2026)
von: Kim, Junho, et al.
Veröffentlicht: (2026)
ViaRL: Adaptive Temporal Grounding via Visual Iterated Amplification Reinforcement Learning
von: Xu, Ziqiang, et al.
Veröffentlicht: (2025)
von: Xu, Ziqiang, et al.
Veröffentlicht: (2025)
DualMem: Bypassing the Objectness Bottleneck for Calibrated Unknown-Stream Filtering in Open-World Object Detection
von: Xiao, Yingjun, et al.
Veröffentlicht: (2026)
von: Xiao, Yingjun, et al.
Veröffentlicht: (2026)
MagDiff: Multi-Alignment Diffusion for High-Fidelity Video Generation and Editing
von: Zhao, Haoyu, et al.
Veröffentlicht: (2023)
von: Zhao, Haoyu, et al.
Veröffentlicht: (2023)
LiveStar: Live Streaming Assistant for Real-World Online Video Understanding
von: Yang, Zhenyu, et al.
Veröffentlicht: (2025)
von: Yang, Zhenyu, et al.
Veröffentlicht: (2025)
StreamingAssistant: Efficient Visual Token Pruning for Accelerating Online Video Understanding
von: Jin, Xinqi, et al.
Veröffentlicht: (2025)
von: Jin, Xinqi, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
StreamMem: Query-Agnostic KV Cache Memory for Streaming Video Understanding
von: Yang, Yanlai, et al.
Veröffentlicht: (2025) -
FreshMem: Brain-Inspired Frequency-Space Hybrid Memory for Streaming Video Understanding
von: Li, Kangcong, et al.
Veröffentlicht: (2026) -
Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding
von: Wu, Hang, et al.
Veröffentlicht: (2026) -
Pix2Cap-COCO: Advancing Visual Comprehension via Pixel-Level Captioning
von: You, Zuyao, et al.
Veröffentlicht: (2025) -
VideoLoom: A Video Large Language Model for Joint Spatial-Temporal Understanding
von: Shi, Jiapeng, et al.
Veröffentlicht: (2026)