FreshMem: Brain-Inspired Frequency-Space Hybrid Memory for Streaming Video Understanding
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Kangcong, Ye, Peng, Zhang, Lin, Wang, Chao, Qin, Huafeng, Chen, Tao |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
CurveStream: Boosting Streaming Video Understanding in MLLMs via Curvature-Aware Hierarchical Visual Memory Management
di: Wang, Chao, et al.
Pubblicazione: (2026)
di: Wang, Chao, et al.
Pubblicazione: (2026)
FluxMem: Adaptive Hierarchical Memory for Streaming Video Understanding
di: Xie, Yiweng, et al.
Pubblicazione: (2026)
di: Xie, Yiweng, et al.
Pubblicazione: (2026)
StreamMem: Query-Agnostic KV Cache Memory for Streaming Video Understanding
di: Yang, Yanlai, et al.
Pubblicazione: (2025)
di: Yang, Yanlai, et al.
Pubblicazione: (2025)
BrainMem: Brain-Inspired Evolving Memory for Embodied Agent Task Planning
di: Ma, Xiaoyu, et al.
Pubblicazione: (2026)
di: Ma, Xiaoyu, et al.
Pubblicazione: (2026)
StreamingTOM: Streaming Token Compression for Efficient Video Understanding
di: Chen, Xueyi, et al.
Pubblicazione: (2025)
di: Chen, Xueyi, et al.
Pubblicazione: (2025)
StreamingBench: Assessing the Gap for MLLMs to Achieve Streaming Video Understanding
di: Lin, Junming, et al.
Pubblicazione: (2024)
di: Lin, Junming, et al.
Pubblicazione: (2024)
Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding
di: Wu, Hang, et al.
Pubblicazione: (2026)
di: Wu, Hang, et al.
Pubblicazione: (2026)
Streaming Video Understanding and Multi-round Interaction with Memory-enhanced Knowledge
di: Xiong, Haomiao, et al.
Pubblicazione: (2025)
di: Xiong, Haomiao, et al.
Pubblicazione: (2025)
MosaicMem: Hybrid Spatial Memory for Controllable Video World Models
di: Yu, Wei, et al.
Pubblicazione: (2026)
di: Yu, Wei, et al.
Pubblicazione: (2026)
MemCam: Memory-Augmented Camera Control for Consistent Video Generation
di: Gao, Xinhang, et al.
Pubblicazione: (2026)
di: Gao, Xinhang, et al.
Pubblicazione: (2026)
SANA-Streaming: Real-time Streaming Video Editing with Hybrid Diffusion Transformer
di: Zhao, Yuyang, et al.
Pubblicazione: (2026)
di: Zhao, Yuyang, et al.
Pubblicazione: (2026)
StreamOV: Streaming Omni-Video Understanding via Evidence-Guided Memory and Response Triggering
di: Xie, Ming, et al.
Pubblicazione: (2026)
di: Xie, Ming, et al.
Pubblicazione: (2026)
EgoMemReason: A Memory-Driven Reasoning Benchmark for Long-Horizon Egocentric Video Understanding
di: Wang, Ziyang, et al.
Pubblicazione: (2026)
di: Wang, Ziyang, et al.
Pubblicazione: (2026)
Scaling the Long Video Understanding of Multimodal Large Language Models via Visual Memory Mechanism
di: Chen, Tao, et al.
Pubblicazione: (2026)
di: Chen, Tao, et al.
Pubblicazione: (2026)
SpatialMem: Metric-Aligned Long-Horizon Video Memory for Language Grounding and QA
di: Zheng, Xinyi, et al.
Pubblicazione: (2026)
di: Zheng, Xinyi, et al.
Pubblicazione: (2026)
FAVOR-Bench: A Comprehensive Benchmark for Fine-Grained Video Motion Understanding
di: Tu, Chongjun, et al.
Pubblicazione: (2025)
di: Tu, Chongjun, et al.
Pubblicazione: (2025)
Understanding Cross Task Generalization in Handwriting-Based Alzheimer's Screening via Vision Language Adaptation
di: Gong, Changqing, et al.
Pubblicazione: (2025)
di: Gong, Changqing, et al.
Pubblicazione: (2025)
VideoMem: Enhancing Ultra-Long Video Understanding via Adaptive Memory Management
di: Jin, Hongbo, et al.
Pubblicazione: (2025)
di: Jin, Hongbo, et al.
Pubblicazione: (2025)
Memory-Inspired Temporal Prompt Interaction for Text-Image Classification
di: Yu, Xinyao, et al.
Pubblicazione: (2024)
di: Yu, Xinyao, et al.
Pubblicazione: (2024)
Multi-Level Decoupled Relational Distillation for Heterogeneous Architectures
di: Yang, Yaoxin, et al.
Pubblicazione: (2025)
di: Yang, Yaoxin, et al.
Pubblicazione: (2025)
Hybrid Transformer for Early Alzheimer's Detection: Integration of Handwriting-Based 2D Images and 1D Signal Features
di: Gong, Changqing, et al.
Pubblicazione: (2024)
di: Gong, Changqing, et al.
Pubblicazione: (2024)
HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding
di: Zhang, Haowei, et al.
Pubblicazione: (2026)
di: Zhang, Haowei, et al.
Pubblicazione: (2026)
Symphony: A Cognitively-Inspired Multi-Agent System for Long-Video Understanding
di: Yan, Haiyang, et al.
Pubblicazione: (2026)
di: Yan, Haiyang, et al.
Pubblicazione: (2026)
VisMem: Latent Vision Memory Unlocks Potential of Vision-Language Models
di: Yu, Xinlei, et al.
Pubblicazione: (2025)
di: Yu, Xinlei, et al.
Pubblicazione: (2025)
TeleMem: Building Long-Term and Multimodal Memory for Agentic AI
di: Chen, Chunliang, et al.
Pubblicazione: (2025)
di: Chen, Chunliang, et al.
Pubblicazione: (2025)
DualMem: Bypassing the Objectness Bottleneck for Calibrated Unknown-Stream Filtering in Open-World Object Detection
di: Xiao, Yingjun, et al.
Pubblicazione: (2026)
di: Xiao, Yingjun, et al.
Pubblicazione: (2026)
MemFlow: Flowing Adaptive Memory for Consistent and Efficient Long Video Narratives
di: Ji, Sihui, et al.
Pubblicazione: (2025)
di: Ji, Sihui, et al.
Pubblicazione: (2025)
SC-Captioner: Improving Image Captioning with Self-Correction by Reinforcement Learning
di: Zhang, Lin, et al.
Pubblicazione: (2025)
di: Zhang, Lin, et al.
Pubblicazione: (2025)
StreamingVLM: Real-Time Understanding for Infinite Video Streams
di: Xu, Ruyi, et al.
Pubblicazione: (2025)
di: Xu, Ruyi, et al.
Pubblicazione: (2025)
Mem3R: Streaming 3D Reconstruction with Hybrid Memory via Test-Time Training
di: Liu, Changkun, et al.
Pubblicazione: (2026)
di: Liu, Changkun, et al.
Pubblicazione: (2026)
Brain Inspired Adaptive Memory Dual-Net for Few-Shot Image Classification
di: Di, Kexin, et al.
Pubblicazione: (2025)
di: Di, Kexin, et al.
Pubblicazione: (2025)
StreamingAssistant: Efficient Visual Token Pruning for Accelerating Online Video Understanding
di: Jin, Xinqi, et al.
Pubblicazione: (2025)
di: Jin, Xinqi, et al.
Pubblicazione: (2025)
Cognition-Inspired Dual-Stream Semantic Enhancement for Vision-Based Dynamic Emotion Modeling
di: Wang, Huanzhen, et al.
Pubblicazione: (2026)
di: Wang, Huanzhen, et al.
Pubblicazione: (2026)
PEARL: Personalized Streaming Video Understanding Model
di: Zheng, Yuanhong, et al.
Pubblicazione: (2026)
di: Zheng, Yuanhong, et al.
Pubblicazione: (2026)
OmniMem: Scalable and Adaptive Memory Retrieval for Long Video Generation
di: Zhao, Lin, et al.
Pubblicazione: (2026)
di: Zhao, Lin, et al.
Pubblicazione: (2026)
Event-VStream: Event-Driven Real-Time Understanding for Long Video Streams
di: Guo, Zhenghui, et al.
Pubblicazione: (2026)
di: Guo, Zhenghui, et al.
Pubblicazione: (2026)
DeltaSpace: A Semantic-aligned Feature Space for Flexible Text-guided Image Editing
di: Lyu, Yueming, et al.
Pubblicazione: (2023)
di: Lyu, Yueming, et al.
Pubblicazione: (2023)
A Survey on Generative AI and LLM for Video Generation, Understanding, and Streaming
di: Zhou, Pengyuan, et al.
Pubblicazione: (2024)
di: Zhou, Pengyuan, et al.
Pubblicazione: (2024)
Lumos-Nexus: Efficient Frequency Bridging with Homogeneous Latent Space for Video Unified Models
di: Xing, Jiazheng, et al.
Pubblicazione: (2026)
di: Xing, Jiazheng, et al.
Pubblicazione: (2026)
VideoSSM: Autoregressive Long Video Generation with Hybrid State-Space Memory
di: Yu, Yifei, et al.
Pubblicazione: (2025)
di: Yu, Yifei, et al.
Pubblicazione: (2025)
Documenti analoghi
-
CurveStream: Boosting Streaming Video Understanding in MLLMs via Curvature-Aware Hierarchical Visual Memory Management
di: Wang, Chao, et al.
Pubblicazione: (2026) -
FluxMem: Adaptive Hierarchical Memory for Streaming Video Understanding
di: Xie, Yiweng, et al.
Pubblicazione: (2026) -
StreamMem: Query-Agnostic KV Cache Memory for Streaming Video Understanding
di: Yang, Yanlai, et al.
Pubblicazione: (2025) -
BrainMem: Brain-Inspired Evolving Memory for Embodied Agent Task Planning
di: Ma, Xiaoyu, et al.
Pubblicazione: (2026) -
StreamingTOM: Streaming Token Compression for Efficient Video Understanding
di: Chen, Xueyi, et al.
Pubblicazione: (2025)