HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Haowei, Yang, Shudong, Fu, Jinlan, Ng, See-Kiong, Qiu, Xipeng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs
por: Chen, Qian, et al.
Publicado: (2026)
por: Chen, Qian, et al.
Publicado: (2026)
CHiP: Cross-modal Hierarchical Direct Preference Optimization for Multimodal LLMs
por: Fu, Jinlan, et al.
Publicado: (2025)
por: Fu, Jinlan, et al.
Publicado: (2025)
StreamMem: Query-Agnostic KV Cache Memory for Streaming Video Understanding
por: Yang, Yanlai, et al.
Publicado: (2025)
por: Yang, Yanlai, et al.
Publicado: (2025)
Analyzing Reasoning Consistency in Large Multimodal Models under Cross-Modal Conflicts
por: Zhu, Zhihao, et al.
Publicado: (2026)
por: Zhu, Zhihao, et al.
Publicado: (2026)
AI Meets Brain: Memory Systems from Cognitive Neuroscience to Autonomous Agents
por: Liang, Jiafeng, et al.
Publicado: (2025)
por: Liang, Jiafeng, et al.
Publicado: (2025)
Decouple and Cache: KV Cache Construction for Streaming Video Understanding
por: Pang, Zhanzhong, et al.
Publicado: (2026)
por: Pang, Zhanzhong, et al.
Publicado: (2026)
Going Down Memory Lane: Scaling Tokens for Video Stream Understanding with Dynamic KV-Cache Memory
por: Agarwal, Vatsal, et al.
Publicado: (2026)
por: Agarwal, Vatsal, et al.
Publicado: (2026)
MuKV: Multi-Grained KV Cache Compression for Long Streaming Video Question-Answering
por: Xiao, Junbin, et al.
Publicado: (2026)
por: Xiao, Junbin, et al.
Publicado: (2026)
READ: Recurrent Adapter with Partial Video-Language Alignment for Parameter-Efficient Transfer Learning in Low-Resource Video-Language Modeling
por: Nguyen, Thong, et al.
Publicado: (2023)
por: Nguyen, Thong, et al.
Publicado: (2023)
StreamingVLM: Real-Time Understanding for Infinite Video Streams
por: Xu, Ruyi, et al.
Publicado: (2025)
por: Xu, Ruyi, et al.
Publicado: (2025)
RoboOmni: Proactive Robot Manipulation in Omni-modal Context
por: Wang, Siyin, et al.
Publicado: (2025)
por: Wang, Siyin, et al.
Publicado: (2025)
VideoLLaMB: Long Streaming Video Understanding with Recurrent Memory Bridges
por: Wang, Yuxuan, et al.
Publicado: (2024)
por: Wang, Yuxuan, et al.
Publicado: (2024)
GAOKAO-MM: A Chinese Human-Level Benchmark for Multimodal Models Evaluation
por: Zong, Yi, et al.
Publicado: (2024)
por: Zong, Yi, et al.
Publicado: (2024)
FluxMem: Adaptive Hierarchical Memory for Streaming Video Understanding
por: Xie, Yiweng, et al.
Publicado: (2026)
por: Xie, Yiweng, et al.
Publicado: (2026)
LiveVLM: Efficient Online Video Understanding via Streaming-Oriented KV Cache and Retrieval
por: Ning, Zhenyu, et al.
Publicado: (2025)
por: Ning, Zhenyu, et al.
Publicado: (2025)
StreamGaze: Gaze-Guided Temporal Reasoning and Proactive Understanding in Streaming Videos
por: Lee, Daeun, et al.
Publicado: (2025)
por: Lee, Daeun, et al.
Publicado: (2025)
FreeAct: Freeing Activations for LLM Quantization
por: Liu, Xiaohao, et al.
Publicado: (2026)
por: Liu, Xiaohao, et al.
Publicado: (2026)
Rethinking Machine Unlearning in Image Generation Models
por: Liu, Renyang, et al.
Publicado: (2025)
por: Liu, Renyang, et al.
Publicado: (2025)
LagKV: Lag-Relative Information of the KV Cache Tells Which Tokens Are Important
por: Liang, Manlai, et al.
Publicado: (2025)
por: Liang, Manlai, et al.
Publicado: (2025)
World Modeling Makes a Better Planner: Dual Preference Optimization for Embodied Task Planning
por: Wang, Siyin, et al.
Publicado: (2025)
por: Wang, Siyin, et al.
Publicado: (2025)
CacheFlow: Compressive Streaming Memory for Efficient Long-Form Video Understanding
por: Patel, Shrenik, et al.
Publicado: (2025)
por: Patel, Shrenik, et al.
Publicado: (2025)
StreamKV: Streaming Video Question-Answering with Segment-based KV Cache Retrieval and Compression
por: Chen, Yilong, et al.
Publicado: (2025)
por: Chen, Yilong, et al.
Publicado: (2025)
HERMES: temporal-coHERent long-forM understanding with Episodes and Semantics
por: Faure, Gueter Josmy, et al.
Publicado: (2024)
por: Faure, Gueter Josmy, et al.
Publicado: (2024)
Hint-before-Solving Prompting: Guiding LLMs to Effectively Utilize Encoded Knowledge
por: Fu, Jinlan, et al.
Publicado: (2024)
por: Fu, Jinlan, et al.
Publicado: (2024)
VideoARM: Agentic Reasoning over Hierarchical Memory for Long-Form Video Understanding
por: Yin, Yufei, et al.
Publicado: (2025)
por: Yin, Yufei, et al.
Publicado: (2025)
Streaming Video Question-Answering with In-context Video KV-Cache Retrieval
por: Di, Shangzhe, et al.
Publicado: (2025)
por: Di, Shangzhe, et al.
Publicado: (2025)
MAMA: Meta-optimized Angular Margin Contrastive Framework for Video-Language Representation Learning
por: Nguyen, Thong, et al.
Publicado: (2024)
por: Nguyen, Thong, et al.
Publicado: (2024)
LOOK-M: Look-Once Optimization in KV Cache for Efficient Multimodal Long-Context Inference
por: Wan, Zhongwei, et al.
Publicado: (2024)
por: Wan, Zhongwei, et al.
Publicado: (2024)
FastOCR: Dynamic Visual Fixation via KV Cache Pruning for Efficient Document Parsing
por: Tang, Zihan, et al.
Publicado: (2026)
por: Tang, Zihan, et al.
Publicado: (2026)
DemaFormer: Damped Exponential Moving Average Transformer with Energy-Based Modeling for Temporal Language Grounding
por: Nguyen, Thong, et al.
Publicado: (2023)
por: Nguyen, Thong, et al.
Publicado: (2023)
Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding
por: Wu, Hang, et al.
Publicado: (2026)
por: Wu, Hang, et al.
Publicado: (2026)
PaSBench-Video: A Streaming Video Benchmark for Proactive Safety Warning
por: Zhao, Yusong, et al.
Publicado: (2026)
por: Zhao, Yusong, et al.
Publicado: (2026)
BitStack: Any-Size Compression of Large Language Models in Variable Memory Environments
por: Wang, Xinghao, et al.
Publicado: (2024)
por: Wang, Xinghao, et al.
Publicado: (2024)
VideoScaffold: Elastic-Scale Visual Hierarchies for Streaming Video Understanding in MLLMs
por: Zheng, Naishan, et al.
Publicado: (2025)
por: Zheng, Naishan, et al.
Publicado: (2025)
XStreamVGGT: Extremely Memory-Efficient Streaming Vision Geometry Grounded Transformer with KV Cache Compression
por: Su, Zunhai, et al.
Publicado: (2026)
por: Su, Zunhai, et al.
Publicado: (2026)
XStreamVGGT: Extremely Memory-Efficient Streaming Vision Geometry Grounded Transformer with KV Cache Compression
por: Su, Zunhai, et al.
Publicado: (2026)
por: Su, Zunhai, et al.
Publicado: (2026)
MMVU: Measuring Expert-Level Multi-Discipline Video Understanding
por: Zhao, Yilun, et al.
Publicado: (2025)
por: Zhao, Yilun, et al.
Publicado: (2025)
D-Judge: How Far Are We? Assessing the Discrepancies Between AI-synthesized and Natural Images through Multimodal Guidance
por: Liu, Renyang, et al.
Publicado: (2024)
por: Liu, Renyang, et al.
Publicado: (2024)
Think While Watching: Online Streaming Segment-Level Memory for Multi-Turn Video Reasoning in Multimodal Large Language Models
por: Wang, Lu, et al.
Publicado: (2026)
por: Wang, Lu, et al.
Publicado: (2026)
Forcing-KV: Hybrid KV Cache Compression for Efficient Autoregressive Video Diffusion Models
por: Ji, Yicheng, et al.
Publicado: (2026)
por: Ji, Yicheng, et al.
Publicado: (2026)
Ejemplares similares
-
FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs
por: Chen, Qian, et al.
Publicado: (2026) -
CHiP: Cross-modal Hierarchical Direct Preference Optimization for Multimodal LLMs
por: Fu, Jinlan, et al.
Publicado: (2025) -
StreamMem: Query-Agnostic KV Cache Memory for Streaming Video Understanding
por: Yang, Yanlai, et al.
Publicado: (2025) -
Analyzing Reasoning Consistency in Large Multimodal Models under Cross-Modal Conflicts
por: Zhu, Zhihao, et al.
Publicado: (2026) -
AI Meets Brain: Memory Systems from Cognitive Neuroscience to Autonomous Agents
por: Liang, Jiafeng, et al.
Publicado: (2025)