SpatialMem: Metric-Aligned Long-Horizon Video Memory for Language Grounding and QA
Fuente:
arXiv
Salvato in:
| Autori principali: | Zheng, Xinyi, Liu, Yunze, Wu, Chi-Hao, Zhang, Fan, Zheng, Hao, Zhou, Wenqi, Mayol-Cuevas, Walterio W., Shen, Junxiao |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
X-LeBench: A Benchmark for Extremely Long Egocentric Video Understanding
di: Zhou, Wenqi, et al.
Pubblicazione: (2025)
di: Zhou, Wenqi, et al.
Pubblicazione: (2025)
CULTURE3D: A Large-Scale and Diverse Dataset of Cultural Landmarks and Terrains for Gaussian-Based Scene Rendering
di: Zheng, Xinyi, et al.
Pubblicazione: (2025)
di: Zheng, Xinyi, et al.
Pubblicazione: (2025)
Re-localization acceleration with Medoid Silhouette Clustering
di: Zhang, Hongyi, et al.
Pubblicazione: (2024)
di: Zhang, Hongyi, et al.
Pubblicazione: (2024)
EvoStruggle: A Dataset Capturing the Evolution of Struggle across Activities and Skill Levels
di: Feng, Shijia, et al.
Pubblicazione: (2025)
di: Feng, Shijia, et al.
Pubblicazione: (2025)
From Detection to Anticipation: Online Understanding of Struggles across Various Tasks and Activities
di: Feng, Shijia, et al.
Pubblicazione: (2025)
di: Feng, Shijia, et al.
Pubblicazione: (2025)
OmniRetriever: Any-to-Any Audio-Video-Text Retrieval via Fusion-as-Teacher Distillation
di: Liu, Yunze, et al.
Pubblicazione: (2026)
di: Liu, Yunze, et al.
Pubblicazione: (2026)
O-MARC: Omni Memory-Augmented Compression Distillation for Efficient Video Understanding
di: Wu, Peiran, et al.
Pubblicazione: (2026)
di: Wu, Peiran, et al.
Pubblicazione: (2026)
MARC: Memory-Augmented RL Token Compression for Efficient Video Understanding
di: Wu, Peiran, et al.
Pubblicazione: (2025)
di: Wu, Peiran, et al.
Pubblicazione: (2025)
Mem-T: Densifying Rewards for Long-Horizon Memory Agents
di: Yue, Yanwei, et al.
Pubblicazione: (2026)
di: Yue, Yanwei, et al.
Pubblicazione: (2026)
Are you Struggling? Dataset and Baselines for Struggle Determination in Assembly Videos
di: Feng, Shijia, et al.
Pubblicazione: (2024)
di: Feng, Shijia, et al.
Pubblicazione: (2024)
AdaMem: Adaptive User-Centric Memory for Long-Horizon Dialogue Agents
di: Yan, Shannan, et al.
Pubblicazione: (2026)
di: Yan, Shannan, et al.
Pubblicazione: (2026)
Fine-Mem: Fine-Grained Feedback Alignment for Long-Horizon Memory Management
di: Ma, Weitao, et al.
Pubblicazione: (2026)
di: Ma, Weitao, et al.
Pubblicazione: (2026)
ST-Think: How Multimodal Large Language Models Reason About 4D Worlds from Ego-Centric Videos
di: Wu, Peiran, et al.
Pubblicazione: (2025)
di: Wu, Peiran, et al.
Pubblicazione: (2025)
UGC-VideoCaptioner: An Omni UGC Video Detail Caption Model and New Benchmarks
di: Wu, Peiran, et al.
Pubblicazione: (2025)
di: Wu, Peiran, et al.
Pubblicazione: (2025)
StoryMem: Multi-shot Long Video Storytelling with Memory
di: Zhang, Kaiwen, et al.
Pubblicazione: (2025)
di: Zhang, Kaiwen, et al.
Pubblicazione: (2025)
Bridging Modalities, Spanning Time: Structured Memory for Ultra-Long Agentic Video Reasoning
di: Li, Jiazheng, et al.
Pubblicazione: (2026)
di: Li, Jiazheng, et al.
Pubblicazione: (2026)
StructMem: Structured Memory for Long-Horizon Behavior in LLMs
di: Xu, Buqiang, et al.
Pubblicazione: (2026)
di: Xu, Buqiang, et al.
Pubblicazione: (2026)
WorldMem: Long-term Consistent World Simulation with Memory
di: Xiao, Zeqi, et al.
Pubblicazione: (2025)
di: Xiao, Zeqi, et al.
Pubblicazione: (2025)
HiMem: Hierarchical Long-Term Memory for LLM Long-Horizon Agents
di: Zhang, Ningning, et al.
Pubblicazione: (2026)
di: Zhang, Ningning, et al.
Pubblicazione: (2026)
MemPO: Self-Memory Policy Optimization for Long-Horizon Agents
di: Li, Ruoran, et al.
Pubblicazione: (2026)
di: Li, Ruoran, et al.
Pubblicazione: (2026)
Mem2Ego: Empowering Vision-Language Models with Global-to-Ego Memory for Long-Horizon Embodied Navigation
di: Zhang, Lingfeng, et al.
Pubblicazione: (2025)
di: Zhang, Lingfeng, et al.
Pubblicazione: (2025)
EgoMemReason: A Memory-Driven Reasoning Benchmark for Long-Horizon Egocentric Video Understanding
di: Wang, Ziyang, et al.
Pubblicazione: (2026)
di: Wang, Ziyang, et al.
Pubblicazione: (2026)
Video-in-the-Loop: Span-Grounded Long Video QA with Interleaved Reasoning
di: Wang, Chendong, et al.
Pubblicazione: (2025)
di: Wang, Chendong, et al.
Pubblicazione: (2025)
O-Mem: Omni Memory System for Personalized, Long Horizon, Self-Evolving Agents
di: Wang, Piaohong, et al.
Pubblicazione: (2025)
di: Wang, Piaohong, et al.
Pubblicazione: (2025)
Hierarchical Memory for Long Video QA
di: Wang, Yiqin, et al.
Pubblicazione: (2024)
di: Wang, Yiqin, et al.
Pubblicazione: (2024)
ParamMem: Augmenting Language Agents with Parametric Reflective Memory
di: Yao, Tianjun, et al.
Pubblicazione: (2026)
di: Yao, Tianjun, et al.
Pubblicazione: (2026)
TiMem: Temporal-Hierarchical Memory Consolidation for Long-Horizon Conversational Agents
di: Li, Kai, et al.
Pubblicazione: (2026)
di: Li, Kai, et al.
Pubblicazione: (2026)
MemWeaver: Weaving Hybrid Memories for Traceable Long-Horizon Agentic Reasoning
di: Ye, Juexiang, et al.
Pubblicazione: (2026)
di: Ye, Juexiang, et al.
Pubblicazione: (2026)
MemOCR: Layout-Aware Visual Memory for Efficient Long-Horizon Reasoning
di: Shi, Yaorui, et al.
Pubblicazione: (2026)
di: Shi, Yaorui, et al.
Pubblicazione: (2026)
MemLens: Benchmarking Multimodal Long-Term Memory in Large Vision-Language Models
di: Ren, Xiyu, et al.
Pubblicazione: (2026)
di: Ren, Xiyu, et al.
Pubblicazione: (2026)
TA-Mem: Tool-Augmented Autonomous Memory Retrieval for LLM in Long-Term Conversational QA
di: Yuan, Mengwei, et al.
Pubblicazione: (2026)
di: Yuan, Mengwei, et al.
Pubblicazione: (2026)
MemGround: Long-Term Memory Evaluation Kit for Large Language Models in Gamified Scenarios
di: Ding, Yihang, et al.
Pubblicazione: (2026)
di: Ding, Yihang, et al.
Pubblicazione: (2026)
VideoMAP: Toward Scalable Mamba-based Video Autoregressive Pretraining
di: Liu, Yunze, et al.
Pubblicazione: (2025)
di: Liu, Yunze, et al.
Pubblicazione: (2025)
RELIC: Interactive Video World Model with Long-Horizon Memory
di: Hong, Yicong, et al.
Pubblicazione: (2025)
di: Hong, Yicong, et al.
Pubblicazione: (2025)
Human-inspired Perspectives: A Survey on AI Long-term Memory
di: He, Zihong, et al.
Pubblicazione: (2024)
di: He, Zihong, et al.
Pubblicazione: (2024)
FluxMem: Adaptive Hierarchical Memory for Streaming Video Understanding
di: Xie, Yiweng, et al.
Pubblicazione: (2026)
di: Xie, Yiweng, et al.
Pubblicazione: (2026)
TokMem: One-Token Procedural Memory for Large Language Models
di: Wu, Zijun, et al.
Pubblicazione: (2025)
di: Wu, Zijun, et al.
Pubblicazione: (2025)
DeferMem: Query-Time Evidence Distillation via Reinforcement Learning for Long-Term Memory QA
di: Yin, Jianing, et al.
Pubblicazione: (2026)
di: Yin, Jianing, et al.
Pubblicazione: (2026)
EverMemOS: A Self-Organizing Memory Operating System for Structured Long-Horizon Reasoning
di: Hu, Chuanrui, et al.
Pubblicazione: (2026)
di: Hu, Chuanrui, et al.
Pubblicazione: (2026)
MosaicMem: Hybrid Spatial Memory for Controllable Video World Models
di: Yu, Wei, et al.
Pubblicazione: (2026)
di: Yu, Wei, et al.
Pubblicazione: (2026)
Documenti analoghi
-
X-LeBench: A Benchmark for Extremely Long Egocentric Video Understanding
di: Zhou, Wenqi, et al.
Pubblicazione: (2025) -
CULTURE3D: A Large-Scale and Diverse Dataset of Cultural Landmarks and Terrains for Gaussian-Based Scene Rendering
di: Zheng, Xinyi, et al.
Pubblicazione: (2025) -
Re-localization acceleration with Medoid Silhouette Clustering
di: Zhang, Hongyi, et al.
Pubblicazione: (2024) -
EvoStruggle: A Dataset Capturing the Evolution of Struggle across Activities and Skill Levels
di: Feng, Shijia, et al.
Pubblicazione: (2025) -
From Detection to Anticipation: Online Understanding of Struggles across Various Tasks and Activities
di: Feng, Shijia, et al.
Pubblicazione: (2025)