EAGLE: Episodic Appearance- and Geometry-aware Memory for Unified 2D-3D Visual Query Localization in Egocentric Vision
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Cao, Yifei, Liu, Yu, Wang, Guolong, Liu, Zhu, Wang, Kai, Zhang, Xianjie, Yu, Jizhe, Tu, Xun |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Online Episodic Memory Visual Query Localization with Egocentric Streaming Object Memory
par: Manigrasso, Zaira, et autres
Publié: (2024)
par: Manigrasso, Zaira, et autres
Publié: (2024)
Egocentric Action-aware Inertial Localization in Point Clouds with Vision-Language Guidance
par: Zhang, Mingfang, et autres
Publié: (2025)
par: Zhang, Mingfang, et autres
Publié: (2025)
EGOSTREAM: A Diagnostic Benchmark for Streaming Episodic Memory in Egocentric Vision
par: Forte, Rosario, et autres
Publié: (2026)
par: Forte, Rosario, et autres
Publié: (2026)
TranStable: Towards Robust Pixel-level Online Video Stabilization by Jointing Transformer and CNN
par: li, zhizhen, et autres
Publié: (2025)
par: li, zhizhen, et autres
Publié: (2025)
Planning from Imagination: Episodic Simulation and Episodic Memory for Vision-and-Language Navigation
par: Pan, Yiyuan, et autres
Publié: (2024)
par: Pan, Yiyuan, et autres
Publié: (2024)
UniLat3D: Geometry-Appearance Unified Latents for Single-Stage 3D Generation
par: Wu, Guanjun, et autres
Publié: (2025)
par: Wu, Guanjun, et autres
Publié: (2025)
GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion
par: Zhu, Hanxin, et autres
Publié: (2026)
par: Zhu, Hanxin, et autres
Publié: (2026)
ESceme: Vision-and-Language Navigation with Episodic Scene Memory
par: Zheng, Qi, et autres
Publié: (2023)
par: Zheng, Qi, et autres
Publié: (2023)
EAGLE: Egocentric AGgregated Language-video Engine
par: Bi, Jing, et autres
Publié: (2024)
par: Bi, Jing, et autres
Publié: (2024)
PEGAsus: 3D Personalization of Geometry and Appearance
par: Hu, Jingyu, et autres
Publié: (2026)
par: Hu, Jingyu, et autres
Publié: (2026)
UniVision: A Unified Framework for Vision-Centric 3D Perception
par: Hong, Yu, et autres
Publié: (2024)
par: Hong, Yu, et autres
Publié: (2024)
OSGNet @ Ego4D Episodic Memory Challenge 2025
par: Feng, Yisen, et autres
Publié: (2025)
par: Feng, Yisen, et autres
Publié: (2025)
HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization
par: Chang, Joohyun, et autres
Publié: (2025)
par: Chang, Joohyun, et autres
Publié: (2025)
Vision to Geometry: 3D Spatial Memory for Sequential Embodied MLLM Reasoning and Exploration
par: Cai, Zhongyi, et autres
Publié: (2025)
par: Cai, Zhongyi, et autres
Publié: (2025)
Do Generated Data Always Help Contrastive Learning?
par: Wang, Yifei, et autres
Publié: (2024)
par: Wang, Yifei, et autres
Publié: (2024)
Beyond Visual Appearances: Privacy-sensitive Objects Identification via Hybrid Graph Reasoning
par: Jiang, Zhuohang, et autres
Publié: (2024)
par: Jiang, Zhuohang, et autres
Publié: (2024)
GLS: Geometry-aware 3D Language Gaussian Splatting
par: Qiu, Jiaxiong, et autres
Publié: (2024)
par: Qiu, Jiaxiong, et autres
Publié: (2024)
LoD-Loc: Aerial Visual Localization using LoD 3D Map with Neural Wireframe Alignment
par: Zhu, Juelin, et autres
Publié: (2024)
par: Zhu, Juelin, et autres
Publié: (2024)
Mutual Information as Intrinsic Reward of Reinforcement Learning Agents for On-demand Ride Pooling
par: Zhang, Xianjie, et autres
Publié: (2023)
par: Zhang, Xianjie, et autres
Publié: (2023)
3D reconstruction of a million atoms by multiple-section local-orbital tomography
par: Mao, Liangze, et autres
Publié: (2024)
par: Mao, Liangze, et autres
Publié: (2024)
PRVQL: Progressive Knowledge-guided Refinement for Robust Egocentric Visual Query Localization
par: Fan, Bing, et autres
Publié: (2025)
par: Fan, Bing, et autres
Publié: (2025)
LifelongMemory: Leveraging LLMs for Answering Queries in Long-form Egocentric Videos
par: Wang, Ying, et autres
Publié: (2023)
par: Wang, Ying, et autres
Publié: (2023)
Pandora: Articulated 3D Scene Graphs from Egocentric Vision
par: Yu, Alan, et autres
Publié: (2026)
par: Yu, Alan, et autres
Publié: (2026)
Unifying 3D Vision-Language Understanding via Promptable Queries
par: Zhu, Ziyu, et autres
Publié: (2024)
par: Zhu, Ziyu, et autres
Publié: (2024)
Velox: Learning Representations of 4D Geometry and Appearance
par: Malik, Anagh, et autres
Publié: (2026)
par: Malik, Anagh, et autres
Publié: (2026)
ObjectNLQ @ Ego4D Episodic Memory Challenge 2024
par: Feng, Yisen, et autres
Publié: (2024)
par: Feng, Yisen, et autres
Publié: (2024)
Visual Episodic Memory-based Exploration
par: Vice, Jack, et autres
Publié: (2024)
par: Vice, Jack, et autres
Publié: (2024)
SFHand: Learning Embodied Manipulation by Streaming Egocentric 3D Hand Forecasting
par: Liu, Ruicong, et autres
Publié: (2025)
par: Liu, Ruicong, et autres
Publié: (2025)
Memory-Augmented Query Intent Understanding for Efficient Chat-based Image Retrieval
par: Chen, Xianke, et autres
Publié: (2026)
par: Chen, Xianke, et autres
Publié: (2026)
AirGlove: Exploring Egocentric 3D Hand Tracking and Appearance Generalization for Sensing Gloves
par: Cui, Wenhui, et autres
Publié: (2026)
par: Cui, Wenhui, et autres
Publié: (2026)
GLASS: Geometry-aware Local Alignment and Structure Synchronization Network for 2D-3D Registration
par: Cheng, Zhixin, et autres
Publié: (2026)
par: Cheng, Zhixin, et autres
Publié: (2026)
VGGT4D: Mining Motion Cues in Visual Geometry Transformers for 4D Scene Reconstruction
par: Hu, Yu, et autres
Publié: (2025)
par: Hu, Yu, et autres
Publié: (2025)
EgoActor: Grounding Task Planning into Spatial-aware Egocentric Actions for Humanoid Robots via Visual-Language Models
par: Bai, Yu, et autres
Publié: (2026)
par: Bai, Yu, et autres
Publié: (2026)
EMemBench: Interactive Benchmarking of Episodic Memory for VLM Agents
par: Li, Xinze, et autres
Publié: (2026)
par: Li, Xinze, et autres
Publié: (2026)
AdaEAGLE: Optimizing Speculative Decoding via Explicit Modeling of Adaptive Draft Structures
par: Zhang, Situo, et autres
Publié: (2024)
par: Zhang, Situo, et autres
Publié: (2024)
Dual-Domain Representation Alignment: Bridging 2D and 3D Vision via Geometry-Aware Architecture Search
par: Zhang, Haoyu, et autres
Publié: (2026)
par: Zhang, Haoyu, et autres
Publié: (2026)
Layout2Scene: 3D Semantic Layout Guided Scene Generation via Geometry and Appearance Diffusion Priors
par: Chen, Minglin, et autres
Publié: (2025)
par: Chen, Minglin, et autres
Publié: (2025)
UniPR-3D: Towards Universal Visual Place Recognition with Visual Geometry Grounded Transformer
par: Deng, Tianchen, et autres
Publié: (2025)
par: Deng, Tianchen, et autres
Publié: (2025)
Towards Visual Query Localization in the 3D World
par: Peng, Liang, et autres
Publié: (2026)
par: Peng, Liang, et autres
Publié: (2026)
EAGLE: Elevating Geometric Reasoning through LLM-empowered Visual Instruction Tuning
par: Li, Zhihao, et autres
Publié: (2024)
par: Li, Zhihao, et autres
Publié: (2024)
Documents similaires
-
Online Episodic Memory Visual Query Localization with Egocentric Streaming Object Memory
par: Manigrasso, Zaira, et autres
Publié: (2024) -
Egocentric Action-aware Inertial Localization in Point Clouds with Vision-Language Guidance
par: Zhang, Mingfang, et autres
Publié: (2025) -
EGOSTREAM: A Diagnostic Benchmark for Streaming Episodic Memory in Egocentric Vision
par: Forte, Rosario, et autres
Publié: (2026) -
TranStable: Towards Robust Pixel-level Online Video Stabilization by Jointing Transformer and CNN
par: li, zhizhen, et autres
Publié: (2025) -
Planning from Imagination: Episodic Simulation and Episodic Memory for Vision-and-Language Navigation
par: Pan, Yiyuan, et autres
Publié: (2024)