Transformers for Image-Goal Navigation
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Pelluri, Nikhilanj |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Towards Localizing Structural Elements: Merging Geometrical Detection with Semantic Verification in RGB-D Data
par: Tourani, Ali, et autres
Publié: (2024)
par: Tourani, Ali, et autres
Publié: (2024)
Systematic Comparison of Projection Methods for Monocular 3D Human Pose Estimation on Fisheye Images
par: Käs, Stephanie, et autres
Publié: (2025)
par: Käs, Stephanie, et autres
Publié: (2025)
Ego-Motion Aware Target Prediction Module for Robust Multi-Object Tracking
par: Mahdian, Navid, et autres
Publié: (2024)
par: Mahdian, Navid, et autres
Publié: (2024)
UAV-assisted Visual SLAM Generating Reconstructed 3D Scene Graphs in GPS-denied Environments
par: Radwan, Ahmed, et autres
Publié: (2024)
par: Radwan, Ahmed, et autres
Publié: (2024)
Vision-based Situational Graphs Exploiting Fiducial Markers for the Integration of Semantic Entities
par: Tourani, Ali, et autres
Publié: (2023)
par: Tourani, Ali, et autres
Publié: (2023)
Learning from Watching: Scalable Extraction of Manipulation Trajectories from Human Videos
par: Hu, X., et autres
Publié: (2025)
par: Hu, X., et autres
Publié: (2025)
Zero-Shot Object Goal Visual Navigation With Class-Independent Relationship Network
par: Li, Xinting, et autres
Publié: (2023)
par: Li, Xinting, et autres
Publié: (2023)
A Survey of Spatial Memory Representations for Efficient Robot Navigation
par: Pangaliman, Ma. Madecheen S., et autres
Publié: (2026)
par: Pangaliman, Ma. Madecheen S., et autres
Publié: (2026)
RAE-NWM: Navigation World Model in Dense Visual Representation Space
par: Zhang, Mingkun, et autres
Publié: (2026)
par: Zhang, Mingkun, et autres
Publié: (2026)
NumeriKontrol: Adding Numeric Control to Diffusion Transformers for Instruction-based Image Editing
par: Xu, Zhenyu, et autres
Publié: (2025)
par: Xu, Zhenyu, et autres
Publié: (2025)
Leveraging GNSS and Onboard Visual Data from Consumer Vehicles for Robust Road Network Estimation
par: Opra, Balázs, et autres
Publié: (2024)
par: Opra, Balázs, et autres
Publié: (2024)
Unveiling the Potential of iMarkers: Invisible Fiducial Markers for Advanced Robotics
par: Tourani, Ali, et autres
Publié: (2025)
par: Tourani, Ali, et autres
Publié: (2025)
SuperPoint-SLAM3: Augmenting ORB-SLAM3 with Deep Features, Adaptive NMS, and Learning-Based Loop Closure
par: Syed, Shahram Najam, et autres
Publié: (2025)
par: Syed, Shahram Najam, et autres
Publié: (2025)
Large Language Models and 3D Vision for Intelligent Robotic Perception and Autonomy
par: Mehta, Vinit, et autres
Publié: (2025)
par: Mehta, Vinit, et autres
Publié: (2025)
vS-Graphs: Tightly Coupling Visual SLAM and 3D Scene Graphs Exploiting Hierarchical Scene Understanding
par: Tourani, Ali, et autres
Publié: (2025)
par: Tourani, Ali, et autres
Publié: (2025)
The Impact of 2D Segmentation Backbones on Point Cloud Predictions Using 4D Radar
par: Muckelroy III, William, et autres
Publié: (2025)
par: Muckelroy III, William, et autres
Publié: (2025)
Temporally Consistent Object 6D Pose Estimation for Robot Control
par: Zorina, Kateryna, et autres
Publié: (2026)
par: Zorina, Kateryna, et autres
Publié: (2026)
How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?
par: Käs, Stephanie, et autres
Publié: (2025)
par: Käs, Stephanie, et autres
Publié: (2025)
Intelligent Vacuum Thermoforming Process
par: Kuswoyo, Andi, et autres
Publié: (2025)
par: Kuswoyo, Andi, et autres
Publié: (2025)
Spot-Compose: A Framework for Open-Vocabulary Object Retrieval and Drawer Manipulation in Point Clouds
par: Lemke, Oliver, et autres
Publié: (2024)
par: Lemke, Oliver, et autres
Publié: (2024)
PRISM-TopoMap: Online Topological Mapping with Place Recognition and Scan Matching
par: Muravyev, Kirill, et autres
Publié: (2024)
par: Muravyev, Kirill, et autres
Publié: (2024)
VIN-NBV: A View Introspection Network for Next-Best-View Selection
par: Frahm, Noah, et autres
Publié: (2025)
par: Frahm, Noah, et autres
Publié: (2025)
CoEnv: Driving Embodied Multi-Agent Collaboration via Compositional Environment
par: Kang, Li, et autres
Publié: (2026)
par: Kang, Li, et autres
Publié: (2026)
PoseRefer: Pathway-Local Parameters for Semantically Grounded Reference Resolution
par: Deichler, Anna
Publié: (2026)
par: Deichler, Anna
Publié: (2026)
M3CAD: Towards Generic Cooperative Autonomous Driving Benchmark
par: Zhu, Morui, et autres
Publié: (2025)
par: Zhu, Morui, et autres
Publié: (2025)
Accelerating Post-Tornado Disaster Assessment Using Advanced Deep Learning Models
par: Umeike, Robinson, et autres
Publié: (2024)
par: Umeike, Robinson, et autres
Publié: (2024)
Positive Style Accumulation: A Style Screening and Continuous Utilization Framework for Federated DG-ReID
par: Xu, Xin, et autres
Publié: (2025)
par: Xu, Xin, et autres
Publié: (2025)
SpectraNet: FFT-assisted Deep Learning Classifier for Deepfake Face Detection
par: Jayarathne, Nithira, et autres
Publié: (2025)
par: Jayarathne, Nithira, et autres
Publié: (2025)
Is Single-View Mesh Reconstruction Ready for Robotics?
par: Nolte, Frederik, et autres
Publié: (2025)
par: Nolte, Frederik, et autres
Publié: (2025)
Exposing Blindspots: Cultural Bias Evaluation in Generative Image Models
par: Seo, Huichan, et autres
Publié: (2025)
par: Seo, Huichan, et autres
Publié: (2025)
Privacy-Preserving Structureless Visual Localization via Image Obfuscation
par: Panek, Vojtech, et autres
Publié: (2026)
par: Panek, Vojtech, et autres
Publié: (2026)
Bayesian Data Augmentation and Training for Perception DNN in Autonomous Aerial Vehicles
par: Rasul, Ashik E, et autres
Publié: (2024)
par: Rasul, Ashik E, et autres
Publié: (2024)
StemVLA:An Open-Source Vision-Language-Action Model with Future 3D Spatial Geometry Knowledge and 4D Historical Representation
par: Xiao, Jiasong, et autres
Publié: (2026)
par: Xiao, Jiasong, et autres
Publié: (2026)
NavTopo: Leveraging Topological Maps For Autonomous Navigation Of a Mobile Robot
par: Muravyev, Kirill, et autres
Publié: (2024)
par: Muravyev, Kirill, et autres
Publié: (2024)
Compositional Semantics for Open Vocabulary Spatio-semantic Representations
par: Karlsson, Robin, et autres
Publié: (2023)
par: Karlsson, Robin, et autres
Publié: (2023)
EmbodiedLGR: Integrating Lightweight Graph Representation and Retrieval for Semantic-Spatial Memory in Robotic Agents
par: Riva, Paolo, et autres
Publié: (2026)
par: Riva, Paolo, et autres
Publié: (2026)
Single-Shot Metric Depth from Focused Plenoptic Cameras
par: Lasheras-Hernandez, Blanca, et autres
Publié: (2024)
par: Lasheras-Hernandez, Blanca, et autres
Publié: (2024)
Evaluating the Impact of Synthetic Data on Object Detection Tasks in Autonomous Driving
par: Özeren, Enes, et autres
Publié: (2025)
par: Özeren, Enes, et autres
Publié: (2025)
CARScenes: Semantic VLM Dataset for Safe Autonomous Driving
par: He, Yuankai, et autres
Publié: (2025)
par: He, Yuankai, et autres
Publié: (2025)
FACT: Multinomial Misalignment Classification for Point Cloud Registration
par: Dillén, Ludvig, et autres
Publié: (2025)
par: Dillén, Ludvig, et autres
Publié: (2025)
Documents similaires
-
Towards Localizing Structural Elements: Merging Geometrical Detection with Semantic Verification in RGB-D Data
par: Tourani, Ali, et autres
Publié: (2024) -
Systematic Comparison of Projection Methods for Monocular 3D Human Pose Estimation on Fisheye Images
par: Käs, Stephanie, et autres
Publié: (2025) -
Ego-Motion Aware Target Prediction Module for Robust Multi-Object Tracking
par: Mahdian, Navid, et autres
Publié: (2024) -
UAV-assisted Visual SLAM Generating Reconstructed 3D Scene Graphs in GPS-denied Environments
par: Radwan, Ahmed, et autres
Publié: (2024) -
Vision-based Situational Graphs Exploiting Fiducial Markers for the Integration of Semantic Entities
par: Tourani, Ali, et autres
Publié: (2023)