CityNav: A Large-Scale Dataset for Real-World Aerial Navigation
Fuente:
arXiv
Saved in:
| Main Authors: | Lee, Jungdae, Miyanishi, Taiki, Kurita, Shuhei, Sakamoto, Koya, Azuma, Daichi, Matsuo, Yutaka, Inoue, Nakamasa |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields
by: Yasuki, Shunsuke, et al.
Published: (2025)
by: Yasuki, Shunsuke, et al.
Published: (2025)
Answerability Fields: Answerable Location Estimation via Diffusion Models
by: Azuma, Daichi, et al.
Published: (2024)
by: Azuma, Daichi, et al.
Published: (2024)
Map-based Modular Approach for Zero-shot Embodied Question Answering
by: Sakamoto, Koya, et al.
Published: (2024)
by: Sakamoto, Koya, et al.
Published: (2024)
Cross3DVG: Cross-Dataset 3D Visual Grounding on Different RGB-D Scans
by: Miyanishi, Taiki, et al.
Published: (2023)
by: Miyanishi, Taiki, et al.
Published: (2023)
E3VS-Bench: A Benchmark for Viewpoint-Dependent Active Perception in 3D Gaussian Splatting Scenes
by: Sakamoto, Koya, et al.
Published: (2026)
by: Sakamoto, Koya, et al.
Published: (2026)
EC-Bench: Enumeration and Counting Benchmark for Ultra-Long Videos
by: Tsuchiya, Fumihiko, et al.
Published: (2026)
by: Tsuchiya, Fumihiko, et al.
Published: (2026)
PhysQuantAgent: An Inference Pipeline of Mass Estimation for Vision-Language Models
by: Yokomizo, Hisayuki, et al.
Published: (2026)
by: Yokomizo, Hisayuki, et al.
Published: (2026)
STATUS Bench: A Rigorous Benchmark for Evaluating Object State Understanding in Vision-Language Models
by: Ukai, Mahiro, et al.
Published: (2025)
by: Ukai, Mahiro, et al.
Published: (2025)
Vision Language Model-based Caption Evaluation Method Leveraging Visual Context Extraction
by: Maeda, Koki, et al.
Published: (2024)
by: Maeda, Koki, et al.
Published: (2024)
JDocQA: Japanese Document Question Answering Dataset for Generative Language Models
by: Onami, Eri, et al.
Published: (2024)
by: Onami, Eri, et al.
Published: (2024)
Referring Expression Comprehension for Small Objects
by: Goto, Kanoko, et al.
Published: (2025)
by: Goto, Kanoko, et al.
Published: (2025)
AdaCoder: Adaptive Prompt Compression for Programmatic Visual Question Answering
by: Ukai, Mahiro, et al.
Published: (2024)
by: Ukai, Mahiro, et al.
Published: (2024)
LegalViz: Legal Text Visualization by Text To Diagram Generation
by: Onami, Eri, et al.
Published: (2025)
by: Onami, Eri, et al.
Published: (2025)
ReMoRa: Multimodal Large Language Model based on Refined Motion Representation for Long-Video Understanding
by: Yashima, Daichi, et al.
Published: (2026)
by: Yashima, Daichi, et al.
Published: (2026)
ABMAMBA: Multimodal Large Language Model with Aligned Hierarchical Bidirectional Scan for Efficient Video Captioning
by: Yashima, Daichi, et al.
Published: (2026)
by: Yashima, Daichi, et al.
Published: (2026)
WAON: A Large-Scale Japanese Image-Text Dataset for Cultural Adaptation in Contrastive Vision-Language Models
by: Sugiura, Issa, et al.
Published: (2025)
by: Sugiura, Issa, et al.
Published: (2025)
AGC-Drive: A Large-Scale Dataset for Real-World Aerial-Ground Collaboration in Driving Scenarios
by: Hou, Yunhao, et al.
Published: (2025)
by: Hou, Yunhao, et al.
Published: (2025)
Evaluating Multimodal Large Language Models on Vertically Written Japanese Text
by: Sasagawa, Keito, et al.
Published: (2025)
by: Sasagawa, Keito, et al.
Published: (2025)
Stitch4D: Sparse Multi-Location 4D Urban Reconstruction via Spatio-Temporal Interpolation
by: Kogure, Hina, et al.
Published: (2026)
by: Kogure, Hina, et al.
Published: (2026)
SynPlay: Large-Scale Synthetic Human Data with Real-World Diversity for Aerial-View Perception
by: Yim, Jinsub, et al.
Published: (2024)
by: Yim, Jinsub, et al.
Published: (2024)
Pyramid Coder: Hierarchical Code Generator for Compositional Visual Question Answering
by: Shen, Ruoyue, et al.
Published: (2024)
by: Shen, Ruoyue, et al.
Published: (2024)
EyeNavGS: A 6-DoF Navigation Dataset and Record-n-Replay Software for Real-World 3DGS Scenes in VR
by: Ding, Zihao, et al.
Published: (2025)
by: Ding, Zihao, et al.
Published: (2025)
SlideAVSR: A Dataset of Paper Explanation Videos for Audio-Visual Speech Recognition
by: Wang, Hao, et al.
Published: (2024)
by: Wang, Hao, et al.
Published: (2024)
SignNav: Leveraging Signage for Semantic Visual Navigation in Large-Scale Indoor Environments
by: Sun, Jian, et al.
Published: (2026)
by: Sun, Jian, et al.
Published: (2026)
BioVITA: Biological Dataset, Model, and Benchmark for Visual-Textual-Acoustic Alignment
by: Shinoda, Risa, et al.
Published: (2026)
by: Shinoda, Risa, et al.
Published: (2026)
AIRoA MoMa Dataset: A Large-Scale Hierarchical Dataset for Mobile Manipulation
by: Takanami, Ryosuke, et al.
Published: (2025)
by: Takanami, Ryosuke, et al.
Published: (2025)
CostNav: A Navigation Benchmark for Real-World Economic-Cost Evaluation of Physical AI Agents
by: Seong, Haebin, et al.
Published: (2025)
by: Seong, Haebin, et al.
Published: (2025)
Jagle: Building a Large-Scale Japanese Multimodal Post-Training Dataset for Vision-Language Models
by: Sugiura, Issa, et al.
Published: (2026)
by: Sugiura, Issa, et al.
Published: (2026)
Formula-Supervised Visual-Geometric Pre-training
by: Yamada, Ryosuke, et al.
Published: (2024)
by: Yamada, Ryosuke, et al.
Published: (2024)
NavBench: Probing Multimodal Large Language Models for Embodied Navigation
by: Qiao, Yanyuan, et al.
Published: (2025)
by: Qiao, Yanyuan, et al.
Published: (2025)
Olbedo: An Albedo and Shading Aerial Dataset for Large-Scale Outdoor Environments
by: Song, Shuang, et al.
Published: (2026)
by: Song, Shuang, et al.
Published: (2026)
From Correspondence to Actions: Human-Like Multi-Image Spatial Reasoning in Multi-modal Large Language Models
by: Oi, Masanari, et al.
Published: (2026)
by: Oi, Masanari, et al.
Published: (2026)
MG-Nav: Dual-Scale Visual Navigation via Sparse Spatial Memory
by: Wang, Bo, et al.
Published: (2025)
by: Wang, Bo, et al.
Published: (2025)
STPLS3D: A Large-Scale Synthetic and Real Aerial Photogrammetry 3D Point Cloud Dataset
by: Chen, Meida, et al.
Published: (2022)
by: Chen, Meida, et al.
Published: (2022)
Multi-modal, Multi-task, Multi-criteria Automatic Evaluation with Vision Language Models
by: Ohi, Masanari, et al.
Published: (2024)
by: Ohi, Masanari, et al.
Published: (2024)
WorldPack: Compressed Memory Improves Spatial Consistency in Video World Modeling
by: Oshima, Yuta, et al.
Published: (2025)
by: Oshima, Yuta, et al.
Published: (2025)
HakushoBench: A Japanese Chart and Table VQA Benchmark from Governmental White Papers
by: Sugiura, Issa, et al.
Published: (2026)
by: Sugiura, Issa, et al.
Published: (2026)
Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision
by: Yoshida, Tomoya, et al.
Published: (2025)
by: Yoshida, Tomoya, et al.
Published: (2025)
GaussNav: Gaussian Splatting for Visual Navigation
by: Lei, Xiaohan, et al.
Published: (2024)
by: Lei, Xiaohan, et al.
Published: (2024)
NavMorph: A Self-Evolving World Model for Vision-and-Language Navigation in Continuous Environments
by: Yao, Xuan, et al.
Published: (2025)
by: Yao, Xuan, et al.
Published: (2025)
Similar Items
-
GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields
by: Yasuki, Shunsuke, et al.
Published: (2025) -
Answerability Fields: Answerable Location Estimation via Diffusion Models
by: Azuma, Daichi, et al.
Published: (2024) -
Map-based Modular Approach for Zero-shot Embodied Question Answering
by: Sakamoto, Koya, et al.
Published: (2024) -
Cross3DVG: Cross-Dataset 3D Visual Grounding on Different RGB-D Scans
by: Miyanishi, Taiki, et al.
Published: (2023) -
E3VS-Bench: A Benchmark for Viewpoint-Dependent Active Perception in 3D Gaussian Splatting Scenes
by: Sakamoto, Koya, et al.
Published: (2026)