Adversarial Exploitation of Data Diversity Improves Visual Localization
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Sihang, Tan, Siqi, Chang, Bowen, Zhang, Jing, Feng, Chen, Li, Yiming |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Focus On What Matters: Separated Models For Visual-Based RL Generalization
par: Zhang, Di, et autres
Publié: (2024)
par: Zhang, Di, et autres
Publié: (2024)
GSplatLoc: Grounding Keypoint Descriptors into 3D Gaussian Splatting for Improved Visual Localization
par: Sidorov, Gennady, et autres
Publié: (2024)
par: Sidorov, Gennady, et autres
Publié: (2024)
Malicious Path Manipulations via Exploitation of Representation Vulnerabilities of Vision-Language Navigation Systems
par: Islam, Chashi Mahiul, et autres
Publié: (2024)
par: Islam, Chashi Mahiul, et autres
Publié: (2024)
Extrapolated Urban View Synthesis Benchmark
par: Han, Xiangyu, et autres
Publié: (2024)
par: Han, Xiangyu, et autres
Publié: (2024)
PhysInOne: Visual Physics Learning and Reasoning in One Suite
par: Zhou, Siyuan, et autres
Publié: (2026)
par: Zhou, Siyuan, et autres
Publié: (2026)
Instruction-Guided Visual Masking
par: Zheng, Jinliang, et autres
Publié: (2024)
par: Zheng, Jinliang, et autres
Publié: (2024)
Adaptive Prediction Ensemble: Improving Out-of-Distribution Generalization of Motion Forecasting
par: Li, Jinning, et autres
Publié: (2024)
par: Li, Jinning, et autres
Publié: (2024)
VISTA: Enhancing Visual Conditioning via Track-Following Preference Optimization in Vision-Language-Action Models
par: Chen, Yiye, et autres
Publié: (2026)
par: Chen, Yiye, et autres
Publié: (2026)
RadarOcc: Robust 3D Occupancy Prediction with 4D Imaging Radar
par: Ding, Fangqiang, et autres
Publié: (2024)
par: Ding, Fangqiang, et autres
Publié: (2024)
When Should We Prefer State-to-Visual DAgger Over Visual Reinforcement Learning?
par: Mu, Tongzhou, et autres
Publié: (2024)
par: Mu, Tongzhou, et autres
Publié: (2024)
DexCap: Scalable and Portable Mocap Data Collection System for Dexterous Manipulation
par: Wang, Chen, et autres
Publié: (2024)
par: Wang, Chen, et autres
Publié: (2024)
RDT2: Exploring the Scaling Limit of UMI Data Towards Zero-Shot Cross-Embodiment Generalization
par: Liu, Songming, et autres
Publié: (2026)
par: Liu, Songming, et autres
Publié: (2026)
LatentPilot: Scene-Aware Vision-and-Language Navigation by Dreaming Ahead with Latent Visual Reasoning
par: Hao, Haihong, et autres
Publié: (2026)
par: Hao, Haihong, et autres
Publié: (2026)
Iterative Refinement Improves Compositional Image Generation
par: Jaiswal, Shantanu, et autres
Publié: (2026)
par: Jaiswal, Shantanu, et autres
Publié: (2026)
UDTIRI: An Online Open-Source Intelligent Road Inspection Benchmark Suite
par: Guo, Sicen, et autres
Publié: (2023)
par: Guo, Sicen, et autres
Publié: (2023)
Enhancing Adversarial Transferability by Balancing Exploration and Exploitation with Gradient-Guided Sampling
par: Niu, Zenghao, et autres
Publié: (2025)
par: Niu, Zenghao, et autres
Publié: (2025)
Leveraging Locality to Boost Sample Efficiency in Robotic Manipulation
par: Zhang, Tong, et autres
Publié: (2024)
par: Zhang, Tong, et autres
Publié: (2024)
ArtFormer: Controllable Generation of Diverse 3D Articulated Objects
par: Su, Jiayi, et autres
Publié: (2024)
par: Su, Jiayi, et autres
Publié: (2024)
CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models
par: Zhao, Qingqing, et autres
Publié: (2025)
par: Zhao, Qingqing, et autres
Publié: (2025)
Closed Loop Dynamic Driving Data Mixture for Real-Synthetic Co-Training
par: Ruan, Hongzhi, et autres
Publié: (2026)
par: Ruan, Hongzhi, et autres
Publié: (2026)
Exploring Domain Shift on Radar-Based 3D Object Detection Amidst Diverse Environmental Conditions
par: Zhang, Miao, et autres
Publié: (2024)
par: Zhang, Miao, et autres
Publié: (2024)
SkillMimicGen: Automated Demonstration Generation for Efficient Skill Learning and Deployment
par: Garrett, Caelan, et autres
Publié: (2024)
par: Garrett, Caelan, et autres
Publié: (2024)
Towards Ambiguity-Free Spatial Foundation Model: Rethinking and Decoupling Depth Ambiguity
par: Xu, Xiaohao, et autres
Publié: (2025)
par: Xu, Xiaohao, et autres
Publié: (2025)
Theia: Distilling Diverse Vision Foundation Models for Robot Learning
par: Shang, Jinghuan, et autres
Publié: (2024)
par: Shang, Jinghuan, et autres
Publié: (2024)
Integrating Object Detection Modality into Visual Language Model for Enhanced Autonomous Driving Agent
par: He, Linfeng, et autres
Publié: (2024)
par: He, Linfeng, et autres
Publié: (2024)
RoboGen: Towards Unleashing Infinite Data for Automated Robot Learning via Generative Simulation
par: Wang, Yufei, et autres
Publié: (2023)
par: Wang, Yufei, et autres
Publié: (2023)
Open-Vocabulary Action Localization with Iterative Visual Prompting
par: Wake, Naoki, et autres
Publié: (2024)
par: Wake, Naoki, et autres
Publié: (2024)
ROSAR: An Adversarial Re-Training Framework for Robust Side-Scan Sonar Object Detection
par: Aubard, Martin, et autres
Publié: (2024)
par: Aubard, Martin, et autres
Publié: (2024)
NAVSIM: Data-Driven Non-Reactive Autonomous Vehicle Simulation and Benchmarking
par: Dauner, Daniel, et autres
Publié: (2024)
par: Dauner, Daniel, et autres
Publié: (2024)
FloNa: Floor Plan Guided Embodied Visual Navigation
par: Li, Jiaxin, et autres
Publié: (2024)
par: Li, Jiaxin, et autres
Publié: (2024)
VLM See, Robot Do: Human Demo Video to Robot Action Plan via Vision Language Model
par: Wang, Beichen, et autres
Publié: (2024)
par: Wang, Beichen, et autres
Publié: (2024)
RDT-1B: a Diffusion Foundation Model for Bimanual Manipulation
par: Liu, Songming, et autres
Publié: (2024)
par: Liu, Songming, et autres
Publié: (2024)
Robust Vehicle Localization and Tracking in Rain using Street Maps
par: Tan, Yu Xiang, et autres
Publié: (2024)
par: Tan, Yu Xiang, et autres
Publié: (2024)
Learning Visual Feature-Based World Models via Residual Latent Action
par: Zhang, Xinyu, et autres
Publié: (2026)
par: Zhang, Xinyu, et autres
Publié: (2026)
Context-aware Multi-Model Object Detection for Diversely Heterogeneous Compute Systems
par: Davis, Justin, et autres
Publié: (2024)
par: Davis, Justin, et autres
Publié: (2024)
Memorize What Matters: Emergent Scene Decomposition from Multitraverse
par: Li, Yiming, et autres
Publié: (2024)
par: Li, Yiming, et autres
Publié: (2024)
Where are we in the search for an Artificial Visual Cortex for Embodied Intelligence?
par: Majumdar, Arjun, et autres
Publié: (2023)
par: Majumdar, Arjun, et autres
Publié: (2023)
LIX: Implicitly Infusing Spatial Geometric Prior Knowledge into Visual Semantic Segmentation for Autonomous Driving
par: Guo, Sicen, et autres
Publié: (2024)
par: Guo, Sicen, et autres
Publié: (2024)
LogoSP: Local-global Grouping of Superpoints for Unsupervised Semantic Segmentation of 3D Point Clouds
par: Zhang, Zihui, et autres
Publié: (2025)
par: Zhang, Zihui, et autres
Publié: (2025)
Imperative Learning: A Self-supervised Neuro-Symbolic Learning Framework for Robot Autonomy
par: Wang, Chen, et autres
Publié: (2024)
par: Wang, Chen, et autres
Publié: (2024)
Documents similaires
-
Focus On What Matters: Separated Models For Visual-Based RL Generalization
par: Zhang, Di, et autres
Publié: (2024) -
GSplatLoc: Grounding Keypoint Descriptors into 3D Gaussian Splatting for Improved Visual Localization
par: Sidorov, Gennady, et autres
Publié: (2024) -
Malicious Path Manipulations via Exploitation of Representation Vulnerabilities of Vision-Language Navigation Systems
par: Islam, Chashi Mahiul, et autres
Publié: (2024) -
Extrapolated Urban View Synthesis Benchmark
par: Han, Xiangyu, et autres
Publié: (2024) -
PhysInOne: Visual Physics Learning and Reasoning in One Suite
par: Zhou, Siyuan, et autres
Publié: (2026)