IA-VLA: Input Augmentation for Vision-Language-Action models in settings with semantically complex tasks
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Hannus, Eric, Malin, Miika, Le, Tran Nguyen, Kyrki, Ville |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Dynamic Manipulation of Deformable Objects using Imitation Learning with Adaptation to Hardware Constraints
par: Hannus, Eric, et autres
Publié: (2024)
par: Hannus, Eric, et autres
Publié: (2024)
Interactive Identification of Granular Materials using Force Measurements
par: Hynninen, Samuli, et autres
Publié: (2024)
par: Hynninen, Samuli, et autres
Publié: (2024)
Online Learning of Human Constraints from Feedback in Shared Autonomy
par: Zhu, Shibei, et autres
Publié: (2024)
par: Zhu, Shibei, et autres
Publié: (2024)
REACT: Real-time Efficient Attribute Clustering and Transfer for Updatable 3D Scene Graph
par: Nguyen, Phuoc, et autres
Publié: (2025)
par: Nguyen, Phuoc, et autres
Publié: (2025)
Event-Grounding Graph: Unified Spatio-Temporal Scene Graph from Robotic Observations
par: Nguyen, Phuoc, et autres
Publié: (2025)
par: Nguyen, Phuoc, et autres
Publié: (2025)
Augmented Environment Representations with Complete Object Models
par: Sivananda, Krishnananda Prabhu, et autres
Publié: (2021)
par: Sivananda, Krishnananda Prabhu, et autres
Publié: (2021)
Probabilistic Surface Friction Estimation Based on Visual and Haptic Measurements
par: Le, Tran Nguyen, et autres
Publié: (2020)
par: Le, Tran Nguyen, et autres
Publié: (2020)
QuASH: Using Natural-Language Heuristics to Query Visual-Language Robotic Maps
par: Pekkanen, Matti, et autres
Publié: (2025)
par: Pekkanen, Matti, et autres
Publié: (2025)
Emergency Stopping for Liquid-manipulating Robots
par: Hynninen, Samuli, et autres
Publié: (2026)
par: Hynninen, Samuli, et autres
Publié: (2026)
Constrained Generative Sampling of 6-DoF Grasps
par: Lundell, Jens, et autres
Publié: (2023)
par: Lundell, Jens, et autres
Publié: (2023)
COSBO: Conservative Offline Simulation-Based Policy Optimization
par: Kargar, Eshagh, et autres
Publié: (2024)
par: Kargar, Eshagh, et autres
Publié: (2024)
Do Visual-Language Grid Maps Capture Latent Semantics?
par: Pekkanen, Matti, et autres
Publié: (2024)
par: Pekkanen, Matti, et autres
Publié: (2024)
Relational Scene Graphs for Object Grounding of Natural Language Commands
par: Kuhn, Julia, et autres
Publié: (2026)
par: Kuhn, Julia, et autres
Publié: (2026)
Localization Under Consistent Assumptions Over Dynamics
par: Pekkanen, Matti, et autres
Publié: (2023)
par: Pekkanen, Matti, et autres
Publié: (2023)
Object-Oriented Grid Mapping in Dynamic Environments
par: Pekkanen, Matti, et autres
Publié: (2023)
par: Pekkanen, Matti, et autres
Publié: (2023)
Jointly Learning Cost and Constraints from Demonstrations for Safe Trajectory Generation
par: Chaubey, Shivam, et autres
Publié: (2024)
par: Chaubey, Shivam, et autres
Publié: (2024)
GNSS-denied geolocalization of UAVs by visual matching of onboard camera images with orthophotos
par: Kinnari, Jouko, et autres
Publié: (2021)
par: Kinnari, Jouko, et autres
Publié: (2021)
Season-invariant GNSS-denied visual localization for UAVs
par: Kinnari, Jouko, et autres
Publié: (2021)
par: Kinnari, Jouko, et autres
Publié: (2021)
Raising Body Ownership in End-to-End Visuomotor Policy Learning via Robot-Centric Pooling
par: Zhuang, Zheyu, et autres
Publié: (2024)
par: Zhuang, Zheyu, et autres
Publié: (2024)
ACoT-VLA: Action Chain-of-Thought for Vision-Language-Action Models
par: Zhong, Linqing, et autres
Publié: (2026)
par: Zhong, Linqing, et autres
Publié: (2026)
StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision
par: Deng, Shengliang, et autres
Publié: (2025)
par: Deng, Shengliang, et autres
Publié: (2025)
ReMoBot: Retrieval-Based Few-Shot Imitation Learning for Mobile Manipulation with Vision Foundation Models
par: Zhang, Yuying, et autres
Publié: (2024)
par: Zhang, Yuying, et autres
Publié: (2024)
DDGC: Generative Deep Dexterous Grasping in Clutter
par: Lundell, Jens, et autres
Publié: (2021)
par: Lundell, Jens, et autres
Publié: (2021)
Trajectory Planning and Control for Robotic Magnetic Manipulation
par: Isitman, Ogulcan, et autres
Publié: (2024)
par: Isitman, Ogulcan, et autres
Publié: (2024)
The Role of Higher-Order Cognitive Models in Active Learning
par: Keurulainen, Oskar, et autres
Publié: (2024)
par: Keurulainen, Oskar, et autres
Publié: (2024)
AIR-VLA: Vision-Language-Action Systems for Aerial Manipulation
par: Sun, Jianli, et autres
Publié: (2026)
par: Sun, Jianli, et autres
Publié: (2026)
EdgeVLA: Efficient Vision-Language-Action Models
par: Budzianowski, Paweł, et autres
Publié: (2025)
par: Budzianowski, Paweł, et autres
Publié: (2025)
MAP-VLA: Memory-Augmented Prompting for Vision-Language-Action Model in Robotic Manipulation
par: Li, Runhao, et autres
Publié: (2025)
par: Li, Runhao, et autres
Publié: (2025)
PriorVLA: Prior-Preserving Adaptation for Vision-Language-Action Models
par: Guo, Xinyu, et autres
Publié: (2026)
par: Guo, Xinyu, et autres
Publié: (2026)
FocusVLA: Focused Visual Utilization for Vision-Language-Action Models
par: Zhang, Yichi, et autres
Publié: (2026)
par: Zhang, Yichi, et autres
Publié: (2026)
VP-VLA: Visual Prompting as an Interface for Vision-Language-Action Models
par: Wang, Zixuan, et autres
Publié: (2026)
par: Wang, Zixuan, et autres
Publié: (2026)
RedVLA: Physical Red Teaming for Vision-Language-Action Models
par: Zhang, Yuhao, et autres
Publié: (2026)
par: Zhang, Yuhao, et autres
Publié: (2026)
Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
par: Apanasevich, I., et autres
Publié: (2026)
par: Apanasevich, I., et autres
Publié: (2026)
NS-VLA: Towards Neuro-Symbolic Vision-Language-Action Models
par: Zhu, Ziyue, et autres
Publié: (2026)
par: Zhu, Ziyue, et autres
Publié: (2026)
FutureVLA: Joint Visuomotor Prediction for Vision-Language-Action Model
par: Xu, Xiaoxu, et autres
Publié: (2026)
par: Xu, Xiaoxu, et autres
Publié: (2026)
LSVL: Large-scale season-invariant visual localization for UAVs
par: Kinnari, Jouko, et autres
Publié: (2022)
par: Kinnari, Jouko, et autres
Publié: (2022)
Data-driven Diffusion Models for Enhancing Safety in Autonomous Vehicle Traffic Simulations
par: Lu, Jinxiong, et autres
Publié: (2024)
par: Lu, Jinxiong, et autres
Publié: (2024)
Bayesian Floor Field: Transferring people flow predictions across environments
par: Verdoja, Francesco, et autres
Publié: (2022)
par: Verdoja, Francesco, et autres
Publié: (2022)
AR-VLA: True Autoregressive Action Expert for Vision-Language-Action Models
par: Hu, Yutong, et autres
Publié: (2026)
par: Hu, Yutong, et autres
Publié: (2026)
X-DiffVLA: X-Embodied Diffusion Action Heads for Vision-Language-Action Models
par: Li, Boyu, et autres
Publié: (2026)
par: Li, Boyu, et autres
Publié: (2026)
Documents similaires
-
Dynamic Manipulation of Deformable Objects using Imitation Learning with Adaptation to Hardware Constraints
par: Hannus, Eric, et autres
Publié: (2024) -
Interactive Identification of Granular Materials using Force Measurements
par: Hynninen, Samuli, et autres
Publié: (2024) -
Online Learning of Human Constraints from Feedback in Shared Autonomy
par: Zhu, Shibei, et autres
Publié: (2024) -
REACT: Real-time Efficient Attribute Clustering and Transfer for Updatable 3D Scene Graph
par: Nguyen, Phuoc, et autres
Publié: (2025) -
Event-Grounding Graph: Unified Spatio-Temporal Scene Graph from Robotic Observations
par: Nguyen, Phuoc, et autres
Publié: (2025)