QueryAdapter: Rapid Adaptation of Vision-Language Models in Response to Natural Language Queries
Fuente:
arXiv
Guardado en:
| Autores principales: | Chapman, Nicolas Harvey, Dayoub, Feras, Browne, Will, Lehnert, Christopher |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Enhancing Embodied Object Detection through Language-Image Pre-training and Implicit Object Memory
por: Chapman, Nicolas Harvey, et al.
Publicado: (2024)
por: Chapman, Nicolas Harvey, et al.
Publicado: (2024)
Vision Foundation Models for Domain Generalisable Cross-View Localisation in Planetary Ground-Aerial Robotic Teams
por: Holden, Lachlan, et al.
Publicado: (2026)
por: Holden, Lachlan, et al.
Publicado: (2026)
Embodied Domain Adaptation for Object Detection
por: Shi, Xiangyu, et al.
Publicado: (2025)
por: Shi, Xiangyu, et al.
Publicado: (2025)
A Physical Agentic Loop for Language-Guided Grasping with Execution-State Monitoring
por: Wang, Wenze, et al.
Publicado: (2026)
por: Wang, Wenze, et al.
Publicado: (2026)
SmartWay: Enhanced Waypoint Prediction and Backtracking for Zero-Shot Vision-and-Language Navigation
por: Shi, Xiangyu, et al.
Publicado: (2025)
por: Shi, Xiangyu, et al.
Publicado: (2025)
KITE: Keyframe-Indexed Tokenized Evidence for VLM-Based Robot Failure Analysis
por: Hosseinzadeh, Mehdi, et al.
Publicado: (2026)
por: Hosseinzadeh, Mehdi, et al.
Publicado: (2026)
To Ask or Not to Ask? Detecting Absence of Information in Vision and Language Navigation
por: Abraham, Savitha Sam, et al.
Publicado: (2024)
por: Abraham, Savitha Sam, et al.
Publicado: (2024)
QueryOcc: Query-based Self-Supervision for 3D Semantic Occupancy
por: Lilja, Adam, et al.
Publicado: (2025)
por: Lilja, Adam, et al.
Publicado: (2025)
FlexVLN: Flexible Adaptation for Diverse Vision-and-Language Navigation Tasks
por: Zhang, Siqi, et al.
Publicado: (2025)
por: Zhang, Siqi, et al.
Publicado: (2025)
Turning Adaptation into Assets: Cross-Domain Bridging for Online Vision-Language Navigation
por: Hu, Zixuan, et al.
Publicado: (2026)
por: Hu, Zixuan, et al.
Publicado: (2026)
Temporal Attention for Cross-View Sequential Image Localization
por: Yuan, Dong, et al.
Publicado: (2024)
por: Yuan, Dong, et al.
Publicado: (2024)
Wasserstein Distance-based Expansion of Low-Density Latent Regions for Unknown Class Detection
por: Mallick, Prakash, et al.
Publicado: (2024)
por: Mallick, Prakash, et al.
Publicado: (2024)
HarvestFlex: Strawberry Harvesting via Vision-Language-Action Policy Adaptation in the Wild
por: Zhao, Ziyang, et al.
Publicado: (2026)
por: Zhao, Ziyang, et al.
Publicado: (2026)
Unified Vision-Language-Action Model
por: Wang, Yuqi, et al.
Publicado: (2025)
por: Wang, Yuqi, et al.
Publicado: (2025)
Improving Online Source-free Domain Adaptation for Object Detection by Unsupervised Data Acquisition
por: Shi, Xiangyu, et al.
Publicado: (2023)
por: Shi, Xiangyu, et al.
Publicado: (2023)
LangMap: A Human-Verified Benchmark for Hierarchical Open-Vocabulary Goal Navigation
por: Miao, Bo, et al.
Publicado: (2026)
por: Miao, Bo, et al.
Publicado: (2026)
DC-VLAQ: Query-Residual Aggregation for Robust Visual Place Recognition
por: Zhu, Hanyu, et al.
Publicado: (2026)
por: Zhu, Hanyu, et al.
Publicado: (2026)
Generalized Robot 3D Vision-Language Model with Fast Rendering and Pre-Training Vision-Language Alignment
por: Liu, Kangcheng, et al.
Publicado: (2023)
por: Liu, Kangcheng, et al.
Publicado: (2023)
Multimodal Fusion and Vision-Language Models: A Survey for Robot Vision
por: Han, Xiaofeng, et al.
Publicado: (2025)
por: Han, Xiaofeng, et al.
Publicado: (2025)
Detecting Precise Hand Touch Moments in Egocentric Video
por: Nguyen, Huy Anh, et al.
Publicado: (2026)
por: Nguyen, Huy Anh, et al.
Publicado: (2026)
Query3D: LLM-Powered Open-Vocabulary Scene Segmentation with Language Embedded 3D Gaussian
por: Chahe, Amirhosein, et al.
Publicado: (2024)
por: Chahe, Amirhosein, et al.
Publicado: (2024)
Attention Hijacking: Response Manipulation Across Queries in Vision-Language Models
por: Wang, Zhiqiang, et al.
Publicado: (2026)
por: Wang, Zhiqiang, et al.
Publicado: (2026)
TANGO: Traversability-Aware Navigation with Local Metric Control for Topological Goals
por: Podgorski, Stefan, et al.
Publicado: (2025)
por: Podgorski, Stefan, et al.
Publicado: (2025)
InVDriver: Intra-Instance Aware Vectorized Query-Based Autonomous Driving Transformer
por: Zhang, Bo, et al.
Publicado: (2025)
por: Zhang, Bo, et al.
Publicado: (2025)
QueST: Persistent Queries as Semantic Monitors for Drift Suppression in Long-Horizon Tracking
por: Anand, Mayank, et al.
Publicado: (2026)
por: Anand, Mayank, et al.
Publicado: (2026)
Understanding the Impact of Geometric Foundation Models on Vision-Language-Action Models
por: Yang, Yurou, et al.
Publicado: (2026)
por: Yang, Yurou, et al.
Publicado: (2026)
NEARL-CLIP: Interacted Query Adaptation with Orthogonal Regularization for Medical Vision-Language Understanding
por: Peng, Zelin, et al.
Publicado: (2025)
por: Peng, Zelin, et al.
Publicado: (2025)
DexVLG: Dexterous Vision-Language-Grasp Model at Scale
por: He, Jiawei, et al.
Publicado: (2025)
por: He, Jiawei, et al.
Publicado: (2025)
LLaDA-VLA: Vision Language Diffusion Action Models
por: Wen, Yuqing, et al.
Publicado: (2025)
por: Wen, Yuqing, et al.
Publicado: (2025)
BOP-ASK: Object-Interaction Reasoning for Vision-Language Models
por: Bhat, Vineet, et al.
Publicado: (2025)
por: Bhat, Vineet, et al.
Publicado: (2025)
AffordanceLLM: Grounding Affordance from Vision Language Models
por: Qian, Shengyi, et al.
Publicado: (2024)
por: Qian, Shengyi, et al.
Publicado: (2024)
QUAR-VLA: Vision-Language-Action Model for Quadruped Robots
por: Ding, Pengxiang, et al.
Publicado: (2023)
por: Ding, Pengxiang, et al.
Publicado: (2023)
Towards Open-World Grasping with Large Vision-Language Models
por: Tziafas, Georgios, et al.
Publicado: (2024)
por: Tziafas, Georgios, et al.
Publicado: (2024)
Structured Observation Language for Efficient and Generalizable Vision-Language Navigation
por: Peng, Daojie, et al.
Publicado: (2026)
por: Peng, Daojie, et al.
Publicado: (2026)
Query-Calibrated Segmental Admission for Descriptor-Agnostic LiDAR Loop Closure in Repetitive Environments
por: Kim, Jaehyun, et al.
Publicado: (2025)
por: Kim, Jaehyun, et al.
Publicado: (2025)
StreamLTS: Query-based Temporal-Spatial LiDAR Fusion for Cooperative Object Detection
por: Yuan, Yunshuang, et al.
Publicado: (2024)
por: Yuan, Yunshuang, et al.
Publicado: (2024)
MAG-VLAQ: Multi-modal Aerial-Ground Query Aggregation for Cross-View Place Recognition
por: Xu, Zhengyi, et al.
Publicado: (2026)
por: Xu, Zhengyi, et al.
Publicado: (2026)
Natural Language Instructions for Scene-Responsive Human-in-the-Loop Motion Planning in Autonomous Driving using Vision-Language-Action Models
por: Martinez-Sanchez, Angel, et al.
Publicado: (2026)
por: Martinez-Sanchez, Angel, et al.
Publicado: (2026)
Dual-Stream Diffusion for World-Model Augmented Vision-Language-Action Model
por: Won, John, et al.
Publicado: (2025)
por: Won, John, et al.
Publicado: (2025)
WMNav: Integrating Vision-Language Models into World Models for Object Goal Navigation
por: Nie, Dujun, et al.
Publicado: (2025)
por: Nie, Dujun, et al.
Publicado: (2025)
Ejemplares similares
-
Enhancing Embodied Object Detection through Language-Image Pre-training and Implicit Object Memory
por: Chapman, Nicolas Harvey, et al.
Publicado: (2024) -
Vision Foundation Models for Domain Generalisable Cross-View Localisation in Planetary Ground-Aerial Robotic Teams
por: Holden, Lachlan, et al.
Publicado: (2026) -
Embodied Domain Adaptation for Object Detection
por: Shi, Xiangyu, et al.
Publicado: (2025) -
A Physical Agentic Loop for Language-Guided Grasping with Execution-State Monitoring
por: Wang, Wenze, et al.
Publicado: (2026) -
SmartWay: Enhanced Waypoint Prediction and Backtracking for Zero-Shot Vision-and-Language Navigation
por: Shi, Xiangyu, et al.
Publicado: (2025)