GAgent: An Adaptive Rigid-Soft Gripping Agent with Vision Language Models for Complex Lighting Environments
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Zhuowei, Zhang, Miao, Lin, Xiaotian, Yin, Meng, Lu, Shuai, Wang, Xueqian |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Cog-GA: A Large Language Models-based Generative Agent for Vision-Language Navigation in Continuous Environments
por: Li, Zhiyuan, et al.
Publicado: (2024)
por: Li, Zhiyuan, et al.
Publicado: (2024)
Interactive Navigation in Environments with Traversable Obstacles Using Large Language and Vision-Language Models
por: Zhang, Zhen, et al.
Publicado: (2023)
por: Zhang, Zhen, et al.
Publicado: (2023)
VacuumVLA: Boosting VLA Capabilities via a Unified Suction and Gripping Tool for Complex Robotic Manipulation
por: Zhou, Hui, et al.
Publicado: (2025)
por: Zhou, Hui, et al.
Publicado: (2025)
SoftMAC: Differentiable Soft Body Simulation with Forecast-based Contact Model and Two-way Coupling with Articulated Rigid Bodies and Clothes
por: Liu, Min, et al.
Publicado: (2023)
por: Liu, Min, et al.
Publicado: (2023)
VLA-AN: An Efficient and Onboard Vision-Language-Action Framework for Aerial Navigation in Complex Environments
por: Wu, Yuze, et al.
Publicado: (2025)
por: Wu, Yuze, et al.
Publicado: (2025)
Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
por: Wang, Qiuyue, et al.
Publicado: (2026)
por: Wang, Qiuyue, et al.
Publicado: (2026)
Mastering Contact-rich Tasks by Combining Soft and Rigid Robotics with Imitation Learning
por: Montero, Mariano Ramírez, et al.
Publicado: (2024)
por: Montero, Mariano Ramírez, et al.
Publicado: (2024)
Vision Language Models Can Parse Floor Plan Maps
por: DeFazio, David, et al.
Publicado: (2024)
por: DeFazio, David, et al.
Publicado: (2024)
FalconWing: An Ultra-Light Indoor Fixed-Wing UAV Platform for Vision-Based Autonomy
por: Miao, Yan, et al.
Publicado: (2025)
por: Miao, Yan, et al.
Publicado: (2025)
A Vision-Language-Action Model for Adaptive Ultrasound-Guided Needle Insertion and Needle Tracking
por: Zhang, Yuelin, et al.
Publicado: (2026)
por: Zhang, Yuelin, et al.
Publicado: (2026)
Visual-tactile Fusion for Transparent Object Grasping in Complex Backgrounds
por: Li, Shoujie, et al.
Publicado: (2022)
por: Li, Shoujie, et al.
Publicado: (2022)
Adaptive Domain Modeling with Language Models: A Multi-Agent Approach to Task Planning
por: Babu, Harisankar, et al.
Publicado: (2025)
por: Babu, Harisankar, et al.
Publicado: (2025)
Bridging Embodiment Gaps: Deploying Vision-Language-Action Models on Soft Robots
por: Su, Haochen, et al.
Publicado: (2025)
por: Su, Haochen, et al.
Publicado: (2025)
DeepThinkVLA: Enhancing Reasoning Capability of Vision-Language-Action Models
por: Yin, Cheng, et al.
Publicado: (2025)
por: Yin, Cheng, et al.
Publicado: (2025)
Adaptive Capacity Allocation for Vision Language Action Fine-tuning
por: Kim, Donghoon, et al.
Publicado: (2026)
por: Kim, Donghoon, et al.
Publicado: (2026)
Reduced-Order Model-Guided Reinforcement Learning for Demonstration-Free Humanoid Locomotion
por: Liu, Shuai, et al.
Publicado: (2025)
por: Liu, Shuai, et al.
Publicado: (2025)
A Vision-Language-Action-Critic Model for Robotic Real-World Reinforcement Learning
por: Zhai, Shaopeng, et al.
Publicado: (2025)
por: Zhai, Shaopeng, et al.
Publicado: (2025)
AnchorRefine: Synergy-Manipulation Based on Trajectory Anchor and Residual Refinement for Vision-Language-Action Models
por: Jia, Tingzheng, et al.
Publicado: (2026)
por: Jia, Tingzheng, et al.
Publicado: (2026)
General-Purpose Aerial Intelligent Agents Empowered by Large Language Models
por: Zhao, Ji, et al.
Publicado: (2025)
por: Zhao, Ji, et al.
Publicado: (2025)
Test-Time Adaptation for Tactile-Vision-Language Models
por: Ye, Chuyang, et al.
Publicado: (2026)
por: Ye, Chuyang, et al.
Publicado: (2026)
IndoorUAV: Benchmarking Vision-Language UAV Navigation in Continuous Indoor Environments
por: Liu, Xu, et al.
Publicado: (2025)
por: Liu, Xu, et al.
Publicado: (2025)
RePO-VLA: Recovery-Driven Policy Optimization for Vision-Language-Action Models
por: Liufu, Weijia, et al.
Publicado: (2026)
por: Liufu, Weijia, et al.
Publicado: (2026)
CityNavAgent: Aerial Vision-and-Language Navigation with Hierarchical Semantic Planning and Global Memory
por: Zhang, Weichen, et al.
Publicado: (2025)
por: Zhang, Weichen, et al.
Publicado: (2025)
DeMaVLA: A Vision-Language-Action Foundation Model for Generalizable Deformable Manipulation
por: Su, Taiyi, et al.
Publicado: (2026)
por: Su, Taiyi, et al.
Publicado: (2026)
Endowing Embodied Agents with Spatial Reasoning Capabilities for Vision-and-Language Navigation
por: Bai, Qianqian, et al.
Publicado: (2025)
por: Bai, Qianqian, et al.
Publicado: (2025)
Align-Then-stEer: Adapting the Vision-Language Action Models through Unified Latent Guidance
por: Zhang, Yang, et al.
Publicado: (2025)
por: Zhang, Yang, et al.
Publicado: (2025)
Zero-shot Object Navigation with Vision-Language Models Reasoning
por: Wen, Congcong, et al.
Publicado: (2024)
por: Wen, Congcong, et al.
Publicado: (2024)
ManiSoft: Towards Vision-Language Manipulation for Soft Continuum Robotics
por: Wei, Ziyu, et al.
Publicado: (2026)
por: Wei, Ziyu, et al.
Publicado: (2026)
SayNav: Grounding Large Language Models for Dynamic Planning to Navigation in New Environments
por: Rajvanshi, Abhinav, et al.
Publicado: (2023)
por: Rajvanshi, Abhinav, et al.
Publicado: (2023)
MA-VLCM: A Vision Language Critic Model for Value Estimation of Policies in Multi-Agent Team Settings
por: Shaik, Shahil, et al.
Publicado: (2026)
por: Shaik, Shahil, et al.
Publicado: (2026)
Survey of Vision-Language-Action Models for Embodied Manipulation
por: Li, Haoran, et al.
Publicado: (2025)
por: Li, Haoran, et al.
Publicado: (2025)
Experiences from Benchmarking Vision-Language-Action Models for Robotic Manipulation
por: Zhang, Yihao, et al.
Publicado: (2025)
por: Zhang, Yihao, et al.
Publicado: (2025)
Learning Adaptive Hydrodynamic Models Using Neural ODEs in Complex Conditions
por: Wang, Cong, et al.
Publicado: (2024)
por: Wang, Cong, et al.
Publicado: (2024)
NEBULA: Do We Evaluate Vision-Language-Action Agents Correctly?
por: Peng, Jierui, et al.
Publicado: (2025)
por: Peng, Jierui, et al.
Publicado: (2025)
Probing a Vision-Language-Action Model for Symbolic States and Integration into a Cognitive Architecture
por: Lu, Hong, et al.
Publicado: (2025)
por: Lu, Hong, et al.
Publicado: (2025)
CrashAgent: Crash Scenario Generation via Multi-modal Reasoning
por: Li, Miao, et al.
Publicado: (2025)
por: Li, Miao, et al.
Publicado: (2025)
UAV-CodeAgents: Scalable UAV Mission Planning via Multi-Agent ReAct and Vision-Language Reasoning
por: Sautenkov, Oleg, et al.
Publicado: (2025)
por: Sautenkov, Oleg, et al.
Publicado: (2025)
Exploring the Adversarial Vulnerabilities of Vision-Language-Action Models in Robotics
por: Wang, Taowen, et al.
Publicado: (2024)
por: Wang, Taowen, et al.
Publicado: (2024)
SmoothVLA: Aligning Vision-Language-Action Models with Physical Constraints via Intrinsic Smoothness Optimization
por: Li, Jiashun, et al.
Publicado: (2026)
por: Li, Jiashun, et al.
Publicado: (2026)
Embodied Instruction Following in Unknown Environments
por: Wu, Zhenyu, et al.
Publicado: (2024)
por: Wu, Zhenyu, et al.
Publicado: (2024)
Ejemplares similares
-
Cog-GA: A Large Language Models-based Generative Agent for Vision-Language Navigation in Continuous Environments
por: Li, Zhiyuan, et al.
Publicado: (2024) -
Interactive Navigation in Environments with Traversable Obstacles Using Large Language and Vision-Language Models
por: Zhang, Zhen, et al.
Publicado: (2023) -
VacuumVLA: Boosting VLA Capabilities via a Unified Suction and Gripping Tool for Complex Robotic Manipulation
por: Zhou, Hui, et al.
Publicado: (2025) -
SoftMAC: Differentiable Soft Body Simulation with Forecast-based Contact Model and Two-way Coupling with Articulated Rigid Bodies and Clothes
por: Liu, Min, et al.
Publicado: (2023) -
VLA-AN: An Efficient and Onboard Vision-Language-Action Framework for Aerial Navigation in Complex Environments
por: Wu, Yuze, et al.
Publicado: (2025)