Guardado en:
| Autores principales: | Cheng, Ning, Li, You, Gao, Jing, Fang, Bin, Xu, Jinan, Han, Wenjuan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2403.09813 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Touch100k: A Large-Scale Touch-Language-Vision Dataset for Touch-Centric Multimodal Representation
por: Cheng, Ning, et al.
Publicado: (2024)
por: Cheng, Ning, et al.
Publicado: (2024)
SToLa: Self-Adaptive Touch-Language Framework with Tactile Commonsense Reasoning in Open-Ended Scenarios
por: Cheng, Ning, et al.
Publicado: (2025)
por: Cheng, Ning, et al.
Publicado: (2025)
A Touch, Vision, and Language Dataset for Multimodal Alignment
por: Fu, Letian, et al.
Publicado: (2024)
por: Fu, Letian, et al.
Publicado: (2024)
SaPaVe: Towards Active Perception and Manipulation in Vision-Language-Action Models for Robotics
por: Liu, Mengzhen, et al.
Publicado: (2026)
por: Liu, Mengzhen, et al.
Publicado: (2026)
Multimodal Fusion and Vision-Language Models: A Survey for Robot Vision
por: Han, Xiaofeng, et al.
Publicado: (2025)
por: Han, Xiaofeng, et al.
Publicado: (2025)
AnyTouch 2: General Optical Tactile Representation Learning For Dynamic Tactile Perception
por: Feng, Ruoxuan, et al.
Publicado: (2026)
por: Feng, Ruoxuan, et al.
Publicado: (2026)
VitaTouch: Property-Aware Vision-Tactile-Language Model for Robotic Quality Inspection in Manufacturing
por: Zong, Junyi, et al.
Publicado: (2026)
por: Zong, Junyi, et al.
Publicado: (2026)
V2X-QA: A Comprehensive Reasoning Dataset and Benchmark for Multimodal Large Language Models in Autonomous Driving Across Ego, Infrastructure, and Cooperative Views
por: You, Junwei, et al.
Publicado: (2026)
por: You, Junwei, et al.
Publicado: (2026)
TinyVLA: Towards Fast, Data-Efficient Vision-Language-Action Models for Robotic Manipulation
por: Wen, Junjie, et al.
Publicado: (2024)
por: Wen, Junjie, et al.
Publicado: (2024)
FantasyVLN: Unified Multimodal Chain-of-Thought Reasoning for Vision-Language Navigation
por: Zuo, Jing, et al.
Publicado: (2026)
por: Zuo, Jing, et al.
Publicado: (2026)
Binding Touch to Everything: Learning Unified Multimodal Tactile Representations
por: Yang, Fengyu, et al.
Publicado: (2024)
por: Yang, Fengyu, et al.
Publicado: (2024)
AnyTouch: Learning Unified Static-Dynamic Representation across Multiple Visuo-tactile Sensors
por: Feng, Ruoxuan, et al.
Publicado: (2025)
por: Feng, Ruoxuan, et al.
Publicado: (2025)
ChatVLA: Unified Multimodal Understanding and Robot Control with Vision-Language-Action Model
por: Zhou, Zhongyi, et al.
Publicado: (2025)
por: Zhou, Zhongyi, et al.
Publicado: (2025)
ProFocus: Proactive Perception and Focused Reasoning in Vision-and-Language Navigation
por: Xue, Wei, et al.
Publicado: (2026)
por: Xue, Wei, et al.
Publicado: (2026)
Learning Gentle Grasping Using Vision, Sound, and Touch
por: Nakahara, Ken, et al.
Publicado: (2025)
por: Nakahara, Ken, et al.
Publicado: (2025)
Tacchi 2.0: A Low Computational Cost and Comprehensive Dynamic Contact Simulator for Vision-based Tactile Sensors
por: Sun, Yuhao, et al.
Publicado: (2025)
por: Sun, Yuhao, et al.
Publicado: (2025)
Enhancing Vision-Language Navigation with Multimodal Event Knowledge from Real-World Indoor Tour Videos
por: Xu, Haoxuan, et al.
Publicado: (2026)
por: Xu, Haoxuan, et al.
Publicado: (2026)
Uni-LaViRA: Language-Vision-Robot Actions Translation for Unified Embodied Navigation
por: Ding, Hongyu, et al.
Publicado: (2026)
por: Ding, Hongyu, et al.
Publicado: (2026)
TouchAnything: Diffusion-Guided 3D Reconstruction from Sparse Robot Touches
por: Gu, Langzhe, et al.
Publicado: (2026)
por: Gu, Langzhe, et al.
Publicado: (2026)
Next Best Sense: Guiding Vision and Touch with FisherRF for 3D Gaussian Splatting
por: Strong, Matthew, et al.
Publicado: (2024)
por: Strong, Matthew, et al.
Publicado: (2024)
DTP: A Simple yet Effective Distracting Token Pruning Framework for Vision-Language Action Models
por: Li, Chenyang, et al.
Publicado: (2026)
por: Li, Chenyang, et al.
Publicado: (2026)
Look, Zoom, Understand: The Robotic Eyeball for Embodied Perception
por: Yang, Jiashu, et al.
Publicado: (2025)
por: Yang, Jiashu, et al.
Publicado: (2025)
Cross-Sensor Touch Generation
por: Rodriguez, Samanta, et al.
Publicado: (2025)
por: Rodriguez, Samanta, et al.
Publicado: (2025)
CoPeD-Advancing Multi-Robot Collaborative Perception: A Comprehensive Dataset in Real-World Environments
por: Zhou, Yang, et al.
Publicado: (2024)
por: Zhou, Yang, et al.
Publicado: (2024)
Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms
por: Cao, Zhixiang, et al.
Publicado: (2026)
por: Cao, Zhixiang, et al.
Publicado: (2026)
MiVLA: Towards Generalizable Vision-Language-Action Model with Human-Robot Mutual Imitation Pre-training
por: Yin, Zhenhan, et al.
Publicado: (2025)
por: Yin, Zhenhan, et al.
Publicado: (2025)
HRIBench: Benchmarking Vision-Language Models for Real-Time Human Perception in Human-Robot Interaction
por: Shi, Zhonghao, et al.
Publicado: (2025)
por: Shi, Zhonghao, et al.
Publicado: (2025)
DOPE: Dual Object Perception-Enhancement Network for Vision-and-Language Navigation
por: Yu, Yinfeng, et al.
Publicado: (2025)
por: Yu, Yinfeng, et al.
Publicado: (2025)
UAOR: Uncertainty-aware Observation Reinjection for Vision-Language-Action Models
por: Yang, Jiabing, et al.
Publicado: (2026)
por: Yang, Jiabing, et al.
Publicado: (2026)
dVLA: Diffusion Vision-Language-Action Model with Multimodal Chain-of-Thought
por: Wen, Junjie, et al.
Publicado: (2025)
por: Wen, Junjie, et al.
Publicado: (2025)
Robobench: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models as Embodied Brain
por: Luo, Yulin, et al.
Publicado: (2025)
por: Luo, Yulin, et al.
Publicado: (2025)
DME-Driver: Integrating Human Decision Logic and 3D Scene Perception in Autonomous Driving
por: Han, Wencheng, et al.
Publicado: (2024)
por: Han, Wencheng, et al.
Publicado: (2024)
ManiSoft: Towards Vision-Language Manipulation for Soft Continuum Robotics
por: Wei, Ziyu, et al.
Publicado: (2026)
por: Wei, Ziyu, et al.
Publicado: (2026)
SIMPACT: Simulation-Enabled Action Planning using Vision-Language Models
por: Liu, Haowen, et al.
Publicado: (2025)
por: Liu, Haowen, et al.
Publicado: (2025)
When Vision Overrides Language: Evaluating and Mitigating Counterfactual Failures in VLAs
por: Fang, Yu, et al.
Publicado: (2026)
por: Fang, Yu, et al.
Publicado: (2026)
Seeing Realism from Simulation: Efficient Video Transfer for Vision-Language-Action Data Augmentation
por: Hui, Chenyu, et al.
Publicado: (2026)
por: Hui, Chenyu, et al.
Publicado: (2026)
DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge
por: Zhang, Wenyao, et al.
Publicado: (2025)
por: Zhang, Wenyao, et al.
Publicado: (2025)
RobotPan: A 360$^\circ$ Surround-View Robotic Vision System for Embodied Perception
por: Ma, Jiahao, et al.
Publicado: (2026)
por: Ma, Jiahao, et al.
Publicado: (2026)
Simultaneous Tactile-Visual Perception for Learning Multimodal Robot Manipulation
por: Li, Yuyang, et al.
Publicado: (2025)
por: Li, Yuyang, et al.
Publicado: (2025)
Masked Depth Modeling for Spatial Perception
por: Tan, Bin, et al.
Publicado: (2026)
por: Tan, Bin, et al.
Publicado: (2026)
Ejemplares similares
-
Touch100k: A Large-Scale Touch-Language-Vision Dataset for Touch-Centric Multimodal Representation
por: Cheng, Ning, et al.
Publicado: (2024) -
SToLa: Self-Adaptive Touch-Language Framework with Tactile Commonsense Reasoning in Open-Ended Scenarios
por: Cheng, Ning, et al.
Publicado: (2025) -
A Touch, Vision, and Language Dataset for Multimodal Alignment
por: Fu, Letian, et al.
Publicado: (2024) -
SaPaVe: Towards Active Perception and Manipulation in Vision-Language-Action Models for Robotics
por: Liu, Mengzhen, et al.
Publicado: (2026) -
Multimodal Fusion and Vision-Language Models: A Survey for Robot Vision
por: Han, Xiaofeng, et al.
Publicado: (2025)