Break Out the Silverware -- Semantic Understanding of Stored Household Items
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Levi-Richter, Michaela, Mirsky, Reuth, Glickman, Oren |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
OSMa-Bench: Evaluating Open Semantic Mapping Under Varying Lighting Conditions
par: Popov, Maxim, et autres
Publié: (2025)
par: Popov, Maxim, et autres
Publié: (2025)
IS-Bench: Evaluating Interactive Safety of VLM-Driven Embodied Agents in Daily Household Tasks
par: Lu, Xiaoya, et autres
Publié: (2025)
par: Lu, Xiaoya, et autres
Publié: (2025)
VLURes: Benchmarking VLM Visual and Linguistic Understanding in Low-Resource Languages
par: Atuhurra, Jesse, et autres
Publié: (2025)
par: Atuhurra, Jesse, et autres
Publié: (2025)
Bridging the 2D-3D Gap: A Hierarchical Semantic-Geometric Map for Vision Language Navigation
par: Li, Kailing, et autres
Publié: (2026)
par: Li, Kailing, et autres
Publié: (2026)
RoboSpatial: Teaching Spatial Understanding to 2D and 3D Vision-Language Models for Robotics
par: Song, Chan Hee, et autres
Publié: (2024)
par: Song, Chan Hee, et autres
Publié: (2024)
Semantic-Drive: Democratizing Long-Tail Data Curation via Open-Vocabulary Grounding and Neuro-Symbolic VLM Consensus
par: Guillen-Perez, Antonio
Publié: (2025)
par: Guillen-Perez, Antonio
Publié: (2025)
Analyzing the Shopping Journey: Computing Shelf Browsing Visits in a Physical Retail Store
par: Morales, Luis Yoichi, et autres
Publié: (2026)
par: Morales, Luis Yoichi, et autres
Publié: (2026)
Smart Help: Strategic Opponent Modeling for Proactive and Adaptive Robot Assistance in Households
par: Cao, Zhihao, et autres
Publié: (2024)
par: Cao, Zhihao, et autres
Publié: (2024)
TaskGround: Structured Executable Task Inference for Full-Scene Household Reasoning
par: Feng, ZhiYuan, et autres
Publié: (2026)
par: Feng, ZhiYuan, et autres
Publié: (2026)
Temporal Preference Optimization for Long-Form Video Understanding
par: Li, Rui, et autres
Publié: (2025)
par: Li, Rui, et autres
Publié: (2025)
On Deep Learning for Geometric and Semantic Scene Understanding Using On-Vehicle 3D LiDAR
par: Li, Li
Publié: (2024)
par: Li, Li
Publié: (2024)
PhysBench: Benchmarking and Enhancing Vision-Language Models for Physical World Understanding
par: Chow, Wei, et autres
Publié: (2025)
par: Chow, Wei, et autres
Publié: (2025)
SceneVerse: Scaling 3D Vision-Language Learning for Grounded Scene Understanding
par: Jia, Baoxiong, et autres
Publié: (2024)
par: Jia, Baoxiong, et autres
Publié: (2024)
Ross3D: Reconstructive Visual Instruction Tuning with 3D-Awareness
par: Wang, Haochen, et autres
Publié: (2025)
par: Wang, Haochen, et autres
Publié: (2025)
How Much Do Large Language Models Know about Human Motion? A Case Study in 3D Avatar Control
par: Li, Kunhang, et autres
Publié: (2025)
par: Li, Kunhang, et autres
Publié: (2025)
InfraGPT Smart Infrastructure: An End-to-End VLM-Based Framework for Detecting and Managing Urban Defects
par: Mohamed, Ibrahim Sheikh, et autres
Publié: (2025)
par: Mohamed, Ibrahim Sheikh, et autres
Publié: (2025)
Rethinking the Embodied Gap in Vision-and-Language Navigation: A Holistic Study of Physical and Visual Disparities
par: Wang, Liuyi, et autres
Publié: (2025)
par: Wang, Liuyi, et autres
Publié: (2025)
HERO: Hierarchical Traversable 3D Scene Graphs for Embodied Navigation Among Movable Obstacles
par: Wang, Yunheng, et autres
Publié: (2025)
par: Wang, Yunheng, et autres
Publié: (2025)
SoMi-ToM: Evaluating Multi-Perspective Theory of Mind in Embodied Social Interactions
par: Fan, Xianzhe, et autres
Publié: (2025)
par: Fan, Xianzhe, et autres
Publié: (2025)
REMAC: Self-Reflective and Self-Evolving Multi-Agent Collaboration for Long-Horizon Robot Manipulation
par: Yuan, Puzhen, et autres
Publié: (2025)
par: Yuan, Puzhen, et autres
Publié: (2025)
Ground-level Viewpoint Vision-and-Language Navigation in Continuous Environments
par: Li, Zerui, et autres
Publié: (2025)
par: Li, Zerui, et autres
Publié: (2025)
SIMSplat: Predictive Driving Scene Editing with Language-aligned 4D Gaussian Splatting
par: Park, Sung-Yeon, et autres
Publié: (2025)
par: Park, Sung-Yeon, et autres
Publié: (2025)
DreamNav: A Trajectory-Based Imaginative Framework for Zero-Shot Vision-and-Language Navigation
par: Wang, Yunheng, et autres
Publié: (2025)
par: Wang, Yunheng, et autres
Publié: (2025)
Unseen from Seen: Rewriting Observation-Instruction Using Foundation Models for Augmenting Vision-Language Navigation
par: Wei, Ziming, et autres
Publié: (2025)
par: Wei, Ziming, et autres
Publié: (2025)
Do Visual Imaginations Improve Vision-and-Language Navigation Agents?
par: Perincherry, Akhil, et autres
Publié: (2025)
par: Perincherry, Akhil, et autres
Publié: (2025)
SO-Bench: A Structural Output Evaluation of Multimodal LLMs
par: Feng, Di, et autres
Publié: (2025)
par: Feng, Di, et autres
Publié: (2025)
From Forecasting to Planning: Policy World Model for Collaborative State-Action Prediction
par: Zhao, Zhida, et autres
Publié: (2025)
par: Zhao, Zhida, et autres
Publié: (2025)
LangCoop: Collaborative Driving with Language
par: Gao, Xiangbo, et autres
Publié: (2025)
par: Gao, Xiangbo, et autres
Publié: (2025)
Following Route Instructions using Large Vision-Language Models: A Comparison between Low-level and Panoramic Action Spaces
par: Kåsene, Vebjørn Haug, et autres
Publié: (2025)
par: Kåsene, Vebjørn Haug, et autres
Publié: (2025)
SafeCoop: Unravelling Full Stack Safety in Agentic Collaborative Driving
par: Gao, Xiangbo, et autres
Publié: (2025)
par: Gao, Xiangbo, et autres
Publié: (2025)
OmniEVA: Embodied Versatile Planner via Task-Adaptive 3D-Grounded and Embodiment-aware Reasoning
par: Liu, Yuecheng, et autres
Publié: (2025)
par: Liu, Yuecheng, et autres
Publié: (2025)
Towards Predicting Any Human Trajectory In Context
par: Fujii, Ryo, et autres
Publié: (2025)
par: Fujii, Ryo, et autres
Publié: (2025)
NavSpace: How Navigation Agents Follow Spatial Intelligence Instructions
par: Yang, Haolin, et autres
Publié: (2025)
par: Yang, Haolin, et autres
Publié: (2025)
ROVER: Recursive Reasoning Over Videos with Vision-Language Models for Embodied Tasks
par: Schroeder, Philip, et autres
Publié: (2025)
par: Schroeder, Philip, et autres
Publié: (2025)
Learning Compositional Behaviors from Demonstration and Language
par: Liu, Weiyu, et autres
Publié: (2025)
par: Liu, Weiyu, et autres
Publié: (2025)
ENACT: Evaluating Embodied Cognition with World Modeling of Egocentric Interaction
par: Wang, Qineng, et autres
Publié: (2025)
par: Wang, Qineng, et autres
Publié: (2025)
CorrectNav: Self-Correction Flywheel Empowers Vision-Language-Action Navigation Model
par: Yu, Zhuoyuan, et autres
Publié: (2025)
par: Yu, Zhuoyuan, et autres
Publié: (2025)
Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation
par: Zhang, Pingrui, et autres
Publié: (2025)
par: Zhang, Pingrui, et autres
Publié: (2025)
MotionScript: Natural Language Descriptions for Expressive 3D Human Motions
par: Yazdian, Payam Jome, et autres
Publié: (2023)
par: Yazdian, Payam Jome, et autres
Publié: (2023)
Probing Collision Grounding in Vision-Language Models for Safe Human-Robot Collaboration
par: Wang, Jun, et autres
Publié: (2026)
par: Wang, Jun, et autres
Publié: (2026)
Documents similaires
-
OSMa-Bench: Evaluating Open Semantic Mapping Under Varying Lighting Conditions
par: Popov, Maxim, et autres
Publié: (2025) -
IS-Bench: Evaluating Interactive Safety of VLM-Driven Embodied Agents in Daily Household Tasks
par: Lu, Xiaoya, et autres
Publié: (2025) -
VLURes: Benchmarking VLM Visual and Linguistic Understanding in Low-Resource Languages
par: Atuhurra, Jesse, et autres
Publié: (2025) -
Bridging the 2D-3D Gap: A Hierarchical Semantic-Geometric Map for Vision Language Navigation
par: Li, Kailing, et autres
Publié: (2026) -
RoboSpatial: Teaching Spatial Understanding to 2D and 3D Vision-Language Models for Robotics
par: Song, Chan Hee, et autres
Publié: (2024)