Scene-Graph ViT: End-to-End Open-Vocabulary Visual Relationship Detection
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Salzmann, Tim, Ryll, Markus, Bewley, Alex, Minderer, Matthias |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Hierarchical Open-Vocabulary 3D Scene Graphs for Language-Grounded Robot Navigation
par: Werby, Abdelrhman, et autres
Publié: (2024)
par: Werby, Abdelrhman, et autres
Publié: (2024)
Leverage Cross-Attention for End-to-End Open-Vocabulary Panoptic Reconstruction
par: Yu, Xuan, et autres
Publié: (2025)
par: Yu, Xuan, et autres
Publié: (2025)
Scaling Open-Vocabulary Object Detection
par: Minderer, Matthias, et autres
Publié: (2023)
par: Minderer, Matthias, et autres
Publié: (2023)
Learning Humanoid End-Effector Control for Open-Vocabulary Visual Loco-Manipulation
par: Dong, Runpei, et autres
Publié: (2026)
par: Dong, Runpei, et autres
Publié: (2026)
DivScene: Towards Open-Vocabulary Object Navigation with Large Vision Language Models in Diverse Scenes
par: Wang, Zhaowei, et autres
Publié: (2024)
par: Wang, Zhaowei, et autres
Publié: (2024)
EMMA: End-to-End Multimodal Model for Autonomous Driving
par: Hwang, Jyh-Jing, et autres
Publié: (2024)
par: Hwang, Jyh-Jing, et autres
Publié: (2024)
OpenEMMA: Open-Source Multimodal Model for End-to-End Autonomous Driving
par: Xing, Shuo, et autres
Publié: (2024)
par: Xing, Shuo, et autres
Publié: (2024)
Point2Graph: An End-to-end Point Cloud-based 3D Open-Vocabulary Scene Graph for Robot Navigation
par: Xu, Yifan, et autres
Publié: (2024)
par: Xu, Yifan, et autres
Publié: (2024)
End-to-End Navigation with Vision Language Models: Transforming Spatial Reasoning into Question-Answering
par: Goetting, Dylan, et autres
Publié: (2024)
par: Goetting, Dylan, et autres
Publié: (2024)
From Human Intention to Action Prediction: Intention-Driven End-to-End Autonomous Driving
par: Zheng, Huan, et autres
Publié: (2025)
par: Zheng, Huan, et autres
Publié: (2025)
Adapting Pretrained ViTs with Convolution Injector for Visuo-Motor Control
par: Hwang, Dongyoon, et autres
Publié: (2024)
par: Hwang, Dongyoon, et autres
Publié: (2024)
InfraGPT Smart Infrastructure: An End-to-End VLM-Based Framework for Detecting and Managing Urban Defects
par: Mohamed, Ibrahim Sheikh, et autres
Publié: (2025)
par: Mohamed, Ibrahim Sheikh, et autres
Publié: (2025)
The Bare Necessities: Designing Simple, Effective Open-Vocabulary Scene Graphs
par: Kassab, Christina, et autres
Publié: (2024)
par: Kassab, Christina, et autres
Publié: (2024)
ViT-VS: On the Applicability of Pretrained Vision Transformer Features for Generalizable Visual Servoing
par: Scherl, Alessandro, et autres
Publié: (2025)
par: Scherl, Alessandro, et autres
Publié: (2025)
Future Success Prediction in Open-Vocabulary Object Manipulation Tasks Based on End-Effector Trajectories
par: Kambara, Motonari, et autres
Publié: (2024)
par: Kambara, Motonari, et autres
Publié: (2024)
GraphEQA: Using 3D Semantic Scene Graphs for Real-time Embodied Question Answering
par: Saxena, Saumya, et autres
Publié: (2024)
par: Saxena, Saumya, et autres
Publié: (2024)
Logic-RAG: Augmenting Large Multimodal Models with Visual-Spatial Knowledge for Road Scene Understanding
par: Kabir, Imran, et autres
Publié: (2025)
par: Kabir, Imran, et autres
Publié: (2025)
How to train your ViT for OOD Detection
par: Mueller, Maximilian, et autres
Publié: (2024)
par: Mueller, Maximilian, et autres
Publié: (2024)
Data Scaling Laws for End-to-End Autonomous Driving
par: Naumann, Alexander, et autres
Publié: (2025)
par: Naumann, Alexander, et autres
Publié: (2025)
Hierarchical and Holistic Open-Vocabulary Functional 3D Scene Graphs for Indoor Spaces
par: Hu, Xinggang, et autres
Publié: (2026)
par: Hu, Xinggang, et autres
Publié: (2026)
Open-Vocabulary Mobile Manipulation Based on Double Relaxed Contrastive Learning with Dense Labeling
par: Yashima, Daichi, et autres
Publié: (2024)
par: Yashima, Daichi, et autres
Publié: (2024)
Efficient Multi-Camera Tokenization with Triplanes for End-to-End Driving
par: Ivanovic, Boris, et autres
Publié: (2025)
par: Ivanovic, Boris, et autres
Publié: (2025)
GEMINUS: Dual-aware Global and Scene-Adaptive Mixture-of-Experts for End-to-End Autonomous Driving
par: Wan, Chi, et autres
Publié: (2025)
par: Wan, Chi, et autres
Publié: (2025)
ObjectVLA: End-to-End Open-World Object Manipulation Without Demonstration
par: Zhu, Minjie, et autres
Publié: (2025)
par: Zhu, Minjie, et autres
Publié: (2025)
OpenESS: Event-based Semantic Scene Understanding with Open Vocabularies
par: Kong, Lingdong, et autres
Publié: (2024)
par: Kong, Lingdong, et autres
Publié: (2024)
DriveTransformer: Unified Transformer for Scalable End-to-End Autonomous Driving
par: Jia, Xiaosong, et autres
Publié: (2025)
par: Jia, Xiaosong, et autres
Publié: (2025)
VAT: Vision Action Transformer by Unlocking Full Representation of ViT
par: Li, Wenhao, et autres
Publié: (2025)
par: Li, Wenhao, et autres
Publié: (2025)
DM2RM: Dual-Mode Multimodal Ranking for Target Objects and Receptacles Based on Open-Vocabulary Instructions
par: Korekata, Ryosuke, et autres
Publié: (2024)
par: Korekata, Ryosuke, et autres
Publié: (2024)
RowDetr: End-to-End Crop Row Detection Using Polynomials
par: Cheppally, Rahul Harsha, et autres
Publié: (2024)
par: Cheppally, Rahul Harsha, et autres
Publié: (2024)
Query3D: LLM-Powered Open-Vocabulary Scene Segmentation with Language Embedded 3D Gaussian
par: Chahe, Amirhosein, et autres
Publié: (2024)
par: Chahe, Amirhosein, et autres
Publié: (2024)
Semantic Segmentation and Scene Reconstruction of RGB-D Image Frames: An End-to-End Modular Pipeline for Robotic Applications
par: Zheng, Zhiwu, et autres
Publié: (2024)
par: Zheng, Zhiwu, et autres
Publié: (2024)
OpenOcc: Open Vocabulary 3D Scene Reconstruction via Occupancy Representation
par: Jiang, Haochen, et autres
Publié: (2024)
par: Jiang, Haochen, et autres
Publié: (2024)
Modulating CNN Features with Pre-Trained ViT Representations for Open-Vocabulary Object Detection
par: Gao, Xiangyu, et autres
Publié: (2025)
par: Gao, Xiangyu, et autres
Publié: (2025)
ViPRA: Video Prediction for Robot Actions
par: Routray, Sandeep, et autres
Publié: (2025)
par: Routray, Sandeep, et autres
Publié: (2025)
Spatially Visual Perception for End-to-End Robotic Learning
par: Davies, Travis, et autres
Publié: (2024)
par: Davies, Travis, et autres
Publié: (2024)
See Less, Drive Better: Generalizable End-to-End Autonomous Driving via Foundation Models Stochastic Patch Selection
par: Mallak, Amir, et autres
Publié: (2026)
par: Mallak, Amir, et autres
Publié: (2026)
Hidden Biases of End-to-End Driving Datasets
par: Zimmerlin, Julian, et autres
Publié: (2024)
par: Zimmerlin, Julian, et autres
Publié: (2024)
Exploring the Causality of End-to-End Autonomous Driving
par: Li, Jiankun, et autres
Publié: (2024)
par: Li, Jiankun, et autres
Publié: (2024)
SToRe3D: Sparse Token Relevance in ViTs for Efficient Multi-View 3D Object Detection
par: Papais, Sandro, et autres
Publié: (2026)
par: Papais, Sandro, et autres
Publié: (2026)
Lexicon3D: Probing Visual Foundation Models for Complex 3D Scene Understanding
par: Man, Yunze, et autres
Publié: (2024)
par: Man, Yunze, et autres
Publié: (2024)
Documents similaires
-
Hierarchical Open-Vocabulary 3D Scene Graphs for Language-Grounded Robot Navigation
par: Werby, Abdelrhman, et autres
Publié: (2024) -
Leverage Cross-Attention for End-to-End Open-Vocabulary Panoptic Reconstruction
par: Yu, Xuan, et autres
Publié: (2025) -
Scaling Open-Vocabulary Object Detection
par: Minderer, Matthias, et autres
Publié: (2023) -
Learning Humanoid End-Effector Control for Open-Vocabulary Visual Loco-Manipulation
par: Dong, Runpei, et autres
Publié: (2026) -
DivScene: Towards Open-Vocabulary Object Navigation with Large Vision Language Models in Diverse Scenes
par: Wang, Zhaowei, et autres
Publié: (2024)