Spatial-ViLT: Enhancing Visual Spatial Reasoning through Multi-Task Learning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Islam, Chashi Mahiul, Mamo, Oteo, Chacko, Samuel Jacob, Liu, Xiuwen, Yu, Weikuan |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Benchmarking Vision Language Models on German Factual Data
par: Peinl, René, et autres
Publié: (2025)
par: Peinl, René, et autres
Publié: (2025)
Attire-Based Anomaly Detection in Restricted Areas Using YOLOv8 for Enhanced CCTV Security
par: B, Abdul Aziz A., et autres
Publié: (2024)
par: B, Abdul Aziz A., et autres
Publié: (2024)
Predicting Pedestrian Crossing Behavior in Germany and Japan: Insights into Model Transferability
par: Zhang, Chi, et autres
Publié: (2024)
par: Zhang, Chi, et autres
Publié: (2024)
Predicting and Analyzing Pedestrian Crossing Behavior at Unsignalized Crossings
par: Zhang, Chi, et autres
Publié: (2024)
par: Zhang, Chi, et autres
Publié: (2024)
Hierarchical Spatial Algorithms for High-Resolution Image Quantization and Feature Extraction
par: Mohammad, Noor Islam S.
Publié: (2025)
par: Mohammad, Noor Islam S.
Publié: (2025)
Depth Priors in Removal Neural Radiance Fields
par: Guo, Zhihao, et autres
Publié: (2024)
par: Guo, Zhihao, et autres
Publié: (2024)
TWIG: Two-Step Image Generation using Segmentation Masks in Diffusion Models
par: Rakib, Mazharul Islam, et autres
Publié: (2025)
par: Rakib, Mazharul Islam, et autres
Publié: (2025)
Hodge Laplacians and Hodge Diffusion Maps
par: Gomez, Alvaro Almeida, et autres
Publié: (2025)
par: Gomez, Alvaro Almeida, et autres
Publié: (2025)
Reduced Jeffries-Matusita distance: A Novel Loss Function to Improve Generalization Performance of Deep Classification Models
par: Lashkari, Mohammad, et autres
Publié: (2024)
par: Lashkari, Mohammad, et autres
Publié: (2024)
MvBody: Multi-View-Based Hybrid Transformer Using Optical 3D Body Scan for Explainable Cesarean Section Prediction
par: Cheng, Ruting, et autres
Publié: (2025)
par: Cheng, Ruting, et autres
Publié: (2025)
A Landmark-Aware Visual Navigation Dataset
par: Johnson, Faith, et autres
Publié: (2024)
par: Johnson, Faith, et autres
Publié: (2024)
Black-box Adversarial Attacks on CNN-based SLAM Algorithms
par: Gkeka, Maria Rafaela, et autres
Publié: (2025)
par: Gkeka, Maria Rafaela, et autres
Publié: (2025)
MotionFollower: Editing Video Motion via Lightweight Score-Guided Diffusion
par: Tu, Shuyuan, et autres
Publié: (2024)
par: Tu, Shuyuan, et autres
Publié: (2024)
FT-NCFM: An Influence-Aware Data Distillation Framework for Efficient VLA Models
par: Chen, Kewei, et autres
Publié: (2025)
par: Chen, Kewei, et autres
Publié: (2025)
ATAAT: Adaptive Threat-Aware Adversarial Tuning Framework against Backdoor Attacks on Vision-Language-Action Models
par: Chen, Kewei, et autres
Publié: (2026)
par: Chen, Kewei, et autres
Publié: (2026)
BAAF: Universal Transformation of One-Class Classifiers for Unsupervised Image Anomaly Detection
par: McIntosh, Declan, et autres
Publié: (2026)
par: McIntosh, Declan, et autres
Publié: (2026)
When Less is Enough: Adaptive Token Reduction for Efficient Image Representation
par: Allakhverdov, Eduard, et autres
Publié: (2025)
par: Allakhverdov, Eduard, et autres
Publié: (2025)
Image Reconstruction as a Tool for Feature Analysis
par: Allakhverdov, Eduard, et autres
Publié: (2025)
par: Allakhverdov, Eduard, et autres
Publié: (2025)
EatGAN: An Edge-Attention Guided Generative Adversarial Network for Single Image Super-Resolution
par: Rao, Penghao, et autres
Publié: (2025)
par: Rao, Penghao, et autres
Publié: (2025)
Isolated Sign Language Recognition with Segmentation and Pose Estimation
par: Perkins, Daniel, et autres
Publié: (2025)
par: Perkins, Daniel, et autres
Publié: (2025)
Simulation-based Scenario Generation for Robust Hybrid AI for Autonomy
par: Keno, Hambisa, et autres
Publié: (2024)
par: Keno, Hambisa, et autres
Publié: (2024)
DOD-SA: Infrared-Visible Decoupled Object Detection with Single-Modality Annotations
par: Jin, Hang, et autres
Publié: (2025)
par: Jin, Hang, et autres
Publié: (2025)
Multimodal Structure-Aware Quantum Data Processing
par: Hawashin, Hala, et autres
Publié: (2024)
par: Hawashin, Hala, et autres
Publié: (2024)
AUTHENTICATION: Identifying Rare Failure Modes in Autonomous Vehicle Perception Systems using Adversarially Guided Diffusion Models
par: Zarei, Mohammad, et autres
Publié: (2025)
par: Zarei, Mohammad, et autres
Publié: (2025)
SQUARE: Semantic Query-Augmented Fusion and Efficient Batch Reranking for Training-free Zero-Shot Composed Image Retrieval
par: Wu, Ren-Di, et autres
Publié: (2025)
par: Wu, Ren-Di, et autres
Publié: (2025)
FeudalNav: A Simple Framework for Visual Navigation
par: Johnson, Faith, et autres
Publié: (2026)
par: Johnson, Faith, et autres
Publié: (2026)
Memory-augmented Online Video Anomaly Detection
par: Rossi, Leonardo, et autres
Publié: (2023)
par: Rossi, Leonardo, et autres
Publié: (2023)
Measuring What Matters: Scenario-Driven Evaluation for Trajectory Predictors in Autonomous Driving
par: Da, Longchao, et autres
Publié: (2025)
par: Da, Longchao, et autres
Publié: (2025)
Search Multilayer Perceptron-Based Fusion for Efficient and Accurate Siamese Tracking
par: Shen, Tianqi, et autres
Publié: (2026)
par: Shen, Tianqi, et autres
Publié: (2026)
ABot-Claw: A Foundation for Persistent, Cooperative, and Self-Evolving Robotic Agents
par: Huo, Dongjie, et autres
Publié: (2026)
par: Huo, Dongjie, et autres
Publié: (2026)
ReasonPlan: Unified Scene Prediction and Decision Reasoning for Closed-loop Autonomous Driving
par: Liu, Xueyi, et autres
Publié: (2025)
par: Liu, Xueyi, et autres
Publié: (2025)
Hybrid SIFT-SNN for Efficient Anomaly Detection of Traffic Flow-Control Infrastructure
par: Rathee, Munish, et autres
Publié: (2025)
par: Rathee, Munish, et autres
Publié: (2025)
Learning Discriminative Spatio-temporal Representations for Semi-supervised Action Recognition
par: Wang, Yu, et autres
Publié: (2024)
par: Wang, Yu, et autres
Publié: (2024)
RefineFormer3D: Efficient 3D Medical Image Segmentation via Adaptive Multi-Scale Transformer with Cross Attention Fusion
par: Tyagi, Kavyansh, et autres
Publié: (2026)
par: Tyagi, Kavyansh, et autres
Publié: (2026)
YOLO Ensemble for UAV-based Multispectral Defect Detection in Wind Turbine Components
par: Svystun, Serhii, et autres
Publié: (2025)
par: Svystun, Serhii, et autres
Publié: (2025)
CulinaryCut-VLAP: A Vision-Language-Action-Physics Framework for Food Cutting via a Force-Aware Material Point Method
par: Koh, Hyunseo, et autres
Publié: (2026)
par: Koh, Hyunseo, et autres
Publié: (2026)
Quality Over Quantity? LLM-Based Curation for a Data-Efficient Audio-Video Foundation Model
par: Vosoughi, Ali, et autres
Publié: (2025)
par: Vosoughi, Ali, et autres
Publié: (2025)
DSER: Spectral Epipolar Representation for Efficient Light Field Depth Estimation
par: Mohammad, Noor Islam S., et autres
Publié: (2025)
par: Mohammad, Noor Islam S., et autres
Publié: (2025)
Analysis of multivariate symbol statistics in primitive rational models
par: Goldwurm, Massimiliano, et autres
Publié: (2026)
par: Goldwurm, Massimiliano, et autres
Publié: (2026)
Socratic Planner: Self-QA-Based Zero-Shot Planning for Embodied Instruction Following
par: Shin, Suyeon, et autres
Publié: (2024)
par: Shin, Suyeon, et autres
Publié: (2024)
Documents similaires
-
Benchmarking Vision Language Models on German Factual Data
par: Peinl, René, et autres
Publié: (2025) -
Attire-Based Anomaly Detection in Restricted Areas Using YOLOv8 for Enhanced CCTV Security
par: B, Abdul Aziz A., et autres
Publié: (2024) -
Predicting Pedestrian Crossing Behavior in Germany and Japan: Insights into Model Transferability
par: Zhang, Chi, et autres
Publié: (2024) -
Predicting and Analyzing Pedestrian Crossing Behavior at Unsignalized Crossings
par: Zhang, Chi, et autres
Publié: (2024) -
Hierarchical Spatial Algorithms for High-Resolution Image Quantization and Feature Extraction
par: Mohammad, Noor Islam S.
Publié: (2025)