Vision-Language Modeling with Regularized Spatial Transformer Networks for All Weather Crosswind Landing of Aircraft
Fuente:
arXiv
Guardado en:
| Autores principales: | Pal, Debabrata, Singh, Anvita, Saumya, Saumya, Das, Shouvik |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
MResT: Multi-Resolution Sensing for Real-Time Control with Vision-Language Models
por: Saxena, Saumya, et al.
Publicado: (2024)
por: Saxena, Saumya, et al.
Publicado: (2024)
Reproducible Evaluation of Data Augmentation and Loss Functions for Brain Tumor Segmentation
por: B, Saumya
Publicado: (2025)
por: B, Saumya
Publicado: (2025)
An Empirical Study on Variance-based MC Dropout Uncertainty-Error Correlation in 2D Brain Tumor Segmentation
por: B, Saumya
Publicado: (2025)
por: B, Saumya
Publicado: (2025)
TopoDiffusionNet: A Topology-aware Diffusion Model
por: Gupta, Saumya, et al.
Publicado: (2024)
por: Gupta, Saumya, et al.
Publicado: (2024)
Is This Tracker On? A Benchmark Protocol for Dynamic Tracking
por: Demler, Ilona, et al.
Publicado: (2025)
por: Demler, Ilona, et al.
Publicado: (2025)
Backdooring Vision-Language Models with Out-Of-Distribution Data
por: Lyu, Weimin, et al.
Publicado: (2024)
por: Lyu, Weimin, et al.
Publicado: (2024)
Image Synthesis Using Spintronic Deep Convolutional Generative Adversarial Network
por: Gupta, Saumya, et al.
Publicado: (2026)
por: Gupta, Saumya, et al.
Publicado: (2026)
Unrolled Networks are Conditional Probability Flows in MRI Reconstruction
por: Qi, Kehan, et al.
Publicado: (2025)
por: Qi, Kehan, et al.
Publicado: (2025)
HyperCap: Hyperspectral Land Cover Captioning Dataset for Vision Language Models
por: Das, Aryan, et al.
Publicado: (2025)
por: Das, Aryan, et al.
Publicado: (2025)
BrainMRDiff: A Diffusion Model for Anatomically Consistent Brain MRI Synthesis
por: Bhattacharya, Moinak, et al.
Publicado: (2025)
por: Bhattacharya, Moinak, et al.
Publicado: (2025)
LoC-Path: Learning to Compress for Pathology Multimodal Large Language Models
por: Hu, Qingqiao, et al.
Publicado: (2025)
por: Hu, Qingqiao, et al.
Publicado: (2025)
Learning from Noisy Pseudo-labels for All-Weather Land Cover Mapping
por: Liu, Wang, et al.
Publicado: (2025)
por: Liu, Wang, et al.
Publicado: (2025)
End-to-End Navigation with Vision Language Models: Transforming Spatial Reasoning into Question-Answering
por: Goetting, Dylan, et al.
Publicado: (2024)
por: Goetting, Dylan, et al.
Publicado: (2024)
Vision Transformers and Convolutional Neural Networks for Land Use Scene Classification
por: Kulkarni, Arun D.
Publicado: (2026)
por: Kulkarni, Arun D.
Publicado: (2026)
HAViT: Historical Attention Vision Transformer
por: Banik, Swarnendu, et al.
Publicado: (2026)
por: Banik, Swarnendu, et al.
Publicado: (2026)
SFANet: Spatial-Frequency Attention Network for Weather Forecasting
por: Wang, Jiaze, et al.
Publicado: (2024)
por: Wang, Jiaze, et al.
Publicado: (2024)
The Spatial Blindspot of Vision-Language Models
por: Alam, Nahid, et al.
Publicado: (2026)
por: Alam, Nahid, et al.
Publicado: (2026)
SpatialBot: Precise Spatial Understanding with Vision Language Models
por: Cai, Wenxiao, et al.
Publicado: (2024)
por: Cai, Wenxiao, et al.
Publicado: (2024)
SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models
por: Cheng, An-Chieh, et al.
Publicado: (2024)
por: Cheng, An-Chieh, et al.
Publicado: (2024)
Semi-supervised Segmentation of Histopathology Images with Noise-Aware Topological Consistency
por: Xu, Meilong, et al.
Publicado: (2023)
por: Xu, Meilong, et al.
Publicado: (2023)
TinyBayes: Closed-Form Bayesian Inference via Jacobi Prior for Real-Time Image Classification on Edge Devices
por: Sardar, Shouvik, et al.
Publicado: (2026)
por: Sardar, Shouvik, et al.
Publicado: (2026)
Learning Spatial Decay for Vision Transformers
por: Mao, Yuxin, et al.
Publicado: (2025)
por: Mao, Yuxin, et al.
Publicado: (2025)
Gaze-Regularized Vision-Language-Action Models for Robotic Manipulation
por: Pani, Anupam, et al.
Publicado: (2026)
por: Pani, Anupam, et al.
Publicado: (2026)
LC4-DViT: Land-cover Creation for Land-cover Classification with Deformable Vision Transformer
por: Wang, Kai, et al.
Publicado: (2025)
por: Wang, Kai, et al.
Publicado: (2025)
TANet: Triplet Attention Network for All-In-One Adverse Weather Image Restoration
por: Wang, Hsing-Hua, et al.
Publicado: (2024)
por: Wang, Hsing-Hua, et al.
Publicado: (2024)
Denoising Vision Transformer Autoencoder with Spectral Self-Regularization
por: Xiang, Xunzhi, et al.
Publicado: (2025)
por: Xiang, Xunzhi, et al.
Publicado: (2025)
Annotation Free Spacecraft Detection and Segmentation using Vision Language Models
por: Hicsonmez, Samet, et al.
Publicado: (2026)
por: Hicsonmez, Samet, et al.
Publicado: (2026)
Spatial-aware Vision Language Model for Autonomous Driving
por: Wei, Weijie, et al.
Publicado: (2025)
por: Wei, Weijie, et al.
Publicado: (2025)
Efficient Whole Slide Pathology VQA via Token Compression
por: Lyu, Weimin, et al.
Publicado: (2025)
por: Lyu, Weimin, et al.
Publicado: (2025)
InternSpatial: A Comprehensive Dataset for Spatial Reasoning in Vision-Language Models
por: Deng, Nianchen, et al.
Publicado: (2025)
por: Deng, Nianchen, et al.
Publicado: (2025)
Vision-Language Gradient Descent-driven All-in-One Deep Unfolding Networks
por: Zeng, Haijin, et al.
Publicado: (2025)
por: Zeng, Haijin, et al.
Publicado: (2025)
Advancing Vision Transformer with Enhanced Spatial Priors
por: Fan, Qihang, et al.
Publicado: (2026)
por: Fan, Qihang, et al.
Publicado: (2026)
Boundary-Aware Vision Transformer for Angiography Vascular Network Segmentation
por: Hezil, Nabil, et al.
Publicado: (2025)
por: Hezil, Nabil, et al.
Publicado: (2025)
MolVision: Molecular Property Prediction with Vision Language Models
por: Adak, Deepan, et al.
Publicado: (2025)
por: Adak, Deepan, et al.
Publicado: (2025)
Spatial-DISE: A Unified Benchmark for Evaluating Spatial Reasoning in Vision-Language Models
por: Huang, Xinmiao, et al.
Publicado: (2025)
por: Huang, Xinmiao, et al.
Publicado: (2025)
HiSpatial: Taming Hierarchical 3D Spatial Understanding in Vision-Language Models
por: Liang, Huizhi, et al.
Publicado: (2026)
por: Liang, Huizhi, et al.
Publicado: (2026)
R-VLM: Region-Aware Vision Language Model for Precise GUI Grounding
por: Park, Joonhyung, et al.
Publicado: (2025)
por: Park, Joonhyung, et al.
Publicado: (2025)
MoAI: Mixture of All Intelligence for Large Language and Vision Models
por: Lee, Byung-Kwan, et al.
Publicado: (2024)
por: Lee, Byung-Kwan, et al.
Publicado: (2024)
MSAD-Net: Multiscale and Spatial Attention-based Dense Network for Lung Cancer Classification
por: Roy, Santanu, et al.
Publicado: (2025)
por: Roy, Santanu, et al.
Publicado: (2025)
WeatherRemover: All-in-one Adverse Weather Removal with Multi-scale Feature Map Compression
por: Qu, Weikai, et al.
Publicado: (2026)
por: Qu, Weikai, et al.
Publicado: (2026)
Ejemplares similares
-
MResT: Multi-Resolution Sensing for Real-Time Control with Vision-Language Models
por: Saxena, Saumya, et al.
Publicado: (2024) -
Reproducible Evaluation of Data Augmentation and Loss Functions for Brain Tumor Segmentation
por: B, Saumya
Publicado: (2025) -
An Empirical Study on Variance-based MC Dropout Uncertainty-Error Correlation in 2D Brain Tumor Segmentation
por: B, Saumya
Publicado: (2025) -
TopoDiffusionNet: A Topology-aware Diffusion Model
por: Gupta, Saumya, et al.
Publicado: (2024) -
Is This Tracker On? A Benchmark Protocol for Dynamic Tracking
por: Demler, Ilona, et al.
Publicado: (2025)