SCALE-VLP: Soft-Weighted Contrastive Volumetric Vision-Language Pre-training with Spatial-Knowledge Semantics
Fuente:
arXiv
Guardado en:
| Autores principales: | Mahdizadeh, Ailar, Moghadam, Puria Azadi, He, Xiangteng, Mirabbasi, Shahriar, Nasiopoulos, Panos, Sigal, Leonid |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
CoRDS: Coreset-based Representative and Diverse Selection for Streaming Video Understanding
por: Mahdizadeh, Ailar, et al.
Publicado: (2026)
por: Mahdizadeh, Ailar, et al.
Publicado: (2026)
VLP: A Survey on Vision-Language Pre-training
por: Chen, Feilong, et al.
Publicado: (2022)
por: Chen, Feilong, et al.
Publicado: (2022)
InvAD: Inversion-based Reconstruction-Free Anomaly Detection with Diffusion Models
por: Sakai, Shunsuke, et al.
Publicado: (2025)
por: Sakai, Shunsuke, et al.
Publicado: (2025)
Effects of Ceramic Shade, Ceramic Thickness, and Surface Treatment on the Color Match of High‐Translucency Monolithic Multilayer Zirconia Restorations
por: Farhad Tabatabaian, et al.
Publicado: (2025)
por: Farhad Tabatabaian, et al.
Publicado: (2025)
Pair-VPR: Place-Aware Pre-training and Contrastive Pair Classification for Visual Place Recognition with Vision Transformers
por: Hausler, Stephen, et al.
Publicado: (2024)
por: Hausler, Stephen, et al.
Publicado: (2024)
To Sink or Not to Sink: Visual Information Pathways in Large Vision-Language Models
por: Luo, Jiayun, et al.
Publicado: (2025)
por: Luo, Jiayun, et al.
Publicado: (2025)
Shallow- and Deep-fake Image Manipulation Localization Using Vision Mamba and Guided Graph Neural Network
por: Zhang, Junbin, et al.
Publicado: (2026)
por: Zhang, Junbin, et al.
Publicado: (2026)
A Comprehensive VRR Dataset of Luminance Signals and Their Perceived Flicker Levels: Insights for Display and GPU Manufacturers
por: Hamid Reza Tohidypour, et al.
Publicado: (2025)
por: Hamid Reza Tohidypour, et al.
Publicado: (2025)
How Molecules Impact Cells: Unlocking Contrastive PhenoMolecular Retrieval
por: Fradkin, Philip, et al.
Publicado: (2024)
por: Fradkin, Philip, et al.
Publicado: (2024)
Multi-level Asymmetric Contrastive Learning for Volumetric Medical Image Segmentation Pre-training
por: Zeng, Shuang, et al.
Publicado: (2023)
por: Zeng, Shuang, et al.
Publicado: (2023)
On Pre-training of Multimodal Language Models Customized for Chart Understanding
por: Fan, Wan-Cyuan, et al.
Publicado: (2024)
por: Fan, Wan-Cyuan, et al.
Publicado: (2024)
Emergent Open-Vocabulary Semantic Segmentation from Off-the-shelf Vision-Language Models
por: Luo, Jiayun, et al.
Publicado: (2023)
por: Luo, Jiayun, et al.
Publicado: (2023)
VLP: Vision Language Planning for Autonomous Driving
por: Pan, Chenbin, et al.
Publicado: (2024)
por: Pan, Chenbin, et al.
Publicado: (2024)
DSeq-JEPA: Discriminative Sequential Joint-Embedding Predictive Architecture
por: He, Xiangteng, et al.
Publicado: (2025)
por: He, Xiangteng, et al.
Publicado: (2025)
37‐1: A Novel Wavelet‐Based Flicker Metric for Variable Refresh‐Rate Displays
por: Hamid Reza Tohidypour, et al.
Publicado: (2025)
por: Hamid Reza Tohidypour, et al.
Publicado: (2025)
ASAP: Advancing Medical Volumetric Representation Learning with Anatomy-aware Semantically-adaptive Pre-training
por: Wang, Rongsheng, et al.
Publicado: (2026)
por: Wang, Rongsheng, et al.
Publicado: (2026)
VLP: Vision-Language Preference Learning for Embodied Manipulation
por: Liu, Runze, et al.
Publicado: (2025)
por: Liu, Runze, et al.
Publicado: (2025)
VELVET-Med: Vision and Efficient Language Pre-training for Volumetric Imaging Tasks in Medicine
por: Zhang, Ziyang, et al.
Publicado: (2025)
por: Zhang, Ziyang, et al.
Publicado: (2025)
In-Depth and In-Breadth: Pre-training Multimodal Language Models Customized for Comprehensive Chart Understanding
por: Fan, Wan-Cyuan, et al.
Publicado: (2025)
por: Fan, Wan-Cyuan, et al.
Publicado: (2025)
SoftMCL: Soft Momentum Contrastive Learning for Fine-grained Sentiment-aware Pre-training
por: Wang, Jin, et al.
Publicado: (2024)
por: Wang, Jin, et al.
Publicado: (2024)
MMFactory: A Universal Solution Search Engine for Vision-Language Tasks
por: Fan, Wan-Cyuan, et al.
Publicado: (2024)
por: Fan, Wan-Cyuan, et al.
Publicado: (2024)
Pre-training with Random Orthogonal Projection Image Modeling
por: Haghighat, Maryam, et al.
Publicado: (2023)
por: Haghighat, Maryam, et al.
Publicado: (2023)
CodeGraphVLP: Code-as-Planner Meets Semantic-Graph State for Non-Markovian Vision-Language-Action Models
por: Vo, Khoa, et al.
Publicado: (2026)
por: Vo, Khoa, et al.
Publicado: (2026)
Response Wide Shut: Surprising Observations in Basic Vision Language Model Capabilities
por: Chandhok, Shivam, et al.
Publicado: (2024)
por: Chandhok, Shivam, et al.
Publicado: (2024)
Revisiting Continual Semantic Segmentation with Pre-trained Vision Models
por: Zhang, Duzhen, et al.
Publicado: (2025)
por: Zhang, Duzhen, et al.
Publicado: (2025)
Superpixel Semantics Representation and Pre-training for Vision-Language Task
por: Zhang, Siyu, et al.
Publicado: (2023)
por: Zhang, Siyu, et al.
Publicado: (2023)
Framework-agnostic Semantically-aware Global Reasoning for Segmentation
por: Hossain, Mir Rayat Imtiaz, et al.
Publicado: (2022)
por: Hossain, Mir Rayat Imtiaz, et al.
Publicado: (2022)
On the Use of Ranked Set Samples in Entropy Based Test of Fit for the Laplace Distribution
por: Mahdi Mahdizadeh
Publicado: (2012)
por: Mahdi Mahdizadeh
Publicado: (2012)
Multi-hop Relational Contrastive Learning: Extending Spatial Contrastive Pre-training Beyond Pairwise Relations
por: Ahmed, Sheikh Tanvir, et al.
Publicado: (2026)
por: Ahmed, Sheikh Tanvir, et al.
Publicado: (2026)
UrbanVLP: Multi-Granularity Vision-Language Pretraining for Urban Socioeconomic Indicator Prediction
por: Hao, Xixuan, et al.
Publicado: (2024)
por: Hao, Xixuan, et al.
Publicado: (2024)
Exploiting the Semantic Knowledge of Pre-trained Text-Encoders for Continual Learning
por: Yu, Lu, et al.
Publicado: (2024)
por: Yu, Lu, et al.
Publicado: (2024)
Spatial-Temporal Cross-View Contrastive Pre-training for Check-in Sequence Representation Learning
por: Gong, Letian, et al.
Publicado: (2024)
por: Gong, Letian, et al.
Publicado: (2024)
Ultrasound-CLIP: Semantic-Aware Contrastive Pre-training for Ultrasound Image-Text Understanding
por: Jin, Jiayun, et al.
Publicado: (2026)
por: Jin, Jiayun, et al.
Publicado: (2026)
Test-Time Consistency in Vision Language Models
por: Chou, Shih-Han, et al.
Publicado: (2025)
por: Chou, Shih-Han, et al.
Publicado: (2025)
Multivariate Frequency Analysis of Drought Characteristics in Finland Using Vine Copulas
por: Rasoul Mirabbasi, et al.
Publicado: (2024)
por: Rasoul Mirabbasi, et al.
Publicado: (2024)
MM-R$^3$: On (In-)Consistency of Vision-Language Models (VLMs)
por: Chou, Shih-Han, et al.
Publicado: (2024)
por: Chou, Shih-Han, et al.
Publicado: (2024)
Boosting Vision Semantic Density with Anatomy Normality Modeling for Medical Vision-language Pre-training
por: Cao, Weiwei, et al.
Publicado: (2025)
por: Cao, Weiwei, et al.
Publicado: (2025)
SigVLP: Sigmoid Volume-Language Pre-Training for Self-Supervised CT-Volume Adaptive Representation Learning
por: Wang, Jiayi, et al.
Publicado: (2026)
por: Wang, Jiayi, et al.
Publicado: (2026)
Classification of Breast Cancer Histopathology Images using a Modified Supervised Contrastive Learning Method
por: Sani, Matina Mahdizadeh, et al.
Publicado: (2024)
por: Sani, Matina Mahdizadeh, et al.
Publicado: (2024)
Benchmark Analysis of Various Pre-trained Deep Learning Models on ASSIRA Cats and Dogs Dataset
por: Himel, Galib Muhammad Shahriar, et al.
Publicado: (2024)
por: Himel, Galib Muhammad Shahriar, et al.
Publicado: (2024)
Ejemplares similares
-
CoRDS: Coreset-based Representative and Diverse Selection for Streaming Video Understanding
por: Mahdizadeh, Ailar, et al.
Publicado: (2026) -
VLP: A Survey on Vision-Language Pre-training
por: Chen, Feilong, et al.
Publicado: (2022) -
InvAD: Inversion-based Reconstruction-Free Anomaly Detection with Diffusion Models
por: Sakai, Shunsuke, et al.
Publicado: (2025) -
Effects of Ceramic Shade, Ceramic Thickness, and Surface Treatment on the Color Match of High‐Translucency Monolithic Multilayer Zirconia Restorations
por: Farhad Tabatabaian, et al.
Publicado: (2025) -
Pair-VPR: Place-Aware Pre-training and Contrastive Pair Classification for Visual Place Recognition with Vision Transformers
por: Hausler, Stephen, et al.
Publicado: (2024)