An analysis of vision-language models for fabric retrieval
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Giuliari, Francesco, Pattan, Asif Khan, Mekhalfi, Mohamed Lamine, Poiesi, Fabio |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Leveraging Confident Image Regions for Source-Free Domain-Adaptive Object Detection
par: Mekhalfi, Mohamed Lamine, et autres
Publié: (2025)
par: Mekhalfi, Mohamed Lamine, et autres
Publié: (2025)
The RaspGrade Dataset: Towards Automatic Raspberry Ripeness Grading with Deep Learning
par: Mekhalfi, Mohamed Lamine, et autres
Publié: (2025)
par: Mekhalfi, Mohamed Lamine, et autres
Publié: (2025)
Functionality understanding and segmentation in 3D scenes
par: Corsetti, Jaime, et autres
Publié: (2024)
par: Corsetti, Jaime, et autres
Publié: (2024)
Orange Quality Grading with Deep Learning
par: Mekhalfi, Mohamed Lamine, et autres
Publié: (2025)
par: Mekhalfi, Mohamed Lamine, et autres
Publié: (2025)
High-resolution open-vocabulary object 6D pose estimation
par: Corsetti, Jaime, et autres
Publié: (2024)
par: Corsetti, Jaime, et autres
Publié: (2024)
Free-form language-based robotic reasoning and grasping
par: Jiao, Runyu, et autres
Publié: (2025)
par: Jiao, Runyu, et autres
Publié: (2025)
FreeZe: Training-free zero-shot 6D pose estimation with geometric and vision foundation models
par: Caraffa, Andrea, et autres
Publié: (2023)
par: Caraffa, Andrea, et autres
Publié: (2023)
Action-guided generation of 3D functionality segmentation data
par: Corsetti, Jaime, et autres
Publié: (2025)
par: Corsetti, Jaime, et autres
Publié: (2025)
Obstruction reasoning for robotic grasping
par: Jiao, Runyu, et autres
Publié: (2025)
par: Jiao, Runyu, et autres
Publié: (2025)
Accurate and efficient zero-shot 6D pose estimation with frozen foundation models
par: Caraffa, Andrea, et autres
Publié: (2025)
par: Caraffa, Andrea, et autres
Publié: (2025)
Object Depth and Size Estimation using Stereo-vision and Integration with SLAM
par: Hamad, Layth, et autres
Publié: (2024)
par: Hamad, Layth, et autres
Publié: (2024)
Wild Berry image dataset collected in Finnish forests and peatlands using drones
par: Riz, Luigi, et autres
Publié: (2024)
par: Riz, Luigi, et autres
Publié: (2024)
Novel class discovery meets foundation models for 3D semantic segmentation
par: Riz, Luigi, et autres
Publié: (2023)
par: Riz, Luigi, et autres
Publié: (2023)
Cross-Modal and Uncertainty-Aware Agglomeration for Open-Vocabulary 3D Scene Understanding
par: Li, Jinlong, et autres
Publié: (2025)
par: Li, Jinlong, et autres
Publié: (2025)
Distilling 3D distinctive local descriptors for 6D pose estimation
par: Hamza, Amir, et autres
Publié: (2025)
par: Hamza, Amir, et autres
Publié: (2025)
Geometrically-driven Aggregation for Zero-shot 3D Point Cloud Understanding
par: Mei, Guofeng, et autres
Publié: (2023)
par: Mei, Guofeng, et autres
Publié: (2023)
DiffAssemble: A Unified Graph-Diffusion Model for 2D and 3D Reassembly
par: Scarpellini, Gianluca, et autres
Publié: (2024)
par: Scarpellini, Gianluca, et autres
Publié: (2024)
IFFNeRF: Initialisation Free and Fast 6DoF pose estimation from a single image and a NeRF model
par: Bortolon, Matteo, et autres
Publié: (2024)
par: Bortolon, Matteo, et autres
Publié: (2024)
OpenHype: Hyperbolic Embeddings for Hierarchical Open-Vocabulary Radiance Fields
par: Weijler, Lisa, et autres
Publié: (2025)
par: Weijler, Lisa, et autres
Publié: (2025)
Open-vocabulary object 6D pose estimation
par: Corsetti, Jaime, et autres
Publié: (2023)
par: Corsetti, Jaime, et autres
Publié: (2023)
Generative 6D Pose Estimation via Conditional Flow Matching
par: Hamza, Amir, et autres
Publié: (2026)
par: Hamza, Amir, et autres
Publié: (2026)
Vocabulary-Free 3D Instance Segmentation with Vision and Language Assistant
par: Mei, Guofeng, et autres
Publié: (2024)
par: Mei, Guofeng, et autres
Publié: (2024)
6DGS: 6D Pose Estimation from a Single Image and a 3D Gaussian Splatting Model
par: Bortolon, Matteo, et autres
Publié: (2024)
par: Bortolon, Matteo, et autres
Publié: (2024)
Uncertainty-aware sign language video retrieval with probability distribution modeling
par: Wu, Xuan, et autres
Publié: (2024)
par: Wu, Xuan, et autres
Publié: (2024)
Fully-Geometric Cross-Attention for Point Cloud Registration
par: Wang, Weijie, et autres
Publié: (2025)
par: Wang, Weijie, et autres
Publié: (2025)
AI-driven visual monitoring of industrial assembly tasks
par: Nardon, Mattia, et autres
Publié: (2025)
par: Nardon, Mattia, et autres
Publié: (2025)
3D Part Segmentation via Geometric Aggregation of 2D Visual Features
par: Garosi, Marco, et autres
Publié: (2024)
par: Garosi, Marco, et autres
Publié: (2024)
Visual symbolic mechanisms: Emergent symbol processing in vision language models
par: Assouel, Rim, et autres
Publié: (2025)
par: Assouel, Rim, et autres
Publié: (2025)
Do large language vision models understand 3D shapes?
par: Eppel, Sagi
Publié: (2024)
par: Eppel, Sagi
Publié: (2024)
Are vision-language models ready to zero-shot replace supervised classification models in agriculture?
par: Ranario, Earl, et autres
Publié: (2025)
par: Ranario, Earl, et autres
Publié: (2025)
Are vision language models robust to uncertain inputs?
par: Wang, Xi, et autres
Publié: (2025)
par: Wang, Xi, et autres
Publié: (2025)
bi-modal textual prompt learning for vision-language models in remote sensing
par: Kashyap, Pankhi, et autres
Publié: (2026)
par: Kashyap, Pankhi, et autres
Publié: (2026)
Multimodal Fusion SLAM with Fourier Attention
par: Zhou, Youjie, et autres
Publié: (2025)
par: Zhou, Youjie, et autres
Publié: (2025)
Enhancing medical vision-language contrastive learning via inter-matching relation modelling
par: Li, Mingjian, et autres
Publié: (2024)
par: Li, Mingjian, et autres
Publié: (2024)
A multi-modal vision-language model for generalizable annotation-free pathology localization
par: Yang, Hao, et autres
Publié: (2024)
par: Yang, Hao, et autres
Publié: (2024)
Enhancing the vision-language foundation model with key semantic knowledge-emphasized report refinement
par: Huang, Weijian, et autres
Publié: (2024)
par: Huang, Weijian, et autres
Publié: (2024)
Initialization matters in few-shot adaptation of vision-language models for histopathological image classification
par: Meseguer, Pablo, et autres
Publié: (2026)
par: Meseguer, Pablo, et autres
Publié: (2026)
Expert-level vision-language foundation model for real-world radiology and comprehensive evaluation
par: Liu, Xiaohong, et autres
Publié: (2024)
par: Liu, Xiaohong, et autres
Publié: (2024)
Masked Clustering Prediction for Unsupervised Point Cloud Pre-training
par: Ren, Bin, et autres
Publié: (2025)
par: Ren, Bin, et autres
Publié: (2025)
Quantifying the human visual exposome with vision language models
par: Rominger, Christian, et autres
Publié: (2026)
par: Rominger, Christian, et autres
Publié: (2026)
Documents similaires
-
Leveraging Confident Image Regions for Source-Free Domain-Adaptive Object Detection
par: Mekhalfi, Mohamed Lamine, et autres
Publié: (2025) -
The RaspGrade Dataset: Towards Automatic Raspberry Ripeness Grading with Deep Learning
par: Mekhalfi, Mohamed Lamine, et autres
Publié: (2025) -
Functionality understanding and segmentation in 3D scenes
par: Corsetti, Jaime, et autres
Publié: (2024) -
Orange Quality Grading with Deep Learning
par: Mekhalfi, Mohamed Lamine, et autres
Publié: (2025) -
High-resolution open-vocabulary object 6D pose estimation
par: Corsetti, Jaime, et autres
Publié: (2024)