MVIP -- A Dataset and Methods for Application Oriented Multi-View and Multi-Modal Industrial Part Recognition
Fuente:
arXiv
Salvato in:
| Autori principali: | Koch, Paul, Schlüter, Marian, Krüger, Jörg |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Vanishing Depth: A Depth Adapter with Positional Depth Encoding for Generalized Image Encoders
di: Koch, Paul, et al.
Pubblicazione: (2025)
di: Koch, Paul, et al.
Pubblicazione: (2025)
A Unified Model for Longitudinal Multi-Modal Multi-View Prediction with Missingness
di: Chen, Boqi, et al.
Pubblicazione: (2024)
di: Chen, Boqi, et al.
Pubblicazione: (2024)
MMXU: A Multi-Modal and Multi-X-ray Understanding Dataset for Disease Progression
di: Mu, Linjie, et al.
Pubblicazione: (2025)
di: Mu, Linjie, et al.
Pubblicazione: (2025)
Bosch Street Dataset: A Multi-Modal Dataset with Imaging Radar for Automated Driving
di: Armanious, Karim, et al.
Pubblicazione: (2024)
di: Armanious, Karim, et al.
Pubblicazione: (2024)
Multi-modal Representations for Fine-grained Multi-label Critical View of Safety Recognition
di: Baby, Britty, et al.
Pubblicazione: (2025)
di: Baby, Britty, et al.
Pubblicazione: (2025)
Multi-Modal Character Localization and Extraction for Chinese Text Recognition
di: Li, Qilong, et al.
Pubblicazione: (2026)
di: Li, Qilong, et al.
Pubblicazione: (2026)
NuPlanQA: A Large-Scale Dataset and Benchmark for Multi-View Driving Scene Understanding in Multi-Modal Large Language Models
di: Park, Sung-Yeon, et al.
Pubblicazione: (2025)
di: Park, Sung-Yeon, et al.
Pubblicazione: (2025)
Visual-Oriented Fine-Grained Knowledge Editing for MultiModal Large Language Models
di: Zeng, Zhen, et al.
Pubblicazione: (2024)
di: Zeng, Zhen, et al.
Pubblicazione: (2024)
Flat'n'Fold: A Diverse Multi-Modal Dataset for Garment Perception and Manipulation
di: Zhuang, Lipeng, et al.
Pubblicazione: (2024)
di: Zhuang, Lipeng, et al.
Pubblicazione: (2024)
IMPACT: A Dataset for Multi-Granularity Human Procedural Action Understanding in Industrial Assembly
di: Wen, Di, et al.
Pubblicazione: (2026)
di: Wen, Di, et al.
Pubblicazione: (2026)
3AM: An Ambiguity-Aware Multi-Modal Machine Translation Dataset
di: Ma, Xinyu, et al.
Pubblicazione: (2024)
di: Ma, Xinyu, et al.
Pubblicazione: (2024)
A Deep Multi-Modal Method for Patient Wound Healing Assessment
di: Oota, Subba Reddy, et al.
Pubblicazione: (2026)
di: Oota, Subba Reddy, et al.
Pubblicazione: (2026)
MOO: A Multi-view Oriented Observations Dataset for Viewpoint Analysis in Cattle Re-Identification
di: Grolleau, William, et al.
Pubblicazione: (2026)
di: Grolleau, William, et al.
Pubblicazione: (2026)
Cross-View Multi-Modal Segmentation @ Ego-Exo4D Challenges 2025
di: Fu, Yuqian, et al.
Pubblicazione: (2025)
di: Fu, Yuqian, et al.
Pubblicazione: (2025)
Multi-language Video Subtitle Dataset for Image-based Text Recognition
di: Singkhornart, Thanadol, et al.
Pubblicazione: (2024)
di: Singkhornart, Thanadol, et al.
Pubblicazione: (2024)
IndEgo: A Dataset of Industrial Scenarios and Collaborative Work for Egocentric Assistants
di: Chavan, Vivek, et al.
Pubblicazione: (2025)
di: Chavan, Vivek, et al.
Pubblicazione: (2025)
FOOTPASS: A Multi-Modal Multi-Agent Tactical Context Dataset for Play-by-Play Action Spotting in Soccer Broadcast Videos
di: Ochin, Jeremie, et al.
Pubblicazione: (2025)
di: Ochin, Jeremie, et al.
Pubblicazione: (2025)
MultiCorrupt: A Multi-Modal Robustness Dataset and Benchmark of LiDAR-Camera Fusion for 3D Object Detection
di: Beemelmanns, Till, et al.
Pubblicazione: (2024)
di: Beemelmanns, Till, et al.
Pubblicazione: (2024)
Improved Kidney Stone Recognition Through Attention and Multi-View Feature Fusion Strategies
di: Villalvazo-Avila, Elias, et al.
Pubblicazione: (2022)
di: Villalvazo-Avila, Elias, et al.
Pubblicazione: (2022)
MMeViT: Multi-Modal ensemble ViT for Post-Stroke Rehabilitation Action Recognition
di: Kim, Ye-eun, et al.
Pubblicazione: (2025)
di: Kim, Ye-eun, et al.
Pubblicazione: (2025)
MGHFT: Multi-Granularity Hierarchical Fusion Transformer for Cross-Modal Sticker Emotion Recognition
di: Chen, Jian, et al.
Pubblicazione: (2025)
di: Chen, Jian, et al.
Pubblicazione: (2025)
PRISM: A Multi-View Multi-Capability Retail Video Dataset for Embodied Vision-Language Models
di: Rouhi, Amirreza, et al.
Pubblicazione: (2026)
di: Rouhi, Amirreza, et al.
Pubblicazione: (2026)
Are a Thousand Words Better Than a Single Picture? Beyond Images -- A Framework for Multi-Modal Knowledge Graph Dataset Enrichment
di: Zhang, Pengyu, et al.
Pubblicazione: (2026)
di: Zhang, Pengyu, et al.
Pubblicazione: (2026)
CMOSE: Comprehensive Multi-Modality Online Student Engagement Dataset with High-Quality Labels
di: Wu, Chi-hsuan, et al.
Pubblicazione: (2023)
di: Wu, Chi-hsuan, et al.
Pubblicazione: (2023)
Learning Content-Aware Multi-Modal Joint Input Pruning via Bird's-Eye-View Representation
di: Li, Yuxin, et al.
Pubblicazione: (2024)
di: Li, Yuxin, et al.
Pubblicazione: (2024)
FRED: A Multi-Modal Autonomous Driving Dataset for Flooded Road Environments
di: Malone, Connor, et al.
Pubblicazione: (2026)
di: Malone, Connor, et al.
Pubblicazione: (2026)
FOCA: Frequency-Oriented Cross-Domain Forgery Detection, Localization and Explanation via Multi-Modal Large Language Model
di: Liu, Zhou, et al.
Pubblicazione: (2026)
di: Liu, Zhou, et al.
Pubblicazione: (2026)
MM-Point: Multi-View Information-Enhanced Multi-Modal Self-Supervised 3D Point Cloud Understanding
di: Yu, Hai-Tao, et al.
Pubblicazione: (2024)
di: Yu, Hai-Tao, et al.
Pubblicazione: (2024)
WaymoQA: A Multi-View Visual Question Answering Dataset for Safety-Critical Reasoning in Autonomous Driving
di: Yu, Seungjun, et al.
Pubblicazione: (2025)
di: Yu, Seungjun, et al.
Pubblicazione: (2025)
FireSentry: A Multi-Modal Spatio-temporal Benchmark Dataset for Fine-Grained Wildfire Spread Forecasting
di: Zhou, Nan, et al.
Pubblicazione: (2025)
di: Zhou, Nan, et al.
Pubblicazione: (2025)
A Comprehensive Review of Sign Language Recognition: Different Types, Modalities, and Datasets
di: Madhiarasan, M., et al.
Pubblicazione: (2022)
di: Madhiarasan, M., et al.
Pubblicazione: (2022)
Novel View Synthesis with Neural Radiance Fields for Industrial Robot Applications
di: Hillemann, Markus, et al.
Pubblicazione: (2024)
di: Hillemann, Markus, et al.
Pubblicazione: (2024)
SPACT18: Spiking Human Action Recognition Benchmark Dataset with Complementary RGB and Thermal Modalities
di: Ashraf, Yasser, et al.
Pubblicazione: (2025)
di: Ashraf, Yasser, et al.
Pubblicazione: (2025)
MoSAiC: Multi-Modal Multi-Label Supervision-Aware Contrastive Learning for Remote Sensing
di: Gupta, Debashis, et al.
Pubblicazione: (2025)
di: Gupta, Debashis, et al.
Pubblicazione: (2025)
MMPB: It's Time for Multi-Modal Personalization
di: Kim, Jaeik, et al.
Pubblicazione: (2025)
di: Kim, Jaeik, et al.
Pubblicazione: (2025)
MMScan: A Multi-Modal 3D Scene Dataset with Hierarchical Grounded Language Annotations
di: Lyu, Ruiyuan, et al.
Pubblicazione: (2024)
di: Lyu, Ruiyuan, et al.
Pubblicazione: (2024)
MMAUD: A Comprehensive Multi-Modal Anti-UAV Dataset for Modern Miniature Drone Threats
di: Yuan, Shenghai, et al.
Pubblicazione: (2024)
di: Yuan, Shenghai, et al.
Pubblicazione: (2024)
Deep Models for Multi-View 3D Object Recognition: A Review
di: Alzahrani, Mona, et al.
Pubblicazione: (2024)
di: Alzahrani, Mona, et al.
Pubblicazione: (2024)
MMVIAD: Multi-view Multi-task Video Understanding for Industrial Anomaly Detection
di: Zhao, Xiran, et al.
Pubblicazione: (2026)
di: Zhao, Xiran, et al.
Pubblicazione: (2026)
Hypergraph-based Multi-View Action Recognition using Event Cameras
di: Gao, Yue, et al.
Pubblicazione: (2024)
di: Gao, Yue, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Vanishing Depth: A Depth Adapter with Positional Depth Encoding for Generalized Image Encoders
di: Koch, Paul, et al.
Pubblicazione: (2025) -
A Unified Model for Longitudinal Multi-Modal Multi-View Prediction with Missingness
di: Chen, Boqi, et al.
Pubblicazione: (2024) -
MMXU: A Multi-Modal and Multi-X-ray Understanding Dataset for Disease Progression
di: Mu, Linjie, et al.
Pubblicazione: (2025) -
Bosch Street Dataset: A Multi-Modal Dataset with Imaging Radar for Automated Driving
di: Armanious, Karim, et al.
Pubblicazione: (2024) -
Multi-modal Representations for Fine-grained Multi-label Critical View of Safety Recognition
di: Baby, Britty, et al.
Pubblicazione: (2025)