Procedural Knowledge Extraction from Industrial Troubleshooting Guides Using Vision Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | de Avalle, Guillermo Gil, Maruster, Laura, Emmanouilidis, Christos |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
FlowExtract: Procedural Knowledge Extraction from Maintenance Flowcharts
par: de Avalle, Guillermo Gil, et autres
Publié: (2026)
par: de Avalle, Guillermo Gil, et autres
Publié: (2026)
SONIC-O1: A Real-World Benchmark for Evaluating Multimodal Large Language Models on Audio-Video Understanding
par: Radwan, Ahmed Y., et autres
Publié: (2026)
par: Radwan, Ahmed Y., et autres
Publié: (2026)
Generative AI for Industrial Contour Detection: A Language-Guided Vision System
par: Gong, Liang, et autres
Publié: (2025)
par: Gong, Liang, et autres
Publié: (2025)
Target Prompting for Information Extraction with Vision Language Model
par: Medhi, Dipankar
Publié: (2024)
par: Medhi, Dipankar
Publié: (2024)
Research on Vision-Language Question Answering Models for Industrial Robots
par: Li, Ping, et autres
Publié: (2026)
par: Li, Ping, et autres
Publié: (2026)
Language-Guided Invariance Probing of Vision-Language Models
par: Lee, Jae Joong
Publié: (2025)
par: Lee, Jae Joong
Publié: (2025)
Guiding Video Prediction with Explicit Procedural Knowledge
par: Takenaka, Patrick, et autres
Publié: (2024)
par: Takenaka, Patrick, et autres
Publié: (2024)
FloodVision: Urban Flood Depth Estimation Using Foundation Vision-Language Models and Domain Knowledge Graph
par: Liu, Zhangding, et autres
Publié: (2025)
par: Liu, Zhangding, et autres
Publié: (2025)
Image2Struct: Benchmarking Structure Extraction for Vision-Language Models
par: Roberts, Josselin Somerville, et autres
Publié: (2024)
par: Roberts, Josselin Somerville, et autres
Publié: (2024)
Effective Damage Data Generation by Fusing Imagery with Human Knowledge Using Vision-Language Models
par: Wei, Jie, et autres
Publié: (2025)
par: Wei, Jie, et autres
Publié: (2025)
Ego: Embedding-Guided Personalization of Vision-Language Models
par: Seifi, Soroush, et autres
Publié: (2026)
par: Seifi, Soroush, et autres
Publié: (2026)
Fine-Tuning Vision-Language Model for Automated Engineering Drawing Information Extraction
par: Khan, Muhammad Tayyab, et autres
Publié: (2024)
par: Khan, Muhammad Tayyab, et autres
Publié: (2024)
Efficient and Comprehensive Feature Extraction in Large Vision-Language Model for Pathology Analysis
par: Zhang, Shengxuming, et autres
Publié: (2024)
par: Zhang, Shengxuming, et autres
Publié: (2024)
Are Large Vision-Language Models Ready to Guide Blind and Low-Vision Individuals?
par: Kim, Eunki, et autres
Publié: (2025)
par: Kim, Eunki, et autres
Publié: (2025)
Symbolic Rule Extraction from Attention-Guided Sparse Representations in Vision Transformers
par: Padalkar, Parth, et autres
Publié: (2025)
par: Padalkar, Parth, et autres
Publié: (2025)
Delineating Knowledge Boundaries for Honest Large Vision-Language Models
par: Song, Junru, et autres
Publié: (2026)
par: Song, Junru, et autres
Publié: (2026)
Vision Language Model-based Caption Evaluation Method Leveraging Visual Context Extraction
par: Maeda, Koki, et autres
Publié: (2024)
par: Maeda, Koki, et autres
Publié: (2024)
VLA-Pro: Cross-Task Procedural Memory Transfer for Vision-Language-Action Models
par: Si, Shengyu, et autres
Publié: (2026)
par: Si, Shengyu, et autres
Publié: (2026)
DualEdit: Dual Editing for Knowledge Updating in Vision-Language Models
par: Shi, Zhiyi, et autres
Publié: (2025)
par: Shi, Zhiyi, et autres
Publié: (2025)
ATA: Bridging Implicit Reasoning with Attention-Guided and Action-Guided Inference for Vision-Language Action Models
par: Yang, Cheng, et autres
Publié: (2026)
par: Yang, Cheng, et autres
Publié: (2026)
Locatability-Guided Adaptive Reasoning for Image Geo-Localization with Vision-Language Models
par: Yu, Bo, et autres
Publié: (2026)
par: Yu, Bo, et autres
Publié: (2026)
Generative Digital Twins: Vision-Language Simulation Models for Executable Industrial Systems
par: Hsu, YuChe, et autres
Publié: (2025)
par: Hsu, YuChe, et autres
Publié: (2025)
On the Utility of Foundation Models for Fast MRI: Vision-Language-Guided Image Reconstruction
par: Feng, Ruimin, et autres
Publié: (2025)
par: Feng, Ruimin, et autres
Publié: (2025)
When Seeing Overrides Knowing: Disentangling Knowledge Conflicts in Vision-Language Models
par: Ortu, Francesco, et autres
Publié: (2025)
par: Ortu, Francesco, et autres
Publié: (2025)
Vision-R1: Evolving Human-Free Alignment in Large Vision-Language Models via Vision-Guided Reinforcement Learning
par: Zhan, Yufei, et autres
Publié: (2025)
par: Zhan, Yufei, et autres
Publié: (2025)
IMPACT: A Dataset for Multi-Granularity Human Procedural Action Understanding in Industrial Assembly
par: Wen, Di, et autres
Publié: (2026)
par: Wen, Di, et autres
Publié: (2026)
V-DPO: Mitigating Hallucination in Large Vision Language Models via Vision-Guided Direct Preference Optimization
par: Xie, Yuxi, et autres
Publié: (2024)
par: Xie, Yuxi, et autres
Publié: (2024)
Sanitizing Manufacturing Dataset Labels Using Vision-Language Models
par: Mahjourian, Nazanin, et autres
Publié: (2025)
par: Mahjourian, Nazanin, et autres
Publié: (2025)
LLaVA-CKD: Bottom-Up Cascaded Knowledge Distillation for Vision-Language Models
par: Gkalelis, Nikolaos, et autres
Publié: (2026)
par: Gkalelis, Nikolaos, et autres
Publié: (2026)
Is There Knowledge Left to Extract? Evidence of Fragility in Medically Fine-Tuned Vision-Language Models
par: McLaughlin, Oliver, et autres
Publié: (2026)
par: McLaughlin, Oliver, et autres
Publié: (2026)
Latent Anomaly Knowledge Excavation: Unveiling Sparse Sensitive Neurons in Vision-Language Models
par: Li, Shaotian, et autres
Publié: (2026)
par: Li, Shaotian, et autres
Publié: (2026)
SpaceMind: Camera-Guided Modality Fusion for Spatial Reasoning in Vision-Language Models
par: Zhao, Ruosen, et autres
Publié: (2025)
par: Zhao, Ruosen, et autres
Publié: (2025)
Attention-Guided Patch-Wise Sparse Adversarial Attacks on Vision-Language-Action Models
par: Zhang, Naifu, et autres
Publié: (2025)
par: Zhang, Naifu, et autres
Publié: (2025)
Align-KD: Distilling Cross-Modal Alignment Knowledge for Mobile Vision-Language Model
par: Feng, Qianhan, et autres
Publié: (2024)
par: Feng, Qianhan, et autres
Publié: (2024)
Revisiting KRISP: A Lightweight Reproduction and Analysis of Knowledge-Enhanced Vision-Language Models
par: Dutta, Souradeep, et autres
Publié: (2025)
par: Dutta, Souradeep, et autres
Publié: (2025)
TernaryCLIP: Efficiently Compressing Vision-Language Models with Ternary Weights and Distilled Knowledge
par: Zhang, Shu-Hao, et autres
Publié: (2025)
par: Zhang, Shu-Hao, et autres
Publié: (2025)
KRAST: Knowledge-Augmented Robotic Action Recognition with Structured Text for Vision-Language Models
par: Nguyen, Son Hai, et autres
Publié: (2025)
par: Nguyen, Son Hai, et autres
Publié: (2025)
Less is More: Label-Guided Summarization of Procedural and Instructional Videos
par: Rajpal, Shreya, et autres
Publié: (2026)
par: Rajpal, Shreya, et autres
Publié: (2026)
IDEATOR: Jailbreaking and Benchmarking Large Vision-Language Models Using Themselves
par: Wang, Ruofan, et autres
Publié: (2024)
par: Wang, Ruofan, et autres
Publié: (2024)
Text-Guided Attention is All You Need for Zero-Shot Robustness in Vision-Language Models
par: Yu, Lu, et autres
Publié: (2024)
par: Yu, Lu, et autres
Publié: (2024)
Documents similaires
-
FlowExtract: Procedural Knowledge Extraction from Maintenance Flowcharts
par: de Avalle, Guillermo Gil, et autres
Publié: (2026) -
SONIC-O1: A Real-World Benchmark for Evaluating Multimodal Large Language Models on Audio-Video Understanding
par: Radwan, Ahmed Y., et autres
Publié: (2026) -
Generative AI for Industrial Contour Detection: A Language-Guided Vision System
par: Gong, Liang, et autres
Publié: (2025) -
Target Prompting for Information Extraction with Vision Language Model
par: Medhi, Dipankar
Publié: (2024) -
Research on Vision-Language Question Answering Models for Industrial Robots
par: Li, Ping, et autres
Publié: (2026)