Salvato in:
| Autori principali: | de Avalle, Guillermo Gil, Maruster, Laura, Emmanouilidis, Christos |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2601.22754 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
FlowExtract: Procedural Knowledge Extraction from Maintenance Flowcharts
di: de Avalle, Guillermo Gil, et al.
Pubblicazione: (2026)
di: de Avalle, Guillermo Gil, et al.
Pubblicazione: (2026)
SONIC-O1: A Real-World Benchmark for Evaluating Multimodal Large Language Models on Audio-Video Understanding
di: Radwan, Ahmed Y., et al.
Pubblicazione: (2026)
di: Radwan, Ahmed Y., et al.
Pubblicazione: (2026)
Generative AI for Industrial Contour Detection: A Language-Guided Vision System
di: Gong, Liang, et al.
Pubblicazione: (2025)
di: Gong, Liang, et al.
Pubblicazione: (2025)
Target Prompting for Information Extraction with Vision Language Model
di: Medhi, Dipankar
Pubblicazione: (2024)
di: Medhi, Dipankar
Pubblicazione: (2024)
Guiding Video Prediction with Explicit Procedural Knowledge
di: Takenaka, Patrick, et al.
Pubblicazione: (2024)
di: Takenaka, Patrick, et al.
Pubblicazione: (2024)
Research on Vision-Language Question Answering Models for Industrial Robots
di: Li, Ping, et al.
Pubblicazione: (2026)
di: Li, Ping, et al.
Pubblicazione: (2026)
Language-Guided Invariance Probing of Vision-Language Models
di: Lee, Jae Joong
Pubblicazione: (2025)
di: Lee, Jae Joong
Pubblicazione: (2025)
FloodVision: Urban Flood Depth Estimation Using Foundation Vision-Language Models and Domain Knowledge Graph
di: Liu, Zhangding, et al.
Pubblicazione: (2025)
di: Liu, Zhangding, et al.
Pubblicazione: (2025)
Image2Struct: Benchmarking Structure Extraction for Vision-Language Models
di: Roberts, Josselin Somerville, et al.
Pubblicazione: (2024)
di: Roberts, Josselin Somerville, et al.
Pubblicazione: (2024)
Effective Damage Data Generation by Fusing Imagery with Human Knowledge Using Vision-Language Models
di: Wei, Jie, et al.
Pubblicazione: (2025)
di: Wei, Jie, et al.
Pubblicazione: (2025)
Ego: Embedding-Guided Personalization of Vision-Language Models
di: Seifi, Soroush, et al.
Pubblicazione: (2026)
di: Seifi, Soroush, et al.
Pubblicazione: (2026)
Fine-Tuning Vision-Language Model for Automated Engineering Drawing Information Extraction
di: Khan, Muhammad Tayyab, et al.
Pubblicazione: (2024)
di: Khan, Muhammad Tayyab, et al.
Pubblicazione: (2024)
Efficient and Comprehensive Feature Extraction in Large Vision-Language Model for Pathology Analysis
di: Zhang, Shengxuming, et al.
Pubblicazione: (2024)
di: Zhang, Shengxuming, et al.
Pubblicazione: (2024)
Are Large Vision-Language Models Ready to Guide Blind and Low-Vision Individuals?
di: Kim, Eunki, et al.
Pubblicazione: (2025)
di: Kim, Eunki, et al.
Pubblicazione: (2025)
Symbolic Rule Extraction from Attention-Guided Sparse Representations in Vision Transformers
di: Padalkar, Parth, et al.
Pubblicazione: (2025)
di: Padalkar, Parth, et al.
Pubblicazione: (2025)
VLA-Pro: Cross-Task Procedural Memory Transfer for Vision-Language-Action Models
di: Si, Shengyu, et al.
Pubblicazione: (2026)
di: Si, Shengyu, et al.
Pubblicazione: (2026)
Delineating Knowledge Boundaries for Honest Large Vision-Language Models
di: Song, Junru, et al.
Pubblicazione: (2026)
di: Song, Junru, et al.
Pubblicazione: (2026)
Vision Language Model-based Caption Evaluation Method Leveraging Visual Context Extraction
di: Maeda, Koki, et al.
Pubblicazione: (2024)
di: Maeda, Koki, et al.
Pubblicazione: (2024)
Generative Digital Twins: Vision-Language Simulation Models for Executable Industrial Systems
di: Hsu, YuChe, et al.
Pubblicazione: (2025)
di: Hsu, YuChe, et al.
Pubblicazione: (2025)
DualEdit: Dual Editing for Knowledge Updating in Vision-Language Models
di: Shi, Zhiyi, et al.
Pubblicazione: (2025)
di: Shi, Zhiyi, et al.
Pubblicazione: (2025)
IMPACT: A Dataset for Multi-Granularity Human Procedural Action Understanding in Industrial Assembly
di: Wen, Di, et al.
Pubblicazione: (2026)
di: Wen, Di, et al.
Pubblicazione: (2026)
ATA: Bridging Implicit Reasoning with Attention-Guided and Action-Guided Inference for Vision-Language Action Models
di: Yang, Cheng, et al.
Pubblicazione: (2026)
di: Yang, Cheng, et al.
Pubblicazione: (2026)
When Seeing Overrides Knowing: Disentangling Knowledge Conflicts in Vision-Language Models
di: Ortu, Francesco, et al.
Pubblicazione: (2025)
di: Ortu, Francesco, et al.
Pubblicazione: (2025)
Locatability-Guided Adaptive Reasoning for Image Geo-Localization with Vision-Language Models
di: Yu, Bo, et al.
Pubblicazione: (2026)
di: Yu, Bo, et al.
Pubblicazione: (2026)
On the Utility of Foundation Models for Fast MRI: Vision-Language-Guided Image Reconstruction
di: Feng, Ruimin, et al.
Pubblicazione: (2025)
di: Feng, Ruimin, et al.
Pubblicazione: (2025)
Vision-R1: Evolving Human-Free Alignment in Large Vision-Language Models via Vision-Guided Reinforcement Learning
di: Zhan, Yufei, et al.
Pubblicazione: (2025)
di: Zhan, Yufei, et al.
Pubblicazione: (2025)
V-DPO: Mitigating Hallucination in Large Vision Language Models via Vision-Guided Direct Preference Optimization
di: Xie, Yuxi, et al.
Pubblicazione: (2024)
di: Xie, Yuxi, et al.
Pubblicazione: (2024)
Less is More: Label-Guided Summarization of Procedural and Instructional Videos
di: Rajpal, Shreya, et al.
Pubblicazione: (2026)
di: Rajpal, Shreya, et al.
Pubblicazione: (2026)
Sanitizing Manufacturing Dataset Labels Using Vision-Language Models
di: Mahjourian, Nazanin, et al.
Pubblicazione: (2025)
di: Mahjourian, Nazanin, et al.
Pubblicazione: (2025)
LLaVA-CKD: Bottom-Up Cascaded Knowledge Distillation for Vision-Language Models
di: Gkalelis, Nikolaos, et al.
Pubblicazione: (2026)
di: Gkalelis, Nikolaos, et al.
Pubblicazione: (2026)
Is There Knowledge Left to Extract? Evidence of Fragility in Medically Fine-Tuned Vision-Language Models
di: McLaughlin, Oliver, et al.
Pubblicazione: (2026)
di: McLaughlin, Oliver, et al.
Pubblicazione: (2026)
Latent Anomaly Knowledge Excavation: Unveiling Sparse Sensitive Neurons in Vision-Language Models
di: Li, Shaotian, et al.
Pubblicazione: (2026)
di: Li, Shaotian, et al.
Pubblicazione: (2026)
Align-KD: Distilling Cross-Modal Alignment Knowledge for Mobile Vision-Language Model
di: Feng, Qianhan, et al.
Pubblicazione: (2024)
di: Feng, Qianhan, et al.
Pubblicazione: (2024)
Revisiting KRISP: A Lightweight Reproduction and Analysis of Knowledge-Enhanced Vision-Language Models
di: Dutta, Souradeep, et al.
Pubblicazione: (2025)
di: Dutta, Souradeep, et al.
Pubblicazione: (2025)
TernaryCLIP: Efficiently Compressing Vision-Language Models with Ternary Weights and Distilled Knowledge
di: Zhang, Shu-Hao, et al.
Pubblicazione: (2025)
di: Zhang, Shu-Hao, et al.
Pubblicazione: (2025)
KRAST: Knowledge-Augmented Robotic Action Recognition with Structured Text for Vision-Language Models
di: Nguyen, Son Hai, et al.
Pubblicazione: (2025)
di: Nguyen, Son Hai, et al.
Pubblicazione: (2025)
SpaceMind: Camera-Guided Modality Fusion for Spatial Reasoning in Vision-Language Models
di: Zhao, Ruosen, et al.
Pubblicazione: (2025)
di: Zhao, Ruosen, et al.
Pubblicazione: (2025)
Attention-Guided Patch-Wise Sparse Adversarial Attacks on Vision-Language-Action Models
di: Zhang, Naifu, et al.
Pubblicazione: (2025)
di: Zhang, Naifu, et al.
Pubblicazione: (2025)
AGMark: Attention-Guided Dynamic Watermarking for Large Vision-Language Models
di: Li, Yue, et al.
Pubblicazione: (2026)
di: Li, Yue, et al.
Pubblicazione: (2026)
Procedure-Aware Surgical Video-language Pretraining with Hierarchical Knowledge Augmentation
di: Yuan, Kun, et al.
Pubblicazione: (2024)
di: Yuan, Kun, et al.
Pubblicazione: (2024)
Documenti analoghi
-
FlowExtract: Procedural Knowledge Extraction from Maintenance Flowcharts
di: de Avalle, Guillermo Gil, et al.
Pubblicazione: (2026) -
SONIC-O1: A Real-World Benchmark for Evaluating Multimodal Large Language Models on Audio-Video Understanding
di: Radwan, Ahmed Y., et al.
Pubblicazione: (2026) -
Generative AI for Industrial Contour Detection: A Language-Guided Vision System
di: Gong, Liang, et al.
Pubblicazione: (2025) -
Target Prompting for Information Extraction with Vision Language Model
di: Medhi, Dipankar
Pubblicazione: (2024) -
Guiding Video Prediction with Explicit Procedural Knowledge
di: Takenaka, Patrick, et al.
Pubblicazione: (2024)