Revisiting KRISP: A Lightweight Reproduction and Analysis of Knowledge-Enhanced Vision-Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Dutta, Souradeep, Bulia, Keshav, Nair, Neena S |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
VLM4VLA: Revisiting Vision-Language-Models in Vision-Language-Action Models
von: Zhang, Jianke, et al.
Veröffentlicht: (2026)
von: Zhang, Jianke, et al.
Veröffentlicht: (2026)
Adapting Lightweight Vision Language Models for Radiological Visual Question Answering
von: Shourya, Aditya, et al.
Veröffentlicht: (2025)
von: Shourya, Aditya, et al.
Veröffentlicht: (2025)
Probing Visual Concepts in Lightweight Vision-Language Models for Automated Driving
von: Theodoridis, Nikos, et al.
Veröffentlicht: (2026)
von: Theodoridis, Nikos, et al.
Veröffentlicht: (2026)
DRScaffold: Boosting Dense-Scene Reasoning in Lightweight Vision Language Models
von: Shi, Xinrui, et al.
Veröffentlicht: (2026)
von: Shi, Xinrui, et al.
Veröffentlicht: (2026)
Revisiting the Role of Language Priors in Vision-Language Models
von: Lin, Zhiqiu, et al.
Veröffentlicht: (2023)
von: Lin, Zhiqiu, et al.
Veröffentlicht: (2023)
KEPT: Knowledge-Enhanced Prediction of Trajectories from Consecutive Driving Frames with Vision-Language Models
von: Wang, Yujin, et al.
Veröffentlicht: (2025)
von: Wang, Yujin, et al.
Veröffentlicht: (2025)
Distilling 3D Spatial Reasoning into a Lightweight Vision-Language Model with CoT
von: Asfour, Alaa, et al.
Veröffentlicht: (2026)
von: Asfour, Alaa, et al.
Veröffentlicht: (2026)
Multi-Frame, Lightweight & Efficient Vision-Language Models for Question Answering in Autonomous Driving
von: Gopalkrishnan, Akshay, et al.
Veröffentlicht: (2024)
von: Gopalkrishnan, Akshay, et al.
Veröffentlicht: (2024)
ZonUI-3B: A Lightweight Vision-Language Model for Cross-Resolution GUI Grounding
von: Hsieh, ZongHan, et al.
Veröffentlicht: (2025)
von: Hsieh, ZongHan, et al.
Veröffentlicht: (2025)
Fine-tuning Vision Language Models with Graph-based Knowledge for Explainable Medical Image Analysis
von: Li, Chenjun, et al.
Veröffentlicht: (2025)
von: Li, Chenjun, et al.
Veröffentlicht: (2025)
Multi-Phase Automated Segmentation of Dental Structures in CBCT Using a Lightweight Auto3DSeg and SegResNet Implementation
von: LaBella, Dominic, et al.
Veröffentlicht: (2025)
von: LaBella, Dominic, et al.
Veröffentlicht: (2025)
Delineating Knowledge Boundaries for Honest Large Vision-Language Models
von: Song, Junru, et al.
Veröffentlicht: (2026)
von: Song, Junru, et al.
Veröffentlicht: (2026)
How Lightweight Can A Vision Transformer Be
von: Tan, Jen Hong
Veröffentlicht: (2024)
von: Tan, Jen Hong
Veröffentlicht: (2024)
Lightweight Models for Emotional Analysis in Video
von: Nguyen, Quoc-Tien, et al.
Veröffentlicht: (2025)
von: Nguyen, Quoc-Tien, et al.
Veröffentlicht: (2025)
Grounded Knowledge-Enhanced Medical Vision-Language Pre-training for Chest X-Ray
von: Deng, Qiao, et al.
Veröffentlicht: (2024)
von: Deng, Qiao, et al.
Veröffentlicht: (2024)
Lightweight Unsupervised Federated Learning with Pretrained Vision Language Model
von: Yan, Hao, et al.
Veröffentlicht: (2024)
von: Yan, Hao, et al.
Veröffentlicht: (2024)
DualEdit: Dual Editing for Knowledge Updating in Vision-Language Models
von: Shi, Zhiyi, et al.
Veröffentlicht: (2025)
von: Shi, Zhiyi, et al.
Veröffentlicht: (2025)
Lightweight Multimodal Adaptation of Vision Language Models for Species Recognition and Habitat Context Interpretation in Drone Thermal Imagery
von: Chen, Hao, et al.
Veröffentlicht: (2026)
von: Chen, Hao, et al.
Veröffentlicht: (2026)
Multi-Aspect Knowledge-Enhanced Medical Vision-Language Pretraining with Multi-Agent Data Generation
von: Li, Xieji, et al.
Veröffentlicht: (2025)
von: Li, Xieji, et al.
Veröffentlicht: (2025)
Aligning Vision to Language: Annotation-Free Multimodal Knowledge Graph Construction for Enhanced LLMs Reasoning
von: Liu, Junming, et al.
Veröffentlicht: (2025)
von: Liu, Junming, et al.
Veröffentlicht: (2025)
Index-Preserving Lightweight Token Pruning for Efficient Document Understanding in Vision-Language Models
von: Son, Jaemin, et al.
Veröffentlicht: (2025)
von: Son, Jaemin, et al.
Veröffentlicht: (2025)
Knowledge-Augmented Vision Language Models for Underwater Bioacoustic Spectrogram Analysis
von: Nihal, Ragib Amin, et al.
Veröffentlicht: (2025)
von: Nihal, Ragib Amin, et al.
Veröffentlicht: (2025)
Intelligent Image Sensing for Crime Analysis: A ML Approach towards Enhanced Violence Detection and Investigation
von: Dutta, Aritra, et al.
Veröffentlicht: (2025)
von: Dutta, Aritra, et al.
Veröffentlicht: (2025)
When Seeing Overrides Knowing: Disentangling Knowledge Conflicts in Vision-Language Models
von: Ortu, Francesco, et al.
Veröffentlicht: (2025)
von: Ortu, Francesco, et al.
Veröffentlicht: (2025)
Qianfan-VL: Domain-Enhanced Universal Vision-Language Models
von: Dong, Daxiang, et al.
Veröffentlicht: (2025)
von: Dong, Daxiang, et al.
Veröffentlicht: (2025)
Enhancing the Safety of Medical Vision-Language Models by Synthetic Demonstrations
von: Xue, Zhiyu, et al.
Veröffentlicht: (2025)
von: Xue, Zhiyu, et al.
Veröffentlicht: (2025)
FloodVision: Urban Flood Depth Estimation Using Foundation Vision-Language Models and Domain Knowledge Graph
von: Liu, Zhangding, et al.
Veröffentlicht: (2025)
von: Liu, Zhangding, et al.
Veröffentlicht: (2025)
Evaluating Vision Language Models (VLMs) for Radiology: A Comprehensive Analysis
von: Li, Frank, et al.
Veröffentlicht: (2025)
von: Li, Frank, et al.
Veröffentlicht: (2025)
LIFT and PLACE: A Simple, Stable, and Effective Knowledge Distillation Framework for Lightweight Diffusion Models
von: Han, Hyunsoo, et al.
Veröffentlicht: (2026)
von: Han, Hyunsoo, et al.
Veröffentlicht: (2026)
VLKEB: A Large Vision-Language Model Knowledge Editing Benchmark
von: Huang, Han, et al.
Veröffentlicht: (2024)
von: Huang, Han, et al.
Veröffentlicht: (2024)
MagicVL-2B: Empowering Vision-Language Models on Mobile Devices with Lightweight Visual Encoders via Curriculum Learning
von: Liu, Yi, et al.
Veröffentlicht: (2025)
von: Liu, Yi, et al.
Veröffentlicht: (2025)
Florence-VL: Enhancing Vision-Language Models with Generative Vision Encoder and Depth-Breadth Fusion
von: Chen, Jiuhai, et al.
Veröffentlicht: (2024)
von: Chen, Jiuhai, et al.
Veröffentlicht: (2024)
GraphVL: Graph-Enhanced Semantic Modeling via Vision-Language Models for Generalized Class Discovery
von: Solanki, Bhupendra, et al.
Veröffentlicht: (2024)
von: Solanki, Bhupendra, et al.
Veröffentlicht: (2024)
TernaryCLIP: Efficiently Compressing Vision-Language Models with Ternary Weights and Distilled Knowledge
von: Zhang, Shu-Hao, et al.
Veröffentlicht: (2025)
von: Zhang, Shu-Hao, et al.
Veröffentlicht: (2025)
KRAST: Knowledge-Augmented Robotic Action Recognition with Structured Text for Vision-Language Models
von: Nguyen, Son Hai, et al.
Veröffentlicht: (2025)
von: Nguyen, Son Hai, et al.
Veröffentlicht: (2025)
LLaVA-CKD: Bottom-Up Cascaded Knowledge Distillation for Vision-Language Models
von: Gkalelis, Nikolaos, et al.
Veröffentlicht: (2026)
von: Gkalelis, Nikolaos, et al.
Veröffentlicht: (2026)
Align-KD: Distilling Cross-Modal Alignment Knowledge for Mobile Vision-Language Model
von: Feng, Qianhan, et al.
Veröffentlicht: (2024)
von: Feng, Qianhan, et al.
Veröffentlicht: (2024)
Procedural Knowledge Extraction from Industrial Troubleshooting Guides Using Vision Language Models
von: de Avalle, Guillermo Gil, et al.
Veröffentlicht: (2026)
von: de Avalle, Guillermo Gil, et al.
Veröffentlicht: (2026)
Is There Knowledge Left to Extract? Evidence of Fragility in Medically Fine-Tuned Vision-Language Models
von: McLaughlin, Oliver, et al.
Veröffentlicht: (2026)
von: McLaughlin, Oliver, et al.
Veröffentlicht: (2026)
Latent Anomaly Knowledge Excavation: Unveiling Sparse Sensitive Neurons in Vision-Language Models
von: Li, Shaotian, et al.
Veröffentlicht: (2026)
von: Li, Shaotian, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
VLM4VLA: Revisiting Vision-Language-Models in Vision-Language-Action Models
von: Zhang, Jianke, et al.
Veröffentlicht: (2026) -
Adapting Lightweight Vision Language Models for Radiological Visual Question Answering
von: Shourya, Aditya, et al.
Veröffentlicht: (2025) -
Probing Visual Concepts in Lightweight Vision-Language Models for Automated Driving
von: Theodoridis, Nikos, et al.
Veröffentlicht: (2026) -
DRScaffold: Boosting Dense-Scene Reasoning in Lightweight Vision Language Models
von: Shi, Xinrui, et al.
Veröffentlicht: (2026) -
Revisiting the Role of Language Priors in Vision-Language Models
von: Lin, Zhiqiu, et al.
Veröffentlicht: (2023)