Sum-of-Checks: Structured Reasoning for Surgical Safety with Large Vision-Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | You, Weiqiu, Goldberg, Cassandra, Madani, Amin, Hashimoto, Daniel A., Wong, Eric |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
PracticalDG: Perturbation Distillation on Vision-Language Models for Hybrid Domain Generalization
von: Chen, Zining, et al.
Veröffentlicht: (2024)
von: Chen, Zining, et al.
Veröffentlicht: (2024)
A Vision Check-up for Language Models
von: Sharma, Pratyusha, et al.
Veröffentlicht: (2024)
von: Sharma, Pratyusha, et al.
Veröffentlicht: (2024)
GeoReasoner: Geo-localization with Reasoning in Street Views using a Large Vision-Language Model
von: Li, Ling, et al.
Veröffentlicht: (2024)
von: Li, Ling, et al.
Veröffentlicht: (2024)
MirrorCheck: Efficient Adversarial Defense for Vision-Language Models
von: Fares, Samar, et al.
Veröffentlicht: (2024)
von: Fares, Samar, et al.
Veröffentlicht: (2024)
Hierarchical Safety Realignment: Lightweight Restoration of Safety in Pruned Large Vision-Language Models
von: Li, Yue, et al.
Veröffentlicht: (2025)
von: Li, Yue, et al.
Veröffentlicht: (2025)
Toward Autonomous Laboratory Safety Monitoring with Vision Language Models: Learning to See Hazards Through Scene Structure
von: Chakraborty, Trishna, et al.
Veröffentlicht: (2026)
von: Chakraborty, Trishna, et al.
Veröffentlicht: (2026)
The Dual Mechanisms of Spatial Reasoning in Vision-Language Models
von: Cui, Kelly, et al.
Veröffentlicht: (2026)
von: Cui, Kelly, et al.
Veröffentlicht: (2026)
STAR: Stage-Wise Attention-Guided Token Reduction for Efficient Large Vision-Language Models Inference
von: Guo, Yichen, et al.
Veröffentlicht: (2025)
von: Guo, Yichen, et al.
Veröffentlicht: (2025)
DenseTRF: Texture-Aware Unsupervised Representation Adaptation for Surgical Scene Dense Prediction
von: Liao, Guiqiu, et al.
Veröffentlicht: (2026)
von: Liao, Guiqiu, et al.
Veröffentlicht: (2026)
ImageNet-Think-250K: A Large-Scale Synthetic Dataset for Multimodal Reasoning for Vision Language Models
von: Chitty-Venkata, Krishna Teja, et al.
Veröffentlicht: (2025)
von: Chitty-Venkata, Krishna Teja, et al.
Veröffentlicht: (2025)
EasyARC: Evaluating Vision Language Models on True Visual Reasoning
von: Unsal, Mert, et al.
Veröffentlicht: (2025)
von: Unsal, Mert, et al.
Veröffentlicht: (2025)
Improved Alignment of Modalities in Large Vision Language Models
von: Jangra, Kartik, et al.
Veröffentlicht: (2025)
von: Jangra, Kartik, et al.
Veröffentlicht: (2025)
Detecting and Preventing Hallucinations in Large Vision Language Models
von: Gunjal, Anisha, et al.
Veröffentlicht: (2023)
von: Gunjal, Anisha, et al.
Veröffentlicht: (2023)
Progressive Multi-granular Alignments for Grounded Reasoning in Large Vision-Language Models
von: Le, Quang-Hung, et al.
Veröffentlicht: (2024)
von: Le, Quang-Hung, et al.
Veröffentlicht: (2024)
Vision-Language Models Encode Clinical Guidelines for Concept-Based Medical Reasoning
von: Harmanani, Mohamed, et al.
Veröffentlicht: (2026)
von: Harmanani, Mohamed, et al.
Veröffentlicht: (2026)
Enhancing Multimodal Large Language Models for Safety-Critical Driving Video Analysis
von: Trinci, Tomaso, et al.
Veröffentlicht: (2026)
von: Trinci, Tomaso, et al.
Veröffentlicht: (2026)
FORLA: Federated Object-centric Representation Learning with Slot Attention
von: Liao, Guiqiu, et al.
Veröffentlicht: (2025)
von: Liao, Guiqiu, et al.
Veröffentlicht: (2025)
VisReason: A Large-Scale Dataset for Visual Chain-of-Thought Reasoning
von: Li, Lingxiao, et al.
Veröffentlicht: (2025)
von: Li, Lingxiao, et al.
Veröffentlicht: (2025)
HoneyBee: Data Recipes for Vision-Language Reasoners
von: Bansal, Hritik, et al.
Veröffentlicht: (2025)
von: Bansal, Hritik, et al.
Veröffentlicht: (2025)
Mitigating Hallucinations via Inter-Layer Consistency Aggregation in Large Vision-Language Models
von: Tang, Kai, et al.
Veröffentlicht: (2025)
von: Tang, Kai, et al.
Veröffentlicht: (2025)
SpatiaLQA: A Benchmark for Evaluating Spatial Logical Reasoning in Vision-Language Models
von: Xie, Yuechen, et al.
Veröffentlicht: (2026)
von: Xie, Yuechen, et al.
Veröffentlicht: (2026)
Towards Understanding How Knowledge Evolves in Large Vision-Language Models
von: Wang, Sudong, et al.
Veröffentlicht: (2025)
von: Wang, Sudong, et al.
Veröffentlicht: (2025)
Investigating and Enhancing Vision-Audio Capability in Omnimodal Large Language Models
von: Hu, Rui, et al.
Veröffentlicht: (2025)
von: Hu, Rui, et al.
Veröffentlicht: (2025)
Beyond Perception Errors: Semantic Fixation in Large Vision-Language Models
von: Alam, Md Tanvirul
Veröffentlicht: (2026)
von: Alam, Md Tanvirul
Veröffentlicht: (2026)
Surgical Vision World Model
von: Koju, Saurabh, et al.
Veröffentlicht: (2025)
von: Koju, Saurabh, et al.
Veröffentlicht: (2025)
FRISM: Fine-Grained Reasoning Injection via Subspace-Level Model Merging for Vision-Language Models
von: Huang, Chenyu, et al.
Veröffentlicht: (2026)
von: Huang, Chenyu, et al.
Veröffentlicht: (2026)
LLM-Seg: Bridging Image Segmentation and Large Language Model Reasoning
von: Wang, Junchi, et al.
Veröffentlicht: (2024)
von: Wang, Junchi, et al.
Veröffentlicht: (2024)
Tactile Modality Fusion for Vision-Language-Action Models
von: Morissette, Charlotte, et al.
Veröffentlicht: (2026)
von: Morissette, Charlotte, et al.
Veröffentlicht: (2026)
Re-ranking Reasoning Context with Tree Search Makes Large Vision-Language Models Stronger
von: Yang, Qi, et al.
Veröffentlicht: (2025)
von: Yang, Qi, et al.
Veröffentlicht: (2025)
CFM: Language-aligned Concept Foundation Model for Vision
von: Wittenmayer, Kai, et al.
Veröffentlicht: (2026)
von: Wittenmayer, Kai, et al.
Veröffentlicht: (2026)
Visual Perturbation and Adaptive Hard Negative Contrastive Learning for Compositional Reasoning in Vision-Language Models
von: Huang, Xin, et al.
Veröffentlicht: (2025)
von: Huang, Xin, et al.
Veröffentlicht: (2025)
Qwen Look Again: Guiding Vision-Language Reasoning Models to Re-attention Visual Information
von: Chu, Xu, et al.
Veröffentlicht: (2025)
von: Chu, Xu, et al.
Veröffentlicht: (2025)
OSSCAR: One-Shot Structured Pruning in Vision and Language Models with Combinatorial Optimization
von: Meng, Xiang, et al.
Veröffentlicht: (2024)
von: Meng, Xiang, et al.
Veröffentlicht: (2024)
Simple Vision-Language Math Reasoning via Rendered Text
von: Skripkin, Matvey, et al.
Veröffentlicht: (2025)
von: Skripkin, Matvey, et al.
Veröffentlicht: (2025)
DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models
von: Tao, Keda, et al.
Veröffentlicht: (2024)
von: Tao, Keda, et al.
Veröffentlicht: (2024)
U2-BENCH: Benchmarking Large Vision-Language Models on Ultrasound Understanding
von: Le, Anjie, et al.
Veröffentlicht: (2025)
von: Le, Anjie, et al.
Veröffentlicht: (2025)
Concept-skill Transferability-based Data Selection for Large Vision-Language Models
von: Lee, Jaewoo, et al.
Veröffentlicht: (2024)
von: Lee, Jaewoo, et al.
Veröffentlicht: (2024)
Sherlock: Self-Correcting Reasoning in Vision-Language Models
von: Ding, Yi, et al.
Veröffentlicht: (2025)
von: Ding, Yi, et al.
Veröffentlicht: (2025)
ETA: Evaluating Then Aligning Safety of Vision Language Models at Inference Time
von: Ding, Yi, et al.
Veröffentlicht: (2024)
von: Ding, Yi, et al.
Veröffentlicht: (2024)
Scaling Vision Language Models for Pharmaceutical Long Form Video Reasoning on Industrial GenAI Platform
von: Mishra, Suyash, et al.
Veröffentlicht: (2026)
von: Mishra, Suyash, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
PracticalDG: Perturbation Distillation on Vision-Language Models for Hybrid Domain Generalization
von: Chen, Zining, et al.
Veröffentlicht: (2024) -
A Vision Check-up for Language Models
von: Sharma, Pratyusha, et al.
Veröffentlicht: (2024) -
GeoReasoner: Geo-localization with Reasoning in Street Views using a Large Vision-Language Model
von: Li, Ling, et al.
Veröffentlicht: (2024) -
MirrorCheck: Efficient Adversarial Defense for Vision-Language Models
von: Fares, Samar, et al.
Veröffentlicht: (2024) -
Hierarchical Safety Realignment: Lightweight Restoration of Safety in Pruned Large Vision-Language Models
von: Li, Yue, et al.
Veröffentlicht: (2025)