Agentic Surgical AI: Surgeon Style Fingerprinting and Privacy Risk Quantification via Discrete Diffusion in a Vision-Language-Action Framework
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhan, Huixin, Moore, Jason H. |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
From Phase Grounding to Intelligent Surgical Narratives
por: Peterson, Ethan, et al.
Publicado: (2026)
por: Peterson, Ethan, et al.
Publicado: (2026)
Surgical-LLaVA: Toward Surgical Scenario Understanding via Large Language and Vision Models
por: Jin, Juseong, et al.
Publicado: (2024)
por: Jin, Juseong, et al.
Publicado: (2024)
D2Styler: Advancing Arbitrary Style Transfer with Discrete Diffusion Methods
por: Susladkar, Onkar, et al.
Publicado: (2024)
por: Susladkar, Onkar, et al.
Publicado: (2024)
Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
por: Liang, Zhixuan, et al.
Publicado: (2025)
por: Liang, Zhixuan, et al.
Publicado: (2025)
NoRD: A Data-Efficient Vision-Language-Action Model that Drives without Reasoning
por: Rawal, Ishaan, et al.
Publicado: (2026)
por: Rawal, Ishaan, et al.
Publicado: (2026)
Unified Diffusion VLA: Vision-Language-Action Model via Joint Discrete Denoising Diffusion Process
por: Chen, Jiayi, et al.
Publicado: (2025)
por: Chen, Jiayi, et al.
Publicado: (2025)
A Style is Worth One Code: Unlocking Code-to-Style Image Generation with Discrete Style Space
por: Liu, Huijie, et al.
Publicado: (2025)
por: Liu, Huijie, et al.
Publicado: (2025)
ArchiLense: A Framework for Quantitative Analysis of Architectural Styles Based on Vision Large Language Models
por: Zhong, Jing, et al.
Publicado: (2025)
por: Zhong, Jing, et al.
Publicado: (2025)
TINA: Think, Interaction, and Action Framework for Zero-Shot Vision Language Navigation
por: Li, Dingbang, et al.
Publicado: (2024)
por: Li, Dingbang, et al.
Publicado: (2024)
Smudged Fingerprints: A Systematic Evaluation of the Robustness of AI Image Fingerprints
por: Yao, Kai, et al.
Publicado: (2025)
por: Yao, Kai, et al.
Publicado: (2025)
Does AI See like Art Historians? Interpreting How Vision Language Models Recognize Artistic Style
por: Limpijankit, Marvin, et al.
Publicado: (2026)
por: Limpijankit, Marvin, et al.
Publicado: (2026)
Surgical Triplet Recognition via Diffusion Model
por: Liu, Daochang, et al.
Publicado: (2024)
por: Liu, Daochang, et al.
Publicado: (2024)
How Far Are Surgeons from Surgical World Models? A Pilot Study on Zero-shot Surgical Video Generation with Expert Assessment
por: Chen, Zhen, et al.
Publicado: (2025)
por: Chen, Zhen, et al.
Publicado: (2025)
IFViT: Interpretable Fixed-Length Representation for Fingerprint Matching via Vision Transformer
por: Qiu, Yuhang, et al.
Publicado: (2024)
por: Qiu, Yuhang, et al.
Publicado: (2024)
Chain-of-Adaptation: Surgical Vision-Language Adaptation with Reinforcement Learning
por: Li, Jiajie, et al.
Publicado: (2026)
por: Li, Jiajie, et al.
Publicado: (2026)
SUREON: A Benchmark and Vision-Language-Model for Surgical Reasoning
por: Perez, Alejandra, et al.
Publicado: (2026)
por: Perez, Alejandra, et al.
Publicado: (2026)
PyVision-RL: Forging Open Agentic Vision Models via RL
por: Zhao, Shitian, et al.
Publicado: (2026)
por: Zhao, Shitian, et al.
Publicado: (2026)
AVA: Towards Agentic Video Analytics with Vision Language Models
por: Yan, Yuxuan, et al.
Publicado: (2025)
por: Yan, Yuxuan, et al.
Publicado: (2025)
Think, Act, Build: An Agentic Framework with Vision Language Models for Zero-Shot 3D Visual Grounding
por: Wang, Haibo, et al.
Publicado: (2026)
por: Wang, Haibo, et al.
Publicado: (2026)
VLM4VLA: Revisiting Vision-Language-Models in Vision-Language-Action Models
por: Zhang, Jianke, et al.
Publicado: (2026)
por: Zhang, Jianke, et al.
Publicado: (2026)
ORCA: An Agentic Reasoning Framework for Hallucination and Adversarial Robustness in Vision-Language Models
por: Yu, Chung-En Johnny, et al.
Publicado: (2025)
por: Yu, Chung-En Johnny, et al.
Publicado: (2025)
Autonomous Computer Vision Development with Agentic AI
por: Kim, Jin, et al.
Publicado: (2025)
por: Kim, Jin, et al.
Publicado: (2025)
Systematic Evaluation of Large Vision-Language Models for Surgical Artificial Intelligence
por: Rau, Anita, et al.
Publicado: (2025)
por: Rau, Anita, et al.
Publicado: (2025)
GeoShield: Safeguarding Geolocation Privacy from Vision-Language Models via Adversarial Perturbations
por: Liu, Xinwei, et al.
Publicado: (2025)
por: Liu, Xinwei, et al.
Publicado: (2025)
Vision-R1: Evolving Human-Free Alignment in Large Vision-Language Models via Vision-Guided Reinforcement Learning
por: Zhan, Yufei, et al.
Publicado: (2025)
por: Zhan, Yufei, et al.
Publicado: (2025)
Assessing Privacy Preservation and Utility in Online Vision-Language Models
por: Chaudhari, Karmesh Siddharam, et al.
Publicado: (2026)
por: Chaudhari, Karmesh Siddharam, et al.
Publicado: (2026)
CF-VLA: Efficient Coarse-to-Fine Action Generation for Vision-Language-Action Policies
por: Du, Fan, et al.
Publicado: (2026)
por: Du, Fan, et al.
Publicado: (2026)
ScreenAI: A Vision-Language Model for UI and Infographics Understanding
por: Baechler, Gilles, et al.
Publicado: (2024)
por: Baechler, Gilles, et al.
Publicado: (2024)
T2T-VICL: Unlocking the Boundaries of Cross-Task Visual In-Context Learning via Implicit Text-Driven VLMs
por: Xia, Shao-Jun, et al.
Publicado: (2025)
por: Xia, Shao-Jun, et al.
Publicado: (2025)
SQAP-VLA: A Synergistic Quantization-Aware Pruning Framework for High-Performance Vision-Language-Action Models
por: Fang, Hengyu, et al.
Publicado: (2025)
por: Fang, Hengyu, et al.
Publicado: (2025)
SpecPrune-VLA: Accelerating Vision-Language-Action Models via Action-Aware Self-Speculative Pruning
por: Wang, Hanzhen, et al.
Publicado: (2025)
por: Wang, Hanzhen, et al.
Publicado: (2025)
Universal Fingerprint Generation: Controllable Diffusion Model with Multimodal Conditions
por: Grosz, Steven A., et al.
Publicado: (2024)
por: Grosz, Steven A., et al.
Publicado: (2024)
VGAS: Value-Guided Action-Chunk Selection for Few-Shot Vision-Language-Action Adaptation
por: Xu, Changhua, et al.
Publicado: (2026)
por: Xu, Changhua, et al.
Publicado: (2026)
Surgeons Are Indian Males and Speech Therapists Are White Females: Auditing Biases in Vision-Language Models for Healthcare Professionals
por: Siddiqui, Zohaib Hasan, et al.
Publicado: (2025)
por: Siddiqui, Zohaib Hasan, et al.
Publicado: (2025)
Learning Vision-Language-Action World Models for Autonomous Driving
por: Wang, Guoqing, et al.
Publicado: (2026)
por: Wang, Guoqing, et al.
Publicado: (2026)
Conformal Predictions for Human Action Recognition with Vision-Language Models
por: Tim, Bary, et al.
Publicado: (2025)
por: Tim, Bary, et al.
Publicado: (2025)
Information-Theoretic Constraints for Continual Vision-Language-Action Alignment
por: Zhao, Libang, et al.
Publicado: (2026)
por: Zhao, Libang, et al.
Publicado: (2026)
ForgeVLA: Federated Vision-Language-Action Learning without Language Annotations
por: Zhou, Yuhao, et al.
Publicado: (2026)
por: Zhou, Yuhao, et al.
Publicado: (2026)
Generalized Recognition of Basic Surgical Actions Enables Skill Assessment and Vision-Language-Model-based Surgical Planning
por: Xu, Mengya, et al.
Publicado: (2026)
por: Xu, Mengya, et al.
Publicado: (2026)
SurgVisAgent: Multimodal Agentic Model for Versatile Surgical Visual Enhancement
por: Lei, Zeyu, et al.
Publicado: (2025)
por: Lei, Zeyu, et al.
Publicado: (2025)
Ejemplares similares
-
From Phase Grounding to Intelligent Surgical Narratives
por: Peterson, Ethan, et al.
Publicado: (2026) -
Surgical-LLaVA: Toward Surgical Scenario Understanding via Large Language and Vision Models
por: Jin, Juseong, et al.
Publicado: (2024) -
D2Styler: Advancing Arbitrary Style Transfer with Discrete Diffusion Methods
por: Susladkar, Onkar, et al.
Publicado: (2024) -
Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
por: Liang, Zhixuan, et al.
Publicado: (2025) -
NoRD: A Data-Efficient Vision-Language-Action Model that Drives without Reasoning
por: Rawal, Ishaan, et al.
Publicado: (2026)