Zero-shot Prompt-based Video Encoder for Surgical Gesture Recognition
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Rao, Mingxing, Qin, Yinhong, Kolouri, Soheil, Wu, Jie Ying, Moyer, Daniel |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Generalization and Memorization in Rectified Flow
par: Rao, Mingxing, et autres
Publié: (2026)
par: Rao, Mingxing, et autres
Publié: (2026)
Score-based Membership Inference on Diffusion Models
par: Rao, Mingxing, et autres
Publié: (2025)
par: Rao, Mingxing, et autres
Publié: (2025)
Training Noise Token Pruning
par: Rao, Mingxing, et autres
Publié: (2024)
par: Rao, Mingxing, et autres
Publié: (2024)
Latent Diffusion Inversion Requires Understanding the Latent Space
par: Rao, Mingxing, et autres
Publié: (2025)
par: Rao, Mingxing, et autres
Publié: (2025)
Multi-Modal Gesture Recognition from Video and Surgical Tool Pose Information via Motion Invariants
par: Atoum, Jumanh, et autres
Publié: (2025)
par: Atoum, Jumanh, et autres
Publié: (2025)
One Category One Prompt: Dataset Distillation using Diffusion Models
par: Abbasi, Ali, et autres
Publié: (2024)
par: Abbasi, Ali, et autres
Publié: (2024)
HecVL: Hierarchical Video-Language Pretraining for Zero-shot Surgical Phase Recognition
par: Yuan, Kun, et autres
Publié: (2024)
par: Yuan, Kun, et autres
Publié: (2024)
Zero-Shot Underwater Gesture Recognition
par: Sarma, Sandipan, et autres
Publié: (2024)
par: Sarma, Sandipan, et autres
Publié: (2024)
BackdoorIDS: Zero-shot Backdoor Detection for Pretrained Vision Encoder
par: Huang, Siquan, et autres
Publié: (2026)
par: Huang, Siquan, et autres
Publié: (2026)
Vector-Quantized Soft Label Compression for Dataset Distillation
par: Abbasi, Ali, et autres
Publié: (2026)
par: Abbasi, Ali, et autres
Publié: (2026)
Prompt-to-Gesture: Measuring the Capabilities of Image-to-Video Deictic Gesture Generation
par: Ali, Hassan, et autres
Publié: (2026)
par: Ali, Hassan, et autres
Publié: (2026)
Fine-gained Zero-shot Video Sampling
par: Chen, Dengsheng, et autres
Publié: (2024)
par: Chen, Dengsheng, et autres
Publié: (2024)
SCALE: Semantic- and Confidence-Aware Conditional Variational Autoencoder for Zero-shot Skeleton-based Action Recognition
par: Oraki, Soroush, et autres
Publié: (2026)
par: Oraki, Soroush, et autres
Publié: (2026)
VideoMaker: Zero-shot Customized Video Generation with the Inherent Force of Video Diffusion Models
par: Wu, Tao, et autres
Publié: (2024)
par: Wu, Tao, et autres
Publié: (2024)
SG-Nav: Online 3D Scene Graph Prompting for LLM-based Zero-shot Object Navigation
par: Yin, Hang, et autres
Publié: (2024)
par: Yin, Hang, et autres
Publié: (2024)
Think Step by Step: Chain-of-Gesture Prompting for Error Detection in Robotic Surgical Videos
par: Shao, Zhimin, et autres
Publié: (2024)
par: Shao, Zhimin, et autres
Publié: (2024)
Min Generalized Sliced Gromov Wasserstein: A Scalable Path to Gromov Wasserstein
par: Shahbazi, Ashkan, et autres
Publié: (2026)
par: Shahbazi, Ashkan, et autres
Publié: (2026)
Meta-Prompting for Automating Zero-shot Visual Recognition with LLMs
par: Mirza, M. Jehanzeb, et autres
Publié: (2024)
par: Mirza, M. Jehanzeb, et autres
Publié: (2024)
Zero-shot HOI Detection with MLLM-based Detector-agnostic Interaction Recognition
par: Xuan, Shiyu, et autres
Publié: (2026)
par: Xuan, Shiyu, et autres
Publié: (2026)
ZeroPose: CAD-Prompted Zero-shot Object 6D Pose Estimation in Cluttered Scenes
par: Chen, Jianqiu, et autres
Publié: (2023)
par: Chen, Jianqiu, et autres
Publié: (2023)
Prompt-based Visual Alignment for Zero-shot Policy Transfer
par: Gao, Haihan, et autres
Publié: (2024)
par: Gao, Haihan, et autres
Publié: (2024)
DiffTED: One-shot Audio-driven TED Talk Video Generation with Diffusion-based Co-speech Gestures
par: Hogue, Steven, et autres
Publié: (2024)
par: Hogue, Steven, et autres
Publié: (2024)
ActionHub: A Large-scale Action Video Description Dataset for Zero-shot Action Recognition
par: Zhou, Jiaming, et autres
Publié: (2024)
par: Zhou, Jiaming, et autres
Publié: (2024)
MM-Gesture: Towards Precise Micro-Gesture Recognition through Multimodal Fusion
par: Gu, Jihao, et autres
Publié: (2025)
par: Gu, Jihao, et autres
Publié: (2025)
Boosting Gesture Recognition with an Automatic Gesture Annotation Framework
par: Shen, Junxiao, et autres
Publié: (2024)
par: Shen, Junxiao, et autres
Publié: (2024)
Efficient Transferable Optimal Transport via Min-Sliced Transport Plans
par: Liu, Xinran, et autres
Publié: (2025)
par: Liu, Xinran, et autres
Publié: (2025)
NOLA: Compressing LoRA using Linear Combination of Random Basis
par: Koohpayegani, Soroush Abbasi, et autres
Publié: (2023)
par: Koohpayegani, Soroush Abbasi, et autres
Publié: (2023)
Zero-shot Compositional Action Recognition with Neural Logic Constraints
par: Ye, Gefan, et autres
Publié: (2025)
par: Ye, Gefan, et autres
Publié: (2025)
EndoPBR: Material and Lighting Estimation for Photorealistic Surgical Simulations via Physically-based Rendering
par: Han, John J., et autres
Publié: (2025)
par: Han, John J., et autres
Publié: (2025)
Hierarchical Compositional Representations for Few-shot Action Recognition
par: Li, Changzhen, et autres
Publié: (2022)
par: Li, Changzhen, et autres
Publié: (2022)
Forearm Ultrasound based Gesture Recognition on Edge
par: Bimbraw, Keshav, et autres
Publié: (2024)
par: Bimbraw, Keshav, et autres
Publié: (2024)
Equivariant vs. Invariant Layers: A Comparison of Backbone and Pooling for Point Cloud Classification
par: Kothapalli, Abihith, et autres
Publié: (2023)
par: Kothapalli, Abihith, et autres
Publié: (2023)
Exploring Conditional Multi-Modal Prompts for Zero-shot HOI Detection
par: Lei, Ting, et autres
Publié: (2024)
par: Lei, Ting, et autres
Publié: (2024)
Fine-grained Abnormality Prompt Learning for Zero-shot Anomaly Detection
par: Zhu, Jiawen, et autres
Publié: (2024)
par: Zhu, Jiawen, et autres
Publié: (2024)
GenCLIP: Generalizing CLIP Prompts for Zero-shot Anomaly Detection
par: Kim, Donghyeong, et autres
Publié: (2025)
par: Kim, Donghyeong, et autres
Publié: (2025)
PDV: Prompt Directional Vectors for Zero-shot Composed Image Retrieval
par: Tursun, Osman, et autres
Publié: (2025)
par: Tursun, Osman, et autres
Publié: (2025)
How Far Are Surgeons from Surgical World Models? A Pilot Study on Zero-shot Surgical Video Generation with Expert Assessment
par: Chen, Zhen, et autres
Publié: (2025)
par: Chen, Zhen, et autres
Publié: (2025)
An Evaluation of Large Pre-Trained Models for Gesture Recognition using Synthetic Videos
par: Reddy, Arun, et autres
Publié: (2024)
par: Reddy, Arun, et autres
Publié: (2024)
SHANDS: A Multi-View Dataset and Benchmark for Surgical Hand-Gesture and Error Recognition Toward Medical Training
par: Ma, Le, et autres
Publié: (2026)
par: Ma, Le, et autres
Publié: (2026)
ZeroShape: Regression-based Zero-shot Shape Reconstruction
par: Huang, Zixuan, et autres
Publié: (2023)
par: Huang, Zixuan, et autres
Publié: (2023)
Documents similaires
-
Generalization and Memorization in Rectified Flow
par: Rao, Mingxing, et autres
Publié: (2026) -
Score-based Membership Inference on Diffusion Models
par: Rao, Mingxing, et autres
Publié: (2025) -
Training Noise Token Pruning
par: Rao, Mingxing, et autres
Publié: (2024) -
Latent Diffusion Inversion Requires Understanding the Latent Space
par: Rao, Mingxing, et autres
Publié: (2025) -
Multi-Modal Gesture Recognition from Video and Surgical Tool Pose Information via Motion Invariants
par: Atoum, Jumanh, et autres
Publié: (2025)