Distinguishing Visually Similar Actions: Prompt-Guided Semantic Prototype Modulation for Few-Shot Action Recognition
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Xiaoyang, Lu, Mingming, Wang, Ruiqi, Li, Hao, Le, Zewei |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Context-Aware Network Based on Multi-scale Spatio-temporal Attention for Action Recognition in Videos
par: Li, Xiaoyang, et autres
Publié: (2025)
par: Li, Xiaoyang, et autres
Publié: (2025)
Motion-Guided Semantic Alignment with Negative Prompts for Zero-Shot Video Action Recognition
par: Wang, Yiming, et autres
Publié: (2026)
par: Wang, Yiming, et autres
Publié: (2026)
Few-Shot Learning of a Graph-Based Neural Network Model Without Backpropagation
par: Lapin, Mykyta, et autres
Publié: (2025)
par: Lapin, Mykyta, et autres
Publié: (2025)
AntiGrounding: Lifting Robotic Actions into VLM Representation Space for Decision Making
par: Li, Wenbo, et autres
Publié: (2025)
par: Li, Wenbo, et autres
Publié: (2025)
MSPCaps: A Multi-Scale Patchify Capsule Network with Cross-Agreement Routing for Visual Recognition
par: Hu, Yudong, et autres
Publié: (2025)
par: Hu, Yudong, et autres
Publié: (2025)
IMUVIE: Pickup Timeline Action Localization via Motion Movies
par: Clapham, John, et autres
Publié: (2024)
par: Clapham, John, et autres
Publié: (2024)
FlyMeThrough: Human-AI Collaborative 3D Indoor Mapping with Commodity Drones
par: Su, Xia, et autres
Publié: (2025)
par: Su, Xia, et autres
Publié: (2025)
EvoCUA: Evolving Computer Use Agents via Learning from Scalable Synthetic Experience
par: Xue, Taofeng, et autres
Publié: (2026)
par: Xue, Taofeng, et autres
Publié: (2026)
Pan-Arctic Permafrost Landform and Human-built Infrastructure Feature Detection with Vision Transformers and Location Embeddings
par: Perera, Amal S., et autres
Publié: (2025)
par: Perera, Amal S., et autres
Publié: (2025)
OrganicHAR: Towards Activity Discovery in Organic Settings for Privacy Preserving Sensors Using Efficient Video Analysis
par: Patidar, Prasoon, et autres
Publié: (2026)
par: Patidar, Prasoon, et autres
Publié: (2026)
T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models
par: Chen, Yiteng, et autres
Publié: (2025)
par: Chen, Yiteng, et autres
Publié: (2025)
FerretNet: Efficient Synthetic Image Detection via Local Pixel Dependencies
par: Liang, Shuqiao, et autres
Publié: (2025)
par: Liang, Shuqiao, et autres
Publié: (2025)
WatchHAR: Real-time On-device Human Activity Recognition System for Smartwatches
par: Yeon, Taeyoung, et autres
Publié: (2025)
par: Yeon, Taeyoung, et autres
Publié: (2025)
Semantic Reality: Interactive Context-Aware Visualization of Inter-Object Relationships in Augmented Reality
par: Liu, Xiaoan, et autres
Publié: (2026)
par: Liu, Xiaoan, et autres
Publié: (2026)
Precision at Scale: Domain-Specific Datasets On-Demand
par: Rodríguez-de-Vera, Jesús M, et autres
Publié: (2024)
par: Rodríguez-de-Vera, Jesús M, et autres
Publié: (2024)
ViBED-Net: Video Based Engagement Detection Network Using Face-Aware and Scene-Aware Spatiotemporal Cues
par: Gothwal, Prateek, et autres
Publié: (2025)
par: Gothwal, Prateek, et autres
Publié: (2025)
ExpressNet-MoE: A Hybrid Deep Neural Network for Emotion Recognition
par: Banerjee, Deeptimaan, et autres
Publié: (2025)
par: Banerjee, Deeptimaan, et autres
Publié: (2025)
Exploring Diagnostic Prompting Approach for Multimodal LLM-based Visual Complexity Assessment: A Case Study of Amazon Search Result Pages
par: Murtadak, Divendar, et autres
Publié: (2025)
par: Murtadak, Divendar, et autres
Publié: (2025)
Introspection in Learned Semantic Scene Graph Localisation
par: Bissessur, Manshika Charvi, et autres
Publié: (2025)
par: Bissessur, Manshika Charvi, et autres
Publié: (2025)
treeX: Unsupervised Tree Instance Segmentation in Dense Forest Point Clouds
par: Burmeister, Josafat-Mattias, et autres
Publié: (2025)
par: Burmeister, Josafat-Mattias, et autres
Publié: (2025)
Emotions in the Loop: A Survey of Affective Computing for Emotional Support
par: Hegde, Karishma, et autres
Publié: (2025)
par: Hegde, Karishma, et autres
Publié: (2025)
Immersive Robot Programming Interface for Human-Guided Automation and Randomized Path Planning
par: Malek, Kaveh, et autres
Publié: (2024)
par: Malek, Kaveh, et autres
Publié: (2024)
MDA: An Interpretable and Scalable Multi-Modal Fusion under Missing Modalities and Intrinsic Noise Conditions
par: Fan, Lin, et autres
Publié: (2024)
par: Fan, Lin, et autres
Publié: (2024)
MoXaRt: Audio-Visual Object-Guided Sound Interaction for XR
par: Xu, Tianyu, et autres
Publié: (2026)
par: Xu, Tianyu, et autres
Publié: (2026)
CCVA-FL: Cross-Client Variations Adaptive Federated Learning for Medical Imaging
par: Gupta, Sunny, et autres
Publié: (2024)
par: Gupta, Sunny, et autres
Publié: (2024)
Taming the Tail: Leveraging Asymmetric Loss and Pade Approximation to Overcome Medical Image Long-Tailed Class Imbalance
par: Kashyap, Pankhi, et autres
Publié: (2024)
par: Kashyap, Pankhi, et autres
Publié: (2024)
MM-Conv: A Multimodal Dataset and Benchmark for Context-Aware Grounding in 3D Dialogue
par: Deichler, Anna, et autres
Publié: (2026)
par: Deichler, Anna, et autres
Publié: (2026)
Multi-Scale Spatial-Temporal Self-Attention Graph Convolutional Networks for Skeleton-based Action Recognition
par: Nakamura, Ikuo
Publié: (2024)
par: Nakamura, Ikuo
Publié: (2024)
AiGet: Transforming Everyday Moments into Hidden Knowledge Discovery with AI Assistance on Smart Glasses
par: Cai, Runze, et autres
Publié: (2025)
par: Cai, Runze, et autres
Publié: (2025)
Yanyun-3: Enabling Cross-Platform Strategy Game Operation with Vision-Language Models
par: Wang, Guoyan, et autres
Publié: (2025)
par: Wang, Guoyan, et autres
Publié: (2025)
Floorplan2Guide: LLM-Guided Floorplan Parsing for BLV Indoor Navigation
par: Ayanzadeh, Aydin, et autres
Publié: (2025)
par: Ayanzadeh, Aydin, et autres
Publié: (2025)
How Can One Choose the Best CAM-Based Explainability Method for a CNN Model?
par: Costa, Daniel da Silva, et autres
Publié: (2026)
par: Costa, Daniel da Silva, et autres
Publié: (2026)
Look and Tell: A Dataset for Multimodal Grounding Across Egocentric and Exocentric Views
par: Deichler, Anna, et autres
Publié: (2025)
par: Deichler, Anna, et autres
Publié: (2025)
Spiking Neural Networks for event-based action recognition: A new task to understand their advantage
par: Vicente-Sola, Alex, et autres
Publié: (2022)
par: Vicente-Sola, Alex, et autres
Publié: (2022)
Inducing Causal World Models in LLMs for Zero-Shot Physical Reasoning
par: Sharma, Aditya, et autres
Publié: (2025)
par: Sharma, Aditya, et autres
Publié: (2025)
TAG-Head: Time-Aligned Graph Head for Plug-and-Play Fine-grained Action Recognition
par: Hassan, Imtiaz Ul, et autres
Publié: (2026)
par: Hassan, Imtiaz Ul, et autres
Publié: (2026)
QoSGMAA: A Robust Multi-Order Graph Attention and Adversarial Framework for Sparse QoS Prediction
par: Du, Guanchen, et autres
Publié: (2025)
par: Du, Guanchen, et autres
Publié: (2025)
Interpretable Machine Learning-Derived Spectral Indices for Vegetation Monitoring
par: Lotfi, Ali, et autres
Publié: (2025)
par: Lotfi, Ali, et autres
Publié: (2025)
SpATr: MoCap 3D Human Action Recognition based on Spiral Auto-encoder and Transformer Network
par: Bouzid, Hamza, et autres
Publié: (2023)
par: Bouzid, Hamza, et autres
Publié: (2023)
Phase-Aware Wavelet-Based-Scattering Encoder-Decoder for Dense Predictions
par: Marrakchi, Ghassen, et autres
Publié: (2026)
par: Marrakchi, Ghassen, et autres
Publié: (2026)
Documents similaires
-
Context-Aware Network Based on Multi-scale Spatio-temporal Attention for Action Recognition in Videos
par: Li, Xiaoyang, et autres
Publié: (2025) -
Motion-Guided Semantic Alignment with Negative Prompts for Zero-Shot Video Action Recognition
par: Wang, Yiming, et autres
Publié: (2026) -
Few-Shot Learning of a Graph-Based Neural Network Model Without Backpropagation
par: Lapin, Mykyta, et autres
Publié: (2025) -
AntiGrounding: Lifting Robotic Actions into VLM Representation Space for Decision Making
par: Li, Wenbo, et autres
Publié: (2025) -
MSPCaps: A Multi-Scale Patchify Capsule Network with Cross-Agreement Routing for Visual Recognition
par: Hu, Yudong, et autres
Publié: (2025)