Storyboard guided Alignment for Fine-grained Video Action Recognition
Fuente:
arXiv
Saved in:
| Main Authors: | Liu, Enqi, Pan, Liyuan, Yang, Yan, Zhong, Yiran, Wu, Zhijing, Wu, Xinxiao, Liu, Liu |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Seeing Through Fog: Towards Fog-Invariant Action Recognition
by: Liu, Enqi, et al.
Published: (2026)
by: Liu, Enqi, et al.
Published: (2026)
Benchmarking and Improving GUI Agents in High-Dynamic Environments
by: Liu, Enqi, et al.
Published: (2026)
by: Liu, Enqi, et al.
Published: (2026)
EZSR: Event-based Zero-Shot Recognition
by: Yang, Yan, et al.
Published: (2024)
by: Yang, Yan, et al.
Published: (2024)
DreamShot: Personalized Storyboard Synthesis with Video Diffusion Prior
by: Huang, Junjia, et al.
Published: (2026)
by: Huang, Junjia, et al.
Published: (2026)
LLM-powered Query Expansion for Enhancing Boundary Prediction in Language-driven Action Localization
by: Shang, Zirui, et al.
Published: (2025)
by: Shang, Zirui, et al.
Published: (2025)
LLM-enhanced Action-aware Multi-modal Prompt Tuning for Image-Text Matching
by: Tian, Mengxiao, et al.
Published: (2025)
by: Tian, Mengxiao, et al.
Published: (2025)
Scene Graph-guided SegCaptioning Transformer with Fine-grained Alignment for Controllable Video Segmentation and Captioning
by: Zhang, Xu, et al.
Published: (2026)
by: Zhang, Xu, et al.
Published: (2026)
METOR: A Unified Framework for Mutual Enhancement of Objects and Relationships in Open-vocabulary Video Visual Relationship Detection
by: Wang, Yongqi, et al.
Published: (2025)
by: Wang, Yongqi, et al.
Published: (2025)
Towards an Effective Action-Region Tracking Framework for Fine-grained Video Action Recognition
by: Sun, Baoli, et al.
Published: (2025)
by: Sun, Baoli, et al.
Published: (2025)
Event Camera Data Dense Pre-training
by: Yang, Yan, et al.
Published: (2023)
by: Yang, Yan, et al.
Published: (2023)
ETVA: Evaluation of Text-to-Video Alignment via Fine-grained Question Generation and Answering
by: Guan, Kaisi, et al.
Published: (2025)
by: Guan, Kaisi, et al.
Published: (2025)
End-to-end Open-vocabulary Video Visual Relationship Detection using Multi-modal Prompting
by: Wang, Yongqi, et al.
Published: (2024)
by: Wang, Yongqi, et al.
Published: (2024)
Democratizing Fine-grained Visual Recognition with Large Language Models
by: Liu, Mingxuan, et al.
Published: (2024)
by: Liu, Mingxuan, et al.
Published: (2024)
Language-guided Hierarchical Fine-grained Image Forgery Detection and Localization
by: Guo, Xiao, et al.
Published: (2024)
by: Guo, Xiao, et al.
Published: (2024)
Human Stone Toolmaking Action Grammar (HSTAG): A Challenging Benchmark for Fine-grained Motor Behavior Recognition
by: Liu, Cheng, et al.
Published: (2024)
by: Liu, Cheng, et al.
Published: (2024)
BEAR: A Video Dataset For Fine-grained Behaviors Recognition Oriented with Action and Environment Factors
by: Hu, Chengyang, et al.
Published: (2025)
by: Hu, Chengyang, et al.
Published: (2025)
Video Summarization using Denoising Diffusion Probabilistic Model
by: Shang, Zirui, et al.
Published: (2024)
by: Shang, Zirui, et al.
Published: (2024)
Fine-grained Context and Multi-modal Alignment for Freehand 3D Ultrasound Reconstruction
by: Yan, Zhongnuo, et al.
Published: (2024)
by: Yan, Zhongnuo, et al.
Published: (2024)
TAlignDiff: Automatic Tooth Alignment assisted by Diffusion-based Transformation Learning
by: Liu, Yunbi, et al.
Published: (2025)
by: Liu, Yunbi, et al.
Published: (2025)
SpikMamba: When SNN meets Mamba in Event-based Human Action Recognition
by: Chen, Jiaqi, et al.
Published: (2024)
by: Chen, Jiaqi, et al.
Published: (2024)
Prompt-guided Disentangled Representation for Action Recognition
by: Wu, Tianci, et al.
Published: (2025)
by: Wu, Tianci, et al.
Published: (2025)
STAGE: Storyboard-Anchored Generation for Cinematic Multi-shot Narrative
by: Zhang, Peixuan, et al.
Published: (2025)
by: Zhang, Peixuan, et al.
Published: (2025)
DarkShake-DVS: Event-based Human Action Recognition under Low-light andShaking Camera Conditions
by: Chen, Jiaqi, et al.
Published: (2026)
by: Chen, Jiaqi, et al.
Published: (2026)
CoFInAl: Enhancing Action Quality Assessment with Coarse-to-Fine Instruction Alignment
by: Zhou, Kanglei, et al.
Published: (2024)
by: Zhou, Kanglei, et al.
Published: (2024)
Heatmap Pooling Network for Action Recognition from RGB Videos
by: Liu, Mengyuan, et al.
Published: (2025)
by: Liu, Mengyuan, et al.
Published: (2025)
Trajectory Attention for Fine-grained Video Motion Control
by: Xiao, Zeqi, et al.
Published: (2024)
by: Xiao, Zeqi, et al.
Published: (2024)
Every Subtlety Counts: Fine-grained Person Independence Micro-Action Recognition via Distributionally Robust Optimization
by: Cui, Feng-Qi, et al.
Published: (2025)
by: Cui, Feng-Qi, et al.
Published: (2025)
Language-guided Open-world Video Anomaly Detection under Weak Supervision
by: Liu, Zihao, et al.
Published: (2025)
by: Liu, Zihao, et al.
Published: (2025)
MA-Bench: Towards Fine-grained Micro-Action Understanding
by: Li, Kun, et al.
Published: (2026)
by: Li, Kun, et al.
Published: (2026)
3rd Place Solution to Large-scale Fine-grained Food Recognition
by: Zhong, Yang, et al.
Published: (2025)
by: Zhong, Yang, et al.
Published: (2025)
ProBench: Judging Multimodal Foundation Models on Open-ended Multi-domain Expert Tasks
by: Yang, Yan, et al.
Published: (2025)
by: Yang, Yan, et al.
Published: (2025)
It Takes Two: Accurate Gait Recognition in the Wild via Cross-granularity Alignment
by: Zheng, Jinkai, et al.
Published: (2024)
by: Zheng, Jinkai, et al.
Published: (2024)
MMHead: Towards Fine-grained Multi-modal 3D Facial Animation
by: Wu, Sijing, et al.
Published: (2024)
by: Wu, Sijing, et al.
Published: (2024)
Synchronized and Fine-Grained Head for Skeleton-Based Ambiguous Action Recognition
by: Huang, Hao, et al.
Published: (2024)
by: Huang, Hao, et al.
Published: (2024)
Data-free Multi-label Image Recognition via LLM-powered Prompt Tuning
by: Yang, Shuo, et al.
Published: (2024)
by: Yang, Shuo, et al.
Published: (2024)
Robust Saliency-Aware Distillation for Few-shot Fine-grained Visual Recognition
by: Liu, Haiqi, et al.
Published: (2023)
by: Liu, Haiqi, et al.
Published: (2023)
FineTec: Fine-Grained Action Recognition Under Temporal Corruption via Skeleton Decomposition and Sequence Completion
by: Shao, Dian, et al.
Published: (2025)
by: Shao, Dian, et al.
Published: (2025)
Align before Adapt: Leveraging Entity-to-Region Alignments for Generalizable Video Action Recognition
by: Chen, Yifei, et al.
Published: (2023)
by: Chen, Yifei, et al.
Published: (2023)
Fine-grained Spatiotemporal Grounding on Egocentric Videos
by: Liang, Shuo, et al.
Published: (2025)
by: Liang, Shuo, et al.
Published: (2025)
DAP: Doppler-aware Point Network for Heterogeneous mmWave Action Recognition
by: Lin, Jiaying, et al.
Published: (2026)
by: Lin, Jiaying, et al.
Published: (2026)
Similar Items
-
Seeing Through Fog: Towards Fog-Invariant Action Recognition
by: Liu, Enqi, et al.
Published: (2026) -
Benchmarking and Improving GUI Agents in High-Dynamic Environments
by: Liu, Enqi, et al.
Published: (2026) -
EZSR: Event-based Zero-Shot Recognition
by: Yang, Yan, et al.
Published: (2024) -
DreamShot: Personalized Storyboard Synthesis with Video Diffusion Prior
by: Huang, Junjia, et al.
Published: (2026) -
LLM-powered Query Expansion for Enhancing Boundary Prediction in Language-driven Action Localization
by: Shang, Zirui, et al.
Published: (2025)