Spatio-Temporal Side Tuning Pre-trained Foundation Models for Video-based Pedestrian Attribute Recognition
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Wang, Xiao, Zhu, Qian, Jin, Jiandong, Zhu, Jun, Wang, Futian, Jiang, Bo, Wang, Yaowei, Tian, Yonghong |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Pedestrian Attribute Recognition: A New Benchmark Dataset and A Large Language Model Augmented Framework
von: Jin, Jiandong, et al.
Veröffentlicht: (2024)
von: Jin, Jiandong, et al.
Veröffentlicht: (2024)
An Empirical Study of Mamba-based Pedestrian Attribute Recognition
von: Wang, Xiao, et al.
Veröffentlicht: (2024)
von: Wang, Xiao, et al.
Veröffentlicht: (2024)
Pedestrian Attribute Recognition via CLIP based Prompt Vision-Language Fusion
von: Wang, Xiao, et al.
Veröffentlicht: (2023)
von: Wang, Xiao, et al.
Veröffentlicht: (2023)
RGB-Event based Pedestrian Attribute Recognition: A Benchmark Dataset and An Asymmetric RWKV Fusion Framework
von: Wang, Xiao, et al.
Veröffentlicht: (2025)
von: Wang, Xiao, et al.
Veröffentlicht: (2025)
EventSTR: A Benchmark Dataset and Baselines for Event Stream based Scene Text Recognition
von: Wang, Xiao, et al.
Veröffentlicht: (2025)
von: Wang, Xiao, et al.
Veröffentlicht: (2025)
Adversarial Semantic and Label Perturbation Attack for Pedestrian Attribute Recognition
von: Kong, Weizhe, et al.
Veröffentlicht: (2025)
von: Kong, Weizhe, et al.
Veröffentlicht: (2025)
Human Activity Recognition using RGB-Event based Sensors: A Multi-modal Heat Conduction Model and A Benchmark Dataset
von: Wang, Shiao, et al.
Veröffentlicht: (2025)
von: Wang, Shiao, et al.
Veröffentlicht: (2025)
ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning
von: Wang, Xiao, et al.
Veröffentlicht: (2025)
von: Wang, Xiao, et al.
Veröffentlicht: (2025)
SNN-PAR: Energy Efficient Pedestrian Attribute Recognition via Spiking Neural Networks
von: Wang, Haiyang, et al.
Veröffentlicht: (2024)
von: Wang, Haiyang, et al.
Veröffentlicht: (2024)
Large-scale Multi-Modal Pre-trained Models: A Comprehensive Survey
von: Wang, Xiao, et al.
Veröffentlicht: (2023)
von: Wang, Xiao, et al.
Veröffentlicht: (2023)
Event Stream based Human Action Recognition: A High-Definition Benchmark Dataset and Algorithms
von: Wang, Xiao, et al.
Veröffentlicht: (2024)
von: Wang, Xiao, et al.
Veröffentlicht: (2024)
SequencePAR: Understanding Pedestrian Attributes via A Sequence Generation Paradigm
von: Jin, Jiandong, et al.
Veröffentlicht: (2023)
von: Jin, Jiandong, et al.
Veröffentlicht: (2023)
SSTFormer: Bridging Spiking Neural Network and Memory Support Transformer for Frame-Event based Recognition
von: Wang, Xiao, et al.
Veröffentlicht: (2023)
von: Wang, Xiao, et al.
Veröffentlicht: (2023)
EPRBench: A High-Quality Benchmark Dataset for Event Stream Based Visual Place Recognition
von: Wang, Xiao, et al.
Veröffentlicht: (2026)
von: Wang, Xiao, et al.
Veröffentlicht: (2026)
Revisiting Color-Event based Tracking: A Unified Network, Dataset, and Metric
von: Tang, Chuanming, et al.
Veröffentlicht: (2022)
von: Tang, Chuanming, et al.
Veröffentlicht: (2022)
Uncertainty-Aware Pedestrian Attribute Recognition via Evidential Deep Learning
von: Lou, Zhuofan, et al.
Veröffentlicht: (2026)
von: Lou, Zhuofan, et al.
Veröffentlicht: (2026)
Sign Language Translation using Frame and Event Stream: Benchmark Dataset and Algorithms
von: Wang, Xiao, et al.
Veröffentlicht: (2025)
von: Wang, Xiao, et al.
Veröffentlicht: (2025)
Spatio-temporal Graph Learning on Adaptive Mined Key Frames for High-performance Multi-Object Tracking
von: Wang, Futian, et al.
Veröffentlicht: (2025)
von: Wang, Futian, et al.
Veröffentlicht: (2025)
RGB-Event HyperGraph Prompt for Kilometer Marker Recognition based on Pre-trained Foundation Models
von: Xian, Xiaoyu, et al.
Veröffentlicht: (2026)
von: Xian, Xiaoyu, et al.
Veröffentlicht: (2026)
D$^2$ST-Adapter: Disentangled-and-Deformable Spatio-Temporal Adapter for Few-shot Action Recognition
von: Pei, Wenjie, et al.
Veröffentlicht: (2023)
von: Pei, Wenjie, et al.
Veröffentlicht: (2023)
Unleashing the Power of CNN and Transformer for Balanced RGB-Event Video Recognition
von: Wang, Xiao, et al.
Veröffentlicht: (2023)
von: Wang, Xiao, et al.
Veröffentlicht: (2023)
Retain, Blend, and Exchange: A Quality-aware Spatial-Stereo Fusion Approach for Event Stream Recognition
von: Chen, Lan, et al.
Veröffentlicht: (2024)
von: Chen, Lan, et al.
Veröffentlicht: (2024)
DialBench: Towards Accurate Reading Recognition of Pointer Meter using Large Foundation Models
von: Wang, Futian, et al.
Veröffentlicht: (2025)
von: Wang, Futian, et al.
Veröffentlicht: (2025)
PFM-VEPAR: Prompting Foundation Models for RGB-Event Camera based Pedestrian Attribute Recognition
von: Xu, Minghe, et al.
Veröffentlicht: (2026)
von: Xu, Minghe, et al.
Veröffentlicht: (2026)
Pedestrian Attribute Recognition via Hierarchical Cross-Modality HyperGraph Learning
von: Wang, Xiao, et al.
Veröffentlicht: (2025)
von: Wang, Xiao, et al.
Veröffentlicht: (2025)
FOCUS: Fine-grained Optimization with Semantic Guided Understanding for Pedestrian Attributes Recognition
von: An, Hongyan, et al.
Veröffentlicht: (2025)
von: An, Hongyan, et al.
Veröffentlicht: (2025)
Pre-training on High Definition X-ray Images: An Experimental Study
von: Wang, Xiao, et al.
Veröffentlicht: (2024)
von: Wang, Xiao, et al.
Veröffentlicht: (2024)
Activating Associative Disease-Aware Vision Token Memory for LLM-Based X-ray Report Generation
von: Wang, Xiao, et al.
Veröffentlicht: (2025)
von: Wang, Xiao, et al.
Veröffentlicht: (2025)
VELoRA: A Low-Rank Adaptation Approach for Efficient RGB-Event based Recognition
von: Chen, Lan, et al.
Veröffentlicht: (2024)
von: Chen, Lan, et al.
Veröffentlicht: (2024)
Uncertainty-aware Bridge based Mobile-Former Network for Event-based Pattern Recognition
von: Yang, Haoxiang, et al.
Veröffentlicht: (2024)
von: Yang, Haoxiang, et al.
Veröffentlicht: (2024)
Towards Seamless Adaptation of Pre-trained Models for Visual Place Recognition
von: Lu, Feng, et al.
Veröffentlicht: (2024)
von: Lu, Feng, et al.
Veröffentlicht: (2024)
Object Detection using Event Camera: A MoE Heat Conduction based Detector and A New Benchmark Dataset
von: Wang, Xiao, et al.
Veröffentlicht: (2024)
von: Wang, Xiao, et al.
Veröffentlicht: (2024)
CRSOT: Cross-Resolution Object Tracking using Unaligned Frame and Event Cameras
von: Zhu, Yabin, et al.
Veröffentlicht: (2024)
von: Zhu, Yabin, et al.
Veröffentlicht: (2024)
UniPAR: A Unified Framework for Pedestrian Attribute Recognition
von: Xu, Minghe, et al.
Veröffentlicht: (2026)
von: Xu, Minghe, et al.
Veröffentlicht: (2026)
FiLA-Video: Spatio-Temporal Compression for Fine-Grained Long Video Understanding
von: Guo, Yanan, et al.
Veröffentlicht: (2025)
von: Guo, Yanan, et al.
Veröffentlicht: (2025)
Cluster-Wise Spatio-Temporal Masking for Efficient Video-Language Pretraining
von: Zhuang, Weijun, et al.
Veröffentlicht: (2026)
von: Zhuang, Weijun, et al.
Veröffentlicht: (2026)
STELLA: Continual Audio-Video Pre-training with Spatio-Temporal Localized Alignment
von: Lee, Jaewoo, et al.
Veröffentlicht: (2023)
von: Lee, Jaewoo, et al.
Veröffentlicht: (2023)
Temporal-Consistent Video Restoration with Pre-trained Diffusion Models
von: Wang, Hengkang, et al.
Veröffentlicht: (2025)
von: Wang, Hengkang, et al.
Veröffentlicht: (2025)
Event Stream-based Visual Object Tracking: HDETrack V2 and A High-Definition Benchmark
von: Wang, Shiao, et al.
Veröffentlicht: (2025)
von: Wang, Shiao, et al.
Veröffentlicht: (2025)
TDS-CLIP: Temporal Difference Side Network for Efficient VideoAction Recognition
von: Wang, Bin, et al.
Veröffentlicht: (2024)
von: Wang, Bin, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Pedestrian Attribute Recognition: A New Benchmark Dataset and A Large Language Model Augmented Framework
von: Jin, Jiandong, et al.
Veröffentlicht: (2024) -
An Empirical Study of Mamba-based Pedestrian Attribute Recognition
von: Wang, Xiao, et al.
Veröffentlicht: (2024) -
Pedestrian Attribute Recognition via CLIP based Prompt Vision-Language Fusion
von: Wang, Xiao, et al.
Veröffentlicht: (2023) -
RGB-Event based Pedestrian Attribute Recognition: A Benchmark Dataset and An Asymmetric RWKV Fusion Framework
von: Wang, Xiao, et al.
Veröffentlicht: (2025) -
EventSTR: A Benchmark Dataset and Baselines for Event Stream based Scene Text Recognition
von: Wang, Xiao, et al.
Veröffentlicht: (2025)