When Pedestrian Detection Meets Multi-Modal Learning: Generalist Model and Benchmark Dataset
Fuente:
arXiv
Saved in:
| Main Authors: | Zhang, Yi, Zeng, Wang, Jin, Sheng, Qian, Chen, Luo, Ping, Liu, Wentao |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
NADER: Neural Architecture Design via Multi-Agent Collaboration
by: Yang, Zekang, et al.
Published: (2024)
by: Yang, Zekang, et al.
Published: (2024)
You Only Learn One Query: Learning Unified Human Query for Single-Stage Multi-Person Multi-Task Human-Centric Perception
by: Jin, Sheng, et al.
Published: (2023)
by: Jin, Sheng, et al.
Published: (2023)
Robust Pedestrian Detection with Uncertain Modality
by: Bie, Qian, et al.
Published: (2026)
by: Bie, Qian, et al.
Published: (2026)
AutoMMLab: Automatically Generating Deployable Models from Language Instructions for Computer Vision Tasks
by: Yang, Zekang, et al.
Published: (2024)
by: Yang, Zekang, et al.
Published: (2024)
GKGNet: Group K-Nearest Neighbor based Graph Convolutional Network for Multi-Label Image Recognition
by: Yao, Ruijie, et al.
Published: (2023)
by: Yao, Ruijie, et al.
Published: (2023)
PFSD: A Multi-Modal Pedestrian-Focus Scene Dataset for Rich Tasks in Semi-Structured Environments
by: Liu, Yueting, et al.
Published: (2025)
by: Liu, Yueting, et al.
Published: (2025)
GDTS: Goal-Guided Diffusion Model with Tree Sampling for Multi-Modal Pedestrian Trajectory Prediction
by: Sun, Ge, et al.
Published: (2023)
by: Sun, Ge, et al.
Published: (2023)
TCFormer: Visual Recognition via Token Clustering Transformer
by: Zeng, Wang, et al.
Published: (2024)
by: Zeng, Wang, et al.
Published: (2024)
Nearshore Underwater Target Detection Meets UAV-borne Hyperspectral Remote Sensing: A Novel Hybrid-level Contrastive Learning Framework and Benchmark Dataset
by: Qi, Jiahao, et al.
Published: (2025)
by: Qi, Jiahao, et al.
Published: (2025)
KptLLM: Unveiling the Power of Large Language Model for Keypoint Comprehension
by: Yang, Jie, et al.
Published: (2024)
by: Yang, Jie, et al.
Published: (2024)
UniFS: Universal Few-shot Instance Perception with Point Representations
by: Jin, Sheng, et al.
Published: (2024)
by: Jin, Sheng, et al.
Published: (2024)
Pedestrian Attribute Recognition: A New Benchmark Dataset and A Large Language Model Augmented Framework
by: Jin, Jiandong, et al.
Published: (2024)
by: Jin, Jiandong, et al.
Published: (2024)
Ambiguous Annotations: When is a Pedestrian not a Pedestrian?
by: Schwirten, Luisa, et al.
Published: (2024)
by: Schwirten, Luisa, et al.
Published: (2024)
Pedestrian Attribute Recognition via Hierarchical Cross-Modality HyperGraph Learning
by: Wang, Xiao, et al.
Published: (2025)
by: Wang, Xiao, et al.
Published: (2025)
Visual CoT: Advancing Multi-Modal Language Models with a Comprehensive Dataset and Benchmark for Chain-of-Thought Reasoning
by: Shao, Hao, et al.
Published: (2024)
by: Shao, Hao, et al.
Published: (2024)
When Deepfake Detection Meets Graph Neural Network:a Unified and Lightweight Learning Framework
by: Liu, Haoyu, et al.
Published: (2025)
by: Liu, Haoyu, et al.
Published: (2025)
KptLLM++: Towards Generic Keypoint Comprehension with Large Language Model
by: Yang, Jie, et al.
Published: (2025)
by: Yang, Jie, et al.
Published: (2025)
When AVSR Meets Video Conferencing: Dataset, Degradation, and the Hidden Mechanism Behind Performance Collapse
by: Huang, Yihuan, et al.
Published: (2026)
by: Huang, Yihuan, et al.
Published: (2026)
Multi-Modal Dataset Distillation in the Wild
by: Dang, Zhuohang, et al.
Published: (2025)
by: Dang, Zhuohang, et al.
Published: (2025)
Boosting Virtual Agent Learning and Reasoning: A Step-Wise, Multi-Dimensional, and Generalist Reward Model with Benchmark
by: Miao, Bingchen, et al.
Published: (2025)
by: Miao, Bingchen, et al.
Published: (2025)
PedDet: Adaptive Spectral Optimization for Multimodal Pedestrian Detection
by: Zhao, Rui, et al.
Published: (2025)
by: Zhao, Rui, et al.
Published: (2025)
MS-DETR: Multispectral Pedestrian Detection Transformer with Loosely Coupled Fusion and Modality-Balanced Optimization
by: Xing, Yinghui, et al.
Published: (2023)
by: Xing, Yinghui, et al.
Published: (2023)
TFDet: Target-Aware Fusion for RGB-T Pedestrian Detection
by: Zhang, Xue, et al.
Published: (2023)
by: Zhang, Xue, et al.
Published: (2023)
When Visual Privacy Protection Meets Multimodal Large Language Models
by: Hui, Xiaofei, et al.
Published: (2026)
by: Hui, Xiaofei, et al.
Published: (2026)
UAVScenes: A Multi-Modal Dataset for UAVs
by: Wang, Sijie, et al.
Published: (2025)
by: Wang, Sijie, et al.
Published: (2025)
Multi-Modal Building Change Detection for Large-Scale Small Changes: Benchmark and Baseline
by: Wang, Ye, et al.
Published: (2026)
by: Wang, Ye, et al.
Published: (2026)
When MLLMs Meet Compression Distortion: A Coding Paradigm Tailored to MLLMs
by: Liu, Jinming, et al.
Published: (2025)
by: Liu, Jinming, et al.
Published: (2025)
A Pedestrian-Vehicle Interaction Benchmark and Annotation Framework for Unstructured Scenes via Uncalibrated Cameras
by: Peng, Haoyang, et al.
Published: (2026)
by: Peng, Haoyang, et al.
Published: (2026)
WDMamba: When Wavelet Degradation Prior Meets Vision Mamba for Image Dehazing
by: Sun, Jie, et al.
Published: (2025)
by: Sun, Jie, et al.
Published: (2025)
AMFD: Distillation via Adaptive Multimodal Fusion for Multispectral Pedestrian Detection
by: Chen, Zizhao, et al.
Published: (2024)
by: Chen, Zizhao, et al.
Published: (2024)
Nighttime Pedestrian Detection Based on Fore-Background Contrast Learning
by: Yao, He, et al.
Published: (2024)
by: Yao, He, et al.
Published: (2024)
Diffusion Models For Multi-Modal Generative Modeling
by: Chen, Changyou, et al.
Published: (2024)
by: Chen, Changyou, et al.
Published: (2024)
RGB-Event based Pedestrian Attribute Recognition: A Benchmark Dataset and An Asymmetric RWKV Fusion Framework
by: Wang, Xiao, et al.
Published: (2025)
by: Wang, Xiao, et al.
Published: (2025)
Multi-View Pedestrian Occupancy Prediction with a Novel Synthetic Dataset
by: Aung, Sithu, et al.
Published: (2024)
by: Aung, Sithu, et al.
Published: (2024)
VGGT-X: When VGGT Meets Dense Novel View Synthesis
by: Liu, Yang, et al.
Published: (2025)
by: Liu, Yang, et al.
Published: (2025)
VisionFM: a Multi-Modal Multi-Task Vision Foundation Model for Generalist Ophthalmic Artificial Intelligence
by: Qiu, Jianing, et al.
Published: (2023)
by: Qiu, Jianing, et al.
Published: (2023)
Fusion Meets Diverse Conditions: A High-diversity Benchmark and Baseline for UAV-based Multimodal Object Detection with Condition Cues
by: Chen, Chen, et al.
Published: (2025)
by: Chen, Chen, et al.
Published: (2025)
Towards Automatic Power Battery Detection: New Challenge, Benchmark Dataset and Baseline
by: Zhao, Xiaoqi, et al.
Published: (2023)
by: Zhao, Xiaoqi, et al.
Published: (2023)
LiMT: A Multi-task Liver Image Benchmark Dataset
by: Liu, Zhe, et al.
Published: (2025)
by: Liu, Zhe, et al.
Published: (2025)
TraceAV-Bench: Benchmarking Multi-Hop Trajectory Reasoning over Long Audio-Visual Videos
by: Feng, Hengyi, et al.
Published: (2026)
by: Feng, Hengyi, et al.
Published: (2026)
Similar Items
-
NADER: Neural Architecture Design via Multi-Agent Collaboration
by: Yang, Zekang, et al.
Published: (2024) -
You Only Learn One Query: Learning Unified Human Query for Single-Stage Multi-Person Multi-Task Human-Centric Perception
by: Jin, Sheng, et al.
Published: (2023) -
Robust Pedestrian Detection with Uncertain Modality
by: Bie, Qian, et al.
Published: (2026) -
AutoMMLab: Automatically Generating Deployable Models from Language Instructions for Computer Vision Tasks
by: Yang, Zekang, et al.
Published: (2024) -
GKGNet: Group K-Nearest Neighbor based Graph Convolutional Network for Multi-Label Image Recognition
by: Yao, Ruijie, et al.
Published: (2023)