PFSD: A Multi-Modal Pedestrian-Focus Scene Dataset for Rich Tasks in Semi-Structured Environments
Fuente:
arXiv
Guardado en:
| Autores principales: | Liu, Yueting, Wang, Hanshi, Zha, Zhengjun, Hu, Weiming, Gao, Jin |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
MambaFusion: Height-Fidelity Dense Global Fusion for Multi-modal 3D Object Detection
por: Wang, Hanshi, et al.
Publicado: (2025)
por: Wang, Hanshi, et al.
Publicado: (2025)
When Pedestrian Detection Meets Multi-Modal Learning: Generalist Model and Benchmark Dataset
por: Zhang, Yi, et al.
Publicado: (2024)
por: Zhang, Yi, et al.
Publicado: (2024)
OneDrive: Unified Multi-Paradigm Driving with Vision-Language-Action Models
por: Zhang, Yiwei, et al.
Publicado: (2026)
por: Zhang, Yiwei, et al.
Publicado: (2026)
Online Segment Any 3D Thing as Instance Tracking
por: Wang, Hanshi, et al.
Publicado: (2025)
por: Wang, Hanshi, et al.
Publicado: (2025)
Integrating Diverse Assignment Strategies into DETRs
por: Zhang, Yiwei, et al.
Publicado: (2026)
por: Zhang, Yiwei, et al.
Publicado: (2026)
AutoPrune: Each Complexity Deserves a Pruning Policy
por: Wang, Hanshi, et al.
Publicado: (2025)
por: Wang, Hanshi, et al.
Publicado: (2025)
GRACE: Estimating Geometry-level 3D Human-Scene Contact from 2D Images
por: Wang, Chengfeng, et al.
Publicado: (2025)
por: Wang, Chengfeng, et al.
Publicado: (2025)
Robust Pedestrian Detection with Uncertain Modality
por: Bie, Qian, et al.
Publicado: (2026)
por: Bie, Qian, et al.
Publicado: (2026)
GDTS: Goal-Guided Diffusion Model with Tree Sampling for Multi-Modal Pedestrian Trajectory Prediction
por: Sun, Ge, et al.
Publicado: (2023)
por: Sun, Ge, et al.
Publicado: (2023)
EMoTive: Event-guided Trajectory Modeling for 3D Motion Estimation
por: Wan, Zengyu, et al.
Publicado: (2025)
por: Wan, Zengyu, et al.
Publicado: (2025)
I2V-Adapter: A General Image-to-Video Adapter for Diffusion Models
por: Guo, Xun, et al.
Publicado: (2023)
por: Guo, Xun, et al.
Publicado: (2023)
CORP: A Multi-Modal Dataset for Campus-Oriented Roadside Perception Tasks
por: Wang, Beibei, et al.
Publicado: (2024)
por: Wang, Beibei, et al.
Publicado: (2024)
Multi-View Pedestrian Occupancy Prediction with a Novel Synthetic Dataset
por: Aung, Sithu, et al.
Publicado: (2024)
por: Aung, Sithu, et al.
Publicado: (2024)
FocusDD: Real-World Scene Infusion for Robust Dataset Distillation
por: Hu, Youbing, et al.
Publicado: (2025)
por: Hu, Youbing, et al.
Publicado: (2025)
BEV$^2$PR: BEV-Enhanced Visual Place Recognition with Structural Cues
por: Ge, Fudong, et al.
Publicado: (2024)
por: Ge, Fudong, et al.
Publicado: (2024)
Leader360V: The Large-scale, Real-world 360 Video Dataset for Multi-task Learning in Diverse Environment
por: Zhang, Weiming, et al.
Publicado: (2025)
por: Zhang, Weiming, et al.
Publicado: (2025)
RealDriveSim: A Realistic Multi-Modal Multi-Task Synthetic Dataset for Autonomous Driving
por: Jadon, Arpit, et al.
Publicado: (2025)
por: Jadon, Arpit, et al.
Publicado: (2025)
RealFace -- Pedestrian Face Dataset
por: Thomas, Leonardo Ramos
Publicado: (2024)
por: Thomas, Leonardo Ramos
Publicado: (2024)
UAVScenes: A Multi-Modal Dataset for UAVs
por: Wang, Sijie, et al.
Publicado: (2025)
por: Wang, Sijie, et al.
Publicado: (2025)
A Pedestrian-Vehicle Interaction Benchmark and Annotation Framework for Unstructured Scenes via Uncalibrated Cameras
por: Peng, Haoyang, et al.
Publicado: (2026)
por: Peng, Haoyang, et al.
Publicado: (2026)
MSVCOD:A Large-Scale Multi-Scene Dataset for Video Camouflage Object Detection
por: Gao, Shuyong, et al.
Publicado: (2025)
por: Gao, Shuyong, et al.
Publicado: (2025)
Animate3D: Animating Any 3D Model with Multi-view Video Diffusion
por: Jiang, Yanqin, et al.
Publicado: (2024)
por: Jiang, Yanqin, et al.
Publicado: (2024)
The S3LI Vulcano Dataset: A Dataset for Multi-Modal SLAM in Unstructured Planetary Environments
por: Giubilato, Riccardo, et al.
Publicado: (2026)
por: Giubilato, Riccardo, et al.
Publicado: (2026)
Iterative Inference-time Scaling with Adaptive Frequency Steering for Image Super-Resolution
por: Zhang, Hexin, et al.
Publicado: (2025)
por: Zhang, Hexin, et al.
Publicado: (2025)
Pedestrian Attribute Recognition via Hierarchical Cross-Modality HyperGraph Learning
por: Wang, Xiao, et al.
Publicado: (2025)
por: Wang, Xiao, et al.
Publicado: (2025)
Beyond Dataset Distillation: Lossless Dataset Concentration via Diffusion-Assisted Distribution Alignment
por: Liu, Tongfei, et al.
Publicado: (2026)
por: Liu, Tongfei, et al.
Publicado: (2026)
A Luminance-Aware Multi-Scale Network for Polarization Image Fusion with a Multi-Scene Dataset
por: Huang, Zhuangfan, et al.
Publicado: (2025)
por: Huang, Zhuangfan, et al.
Publicado: (2025)
MultiEgo: A Multi-View Egocentric Video Dataset for 4D Scene Reconstruction
por: Li, Bate, et al.
Publicado: (2025)
por: Li, Bate, et al.
Publicado: (2025)
Part-Whole Relational Fusion Towards Multi-Modal Scene Understanding
por: Liu, Yi, et al.
Publicado: (2024)
por: Liu, Yi, et al.
Publicado: (2024)
Semi-Supervised Multi-Modal Medical Image Segmentation for Complex Situations
por: Meng, Dongdong, et al.
Publicado: (2025)
por: Meng, Dongdong, et al.
Publicado: (2025)
InCrowd-VI: A Realistic Visual-Inertial Dataset for Evaluating SLAM in Indoor Pedestrian-Rich Spaces for Human Navigation
por: Bamdad, Marziyeh, et al.
Publicado: (2024)
por: Bamdad, Marziyeh, et al.
Publicado: (2024)
Focus Entirety and Perceive Environment for Arbitrary-Shaped Text Detection
por: Han, Xu, et al.
Publicado: (2024)
por: Han, Xu, et al.
Publicado: (2024)
TBD Pedestrian Data Collection: Towards Rich, Portable, and Large-Scale Natural Pedestrian Data
por: Wang, Allan, et al.
Publicado: (2023)
por: Wang, Allan, et al.
Publicado: (2023)
MMInstruct: A High-Quality Multi-Modal Instruction Tuning Dataset with Extensive Diversity
por: Liu, Yangzhou, et al.
Publicado: (2024)
por: Liu, Yangzhou, et al.
Publicado: (2024)
COMMA: Co-Articulated Multi-Modal Learning
por: Hu, Lianyu, et al.
Publicado: (2023)
por: Hu, Lianyu, et al.
Publicado: (2023)
Pedestrian Attribute Recognition as Label-balanced Multi-label Learning
por: Zhou, Yibo, et al.
Publicado: (2024)
por: Zhou, Yibo, et al.
Publicado: (2024)
Queryable 3D Scene Representation: A Multi-Modal Framework for Semantic Reasoning and Robotic Task Planning
por: Li, Xun, et al.
Publicado: (2025)
por: Li, Xun, et al.
Publicado: (2025)
Fine-Grained Scene Image Classification with Modality-Agnostic Adapter
por: Wang, Yiqun, et al.
Publicado: (2024)
por: Wang, Yiqun, et al.
Publicado: (2024)
Towards Personalized Multi-Modal MRI Synthesis across Heterogeneous Datasets
por: Zhang, Yue, et al.
Publicado: (2026)
por: Zhang, Yue, et al.
Publicado: (2026)
SGTA: Scene-Graph Based Multi-Modal Traffic Agent for Video Understanding
por: Zhou, Xingcheng, et al.
Publicado: (2026)
por: Zhou, Xingcheng, et al.
Publicado: (2026)
Ejemplares similares
-
MambaFusion: Height-Fidelity Dense Global Fusion for Multi-modal 3D Object Detection
por: Wang, Hanshi, et al.
Publicado: (2025) -
When Pedestrian Detection Meets Multi-Modal Learning: Generalist Model and Benchmark Dataset
por: Zhang, Yi, et al.
Publicado: (2024) -
OneDrive: Unified Multi-Paradigm Driving with Vision-Language-Action Models
por: Zhang, Yiwei, et al.
Publicado: (2026) -
Online Segment Any 3D Thing as Instance Tracking
por: Wang, Hanshi, et al.
Publicado: (2025) -
Integrating Diverse Assignment Strategies into DETRs
por: Zhang, Yiwei, et al.
Publicado: (2026)