Poseidon: A ViT-based Architecture for Multi-Frame Pose Estimation with Adaptive Frame Weighting and Multi-Scale Feature Fusion
Fuente:
arXiv
Salvato in:
| Autori principali: | Pace, Cesare Davide, De Nunzio, Alessandro Marco, De Stefano, Claudio, Fontanella, Francesco, Molinara, Mario |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Uncertainty-Aware Mapping from 3D Keypoints to Anatomical Landmarks for Markerless Biomechanics
di: Pace, Cesare Davide, et al.
Pubblicazione: (2026)
di: Pace, Cesare Davide, et al.
Pubblicazione: (2026)
Multi-view Pose Fusion for Occlusion-Aware 3D Human Pose Estimation
di: Bragagnolo, Laura, et al.
Pubblicazione: (2024)
di: Bragagnolo, Laura, et al.
Pubblicazione: (2024)
When Deep Learning Fails: Limitations of Recurrent Models on Stroke-Based Handwriting for Alzheimer's Disease Detection
di: Nardone, Emanuele, et al.
Pubblicazione: (2025)
di: Nardone, Emanuele, et al.
Pubblicazione: (2025)
FastPose-ViT: A Vision Transformer for Real-Time Spacecraft Pose Estimation
di: Ancey, Pierre, et al.
Pubblicazione: (2025)
di: Ancey, Pierre, et al.
Pubblicazione: (2025)
ViT Registers and Fractal ViT
di: Chou, Jason Chuan-Chih, et al.
Pubblicazione: (2026)
di: Chou, Jason Chuan-Chih, et al.
Pubblicazione: (2026)
EFO: the Emotion Frame Ontology
di: De Giorgis, Stefano, et al.
Pubblicazione: (2024)
di: De Giorgis, Stefano, et al.
Pubblicazione: (2024)
DKPMV: Dense Keypoints Fusion from Multi-View RGB Frames for 6D Pose Estimation of Textureless Objects
di: Chen, Jiahong, et al.
Pubblicazione: (2025)
di: Chen, Jiahong, et al.
Pubblicazione: (2025)
KAN-FPN-Stem:A KAN-Enhanced Feature Pyramid Stem for Boosting ViT-based Pose Estimation
di: Tang, HaoNan
Pubblicazione: (2025)
di: Tang, HaoNan
Pubblicazione: (2025)
A Survey on Constructing Parseval Fusion Frames via Scaling Weights
di: Ameli, Ehsan, et al.
Pubblicazione: (2025)
di: Ameli, Ehsan, et al.
Pubblicazione: (2025)
A Machine Learning Approach to Analyze the Effects of Alzheimer's Disease on Handwriting through Lognormal Features
di: D'Alessandro, Tiziana, et al.
Pubblicazione: (2024)
di: D'Alessandro, Tiziana, et al.
Pubblicazione: (2024)
milliMamba: Specular-Aware Human Pose Estimation via Dual mmWave Radar with Multi-Frame Mamba Fusion
di: Kini, Niraj Prakash, et al.
Pubblicazione: (2025)
di: Kini, Niraj Prakash, et al.
Pubblicazione: (2025)
Lightweight ViT with Multiscale Feature Fusion for Driving Risk Rating Warning System
di: Hao Tang, et al.
Pubblicazione: (2024)
di: Hao Tang, et al.
Pubblicazione: (2024)
MedSAM-CA: A CNN-Augmented ViT with Attention-Enhanced Multi-Scale Fusion for Medical Image Segmentation
di: Tian, Peiting, et al.
Pubblicazione: (2025)
di: Tian, Peiting, et al.
Pubblicazione: (2025)
Active 6D Pose Estimation for Textureless Objects using Multi-View RGB Frames
di: Yang, Jun, et al.
Pubblicazione: (2025)
di: Yang, Jun, et al.
Pubblicazione: (2025)
CLAMP-ViT: Contrastive Data-Free Learning for Adaptive Post-Training Quantization of ViTs
di: Ramachandran, Akshat, et al.
Pubblicazione: (2024)
di: Ramachandran, Akshat, et al.
Pubblicazione: (2024)
AXIAL: Attention-based eXplainability for Interpretable Alzheimer's Localized Diagnosis using 2D CNNs on 3D MRI brain scans
di: Lozupone, Gabriele, et al.
Pubblicazione: (2024)
di: Lozupone, Gabriele, et al.
Pubblicazione: (2024)
SnapPose3D: Diffusion-Based Single-Frame 2D-to-3D Lifting of Human Poses
di: Simoni, Alessandro, et al.
Pubblicazione: (2026)
di: Simoni, Alessandro, et al.
Pubblicazione: (2026)
Motion Aware ViT-based Framework for Monocular 6-DoF Spacecraft Pose Estimation
di: Sosa, Jose, et al.
Pubblicazione: (2025)
di: Sosa, Jose, et al.
Pubblicazione: (2025)
ViT-VS: On the Applicability of Pretrained Vision Transformer Features for Generalizable Visual Servoing
di: Scherl, Alessandro, et al.
Pubblicazione: (2025)
di: Scherl, Alessandro, et al.
Pubblicazione: (2025)
ViT-CoMer: Vision Transformer with Convolutional Multi-scale Feature Interaction for Dense Predictions
di: Xia, Chunlong, et al.
Pubblicazione: (2024)
di: Xia, Chunlong, et al.
Pubblicazione: (2024)
How word semantics and phonology affect handwriting of Alzheimer's patients: a machine learning based analysis
di: Cilia, Nicole Dalia, et al.
Pubblicazione: (2023)
di: Cilia, Nicole Dalia, et al.
Pubblicazione: (2023)
Character Detection using YOLO for Writer Identification in multiple Medieval books
di: di Freca, Alessandra Scotto, et al.
Pubblicazione: (2026)
di: di Freca, Alessandra Scotto, et al.
Pubblicazione: (2026)
Frequency-Adaptive Discrete Cosine-ViT-ResNet Architecture for Sparse-Data Vision
di: Kang, Ziyue, et al.
Pubblicazione: (2025)
di: Kang, Ziyue, et al.
Pubblicazione: (2025)
MMeViT: Multi-Modal ensemble ViT for Post-Stroke Rehabilitation Action Recognition
di: Kim, Ye-eun, et al.
Pubblicazione: (2025)
di: Kim, Ye-eun, et al.
Pubblicazione: (2025)
VTCNet: A Feature Fusion DL Model Based on CNN and ViT for the Classification of Cervical Cells
di: Mingzhe Li, et al.
Pubblicazione: (2024)
di: Mingzhe Li, et al.
Pubblicazione: (2024)
Strong Szegő Limit Theorems for Multi-Bordered, Framed, and Multi-Framed Toeplitz Determinants
di: Gharakhloo, Roozbeh
Pubblicazione: (2023)
di: Gharakhloo, Roozbeh
Pubblicazione: (2023)
Latent Diffusion Autoencoders: Toward Efficient and Meaningful Unsupervised Representation Learning in Medical Imaging
di: Lozupone, Gabriele, et al.
Pubblicazione: (2025)
di: Lozupone, Gabriele, et al.
Pubblicazione: (2025)
[Dataset] Color Preserving CMOS-SPAD Fusion for Multi-Frame HDR
di: Suonsivu, Aleksi
Pubblicazione: (2025)
di: Suonsivu, Aleksi
Pubblicazione: (2025)
Multi-Temporal Frames Projection for Dynamic Processes Fusion in Fluorescence Microscopy
di: Eshkiki, Hassan, et al.
Pubblicazione: (2026)
di: Eshkiki, Hassan, et al.
Pubblicazione: (2026)
Hierarchical Pose Estimation and Mapping with Multi-Scale Neural Feature Fields
di: Kruzhkov, Evgenii, et al.
Pubblicazione: (2024)
di: Kruzhkov, Evgenii, et al.
Pubblicazione: (2024)
Exploring Plain ViT Reconstruction for Multi-class Unsupervised Anomaly Detection
di: Zhang, Jiangning, et al.
Pubblicazione: (2023)
di: Zhang, Jiangning, et al.
Pubblicazione: (2023)
DC-ViT: Modulating Spatial and Channel Interactions for Multi-Channel Images
di: Marikkar, Umar, et al.
Pubblicazione: (2026)
di: Marikkar, Umar, et al.
Pubblicazione: (2026)
MSCViT: A Small-size ViT architecture with Multi-Scale Self-Attention Mechanism for Tiny Datasets
di: Zhang, Bowei, et al.
Pubblicazione: (2025)
di: Zhang, Bowei, et al.
Pubblicazione: (2025)
Multi-Cali Anything: Dense Feature Multi-Frame Structure-from-Motion for Large-Scale Camera Array Calibration
di: You, Jinjiang, et al.
Pubblicazione: (2025)
di: You, Jinjiang, et al.
Pubblicazione: (2025)
ViSketch-GPT: Collaborative Multi-Scale Feature Extraction for Sketch Recognition and Generation
di: Federico, Giulio, et al.
Pubblicazione: (2025)
di: Federico, Giulio, et al.
Pubblicazione: (2025)
TFS-ViT: Token-Level Feature Stylization for Domain Generalization
di: Noori, Mehrdad, et al.
Pubblicazione: (2023)
di: Noori, Mehrdad, et al.
Pubblicazione: (2023)
A Unified Solution to Video Fusion: From Multi-Frame Learning to Benchmarking
di: Zhao, Zixiang, et al.
Pubblicazione: (2025)
di: Zhao, Zixiang, et al.
Pubblicazione: (2025)
HIRI-ViT: Scaling Vision Transformer with High Resolution Inputs
di: Yao, Ting, et al.
Pubblicazione: (2024)
di: Yao, Ting, et al.
Pubblicazione: (2024)
A Single-Frame and Multi-Frame Cascaded Image Super-Resolution Method
di: Sun, Jing, et al.
Pubblicazione: (2024)
di: Sun, Jing, et al.
Pubblicazione: (2024)
Data-Driven Feature Tracking for Event Cameras With and Without Frames
di: Messikommer, Nico, et al.
Pubblicazione: (2022)
di: Messikommer, Nico, et al.
Pubblicazione: (2022)
Documenti analoghi
-
Uncertainty-Aware Mapping from 3D Keypoints to Anatomical Landmarks for Markerless Biomechanics
di: Pace, Cesare Davide, et al.
Pubblicazione: (2026) -
Multi-view Pose Fusion for Occlusion-Aware 3D Human Pose Estimation
di: Bragagnolo, Laura, et al.
Pubblicazione: (2024) -
When Deep Learning Fails: Limitations of Recurrent Models on Stroke-Based Handwriting for Alzheimer's Disease Detection
di: Nardone, Emanuele, et al.
Pubblicazione: (2025) -
FastPose-ViT: A Vision Transformer for Real-Time Spacecraft Pose Estimation
di: Ancey, Pierre, et al.
Pubblicazione: (2025) -
ViT Registers and Fractal ViT
di: Chou, Jason Chuan-Chih, et al.
Pubblicazione: (2026)