Towards Multi-Modal Animal Pose Estimation: A Survey and In-Depth Analysis
Fuente:
arXiv
Guardado en:
| Autores principales: | Deng, Qianyi, Deb, Oishi, Patel, Amir, Rupprecht, Christian, Torr, Philip, Trigoni, Niki, Markham, Andrew |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Articulate3D: Zero-Shot Text-Driven 3D Object Posing
por: Deb, Oishi, et al.
Publicado: (2025)
por: Deb, Oishi, et al.
Publicado: (2025)
Dusk Till Dawn: Self-supervised Nighttime Stereo Depth Estimation using Visual Foundation Models
por: Vankadari, Madhu, et al.
Publicado: (2024)
por: Vankadari, Madhu, et al.
Publicado: (2024)
WSCLoc: Weakly-Supervised Sparse-View Camera Relocalization
por: Wang, Jialu, et al.
Publicado: (2024)
por: Wang, Jialu, et al.
Publicado: (2024)
MambaLoc: Efficient Camera Localisation via State Space Model
por: Wang, Jialu, et al.
Publicado: (2024)
por: Wang, Jialu, et al.
Publicado: (2024)
Manydepth2: Motion-Aware Self-Supervised Monocular Depth Estimation in Dynamic Scenes
por: Zhou, Kaichen, et al.
Publicado: (2023)
por: Zhou, Kaichen, et al.
Publicado: (2023)
Spherical Mask: Coarse-to-Fine 3D Point Cloud Instance Segmentation with Spherical Representation
por: Shin, Sangyun, et al.
Publicado: (2023)
por: Shin, Sangyun, et al.
Publicado: (2023)
SoundLoc3D: Invisible 3D Sound Source Localization and Classification Using a Multimodal RGB-D Acoustic Camera
por: He, Yuhang, et al.
Publicado: (2024)
por: He, Yuhang, et al.
Publicado: (2024)
SpatialPIN: Enhancing Spatial Reasoning Capabilities of Vision-Language Models through Prompting and Interacting 3D Priors
por: Ma, Chenyang, et al.
Publicado: (2024)
por: Ma, Chenyang, et al.
Publicado: (2024)
ZeST: Zero-Shot Material Transfer from a Single Image
por: Cheng, Ta-Ying, et al.
Publicado: (2024)
por: Cheng, Ta-Ying, et al.
Publicado: (2024)
Pre-training Feature Guided Diffusion Model for Speech Enhancement
por: Yang, Yiyuan, et al.
Publicado: (2024)
por: Yang, Yiyuan, et al.
Publicado: (2024)
Data Factory with Minimal Human Effort Using VLMs
por: Ye, Jiaojiao, et al.
Publicado: (2025)
por: Ye, Jiaojiao, et al.
Publicado: (2025)
PoseDiffusion: Solving Pose Estimation via Diffusion-aided Bundle Adjustment
por: Wang, Jianyuan, et al.
Publicado: (2023)
por: Wang, Jianyuan, et al.
Publicado: (2023)
Mitigating Cognitive Bias in RLHF by Altering Rationality
por: Horter, Tiffany, et al.
Publicado: (2026)
por: Horter, Tiffany, et al.
Publicado: (2026)
Target Speaker Extraction through Comparing Noisy Positive and Negative Audio Enrollments
por: Xu, Shitong, et al.
Publicado: (2025)
por: Xu, Shitong, et al.
Publicado: (2025)
Efficient and Microphone-Fault-Tolerant 3D Sound Source Localization
por: Yang, Yiyuan, et al.
Publicado: (2025)
por: Yang, Yiyuan, et al.
Publicado: (2025)
VMLoc: Variational Fusion For Learning-Based Multimodal Camera Localization
por: Zhou, Kaichen, et al.
Publicado: (2020)
por: Zhou, Kaichen, et al.
Publicado: (2020)
Learning Continuous 3D Words for Text-to-Image Generation
por: Cheng, Ta-Ying, et al.
Publicado: (2024)
por: Cheng, Ta-Ying, et al.
Publicado: (2024)
DynPoint: Dynamic Neural Point For View Synthesis
por: Zhou, Kaichen, et al.
Publicado: (2023)
por: Zhou, Kaichen, et al.
Publicado: (2023)
WildDepth: A Multimodal Dataset for 3D Wildlife Perception and Depth Estimation
por: Aamir, Muhammad, et al.
Publicado: (2026)
por: Aamir, Muhammad, et al.
Publicado: (2026)
Scene-Conditional 3D Object Stylization and Composition
por: Zhou, Jinghao, et al.
Publicado: (2023)
por: Zhou, Jinghao, et al.
Publicado: (2023)
Multi-Modal Monocular Endoscopic Depth and Pose Estimation with Edge-Guided Self-Supervision
por: Ju, Xinwei, et al.
Publicado: (2026)
por: Ju, Xinwei, et al.
Publicado: (2026)
Gen4Gen: Generative Data Pipeline for Generative Multi-Concept Composition
por: Yeh, Chun-Hsiao, et al.
Publicado: (2024)
por: Yeh, Chun-Hsiao, et al.
Publicado: (2024)
Demo-Pose: Depth-Monocular Modality Fusion For Object Pose Estimation
por: Agarwal, Rachit, et al.
Publicado: (2026)
por: Agarwal, Rachit, et al.
Publicado: (2026)
AnimalClue: Recognizing Animals by their Traces
por: Shinoda, Risa, et al.
Publicado: (2025)
por: Shinoda, Risa, et al.
Publicado: (2025)
New keypoint-based approach for recognising British Sign Language (BSL) from sequences
por: Deb, Oishi, et al.
Publicado: (2024)
por: Deb, Oishi, et al.
Publicado: (2024)
CountGD: Multi-Modal Open-World Counting
por: Amini-Naieni, Niki, et al.
Publicado: (2024)
por: Amini-Naieni, Niki, et al.
Publicado: (2024)
DiffPose-Animal: A Language-Conditioned Diffusion Framework for Animal Pose Estimation
por: Xiong, Tianyu, et al.
Publicado: (2025)
por: Xiong, Tianyu, et al.
Publicado: (2025)
Towards Balanced Multi-Modal Learning in 3D Human Pose Estimation
por: Qi, Mengshi, et al.
Publicado: (2025)
por: Qi, Mengshi, et al.
Publicado: (2025)
COOPERA: Continual Open-Ended Human-Robot Assistance
por: Ma, Chenyang, et al.
Publicado: (2025)
por: Ma, Chenyang, et al.
Publicado: (2025)
Mushroom Segmentation and 3D Pose Estimation from Point Clouds using Fully Convolutional Geometric Features and Implicit Pose Encoding
por: Retsinas, George, et al.
Publicado: (2024)
por: Retsinas, George, et al.
Publicado: (2024)
MMP: Towards Robust Multi-Modal Learning with Masked Modality Projection
por: Nezakati, Niki, et al.
Publicado: (2024)
por: Nezakati, Niki, et al.
Publicado: (2024)
DualPM: Dual Posed-Canonical Point Maps for 3D Shape and Pose Reconstruction
por: Kaye, Ben, et al.
Publicado: (2024)
por: Kaye, Ben, et al.
Publicado: (2024)
Probabilistic Prompt Distribution Learning for Animal Pose Estimation
por: Rao, Jiyong, et al.
Publicado: (2025)
por: Rao, Jiyong, et al.
Publicado: (2025)
STEP: Simultaneous Tracking and Estimation of Pose for Animals and Humans
por: Verma, Shashikant, et al.
Publicado: (2025)
por: Verma, Shashikant, et al.
Publicado: (2025)
SPEAR: Receiver-to-Receiver Acoustic Neural Warping Field
por: He, Yuhang, et al.
Publicado: (2024)
por: He, Yuhang, et al.
Publicado: (2024)
Invisible Stitch: Generating Smooth 3D Scenes with Depth Inpainting
por: Engstler, Paul, et al.
Publicado: (2024)
por: Engstler, Paul, et al.
Publicado: (2024)
DeepInteraction++: Multi-Modality Interaction for Autonomous Driving
por: Yang, Zeyu, et al.
Publicado: (2024)
por: Yang, Zeyu, et al.
Publicado: (2024)
PTC-Depth: Pose-Refined Monocular Depth Estimation with Temporal Consistency
por: Han, Leezy, et al.
Publicado: (2026)
por: Han, Leezy, et al.
Publicado: (2026)
AnyCam: Learning to Recover Camera Poses and Intrinsics from Casual Videos
por: Wimbauer, Felix, et al.
Publicado: (2025)
por: Wimbauer, Felix, et al.
Publicado: (2025)
Farm3D: Learning Articulated 3D Animals by Distilling 2D Diffusion
por: Jakab, Tomas, et al.
Publicado: (2023)
por: Jakab, Tomas, et al.
Publicado: (2023)
Ejemplares similares
-
Articulate3D: Zero-Shot Text-Driven 3D Object Posing
por: Deb, Oishi, et al.
Publicado: (2025) -
Dusk Till Dawn: Self-supervised Nighttime Stereo Depth Estimation using Visual Foundation Models
por: Vankadari, Madhu, et al.
Publicado: (2024) -
WSCLoc: Weakly-Supervised Sparse-View Camera Relocalization
por: Wang, Jialu, et al.
Publicado: (2024) -
MambaLoc: Efficient Camera Localisation via State Space Model
por: Wang, Jialu, et al.
Publicado: (2024) -
Manydepth2: Motion-Aware Self-Supervised Monocular Depth Estimation in Dynamic Scenes
por: Zhou, Kaichen, et al.
Publicado: (2023)