PAWS: Perception of Articulation in the Wild at Scale from Egocentric Videos
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Yihao, Miao, Yang, Zhao, Wenshuai, Yang, Wenyan, Wang, Zihan, Pajarinen, Joni, Van Gool, Luc, Paudel, Danda Pani, Kannala, Juho, Wang, Xi, Solin, Arno |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Smoothing Slot Attention Iterations and Recurrences
di: Zhao, Rongzhen, et al.
Pubblicazione: (2025)
di: Zhao, Rongzhen, et al.
Pubblicazione: (2025)
Articulate3D: Holistic Understanding of 3D Scenes as Universal Scene Description
di: Halacheva, Anna-Maria, et al.
Pubblicazione: (2024)
di: Halacheva, Anna-Maria, et al.
Pubblicazione: (2024)
Sparsely Supervised Diffusion
di: Zhao, Wenshuai, et al.
Pubblicazione: (2026)
di: Zhao, Wenshuai, et al.
Pubblicazione: (2026)
Optimistic Multi-Agent Policy Gradient
di: Zhao, Wenshuai, et al.
Pubblicazione: (2023)
di: Zhao, Wenshuai, et al.
Pubblicazione: (2023)
Latent-Compressed Variational Autoencoder for Video Diffusion Models
di: Guan, Jiarui, et al.
Pubblicazione: (2026)
di: Guan, Jiarui, et al.
Pubblicazione: (2026)
Lego: Learning to Disentangle and Invert Personalized Concepts Beyond Object Appearance in Text-to-Image Diffusion Models
di: Motamed, Saman, et al.
Pubblicazione: (2023)
di: Motamed, Saman, et al.
Pubblicazione: (2023)
Autonomous Vehicle Controllers From End-to-End Differentiable Simulation
di: Nachkov, Asen, et al.
Pubblicazione: (2024)
di: Nachkov, Asen, et al.
Pubblicazione: (2024)
EvenNICER-SLAM: Event-based Neural Implicit Encoding SLAM
di: Chen, Shi, et al.
Pubblicazione: (2024)
di: Chen, Shi, et al.
Pubblicazione: (2024)
Multi-Scale Fusion for Object Representation
di: Zhao, Rongzhen, et al.
Pubblicazione: (2024)
di: Zhao, Rongzhen, et al.
Pubblicazione: (2024)
Grouped Discrete Representation for Object-Centric Learning
di: Zhao, Rongzhen, et al.
Pubblicazione: (2024)
di: Zhao, Rongzhen, et al.
Pubblicazione: (2024)
Vector-Quantized Vision Foundation Models for Object-Centric Learning
di: Zhao, Rongzhen, et al.
Pubblicazione: (2025)
di: Zhao, Rongzhen, et al.
Pubblicazione: (2025)
Organized Grouped Discrete Representation for Object-Centric Learning
di: Zhao, Rongzhen, et al.
Pubblicazione: (2024)
di: Zhao, Rongzhen, et al.
Pubblicazione: (2024)
Grouped Discrete Representation Guides Object-Centric Learning
di: Zhao, Rongzhen, et al.
Pubblicazione: (2024)
di: Zhao, Rongzhen, et al.
Pubblicazione: (2024)
LangHOPS: Language Grounded Hierarchical Open-Vocabulary Part Segmentation
di: Miao, Yang, et al.
Pubblicazione: (2025)
di: Miao, Yang, et al.
Pubblicazione: (2025)
Efficient Reinforcement Learning by Guiding Generalist World Models with Non-Curated Data
di: Zhao, Yi, et al.
Pubblicazione: (2025)
di: Zhao, Yi, et al.
Pubblicazione: (2025)
DeSplat: Decomposed Gaussian Splatting for Distractor-Free Rendering
di: Wang, Yihao, et al.
Pubblicazione: (2024)
di: Wang, Yihao, et al.
Pubblicazione: (2024)
Exo2EgoSyn: Unlocking Foundation Video Generation Models for Exocentric-to-Egocentric Video Synthesis
di: Mahdi, Mohammad, et al.
Pubblicazione: (2025)
di: Mahdi, Mohammad, et al.
Pubblicazione: (2025)
Autonomous Vehicle Path Planning by Searching With Differentiable Simulation
di: Nachkov, Asen, et al.
Pubblicazione: (2025)
di: Nachkov, Asen, et al.
Pubblicazione: (2025)
Predicting Video Slot Attention Queries from Random Slot-Feature Pairs
di: Zhao, Rongzhen, et al.
Pubblicazione: (2025)
di: Zhao, Rongzhen, et al.
Pubblicazione: (2025)
Internalizing Temporal Consistency in Video Object-Centric Learning without Explicit Regularization
di: Zhao, Rongzhen, et al.
Pubblicazione: (2026)
di: Zhao, Rongzhen, et al.
Pubblicazione: (2026)
Slot Attention with Re-Initialization and Self-Distillation
di: Zhao, Rongzhen, et al.
Pubblicazione: (2025)
di: Zhao, Rongzhen, et al.
Pubblicazione: (2025)
Reachability Weighted Offline Goal-conditioned Resampling
di: Yang, Wenyan, et al.
Pubblicazione: (2025)
di: Yang, Wenyan, et al.
Pubblicazione: (2025)
Point Tracking Improves World Action Models
di: Guan, Jiarui, et al.
Pubblicazione: (2026)
di: Guan, Jiarui, et al.
Pubblicazione: (2026)
Implicit-Zoo: A Large-Scale Dataset of Neural Implicit Functions for 2D Images and 3D Scenes
di: Ma, Qi, et al.
Pubblicazione: (2024)
di: Ma, Qi, et al.
Pubblicazione: (2024)
Continuous Pose for Monocular Cameras in Neural Implicit Representation
di: Ma, Qi, et al.
Pubblicazione: (2023)
di: Ma, Qi, et al.
Pubblicazione: (2023)
From Synchrony to Sequence: Exo-to-Ego Generation via Interpolation
di: Mahdi, Mohammad, et al.
Pubblicazione: (2026)
di: Mahdi, Mohammad, et al.
Pubblicazione: (2026)
Vision encoders should be image size agnostic and task driven
di: Prisadnikov, Nedyalko, et al.
Pubblicazione: (2025)
di: Prisadnikov, Nedyalko, et al.
Pubblicazione: (2025)
Self-supervised pretraining for an iterative image size agnostic vision transformer
di: Prisadnikov, Nedyalko, et al.
Pubblicazione: (2026)
di: Prisadnikov, Nedyalko, et al.
Pubblicazione: (2026)
A Simple and Generalist Approach for Panoptic Segmentation
di: Prisadnikov, Nedyalko, et al.
Pubblicazione: (2024)
di: Prisadnikov, Nedyalko, et al.
Pubblicazione: (2024)
Sources of Uncertainty in 3D Scene Reconstruction
di: Klasson, Marcus, et al.
Pubblicazione: (2024)
di: Klasson, Marcus, et al.
Pubblicazione: (2024)
Cross-View Multi-Modal Segmentation @ Ego-Exo4D Challenges 2025
di: Fu, Yuqian, et al.
Pubblicazione: (2025)
di: Fu, Yuqian, et al.
Pubblicazione: (2025)
Exploration-Driven Generative Interactive Environments
di: Savov, Nedko, et al.
Pubblicazione: (2025)
di: Savov, Nedko, et al.
Pubblicazione: (2025)
GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond
di: Halacheva, Anna-Maria, et al.
Pubblicazione: (2025)
di: Halacheva, Anna-Maria, et al.
Pubblicazione: (2025)
StateSpaceDiffuser: Bringing Long Context to Diffusion World Models
di: Savov, Nedko, et al.
Pubblicazione: (2025)
di: Savov, Nedko, et al.
Pubblicazione: (2025)
Inferring Compositional 4D Scenes without Ever Seeing One
di: Gokmen, Ahmet Berke, et al.
Pubblicazione: (2025)
di: Gokmen, Ahmet Berke, et al.
Pubblicazione: (2025)
Taming CLIP for Fine-grained and Structured Visual Understanding of Museum Exhibits
di: Balauca, Ada-Astrid, et al.
Pubblicazione: (2024)
di: Balauca, Ada-Astrid, et al.
Pubblicazione: (2024)
RICO: Two Realistic Benchmarks and an In-Depth Analysis for Incremental Learning in Object Detection
di: Neuwirth-Trapp, Matthias, et al.
Pubblicazione: (2025)
di: Neuwirth-Trapp, Matthias, et al.
Pubblicazione: (2025)
Incremental Object Detection with Prompt-based Methods
di: Neuwirth-Trapp, Matthias, et al.
Pubblicazione: (2025)
di: Neuwirth-Trapp, Matthias, et al.
Pubblicazione: (2025)
Occam's LGS: An Efficient Approach for Language Gaussian Splatting
di: Cheng, Jiahuan, et al.
Pubblicazione: (2024)
di: Cheng, Jiahuan, et al.
Pubblicazione: (2024)
EgoCross: Benchmarking Multimodal Large Language Models for Cross-Domain Egocentric Video Question Answering
di: Li, Yanjun, et al.
Pubblicazione: (2025)
di: Li, Yanjun, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Smoothing Slot Attention Iterations and Recurrences
di: Zhao, Rongzhen, et al.
Pubblicazione: (2025) -
Articulate3D: Holistic Understanding of 3D Scenes as Universal Scene Description
di: Halacheva, Anna-Maria, et al.
Pubblicazione: (2024) -
Sparsely Supervised Diffusion
di: Zhao, Wenshuai, et al.
Pubblicazione: (2026) -
Optimistic Multi-Agent Policy Gradient
di: Zhao, Wenshuai, et al.
Pubblicazione: (2023) -
Latent-Compressed Variational Autoencoder for Video Diffusion Models
di: Guan, Jiarui, et al.
Pubblicazione: (2026)