Enregistré dans:
| Auteurs principaux: | Jiang, Hanwen, Jiang, Zhenyu, Grauman, Kristen, Zhu, Yuke |
|---|---|
| Format: | Preprint |
| Publié: |
2022
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2212.04492 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Audio-Visual Camera Pose Estimation with Passive Scene Sounds and In-the-Wild Video
par: Adebi, Daniel, et autres
Publié: (2025)
par: Adebi, Daniel, et autres
Publié: (2025)
Learning Object State Changes in Videos: An Open-World Perspective
par: Xue, Zihui, et autres
Publié: (2023)
par: Xue, Zihui, et autres
Publié: (2023)
HieraMamba: Video Temporal Grounding via Hierarchical Anchor-Mamba Pooling
par: An, Joungbin, et autres
Publié: (2025)
par: An, Joungbin, et autres
Publié: (2025)
HOI-Swap: Swapping Objects in Videos with Hand-Object Interaction Awareness
par: Xue, Zihui, et autres
Publié: (2024)
par: Xue, Zihui, et autres
Publié: (2024)
Switch-a-View: View Selection Learned from Unlabeled In-the-wild Videos
par: Majumder, Sagnik, et autres
Publié: (2024)
par: Majumder, Sagnik, et autres
Publié: (2024)
Generic Objects as Pose Probes for Few-shot View Synthesis
par: Gao, Zhirui, et autres
Publié: (2024)
par: Gao, Zhirui, et autres
Publié: (2024)
Seeing without Pixels: Perception from Camera Trajectories
par: Xue, Zihui, et autres
Publié: (2025)
par: Xue, Zihui, et autres
Publié: (2025)
ExpertEdit: Learning Skill-Aware Motion Editing from Expert Videos
par: Somayazulu, Arjun, et autres
Publié: (2026)
par: Somayazulu, Arjun, et autres
Publié: (2026)
Learning Skill-Attributes for Transferable Assessment in Video
par: Ashutosh, Kumar, et autres
Publié: (2025)
par: Ashutosh, Kumar, et autres
Publié: (2025)
ViewBridge: Curriculum Knowledge Distillation for Activity View-Invariance Under Extreme Viewpoint Changes
par: Somayazulu, Arjun, et autres
Publié: (2025)
par: Somayazulu, Arjun, et autres
Publié: (2025)
UniversalVTG: A Universal and Lightweight Foundation Model for Video Temporal Grounding
par: An, Joungbin, et autres
Publié: (2026)
par: An, Joungbin, et autres
Publié: (2026)
MZEN: Multi-Zoom Enhanced NeRF for 3-D Reconstruction with Unknown Camera Poses
par: Park, Jong-Ik, et autres
Publié: (2025)
par: Park, Jong-Ik, et autres
Publié: (2025)
SPOC: Spatially-Progressing Object State Change Segmentation in Video
par: Mandikal, Priyanka, et autres
Publié: (2025)
par: Mandikal, Priyanka, et autres
Publié: (2025)
Category-level Object Detection, Pose Estimation and Reconstruction from Stereo Images
par: Zhang, Chuanrui, et autres
Publié: (2024)
par: Zhang, Chuanrui, et autres
Publié: (2024)
FIction: 4D Future Interaction Prediction from Video
par: Ashutosh, Kumar, et autres
Publié: (2024)
par: Ashutosh, Kumar, et autres
Publié: (2024)
Seeing the Arrow of Time in Large Multimodal Models
par: Xue, Zihui, et autres
Publié: (2025)
par: Xue, Zihui, et autres
Publié: (2025)
Don't Let the Video Speak: Audio-Contrastive Preference Optimization for Audio-Visual Language Models
par: Baid, Ami, et autres
Publié: (2026)
par: Baid, Ami, et autres
Publié: (2026)
Which Viewpoint Shows it Best? Language for Weakly Supervising View Selection in Multi-view Instructional Videos
par: Majumder, Sagnik, et autres
Publié: (2024)
par: Majumder, Sagnik, et autres
Publié: (2024)
Dense Dynamic Scene Reconstruction and Camera Pose Estimation from Multi-View Videos
par: Sun, Shuo, et autres
Publié: (2026)
par: Sun, Shuo, et autres
Publié: (2026)
A Construct-Optimize Approach to Sparse View Synthesis without Camera Pose
par: Jiang, Kaiwen, et autres
Publié: (2024)
par: Jiang, Kaiwen, et autres
Publié: (2024)
Beyond 'Templates': Category-Agnostic Object Pose, Size, and Shape Estimation from a Single View
par: Zhang, Jinyu, et autres
Publié: (2025)
par: Zhang, Jinyu, et autres
Publié: (2025)
SkillSight: Efficient First-Person Skill Assessment with Gaze
par: Wu, Chi Hsuan, et autres
Publié: (2025)
par: Wu, Chi Hsuan, et autres
Publié: (2025)
EgoExo-WM: Unlocking Exo Video for Ego World Models
par: Tran, Danny, et autres
Publié: (2026)
par: Tran, Danny, et autres
Publié: (2026)
Progress-Aware Video Frame Captioning
par: Xue, Zihui, et autres
Publié: (2024)
par: Xue, Zihui, et autres
Publié: (2024)
Stitch-a-Demo: Video Demonstrations from Multistep Descriptions
par: Wu, Chi Hsuan, et autres
Publié: (2025)
par: Wu, Chi Hsuan, et autres
Publié: (2025)
SportSkills: Physical Skill Learning from Sports Instructional Videos
par: Ashutosh, Kumar, et autres
Publié: (2026)
par: Ashutosh, Kumar, et autres
Publié: (2026)
CleanPose: Category-Level Object Pose Estimation via Causal Learning and Knowledge Distillation
par: Lin, Xiao, et autres
Publié: (2025)
par: Lin, Xiao, et autres
Publié: (2025)
Learning a Category-level Object Pose Estimator without Pose Annotations
par: Tian, Fengrui, et autres
Publié: (2024)
par: Tian, Fengrui, et autres
Publié: (2024)
GCE-Pose: Global Context Enhancement for Category-level Object Pose Estimation
par: Li, Weihang, et autres
Publié: (2025)
par: Li, Weihang, et autres
Publié: (2025)
Learning Unknowns from Unknowns: Diversified Negative Prototypes Generator for Few-Shot Open-Set Recognition
par: Zhang, Zhenyu, et autres
Publié: (2024)
par: Zhang, Zhenyu, et autres
Publié: (2024)
Free-Moving Object Reconstruction and Pose Estimation with Virtual Camera
par: Shi, Haixin, et autres
Publié: (2024)
par: Shi, Haixin, et autres
Publié: (2024)
Put Myself in Your Shoes: Lifting the Egocentric Perspective from Exocentric Videos
par: Luo, Mi, et autres
Publié: (2024)
par: Luo, Mi, et autres
Publié: (2024)
Detours for Navigating Instructional Videos
par: Ashutosh, Kumar, et autres
Publié: (2024)
par: Ashutosh, Kumar, et autres
Publié: (2024)
Indoor 3D Reconstruction with an Unknown Camera-Projector Pair
par: Qi, Zhaoshuai, et autres
Publié: (2024)
par: Qi, Zhaoshuai, et autres
Publié: (2024)
Real3D: Scaling Up Large Reconstruction Models with Real-World Images
par: Jiang, Hanwen, et autres
Publié: (2024)
par: Jiang, Hanwen, et autres
Publié: (2024)
Marginalized Bundle Adjustment: Multi-View Camera Pose from Monocular Depth Estimates
par: Zhu, Shengjie, et autres
Publié: (2026)
par: Zhu, Shengjie, et autres
Publié: (2026)
CLIPose: Category-Level Object Pose Estimation with Pre-trained Vision-Language Knowledge
par: Lin, Xiao, et autres
Publié: (2024)
par: Lin, Xiao, et autres
Publié: (2024)
Mash, Spread, Slice! Learning to Manipulate Object States via Visual Spatial Progress
par: Mandikal, Priyanka, et autres
Publié: (2025)
par: Mandikal, Priyanka, et autres
Publié: (2025)
TSM-Pose: Topology-Aware Learning with Semantic Mamba for Category-Level Object Pose Estimation
par: Liu, Jinshuo, et autres
Publié: (2026)
par: Liu, Jinshuo, et autres
Publié: (2026)
Exploring Category-level Articulated Object Pose Tracking on SE(3) Manifolds
par: Meng, Xianhui, et autres
Publié: (2025)
par: Meng, Xianhui, et autres
Publié: (2025)
Documents similaires
-
Audio-Visual Camera Pose Estimation with Passive Scene Sounds and In-the-Wild Video
par: Adebi, Daniel, et autres
Publié: (2025) -
Learning Object State Changes in Videos: An Open-World Perspective
par: Xue, Zihui, et autres
Publié: (2023) -
HieraMamba: Video Temporal Grounding via Hierarchical Anchor-Mamba Pooling
par: An, Joungbin, et autres
Publié: (2025) -
HOI-Swap: Swapping Objects in Videos with Hand-Object Interaction Awareness
par: Xue, Zihui, et autres
Publié: (2024) -
Switch-a-View: View Selection Learned from Unlabeled In-the-wild Videos
par: Majumder, Sagnik, et autres
Publié: (2024)