Stitch-a-Demo: Video Demonstrations from Multistep Descriptions
Fuente:
arXiv
Salvato in:
| Autori principali: | Wu, Chi Hsuan, Ashutosh, Kumar, Grauman, Kristen |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SportSkills: Physical Skill Learning from Sports Instructional Videos
di: Ashutosh, Kumar, et al.
Pubblicazione: (2026)
di: Ashutosh, Kumar, et al.
Pubblicazione: (2026)
SkillSight: Efficient First-Person Skill Assessment with Gaze
di: Wu, Chi Hsuan, et al.
Pubblicazione: (2025)
di: Wu, Chi Hsuan, et al.
Pubblicazione: (2025)
Learning Skill-Attributes for Transferable Assessment in Video
di: Ashutosh, Kumar, et al.
Pubblicazione: (2025)
di: Ashutosh, Kumar, et al.
Pubblicazione: (2025)
FIction: 4D Future Interaction Prediction from Video
di: Ashutosh, Kumar, et al.
Pubblicazione: (2024)
di: Ashutosh, Kumar, et al.
Pubblicazione: (2024)
Learning Object State Changes in Videos: An Open-World Perspective
di: Xue, Zihui, et al.
Pubblicazione: (2023)
di: Xue, Zihui, et al.
Pubblicazione: (2023)
Detours for Navigating Instructional Videos
di: Ashutosh, Kumar, et al.
Pubblicazione: (2024)
di: Ashutosh, Kumar, et al.
Pubblicazione: (2024)
ExpertAF: Expert Actionable Feedback from Video
di: Ashutosh, Kumar, et al.
Pubblicazione: (2024)
di: Ashutosh, Kumar, et al.
Pubblicazione: (2024)
HieraMamba: Video Temporal Grounding via Hierarchical Anchor-Mamba Pooling
di: An, Joungbin, et al.
Pubblicazione: (2025)
di: An, Joungbin, et al.
Pubblicazione: (2025)
ExpertEdit: Learning Skill-Aware Motion Editing from Expert Videos
di: Somayazulu, Arjun, et al.
Pubblicazione: (2026)
di: Somayazulu, Arjun, et al.
Pubblicazione: (2026)
UniversalVTG: A Universal and Lightweight Foundation Model for Video Temporal Grounding
di: An, Joungbin, et al.
Pubblicazione: (2026)
di: An, Joungbin, et al.
Pubblicazione: (2026)
Vid2Coach: Transforming How-To Videos into Task Assistants
di: Huh, Mina, et al.
Pubblicazione: (2025)
di: Huh, Mina, et al.
Pubblicazione: (2025)
SoundingActions: Learning How Actions Sound from Narrated Egocentric Videos
di: Chen, Changan, et al.
Pubblicazione: (2024)
di: Chen, Changan, et al.
Pubblicazione: (2024)
Audio-Visual Camera Pose Estimation with Passive Scene Sounds and In-the-Wild Video
di: Adebi, Daniel, et al.
Pubblicazione: (2025)
di: Adebi, Daniel, et al.
Pubblicazione: (2025)
Don't Let the Video Speak: Audio-Contrastive Preference Optimization for Audio-Visual Language Models
di: Baid, Ami, et al.
Pubblicazione: (2026)
di: Baid, Ami, et al.
Pubblicazione: (2026)
Progress-Aware Video Frame Captioning
di: Xue, Zihui, et al.
Pubblicazione: (2024)
di: Xue, Zihui, et al.
Pubblicazione: (2024)
EgoExo-WM: Unlocking Exo Video for Ego World Models
di: Tran, Danny, et al.
Pubblicazione: (2026)
di: Tran, Danny, et al.
Pubblicazione: (2026)
Put Myself in Your Shoes: Lifting the Egocentric Perspective from Exocentric Videos
di: Luo, Mi, et al.
Pubblicazione: (2024)
di: Luo, Mi, et al.
Pubblicazione: (2024)
Switch-a-View: View Selection Learned from Unlabeled In-the-wild Videos
di: Majumder, Sagnik, et al.
Pubblicazione: (2024)
di: Majumder, Sagnik, et al.
Pubblicazione: (2024)
HOI-Swap: Swapping Objects in Videos with Hand-Object Interaction Awareness
di: Xue, Zihui, et al.
Pubblicazione: (2024)
di: Xue, Zihui, et al.
Pubblicazione: (2024)
MistExit: Learning to Exit for Early Mistake Detection in Procedural Videos
di: Majumder, Sagnik, et al.
Pubblicazione: (2026)
di: Majumder, Sagnik, et al.
Pubblicazione: (2026)
Human detectors are surprisingly powerful reward models
di: Ashutosh, Kumar, et al.
Pubblicazione: (2026)
di: Ashutosh, Kumar, et al.
Pubblicazione: (2026)
SPOC: Spatially-Progressing Object State Change Segmentation in Video
di: Mandikal, Priyanka, et al.
Pubblicazione: (2025)
di: Mandikal, Priyanka, et al.
Pubblicazione: (2025)
Seeing the Arrow of Time in Large Multimodal Models
di: Xue, Zihui, et al.
Pubblicazione: (2025)
di: Xue, Zihui, et al.
Pubblicazione: (2025)
When Thinking Drifts: Evidential Grounding for Robust Video Reasoning
di: Luo, Mi, et al.
Pubblicazione: (2025)
di: Luo, Mi, et al.
Pubblicazione: (2025)
Learning Spatial Features from Audio-Visual Correspondence in Egocentric Videos
di: Majumder, Sagnik, et al.
Pubblicazione: (2023)
di: Majumder, Sagnik, et al.
Pubblicazione: (2023)
Which Viewpoint Shows it Best? Language for Weakly Supervising View Selection in Multi-view Instructional Videos
di: Majumder, Sagnik, et al.
Pubblicazione: (2024)
di: Majumder, Sagnik, et al.
Pubblicazione: (2024)
MINT-Demo: Membership Inference Test Demonstrator
di: DeAlcala, Daniel, et al.
Pubblicazione: (2025)
di: DeAlcala, Daniel, et al.
Pubblicazione: (2025)
Few-View Object Reconstruction with Unknown Categories and Camera Poses
di: Jiang, Hanwen, et al.
Pubblicazione: (2022)
di: Jiang, Hanwen, et al.
Pubblicazione: (2022)
Seeing without Pixels: Perception from Camera Trajectories
di: Xue, Zihui, et al.
Pubblicazione: (2025)
di: Xue, Zihui, et al.
Pubblicazione: (2025)
CyberDemo: Augmenting Simulated Human Demonstration for Real-World Dexterous Manipulation
di: Wang, Jun, et al.
Pubblicazione: (2024)
di: Wang, Jun, et al.
Pubblicazione: (2024)
ViewBridge: Curriculum Knowledge Distillation for Activity View-Invariance Under Extreme Viewpoint Changes
di: Somayazulu, Arjun, et al.
Pubblicazione: (2025)
di: Somayazulu, Arjun, et al.
Pubblicazione: (2025)
Personal Visual Context Learning in Large Multimodal Models
di: Xue, Zihui, et al.
Pubblicazione: (2026)
di: Xue, Zihui, et al.
Pubblicazione: (2026)
StabStitch++: Unsupervised Online Video Stitching with Spatiotemporal Bidirectional Warps
di: Nie, Lang, et al.
Pubblicazione: (2025)
di: Nie, Lang, et al.
Pubblicazione: (2025)
Demo-ICL: In-Context Learning for Procedural Video Knowledge Acquisition
di: Dong, Yuhao, et al.
Pubblicazione: (2026)
di: Dong, Yuhao, et al.
Pubblicazione: (2026)
Shapes as Product Differentiation: Neural Network Embedding in the Analysis of Markets for Fonts
di: Han, Sukjin, et al.
Pubblicazione: (2021)
di: Han, Sukjin, et al.
Pubblicazione: (2021)
Eliminating Warping Shakes for Unsupervised Online Video Stitching
di: Nie, Lang, et al.
Pubblicazione: (2024)
di: Nie, Lang, et al.
Pubblicazione: (2024)
Video Self-Stitching Graph Network for Temporal Action Localization
di: Zhao, Chen, et al.
Pubblicazione: (2020)
di: Zhao, Chen, et al.
Pubblicazione: (2020)
UniStitch: Unifying Semantic and Geometric Features for Image Stitching
di: Mei, Yuan, et al.
Pubblicazione: (2026)
di: Mei, Yuan, et al.
Pubblicazione: (2026)
DemoCaricature: Democratising Caricature Generation with a Rough Sketch
di: Chen, Dar-Yen, et al.
Pubblicazione: (2023)
di: Chen, Dar-Yen, et al.
Pubblicazione: (2023)
Perceptual Piercing: Human Visual Cue-based Object Detection in Low Visibility Conditions
di: Kumar, Ashutosh
Pubblicazione: (2024)
di: Kumar, Ashutosh
Pubblicazione: (2024)
Documenti analoghi
-
SportSkills: Physical Skill Learning from Sports Instructional Videos
di: Ashutosh, Kumar, et al.
Pubblicazione: (2026) -
SkillSight: Efficient First-Person Skill Assessment with Gaze
di: Wu, Chi Hsuan, et al.
Pubblicazione: (2025) -
Learning Skill-Attributes for Transferable Assessment in Video
di: Ashutosh, Kumar, et al.
Pubblicazione: (2025) -
FIction: 4D Future Interaction Prediction from Video
di: Ashutosh, Kumar, et al.
Pubblicazione: (2024) -
Learning Object State Changes in Videos: An Open-World Perspective
di: Xue, Zihui, et al.
Pubblicazione: (2023)