ExpertAF: Expert Actionable Feedback from Video
Fuente:
arXiv
Salvato in:
| Autori principali: | Ashutosh, Kumar, Nagarajan, Tushar, Pavlakos, Georgios, Kitani, Kris, Grauman, Kristen |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
FIction: 4D Future Interaction Prediction from Video
di: Ashutosh, Kumar, et al.
Pubblicazione: (2024)
di: Ashutosh, Kumar, et al.
Pubblicazione: (2024)
Detours for Navigating Instructional Videos
di: Ashutosh, Kumar, et al.
Pubblicazione: (2024)
di: Ashutosh, Kumar, et al.
Pubblicazione: (2024)
ExpertEdit: Learning Skill-Aware Motion Editing from Expert Videos
di: Somayazulu, Arjun, et al.
Pubblicazione: (2026)
di: Somayazulu, Arjun, et al.
Pubblicazione: (2026)
Learning Skill-Attributes for Transferable Assessment in Video
di: Ashutosh, Kumar, et al.
Pubblicazione: (2025)
di: Ashutosh, Kumar, et al.
Pubblicazione: (2025)
Switch-a-View: View Selection Learned from Unlabeled In-the-wild Videos
di: Majumder, Sagnik, et al.
Pubblicazione: (2024)
di: Majumder, Sagnik, et al.
Pubblicazione: (2024)
Learning Object State Changes in Videos: An Open-World Perspective
di: Xue, Zihui, et al.
Pubblicazione: (2023)
di: Xue, Zihui, et al.
Pubblicazione: (2023)
SPOC: Spatially-Progressing Object State Change Segmentation in Video
di: Mandikal, Priyanka, et al.
Pubblicazione: (2025)
di: Mandikal, Priyanka, et al.
Pubblicazione: (2025)
Stitch-a-Demo: Video Demonstrations from Multistep Descriptions
di: Wu, Chi Hsuan, et al.
Pubblicazione: (2025)
di: Wu, Chi Hsuan, et al.
Pubblicazione: (2025)
SportSkills: Physical Skill Learning from Sports Instructional Videos
di: Ashutosh, Kumar, et al.
Pubblicazione: (2026)
di: Ashutosh, Kumar, et al.
Pubblicazione: (2026)
Which Viewpoint Shows it Best? Language for Weakly Supervising View Selection in Multi-view Instructional Videos
di: Majumder, Sagnik, et al.
Pubblicazione: (2024)
di: Majumder, Sagnik, et al.
Pubblicazione: (2024)
SkillSight: Efficient First-Person Skill Assessment with Gaze
di: Wu, Chi Hsuan, et al.
Pubblicazione: (2025)
di: Wu, Chi Hsuan, et al.
Pubblicazione: (2025)
Human Action Anticipation: A Survey
di: Lai, Bolin, et al.
Pubblicazione: (2024)
di: Lai, Bolin, et al.
Pubblicazione: (2024)
Propose, Assess, Search: Harnessing LLMs for Goal-Oriented Planning in Instructional Videos
di: Islam, Md Mohaiminul, et al.
Pubblicazione: (2024)
di: Islam, Md Mohaiminul, et al.
Pubblicazione: (2024)
HieraMamba: Video Temporal Grounding via Hierarchical Anchor-Mamba Pooling
di: An, Joungbin, et al.
Pubblicazione: (2025)
di: An, Joungbin, et al.
Pubblicazione: (2025)
Unlocking Exocentric Video-Language Data for Egocentric Video Representation Learning
di: Dou, Zi-Yi, et al.
Pubblicazione: (2024)
di: Dou, Zi-Yi, et al.
Pubblicazione: (2024)
UniversalVTG: A Universal and Lightweight Foundation Model for Video Temporal Grounding
di: An, Joungbin, et al.
Pubblicazione: (2026)
di: An, Joungbin, et al.
Pubblicazione: (2026)
Step Differences in Instructional Video
di: Nagarajan, Tushar, et al.
Pubblicazione: (2024)
di: Nagarajan, Tushar, et al.
Pubblicazione: (2024)
Vid2Coach: Transforming How-To Videos into Task Assistants
di: Huh, Mina, et al.
Pubblicazione: (2025)
di: Huh, Mina, et al.
Pubblicazione: (2025)
SoundingActions: Learning How Actions Sound from Narrated Egocentric Videos
di: Chen, Changan, et al.
Pubblicazione: (2024)
di: Chen, Changan, et al.
Pubblicazione: (2024)
Reconstructing Hand-Held Objects in 3D from Images and Videos
di: Wu, Jane, et al.
Pubblicazione: (2024)
di: Wu, Jane, et al.
Pubblicazione: (2024)
Audio-Visual Camera Pose Estimation with Passive Scene Sounds and In-the-Wild Video
di: Adebi, Daniel, et al.
Pubblicazione: (2025)
di: Adebi, Daniel, et al.
Pubblicazione: (2025)
Don't Let the Video Speak: Audio-Contrastive Preference Optimization for Audio-Visual Language Models
di: Baid, Ami, et al.
Pubblicazione: (2026)
di: Baid, Ami, et al.
Pubblicazione: (2026)
Progress-Aware Video Frame Captioning
di: Xue, Zihui, et al.
Pubblicazione: (2024)
di: Xue, Zihui, et al.
Pubblicazione: (2024)
EgoExo-WM: Unlocking Exo Video for Ego World Models
di: Tran, Danny, et al.
Pubblicazione: (2026)
di: Tran, Danny, et al.
Pubblicazione: (2026)
Put Myself in Your Shoes: Lifting the Egocentric Perspective from Exocentric Videos
di: Luo, Mi, et al.
Pubblicazione: (2024)
di: Luo, Mi, et al.
Pubblicazione: (2024)
Multi-Object Tracking by Hierarchical Visual Representations
di: Cao, Jinkun, et al.
Pubblicazione: (2024)
di: Cao, Jinkun, et al.
Pubblicazione: (2024)
HOI-Swap: Swapping Objects in Videos with Hand-Object Interaction Awareness
di: Xue, Zihui, et al.
Pubblicazione: (2024)
di: Xue, Zihui, et al.
Pubblicazione: (2024)
Real3D: Scaling Up Large Reconstruction Models with Real-World Images
di: Jiang, Hanwen, et al.
Pubblicazione: (2024)
di: Jiang, Hanwen, et al.
Pubblicazione: (2024)
AesRM: Improving Video Aesthetics with Expert-Level Feedback
di: Han, Yujin, et al.
Pubblicazione: (2026)
di: Han, Yujin, et al.
Pubblicazione: (2026)
MistExit: Learning to Exit for Early Mistake Detection in Procedural Videos
di: Majumder, Sagnik, et al.
Pubblicazione: (2026)
di: Majumder, Sagnik, et al.
Pubblicazione: (2026)
Harmony4D: A Video Dataset for In-The-Wild Close Human Interactions
di: Khirodkar, Rawal, et al.
Pubblicazione: (2024)
di: Khirodkar, Rawal, et al.
Pubblicazione: (2024)
Human detectors are surprisingly powerful reward models
di: Ashutosh, Kumar, et al.
Pubblicazione: (2026)
di: Ashutosh, Kumar, et al.
Pubblicazione: (2026)
Seeing the Arrow of Time in Large Multimodal Models
di: Xue, Zihui, et al.
Pubblicazione: (2025)
di: Xue, Zihui, et al.
Pubblicazione: (2025)
TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding
di: Yang, Zuhao, et al.
Pubblicazione: (2025)
di: Yang, Zuhao, et al.
Pubblicazione: (2025)
Natural Human Motion Recovery by Aligning High-Order Temporal Dynamics from Monocular Videos
di: Wei, Dingkun, et al.
Pubblicazione: (2026)
di: Wei, Dingkun, et al.
Pubblicazione: (2026)
G-HOP: Generative Hand-Object Prior for Interaction Reconstruction and Grasp Synthesis
di: Ye, Yufei, et al.
Pubblicazione: (2024)
di: Ye, Yufei, et al.
Pubblicazione: (2024)
Joint Diffusion for Universal Hand-Object Grasp Generation
di: Cao, Jinkun, et al.
Pubblicazione: (2024)
di: Cao, Jinkun, et al.
Pubblicazione: (2024)
CacheFlow: Fast Human Motion Prediction by Cached Normalizing Flow
di: Maeda, Takahiro, et al.
Pubblicazione: (2025)
di: Maeda, Takahiro, et al.
Pubblicazione: (2025)
When Thinking Drifts: Evidential Grounding for Robust Video Reasoning
di: Luo, Mi, et al.
Pubblicazione: (2025)
di: Luo, Mi, et al.
Pubblicazione: (2025)
Learning Spatial Features from Audio-Visual Correspondence in Egocentric Videos
di: Majumder, Sagnik, et al.
Pubblicazione: (2023)
di: Majumder, Sagnik, et al.
Pubblicazione: (2023)
Documenti analoghi
-
FIction: 4D Future Interaction Prediction from Video
di: Ashutosh, Kumar, et al.
Pubblicazione: (2024) -
Detours for Navigating Instructional Videos
di: Ashutosh, Kumar, et al.
Pubblicazione: (2024) -
ExpertEdit: Learning Skill-Aware Motion Editing from Expert Videos
di: Somayazulu, Arjun, et al.
Pubblicazione: (2026) -
Learning Skill-Attributes for Transferable Assessment in Video
di: Ashutosh, Kumar, et al.
Pubblicazione: (2025) -
Switch-a-View: View Selection Learned from Unlabeled In-the-wild Videos
di: Majumder, Sagnik, et al.
Pubblicazione: (2024)