Salvato in:
| Autori principali: | Ashutosh, Kumar, Wang, XuDong, Yin, Xi, Grauman, Kristen, Polyak, Adam, Misra, Ishan, Girdhar, Rohit |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2601.14037 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SoundingActions: Learning How Actions Sound from Narrated Egocentric Videos
di: Chen, Changan, et al.
Pubblicazione: (2024)
di: Chen, Changan, et al.
Pubblicazione: (2024)
LLMs can see and hear without any training
di: Ashutosh, Kumar, et al.
Pubblicazione: (2025)
di: Ashutosh, Kumar, et al.
Pubblicazione: (2025)
Learning Skill-Attributes for Transferable Assessment in Video
di: Ashutosh, Kumar, et al.
Pubblicazione: (2025)
di: Ashutosh, Kumar, et al.
Pubblicazione: (2025)
Generating Illustrated Instructions
di: Menon, Sachit, et al.
Pubblicazione: (2023)
di: Menon, Sachit, et al.
Pubblicazione: (2023)
FIction: 4D Future Interaction Prediction from Video
di: Ashutosh, Kumar, et al.
Pubblicazione: (2024)
di: Ashutosh, Kumar, et al.
Pubblicazione: (2024)
Learning Object State Changes in Videos: An Open-World Perspective
di: Xue, Zihui, et al.
Pubblicazione: (2023)
di: Xue, Zihui, et al.
Pubblicazione: (2023)
SkillSight: Efficient First-Person Skill Assessment with Gaze
di: Wu, Chi Hsuan, et al.
Pubblicazione: (2025)
di: Wu, Chi Hsuan, et al.
Pubblicazione: (2025)
Stitch-a-Demo: Video Demonstrations from Multistep Descriptions
di: Wu, Chi Hsuan, et al.
Pubblicazione: (2025)
di: Wu, Chi Hsuan, et al.
Pubblicazione: (2025)
SportSkills: Physical Skill Learning from Sports Instructional Videos
di: Ashutosh, Kumar, et al.
Pubblicazione: (2026)
di: Ashutosh, Kumar, et al.
Pubblicazione: (2026)
Diffusion Autoencoders are Scalable Image Tokenizers
di: Chen, Yinbo, et al.
Pubblicazione: (2025)
di: Chen, Yinbo, et al.
Pubblicazione: (2025)
InstanceDiffusion: Instance-level Control for Image Generation
di: Wang, Xudong, et al.
Pubblicazione: (2024)
di: Wang, Xudong, et al.
Pubblicazione: (2024)
Detours for Navigating Instructional Videos
di: Ashutosh, Kumar, et al.
Pubblicazione: (2024)
di: Ashutosh, Kumar, et al.
Pubblicazione: (2024)
Toward Diffusible High-Dimensional Latent Spaces: A Frequency Perspective
di: Lai, Bolin, et al.
Pubblicazione: (2025)
di: Lai, Bolin, et al.
Pubblicazione: (2025)
ExpertAF: Expert Actionable Feedback from Video
di: Ashutosh, Kumar, et al.
Pubblicazione: (2024)
di: Ashutosh, Kumar, et al.
Pubblicazione: (2024)
Human Action Anticipation: A Survey
di: Lai, Bolin, et al.
Pubblicazione: (2024)
di: Lai, Bolin, et al.
Pubblicazione: (2024)
HieraMamba: Video Temporal Grounding via Hierarchical Anchor-Mamba Pooling
di: An, Joungbin, et al.
Pubblicazione: (2025)
di: An, Joungbin, et al.
Pubblicazione: (2025)
ExpertEdit: Learning Skill-Aware Motion Editing from Expert Videos
di: Somayazulu, Arjun, et al.
Pubblicazione: (2026)
di: Somayazulu, Arjun, et al.
Pubblicazione: (2026)
Vid2Coach: Transforming How-To Videos into Task Assistants
di: Huh, Mina, et al.
Pubblicazione: (2025)
di: Huh, Mina, et al.
Pubblicazione: (2025)
Emu Video: Factorizing Text-to-Video Generation by Explicit Image Conditioning
di: Girdhar, Rohit, et al.
Pubblicazione: (2023)
di: Girdhar, Rohit, et al.
Pubblicazione: (2023)
UniversalVTG: A Universal and Lightweight Foundation Model for Video Temporal Grounding
di: An, Joungbin, et al.
Pubblicazione: (2026)
di: An, Joungbin, et al.
Pubblicazione: (2026)
MotiF: Making Text Count in Image Animation with Motion Focal Loss
di: Wang, Shijie, et al.
Pubblicazione: (2024)
di: Wang, Shijie, et al.
Pubblicazione: (2024)
Seeing the Arrow of Time in Large Multimodal Models
di: Xue, Zihui, et al.
Pubblicazione: (2025)
di: Xue, Zihui, et al.
Pubblicazione: (2025)
Audio-Visual Camera Pose Estimation with Passive Scene Sounds and In-the-Wild Video
di: Adebi, Daniel, et al.
Pubblicazione: (2025)
di: Adebi, Daniel, et al.
Pubblicazione: (2025)
Don't Let the Video Speak: Audio-Contrastive Preference Optimization for Audio-Visual Language Models
di: Baid, Ami, et al.
Pubblicazione: (2026)
di: Baid, Ami, et al.
Pubblicazione: (2026)
SelfEval: Leveraging the discriminative nature of generative models for evaluation
di: Rambhatla, Sai Saketh, et al.
Pubblicazione: (2023)
di: Rambhatla, Sai Saketh, et al.
Pubblicazione: (2023)
Segment Anything without Supervision
di: Wang, XuDong, et al.
Pubblicazione: (2024)
di: Wang, XuDong, et al.
Pubblicazione: (2024)
EgoExo-WM: Unlocking Exo Video for Ego World Models
di: Tran, Danny, et al.
Pubblicazione: (2026)
di: Tran, Danny, et al.
Pubblicazione: (2026)
Progress-Aware Video Frame Captioning
di: Xue, Zihui, et al.
Pubblicazione: (2024)
di: Xue, Zihui, et al.
Pubblicazione: (2024)
Generating Multi-Image Synthetic Data for Text-to-Image Customization
di: Kumari, Nupur, et al.
Pubblicazione: (2025)
di: Kumari, Nupur, et al.
Pubblicazione: (2025)
HOI-Swap: Swapping Objects in Videos with Hand-Object Interaction Awareness
di: Xue, Zihui, et al.
Pubblicazione: (2024)
di: Xue, Zihui, et al.
Pubblicazione: (2024)
Put Myself in Your Shoes: Lifting the Egocentric Perspective from Exocentric Videos
di: Luo, Mi, et al.
Pubblicazione: (2024)
di: Luo, Mi, et al.
Pubblicazione: (2024)
Few-View Object Reconstruction with Unknown Categories and Camera Poses
di: Jiang, Hanwen, et al.
Pubblicazione: (2022)
di: Jiang, Hanwen, et al.
Pubblicazione: (2022)
UnSAMv2: Self-Supervised Learning Enables Segment Anything at Any Granularity
di: Yu, Junwei, et al.
Pubblicazione: (2025)
di: Yu, Junwei, et al.
Pubblicazione: (2025)
MistExit: Learning to Exit for Early Mistake Detection in Procedural Videos
di: Majumder, Sagnik, et al.
Pubblicazione: (2026)
di: Majumder, Sagnik, et al.
Pubblicazione: (2026)
Switch-a-View: View Selection Learned from Unlabeled In-the-wild Videos
di: Majumder, Sagnik, et al.
Pubblicazione: (2024)
di: Majumder, Sagnik, et al.
Pubblicazione: (2024)
Perceptual Piercing: Human Visual Cue-based Object Detection in Low Visibility Conditions
di: Kumar, Ashutosh
Pubblicazione: (2024)
di: Kumar, Ashutosh
Pubblicazione: (2024)
When Thinking Drifts: Evidential Grounding for Robust Video Reasoning
di: Luo, Mi, et al.
Pubblicazione: (2025)
di: Luo, Mi, et al.
Pubblicazione: (2025)
Shapes as Product Differentiation: Neural Network Embedding in the Analysis of Markets for Fonts
di: Han, Sukjin, et al.
Pubblicazione: (2021)
di: Han, Sukjin, et al.
Pubblicazione: (2021)
Personal Visual Context Learning in Large Multimodal Models
di: Xue, Zihui, et al.
Pubblicazione: (2026)
di: Xue, Zihui, et al.
Pubblicazione: (2026)
ViewBridge: Curriculum Knowledge Distillation for Activity View-Invariance Under Extreme Viewpoint Changes
di: Somayazulu, Arjun, et al.
Pubblicazione: (2025)
di: Somayazulu, Arjun, et al.
Pubblicazione: (2025)
Documenti analoghi
-
SoundingActions: Learning How Actions Sound from Narrated Egocentric Videos
di: Chen, Changan, et al.
Pubblicazione: (2024) -
LLMs can see and hear without any training
di: Ashutosh, Kumar, et al.
Pubblicazione: (2025) -
Learning Skill-Attributes for Transferable Assessment in Video
di: Ashutosh, Kumar, et al.
Pubblicazione: (2025) -
Generating Illustrated Instructions
di: Menon, Sachit, et al.
Pubblicazione: (2023) -
FIction: 4D Future Interaction Prediction from Video
di: Ashutosh, Kumar, et al.
Pubblicazione: (2024)