SAMJAM: Zero-Shot Video Scene Graph Generation for Egocentric Kitchen Videos
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Joshua, Cantu, Fernando Jose Pena, Yu, Emily, Wong, Alexander, Cui, Yuchen, Chen, Yuhao |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Zero-Shot Object Re-Identification in Egocentric Kitchen Videos via Multi-Stage SAM3 Feature Fusion
par: Klepachevskyi, Dmytro, et autres
Publié: (2026)
par: Klepachevskyi, Dmytro, et autres
Publié: (2026)
Static Scene Reconstruction from Dynamic Egocentric Videos
par: Cui, Qifei, et autres
Publié: (2026)
par: Cui, Qifei, et autres
Publié: (2026)
FoodTrack: Estimating Handheld Food Portions with Egocentric Video
par: Wang, Ervin, et autres
Publié: (2025)
par: Wang, Ervin, et autres
Publié: (2025)
ZeroHSI: Zero-Shot 4D Human-Scene Interaction by Video Generation
par: Li, Hongjie, et autres
Publié: (2024)
par: Li, Hongjie, et autres
Publié: (2024)
Zero-Shot Temporal Interaction Localization for Egocentric Videos
par: Zhang, Erhang, et autres
Publié: (2025)
par: Zhang, Erhang, et autres
Publié: (2025)
EASG-Bench: Video Q&A Benchmark with Egocentric Action Scene Graphs
par: Rodin, Ivan, et autres
Publié: (2025)
par: Rodin, Ivan, et autres
Publié: (2025)
Scaling Zero-Shot Reference-to-Video Generation
par: Zhou, Zijian, et autres
Publié: (2025)
par: Zhou, Zijian, et autres
Publié: (2025)
Instance Tracking in 3D Scenes from Egocentric Videos
par: Zhao, Yunhan, et autres
Publié: (2023)
par: Zhao, Yunhan, et autres
Publié: (2023)
Unleashing the Potential of Multimodal LLMs for Zero-Shot Spatio-Temporal Video Grounding
par: Yang, Zaiquan, et autres
Publié: (2025)
par: Yang, Zaiquan, et autres
Publié: (2025)
Self-Supervised Monocular 4D Scene Reconstruction for Egocentric Videos
par: Yuan, Chengbo, et autres
Publié: (2024)
par: Yuan, Chengbo, et autres
Publié: (2024)
DissolveStereo: Coarse Depth Injection for Zero-Shot Stereo Video Generation
par: Shi, Jian, et autres
Publié: (2024)
par: Shi, Jian, et autres
Publié: (2024)
Embodied VideoAgent: Persistent Memory from Egocentric Videos and Embodied Sensors Enables Dynamic Scene Understanding
par: Fan, Yue, et autres
Publié: (2024)
par: Fan, Yue, et autres
Publié: (2024)
HENASY: Learning to Assemble Scene-Entities for Egocentric Video-Language Model
par: Vo, Khoa, et autres
Publié: (2024)
par: Vo, Khoa, et autres
Publié: (2024)
KitchenTwin: Semantically and Geometrically Grounded 3D Kitchen Digital Twins
par: Wu, Quanyun, et autres
Publié: (2026)
par: Wu, Quanyun, et autres
Publié: (2026)
Zero-Shot Video Deraining with Video Diffusion Models
par: Varanka, Tuomas, et autres
Publié: (2025)
par: Varanka, Tuomas, et autres
Publié: (2025)
EgoGraph: Temporal Knowledge Graph for Egocentric Video Understanding
par: Sun, Shitong, et autres
Publié: (2026)
par: Sun, Shitong, et autres
Publié: (2026)
Object-Shot Enhanced Grounding Network for Egocentric Video
par: Feng, Yisen, et autres
Publié: (2025)
par: Feng, Yisen, et autres
Publié: (2025)
The Devil is in the Distributions: Explicit Modeling of Scene Content is Key in Zero-Shot Video Captioning
par: Tian, Mingkai, et autres
Publié: (2025)
par: Tian, Mingkai, et autres
Publié: (2025)
VIZOR: Viewpoint-Invariant Zero-Shot Scene Graph Generation for 3D Scene Reasoning
par: Madhavaram, Vivek, et autres
Publié: (2026)
par: Madhavaram, Vivek, et autres
Publié: (2026)
Zero-Shot Video Translation via Token Warping
par: Zhu, Haiming, et autres
Publié: (2024)
par: Zhu, Haiming, et autres
Publié: (2024)
DIFFVSGG: Diffusion-Driven Online Video Scene Graph Generation
par: Chen, Mu, et autres
Publié: (2025)
par: Chen, Mu, et autres
Publié: (2025)
VideoPoet: A Large Language Model for Zero-Shot Video Generation
par: Kondratyuk, Dan, et autres
Publié: (2023)
par: Kondratyuk, Dan, et autres
Publié: (2023)
Motion-Zero: Zero-Shot Moving Object Control Framework for Diffusion-Based Video Generation
par: Chen, Changgu, et autres
Publié: (2024)
par: Chen, Changgu, et autres
Publié: (2024)
LMP: Leveraging Motion Prior in Zero-Shot Video Generation with Diffusion Transformer
par: Chen, Changgu, et autres
Publié: (2025)
par: Chen, Changgu, et autres
Publié: (2025)
DriveVA: Video Action Models are Zero-Shot Drivers
par: Liu, Mengmeng, et autres
Publié: (2026)
par: Liu, Mengmeng, et autres
Publié: (2026)
EgoX: Egocentric Video Generation from a Single Exocentric Video
par: Kang, Taewoong, et autres
Publié: (2025)
par: Kang, Taewoong, et autres
Publié: (2025)
Grounded Multi-Hop VideoQA in Long-Form Egocentric Videos
par: Chen, Qirui, et autres
Publié: (2024)
par: Chen, Qirui, et autres
Publié: (2024)
Retrieval-Augmented Egocentric Video Captioning
par: Xu, Jilan, et autres
Publié: (2024)
par: Xu, Jilan, et autres
Publié: (2024)
Video In-context Learning: Autoregressive Transformers are Zero-Shot Video Imitators
par: Zhang, Wentao, et autres
Publié: (2024)
par: Zhang, Wentao, et autres
Publié: (2024)
Zero-Shot Video Restoration and Enhancement with Assistance of Video Diffusion Models
par: Cao, Cong, et autres
Publié: (2026)
par: Cao, Cong, et autres
Publié: (2026)
FunRec: Reconstructing Functional 3D Scenes from Egocentric Interaction Videos
par: Delitzas, Alexandros, et autres
Publié: (2026)
par: Delitzas, Alexandros, et autres
Publié: (2026)
ID-Animator: Zero-Shot Identity-Preserving Human Video Generation
par: He, Xuanhua, et autres
Publié: (2024)
par: He, Xuanhua, et autres
Publié: (2024)
LiveSVG: Zero-Shot SVG Animation via Video Generation
par: Levy, Matan, et autres
Publié: (2026)
par: Levy, Matan, et autres
Publié: (2026)
HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation
par: Nguyen, Trong-Thuan, et autres
Publié: (2024)
par: Nguyen, Trong-Thuan, et autres
Publié: (2024)
SceneGraphVLM: Dynamic Scene Graph Generation from Video with Vision-Language Models
par: Makarov, Vladislav, et autres
Publié: (2026)
par: Makarov, Vladislav, et autres
Publié: (2026)
Are Image-to-Video Models Good Zero-Shot Image Editors?
par: Zhang, Zechuan, et autres
Publié: (2025)
par: Zhang, Zechuan, et autres
Publié: (2025)
FRESCO: Spatial-Temporal Correspondence for Zero-Shot Video Translation
par: Yang, Shuai, et autres
Publié: (2024)
par: Yang, Shuai, et autres
Publié: (2024)
EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos
par: Ma, Junyi, et autres
Publié: (2025)
par: Ma, Junyi, et autres
Publié: (2025)
ShotDirector: Directorially Controllable Multi-Shot Video Generation with Cinematographic Transitions
par: Wu, Xiaoxue, et autres
Publié: (2025)
par: Wu, Xiaoxue, et autres
Publié: (2025)
Towards Spatio-Temporal World Scene Graph Generation from Monocular Videos
par: Peddi, Rohith, et autres
Publié: (2026)
par: Peddi, Rohith, et autres
Publié: (2026)
Documents similaires
-
Zero-Shot Object Re-Identification in Egocentric Kitchen Videos via Multi-Stage SAM3 Feature Fusion
par: Klepachevskyi, Dmytro, et autres
Publié: (2026) -
Static Scene Reconstruction from Dynamic Egocentric Videos
par: Cui, Qifei, et autres
Publié: (2026) -
FoodTrack: Estimating Handheld Food Portions with Egocentric Video
par: Wang, Ervin, et autres
Publié: (2025) -
ZeroHSI: Zero-Shot 4D Human-Scene Interaction by Video Generation
par: Li, Hongjie, et autres
Publié: (2024) -
Zero-Shot Temporal Interaction Localization for Egocentric Videos
par: Zhang, Erhang, et autres
Publié: (2025)