ProcObject-10K: Benchmarking Object-Centric Procedural Understanding in Instructional Videos
Fuente:
arXiv
Salvato in:
| Autori principali: | Guo, Wenliang, Kong, Yu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Procedural Mistake Detection via Action Effect Modeling
di: Guo, Wenliang, et al.
Pubblicazione: (2025)
di: Guo, Wenliang, et al.
Pubblicazione: (2025)
Spatial Reasoning in Foundation Models: Benchmarking Object-Centric Spatial Understanding
di: Mirjalili, Vahid, et al.
Pubblicazione: (2025)
di: Mirjalili, Vahid, et al.
Pubblicazione: (2025)
Proc-GS: Procedural Building Generation for City Assembly with 3D Gaussians
di: Li, Yixuan, et al.
Pubblicazione: (2024)
di: Li, Yixuan, et al.
Pubblicazione: (2024)
Object-Centric Instruction Augmentation for Robotic Manipulation
di: Wen, Junjie, et al.
Pubblicazione: (2024)
di: Wen, Junjie, et al.
Pubblicazione: (2024)
PinpointQA: A Dataset and Benchmark for Small Object-Centric Spatial Understanding in Indoor Videos
di: Zhou, Zhiyu, et al.
Pubblicazione: (2026)
di: Zhou, Zhiyu, et al.
Pubblicazione: (2026)
Object-Centric Framework for Video Moment Retrieval
di: Li, Zongyao, et al.
Pubblicazione: (2025)
di: Li, Zongyao, et al.
Pubblicazione: (2025)
Cycle Consistency in Video Object-Centric Learning
di: Zhao, Rongzhen, et al.
Pubblicazione: (2026)
di: Zhao, Rongzhen, et al.
Pubblicazione: (2026)
VRSO: Visual-Centric Reconstruction for Static Object Annotation
di: Yu, Chenyao, et al.
Pubblicazione: (2024)
di: Yu, Chenyao, et al.
Pubblicazione: (2024)
ProcFunc: Function-Oriented Abstractions for Procedural 3D Generation in Python
di: Raistrick, Alexander, et al.
Pubblicazione: (2026)
di: Raistrick, Alexander, et al.
Pubblicazione: (2026)
ReXSonoVQA: A Video QA Benchmark for Procedure-Centric Ultrasound Understanding
di: Wang, Xucheng, et al.
Pubblicazione: (2026)
di: Wang, Xucheng, et al.
Pubblicazione: (2026)
LMMs Meet Object-Centric Vision: Understanding, Segmentation, Editing and Generation
di: Yuan, Yuqian, et al.
Pubblicazione: (2026)
di: Yuan, Yuqian, et al.
Pubblicazione: (2026)
Anticipating Object State Changes in Long Procedural Videos
di: Manousaki, Victoria, et al.
Pubblicazione: (2024)
di: Manousaki, Victoria, et al.
Pubblicazione: (2024)
Compositional Video Synthesis by Temporal Object-Centric Learning
di: Akan, Adil Kaan, et al.
Pubblicazione: (2025)
di: Akan, Adil Kaan, et al.
Pubblicazione: (2025)
ProcTag: Process Tagging for Assessing the Efficacy of Document Instruction Data
di: Shen, Yufan, et al.
Pubblicazione: (2024)
di: Shen, Yufan, et al.
Pubblicazione: (2024)
InstructionBench: An Instructional Video Understanding Benchmark
di: Wei, Haiwan, et al.
Pubblicazione: (2025)
di: Wei, Haiwan, et al.
Pubblicazione: (2025)
Object-Centric Data Synthesis for Category-level Object Detection
di: Agarwal, Vikhyat, et al.
Pubblicazione: (2025)
di: Agarwal, Vikhyat, et al.
Pubblicazione: (2025)
SCHEMA: State CHangEs MAtter for Procedure Planning in Instructional Videos
di: Niu, Yulei, et al.
Pubblicazione: (2024)
di: Niu, Yulei, et al.
Pubblicazione: (2024)
TextOCVP: Object-Centric Video Prediction with Language Guidance
di: Villar-Corrales, Angel, et al.
Pubblicazione: (2025)
di: Villar-Corrales, Angel, et al.
Pubblicazione: (2025)
Video Spatial Reasoning with Object-Centric 3D Rollout
di: Tang, Haoran, et al.
Pubblicazione: (2025)
di: Tang, Haoran, et al.
Pubblicazione: (2025)
VASE: Object-Centric Appearance and Shape Manipulation of Real Videos
di: Peruzzo, Elia, et al.
Pubblicazione: (2024)
di: Peruzzo, Elia, et al.
Pubblicazione: (2024)
InstrAct: Towards Action-Centric Understanding in Instructional Videos
di: Yang, Zhuoyi, et al.
Pubblicazione: (2026)
di: Yang, Zhuoyi, et al.
Pubblicazione: (2026)
SimpleProc: Fully Procedural Synthetic Data from Simple Rules for Multi-View Stereo
di: Ma, Zeyu, et al.
Pubblicazione: (2026)
di: Ma, Zeyu, et al.
Pubblicazione: (2026)
DOCTR: Disentangled Object-Centric Transformer for Point Scene Understanding
di: Yu, Xiaoxuan, et al.
Pubblicazione: (2024)
di: Yu, Xiaoxuan, et al.
Pubblicazione: (2024)
Object-Centric Diffusion for Efficient Video Editing
di: Kahatapitiya, Kumara, et al.
Pubblicazione: (2024)
di: Kahatapitiya, Kumara, et al.
Pubblicazione: (2024)
Dynamic Scene Understanding through Object-Centric Voxelization and Neural Rendering
di: Zhao, Yanpeng, et al.
Pubblicazione: (2024)
di: Zhao, Yanpeng, et al.
Pubblicazione: (2024)
ObjectRelator: Enabling Cross-View Object Relation Understanding Across Ego-Centric and Exo-Centric Perspectives
di: Fu, Yuqian, et al.
Pubblicazione: (2024)
di: Fu, Yuqian, et al.
Pubblicazione: (2024)
CausalSpatial: A Benchmark for Object-Centric Causal Spatial Reasoning
di: Ma, Wenxin, et al.
Pubblicazione: (2026)
di: Ma, Wenxin, et al.
Pubblicazione: (2026)
Unsupervised Discovery of Object-Centric Neural Fields
di: Luo, Rundong, et al.
Pubblicazione: (2024)
di: Luo, Rundong, et al.
Pubblicazione: (2024)
PDPP: Projected Diffusion for Procedure Planning in Instructional Videos
di: Wang, Hanlin, et al.
Pubblicazione: (2023)
di: Wang, Hanlin, et al.
Pubblicazione: (2023)
SlotVTG: Object-Centric Adapter for Generalizable Video Temporal Grounding
di: Han, Jiwook, et al.
Pubblicazione: (2026)
di: Han, Jiwook, et al.
Pubblicazione: (2026)
ProcGen3D: Learning Neural Procedural Graph Representations for Image-to-3D Reconstruction
di: Zhang, Xinyi, et al.
Pubblicazione: (2025)
di: Zhang, Xinyi, et al.
Pubblicazione: (2025)
Ego-InBetween: Generating Object State Transitions in Ego-Centric Videos
di: Ge, Mengmeng, et al.
Pubblicazione: (2026)
di: Ge, Mengmeng, et al.
Pubblicazione: (2026)
SlotMemory: Object-Centric KV Memory for Streaming Long-Video Generation
di: Dou, Weijia, et al.
Pubblicazione: (2026)
di: Dou, Weijia, et al.
Pubblicazione: (2026)
Internalizing Temporal Consistency in Video Object-Centric Learning without Explicit Regularization
di: Zhao, Rongzhen, et al.
Pubblicazione: (2026)
di: Zhao, Rongzhen, et al.
Pubblicazione: (2026)
Spacewalk-18: A Benchmark for Multimodal and Long-form Procedural Video Understanding in Novel Domains
di: Tang, Zitian, et al.
Pubblicazione: (2023)
di: Tang, Zitian, et al.
Pubblicazione: (2023)
QASA: Quality-Guided K-Adaptive Slot Attention for Unsupervised Object-Centric Learning
di: Ouyang, Tianran, et al.
Pubblicazione: (2026)
di: Ouyang, Tianran, et al.
Pubblicazione: (2026)
Reconstruction-Guided Slot Curriculum: Addressing Object Over-Fragmentation in Video Object-Centric Learning
di: Moon, WonJun, et al.
Pubblicazione: (2026)
di: Moon, WonJun, et al.
Pubblicazione: (2026)
How Can Objects Help Video-Language Understanding?
di: Tang, Zitian, et al.
Pubblicazione: (2025)
di: Tang, Zitian, et al.
Pubblicazione: (2025)
Harnessing Object Grounding for Time-Sensitive Video Understanding
di: Wu, Tz-Ying, et al.
Pubblicazione: (2025)
di: Wu, Tz-Ying, et al.
Pubblicazione: (2025)
Zero-shot Object-Centric Instruction Following: Integrating Foundation Models with Traditional Navigation
di: Raychaudhuri, Sonia, et al.
Pubblicazione: (2024)
di: Raychaudhuri, Sonia, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Procedural Mistake Detection via Action Effect Modeling
di: Guo, Wenliang, et al.
Pubblicazione: (2025) -
Spatial Reasoning in Foundation Models: Benchmarking Object-Centric Spatial Understanding
di: Mirjalili, Vahid, et al.
Pubblicazione: (2025) -
Proc-GS: Procedural Building Generation for City Assembly with 3D Gaussians
di: Li, Yixuan, et al.
Pubblicazione: (2024) -
Object-Centric Instruction Augmentation for Robotic Manipulation
di: Wen, Junjie, et al.
Pubblicazione: (2024) -
PinpointQA: A Dataset and Benchmark for Small Object-Centric Spatial Understanding in Indoor Videos
di: Zhou, Zhiyu, et al.
Pubblicazione: (2026)