Compositional Physical Reasoning of Objects and Events from Videos
Fuente:
arXiv
Guardado en:
| Autores principales: | Chen, Zhenfang, Dong, Shilong, Yi, Kexin, Li, Yunzhu, Ding, Mingyu, Torralba, Antonio, Tenenbaum, Joshua B., Gan, Chuang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
STAR: A Benchmark for Situated Reasoning in Real-World Videos
por: Wu, Bo, et al.
Publicado: (2024)
por: Wu, Bo, et al.
Publicado: (2024)
ContPhy: Continuum Physical Concept Learning and Reasoning from Videos
por: Zheng, Zhicheng, et al.
Publicado: (2024)
por: Zheng, Zhicheng, et al.
Publicado: (2024)
TextPSG: Panoptic Scene Graph Generation from Textual Descriptions
por: Zhao, Chengyang, et al.
Publicado: (2023)
por: Zhao, Chengyang, et al.
Publicado: (2023)
Physically Compatible 3D Object Modeling from a Single Image
por: Guo, Minghao, et al.
Publicado: (2024)
por: Guo, Minghao, et al.
Publicado: (2024)
EventRR: Event Referential Reasoning for Referring Video Object Segmentation
por: Xu, Huihui, et al.
Publicado: (2025)
por: Xu, Huihui, et al.
Publicado: (2025)
MultiModal Action Conditioned Video Generation
por: Li, Yichen, et al.
Publicado: (2025)
por: Li, Yichen, et al.
Publicado: (2025)
SOK-Bench: A Situated Video Reasoning Benchmark with Aligned Open-World Knowledge
por: Wang, Andong, et al.
Publicado: (2024)
por: Wang, Andong, et al.
Publicado: (2024)
MECD+: Unlocking Event-Level Causal Graph Discovery for Video Reasoning
por: Chen, Tieyuan, et al.
Publicado: (2025)
por: Chen, Tieyuan, et al.
Publicado: (2025)
FlexAttention for Efficient High-Resolution Vision-Language Models
por: Li, Junyan, et al.
Publicado: (2024)
por: Li, Junyan, et al.
Publicado: (2024)
MECD: Unlocking Multi-Event Causal Discovery in Video Reasoning
por: Chen, Tieyuan, et al.
Publicado: (2024)
por: Chen, Tieyuan, et al.
Publicado: (2024)
JSTR: Joint Spatio-Temporal Reasoning for Event-based Moving Object Detection
por: Zhou, Hanyu, et al.
Publicado: (2024)
por: Zhou, Hanyu, et al.
Publicado: (2024)
GPD: Guided Progressive Distillation for Fast and High-Quality Video Generation
por: Liang, Xiao, et al.
Publicado: (2026)
por: Liang, Xiao, et al.
Publicado: (2026)
Compositional Image Decomposition with Diffusion Models
por: Su, Jocelin, et al.
Publicado: (2024)
por: Su, Jocelin, et al.
Publicado: (2024)
PhysTwin: Physics-Informed Reconstruction and Simulation of Deformable Objects from Videos
por: Jiang, Hanxiao, et al.
Publicado: (2025)
por: Jiang, Hanxiao, et al.
Publicado: (2025)
Particle-Grid Neural Dynamics for Learning Deformable Object Models from RGB-D Videos
por: Zhang, Kaifeng, et al.
Publicado: (2025)
por: Zhang, Kaifeng, et al.
Publicado: (2025)
Enhancing Event-based Object Detection with Monocular Normal Maps
por: Liu, Mingjie, et al.
Publicado: (2025)
por: Liu, Mingjie, et al.
Publicado: (2025)
IDPro: Flexible Interactive Video Object Segmentation by ID-queried Concurrent Propagation
por: Li, Kexin, et al.
Publicado: (2024)
por: Li, Kexin, et al.
Publicado: (2024)
FlexSelect: Flexible Token Selection for Efficient Long Video Understanding
por: Zhang, Yunzhu, et al.
Publicado: (2025)
por: Zhang, Yunzhu, et al.
Publicado: (2025)
Reconstruction and Simulation of Elastic Objects with Spring-Mass 3D Gaussians
por: Zhong, Licheng, et al.
Publicado: (2024)
por: Zhong, Licheng, et al.
Publicado: (2024)
CoMo: Compositional Motion Customization for Text-to-Video Generation
por: Xu, Youcan, et al.
Publicado: (2025)
por: Xu, Youcan, et al.
Publicado: (2025)
Wan-R1: Verifiable-Reinforcement Learning for Video Reasoning
por: Liu, Ming, et al.
Publicado: (2026)
por: Liu, Ming, et al.
Publicado: (2026)
Event-to-Video Conversion for Overhead Object Detection
por: Hannan, Darryl, et al.
Publicado: (2024)
por: Hannan, Darryl, et al.
Publicado: (2024)
Structure from Duplicates: Neural Inverse Graphics from a Pile of Objects
por: Cheng, Tianhang, et al.
Publicado: (2024)
por: Cheng, Tianhang, et al.
Publicado: (2024)
VCA: Video Curious Agent for Long Video Understanding
por: Yang, Zeyuan, et al.
Publicado: (2024)
por: Yang, Zeyuan, et al.
Publicado: (2024)
Evaluating Multiview Object Consistency in Humans and Image Models
por: Bonnen, Tyler, et al.
Publicado: (2024)
por: Bonnen, Tyler, et al.
Publicado: (2024)
VideoSketcher: Video Models Prior Enable Versatile Sequential Sketch Generation
por: Ren, Hui, et al.
Publicado: (2026)
por: Ren, Hui, et al.
Publicado: (2026)
Online Reasoning Video Object Segmentation
por: Liu, Jinyuan, et al.
Publicado: (2026)
por: Liu, Jinyuan, et al.
Publicado: (2026)
Event-assisted Low-Light Video Object Segmentation
por: Li, Hebei, et al.
Publicado: (2024)
por: Li, Hebei, et al.
Publicado: (2024)
OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning
por: Liang, Zhijia, et al.
Publicado: (2026)
por: Liang, Zhijia, et al.
Publicado: (2026)
HAZARD Challenge: Embodied Decision Making in Dynamically Changing Environments
por: Zhou, Qinhong, et al.
Publicado: (2024)
por: Zhou, Qinhong, et al.
Publicado: (2024)
Exploring Enhanced Contextual Information for Video-Level Object Tracking
por: Kang, Ben, et al.
Publicado: (2024)
por: Kang, Ben, et al.
Publicado: (2024)
Building Cooperative Embodied Agents Modularly with Large Language Models
por: Zhang, Hongxin, et al.
Publicado: (2023)
por: Zhang, Hongxin, et al.
Publicado: (2023)
Generalized Dynamics Generation towards Scannable Physical World Model
por: Li, Yichen, et al.
Publicado: (2025)
por: Li, Yichen, et al.
Publicado: (2025)
From Objects to Events: Unlocking Complex Visual Understanding in Object Detectors via LLM-guided Symbolic Reasoning
por: Zeng, Yuhui, et al.
Publicado: (2025)
por: Zeng, Yuhui, et al.
Publicado: (2025)
Potential Based Diffusion Motion Planning
por: Luo, Yunhao, et al.
Publicado: (2024)
por: Luo, Yunhao, et al.
Publicado: (2024)
Compositional Video Synthesis by Temporal Object-Centric Learning
por: Akan, Adil Kaan, et al.
Publicado: (2025)
por: Akan, Adil Kaan, et al.
Publicado: (2025)
ReplicateAnyScene: Zero-Shot Video-to-3D Composition via Textual-Visual-Spatial Alignment
por: Dong, Mingyu, et al.
Publicado: (2026)
por: Dong, Mingyu, et al.
Publicado: (2026)
MJ-VIDEO: Fine-Grained Benchmarking and Rewarding Video Preferences in Video Generation
por: Tong, Haibo, et al.
Publicado: (2025)
por: Tong, Haibo, et al.
Publicado: (2025)
Robotic Manipulation by Imitating Generated Videos Without Physical Demonstrations
por: Patel, Shivansh, et al.
Publicado: (2025)
por: Patel, Shivansh, et al.
Publicado: (2025)
Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens
por: Yang, Zeyuan, et al.
Publicado: (2025)
por: Yang, Zeyuan, et al.
Publicado: (2025)
Ejemplares similares
-
STAR: A Benchmark for Situated Reasoning in Real-World Videos
por: Wu, Bo, et al.
Publicado: (2024) -
ContPhy: Continuum Physical Concept Learning and Reasoning from Videos
por: Zheng, Zhicheng, et al.
Publicado: (2024) -
TextPSG: Panoptic Scene Graph Generation from Textual Descriptions
por: Zhao, Chengyang, et al.
Publicado: (2023) -
Physically Compatible 3D Object Modeling from a Single Image
por: Guo, Minghao, et al.
Publicado: (2024) -
EventRR: Event Referential Reasoning for Referring Video Object Segmentation
por: Xu, Huihui, et al.
Publicado: (2025)