Anticipating Object State Changes in Long Procedural Videos
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Manousaki, Victoria, Bacharidis, Konstantinos, Gouidis, Filippos, Papoutsakis, Konstantinos, Plexousakis, Dimitris, Argyros, Antonis |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Recognizing Unseen States of Unknown Objects by Leveraging Knowledge Graphs
par: Gouidis, Filipos, et autres
Publié: (2023)
par: Gouidis, Filipos, et autres
Publié: (2023)
Fusing Domain-Specific Content from Large Language Models into Knowledge Graphs for Enhanced Zero Shot Object State Classification
par: Gouidis, Filippos, et autres
Publié: (2024)
par: Gouidis, Filippos, et autres
Publié: (2024)
Action Anticipation at a Glimpse: To What Extent Can Multimodal Cues Replace Video?
par: Benavent-Lledo, Manuel, et autres
Publié: (2025)
par: Benavent-Lledo, Manuel, et autres
Publié: (2025)
Understanding Multimodal Complementarity for Single-Frame Action Anticipation
par: Benavent-Lledo, Manuel, et autres
Publié: (2026)
par: Benavent-Lledo, Manuel, et autres
Publié: (2026)
Vision-Based Mistake Analysis in Procedural Activities: A Review of Advances and Challenges
par: Bacharidis, Konstantinos, et autres
Publié: (2025)
par: Bacharidis, Konstantinos, et autres
Publié: (2025)
ENACT: Entropy-based Clustering of Attention Input for Reducing the Computational Needs of Object Detection Transformers
par: Savathrakis, Giorgos, et autres
Publié: (2024)
par: Savathrakis, Giorgos, et autres
Publié: (2024)
OCCAM: Class-Agnostic, Training-Free, Prior-Free and Multi-Class Object Counting
par: Spanakis, Michail, et autres
Publié: (2026)
par: Spanakis, Michail, et autres
Publié: (2026)
A vision-based framework for human behavior understanding in industrial assembly lines
par: Papoutsakis, Konstantinos, et autres
Publié: (2024)
par: Papoutsakis, Konstantinos, et autres
Publié: (2024)
AIFloodSense: A Global Aerial Imagery Dataset for Semantic Segmentation and Understanding of Flooded Environments
par: Simantiris, Georgios, et autres
Publié: (2025)
par: Simantiris, Georgios, et autres
Publié: (2025)
D-PoSE: Depth as an Intermediate Representation for 3D Human Pose and Shape Estimation
par: Vasilikopoulos, Nikolaos, et autres
Publié: (2024)
par: Vasilikopoulos, Nikolaos, et autres
Publié: (2024)
Combining Facial Videos and Biosignals for Stress Estimation During Driving
par: Valergaki, Paraskevi, et autres
Publié: (2026)
par: Valergaki, Paraskevi, et autres
Publié: (2026)
Anticipating Next Active Objects for Egocentric Videos
par: Thakur, Sanket, et autres
Publié: (2023)
par: Thakur, Sanket, et autres
Publié: (2023)
Y-MAP-Net: Real-time depth, normals, segmentation, multi-label captioning and 2D human pose in RGB images
par: Qammaz, Ammar, et autres
Publié: (2024)
par: Qammaz, Ammar, et autres
Publié: (2024)
Video Reconstruction using Diffusion-based Image-to-Video Generation with Trajectory Guidance
par: Bompai, Stelio, et autres
Publié: (2026)
par: Bompai, Stelio, et autres
Publié: (2026)
Trajectory-Aware Adaptive Inference in Object Detection Models
par: Papanikolaou, Grigorios, et autres
Publié: (2026)
par: Papanikolaou, Grigorios, et autres
Publié: (2026)
Enhancing Monocular 3D Hand Reconstruction with Learned Texture Priors
par: Karvounas, Giorgos, et autres
Publié: (2025)
par: Karvounas, Giorgos, et autres
Publié: (2025)
What Changed and What Could Have Changed? State-Change Counterfactuals for Procedure-Aware Video Representation Learning
par: Kung, Chi-Hsi, et autres
Publié: (2025)
par: Kung, Chi-Hsi, et autres
Publié: (2025)
Anticipating Future Object Compositions without Forgetting
par: Zahran, Youssef, et autres
Publié: (2024)
par: Zahran, Youssef, et autres
Publié: (2024)
Leveraging Gaze and Set-of-Mark in VLLMs for Human-Object Interaction Anticipation from Egocentric Videos
par: Materia, Daniele, et autres
Publié: (2026)
par: Materia, Daniele, et autres
Publié: (2026)
Learning Object State Changes in Videos: An Open-World Perspective
par: Xue, Zihui, et autres
Publié: (2023)
par: Xue, Zihui, et autres
Publié: (2023)
SPOC: Spatially-Progressing Object State Change Segmentation in Video
par: Mandikal, Priyanka, et autres
Publié: (2025)
par: Mandikal, Priyanka, et autres
Publié: (2025)
VGRP-Bench: Visual Grid Reasoning Puzzle Benchmark for Large Vision-Language Models
par: Ren, Yufan, et autres
Publié: (2025)
par: Ren, Yufan, et autres
Publié: (2025)
EgoVIS@CVPR: What Changed and What Could Have Changed? State-Change Counterfactuals for Procedure-Aware Video Representation Learning
par: Kung, Chi-Hsi, et autres
Publié: (2025)
par: Kung, Chi-Hsi, et autres
Publié: (2025)
Towards Consistent Long-Term Pose Generation
par: Li, Yayuan, et autres
Publié: (2025)
par: Li, Yayuan, et autres
Publié: (2025)
Intelligent Sampling Consensus for Homography Estimation in Football Videos Using Featureless Unpaired Points
par: Nousias, George, et autres
Publié: (2023)
par: Nousias, George, et autres
Publié: (2023)
PEAR: Phrase-Based Hand-Object Interaction Anticipation
par: Zhang, Zichen, et autres
Publié: (2024)
par: Zhang, Zichen, et autres
Publié: (2024)
Test-Time Spectrum-Aware Latent Steering for Zero-Shot Generalization in Vision-Language Models
par: Dafnis, Konstantinos M., et autres
Publié: (2025)
par: Dafnis, Konstantinos M., et autres
Publié: (2025)
Uncertainty-boosted Robust Video Activity Anticipation
par: Qi, Zhaobo, et autres
Publié: (2024)
par: Qi, Zhaobo, et autres
Publié: (2024)
Action-Guided Attention for Video Action Anticipation
par: Tai, Tsung-Ming, et autres
Publié: (2026)
par: Tai, Tsung-Ming, et autres
Publié: (2026)
ProcObject-10K: Benchmarking Object-Centric Procedural Understanding in Instructional Videos
par: Guo, Wenliang, et autres
Publié: (2025)
par: Guo, Wenliang, et autres
Publié: (2025)
Context Matters: Learning Global Semantics via Object-Centric Representation
par: Zhong, Jike, et autres
Publié: (2025)
par: Zhong, Jike, et autres
Publié: (2025)
Gen3DEval: Using vLLMs for Automatic Evaluation of Generated 3D Objects
par: Maiti, Shalini, et autres
Publié: (2025)
par: Maiti, Shalini, et autres
Publié: (2025)
AntGPT: Can Large Language Models Help Long-term Action Anticipation from Videos?
par: Zhao, Qi, et autres
Publié: (2023)
par: Zhao, Qi, et autres
Publié: (2023)
SPOT: Self-Training with Patch-Order Permutation for Object-Centric Learning with Autoregressive Transformers
par: Kakogeorgiou, Ioannis, et autres
Publié: (2023)
par: Kakogeorgiou, Ioannis, et autres
Publié: (2023)
Short-term Object Interaction Anticipation with Disentangled Object Detection @ Ego4D Short Term Object Interaction Anticipation Challenge
par: Cho, Hyunjin, et autres
Publié: (2024)
par: Cho, Hyunjin, et autres
Publié: (2024)
Gated Temporal Diffusion for Stochastic Long-Term Dense Anticipation
par: Zatsarynna, Olga, et autres
Publié: (2024)
par: Zatsarynna, Olga, et autres
Publié: (2024)
Integrating Affordances and Attention models for Short-Term Object Interaction Anticipation
par: Labadia, Lorenzo Mur, et autres
Publié: (2026)
par: Labadia, Lorenzo Mur, et autres
Publié: (2026)
Run-time Introspection of 2D Object Detection in Automated Driving Systems Using Learning Representations
par: Yatbaz, Hakan Yekta, et autres
Publié: (2024)
par: Yatbaz, Hakan Yekta, et autres
Publié: (2024)
An Integrated Framework for Multi-Granular Explanation of Video Summarization
par: Tsigos, Konstantinos, et autres
Publié: (2024)
par: Tsigos, Konstantinos, et autres
Publié: (2024)
Control-DINO: Feature Space Conditioning for Controllable Image-to-Video Diffusion
par: Dominici, Edoardo A., et autres
Publié: (2026)
par: Dominici, Edoardo A., et autres
Publié: (2026)
Documents similaires
-
Recognizing Unseen States of Unknown Objects by Leveraging Knowledge Graphs
par: Gouidis, Filipos, et autres
Publié: (2023) -
Fusing Domain-Specific Content from Large Language Models into Knowledge Graphs for Enhanced Zero Shot Object State Classification
par: Gouidis, Filippos, et autres
Publié: (2024) -
Action Anticipation at a Glimpse: To What Extent Can Multimodal Cues Replace Video?
par: Benavent-Lledo, Manuel, et autres
Publié: (2025) -
Understanding Multimodal Complementarity for Single-Frame Action Anticipation
par: Benavent-Lledo, Manuel, et autres
Publié: (2026) -
Vision-Based Mistake Analysis in Procedural Activities: A Review of Advances and Challenges
par: Bacharidis, Konstantinos, et autres
Publié: (2025)