Are you Struggling? Dataset and Baselines for Struggle Determination in Assembly Videos
Fuente:
arXiv
Salvato in:
| Autori principali: | Feng, Shijia, Wray, Michael, Sullivan, Brian, Jang, Youngkyoon, Ludwig, Casimir, Gilchrist, Iain, Mayol-Cuevas, Walterio |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
EvoStruggle: A Dataset Capturing the Evolution of Struggle across Activities and Skill Levels
di: Feng, Shijia, et al.
Pubblicazione: (2025)
di: Feng, Shijia, et al.
Pubblicazione: (2025)
From Detection to Anticipation: Online Understanding of Struggles across Various Tasks and Activities
di: Feng, Shijia, et al.
Pubblicazione: (2025)
di: Feng, Shijia, et al.
Pubblicazione: (2025)
Re-localization acceleration with Medoid Silhouette Clustering
di: Zhang, Hongyi, et al.
Pubblicazione: (2024)
di: Zhang, Hongyi, et al.
Pubblicazione: (2024)
Why MLLMs Struggle to Determine Object Orientations
di: Gopinath, Anju, et al.
Pubblicazione: (2026)
di: Gopinath, Anju, et al.
Pubblicazione: (2026)
CULTURE3D: A Large-Scale and Diverse Dataset of Cultural Landmarks and Terrains for Gaussian-Based Scene Rendering
di: Zheng, Xinyi, et al.
Pubblicazione: (2025)
di: Zheng, Xinyi, et al.
Pubblicazione: (2025)
CoMapGS: Covisibility Map-based Gaussian Splatting for Sparse Novel View Synthesis
di: Jang, Youngkyoon, et al.
Pubblicazione: (2025)
di: Jang, Youngkyoon, et al.
Pubblicazione: (2025)
Specialized Foundation Models Struggle to Beat Supervised Baselines
di: Xu, Zongzhe, et al.
Pubblicazione: (2024)
di: Xu, Zongzhe, et al.
Pubblicazione: (2024)
SpatialMem: Metric-Aligned Long-Horizon Video Memory for Language Grounding and QA
di: Zheng, Xinyi, et al.
Pubblicazione: (2026)
di: Zheng, Xinyi, et al.
Pubblicazione: (2026)
X-LeBench: A Benchmark for Extremely Long Egocentric Video Understanding
di: Zhou, Wenqi, et al.
Pubblicazione: (2025)
di: Zhou, Wenqi, et al.
Pubblicazione: (2025)
Struggle with Adversarial Defense? Try Diffusion
di: Li, Yujie, et al.
Pubblicazione: (2024)
di: Li, Yujie, et al.
Pubblicazione: (2024)
SAM Struggles in Concealed Scenes -- Empirical Study on Segment Anything
di: Ji, Ge-Peng, et al.
Pubblicazione: (2023)
di: Ji, Ge-Peng, et al.
Pubblicazione: (2023)
Video, How Do Your Tokens Merge?
di: Pollard, Sam, et al.
Pubblicazione: (2025)
di: Pollard, Sam, et al.
Pubblicazione: (2025)
A Video Is Not Worth a Thousand Words
di: Pollard, Sam, et al.
Pubblicazione: (2025)
di: Pollard, Sam, et al.
Pubblicazione: (2025)
SA-ResGS: Self-Augmented Residual 3D Gaussian Splatting for Next Best View Selection
di: Jun-Seong, Kim, et al.
Pubblicazione: (2026)
di: Jun-Seong, Kim, et al.
Pubblicazione: (2026)
Lost in Translation: Modern Neural Networks Still Struggle With Small Realistic Image Transformations
di: Shifman, Ofir, et al.
Pubblicazione: (2024)
di: Shifman, Ofir, et al.
Pubblicazione: (2024)
Leveraging Auxiliary Information in Text-to-Video Retrieval: A Review
di: Fragomeni, Adriano, et al.
Pubblicazione: (2025)
di: Fragomeni, Adriano, et al.
Pubblicazione: (2025)
Leveraging Modality Tags for Enhanced Cross-Modal Video Retrieval
di: Fragomeni, Adriano, et al.
Pubblicazione: (2025)
di: Fragomeni, Adriano, et al.
Pubblicazione: (2025)
Moment of Untruth: Dealing with Negative Queries in Video Moment Retrieval
di: Flanagan, Kevin, et al.
Pubblicazione: (2025)
di: Flanagan, Kevin, et al.
Pubblicazione: (2025)
Why Do Vision Language Models Struggle To Recognize Human Emotions?
di: Agarwal, Madhav, et al.
Pubblicazione: (2026)
di: Agarwal, Madhav, et al.
Pubblicazione: (2026)
Catch-Up Mix: Catch-Up Class for Struggling Filters in CNN
di: Kang, Minsoo, et al.
Pubblicazione: (2024)
di: Kang, Minsoo, et al.
Pubblicazione: (2024)
Why Do MLLMs Struggle with Spatial Understanding? A Systematic Analysis from Data to Architecture
di: Zhang, Wanyue, et al.
Pubblicazione: (2025)
di: Zhang, Wanyue, et al.
Pubblicazione: (2025)
GlotOCR Bench: OCR Models Still Struggle Beyond a Handful of Unicode Scripts
di: Kargaran, Amir Hossein, et al.
Pubblicazione: (2026)
di: Kargaran, Amir Hossein, et al.
Pubblicazione: (2026)
Multimodal LLMs Struggle with Basic Visual Network Analysis: a VNA Benchmark
di: Williams, Evan M., et al.
Pubblicazione: (2024)
di: Williams, Evan M., et al.
Pubblicazione: (2024)
Lost in Space? Vision-Language Models Struggle with Relative Camera Pose Estimation
di: Deng, Ken, et al.
Pubblicazione: (2026)
di: Deng, Ken, et al.
Pubblicazione: (2026)
Video Editing for Video Retrieval
di: Zhu, Bin, et al.
Pubblicazione: (2024)
di: Zhu, Bin, et al.
Pubblicazione: (2024)
Towards Video Anomaly Detection from Event Streams: A Baseline and Benchmark Datasets
di: Wu, Peng, et al.
Pubblicazione: (2026)
di: Wu, Peng, et al.
Pubblicazione: (2026)
Pioneering Perceptual Video Fluency Assessment: A Novel Task with Benchmark Dataset and Baseline
di: Xie, Qizhi, et al.
Pubblicazione: (2026)
di: Xie, Qizhi, et al.
Pubblicazione: (2026)
VisOnlyQA: Large Vision Language Models Still Struggle with Visual Perception of Geometric Information
di: Kamoi, Ryo, et al.
Pubblicazione: (2024)
di: Kamoi, Ryo, et al.
Pubblicazione: (2024)
LRR-Bench: Left, Right or Rotate? Vision-Language models Still Struggle With Spatial Understanding Tasks
di: Kong, Fei, et al.
Pubblicazione: (2025)
di: Kong, Fei, et al.
Pubblicazione: (2025)
Towards Student Actions in Classroom Scenes: New Dataset and Baseline
di: Tan, Zhuolin, et al.
Pubblicazione: (2024)
di: Tan, Zhuolin, et al.
Pubblicazione: (2024)
GenHowTo: Learning to Generate Actions and State Transformations from Instructional Videos
di: Souček, Tomáš, et al.
Pubblicazione: (2023)
di: Souček, Tomáš, et al.
Pubblicazione: (2023)
Beyond Caption-Based Queries for Video Moment Retrieval
di: Pujol-Perich, David, et al.
Pubblicazione: (2026)
di: Pujol-Perich, David, et al.
Pubblicazione: (2026)
Towards Emotion Analysis in Short-form Videos: A Large-Scale Dataset and Baseline
di: Wu, Xuecheng, et al.
Pubblicazione: (2023)
di: Wu, Xuecheng, et al.
Pubblicazione: (2023)
Map2Thought: Explicit 3D Spatial Reasoning via Metric Cognitive Maps
di: Gao, Xiangjun, et al.
Pubblicazione: (2026)
di: Gao, Xiangjun, et al.
Pubblicazione: (2026)
Compressed Feature Quality Assessment: Dataset and Baselines
di: Gao, Changsheng, et al.
Pubblicazione: (2025)
di: Gao, Changsheng, et al.
Pubblicazione: (2025)
The Aftermath of DrawEduMath: Vision Language Models Underperform with Struggling Students and Misdiagnose Errors
di: Lucy, Li, et al.
Pubblicazione: (2026)
di: Lucy, Li, et al.
Pubblicazione: (2026)
Why Vision Language Models Struggle with Visual Arithmetic? Towards Enhanced Chart and Geometry Understanding
di: Huang, Kung-Hsiang, et al.
Pubblicazione: (2025)
di: Huang, Kung-Hsiang, et al.
Pubblicazione: (2025)
ICo3D: An Interactive Conversational 3D Virtual Human
di: Shaw, Richard, et al.
Pubblicazione: (2026)
di: Shaw, Richard, et al.
Pubblicazione: (2026)
SHARP: Segmentation of Hands and Arms by Range using Pseudo-Depth for Enhanced Egocentric 3D Hand Pose Estimation and Action Recognition
di: Mucha, Wiktor, et al.
Pubblicazione: (2024)
di: Mucha, Wiktor, et al.
Pubblicazione: (2024)
HOI-Ref: Hand-Object Interaction Referral in Egocentric Vision
di: Bansal, Siddhant, et al.
Pubblicazione: (2024)
di: Bansal, Siddhant, et al.
Pubblicazione: (2024)
Documenti analoghi
-
EvoStruggle: A Dataset Capturing the Evolution of Struggle across Activities and Skill Levels
di: Feng, Shijia, et al.
Pubblicazione: (2025) -
From Detection to Anticipation: Online Understanding of Struggles across Various Tasks and Activities
di: Feng, Shijia, et al.
Pubblicazione: (2025) -
Re-localization acceleration with Medoid Silhouette Clustering
di: Zhang, Hongyi, et al.
Pubblicazione: (2024) -
Why MLLMs Struggle to Determine Object Orientations
di: Gopinath, Anju, et al.
Pubblicazione: (2026) -
CULTURE3D: A Large-Scale and Diverse Dataset of Cultural Landmarks and Terrains for Gaussian-Based Scene Rendering
di: Zheng, Xinyi, et al.
Pubblicazione: (2025)