TEMPURA: Temporal Event Masked Prediction and Understanding for Reasoning in Action
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Cheng, Jen-Hao, Wang, Vivian, Wang, Huayu, Zhou, Huapeng, Peng, Yi-Hao, Liu, Hou-I, Huang, Hsiang-Wei, Chen, Kuang-Ming, Yang, Cheng-Yen, Chai, Wenhao, Chen, Yi-Ling, Vineet, Vibhav, Cai, Qin, Hwang, Jenq-Neng |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Reasoning Matters for 3D Visual Grounding
von: Huang, Hsiang-Wei, et al.
Veröffentlicht: (2026)
von: Huang, Hsiang-Wei, et al.
Veröffentlicht: (2026)
ToSA: Token Merging with Spatial Awareness
von: Huang, Hsiang-Wei, et al.
Veröffentlicht: (2025)
von: Huang, Hsiang-Wei, et al.
Veröffentlicht: (2025)
SAMURAI: Adapting Segment Anything Model for Zero-Shot Visual Tracking with Motion-Aware Memory
von: Yang, Cheng-Yen, et al.
Veröffentlicht: (2024)
von: Yang, Cheng-Yen, et al.
Veröffentlicht: (2024)
MambaMOT: State-Space Model as Motion Predictor for Multi-Object Tracking
von: Huang, Hsiang-Wei, et al.
Veröffentlicht: (2024)
von: Huang, Hsiang-Wei, et al.
Veröffentlicht: (2024)
A Density-Guided Temporal Attention Transformer for Indiscernible Object Counting in Underwater Video
von: Yang, Cheng-Yen, et al.
Veröffentlicht: (2024)
von: Yang, Cheng-Yen, et al.
Veröffentlicht: (2024)
PackDiT: Joint Human Motion and Text Generation via Mutual Prompting
von: Jiang, Zhongyu, et al.
Veröffentlicht: (2025)
von: Jiang, Zhongyu, et al.
Veröffentlicht: (2025)
Boosting Online 3D Multi-Object Tracking through Camera-Radar Cross Check
von: Kuan, Sheng-Yao, et al.
Veröffentlicht: (2024)
von: Kuan, Sheng-Yao, et al.
Veröffentlicht: (2024)
Technical Report for ReID-SAM on SkiTB Visual Tracking Challenge 2025
von: Li, Kunjun, et al.
Veröffentlicht: (2025)
von: Li, Kunjun, et al.
Veröffentlicht: (2025)
RT-Pose: A 4D Radar Tensor-based 3D Human Pose Estimation and Localization Benchmark
von: Ho, Yuan-Hao, et al.
Veröffentlicht: (2024)
von: Ho, Yuan-Hao, et al.
Veröffentlicht: (2024)
CaMo: Camera Motion Grounded Evaluation and Training for Vision-Language Models
von: Huang, Hsiang-Wei, et al.
Veröffentlicht: (2026)
von: Huang, Hsiang-Wei, et al.
Veröffentlicht: (2026)
UniHPR: Unified Human Pose Representation via Singular Value Contrastive Learning
von: Jiang, Zhongyu, et al.
Veröffentlicht: (2025)
von: Jiang, Zhongyu, et al.
Veröffentlicht: (2025)
Memory-Efficient Visual Autoregressive Modeling with Scale-Aware KV Cache Compression
von: Li, Kunjun, et al.
Veröffentlicht: (2025)
von: Li, Kunjun, et al.
Veröffentlicht: (2025)
Modeling LLM Agent Reviewer Dynamics in Elo-Ranked Review System
von: Huang, Hsiang-Wei, et al.
Veröffentlicht: (2026)
von: Huang, Hsiang-Wei, et al.
Veröffentlicht: (2026)
Single-image driven 3d viewpoint training data augmentation for effective wine label recognition
von: Huang, Yueh-Cheng, et al.
Veröffentlicht: (2024)
von: Huang, Yueh-Cheng, et al.
Veröffentlicht: (2024)
Pointmap Association and Piecewise-Plane Constraint for Consistent and Compact 3D Gaussian Segmentation Field
von: Hu, Wenhao, et al.
Veröffentlicht: (2025)
von: Hu, Wenhao, et al.
Veröffentlicht: (2025)
Warehouse Spatial Question Answering with LLM Agent
von: Huang, Hsiang-Wei, et al.
Veröffentlicht: (2025)
von: Huang, Hsiang-Wei, et al.
Veröffentlicht: (2025)
MPM: A Unified 2D-3D Human Pose Representation via Masked Pose Modeling
von: Zhang, Zhenyu, et al.
Veröffentlicht: (2023)
von: Zhang, Zhenyu, et al.
Veröffentlicht: (2023)
GTA: Global Tracklet Association for Multi-Object Tracking in Sports
von: Sun, Jiacheng, et al.
Veröffentlicht: (2024)
von: Sun, Jiacheng, et al.
Veröffentlicht: (2024)
Detector-in-the-Loop Tracking: Active Memory Rectification for Stable Glottic Opening Localization
von: Wang, Huayu, et al.
Veröffentlicht: (2026)
von: Wang, Huayu, et al.
Veröffentlicht: (2026)
ToddlerAct: A Toddler Action Recognition Dataset for Gross Motor Development Assessment
von: Huang, Hsiang-Wei, et al.
Veröffentlicht: (2024)
von: Huang, Hsiang-Wei, et al.
Veröffentlicht: (2024)
MovieChat+: Question-aware Sparse Memory for Long Video Question Answering
von: Song, Enxin, et al.
Veröffentlicht: (2024)
von: Song, Enxin, et al.
Veröffentlicht: (2024)
Exploring Probabilistic Modeling Beyond Domain Generalization for Semantic Segmentation
von: Chen, I-Hsiang, et al.
Veröffentlicht: (2025)
von: Chen, I-Hsiang, et al.
Veröffentlicht: (2025)
CityGen: Infinite and Controllable City Layout Generation
von: Deng, Jie, et al.
Veröffentlicht: (2023)
von: Deng, Jie, et al.
Veröffentlicht: (2023)
Recent Advances in Embedding Methods for Multi-Object Tracking: A Survey
von: Wang, Gaoang, et al.
Veröffentlicht: (2022)
von: Wang, Gaoang, et al.
Veröffentlicht: (2022)
MonoTAKD: Teaching Assistant Knowledge Distillation for Monocular 3D Object Detection
von: Liu, Hou-I, et al.
Veröffentlicht: (2024)
von: Liu, Hou-I, et al.
Veröffentlicht: (2024)
VersaT2I: Improving Text-to-Image Models with Versatile Reward
von: Guo, Jianshu, et al.
Veröffentlicht: (2024)
von: Guo, Jianshu, et al.
Veröffentlicht: (2024)
PEEKABOO: Interactive Video Generation via Masked-Diffusion
von: Jain, Yash, et al.
Veröffentlicht: (2023)
von: Jain, Yash, et al.
Veröffentlicht: (2023)
On Occlusions in Video Action Detection: Benchmark Datasets And Training Recipes
von: Modi, Rajat, et al.
Veröffentlicht: (2024)
von: Modi, Rajat, et al.
Veröffentlicht: (2024)
Physics Knowledge in Frontier Models: A Diagnostic Study of Failure Modes
von: Bagdonaviciute, Ieva, et al.
Veröffentlicht: (2025)
von: Bagdonaviciute, Ieva, et al.
Veröffentlicht: (2025)
CityCraft: A Real Crafter for 3D City Generation
von: Deng, Jie, et al.
Veröffentlicht: (2024)
von: Deng, Jie, et al.
Veröffentlicht: (2024)
Understanding Identity Continuity in Thermal Video through Scene-Level Consistency
von: Sun, Wei-Chieh, et al.
Veröffentlicht: (2026)
von: Sun, Wei-Chieh, et al.
Veröffentlicht: (2026)
DAug: Diffusion-based Channel Augmentation for Radiology Image Retrieval and Classification
von: Jin, Ying, et al.
Veröffentlicht: (2024)
von: Jin, Ying, et al.
Veröffentlicht: (2024)
RiTTA: Modeling Event Relations in Text-to-Audio Generation
von: He, Yuhang, et al.
Veröffentlicht: (2024)
von: He, Yuhang, et al.
Veröffentlicht: (2024)
Emergent Crowd Grouping via Heuristic Self-Organization
von: Liao, Xiao-Cheng, et al.
Veröffentlicht: (2024)
von: Liao, Xiao-Cheng, et al.
Veröffentlicht: (2024)
Adapting SAM 2 for Visual Object Tracking: 1st Place Solution for MMVPR Challenge Multi-Modal Tracking
von: Yang, Cheng-Yen, et al.
Veröffentlicht: (2025)
von: Yang, Cheng-Yen, et al.
Veröffentlicht: (2025)
ProTPS: Prototype-Guided Text Prompt Selection for Continual Learning
von: Mei, Jie, et al.
Veröffentlicht: (2026)
von: Mei, Jie, et al.
Veröffentlicht: (2026)
EVAN: Evolutional Video Streaming Adaptation via Neural Representation
von: Liu, Mufan, et al.
Veröffentlicht: (2024)
von: Liu, Mufan, et al.
Veröffentlicht: (2024)
Navigating Hallucinations for Reasoning of Unintentional Activities
von: Grover, Shresth, et al.
Veröffentlicht: (2024)
von: Grover, Shresth, et al.
Veröffentlicht: (2024)
Exposing the Achilles' Heel: Evaluating LLMs Ability to Handle Mistakes in Mathematical Reasoning
von: Singh, Joykirat, et al.
Veröffentlicht: (2024)
von: Singh, Joykirat, et al.
Veröffentlicht: (2024)
Score-matching-based Structure Learning for Temporal Data on Networks
von: Chen, Hao, et al.
Veröffentlicht: (2024)
von: Chen, Hao, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Reasoning Matters for 3D Visual Grounding
von: Huang, Hsiang-Wei, et al.
Veröffentlicht: (2026) -
ToSA: Token Merging with Spatial Awareness
von: Huang, Hsiang-Wei, et al.
Veröffentlicht: (2025) -
SAMURAI: Adapting Segment Anything Model for Zero-Shot Visual Tracking with Motion-Aware Memory
von: Yang, Cheng-Yen, et al.
Veröffentlicht: (2024) -
MambaMOT: State-Space Model as Motion Predictor for Multi-Object Tracking
von: Huang, Hsiang-Wei, et al.
Veröffentlicht: (2024) -
A Density-Guided Temporal Attention Transformer for Indiscernible Object Counting in Underwater Video
von: Yang, Cheng-Yen, et al.
Veröffentlicht: (2024)