Saved in:
| Main Authors: | Deng, Andong, Yang, Taojiannan, Chen, Chen, Chen, Qian, Neely, Leslie, Oyama, Sakiko |
|---|---|
| Format: | Preprint |
| Published: |
2022
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2211.09310 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
SciVideoBench: Benchmarking Scientific Video Reasoning in Large Multimodal Models
by: Deng, Andong, et al.
Published: (2025)
by: Deng, Andong, et al.
Published: (2025)
Motion-Grounded Video Reasoning: Understanding and Perceiving Motion at Pixel Level
by: Deng, Andong, et al.
Published: (2024)
by: Deng, Andong, et al.
Published: (2024)
From Perception to Reasoning: Deep Thinking Empowers Multimodal Large Language Models
by: Zhu, Wenxin, et al.
Published: (2025)
by: Zhu, Wenxin, et al.
Published: (2025)
Deep Learning Based Approach to Enhanced Recognition of Emotions and Behavioral Patterns of Autistic Children
by: R, Nelaka K. A., et al.
Published: (2025)
by: R, Nelaka K. A., et al.
Published: (2025)
A.I.R.: Enabling Adaptive, Iterative, and Reasoning-based Frame Selection For Video Question Answering
by: Zou, Yuanhao, et al.
Published: (2025)
by: Zou, Yuanhao, et al.
Published: (2025)
Explain via Any Concept: Concept Bottleneck Model with Open Vocabulary Concepts
by: Tan, Andong, et al.
Published: (2024)
by: Tan, Andong, et al.
Published: (2024)
Post-hoc Part-prototype Networks
by: Tan, Andong, et al.
Published: (2024)
by: Tan, Andong, et al.
Published: (2024)
ControlNet++: Improving Conditional Controls with Efficient Consistency Feedback
by: Li, Ming, et al.
Published: (2024)
by: Li, Ming, et al.
Published: (2024)
Multi-threshold Deep Metric Learning for Facial Expression Recognition
by: Yang, Wenwu, et al.
Published: (2024)
by: Yang, Wenwu, et al.
Published: (2024)
STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models
by: Liang, Yiming, et al.
Published: (2026)
by: Liang, Yiming, et al.
Published: (2026)
Seq2Time: Sequential Knowledge Transfer for Video LLM Temporal Grounding
by: Deng, Andong, et al.
Published: (2024)
by: Deng, Andong, et al.
Published: (2024)
VEBench:Benchmarking Large Multimodal Models for Real-World Video Editing
by: Deng, Andong, et al.
Published: (2026)
by: Deng, Andong, et al.
Published: (2026)
Voronoi-Assisted Diffusion for Computing Unsigned Distance Fields from Unoriented Points
by: Kong, Jiayi, et al.
Published: (2025)
by: Kong, Jiayi, et al.
Published: (2025)
Video-Based Autism Detection with Deep Learning
by: Serna-Aguilera, M., et al.
Published: (2024)
by: Serna-Aguilera, M., et al.
Published: (2024)
Deep Learning-based Animal Behavior Analysis: Insights from Mouse Chronic Pain Models
by: Chen, Yu-Hsi, et al.
Published: (2025)
by: Chen, Yu-Hsi, et al.
Published: (2025)
Deep Tree Tensor Networks for Image Recognition
by: Nie, Chang, et al.
Published: (2025)
by: Nie, Chang, et al.
Published: (2025)
Learning Semantic-Aware Representation in Visual-Language Models for Multi-Label Recognition with Partial Labels
by: Ruan, Haoxian, et al.
Published: (2024)
by: Ruan, Haoxian, et al.
Published: (2024)
Smile upon the Face but Sadness in the Eyes: Emotion Recognition based on Facial Expressions and Eye Behaviors
by: Liu, Yuanyuan, et al.
Published: (2024)
by: Liu, Yuanyuan, et al.
Published: (2024)
Multi-Modality Co-Learning for Efficient Skeleton-based Action Recognition
by: Liu, Jinfu, et al.
Published: (2024)
by: Liu, Jinfu, et al.
Published: (2024)
BEAR: A Video Dataset For Fine-grained Behaviors Recognition Oriented with Action and Environment Factors
by: Hu, Chengyang, et al.
Published: (2025)
by: Hu, Chengyang, et al.
Published: (2025)
Culture In a Frame: C$^3$B as a Comic-Based Benchmark for Multimodal Culturally Awareness
by: Song, Yuchen, et al.
Published: (2025)
by: Song, Yuchen, et al.
Published: (2025)
Denoising-Contrastive Alignment for Continuous Sign Language Recognition
by: Guo, Leming, et al.
Published: (2023)
by: Guo, Leming, et al.
Published: (2023)
MolNexTR: A Generalized Deep Learning Model for Molecular Image Recognition
by: Chen, Yufan, et al.
Published: (2024)
by: Chen, Yufan, et al.
Published: (2024)
Meta-Auxiliary Learning for Micro-Expression Recognition
by: Wang, Jingyao, et al.
Published: (2024)
by: Wang, Jingyao, et al.
Published: (2024)
Continual Learning for Remote Physiological Measurement: Minimize Forgetting and Simplify Inference
by: Liang, Qian, et al.
Published: (2024)
by: Liang, Qian, et al.
Published: (2024)
Are Deep Learning Models Robust to Partial Object Occlusion in Visual Recognition Tasks?
by: Kassaw, Kaleb, et al.
Published: (2024)
by: Kassaw, Kaleb, et al.
Published: (2024)
Efficient Surgical Tool Recognition via HMM-Stabilized Deep Learning
by: Wang, Haifeng, et al.
Published: (2024)
by: Wang, Haifeng, et al.
Published: (2024)
Few-Shot Continual Learning for Activity Recognition in Classroom Surveillance Images
by: Qian, Yilei, et al.
Published: (2024)
by: Qian, Yilei, et al.
Published: (2024)
SignVTCL: Multi-Modal Continuous Sign Language Recognition Enhanced by Visual-Textual Contrastive Learning
by: Chen, Hao, et al.
Published: (2024)
by: Chen, Hao, et al.
Published: (2024)
Neuron: Learning Context-Aware Evolving Representations for Zero-Shot Skeleton Action Recognition
by: Chen, Yang, et al.
Published: (2024)
by: Chen, Yang, et al.
Published: (2024)
KAN-HyperpointNet for Point Cloud Sequence-Based 3D Human Action Recognition
by: Chen, Zhaoyu, et al.
Published: (2024)
by: Chen, Zhaoyu, et al.
Published: (2024)
Beyond Global Alignment: Fine-Grained Motion-Language Retrieval via Pyramidal Shapley-Taylor Learning
by: Chen, Hanmo, et al.
Published: (2026)
by: Chen, Hanmo, et al.
Published: (2026)
Language-Assisted Human Part Motion Learning for Skeleton-Based Temporal Action Segmentation
by: Chen, Bowen, et al.
Published: (2024)
by: Chen, Bowen, et al.
Published: (2024)
OST: Refining Text Knowledge with Optimal Spatio-Temporal Descriptor for General Video Recognition
by: Chen, Tongjia, et al.
Published: (2023)
by: Chen, Tongjia, et al.
Published: (2023)
GlyphDraw2: Automatic Generation of Complex Glyph Posters with Diffusion Models and Large Language Models
by: Ma, Jian, et al.
Published: (2024)
by: Ma, Jian, et al.
Published: (2024)
Modality-missing RGBT Tracking: Invertible Prompt Learning and High-quality Benchmarks
by: Lu, Andong, et al.
Published: (2023)
by: Lu, Andong, et al.
Published: (2023)
Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition
by: Lin, Tiancheng, et al.
Published: (2024)
by: Lin, Tiancheng, et al.
Published: (2024)
Locating Tennis Ball Impact on the Racket in Real Time Using an Event Camera
by: Kase, Yuto, et al.
Published: (2025)
by: Kase, Yuto, et al.
Published: (2025)
Automated Estimation of Impact Time, Impact Location, and Shuttlecock Speed in Badminton Smashes Using Event Cameras
by: Washida, Yudai, et al.
Published: (2026)
by: Washida, Yudai, et al.
Published: (2026)
Interaction-via-Actions: Cattle Interaction Detection with Joint Learning of Action-Interaction Latent Space
by: Nakagawa, Ren, et al.
Published: (2025)
by: Nakagawa, Ren, et al.
Published: (2025)
Similar Items
-
SciVideoBench: Benchmarking Scientific Video Reasoning in Large Multimodal Models
by: Deng, Andong, et al.
Published: (2025) -
Motion-Grounded Video Reasoning: Understanding and Perceiving Motion at Pixel Level
by: Deng, Andong, et al.
Published: (2024) -
From Perception to Reasoning: Deep Thinking Empowers Multimodal Large Language Models
by: Zhu, Wenxin, et al.
Published: (2025) -
Deep Learning Based Approach to Enhanced Recognition of Emotions and Behavioral Patterns of Autistic Children
by: R, Nelaka K. A., et al.
Published: (2025) -
A.I.R.: Enabling Adaptive, Iterative, and Reasoning-based Frame Selection For Video Question Answering
by: Zou, Yuanhao, et al.
Published: (2025)