StimuVAR: Spatiotemporal Stimuli-aware Video Affective Reasoning with Multimodal Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Guo, Yuxiang, Siddiqui, Faizan, Zhao, Yang, Chellappa, Rama, Lo, Shao-Yuan |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
VILLS -- Video-Image Learning to Learn Semantics for Person Re-Identification
by: Huang, Siyuan, et al.
Published: (2023)
by: Huang, Siyuan, et al.
Published: (2023)
Follow the Rules: Reasoning for Video Anomaly Detection with Large Language Models
by: Yang, Yuchen, et al.
Published: (2024)
by: Yang, Yuchen, et al.
Published: (2024)
Mesh-Gait: A Unified Framework for Gait Recognition Through Multi-Modal Representation Learning from 2D Silhouettes
by: Wang, Zhao-Yang, et al.
Published: (2025)
by: Wang, Zhao-Yang, et al.
Published: (2025)
RANKVIDEO: Reasoning Reranking for Text-to-Video Retrieval
by: Skow, Tyler, et al.
Published: (2026)
by: Skow, Tyler, et al.
Published: (2026)
Template-based Multi-Domain Face Recognition
by: Nanduri, Anirudh, et al.
Published: (2024)
by: Nanduri, Anirudh, et al.
Published: (2024)
DiffInf: Influence-Guided Diffusion for Supervision Alignment in Facial Attribute Learning
by: Pal, Basudha, et al.
Published: (2026)
by: Pal, Basudha, et al.
Published: (2026)
MimicGait: A Model Agnostic approach for Occluded Gait Recognition using Correlational Knowledge Distillation
by: Gupta, Ayush, et al.
Published: (2025)
by: Gupta, Ayush, et al.
Published: (2025)
CLR-Face: Conditional Latent Refinement for Blind Face Restoration Using Score-Based Diffusion Models
by: Suin, Maitreya, et al.
Published: (2024)
by: Suin, Maitreya, et al.
Published: (2024)
Enrich and Detect: Video Temporal Grounding with Multimodal LLMs
by: Pramanick, Shraman, et al.
Published: (2025)
by: Pramanick, Shraman, et al.
Published: (2025)
SPIQA: A Dataset for Multimodal Question Answering on Scientific Papers
by: Pramanick, Shraman, et al.
Published: (2024)
by: Pramanick, Shraman, et al.
Published: (2024)
GaitContour: Efficient Gait Recognition based on a Contour-Pose Representation
by: Guo, Yuxiang, et al.
Published: (2023)
by: Guo, Yuxiang, et al.
Published: (2023)
SPIDER: Spatial Image CorresponDence Estimator for Robust Calibration
by: Shao, Zhimin, et al.
Published: (2025)
by: Shao, Zhimin, et al.
Published: (2025)
ViT-Linearizer: Distilling Quadratic Knowledge into Linear-Time Vision Models
by: Wei, Guoyizhe, et al.
Published: (2025)
by: Wei, Guoyizhe, et al.
Published: (2025)
Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models
by: Xu, Jiacong, et al.
Published: (2025)
by: Xu, Jiacong, et al.
Published: (2025)
Filter Images First, Generate Instructions Later: Pre-Instruction Data Selection for Visual Instruction Tuning
by: Safaei, Bardia, et al.
Published: (2025)
by: Safaei, Bardia, et al.
Published: (2025)
Test-Time-Scaling for Zero-Shot Diagnosis with Visual-Language Reasoning
by: Byun, Ji Young, et al.
Published: (2025)
by: Byun, Ji Young, et al.
Published: (2025)
Distillation-guided Representation Learning for Unconstrained Gait Recognition
by: Guo, Yuxiang, et al.
Published: (2023)
by: Guo, Yuxiang, et al.
Published: (2023)
DiffProtect: Generate Adversarial Examples with Diffusion Models for Facial Privacy Protection
by: Liu, Jiang, et al.
Published: (2023)
by: Liu, Jiang, et al.
Published: (2023)
Uncertainty-quantified Pulse Signal Recovery from Facial Video using Regularized Stochastic Interpolants
by: Shenoy, Vineet R., et al.
Published: (2026)
by: Shenoy, Vineet R., et al.
Published: (2026)
A Quantitative Evaluation of the Expressivity of BMI, Pose and Gender in Body Embeddings for Recognition and Identification
by: Pal, Basudha, et al.
Published: (2025)
by: Pal, Basudha, et al.
Published: (2025)
Zero-Shot Personalization of Objects via Textual Inversion
by: Roy, Aniket, et al.
Published: (2026)
by: Roy, Aniket, et al.
Published: (2026)
Mind the Gap: Bridging Occlusion in Gait Recognition via Residual Gap Correction
by: Gupta, Ayush, et al.
Published: (2025)
by: Gupta, Ayush, et al.
Published: (2025)
Cross-Spectral Body Recognition with Side Information Embedding: Benchmarks on LLCM and Analyzing Range-Induced Occlusions on IJB-MDF
by: Nanduri, Anirudh, et al.
Published: (2025)
by: Nanduri, Anirudh, et al.
Published: (2025)
Multi-Domain Biometric Recognition using Body Embeddings
by: Nanduri, Anirudh, et al.
Published: (2025)
by: Nanduri, Anirudh, et al.
Published: (2025)
An Evaluation of Large Pre-Trained Models for Gesture Recognition using Synthetic Videos
by: Reddy, Arun, et al.
Published: (2024)
by: Reddy, Arun, et al.
Published: (2024)
An Immersive Multi-Elevation Multi-Seasonal Dataset for 3D Reconstruction and Visualization
by: Liu, Xijun, et al.
Published: (2024)
by: Liu, Xijun, et al.
Published: (2024)
Can't make an Omelette without Breaking some Eggs: Plausible Action Anticipation using Large Video-Language Models
by: Mittal, Himangi, et al.
Published: (2024)
by: Mittal, Himangi, et al.
Published: (2024)
ViRectify: A Challenging Benchmark for Video Reasoning Correction with Multimodal Large Language Models
by: Hei, Xusen, et al.
Published: (2025)
by: Hei, Xusen, et al.
Published: (2025)
Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing
by: Zhao, Pengcheng, et al.
Published: (2024)
by: Zhao, Pengcheng, et al.
Published: (2024)
FusionRF: High-Fidelity Satellite Neural Radiance Fields from Multispectral and Panchromatic Acquisitions
by: Sprintson, Michael, et al.
Published: (2024)
by: Sprintson, Michael, et al.
Published: (2024)
Tool-Augmented Spatiotemporal Reasoning for Streamlining Video Question Answering Task
by: Fan, Sunqi, et al.
Published: (2025)
by: Fan, Sunqi, et al.
Published: (2025)
MultLFG: Training-free Multi-LoRA composition using Frequency-domain Guidance
by: Roy, Aniket, et al.
Published: (2025)
by: Roy, Aniket, et al.
Published: (2025)
CAM3R: Camera-Agnostic Model for 3D Reconstruction
by: Guruprasad, Namitha, et al.
Published: (2026)
by: Guruprasad, Namitha, et al.
Published: (2026)
The Gait Signature of Frailty: Transfer Learning based Deep Gait Models for Scalable Frailty Assessment
by: McDaniel, Laura, et al.
Published: (2026)
by: McDaniel, Laura, et al.
Published: (2026)
DiffRegCD: Integrated Registration and Change Detection with Diffusion Features
by: Madani, Seyedehanita, et al.
Published: (2025)
by: Madani, Seyedehanita, et al.
Published: (2025)
MV2MAE: Multi-View Video Masked Autoencoders
by: Shah, Ketul, et al.
Published: (2024)
by: Shah, Ketul, et al.
Published: (2024)
Encoding of Demographic and Anatomical Information in Chest X-Ray-based Severe Left Ventricular Hypertrophy Classifiers
by: Pal, Basudha, et al.
Published: (2025)
by: Pal, Basudha, et al.
Published: (2025)
Scenes as Tokens: Multi-Scale Normal Distributions Transform Tokenizer for General 3D Vision-Language Understanding
by: Tang, Yutao, et al.
Published: (2025)
by: Tang, Yutao, et al.
Published: (2025)
Part-X-MLLM: Part-aware 3D Multimodal Large Language Model
by: Wang, Chunshi, et al.
Published: (2025)
by: Wang, Chunshi, et al.
Published: (2025)
FaceXFormer: A Unified Transformer for Facial Analysis
by: Narayan, Kartik, et al.
Published: (2024)
by: Narayan, Kartik, et al.
Published: (2024)
Similar Items
-
VILLS -- Video-Image Learning to Learn Semantics for Person Re-Identification
by: Huang, Siyuan, et al.
Published: (2023) -
Follow the Rules: Reasoning for Video Anomaly Detection with Large Language Models
by: Yang, Yuchen, et al.
Published: (2024) -
Mesh-Gait: A Unified Framework for Gait Recognition Through Multi-Modal Representation Learning from 2D Silhouettes
by: Wang, Zhao-Yang, et al.
Published: (2025) -
RANKVIDEO: Reasoning Reranking for Text-to-Video Retrieval
by: Skow, Tyler, et al.
Published: (2026) -
Template-based Multi-Domain Face Recognition
by: Nanduri, Anirudh, et al.
Published: (2024)