From a Social Cognitive Perspective: Context-aware Visual Social Relationship Recognition
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wu, Shiwei, Zhang, Chao, Chen, Joya, Xu, Tong, Wu, Likang, Hu, Yao, Chen, Enhong |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Semantic-Consistent Bidirectional Contrastive Hashing for Noisy Multi-Label Cross-Modal Retrieval
par: Peng, Likang, et autres
Publié: (2025)
par: Peng, Likang, et autres
Publié: (2025)
SemCo: Toward Semantic Coherent Visual Relationship Forecasting
par: Ou, Yangjun, et autres
Publié: (2021)
par: Ou, Yangjun, et autres
Publié: (2021)
Perception-R1: Advancing Multimodal Reasoning Capabilities of MLLMs via Visual Perception Reward
par: Xiao, Tong, et autres
Publié: (2025)
par: Xiao, Tong, et autres
Publié: (2025)
Towards Visual Discrimination and Reasoning of Real-World Physical Dynamics: Physics-Grounded Anomaly Detection
par: Li, Wenqiao, et autres
Publié: (2025)
par: Li, Wenqiao, et autres
Publié: (2025)
Reasoning Path and Latent State Analysis for Multi-view Visual Spatial Reasoning: A Cognitive Science Perspective
par: Xue, Qiyao, et autres
Publié: (2025)
par: Xue, Qiyao, et autres
Publié: (2025)
DTL: Disentangled Transfer Learning for Visual Recognition
par: Fu, Minghao, et autres
Publié: (2023)
par: Fu, Minghao, et autres
Publié: (2023)
VideoLLM-MoD: Efficient Video-Language Streaming with Mixture-of-Depths Vision Computation
par: Wu, Shiwei, et autres
Publié: (2024)
par: Wu, Shiwei, et autres
Publié: (2024)
IVR-R1: Refining Trajectories through Iterative Visual-Grounded Reasoning in Reinforcement Learning
par: Li, Chenghao, et autres
Publié: (2026)
par: Li, Chenghao, et autres
Publié: (2026)
Visual-Noise Guided In-Context Distillation for Multimodal Large Language Model Unlearning
par: Chen, Junkai, et autres
Publié: (2026)
par: Chen, Junkai, et autres
Publié: (2026)
Following the Diagnostic Trace: Visual Cognition-guided Cooperative Network for Chest X-Ray Diagnosis
par: Wu, Shaoxuan, et autres
Publié: (2026)
par: Wu, Shaoxuan, et autres
Publié: (2026)
HIPPO: Accelerating Video Large Language Models Inference via Holistic-aware Parallel Speculative Decoding
par: Lv, Qitan, et autres
Publié: (2026)
par: Lv, Qitan, et autres
Publié: (2026)
${C}^{3}$-GS: Learning Context-aware, Cross-dimension, Cross-scale Feature for Generalizable Gaussian Splatting
par: Hu, Yuxi, et autres
Publié: (2025)
par: Hu, Yuxi, et autres
Publié: (2025)
From Geometric Mimicry to Comprehensive Generation: A Context-Informed Multimodal Diffusion Model for Urban Morphology Synthesis
par: Zhou, Fangshuo, et autres
Publié: (2024)
par: Zhou, Fangshuo, et autres
Publié: (2024)
Beyond Recognition: Evaluating Visual Perspective Taking in Vision Language Models
par: Góral, Gracjan, et autres
Publié: (2025)
par: Góral, Gracjan, et autres
Publié: (2025)
C^2DA: Contrastive and Context-aware Domain Adaptive Semantic Segmentation
par: Khan, Md. Al-Masrur, et autres
Publié: (2024)
par: Khan, Md. Al-Masrur, et autres
Publié: (2024)
Visual Instance-aware Prompt Tuning
par: Xiao, Xi, et autres
Publié: (2025)
par: Xiao, Xi, et autres
Publié: (2025)
OLIVE: Object Level In-Context Visual Embeddings
par: Ossowski, Timothy, et autres
Publié: (2024)
par: Ossowski, Timothy, et autres
Publié: (2024)
Walking Further: Semantic-aware Multimodal Gait Recognition Under Long-Range Conditions
par: Lu, Zhiyang, et autres
Publié: (2026)
par: Lu, Zhiyang, et autres
Publié: (2026)
Spatiotemporal Learning with Context-aware Video Tubelets for Ultrasound Video Analysis
par: Li, Gary Y., et autres
Publié: (2025)
par: Li, Gary Y., et autres
Publié: (2025)
True Multimodal In-Context Learning Needs Attention to the Visual Context
par: Chen, Shuo, et autres
Publié: (2025)
par: Chen, Shuo, et autres
Publié: (2025)
DesCLIP: Robust Continual Learning via General Attribute Descriptions for VLM-Based Visual Recognition
par: He, Chiyuan, et autres
Publié: (2025)
par: He, Chiyuan, et autres
Publié: (2025)
ActFER: Agentic Facial Expression Recognition via Active Tool-Augmented Visual Reasoning
par: Liu, Shifeng, et autres
Publié: (2026)
par: Liu, Shifeng, et autres
Publié: (2026)
Benchmarking and Analyzing Generative Data for Visual Recognition
par: Li, Bo, et autres
Publié: (2023)
par: Li, Bo, et autres
Publié: (2023)
SocialNav: Training Human-Inspired Foundation Model for Socially-Aware Embodied Navigation
par: Chen, Ziyi, et autres
Publié: (2025)
par: Chen, Ziyi, et autres
Publié: (2025)
Large-Scale 3D Medical Image Pre-training with Geometric Context Priors
par: Wu, Linshan, et autres
Publié: (2024)
par: Wu, Linshan, et autres
Publié: (2024)
Scaling the Long Video Understanding of Multimodal Large Language Models via Visual Memory Mechanism
par: Chen, Tao, et autres
Publié: (2026)
par: Chen, Tao, et autres
Publié: (2026)
Frequency-Semantic Enhanced Variational Autoencoder for Zero-Shot Skeleton-based Action Recognition
par: Wu, Wenhan, et autres
Publié: (2025)
par: Wu, Wenhan, et autres
Publié: (2025)
Unleashing the Power of CNN and Transformer for Balanced RGB-Event Video Recognition
par: Wang, Xiao, et autres
Publié: (2023)
par: Wang, Xiao, et autres
Publié: (2023)
Robust-R1: Degradation-Aware Reasoning for Robust Visual Understanding
par: Tang, Jiaqi, et autres
Publié: (2025)
par: Tang, Jiaqi, et autres
Publié: (2025)
Unsupervised Multi-View Visual Anomaly Detection via Progressive Homography-Guided Alignment
par: Chen, Xintao, et autres
Publié: (2025)
par: Chen, Xintao, et autres
Publié: (2025)
Visual Fourier Prompt Tuning
par: Zeng, Runjia, et autres
Publié: (2024)
par: Zeng, Runjia, et autres
Publié: (2024)
Diffusion-Based Visual Art Creation: A Survey and New Perspectives
par: Wang, Bingyuan, et autres
Publié: (2024)
par: Wang, Bingyuan, et autres
Publié: (2024)
Visual Para-Thinker: Divide-and-Conquer Reasoning for Visual Comprehension
par: Xu, Haoran, et autres
Publié: (2026)
par: Xu, Haoran, et autres
Publié: (2026)
Order-aware Interactive Segmentation
par: Wang, Bin, et autres
Publié: (2024)
par: Wang, Bin, et autres
Publié: (2024)
SARE: Sample-wise Adaptive Reasoning for Training-free Fine-grained Visual Recognition
par: Yang, Jingxiao, et autres
Publié: (2026)
par: Yang, Jingxiao, et autres
Publié: (2026)
ViPO: Visual Preference Optimization at Scale
par: Li, Ming, et autres
Publié: (2026)
par: Li, Ming, et autres
Publié: (2026)
Locality-aware Parallel Decoding for Efficient Autoregressive Image Generation
par: Zhang, Zhuoyang, et autres
Publié: (2025)
par: Zhang, Zhuoyang, et autres
Publié: (2025)
VLA-LPAF: Lightweight Perspective-Adaptive Fusion for Vision-Language-Action to Enable More Unconstrained Robotic Manipulation
par: Bian, Jinyue, et autres
Publié: (2025)
par: Bian, Jinyue, et autres
Publié: (2025)
Adjusting Logit in Gaussian Form for Long-Tailed Visual Recognition
par: Li, Mengke, et autres
Publié: (2023)
par: Li, Mengke, et autres
Publié: (2023)
On Denoising Walking Videos for Gait Recognition
par: Jin, Dongyang, et autres
Publié: (2025)
par: Jin, Dongyang, et autres
Publié: (2025)
Documents similaires
-
Semantic-Consistent Bidirectional Contrastive Hashing for Noisy Multi-Label Cross-Modal Retrieval
par: Peng, Likang, et autres
Publié: (2025) -
SemCo: Toward Semantic Coherent Visual Relationship Forecasting
par: Ou, Yangjun, et autres
Publié: (2021) -
Perception-R1: Advancing Multimodal Reasoning Capabilities of MLLMs via Visual Perception Reward
par: Xiao, Tong, et autres
Publié: (2025) -
Towards Visual Discrimination and Reasoning of Real-World Physical Dynamics: Physics-Grounded Anomaly Detection
par: Li, Wenqiao, et autres
Publié: (2025) -
Reasoning Path and Latent State Analysis for Multi-view Visual Spatial Reasoning: A Cognitive Science Perspective
par: Xue, Qiyao, et autres
Publié: (2025)