SocialGen: Modeling Multi-Human Social Interaction with Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yu, Heng, Zhang, Juze, Chen, Changan, Xiang, Tiange, Fang, Yusu, Niebles, Juan Carlos, Adeli, Ehsan |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
The Language of Motion: Unifying Verbal and Non-verbal Language of 3D Human Motion
par: Chen, Changan, et autres
Publié: (2024)
par: Chen, Changan, et autres
Publié: (2024)
ViBES: A Conversational Agent with Behaviorally-Intelligent 3D Virtual Body
par: Zhang, Juze, et autres
Publié: (2025)
par: Zhang, Juze, et autres
Publié: (2025)
HumanScore: Benchmarking Human Motions in Generated Videos
par: Fang, Yusu, et autres
Publié: (2026)
par: Fang, Yusu, et autres
Publié: (2026)
AdaVid: Adaptive Video-Language Pretraining
par: Patel, Chaitanya, et autres
Publié: (2025)
par: Patel, Chaitanya, et autres
Publié: (2025)
Repurposing 2D Diffusion Models for 3D Shape Completion
par: He, Yao, et autres
Publié: (2025)
par: He, Yao, et autres
Publié: (2025)
OccFusion: Rendering Occluded Humans with Generative Diffusion Priors
par: Sun, Adam, et autres
Publié: (2024)
par: Sun, Adam, et autres
Publié: (2024)
UniEgoMotion: A Unified Model for Egocentric Motion Reconstruction, Forecasting, and Generation
par: Patel, Chaitanya, et autres
Publié: (2025)
par: Patel, Chaitanya, et autres
Publié: (2025)
Wild2Avatar: Rendering Humans Behind Occlusions
par: Xiang, Tiange, et autres
Publié: (2023)
par: Xiang, Tiange, et autres
Publié: (2023)
Repurposing 2D Diffusion Models with Gaussian Atlas for 3D Generation
par: Xiang, Tiange, et autres
Publié: (2025)
par: Xiang, Tiange, et autres
Publié: (2025)
GenFusion: Feed-forward Human Performance Capture via Progressive Canonical Space Updates
par: Kwon, Youngjoong, et autres
Publié: (2026)
par: Kwon, Youngjoong, et autres
Publié: (2026)
Decoding Visual Experience and Mapping Semantics through Whole-Brain Analysis Using fMRI Foundation Models
par: Wang, Yanchen, et autres
Publié: (2024)
par: Wang, Yanchen, et autres
Publié: (2024)
Diffusion MRI Transformer with a Diffusion Space Rotary Positional Embedding (D-RoPE)
par: Kung, Gustavo Chau Loo, et autres
Publié: (2026)
par: Kung, Gustavo Chau Loo, et autres
Publié: (2026)
Latent Forcing: Reordering the Diffusion Trajectory for Pixel-Space Image Generation
par: Baade, Alan, et autres
Publié: (2026)
par: Baade, Alan, et autres
Publié: (2026)
I'M HOI: Inertia-aware Monocular Capture of 3D Human-Object Interactions
par: Zhao, Chengfeng, et autres
Publié: (2023)
par: Zhao, Chengfeng, et autres
Publié: (2023)
Anatomically Guided Latent Diffusion for Brain MRI Progression Modeling
par: Wan, Cheng, et autres
Publié: (2026)
par: Wan, Cheng, et autres
Publié: (2026)
HOI-M3:Capture Multiple Humans and Objects Interaction within Contextual Environment
par: Zhang, Juze, et autres
Publié: (2024)
par: Zhang, Juze, et autres
Publié: (2024)
Integrating Anatomical Priors into a Causal Diffusion Model
par: Li, Binxu, et autres
Publié: (2025)
par: Li, Binxu, et autres
Publié: (2025)
Towards Robust 3D Pose Transfer with Adversarial Learning
par: Chen, Haoyu, et autres
Publié: (2024)
par: Chen, Haoyu, et autres
Publié: (2024)
The Cost of Language: Centroid Erasure Exposes and Exploits Modal Competition in Multimodal Language Models
par: Paruchuri, Akshay, et autres
Publié: (2026)
par: Paruchuri, Akshay, et autres
Publié: (2026)
InterAgent: Physics-based Multi-agent Command Execution via Diffusion on Interaction Graphs
par: Li, Bin, et autres
Publié: (2025)
par: Li, Bin, et autres
Publié: (2025)
Diffusion Models for Computational Neuroimaging: A Survey
par: Zhao, Haokai, et autres
Publié: (2025)
par: Zhao, Haokai, et autres
Publié: (2025)
AnyLift: Scaling Motion Reconstruction from Internet Videos via 2D Diffusion
par: Li, Hongjie, et autres
Publié: (2026)
par: Li, Hongjie, et autres
Publié: (2026)
HOI-Swap: Swapping Objects in Videos with Hand-Object Interaction Awareness
par: Xue, Zihui, et autres
Publié: (2024)
par: Xue, Zihui, et autres
Publié: (2024)
Artist-Created Mesh Generation from Raw Observation
par: He, Yao, et autres
Publié: (2025)
par: He, Yao, et autres
Publié: (2025)
T*: Re-thinking Temporal Search for Long-Form Video Understanding
par: Ye, Jinhui, et autres
Publié: (2025)
par: Ye, Jinhui, et autres
Publié: (2025)
Linear Scaling Video VLMs for Long Video Understanding
par: Eyzaguirre, Cristobal, et autres
Publié: (2026)
par: Eyzaguirre, Cristobal, et autres
Publié: (2026)
MMHOI: Modeling Complex 3D Multi-Human Multi-Object Interactions
par: Kogashi, Kaen, et autres
Publié: (2025)
par: Kogashi, Kaen, et autres
Publié: (2025)
Dyadic Interaction Modeling for Social Behavior Generation
par: Tran, Minh, et autres
Publié: (2024)
par: Tran, Minh, et autres
Publié: (2024)
Social 3D Scene Graphs: Modeling Human Actions and Relations for Interactive Service Robots
par: Bartoli, Ermanno, et autres
Publié: (2025)
par: Bartoli, Ermanno, et autres
Publié: (2025)
LLaVA-SLT: Visual Language Tuning for Sign Language Translation
par: Liang, Han, et autres
Publié: (2024)
par: Liang, Han, et autres
Publié: (2024)
SLAP: The Semantic Least Action Principle for Variational Video-Language Modeling
par: Fang, Xiang, et autres
Publié: (2026)
par: Fang, Xiang, et autres
Publié: (2026)
Human-like Content Analysis for Generative AI with Language-Grounded Sparse Encoders
par: Tang, Yiming, et autres
Publié: (2025)
par: Tang, Yiming, et autres
Publié: (2025)
HUMOF: Human Motion Forecasting in Interactive Social Scenes
par: Sun, Caiyi, et autres
Publié: (2025)
par: Sun, Caiyi, et autres
Publié: (2025)
Large Language Model-Guided Semantic Alignment for Human Activity Recognition
par: Yan, Hua, et autres
Publié: (2024)
par: Yan, Hua, et autres
Publié: (2024)
GenHSI: Controllable Generation of Human-Scene Interaction Videos
par: Li, Zekun, et autres
Publié: (2025)
par: Li, Zekun, et autres
Publié: (2025)
UniVG: A Generalist Diffusion Model for Unified Image Generation and Editing
par: Fu, Tsu-Jui, et autres
Publié: (2025)
par: Fu, Tsu-Jui, et autres
Publié: (2025)
DRESS: Instructing Large Vision-Language Models to Align and Interact with Humans via Natural Language Feedback
par: Chen, Yangyi, et autres
Publié: (2023)
par: Chen, Yangyi, et autres
Publié: (2023)
SocialDirector: Training-Free Social Interaction Control for Multi-Person Video Generation
par: Ouyang, Liangyang, et autres
Publié: (2026)
par: Ouyang, Liangyang, et autres
Publié: (2026)
Whom to Respond To? A Transformer-Based Model for Multi-Party Social Robot Interaction
par: Zhu, He, et autres
Publié: (2025)
par: Zhu, He, et autres
Publié: (2025)
Brain-Cognition Fingerprinting via Graph-GCCA with Contrastive Learning
par: Wang, Yixin, et autres
Publié: (2024)
par: Wang, Yixin, et autres
Publié: (2024)
Documents similaires
-
The Language of Motion: Unifying Verbal and Non-verbal Language of 3D Human Motion
par: Chen, Changan, et autres
Publié: (2024) -
ViBES: A Conversational Agent with Behaviorally-Intelligent 3D Virtual Body
par: Zhang, Juze, et autres
Publié: (2025) -
HumanScore: Benchmarking Human Motions in Generated Videos
par: Fang, Yusu, et autres
Publié: (2026) -
AdaVid: Adaptive Video-Language Pretraining
par: Patel, Chaitanya, et autres
Publié: (2025) -
Repurposing 2D Diffusion Models for 3D Shape Completion
par: He, Yao, et autres
Publié: (2025)