HIS-GPT: Towards 3D Human-In-Scene Multimodal Understanding
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhao, Jiahe, Hou, Ruibing, Tian, Zejie, Chang, Hong, Shan, Shiguang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
RefHCM: A Unified Model for Referring Perceptions in Human-Centric Scenarios
di: Huang, Jie, et al.
Pubblicazione: (2024)
di: Huang, Jie, et al.
Pubblicazione: (2024)
HERM: Benchmarking and Enhancing Multimodal LLMs for Human-Centric Understanding
di: Li, Keliang, et al.
Pubblicazione: (2024)
di: Li, Keliang, et al.
Pubblicazione: (2024)
M$^3$GPT: An Advanced Multimodal, Multitask Framework for Motion Comprehension and Generation
di: Luo, Mingshuang, et al.
Pubblicazione: (2024)
di: Luo, Mingshuang, et al.
Pubblicazione: (2024)
un$^2$CLIP: Improving CLIP's Visual Detail Capturing Ability via Inverting unCLIP
di: Li, Yinqi, et al.
Pubblicazione: (2025)
di: Li, Yinqi, et al.
Pubblicazione: (2025)
UniPose: A Unified Multimodal Framework for Human Pose Comprehension, Generation and Editing
di: Li, Yiheng, et al.
Pubblicazione: (2024)
di: Li, Yiheng, et al.
Pubblicazione: (2024)
MotionVerse: A Unified Multimodal Framework for Motion Comprehension, Generation and Editing
di: Hou, Ruibing, et al.
Pubblicazione: (2025)
di: Hou, Ruibing, et al.
Pubblicazione: (2025)
Clothes-Changing Person Re-Identification with Feasibility-Aware Intermediary Matching
di: Zhao, Jiahe, et al.
Pubblicazione: (2024)
di: Zhao, Jiahe, et al.
Pubblicazione: (2024)
Component-Based Out-of-Distribution Detection
di: Liu, Wenrui, et al.
Pubblicazione: (2026)
di: Liu, Wenrui, et al.
Pubblicazione: (2026)
DIVE: Inverting Conditional Diffusion Models for Discriminative Tasks
di: Li, Yinqi, et al.
Pubblicazione: (2025)
di: Li, Yinqi, et al.
Pubblicazione: (2025)
CLIP-Guided Adaptable Self-Supervised Learning for Human-Centric Visual Tasks
di: Luo, Mingshuang, et al.
Pubblicazione: (2026)
di: Luo, Mingshuang, et al.
Pubblicazione: (2026)
HumanPCR: Probing MLLM Capabilities in Diverse Human-Centric Scenes
di: Li, Keliang, et al.
Pubblicazione: (2025)
di: Li, Keliang, et al.
Pubblicazione: (2025)
Revisiting Logit Distributions for Reliable Out-of-Distribution Detection
di: Liang, Jiachen, et al.
Pubblicazione: (2025)
di: Liang, Jiachen, et al.
Pubblicazione: (2025)
UMFC: Unsupervised Multi-Domain Feature Calibration for Vision-Language Models
di: Liang, Jiachen, et al.
Pubblicazione: (2024)
di: Liang, Jiachen, et al.
Pubblicazione: (2024)
Generalized Semi-Supervised Learning via Self-Supervised Feature Adaptation
di: Liang, Jiachen, et al.
Pubblicazione: (2024)
di: Liang, Jiachen, et al.
Pubblicazione: (2024)
EgoMotion: Hierarchical Reasoning and Diffusion for Egocentric Vision-Language Motion Generation
di: Hou, Ruibing, et al.
Pubblicazione: (2026)
di: Hou, Ruibing, et al.
Pubblicazione: (2026)
AnyMo: Scaling Any-Modality Conditional Motion Generation with Masked Modeling
di: Li, Yiheng, et al.
Pubblicazione: (2026)
di: Li, Yiheng, et al.
Pubblicazione: (2026)
SceneGPT: A Language Model for 3D Scene Understanding
di: Chandhok, Shivam
Pubblicazione: (2024)
di: Chandhok, Shivam
Pubblicazione: (2024)
GPT4Scene: Understand 3D Scenes from Videos with Vision-Language Models
di: Qi, Zhangyang, et al.
Pubblicazione: (2025)
di: Qi, Zhangyang, et al.
Pubblicazione: (2025)
Revisiting Multimodal Positional Encoding in Vision-Language Models
di: Huang, Jie, et al.
Pubblicazione: (2025)
di: Huang, Jie, et al.
Pubblicazione: (2025)
Morph: A Motion-free Physics Optimization Framework for Human Motion Generation
di: Li, Zhuo, et al.
Pubblicazione: (2024)
di: Li, Zhuo, et al.
Pubblicazione: (2024)
GaussianGPT: Towards Autoregressive 3D Gaussian Scene Generation
di: von Lützow, Nicolas, et al.
Pubblicazione: (2026)
di: von Lützow, Nicolas, et al.
Pubblicazione: (2026)
Static for Dynamic: Towards a Deeper Understanding of Dynamic Facial Expressions Using Static Expression Data
di: Chen, Yin, et al.
Pubblicazione: (2024)
di: Chen, Yin, et al.
Pubblicazione: (2024)
R3DS: Reality-linked 3D Scenes for Panoramic Scene Understanding
di: Wu, Qirui, et al.
Pubblicazione: (2024)
di: Wu, Qirui, et al.
Pubblicazione: (2024)
LensWalk: Agentic Video Understanding by Planning How You See in Videos
di: Li, Keliang, et al.
Pubblicazione: (2026)
di: Li, Keliang, et al.
Pubblicazione: (2026)
Dense Multimodal Alignment for Open-Vocabulary 3D Scene Understanding
di: Li, Ruihuang, et al.
Pubblicazione: (2024)
di: Li, Ruihuang, et al.
Pubblicazione: (2024)
DC-Scene: Data-Centric Learning for 3D Scene Understanding
di: Huang, Ting, et al.
Pubblicazione: (2025)
di: Huang, Ting, et al.
Pubblicazione: (2025)
Contrastive Learning of Person-independent Representations for Facial Action Unit Detection
di: Li, Yong, et al.
Pubblicazione: (2024)
di: Li, Yong, et al.
Pubblicazione: (2024)
HERMES++: Toward a Unified Driving World Model for 3D Scene Understanding and Generation
di: Zhou, Xin, et al.
Pubblicazione: (2026)
di: Zhou, Xin, et al.
Pubblicazione: (2026)
OmniScene: Attention-Augmented Multimodal 4D Scene Understanding for Autonomous Driving
di: Liu, Pei, et al.
Pubblicazione: (2025)
di: Liu, Pei, et al.
Pubblicazione: (2025)
HMR3D: Hierarchical Multimodal Representation for 3D Scene Understanding with Large Vision-Language Model
di: Li, Chen, et al.
Pubblicazione: (2025)
di: Li, Chen, et al.
Pubblicazione: (2025)
Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts
di: Zhang, Yue, et al.
Pubblicazione: (2025)
di: Zhang, Yue, et al.
Pubblicazione: (2025)
SceneEval: Evaluating Semantic Coherence in Text-Conditioned 3D Indoor Scene Synthesis
di: Tam, Hou In Ivan, et al.
Pubblicazione: (2025)
di: Tam, Hou In Ivan, et al.
Pubblicazione: (2025)
3UR-LLM: An End-to-End Multimodal Large Language Model for 3D Scene Understanding
di: Xiong, Haomiao, et al.
Pubblicazione: (2025)
di: Xiong, Haomiao, et al.
Pubblicazione: (2025)
Open-Vocabulary Octree-Graph for 3D Scene Understanding
di: Wang, Zhigang, et al.
Pubblicazione: (2024)
di: Wang, Zhigang, et al.
Pubblicazione: (2024)
Open-Vocabulary SAM3D: Towards Training-free Open-Vocabulary 3D Scene Understanding
di: Tai, Hanchen, et al.
Pubblicazione: (2024)
di: Tai, Hanchen, et al.
Pubblicazione: (2024)
NAUTILUS: A Large Multimodal Model for Underwater Scene Understanding
di: Xu, Wei, et al.
Pubblicazione: (2025)
di: Xu, Wei, et al.
Pubblicazione: (2025)
ESGNN: Towards Equivariant Scene Graph Neural Network for 3D Scene Understanding
di: Pham, Quang P. M., et al.
Pubblicazione: (2024)
di: Pham, Quang P. M., et al.
Pubblicazione: (2024)
VisionGPT-3D: A Generalized Multimodal Agent for Enhanced 3D Vision Understanding
di: Kelly, Chris, et al.
Pubblicazione: (2024)
di: Kelly, Chris, et al.
Pubblicazione: (2024)
Towards Robust Semantic Segmentation against Patch-based Attack via Attention Refinement
di: Yuan, Zheng, et al.
Pubblicazione: (2024)
di: Yuan, Zheng, et al.
Pubblicazione: (2024)
EventGPT: Event Stream Understanding with Multimodal Large Language Models
di: Liu, Shaoyu, et al.
Pubblicazione: (2024)
di: Liu, Shaoyu, et al.
Pubblicazione: (2024)
Documenti analoghi
-
RefHCM: A Unified Model for Referring Perceptions in Human-Centric Scenarios
di: Huang, Jie, et al.
Pubblicazione: (2024) -
HERM: Benchmarking and Enhancing Multimodal LLMs for Human-Centric Understanding
di: Li, Keliang, et al.
Pubblicazione: (2024) -
M$^3$GPT: An Advanced Multimodal, Multitask Framework for Motion Comprehension and Generation
di: Luo, Mingshuang, et al.
Pubblicazione: (2024) -
un$^2$CLIP: Improving CLIP's Visual Detail Capturing Ability via Inverting unCLIP
di: Li, Yinqi, et al.
Pubblicazione: (2025) -
UniPose: A Unified Multimodal Framework for Human Pose Comprehension, Generation and Editing
di: Li, Yiheng, et al.
Pubblicazione: (2024)