Omni-MMSI: Toward Identity-attributed Social Interaction Understanding
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Xinpeng, Lai, Bolin, Chen, Hardy, Deng, Shijian, Xie, Cihang, Zhou, Yuyin, Rehg, James Matthew, Tian, Yapeng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Towards Online Multi-Modal Social Interaction Understanding
di: Li, Xinpeng, et al.
Pubblicazione: (2025)
di: Li, Xinpeng, et al.
Pubblicazione: (2025)
OmniSonic: Towards Universal and Holistic Audio Generation from Video and Text
di: Pian, Weiguo, et al.
Pubblicazione: (2026)
di: Pian, Weiguo, et al.
Pubblicazione: (2026)
SocialGesture: Delving into Multi-person Gesture Understanding
di: Cao, Xu, et al.
Pubblicazione: (2025)
di: Cao, Xu, et al.
Pubblicazione: (2025)
Modeling Multimodal Social Interactions: New Challenges and Baselines with Densely Aligned Representations
di: Lee, Sangmin, et al.
Pubblicazione: (2024)
di: Lee, Sangmin, et al.
Pubblicazione: (2024)
In the Eye of Transformer: Global-Local Correlation for Egocentric Gaze Estimation
di: Lai, Bolin, et al.
Pubblicazione: (2022)
di: Lai, Bolin, et al.
Pubblicazione: (2022)
ARGaze: Autoregressive Transformers for Online Egocentric Gaze Estimation
di: Li, Jia, et al.
Pubblicazione: (2026)
di: Li, Jia, et al.
Pubblicazione: (2026)
Listen to Look into the Future: Audio-Visual Egocentric Gaze Anticipation
di: Lai, Bolin, et al.
Pubblicazione: (2023)
di: Lai, Bolin, et al.
Pubblicazione: (2023)
MM-SpuBench: Towards Better Understanding of Spurious Biases in Multimodal LLMs
di: Ye, Wenqian, et al.
Pubblicazione: (2024)
di: Ye, Wenqian, et al.
Pubblicazione: (2024)
Toward Diffusible High-Dimensional Latent Spaces: A Frequency Perspective
di: Lai, Bolin, et al.
Pubblicazione: (2025)
di: Lai, Bolin, et al.
Pubblicazione: (2025)
Sculpting Holistic 3D Representation in Contrastive Language-Image-3D Pre-training
di: Gao, Yipeng, et al.
Pubblicazione: (2023)
di: Gao, Yipeng, et al.
Pubblicazione: (2023)
GRASP: Learning to Ground Social Reasoning in Multi-Person Non-Verbal Interactions
di: Kim, Junho, et al.
Pubblicazione: (2026)
di: Kim, Junho, et al.
Pubblicazione: (2026)
Learning Predictive Visuomotor Coordination
di: Jia, Wenqi, et al.
Pubblicazione: (2025)
di: Jia, Wenqi, et al.
Pubblicazione: (2025)
AV-DiT: Efficient Audio-Visual Diffusion Transformer for Joint Audio and Video Generation
di: Wang, Kai, et al.
Pubblicazione: (2024)
di: Wang, Kai, et al.
Pubblicazione: (2024)
MMSI-Bench: A Benchmark for Multi-Image Spatial Intelligence
di: Yang, Sihan, et al.
Pubblicazione: (2025)
di: Yang, Sihan, et al.
Pubblicazione: (2025)
Unified Text-Image-to-Video Generation: A Training-Free Approach to Flexible Visual Conditioning
di: Lai, Bolin, et al.
Pubblicazione: (2025)
di: Lai, Bolin, et al.
Pubblicazione: (2025)
Distillation Dynamics: Towards Understanding Feature-Based Distillation in Vision Transformers
di: Tian, Huiyuan, et al.
Pubblicazione: (2025)
di: Tian, Huiyuan, et al.
Pubblicazione: (2025)
LEGO: Learning EGOcentric Action Frame Generation via Visual Instruction Tuning
di: Lai, Bolin, et al.
Pubblicazione: (2023)
di: Lai, Bolin, et al.
Pubblicazione: (2023)
From Seeing to Thinking: Decoupling Perception and Reasoning Improves Post-Training of Vision-Language Models
di: Wu, Juncheng, et al.
Pubblicazione: (2026)
di: Wu, Juncheng, et al.
Pubblicazione: (2026)
$\texttt{Complex-Edit}$: CoT-Like Instruction Generation for Complexity-Controllable Image Editing Benchmark
di: Yang, Siwei, et al.
Pubblicazione: (2025)
di: Yang, Siwei, et al.
Pubblicazione: (2025)
MMSI-Video-Bench: A Holistic Benchmark for Video-Based Spatial Intelligence
di: Lin, Jingli, et al.
Pubblicazione: (2025)
di: Lin, Jingli, et al.
Pubblicazione: (2025)
OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning
di: Liu, Yanqing, et al.
Pubblicazione: (2025)
di: Liu, Yanqing, et al.
Pubblicazione: (2025)
Scaling White-Box Transformers for Vision
di: Yang, Jinrui, et al.
Pubblicazione: (2024)
di: Yang, Jinrui, et al.
Pubblicazione: (2024)
Scaling Laws in Patchification: An Image Is Worth 50,176 Tokens And More
di: Wang, Feng, et al.
Pubblicazione: (2025)
di: Wang, Feng, et al.
Pubblicazione: (2025)
GPT-IMAGE-EDIT-1.5M: A Million-Scale, GPT-Generated Image Dataset
di: Wang, Yuhan, et al.
Pubblicazione: (2025)
di: Wang, Yuhan, et al.
Pubblicazione: (2025)
3D-TransUNet for Brain Metastases Segmentation in the BraTS2023 Challenge
di: Yang, Siwei, et al.
Pubblicazione: (2024)
di: Yang, Siwei, et al.
Pubblicazione: (2024)
Kestrel: Grounding Self-Refinement for LVLM Hallucination Mitigation
di: Mao, Jiawei, et al.
Pubblicazione: (2026)
di: Mao, Jiawei, et al.
Pubblicazione: (2026)
Explainable AI-Generated Image Detection RewardBench
di: Yang, Michael, et al.
Pubblicazione: (2025)
di: Yang, Michael, et al.
Pubblicazione: (2025)
L2B: Learning to Bootstrap Robust Models for Combating Label Noise
di: Zhou, Yuyin, et al.
Pubblicazione: (2022)
di: Zhou, Yuyin, et al.
Pubblicazione: (2022)
A Unified and Controllable Framework for Layered Image Generation with Visual Effects
di: Yang, Jinrui, et al.
Pubblicazione: (2026)
di: Yang, Jinrui, et al.
Pubblicazione: (2026)
Where on Earth? A Vision-Language Benchmark for Probing Model Geolocation Skills Across Scales
di: Qian, Zhaofang, et al.
Pubblicazione: (2025)
di: Qian, Zhaofang, et al.
Pubblicazione: (2025)
MedTrinity-25M: A Large-scale Multimodal Dataset with Multigranular Annotations for Medicine
di: Xie, Yunfei, et al.
Pubblicazione: (2024)
di: Xie, Yunfei, et al.
Pubblicazione: (2024)
ROMA: Real-time Omni-Multimodal Assistant with Interactive Streaming Understanding
di: Tian, Xueyun, et al.
Pubblicazione: (2026)
di: Tian, Xueyun, et al.
Pubblicazione: (2026)
ARFlow: Autoregressive Flow with Hybrid Linear Attention
di: Hui, Mude, et al.
Pubblicazione: (2025)
di: Hui, Mude, et al.
Pubblicazione: (2025)
IAM: Identity-Aware Human Motion and Shape Joint Generation
di: Jia, Wenqi, et al.
Pubblicazione: (2026)
di: Jia, Wenqi, et al.
Pubblicazione: (2026)
HQ-Edit: A High-Quality Dataset for Instruction-based Image Editing
di: Hui, Mude, et al.
Pubblicazione: (2024)
di: Hui, Mude, et al.
Pubblicazione: (2024)
Mamba-R: Vision Mamba ALSO Needs Registers
di: Wang, Feng, et al.
Pubblicazione: (2024)
di: Wang, Feng, et al.
Pubblicazione: (2024)
Story-Iter: A Training-free Iterative Paradigm for Long Story Visualization
di: Mao, Jiawei, et al.
Pubblicazione: (2024)
di: Mao, Jiawei, et al.
Pubblicazione: (2024)
OmniPerson: Unified Identity-Preserving Pedestrian Generation
di: Ma, Changxiao, et al.
Pubblicazione: (2025)
di: Ma, Changxiao, et al.
Pubblicazione: (2025)
OmniSTVG: Toward Spatio-Temporal Omni-Object Video Grounding
di: Yao, Jiali, et al.
Pubblicazione: (2025)
di: Yao, Jiali, et al.
Pubblicazione: (2025)
ViLBench: A Suite for Vision-Language Process Reward Modeling
di: Tu, Haoqin, et al.
Pubblicazione: (2025)
di: Tu, Haoqin, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Towards Online Multi-Modal Social Interaction Understanding
di: Li, Xinpeng, et al.
Pubblicazione: (2025) -
OmniSonic: Towards Universal and Holistic Audio Generation from Video and Text
di: Pian, Weiguo, et al.
Pubblicazione: (2026) -
SocialGesture: Delving into Multi-person Gesture Understanding
di: Cao, Xu, et al.
Pubblicazione: (2025) -
Modeling Multimodal Social Interactions: New Challenges and Baselines with Densely Aligned Representations
di: Lee, Sangmin, et al.
Pubblicazione: (2024) -
In the Eye of Transformer: Global-Local Correlation for Egocentric Gaze Estimation
di: Lai, Bolin, et al.
Pubblicazione: (2022)