A Large-Scale Multimodal Dataset and Benchmarks for Human Activity Scene Understanding and Reasoning
Fuente:
arXiv
Salvato in:
| Autori principali: | Jiang, Siyang, Yuan, Mu, Ji, Xiang, Yang, Bufang, Liu, Zeyu, Xu, Lilin, Li, Yang, He, Yuting, Dong, Liran, Lu, Wenrui, Yan, Zhenyu, Jiang, Xiaofan, Gao, Wei, Chen, Hongkai, Xing, Guoliang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
DrHouse: An LLM-empowered Diagnostic Reasoning System through Harnessing Outcomes from Sensor Data and Expert Knowledge
di: Yang, Bufang, et al.
Pubblicazione: (2024)
di: Yang, Bufang, et al.
Pubblicazione: (2024)
ContextAgent: Context-Aware Proactive LLM Agents with Open-World Sensory Perceptions
di: Yang, Bufang, et al.
Pubblicazione: (2025)
di: Yang, Bufang, et al.
Pubblicazione: (2025)
An LLM-Empowered Low-Resolution Vision System for On-Device Human Behavior Understanding
di: Jiang, Siyang, et al.
Pubblicazione: (2025)
di: Jiang, Siyang, et al.
Pubblicazione: (2025)
SocialMind: LLM-based Proactive AR Social Assistive System with Human-like Perception for In-situ Live Interactions
di: Yang, Bufang, et al.
Pubblicazione: (2024)
di: Yang, Bufang, et al.
Pubblicazione: (2024)
Pro$^2$Assist: Continuous Step-Aware Proactive Assistance with Multimodal Egocentric Perception for Long-Horizon Procedural Tasks
di: Xu, Lilin, et al.
Pubblicazione: (2026)
di: Xu, Lilin, et al.
Pubblicazione: (2026)
ProAgent: Harnessing On-Demand Sensory Contexts for Proactive LLM Agent Systems in the Wild
di: Yang, Bufang, et al.
Pubblicazione: (2025)
di: Yang, Bufang, et al.
Pubblicazione: (2025)
SensorPersona: An LLM-Empowered System for Continual Persona Extraction from Longitudinal Mobile Sensor Streams
di: Yang, Bufang, et al.
Pubblicazione: (2026)
di: Yang, Bufang, et al.
Pubblicazione: (2026)
Exploring the Capabilities of LLMs for IMU-based Fine-grained Human Activity Understanding
di: Xu, Lilin, et al.
Pubblicazione: (2025)
di: Xu, Lilin, et al.
Pubblicazione: (2025)
EgoLog: Ego-Centric Fine-Grained Daily Log with Ubiquitous Wearables
di: He, Lixing, et al.
Pubblicazione: (2025)
di: He, Lixing, et al.
Pubblicazione: (2025)
PerCache: Predictive Hierarchical Cache for RAG Applications on Mobile Devices
di: Liu, Kaiwei, et al.
Pubblicazione: (2025)
di: Liu, Kaiwei, et al.
Pubblicazione: (2025)
Visualizing the Invisible: A Generative AR System for Intuitive Multi-Modal Sensor Data Presentation
di: Guo, Yunqi, et al.
Pubblicazione: (2024)
di: Guo, Yunqi, et al.
Pubblicazione: (2024)
TDBench: A Benchmark for Top-Down Image Understanding with Reliability Analysis of Vision-Language Models
di: Hou, Kaiyuan, et al.
Pubblicazione: (2025)
di: Hou, Kaiyuan, et al.
Pubblicazione: (2025)
DeepFeature: Iterative Context-aware Feature Generation for Wearable Biosignals
di: Liu, Kaiwei, et al.
Pubblicazione: (2025)
di: Liu, Kaiwei, et al.
Pubblicazione: (2025)
Synera: Synergistic LLM Serving across Device and Cloud at Scale
di: Wang, Genglin, et al.
Pubblicazione: (2025)
di: Wang, Genglin, et al.
Pubblicazione: (2025)
SHADE-AD: An LLM-Based Framework for Synthesizing Activity Data of Alzheimer's Patients
di: Fu, Heming, et al.
Pubblicazione: (2025)
di: Fu, Heming, et al.
Pubblicazione: (2025)
CURE: A Multimodal Benchmark for Clinical Understanding and Retrieval Evaluation
di: Gu, Yannian, et al.
Pubblicazione: (2026)
di: Gu, Yannian, et al.
Pubblicazione: (2026)
VIAssist: Adapting Multi-modal Large Language Models for Users with Visual Impairments
di: Yang, Bufang, et al.
Pubblicazione: (2024)
di: Yang, Bufang, et al.
Pubblicazione: (2024)
Lancelot: Towards Efficient and Privacy-Preserving Byzantine-Robust Federated Learning within Fully Homomorphic Encryption
di: Jiang, Siyang, et al.
Pubblicazione: (2024)
di: Jiang, Siyang, et al.
Pubblicazione: (2024)
NuScenes-SpatialQA: A Spatial Understanding and Reasoning Benchmark for Vision-Language Models in Autonomous Driving
di: Tian, Kexin, et al.
Pubblicazione: (2025)
di: Tian, Kexin, et al.
Pubblicazione: (2025)
RAM-Net: Expressive Linear Attention with Selectively Addressable Memory
di: Xiao, Kaicheng, et al.
Pubblicazione: (2026)
di: Xiao, Kaicheng, et al.
Pubblicazione: (2026)
MECO: A Multimodal Dataset for Emotion and Cognitive Understanding in Older Adults
di: Chen, Hongbin, et al.
Pubblicazione: (2026)
di: Chen, Hongbin, et al.
Pubblicazione: (2026)
Soar: Design and Deployment of A Smart Roadside Infrastructure System for Autonomous Driving
di: Shi, Shuyao, et al.
Pubblicazione: (2024)
di: Shi, Shuyao, et al.
Pubblicazione: (2024)
SKG-VLA: Scene Knowledge Graph Priors for Structured Scene Semantics and Multimodal Reasoning for Decision Making
di: Li, Zeyu, et al.
Pubblicazione: (2026)
di: Li, Zeyu, et al.
Pubblicazione: (2026)
NAUTILUS: A Large Multimodal Model for Underwater Scene Understanding
di: Xu, Wei, et al.
Pubblicazione: (2025)
di: Xu, Wei, et al.
Pubblicazione: (2025)
DC-Scene: Data-Centric Learning for 3D Scene Understanding
di: Huang, Ting, et al.
Pubblicazione: (2025)
di: Huang, Ting, et al.
Pubblicazione: (2025)
VNU-Bench: A Benchmarking Dataset for Multi-Source Multimodal News Video Understanding
di: Liu, Zibo, et al.
Pubblicazione: (2026)
di: Liu, Zibo, et al.
Pubblicazione: (2026)
SurgMLLMBench: A Multimodal Large Language Model Benchmark Dataset for Surgical Scene Understanding
di: Choi, Tae-Min, et al.
Pubblicazione: (2025)
di: Choi, Tae-Min, et al.
Pubblicazione: (2025)
XFacta: Contemporary, Real-World Dataset and Evaluation for Multimodal Misinformation Detection with Multimodal LLMs
di: Xiao, Yuzhuo, et al.
Pubblicazione: (2025)
di: Xiao, Yuzhuo, et al.
Pubblicazione: (2025)
MME-Unify: A Comprehensive Benchmark for Unified Multimodal Understanding and Generation Models
di: Xie, Wulin, et al.
Pubblicazione: (2025)
di: Xie, Wulin, et al.
Pubblicazione: (2025)
Multimodal 3D Reasoning Segmentation with Complex Scenes
di: Jiang, Xueying, et al.
Pubblicazione: (2024)
di: Jiang, Xueying, et al.
Pubblicazione: (2024)
Multimodal Inconsistency Reasoning (MMIR): A New Benchmark for Multimodal Reasoning Models
di: Yan, Qianqi, et al.
Pubblicazione: (2025)
di: Yan, Qianqi, et al.
Pubblicazione: (2025)
Emotion and Intent Joint Understanding in Multimodal Conversation: A Benchmarking Dataset
di: Liu, Rui, et al.
Pubblicazione: (2024)
di: Liu, Rui, et al.
Pubblicazione: (2024)
Introducing Visual Scenes and Reasoning: A More Realistic Benchmark for Spoken Language Understanding
di: Wu, Di, et al.
Pubblicazione: (2025)
di: Wu, Di, et al.
Pubblicazione: (2025)
Reasoning with Autoregressive-Diffusion Collaborative Thoughts
di: Yuan, Mu, et al.
Pubblicazione: (2026)
di: Yuan, Mu, et al.
Pubblicazione: (2026)
Sim2Radar: Toward Bridging the Radar Sim-to-Real Gap with VLM-Guided Scene Reconstruction
di: Bejerano, Emily, et al.
Pubblicazione: (2026)
di: Bejerano, Emily, et al.
Pubblicazione: (2026)
Elicit and Enhance: Advancing Multimodal Reasoning in Medical Scenarios
di: Huang, Zhongzhen, et al.
Pubblicazione: (2025)
di: Huang, Zhongzhen, et al.
Pubblicazione: (2025)
MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI
di: Yue, Xiang, et al.
Pubblicazione: (2023)
di: Yue, Xiang, et al.
Pubblicazione: (2023)
Can Large Multimodal Models Understand Agricultural Scenes? Benchmarking with AgroMind
di: Li, Qingmei, et al.
Pubblicazione: (2025)
di: Li, Qingmei, et al.
Pubblicazione: (2025)
3D-R1: Enhancing Reasoning in 3D VLMs for Unified Scene Understanding
di: Huang, Ting, et al.
Pubblicazione: (2025)
di: Huang, Ting, et al.
Pubblicazione: (2025)
Lightweight Structured Multimodal Reasoning for Clinical Scene Understanding in Robotics
di: Jha, Saurav, et al.
Pubblicazione: (2025)
di: Jha, Saurav, et al.
Pubblicazione: (2025)
Documenti analoghi
-
DrHouse: An LLM-empowered Diagnostic Reasoning System through Harnessing Outcomes from Sensor Data and Expert Knowledge
di: Yang, Bufang, et al.
Pubblicazione: (2024) -
ContextAgent: Context-Aware Proactive LLM Agents with Open-World Sensory Perceptions
di: Yang, Bufang, et al.
Pubblicazione: (2025) -
An LLM-Empowered Low-Resolution Vision System for On-Device Human Behavior Understanding
di: Jiang, Siyang, et al.
Pubblicazione: (2025) -
SocialMind: LLM-based Proactive AR Social Assistive System with Human-like Perception for In-situ Live Interactions
di: Yang, Bufang, et al.
Pubblicazione: (2024) -
Pro$^2$Assist: Continuous Step-Aware Proactive Assistance with Multimodal Egocentric Perception for Long-Horizon Procedural Tasks
di: Xu, Lilin, et al.
Pubblicazione: (2026)