AllSpark: A Multimodal Spatio-Temporal General Intelligence Model with Ten Modalities via Language as a Reference Framework
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Shao, Run, Yang, Cheng, Li, Qiujun, Zhu, Qing, Zhang, Yongjun, Li, YanSheng, Liu, Yu, Tang, Yong, Liu, Dapeng, Yang, Shizhong, Li, Haifeng |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
AllSpark: Reborn Labeled Features from Unlabeled in Transformer for Semi-Supervised Semantic Segmentation
par: Wang, Haonan, et autres
Publié: (2024)
par: Wang, Haonan, et autres
Publié: (2024)
LocationAgent: A Hierarchical Agent for Image Geolocation via Decoupling Strategy and Evidence from Parametric Knowledge
par: Li, Qiujun, et autres
Publié: (2026)
par: Li, Qiujun, et autres
Publié: (2026)
PixelRefer: A Unified Framework for Spatio-Temporal Object Referring with Arbitrary Granularity
par: Yuan, Yuqian, et autres
Publié: (2025)
par: Yuan, Yuqian, et autres
Publié: (2025)
RS-GPT4V: A Unified Multimodal Instruction-Following Dataset for Remote Sensing Image Understanding
par: Xu, Linrui, et autres
Publié: (2024)
par: Xu, Linrui, et autres
Publié: (2024)
Adaptive Channel Estimation and Hybrid Beamforming for RIS aided Vehicular Communication
par: Li, Tianyou, et autres
Publié: (2026)
par: Li, Tianyou, et autres
Publié: (2026)
Fabrication and Analysis of the Wear Properties of High‐Vanadium High‐Speed Steel through Spark Plasma Sintering
par: Shuaiwu Tong, et autres
Publié: (2024)
par: Shuaiwu Tong, et autres
Publié: (2024)
Genesis: Multimodal Driving Scene Generation with Spatio-Temporal and Cross-Modal Consistency
par: Guo, Xiangyu, et autres
Publié: (2025)
par: Guo, Xiangyu, et autres
Publié: (2025)
SpaceVLLM: Endowing Multimodal Large Language Model with Spatio-Temporal Video Grounding Capability
par: Wang, Jiankang, et autres
Publié: (2025)
par: Wang, Jiankang, et autres
Publié: (2025)
STA-GANN: A Valid and Generalizable Spatio-Temporal Kriging Approach
par: Li, Yujie, et autres
Publié: (2025)
par: Li, Yujie, et autres
Publié: (2025)
Spatio-Temporal Few-Shot Learning via Diffusive Neural Network Generation
par: Yuan, Yuan, et autres
Publié: (2024)
par: Yuan, Yuan, et autres
Publié: (2024)
Unleashing the Potential of Multimodal LLMs for Zero-Shot Spatio-Temporal Video Grounding
par: Yang, Zaiquan, et autres
Publié: (2025)
par: Yang, Zaiquan, et autres
Publié: (2025)
LiDAR Prompted Spatio-Temporal Multi-View Stereo for Autonomous Driving
par: Sun, Qihao, et autres
Publié: (2026)
par: Sun, Qihao, et autres
Publié: (2026)
The Wittgensteinian Representation Hypothesis: Is Language the Attractor of Multimodal Convergence?
par: Zhang, Zhaoyang, et autres
Publié: (2026)
par: Zhang, Zhaoyang, et autres
Publié: (2026)
A Refer-and-Ground Multimodal Large Language Model for Biomedicine
par: Huang, Xiaoshuang, et autres
Publié: (2024)
par: Huang, Xiaoshuang, et autres
Publié: (2024)
Jointly Modeling Spatio-Temporal Features of Tactile Signals for Action Classification
par: Lin, Jimmy, et autres
Publié: (2024)
par: Lin, Jimmy, et autres
Publié: (2024)
Transformer RGBT Tracking with Spatio-Temporal Multimodal Tokens
par: Sun, Dengdi, et autres
Publié: (2024)
par: Sun, Dengdi, et autres
Publié: (2024)
STaR-Attack: A Spatio-Temporal and Narrative Reasoning Attack Framework for Unified Multimodal Understanding and Generation Models
par: Guo, Shaoxiong, et autres
Publié: (2025)
par: Guo, Shaoxiong, et autres
Publié: (2025)
Air Quality Prediction with A Meteorology-Guided Modality-Decoupled Spatio-Temporal Network
par: Yin, Hang, et autres
Publié: (2025)
par: Yin, Hang, et autres
Publié: (2025)
Robust Multimodal Semantic Segmentation with Balanced Modality Contributions
par: Tan, Jiaqi, et autres
Publié: (2025)
par: Tan, Jiaqi, et autres
Publié: (2025)
Mining Multi-Modality Spatio-Temporal Cues for Video Important Person Identification
par: Wang, Xiao, et autres
Publié: (2026)
par: Wang, Xiao, et autres
Publié: (2026)
Multimodal Contrastive Learning via Uni-Modal Coding and Cross-Modal Prediction for Multimodal Sentiment Analysis
par: Lin, Ronghao, et autres
Publié: (2022)
par: Lin, Ronghao, et autres
Publié: (2022)
UniFlow: A Foundation Model for Unified Urban Spatio-Temporal Flow Prediction
par: Yuan, Yuan, et autres
Publié: (2024)
par: Yuan, Yuan, et autres
Publié: (2024)
AsyReC: A Multimodal Graph-based Framework for Spatio-Temporal Asymmetric Dyadic Relationship Classification
par: Tang, Wang, et autres
Publié: (2025)
par: Tang, Wang, et autres
Publié: (2025)
Value-Decomposed Reinforcement Learning Framework for Taxiway Routing with Hierarchical Conflict-Aware Observations
par: Zhou, Shizhong, et autres
Publié: (2026)
par: Zhou, Shizhong, et autres
Publié: (2026)
GLIDE: Graph-guided Leap Inference for Diffusion Estimation of Spatio-Temporal Point Processes
par: Zhou, Guanyu, et autres
Publié: (2026)
par: Zhou, Guanyu, et autres
Publié: (2026)
UrbanGPT: Spatio-Temporal Large Language Models
par: Li, Zhonghang, et autres
Publié: (2024)
par: Li, Zhonghang, et autres
Publié: (2024)
DMTrack: Spatio-Temporal Multimodal Tracking via Dual-Adapter
par: Li, Weihong, et autres
Publié: (2025)
par: Li, Weihong, et autres
Publié: (2025)
Crip Spacetime: Access, Failure, and Accountability in Academic Life. By MargaretPrice, Durham: Duke University Press, 2024. 240 pp. $26.95 (paper). ISBN: 978‐1‐47‐803037‐9; $102.95 (hardcover). ISBN: 978‐1‐47‐802613‐6
par: Leyan Zheng, et autres
Publié: (2025)
par: Leyan Zheng, et autres
Publié: (2025)
STQuant: Spatio-Temporal Adaptive Framework for Optimizer Quantization in Large Multimodal Model Training
par: Liu, Minglu, et autres
Publié: (2026)
par: Liu, Minglu, et autres
Publié: (2026)
Interacted Object Grounding in Spatio-Temporal Human-Object Interactions
par: Liu, Xiaoyang, et autres
Publié: (2024)
par: Liu, Xiaoyang, et autres
Publié: (2024)
Enhancing SNN-based Spatio-Temporal Learning: A Benchmark Dataset and Cross-Modality Attention Model
par: Zhou, Shibo, et autres
Publié: (2024)
par: Zhou, Shibo, et autres
Publié: (2024)
Global Spatio-Temporal Fusion-based Traffic Prediction Algorithm with Anomaly Aware
par: Liu, Chaoqun, et autres
Publié: (2024)
par: Liu, Chaoqun, et autres
Publié: (2024)
Graph Learning-Driven Multi-Vessel Association: Fusing Multimodal Data for Maritime Intelligence
par: Lu, Yuxu, et autres
Publié: (2025)
par: Lu, Yuxu, et autres
Publié: (2025)
Decoupled Diffusion Sparks Adaptive Scene Generation
par: Zhou, Yunsong, et autres
Publié: (2025)
par: Zhou, Yunsong, et autres
Publié: (2025)
Multimodal Classification via Modal-Aware Interactive Enhancement
par: Jiang, Qing-Yuan, et autres
Publié: (2024)
par: Jiang, Qing-Yuan, et autres
Publié: (2024)
System States Forecasting of Microservices with Dynamic Spatio-Temporal Data
par: Xu, Yifei, et autres
Publié: (2024)
par: Xu, Yifei, et autres
Publié: (2024)
Learnability in Online Kernel Selection with Memory Constraint via Data-dependent Regret Analysis
par: Li, Junfan, et autres
Publié: (2024)
par: Li, Junfan, et autres
Publié: (2024)
Improved Kernel Alignment Regret Bound for Online Kernel Learning
par: Li, Junfan, et autres
Publié: (2022)
par: Li, Junfan, et autres
Publié: (2022)
TreeMIL: A Multi-instance Learning Framework for Time Series Anomaly Detection with Inexact Supervision
par: Liu, Chen, et autres
Publié: (2024)
par: Liu, Chen, et autres
Publié: (2024)
Modality-Guided Dynamic Graph Fusion and Temporal Diffusion for Self-Supervised RGB-T Tracking
par: Li, Shenglan, et autres
Publié: (2025)
par: Li, Shenglan, et autres
Publié: (2025)
Documents similaires
-
AllSpark: Reborn Labeled Features from Unlabeled in Transformer for Semi-Supervised Semantic Segmentation
par: Wang, Haonan, et autres
Publié: (2024) -
LocationAgent: A Hierarchical Agent for Image Geolocation via Decoupling Strategy and Evidence from Parametric Knowledge
par: Li, Qiujun, et autres
Publié: (2026) -
PixelRefer: A Unified Framework for Spatio-Temporal Object Referring with Arbitrary Granularity
par: Yuan, Yuqian, et autres
Publié: (2025) -
RS-GPT4V: A Unified Multimodal Instruction-Following Dataset for Remote Sensing Image Understanding
par: Xu, Linrui, et autres
Publié: (2024) -
Adaptive Channel Estimation and Hybrid Beamforming for RIS aided Vehicular Communication
par: Li, Tianyou, et autres
Publié: (2026)