HoloLLM: Multisensory Foundation Model for Language-Grounded Human Sensing and Reasoning
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhou, Chuhao, Yang, Jianfei |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Foundations of Multisensory Artificial Intelligence
por: Liang, Paul Pu
Publicado: (2024)
por: Liang, Paul Pu
Publicado: (2024)
IoT-LM: Large Multisensory Language Models for the Internet of Things
por: Mo, Shentong, et al.
Publicado: (2024)
por: Mo, Shentong, et al.
Publicado: (2024)
MB-ORES: A Multi-Branch Object Reasoner for Visual Grounding in Remote Sensing
por: Radouane, Karim, et al.
Publicado: (2025)
por: Radouane, Karim, et al.
Publicado: (2025)
OneLLM: One Framework to Align All Modalities with Language
por: Han, Jiaming, et al.
Publicado: (2023)
por: Han, Jiaming, et al.
Publicado: (2023)
Building a Precise Video Language with Human-AI Oversight
por: Lin, Zhiqiu, et al.
Publicado: (2026)
por: Lin, Zhiqiu, et al.
Publicado: (2026)
OceanPile: A Large-Scale Multimodal Ocean Corpus for Foundation Models
por: Xue, Yida, et al.
Publicado: (2026)
por: Xue, Yida, et al.
Publicado: (2026)
LookAhead Tuning: Safer Language Models via Partial Answer Previews
por: Liu, Kangwei, et al.
Publicado: (2025)
por: Liu, Kangwei, et al.
Publicado: (2025)
LLaMA-Adapter: Efficient Fine-tuning of Language Models with Zero-init Attention
por: Zhang, Renrui, et al.
Publicado: (2023)
por: Zhang, Renrui, et al.
Publicado: (2023)
Argus Inspection: Do Multimodal Large Language Models Possess the Eye of Panoptes?
por: Yao, Yang, et al.
Publicado: (2025)
por: Yao, Yang, et al.
Publicado: (2025)
Human-Centric Foundation Models: Perception, Generation and Agentic Modeling
por: Tang, Shixiang, et al.
Publicado: (2025)
por: Tang, Shixiang, et al.
Publicado: (2025)
Scalable Object Relation Encoding for Better 3D Spatial Reasoning in Large Language Models
por: Zhou, Shengli, et al.
Publicado: (2026)
por: Zhou, Shengli, et al.
Publicado: (2026)
Can We Edit Multimodal Large Language Models?
por: Cheng, Siyuan, et al.
Publicado: (2023)
por: Cheng, Siyuan, et al.
Publicado: (2023)
To Forget or Not? Towards Practical Knowledge Unlearning for Large Language Models
por: Tian, Bozhong, et al.
Publicado: (2024)
por: Tian, Bozhong, et al.
Publicado: (2024)
Beyond the Leaderboard: Rethinking Medical Benchmarks for Large Language Models
por: Chen, Wenting, et al.
Publicado: (2025)
por: Chen, Wenting, et al.
Publicado: (2025)
RAP: Retrieval-Augmented Personalization for Multimodal Large Language Models
por: Hao, Haoran, et al.
Publicado: (2024)
por: Hao, Haoran, et al.
Publicado: (2024)
From Linguistic Giants to Sensory Maestros: A Survey on Cross-Modal Reasoning with Large Language Models
por: Qian, Shengsheng, et al.
Publicado: (2024)
por: Qian, Shengsheng, et al.
Publicado: (2024)
Beyond Embeddings: The Promise of Visual Table in Visual Reasoning
por: Zhong, Yiwu, et al.
Publicado: (2024)
por: Zhong, Yiwu, et al.
Publicado: (2024)
PlanLLM: Video Procedure Planning with Refinable Large Language Models
por: Yang, Dejie, et al.
Publicado: (2024)
por: Yang, Dejie, et al.
Publicado: (2024)
Words or Vision: Do Vision-Language Models Have Blind Faith in Text?
por: Deng, Ailin, et al.
Publicado: (2025)
por: Deng, Ailin, et al.
Publicado: (2025)
Seeing is Believing: Mitigating Hallucination in Large Vision-Language Models via CLIP-Guided Decoding
por: Deng, Ailin, et al.
Publicado: (2024)
por: Deng, Ailin, et al.
Publicado: (2024)
HLL: Can Agents Cross Humanity's Last Line of Verification?
por: Song, Xinhao, et al.
Publicado: (2026)
por: Song, Xinhao, et al.
Publicado: (2026)
WorDepth: Variational Language Prior for Monocular Depth Estimation
por: Zeng, Ziyao, et al.
Publicado: (2024)
por: Zeng, Ziyao, et al.
Publicado: (2024)
GoT-R1: Unleashing Reasoning Capability of MLLM for Visual Generation with Reinforcement Learning
por: Duan, Chengqi, et al.
Publicado: (2025)
por: Duan, Chengqi, et al.
Publicado: (2025)
OmniEvalKit: A Modular, Lightweight Toolbox for Evaluating Large Language Model and its Omni-Extensions
por: Zhang, Yi-Kai, et al.
Publicado: (2024)
por: Zhang, Yi-Kai, et al.
Publicado: (2024)
Factorized Learning for Temporally Grounded Video-Language Models
por: Zeng, Wenzheng, et al.
Publicado: (2025)
por: Zeng, Wenzheng, et al.
Publicado: (2025)
Data or Language Supervision: What Makes CLIP Better than DINO?
por: Liu, Yiming, et al.
Publicado: (2025)
por: Liu, Yiming, et al.
Publicado: (2025)
State Space Model for New-Generation Network Alternative to Transformers: A Survey
por: Wang, Xiao, et al.
Publicado: (2024)
por: Wang, Xiao, et al.
Publicado: (2024)
Seeing Culture: A Benchmark for Visual Reasoning and Grounding
por: Satar, Burak, et al.
Publicado: (2025)
por: Satar, Burak, et al.
Publicado: (2025)
X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models
por: Sun, Zeyi, et al.
Publicado: (2024)
por: Sun, Zeyi, et al.
Publicado: (2024)
Multimodal Long Video Modeling Based on Temporal Dynamic Context
por: Hao, Haoran, et al.
Publicado: (2025)
por: Hao, Haoran, et al.
Publicado: (2025)
Aligning Agentic World Models via Knowledgeable Experience Learning
por: Ren, Baochang, et al.
Publicado: (2026)
por: Ren, Baochang, et al.
Publicado: (2026)
SILMM: Self-Improving Large Multimodal Models for Compositional Text-to-Image Generation
por: Qu, Leigang, et al.
Publicado: (2024)
por: Qu, Leigang, et al.
Publicado: (2024)
ZJUKLAB at SemEval-2025 Task 4: Unlearning via Model Merging
por: Xu, Haoming, et al.
Publicado: (2025)
por: Xu, Haoming, et al.
Publicado: (2025)
TIGeR: Unifying Text-to-Image Generation and Retrieval with Large Multimodal Models
por: Qu, Leigang, et al.
Publicado: (2024)
por: Qu, Leigang, et al.
Publicado: (2024)
AID: Adapting Image2Video Diffusion Models for Instruction-guided Video Prediction
por: Xing, Zhen, et al.
Publicado: (2024)
por: Xing, Zhen, et al.
Publicado: (2024)
Heracles: A Hybrid SSM-Transformer Model for High-Resolution Image and Time-Series Analysis
por: Patro, Badri N., et al.
Publicado: (2024)
por: Patro, Badri N., et al.
Publicado: (2024)
Improving Prediction Performance and Model Interpretability through Attention Mechanisms from Basic and Applied Research Perspectives
por: Kitada, Shunsuke
Publicado: (2023)
por: Kitada, Shunsuke
Publicado: (2023)
Finding Distributed Object-Centric Properties in Self-Supervised Transformers
por: Rawlekar, Samyak, et al.
Publicado: (2026)
por: Rawlekar, Samyak, et al.
Publicado: (2026)
Contrastive Visual Data Augmentation
por: Zhou, Yu, et al.
Publicado: (2025)
por: Zhou, Yu, et al.
Publicado: (2025)
Spatial Knowledge Graph-Guided Multimodal Synthesis
por: Xue, Yida, et al.
Publicado: (2025)
por: Xue, Yida, et al.
Publicado: (2025)
Ejemplares similares
-
Foundations of Multisensory Artificial Intelligence
por: Liang, Paul Pu
Publicado: (2024) -
IoT-LM: Large Multisensory Language Models for the Internet of Things
por: Mo, Shentong, et al.
Publicado: (2024) -
MB-ORES: A Multi-Branch Object Reasoner for Visual Grounding in Remote Sensing
por: Radouane, Karim, et al.
Publicado: (2025) -
OneLLM: One Framework to Align All Modalities with Language
por: Han, Jiaming, et al.
Publicado: (2023) -
Building a Precise Video Language with Human-AI Oversight
por: Lin, Zhiqiu, et al.
Publicado: (2026)