Toward Cognitive Supersensing in Multimodal Large Language Model
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Boyi, Shen, Yifan, Liu, Yuanzhe, Xu, Yifan, Liu, Jiateng, Li, Xinzhuo, Li, Zhengyuan, Zhu, Jingyuan, Zhong, Yunhan, Lan, Fangzhou, Cao, Jianguo, Rehg, James M., Ji, Heng, Lourentzou, Ismini, Cao, Xu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
CoRe3D: Collaborative Reasoning as a Foundation for 3D Intelligence
di: Yu, Tianjiao, et al.
Pubblicazione: (2025)
di: Yu, Tianjiao, et al.
Pubblicazione: (2025)
EgoForge: Goal-Directed Egocentric World Simulator
di: Shen, Yifan, et al.
Pubblicazione: (2026)
di: Shen, Yifan, et al.
Pubblicazione: (2026)
Fine-Grained Preference Optimization Improves Spatial Reasoning in VLMs
di: Shen, Yifan, et al.
Pubblicazione: (2025)
di: Shen, Yifan, et al.
Pubblicazione: (2025)
PALM: Progress-Aware Policy Learning via Affordance Reasoning for Long-Horizon Robotic Manipulation
di: Liu, Yuanzhe, et al.
Pubblicazione: (2026)
di: Liu, Yuanzhe, et al.
Pubblicazione: (2026)
Evaluating Cognitive Age Alignment in Interactive AI Agents
di: Shen, Yifan, et al.
Pubblicazione: (2026)
di: Shen, Yifan, et al.
Pubblicazione: (2026)
DreamPartGen: Semantically Grounded Part-Level 3D Generation via Collaborative Latent Denoising
di: Yu, Tianjiao, et al.
Pubblicazione: (2026)
di: Yu, Tianjiao, et al.
Pubblicazione: (2026)
Counterfactual Segmentation Reasoning: Diagnosing and Mitigating Pixel-Grounding Hallucination
di: Li, Xinzhuo, et al.
Pubblicazione: (2025)
di: Li, Xinzhuo, et al.
Pubblicazione: (2025)
Cambrian-S: Towards Spatial Supersensing in Video
di: Yang, Shusheng, et al.
Pubblicazione: (2025)
di: Yang, Shusheng, et al.
Pubblicazione: (2025)
What is the Visual Cognition Gap between Humans and Multimodal LLMs?
di: Cao, Xu, et al.
Pubblicazione: (2024)
di: Cao, Xu, et al.
Pubblicazione: (2024)
Commonsense for Zero-Shot Natural Language Video Localization
di: Holla, Meghana, et al.
Pubblicazione: (2023)
di: Holla, Meghana, et al.
Pubblicazione: (2023)
3D-VCD: Hallucination Mitigation in 3D-LLM Embodied Agents through Visual Contrastive Decoding
di: Ogunleye, Makanjuola, et al.
Pubblicazione: (2026)
di: Ogunleye, Makanjuola, et al.
Pubblicazione: (2026)
mTSBench: Benchmarking Multivariate Time Series Anomaly Detection and Model Selection at Scale
di: Zhou, Xiaona, et al.
Pubblicazione: (2025)
di: Zhou, Xiaona, et al.
Pubblicazione: (2025)
SafeCRS: Personalized Safety Alignment for LLM-Based Conversational Recommender Systems
di: Hao, Haochang, et al.
Pubblicazione: (2026)
di: Hao, Haochang, et al.
Pubblicazione: (2026)
Solving Spatial Supersensing Without Spatial Supersensing
di: Udandarao, Vishaal, et al.
Pubblicazione: (2025)
di: Udandarao, Vishaal, et al.
Pubblicazione: (2025)
MMPlanner: Zero-Shot Multimodal Procedural Planning with Chain-of-Thought Object State Reasoning
di: Tabassum, Afrina, et al.
Pubblicazione: (2025)
di: Tabassum, Afrina, et al.
Pubblicazione: (2025)
PRIMA: Multi-Image Vision-Language Models for Reasoning Segmentation
di: Wahed, Muntasir, et al.
Pubblicazione: (2024)
di: Wahed, Muntasir, et al.
Pubblicazione: (2024)
PanoWorld: Towards Spatial Supersensing in 360$^\circ$ Panorama World
di: Wang, Changpeng, et al.
Pubblicazione: (2026)
di: Wang, Changpeng, et al.
Pubblicazione: (2026)
Hierarchical Dataset Selection for High-Quality Data Sharing
di: Zhou, Xiaona, et al.
Pubblicazione: (2025)
di: Zhou, Xiaona, et al.
Pubblicazione: (2025)
FAIR: Facilitating Artificial Intelligence Resilience in Manufacturing Industrial Internet
di: Zeng, Yingyan, et al.
Pubblicazione: (2025)
di: Zeng, Yingyan, et al.
Pubblicazione: (2025)
RAVEL: Rare Concept Generation and Editing via Graph-driven Relational Guidance
di: Venkatesh, Kavana, et al.
Pubblicazione: (2024)
di: Venkatesh, Kavana, et al.
Pubblicazione: (2024)
ELBA: Learning by Asking for Embodied Visual Navigation and Task Completion
di: Shen, Ying, et al.
Pubblicazione: (2023)
di: Shen, Ying, et al.
Pubblicazione: (2023)
Phantom: Physics-Infused Video Generation via Joint Modeling of Visual and Latent Physical Dynamics
di: Shen, Ying, et al.
Pubblicazione: (2026)
di: Shen, Ying, et al.
Pubblicazione: (2026)
A Privacy-Preserving Framework for Advertising Personalization Incorporating Federated Learning and Differential Privacy
di: Li, Xiang, et al.
Pubblicazione: (2025)
di: Li, Xiang, et al.
Pubblicazione: (2025)
EMCompress: Video-LLMs with Endomorphic Multimodal Compression
di: Fan, Zheyu, et al.
Pubblicazione: (2025)
di: Fan, Zheyu, et al.
Pubblicazione: (2025)
Practical Region-level Attack against Segment Anything Models
di: Shen, Yifan, et al.
Pubblicazione: (2024)
di: Shen, Yifan, et al.
Pubblicazione: (2024)
Context Engineering for Trustworthiness: Rescorla Wagner Steering Under Mixed and Inappropriate Contexts
di: Wang, Rushi, et al.
Pubblicazione: (2025)
di: Wang, Rushi, et al.
Pubblicazione: (2025)
CauSight: Learning to Supersense for Visual Causal Discovery
di: Zhang, Yize, et al.
Pubblicazione: (2025)
di: Zhang, Yize, et al.
Pubblicazione: (2025)
Augmenting Interface Usability Heuristics for Reliable Computer-Use Agents
di: Liu, Jiateng, et al.
Pubblicazione: (2026)
di: Liu, Jiateng, et al.
Pubblicazione: (2026)
Multimodal Graphene Lubricant Monitoring for IoT ‐Driven Predictive Maintenance
di: Yifan Wang, et al.
Pubblicazione: (2026)
di: Yifan Wang, et al.
Pubblicazione: (2026)
uaMix-MAE: Efficient Tuning of Pretrained Audio Transformers with Unsupervised Audio Mixtures
di: Tabassum, Afrina, et al.
Pubblicazione: (2024)
di: Tabassum, Afrina, et al.
Pubblicazione: (2024)
Tiny but Trusted: Efficient Vision-Language Reasoning for Time-Series Anomaly Detection
di: Zhou, Xiaona, et al.
Pubblicazione: (2026)
di: Zhou, Xiaona, et al.
Pubblicazione: (2026)
MM-SpuBench: Towards Better Understanding of Spurious Biases in Multimodal LLMs
di: Ye, Wenqian, et al.
Pubblicazione: (2024)
di: Ye, Wenqian, et al.
Pubblicazione: (2024)
VTAM: Video-Tactile-Action Models for Complex Physical Interaction Beyond VLAs
di: Yuan, Haoran, et al.
Pubblicazione: (2026)
di: Yuan, Haoran, et al.
Pubblicazione: (2026)
Multimodal Policy Internalization for Conversational Agents
di: Wang, Zhenhailong, et al.
Pubblicazione: (2025)
di: Wang, Zhenhailong, et al.
Pubblicazione: (2025)
Enhancing Speech Large Language Models through Reinforced Behavior Alignment
di: Liu, Yansong, et al.
Pubblicazione: (2025)
di: Liu, Yansong, et al.
Pubblicazione: (2025)
Towards Long-horizon Agentic Multimodal Search
di: Du, Yifan, et al.
Pubblicazione: (2026)
di: Du, Yifan, et al.
Pubblicazione: (2026)
EVEDIT: Event-based Knowledge Editing with Deductive Editing Boundaries
di: Liu, Jiateng, et al.
Pubblicazione: (2024)
di: Liu, Jiateng, et al.
Pubblicazione: (2024)
Liquid directional transport surface applied to the spacecraft fluid management system: Fundamentals and prospect analysis
di: Yifan He, et al.
Pubblicazione: (2025)
di: Yifan He, et al.
Pubblicazione: (2025)
oMeBench: Towards Robust Benchmarking of LLMs in Organic Mechanism Elucidation and Reasoning
di: Xu, Ruiling, et al.
Pubblicazione: (2025)
di: Xu, Ruiling, et al.
Pubblicazione: (2025)
Facile Ester‐based Phase Change Materials Synthesis for Enhanced Energy Storage Toward Battery Thermal Management
di: Long Geng, et al.
Pubblicazione: (2025)
di: Long Geng, et al.
Pubblicazione: (2025)
Documenti analoghi
-
CoRe3D: Collaborative Reasoning as a Foundation for 3D Intelligence
di: Yu, Tianjiao, et al.
Pubblicazione: (2025) -
EgoForge: Goal-Directed Egocentric World Simulator
di: Shen, Yifan, et al.
Pubblicazione: (2026) -
Fine-Grained Preference Optimization Improves Spatial Reasoning in VLMs
di: Shen, Yifan, et al.
Pubblicazione: (2025) -
PALM: Progress-Aware Policy Learning via Affordance Reasoning for Long-Horizon Robotic Manipulation
di: Liu, Yuanzhe, et al.
Pubblicazione: (2026) -
Evaluating Cognitive Age Alignment in Interactive AI Agents
di: Shen, Yifan, et al.
Pubblicazione: (2026)