Human-like object concept representations emerge naturally in multimodal large language models
Fuente:
arXiv
Guardado en:
| Autores principales: | Du, Changde, Fu, Kaicheng, Wen, Bincheng, Sun, Yi, Peng, Jie, Wei, Wei, Gao, Ying, Wang, Shengpei, Zhang, Chuncheng, Li, Jinpeng, Qiu, Shuang, Chang, Le, He, Huiguang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
CLIP-MUSED: CLIP-Guided Multi-Subject Visual Neural Information Semantic Decoding
por: Zhou, Qiongyi, et al.
Publicado: (2024)
por: Zhou, Qiongyi, et al.
Publicado: (2024)
Identifying the Hierarchical Emotional Areas in the Human Brain Through Information Fusion
por: Huang, Zhongyu, et al.
Publicado: (2024)
por: Huang, Zhongyu, et al.
Publicado: (2024)
PGCN: Pyramidal Graph Convolutional Network for EEG Emotion Recognition
por: Jin, Ming, et al.
Publicado: (2023)
por: Jin, Ming, et al.
Publicado: (2023)
Bridging the behavior-neural gap: A multimodal AI reveals the brain's geometry of emotion more accurately than human self-reports
por: Du, Changde, et al.
Publicado: (2025)
por: Du, Changde, et al.
Publicado: (2025)
BP-GPT: Auditory Neural Decoding Using fMRI-prompted LLM
por: Chen, Xiaoyu, et al.
Publicado: (2025)
por: Chen, Xiaoyu, et al.
Publicado: (2025)
Open-vocabulary Auditory Neural Decoding Using fMRI-prompted LLM
por: Chen, Xiaoyu, et al.
Publicado: (2024)
por: Chen, Xiaoyu, et al.
Publicado: (2024)
NeuralOOD: Improving Out-of-Distribution Generalization Performance with Brain-machine Fusion Learning Framework
por: Zhao, Shuangchen, et al.
Publicado: (2024)
por: Zhao, Shuangchen, et al.
Publicado: (2024)
Revealing emergent human-like conceptual representations from language prediction
por: Xu, Ningyu, et al.
Publicado: (2025)
por: Xu, Ningyu, et al.
Publicado: (2025)
Reverse the auditory processing pathway: Coarse-to-fine audio reconstruction from fMRI
por: Liu, Che, et al.
Publicado: (2024)
por: Liu, Che, et al.
Publicado: (2024)
Versatile Framework with Semantic and Structural guidance for Image Reconstruction from Brain Activity
por: Lu, Yizhuo, et al.
Publicado: (2026)
por: Lu, Yizhuo, et al.
Publicado: (2026)
A Temporal-Spectral Fusion Transformer with Subject-Specific Adapter for Enhancing RSVP-BCI Decoding
por: Li, Xujin, et al.
Publicado: (2024)
por: Li, Xujin, et al.
Publicado: (2024)
Integrating Language-Image Prior into EEG Decoding for Cross-Task Zero-Calibration RSVP-BCI
por: Li, Xujin, et al.
Publicado: (2025)
por: Li, Xujin, et al.
Publicado: (2025)
ViKL: A Mammography Interpretation Framework via Multimodal Aggregation of Visual-knowledge-linguistic Features
por: Wei, Xin, et al.
Publicado: (2024)
por: Wei, Xin, et al.
Publicado: (2024)
Multi-label Class Incremental Emotion Decoding with Augmented Emotional Semantics Learning
por: Fu, Kaicheng, et al.
Publicado: (2024)
por: Fu, Kaicheng, et al.
Publicado: (2024)
Retrieval augmentation of large language models for lay language generation
por: Guo, Yue, et al.
Publicado: (2022)
por: Guo, Yue, et al.
Publicado: (2022)
Animate Your Thoughts: Decoupled Reconstruction of Dynamic Natural Vision from Slow Brain Activity
por: Lu, Yizhuo, et al.
Publicado: (2024)
por: Lu, Yizhuo, et al.
Publicado: (2024)
Protecting multimodal large language models against misleading visualizations
por: Tonglet, Jonathan, et al.
Publicado: (2025)
por: Tonglet, Jonathan, et al.
Publicado: (2025)
Explaining latent representations of generative models with large multimodal models
por: Zhu, Mengdan, et al.
Publicado: (2024)
por: Zhu, Mengdan, et al.
Publicado: (2024)
Exploring EEG and Eye Movement Fusion for Multi-Class Target RSVP-BCI
por: Li, Xujin, et al.
Publicado: (2025)
por: Li, Xujin, et al.
Publicado: (2025)
A benchmark multimodal oro-dental dataset for large vision-language models
por: Lv, Haoxin, et al.
Publicado: (2025)
por: Lv, Haoxin, et al.
Publicado: (2025)
Is your multimodal large language model a good science tutor?
por: Liu, Ming, et al.
Publicado: (2025)
por: Liu, Ming, et al.
Publicado: (2025)
Simple synthetic data reduces sycophancy in large language models
por: Wei, Jerry, et al.
Publicado: (2023)
por: Wei, Jerry, et al.
Publicado: (2023)
Assessing the nature of large language models: A caution against anthropocentrism
por: Speed, Ann
Publicado: (2023)
por: Speed, Ann
Publicado: (2023)
GPT-4o: Visual perception performance of multimodal large language models in piglet activity understanding
por: Wu, Yiqi, et al.
Publicado: (2024)
por: Wu, Yiqi, et al.
Publicado: (2024)
Hallucination-aware intermediate representation edit in large vision-language models
por: Suo, Wei, et al.
Publicado: (2026)
por: Suo, Wei, et al.
Publicado: (2026)
Reasoning emerges from constrained inference manifolds in large language models
por: Ma, Yanbiao, et al.
Publicado: (2026)
por: Ma, Yanbiao, et al.
Publicado: (2026)
When language and vision meet road safety: leveraging multimodal large language models for video-based traffic accident analysis
por: Zhang, Ruixuan, et al.
Publicado: (2025)
por: Zhang, Ruixuan, et al.
Publicado: (2025)
Strategies of cooperation and defection in five large language models
por: Pal, Saptarshi, et al.
Publicado: (2026)
por: Pal, Saptarshi, et al.
Publicado: (2026)
Visual concept ranking uncovers medical shortcuts used by large multimodal models
por: Janizek, Joseph D., et al.
Publicado: (2026)
por: Janizek, Joseph D., et al.
Publicado: (2026)
MNAFT: modality neuron-aware fine-tuning of multimodal large language models for image translation
por: Li, Bo, et al.
Publicado: (2026)
por: Li, Bo, et al.
Publicado: (2026)
Mathematics with large language models as provers and verifiers
por: Duc, Hieu Le, et al.
Publicado: (2025)
por: Duc, Hieu Le, et al.
Publicado: (2025)
Test-Time Reinforcement Learning for GUI Grounding via Region Consistency
por: Du, Yong, et al.
Publicado: (2025)
por: Du, Yong, et al.
Publicado: (2025)
On the steerability of large language models toward data-driven personas
por: Li, Junyi, et al.
Publicado: (2023)
por: Li, Junyi, et al.
Publicado: (2023)
The production of meaning in the processing of natural language
por: Agostino, Christopher J., et al.
Publicado: (2026)
por: Agostino, Christopher J., et al.
Publicado: (2026)
Assessing the alignment between infants' visual and linguistic experience using multimodal language models
por: Tan, Alvin Wei Ming, et al.
Publicado: (2025)
por: Tan, Alvin Wei Ming, et al.
Publicado: (2025)
Evaluating point-light biological motion in multimodal large language models
por: Kadambi, Akila, et al.
Publicado: (2025)
por: Kadambi, Akila, et al.
Publicado: (2025)
Auditing demographic bias in AI-based emergency police dispatch: a cross-lingual evaluation of eleven large language models
por: Guey, William, et al.
Publicado: (2026)
por: Guey, William, et al.
Publicado: (2026)
CoCoG-2: Controllable generation of visual stimuli for understanding human concept representation
por: Wei, Chen, et al.
Publicado: (2024)
por: Wei, Chen, et al.
Publicado: (2024)
In-context learning enables multimodal large language models to classify cancer pathology images
por: Ferber, Dyke, et al.
Publicado: (2024)
por: Ferber, Dyke, et al.
Publicado: (2024)
Lean Workbook: A large-scale Lean problem set formalized from natural language math problems
por: Ying, Huaiyuan, et al.
Publicado: (2024)
por: Ying, Huaiyuan, et al.
Publicado: (2024)
Ejemplares similares
-
CLIP-MUSED: CLIP-Guided Multi-Subject Visual Neural Information Semantic Decoding
por: Zhou, Qiongyi, et al.
Publicado: (2024) -
Identifying the Hierarchical Emotional Areas in the Human Brain Through Information Fusion
por: Huang, Zhongyu, et al.
Publicado: (2024) -
PGCN: Pyramidal Graph Convolutional Network for EEG Emotion Recognition
por: Jin, Ming, et al.
Publicado: (2023) -
Bridging the behavior-neural gap: A multimodal AI reveals the brain's geometry of emotion more accurately than human self-reports
por: Du, Changde, et al.
Publicado: (2025) -
BP-GPT: Auditory Neural Decoding Using fMRI-prompted LLM
por: Chen, Xiaoyu, et al.
Publicado: (2025)