GPT-4o: Visual perception performance of multimodal large language models in piglet activity understanding
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wu, Yiqi, Hu, Xiaodan, Fu, Ziming, Zhou, Siling, Li, Jiangong |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MedViLaM: A multimodal large language model with advanced generalizability and explainability for medical data understanding and generation
par: Xu, Lijian, et autres
Publié: (2024)
par: Xu, Lijian, et autres
Publié: (2024)
Do large language vision models understand 3D shapes?
par: Eppel, Sagi
Publié: (2024)
par: Eppel, Sagi
Publié: (2024)
In-context learning enables multimodal large language models to classify cancer pathology images
par: Ferber, Dyke, et autres
Publié: (2024)
par: Ferber, Dyke, et autres
Publié: (2024)
LLaVAction: evaluating and training multi-modal large language models for action understanding
par: Qi, Haozhe, et autres
Publié: (2025)
par: Qi, Haozhe, et autres
Publié: (2025)
Evaluating point-light biological motion in multimodal large language models
par: Kadambi, Akila, et autres
Publié: (2025)
par: Kadambi, Akila, et autres
Publié: (2025)
Chain-of-Caption: Training-free improvement of multimodal large language model on referring expression comprehension
par: Pang, Yik Lung, et autres
Publié: (2026)
par: Pang, Yik Lung, et autres
Publié: (2026)
A benchmark multimodal oro-dental dataset for large vision-language models
par: Lv, Haoxin, et autres
Publié: (2025)
par: Lv, Haoxin, et autres
Publié: (2025)
On the robustness of multimodal language model towards distractions
par: Liu, Ming, et autres
Publié: (2025)
par: Liu, Ming, et autres
Publié: (2025)
Visual concept ranking uncovers medical shortcuts used by large multimodal models
par: Janizek, Joseph D., et autres
Publié: (2026)
par: Janizek, Joseph D., et autres
Publié: (2026)
MIMO: A medical vision language model with visual referring multimodal input and pixel grounding multimodal output
par: Chen, Yanyuan, et autres
Publié: (2025)
par: Chen, Yanyuan, et autres
Publié: (2025)
Visual representations in the human brain are aligned with large language models
par: Doerig, Adrien, et autres
Publié: (2022)
par: Doerig, Adrien, et autres
Publié: (2022)
GPT4Vis: What Can GPT-4 Do for Zero-shot Visual Recognition?
par: Wu, Wenhao, et autres
Publié: (2023)
par: Wu, Wenhao, et autres
Publié: (2023)
Beyond the Hype: A dispassionate look at vision-language models in medical scenario
par: Nan, Yang, et autres
Publié: (2024)
par: Nan, Yang, et autres
Publié: (2024)
SalsaAgent: A multimodal embodied language model for interactive dance generation
par: Yazdian, Payam Jome, et autres
Publié: (2026)
par: Yazdian, Payam Jome, et autres
Publié: (2026)
When language and vision meet road safety: leveraging multimodal large language models for video-based traffic accident analysis
par: Zhang, Ruixuan, et autres
Publié: (2025)
par: Zhang, Ruixuan, et autres
Publié: (2025)
Have we unified image generation and understanding yet? An empirical study of GPT-4o's image generation ability
par: Li, Ning, et autres
Publié: (2025)
par: Li, Ning, et autres
Publié: (2025)
Visual hallucination detection in large vision-language models via evidential conflict
par: Huang, Tao, et autres
Publié: (2025)
par: Huang, Tao, et autres
Publié: (2025)
EHWGesture -- A dataset for multimodal understanding of clinical gestures
par: Amprimo, Gianluca, et autres
Publié: (2025)
par: Amprimo, Gianluca, et autres
Publié: (2025)
Visual Interestingness Decoded: How GPT-4o Mirrors Human Interests
par: Abdullahu, Fitim, et autres
Publié: (2025)
par: Abdullahu, Fitim, et autres
Publié: (2025)
Human-like object concept representations emerge naturally in multimodal large language models
par: Du, Changde, et autres
Publié: (2024)
par: Du, Changde, et autres
Publié: (2024)
Building and better understanding vision-language models: insights and future directions
par: Laurençon, Hugo, et autres
Publié: (2024)
par: Laurençon, Hugo, et autres
Publié: (2024)
An Empirical Study of GPT-4o Image Generation Capabilities
par: Chen, Sixiang, et autres
Publié: (2025)
par: Chen, Sixiang, et autres
Publié: (2025)
Attacks on multimodal models
par: Iablochnikov, Viacheslav, et autres
Publié: (2024)
par: Iablochnikov, Viacheslav, et autres
Publié: (2024)
ArtSeek: Deep artwork understanding via multimodal in-context reasoning and late interaction retrieval
par: Fanelli, Nicola, et autres
Publié: (2025)
par: Fanelli, Nicola, et autres
Publié: (2025)
GPT as Psychologist? Preliminary Evaluations for GPT-4V on Visual Affective Computing
par: Lu, Hao, et autres
Publié: (2024)
par: Lu, Hao, et autres
Publié: (2024)
ViSTa Dataset: Do vision-language models understand sequential tasks?
par: Wybitul, Evžen, et autres
Publié: (2024)
par: Wybitul, Evžen, et autres
Publié: (2024)
What do vision-language models see in the context? Investigating multimodal in-context learning
par: Santos, Gabriel O. dos, et autres
Publié: (2025)
par: Santos, Gabriel O. dos, et autres
Publié: (2025)
Assessing the alignment between infants' visual and linguistic experience using multimodal language models
par: Tan, Alvin Wei Ming, et autres
Publié: (2025)
par: Tan, Alvin Wei Ming, et autres
Publié: (2025)
Remote Sensing ChatGPT: Solving Remote Sensing Tasks with ChatGPT and Visual Models
par: Guo, Haonan, et autres
Publié: (2024)
par: Guo, Haonan, et autres
Publié: (2024)
ArtGPT-4: Towards Artistic-understanding Large Vision-Language Models with Enhanced Adapter
par: Yuan, Zhengqing, et autres
Publié: (2023)
par: Yuan, Zhengqing, et autres
Publié: (2023)
Vibe-Eval: A hard evaluation suite for measuring progress of multimodal language models
par: Padlewski, Piotr, et autres
Publié: (2024)
par: Padlewski, Piotr, et autres
Publié: (2024)
Hidden flaws behind expert-level accuracy of multimodal GPT-4 vision in medicine
par: Jin, Qiao, et autres
Publié: (2024)
par: Jin, Qiao, et autres
Publié: (2024)
A Cross-Hierarchical Difference Feature Fusion Network Based on Multiscale Encoder-Decoder for Hyperspectral Change Detection
par: Sheng, Mingshuai, et autres
Publié: (2025)
par: Sheng, Mingshuai, et autres
Publié: (2025)
Visual symbolic mechanisms: Emergent symbol processing in vision language models
par: Assouel, Rim, et autres
Publié: (2025)
par: Assouel, Rim, et autres
Publié: (2025)
GPT-ImgEval: A Comprehensive Benchmark for Diagnosing GPT4o in Image Generation
par: Yan, Zhiyuan, et autres
Publié: (2025)
par: Yan, Zhiyuan, et autres
Publié: (2025)
P4Q: Learning to Prompt for Quantization in Visual-language Models
par: Sun, Huixin, et autres
Publié: (2024)
par: Sun, Huixin, et autres
Publié: (2024)
Teaching large language models to reason like expert diagnosticians
par: Buckley, Thomas A., et autres
Publié: (2025)
par: Buckley, Thomas A., et autres
Publié: (2025)
IQAGPT: Image Quality Assessment with Vision-language and ChatGPT Models
par: Chen, Zhihao, et autres
Publié: (2023)
par: Chen, Zhihao, et autres
Publié: (2023)
VLA-Mark: A cross modal watermark for large vision-language alignment model
par: Liu, Shuliang, et autres
Publié: (2025)
par: Liu, Shuliang, et autres
Publié: (2025)
Explaining latent representations of generative models with large multimodal models
par: Zhu, Mengdan, et autres
Publié: (2024)
par: Zhu, Mengdan, et autres
Publié: (2024)
Documents similaires
-
MedViLaM: A multimodal large language model with advanced generalizability and explainability for medical data understanding and generation
par: Xu, Lijian, et autres
Publié: (2024) -
Do large language vision models understand 3D shapes?
par: Eppel, Sagi
Publié: (2024) -
In-context learning enables multimodal large language models to classify cancer pathology images
par: Ferber, Dyke, et autres
Publié: (2024) -
LLaVAction: evaluating and training multi-modal large language models for action understanding
par: Qi, Haozhe, et autres
Publié: (2025) -
Evaluating point-light biological motion in multimodal large language models
par: Kadambi, Akila, et autres
Publié: (2025)