Visual Reasoning Evaluation of Grok, Deepseek Janus, Gemini, Qwen, Mistral, and ChatGPT
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Jegham, Nidhal, Abdelatti, Marwan, Hendawi, Abdeltawab |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
YOLO Evolution: A Comprehensive Benchmark and Architectural Review of YOLOv12, YOLO11, and Their Previous Versions
par: Jegham, Nidhal, et autres
Publié: (2024)
par: Jegham, Nidhal, et autres
Publié: (2024)
How Hungry is AI? Benchmarking Energy, Water, and Carbon Footprint of LLM Inference
par: Jegham, Nidhal, et autres
Publié: (2025)
par: Jegham, Nidhal, et autres
Publié: (2025)
GPTDrawer: Enhancing Visual Synthesis through ChatGPT
par: Li, Kun, et autres
Publié: (2024)
par: Li, Kun, et autres
Publié: (2024)
PhD: A ChatGPT-Prompted Visual hallucination Evaluation Dataset
par: Liu, Jiazhen, et autres
Publié: (2024)
par: Liu, Jiazhen, et autres
Publié: (2024)
A Safety Report on GPT-5.2, Gemini 3 Pro, Qwen3-VL, Grok 4.1 Fast, Nano Banana Pro, and Seedream 4.5
par: Ma, Xingjun, et autres
Publié: (2026)
par: Ma, Xingjun, et autres
Publié: (2026)
Assessing Greenspace Attractiveness with ChatGPT, Claude, and Gemini: Do AI Models Reflect Human Perceptions?
par: Malekzadeh, Milad, et autres
Publié: (2025)
par: Malekzadeh, Milad, et autres
Publié: (2025)
Is ChatGPT-5 Ready for Mammogram VQA?
par: Li, Qiang, et autres
Publié: (2025)
par: Li, Qiang, et autres
Publié: (2025)
An Evaluation of GPT-4V and Gemini in Online VQA
par: Liu, Mengchen, et autres
Publié: (2023)
par: Liu, Mengchen, et autres
Publié: (2023)
Intelligent Director: An Automatic Framework for Dynamic Visual Composition using ChatGPT
par: Zheng, Sixiao, et autres
Publié: (2024)
par: Zheng, Sixiao, et autres
Publié: (2024)
Evaluating ChatGPT's Performance in Classifying Pneumonia from Chest X-Ray Images
par: Prahallad, Pragna, et autres
Publié: (2025)
par: Prahallad, Pragna, et autres
Publié: (2025)
IQAGPT: Image Quality Assessment with Vision-language and ChatGPT Models
par: Chen, Zhihao, et autres
Publié: (2023)
par: Chen, Zhihao, et autres
Publié: (2023)
Demystifying the Potential of ChatGPT-4 Vision for Construction Progress Monitoring
par: Ersoz, Ahmet Bahaddin
Publié: (2024)
par: Ersoz, Ahmet Bahaddin
Publié: (2024)
ChatGPT and biometrics: an assessment of face recognition, gender detection, and age estimation capabilities
par: Hassanpour, Ahmad, et autres
Publié: (2024)
par: Hassanpour, Ahmad, et autres
Publié: (2024)
Prompt fidelity of ChatGPT4o / Dall-E3 text-to-image visualisations
par: Spennemann, Dirk HR
Publié: (2025)
par: Spennemann, Dirk HR
Publié: (2025)
Digital Twin Buildings: 3D Modeling, GIS Integration, and Visual Descriptions Using Gaussian Splatting, ChatGPT/Deepseek, and Google Maps Platform
par: Gao, Kyle, et autres
Publié: (2025)
par: Gao, Kyle, et autres
Publié: (2025)
Can ChatGPT Perform Image Splicing Detection? A Preliminary Study
par: Nath, Souradip
Publié: (2025)
par: Nath, Souradip
Publié: (2025)
How Good is ChatGPT at Audiovisual Deepfake Detection: A Comparative Study of ChatGPT, AI Models and Human Perception
par: Shahzad, Sahibzada Adil, et autres
Publié: (2024)
par: Shahzad, Sahibzada Adil, et autres
Publié: (2024)
AI-Generated Content Enhanced Computer-Aided Diagnosis Model for Thyroid Nodules: A ChatGPT-Style Assistant
par: Yao, Jincao, et autres
Publié: (2024)
par: Yao, Jincao, et autres
Publié: (2024)
Leveraging ChatGPT's Multimodal Vision Capabilities to Rank Satellite Images by Poverty Level: Advancing Tools for Social Science Research
par: Sarmadi, Hamid, et autres
Publié: (2025)
par: Sarmadi, Hamid, et autres
Publié: (2025)
Remote Sensing ChatGPT: Solving Remote Sensing Tasks with ChatGPT and Visual Models
par: Guo, Haonan, et autres
Publié: (2024)
par: Guo, Haonan, et autres
Publié: (2024)
Can generative AI figure out figurative language? The influence of idioms on essay scoring by ChatGPT, Gemini, and Deepseek
par: Oğuz, Enis
Publié: (2025)
par: Oğuz, Enis
Publié: (2025)
Qwen3-VL Technical Report
par: Bai, Shuai, et autres
Publié: (2025)
par: Bai, Shuai, et autres
Publié: (2025)
Can ChatGPT Learn My Life From a Week of First-Person Video?
par: Harris, Keegan
Publié: (2025)
par: Harris, Keegan
Publié: (2025)
GPT as Psychologist? Preliminary Evaluations for GPT-4V on Visual Affective Computing
par: Lu, Hao, et autres
Publié: (2024)
par: Lu, Hao, et autres
Publié: (2024)
Deep Networks Always Grok and Here is Why
par: Humayun, Ahmed Imtiaz, et autres
Publié: (2024)
par: Humayun, Ahmed Imtiaz, et autres
Publié: (2024)
Gemini in Reasoning: Unveiling Commonsense in Multimodal Large Language Models
par: Wang, Yuqing, et autres
Publié: (2023)
par: Wang, Yuqing, et autres
Publié: (2023)
How Good is ChatGPT at Face Biometrics? A First Look into Recognition, Soft Biometrics, and Explainability
par: DeAndres-Tame, Ivan, et autres
Publié: (2024)
par: DeAndres-Tame, Ivan, et autres
Publié: (2024)
ChatGPT Encounters Morphing Attack Detection: Zero-Shot MAD with Multi-Modal Large Language Models and General Vision Models
par: Zhang, Haoyu, et autres
Publié: (2025)
par: Zhang, Haoyu, et autres
Publié: (2025)
Revisiting Change VQA in Remote Sensing with Structured and Native Multimodal Qwen Models
par: Bazi, Yakoub, et autres
Publié: (2026)
par: Bazi, Yakoub, et autres
Publié: (2026)
GazeQwen: Lightweight Gaze-Conditioned LLM Modulation for Streaming Video Understanding
par: Pham, Trong Thang, et autres
Publié: (2026)
par: Pham, Trong Thang, et autres
Publié: (2026)
Can GPT-4o mini and Gemini 2.0 Flash Predict Fine-Grained Fashion Product Attributes? A Zero-Shot Analysis
par: Shukla, Shubham, et autres
Publié: (2025)
par: Shukla, Shubham, et autres
Publié: (2025)
Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation
par: Wu, Chengyue, et autres
Publié: (2024)
par: Wu, Chengyue, et autres
Publié: (2024)
Qwen3-VL-Seg: Unlocking Open-World Referring Segmentation with Vision-Language Grounding
par: Yao, Yuan, et autres
Publié: (2026)
par: Yao, Yuan, et autres
Publié: (2026)
Performance of GPT-5 in Brain Tumor MRI Reasoning
par: Safari, Mojtaba, et autres
Publié: (2025)
par: Safari, Mojtaba, et autres
Publié: (2025)
ChatGPT Meets Iris Biometrics
par: Farmanifard, Parisa, et autres
Publié: (2024)
par: Farmanifard, Parisa, et autres
Publié: (2024)
Chatting with Images for Introspective Visual Thinking
par: Wu, Junfei, et autres
Publié: (2026)
par: Wu, Junfei, et autres
Publié: (2026)
ChatBEV: A Visual Language Model that Understands BEV Maps
par: Xu, Qingyao, et autres
Publié: (2025)
par: Xu, Qingyao, et autres
Publié: (2025)
MTabVQA: Evaluating Multi-Tabular Reasoning of Language Models in Visual Space
par: Singh, Anshul, et autres
Publié: (2025)
par: Singh, Anshul, et autres
Publié: (2025)
VLMs have Tunnel Vision: Evaluating Nonlocal Visual Reasoning in Leading VLMs
par: Berman, Shmuel, et autres
Publié: (2025)
par: Berman, Shmuel, et autres
Publié: (2025)
Beyond Perception: Evaluating Abstract Visual Reasoning through Multi-Stage Task
par: Jiang, Yanbei, et autres
Publié: (2025)
par: Jiang, Yanbei, et autres
Publié: (2025)
Documents similaires
-
YOLO Evolution: A Comprehensive Benchmark and Architectural Review of YOLOv12, YOLO11, and Their Previous Versions
par: Jegham, Nidhal, et autres
Publié: (2024) -
How Hungry is AI? Benchmarking Energy, Water, and Carbon Footprint of LLM Inference
par: Jegham, Nidhal, et autres
Publié: (2025) -
GPTDrawer: Enhancing Visual Synthesis through ChatGPT
par: Li, Kun, et autres
Publié: (2024) -
PhD: A ChatGPT-Prompted Visual hallucination Evaluation Dataset
par: Liu, Jiazhen, et autres
Publié: (2024) -
A Safety Report on GPT-5.2, Gemini 3 Pro, Qwen3-VL, Grok 4.1 Fast, Nano Banana Pro, and Seedream 4.5
par: Ma, Xingjun, et autres
Publié: (2026)