Do LLMs Have Visualization Literacy? An Evaluation on Modified Visualizations to Test Generalization in Data Interpretation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Hong, Jiayi, Seto, Christian, Fan, Arlen, Maciejewski, Ross |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Simulation-Driven Evaluation of Chiplet-Based Architectures Using VisualSim
par: Ali, Wajid, et autres
Publié: (2025)
par: Ali, Wajid, et autres
Publié: (2025)
When Does the Gittins Policy Have Asymptotically Optimal Response Time Tail?
par: Scully, Ziv, et autres
Publié: (2021)
par: Scully, Ziv, et autres
Publié: (2021)
Tests de ejecución continua: Integrated Visual and Auditory Continuous Performance Test (IVA/CPT) y TDAH. Una revisión
par: Susana Meneres-Sancho
Publié: (2015)
par: Susana Meneres-Sancho
Publié: (2015)
Achieving Consistent and Comparable CPU Evaluation
par: Wang, Chenxi, et autres
Publié: (2024)
par: Wang, Chenxi, et autres
Publié: (2024)
UPMEM Unleashed: Software Secrets for Speed
par: Chmielewski, Krystian, et autres
Publié: (2025)
par: Chmielewski, Krystian, et autres
Publié: (2025)
Opal: A Modular Framework for Optimizing Performance using Analytics and LLMs
par: Zaeed, Mohammad, et autres
Publié: (2025)
par: Zaeed, Mohammad, et autres
Publié: (2025)
How to Do Statistical Evaluations in ECE/CS Papers: A Practical Playbook for Defensible Results
par: Krishnamachari, Bhaskar
Publié: (2026)
par: Krishnamachari, Bhaskar
Publié: (2026)
Inference performance evaluation for LLMs on edge devices with a novel benchmarking framework and metric
par: Chen, Hao, et autres
Publié: (2025)
par: Chen, Hao, et autres
Publié: (2025)
Leveraging LLMs for Structured Information Extraction and Analysis from Cloud Incident Reports (Work In Progress Paper)
par: Chu, Xiaoyu, et autres
Publié: (2026)
par: Chu, Xiaoyu, et autres
Publié: (2026)
Testing the Unknown: A Framework for OpenMP Testing via Random Program Generation
par: Laguna, Ignacio, et autres
Publié: (2024)
par: Laguna, Ignacio, et autres
Publié: (2024)
Performance Evaluation of Subroutines Call in PHP
par: Kalmukov, Yordan
Publié: (2026)
par: Kalmukov, Yordan
Publié: (2026)
HD-MoE: Hybrid and Dynamic Parallelism for Mixture-of-Expert LLMs with 3D Near-Memory Processing
par: Huang, Haochen, et autres
Publié: (2025)
par: Huang, Haochen, et autres
Publié: (2025)
Single-Thread JPEG Decoder Benchmarks Mis-Evaluate ML Data Loaders
par: Iglovikov, Vladimir, et autres
Publié: (2026)
par: Iglovikov, Vladimir, et autres
Publié: (2026)
DeepSpeed-FastGen: High-throughput Text Generation for LLMs via MII and DeepSpeed-Inference
par: Holmes, Connor, et autres
Publié: (2024)
par: Holmes, Connor, et autres
Publié: (2024)
An Interpretable Latency Model for Speculative Decoding in LLM Serving
par: Kong, Linghao, et autres
Publié: (2026)
par: Kong, Linghao, et autres
Publié: (2026)
Evaluation of Domain-Specific Architectures for General-Purpose Applications in Apple Silicon
par: López, Álvaro Corrochano, et autres
Publié: (2025)
par: López, Álvaro Corrochano, et autres
Publié: (2025)
PlantD: Performance, Latency ANalysis, and Testing for Data Pipelines -- An Open Source Measurement, Testing, and Simulation Framework
par: Bogart, Christopher, et autres
Publié: (2025)
par: Bogart, Christopher, et autres
Publié: (2025)
SynthEval: A Framework for Detailed Utility and Privacy Evaluation of Tabular Synthetic Data
par: Lautrup, Anton Danholt, et autres
Publié: (2024)
par: Lautrup, Anton Danholt, et autres
Publié: (2024)
Performance Evaluation of CMOS Annealing with Support Vector Machine
par: Fukuhara, Ryoga, et autres
Publié: (2024)
par: Fukuhara, Ryoga, et autres
Publié: (2024)
Industry 4.0 Connectors -- A Performance Experiment with Modbus/TCP
par: Nikolajew, Christian, et autres
Publié: (2024)
par: Nikolajew, Christian, et autres
Publié: (2024)
Skeptik: A Hybrid Framework for Combating Potential Misinformation in Journalism
par: Fan, Arlen, et autres
Publié: (2025)
par: Fan, Arlen, et autres
Publié: (2025)
Evaluating the Performance of the DeepSeek Model in Confidential Computing Environment
par: Dong, Ben, et autres
Publié: (2025)
par: Dong, Ben, et autres
Publié: (2025)
Streaming Data in HPC Workflows Using ADIOS
par: Eisenhauer, Greg, et autres
Publié: (2024)
par: Eisenhauer, Greg, et autres
Publié: (2024)
A Microbenchmark Framework for Performance Evaluation of OpenMP Target Offloading
par: Atif, Mohammad, et autres
Publié: (2025)
par: Atif, Mohammad, et autres
Publié: (2025)
Systematic Performance Evaluation Framework for LEO Mega-Constellation Satellite Networks
par: Wang, Yu, et autres
Publié: (2024)
par: Wang, Yu, et autres
Publié: (2024)
The Multiserver-Job Stochastic Recurrence Equation for Cloud Computing Performance Evaluation
par: Baccelli, Francois, et autres
Publié: (2026)
par: Baccelli, Francois, et autres
Publié: (2026)
Efficient Data-Driven Production Scheduling in Pharmaceutical Manufacturing
par: Balatsos, Ioannis, et autres
Publié: (2026)
par: Balatsos, Ioannis, et autres
Publié: (2026)
KernelBenchX: A Comprehensive Benchmark for Evaluating LLM-Generated GPU Kernels
par: Wang, Han, et autres
Publié: (2026)
par: Wang, Han, et autres
Publié: (2026)
Swarm: Co-Activation Aware KVCache Offloading Across Multiple SSDs
par: Wang, Tuowei, et autres
Publié: (2026)
par: Wang, Tuowei, et autres
Publié: (2026)
Analysis of Stable Vertex Values: Fast Query Evaluation Over An Evolving Graph
par: Afarin, Mahbod, et autres
Publié: (2025)
par: Afarin, Mahbod, et autres
Publié: (2025)
A Dataset of Performance Measurements and Alerts from Mozilla (Data Artifact)
par: Besbes, Mohamed Bilel, et autres
Publié: (2025)
par: Besbes, Mohamed Bilel, et autres
Publié: (2025)
Visual Insights into Agentic Optimization of Pervasive Stream Processing Services
par: Sedlak, Boris, et autres
Publié: (2026)
par: Sedlak, Boris, et autres
Publié: (2026)
Evaluating the impact of the L3 cache size of AMD EPYC CPUs on the performance of CFD applications
par: Lawenda, Marcin, et autres
Publié: (2025)
par: Lawenda, Marcin, et autres
Publié: (2025)
Input-Gen: Guided Generation of Stateful Inputs for Testing, Tuning, and Training
par: Ivanov, Ivan R., et autres
Publié: (2024)
par: Ivanov, Ivan R., et autres
Publié: (2024)
On the Benefits of Traffic "Reprofiling'' -- The Single Hop Case
par: Song, Jiayi, et autres
Publié: (2021)
par: Song, Jiayi, et autres
Publié: (2021)
Integrating High Performance In-Memory Data Streaming and In-Situ Visualization in Hybrid MPI+OpenMP PIC MC Simulations Towards Exascale
par: Williams, Jeremy J., et autres
Publié: (2025)
par: Williams, Jeremy J., et autres
Publié: (2025)
HPL-MxP Benchmark: Mixed-Precision Algorithms, Iterative Refinement, and Scalable Data Generation
par: Dongarra, Jack, et autres
Publié: (2025)
par: Dongarra, Jack, et autres
Publié: (2025)
HistogramTools for Efficient Data Analysis and Distribution Representation in Large Data Sets
par: Malhotra, Shubham
Publié: (2025)
par: Malhotra, Shubham
Publié: (2025)
Heterogeneous Data Access Model for Concurrency Control and Methods to Deal with High Data Contention
par: Thomasian, Alexander
Publié: (2024)
par: Thomasian, Alexander
Publié: (2024)
Scalable Packed Layouts for Vector-Length-Agnostic ML Code Generation
par: Beysel, Ege, et autres
Publié: (2026)
par: Beysel, Ege, et autres
Publié: (2026)
Documents similaires
-
Simulation-Driven Evaluation of Chiplet-Based Architectures Using VisualSim
par: Ali, Wajid, et autres
Publié: (2025) -
When Does the Gittins Policy Have Asymptotically Optimal Response Time Tail?
par: Scully, Ziv, et autres
Publié: (2021) -
Tests de ejecución continua: Integrated Visual and Auditory Continuous Performance Test (IVA/CPT) y TDAH. Una revisión
par: Susana Meneres-Sancho
Publié: (2015) -
Achieving Consistent and Comparable CPU Evaluation
par: Wang, Chenxi, et autres
Publié: (2024) -
UPMEM Unleashed: Software Secrets for Speed
par: Chmielewski, Krystian, et autres
Publié: (2025)