Benchmark for Assessing Olfactory Perception of Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Makri, Eftychia, Nakis, Nikolaos, Sisson, Laura, Minsky, Gigi, Tassiulas, Leandros, Satarifard, Vahid, Christakis, Nicholas A. |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Ethereum Price Prediction Employing Large Language Models for Short-term and Few-shot Forecasting
by: Makri, Eftychia, et al.
Published: (2025)
by: Makri, Eftychia, et al.
Published: (2025)
Rank Is Not Capacity: Spectral Occupancy for Latent Graph Models
by: Nakis, Nikolaos, et al.
Published: (2026)
by: Nakis, Nikolaos, et al.
Published: (2026)
Fin-RATE: A Real-world Financial Analytics and Tracking Evaluation Benchmark for LLMs on SEC Filings
by: Jiang, Yidong, et al.
Published: (2026)
by: Jiang, Yidong, et al.
Published: (2026)
Evaluating Large Language Models in Code Generation: INFINITE Methodology for Defining the Inference Index
by: Christakis, Nicholas, et al.
Published: (2025)
by: Christakis, Nicholas, et al.
Published: (2025)
MTBench: A Multimodal Time Series Benchmark for Temporal Reasoning and Question Answering
by: Chen, Jialin, et al.
Published: (2025)
by: Chen, Jialin, et al.
Published: (2025)
Tele-LLMs: A Series of Specialized Large Language Models for Telecommunications
by: Maatouk, Ali, et al.
Published: (2024)
by: Maatouk, Ali, et al.
Published: (2024)
Evaluating Monolingual and Multilingual Large Language Models for Greek Question Answering: The DemosQA Benchmark
by: Mastrokostas, Charalampos, et al.
Published: (2026)
by: Mastrokostas, Charalampos, et al.
Published: (2026)
LitBench: A Graph-Centric Large Language Model Benchmarking Tool For Literature Tasks
by: Varvarigos, Andreas, et al.
Published: (2026)
by: Varvarigos, Andreas, et al.
Published: (2026)
Developing a Pragmatic Benchmark for Assessing Korean Legal Language Understanding in Large Language Models
by: Kim, Yeeun, et al.
Published: (2024)
by: Kim, Yeeun, et al.
Published: (2024)
Constrained Reinforcement Learning for Adaptive Controller Synchronization in Distributed SDN
by: Panitsas, Ioannis, et al.
Published: (2024)
by: Panitsas, Ioannis, et al.
Published: (2024)
Deep description of static and dynamic network ties in Honduran villages
by: Papamichalis, Marios, et al.
Published: (2026)
by: Papamichalis, Marios, et al.
Published: (2026)
ElectriQ: A Benchmark for Assessing the Response Capability of Large Language Models in Power Marketing
by: Wang, Jinzhi, et al.
Published: (2025)
by: Wang, Jinzhi, et al.
Published: (2025)
MedHallBench: A New Benchmark for Assessing Hallucination in Medical Large Language Models
by: Zuo, Kaiwen, et al.
Published: (2024)
by: Zuo, Kaiwen, et al.
Published: (2024)
Evaluating Large Language Models on the GMAT: Implications for the Future of Business Education
by: Ashrafimoghari, Vahid, et al.
Published: (2024)
by: Ashrafimoghari, Vahid, et al.
Published: (2024)
Over-the-Air Federated Learning via Weighted Aggregation
by: Azimi-Abarghouyi, Seyed Mohammad, et al.
Published: (2024)
by: Azimi-Abarghouyi, Seyed Mohammad, et al.
Published: (2024)
COBIAS: Assessing the Contextual Reliability of Bias Benchmarks for Language Models
by: Govil, Priyanshul, et al.
Published: (2024)
by: Govil, Priyanshul, et al.
Published: (2024)
Assessing and Understanding Creativity in Large Language Models
by: Zhao, Yunpu, et al.
Published: (2024)
by: Zhao, Yunpu, et al.
Published: (2024)
Assessing Political Bias in Large Language Models
by: Rettenberger, Luca, et al.
Published: (2024)
by: Rettenberger, Luca, et al.
Published: (2024)
Assessing Large Language Models for Structured Medical Order Extraction
by: Karim, A H M Rezaul, et al.
Published: (2025)
by: Karim, A H M Rezaul, et al.
Published: (2025)
Let's Play Across Cultures: A Large Multilingual, Multicultural Benchmark for Assessing Language Models' Understanding of Sports
by: Singh, Punit Kumar, et al.
Published: (2025)
by: Singh, Punit Kumar, et al.
Published: (2025)
Benchmarking the Pedagogical Knowledge of Large Language Models
by: Lelièvre, Maxime, et al.
Published: (2025)
by: Lelièvre, Maxime, et al.
Published: (2025)
Investigating Hallucinations in Pruned Large Language Models for Abstractive Summarization
by: Chrysostomou, George, et al.
Published: (2023)
by: Chrysostomou, George, et al.
Published: (2023)
Assessing Modality Bias in Video Question Answering Benchmarks with Multimodal Large Language Models
by: Park, Jean, et al.
Published: (2024)
by: Park, Jean, et al.
Published: (2024)
Decoding Emergent Big Five Traits in Large Language Models: Temperature-Dependent Expression and Architectural Clustering
by: Zacharopoulos, Christos-Nikolaos, et al.
Published: (2025)
by: Zacharopoulos, Christos-Nikolaos, et al.
Published: (2025)
Uncovering Competency Gaps in Large Language Models and Their Benchmarks
by: Bohacek, Maty, et al.
Published: (2025)
by: Bohacek, Maty, et al.
Published: (2025)
EssayJudge: A Multi-Granular Benchmark for Assessing Automated Essay Scoring Capabilities of Multimodal Large Language Models
by: Su, Jiamin, et al.
Published: (2025)
by: Su, Jiamin, et al.
Published: (2025)
Probing the Difficulty Perception Mechanism of Large Language Models
by: Lee, Sunbowen, et al.
Published: (2025)
by: Lee, Sunbowen, et al.
Published: (2025)
When Chain-of-Thought Backfires: Evaluating Prompt Sensitivity in Medical Language Models
by: Sadanandan, Binesh, et al.
Published: (2026)
by: Sadanandan, Binesh, et al.
Published: (2026)
HELM: Hyperbolic Large Language Models via Mixture-of-Curvature Experts
by: He, Neil, et al.
Published: (2025)
by: He, Neil, et al.
Published: (2025)
KLoB: a Benchmark for Assessing Knowledge Locating Methods in Language Models
by: Ju, Yiming, et al.
Published: (2023)
by: Ju, Yiming, et al.
Published: (2023)
Large Language Models as Universal Predictors? An Empirical Study on Small Tabular Datasets
by: Pavlidis, Nikolaos, et al.
Published: (2025)
by: Pavlidis, Nikolaos, et al.
Published: (2025)
Assessing Consciousness-Related Behaviors in Large Language Models Using the Maze Test
by: Pimenta, Rui A., et al.
Published: (2025)
by: Pimenta, Rui A., et al.
Published: (2025)
Codenames as a Benchmark for Large Language Models
by: Stephenson, Matthew, et al.
Published: (2024)
by: Stephenson, Matthew, et al.
Published: (2024)
Benchmarking Distributional Alignment of Large Language Models
by: Meister, Nicole, et al.
Published: (2024)
by: Meister, Nicole, et al.
Published: (2024)
Large Language Model Benchmarks in Medical Tasks
by: Yan, Lawrence K. Q., et al.
Published: (2024)
by: Yan, Lawrence K. Q., et al.
Published: (2024)
BELL: Benchmarking the Explainability of Large Language Models
by: Ahmed, Syed Quiser, et al.
Published: (2025)
by: Ahmed, Syed Quiser, et al.
Published: (2025)
Concise and Organized Perception Facilitates Reasoning in Large Language Models
by: Liu, Junjie, et al.
Published: (2023)
by: Liu, Junjie, et al.
Published: (2023)
Large Language Models in the Clinic: A Comprehensive Benchmark
by: Liu, Fenglin, et al.
Published: (2024)
by: Liu, Fenglin, et al.
Published: (2024)
Modeling roles and trade-offs in multiplex networks
by: Nakis, Nikolaos, et al.
Published: (2025)
by: Nakis, Nikolaos, et al.
Published: (2025)
ArabLegalEval: A Multitask Benchmark for Assessing Arabic Legal Knowledge in Large Language Models
by: Hijazi, Faris, et al.
Published: (2024)
by: Hijazi, Faris, et al.
Published: (2024)
Similar Items
-
Ethereum Price Prediction Employing Large Language Models for Short-term and Few-shot Forecasting
by: Makri, Eftychia, et al.
Published: (2025) -
Rank Is Not Capacity: Spectral Occupancy for Latent Graph Models
by: Nakis, Nikolaos, et al.
Published: (2026) -
Fin-RATE: A Real-world Financial Analytics and Tracking Evaluation Benchmark for LLMs on SEC Filings
by: Jiang, Yidong, et al.
Published: (2026) -
Evaluating Large Language Models in Code Generation: INFINITE Methodology for Defining the Inference Index
by: Christakis, Nicholas, et al.
Published: (2025) -
MTBench: A Multimodal Time Series Benchmark for Temporal Reasoning and Question Answering
by: Chen, Jialin, et al.
Published: (2025)