Benchmarking the Capabilities of Large Language Models in Transportation System Engineering: Accuracy, Consistency, and Reasoning Behaviors
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Syed, Usman, Light, Ethan, Guo, Xingang, Zhang, Huan, Qin, Lianhui, Ouyang, Yanfeng, Hu, Bin |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Capabilities of Large Language Models in Control Engineering: A Benchmark Study on GPT-4, Claude 3 Opus, and Gemini 1.0 Ultra
par: Kevian, Darioush, et autres
Publié: (2024)
par: Kevian, Darioush, et autres
Publié: (2024)
ControlAgent: Automating Control System Design via Novel Integration of LLM Agents and Domain Expertise
par: Guo, Xingang, et autres
Publié: (2024)
par: Guo, Xingang, et autres
Publié: (2024)
COLD-Attack: Jailbreaking LLMs with Stealthiness and Controllability
par: Guo, Xingang, et autres
Publié: (2024)
par: Guo, Xingang, et autres
Publié: (2024)
DynaMath: A Dynamic Visual Benchmark for Evaluating Mathematical Reasoning Robustness of Vision Language Models
par: Zou, Chengke, et autres
Publié: (2024)
par: Zou, Chengke, et autres
Publié: (2024)
Structured Chemistry Reasoning with Large Language Models
par: Ouyang, Siru, et autres
Publié: (2023)
par: Ouyang, Siru, et autres
Publié: (2023)
Evaluating Consistency and Reasoning Capabilities of Large Language Models
par: Saxena, Yash, et autres
Publié: (2024)
par: Saxena, Yash, et autres
Publié: (2024)
Unlocking General Long Chain-of-Thought Reasoning Capabilities of Large Language Models via Representation Engineering
par: Tang, Xinyu, et autres
Publié: (2025)
par: Tang, Xinyu, et autres
Publié: (2025)
Beyond Accuracy: Evaluating the Reasoning Behavior of Large Language Models -- A Survey
par: Mondorf, Philipp, et autres
Publié: (2024)
par: Mondorf, Philipp, et autres
Publié: (2024)
Small Drafts, Big Verdict: Information-Intensive Visual Reasoning via Speculation
par: Liu, Yuhan, et autres
Publié: (2025)
par: Liu, Yuhan, et autres
Publié: (2025)
AstroMind: A High-Fidelity Benchmark for Spacecraft Behavior Reasoning Based on Large Language Models
par: Liu, Hao, et autres
Publié: (2026)
par: Liu, Hao, et autres
Publié: (2026)
Flow of Reasoning: Training LLMs for Divergent Reasoning with Minimal Examples
par: Yu, Fangxu, et autres
Publié: (2024)
par: Yu, Fangxu, et autres
Publié: (2024)
CliMedBench: A Large-Scale Chinese Benchmark for Evaluating Medical Large Language Models in Clinical Scenarios
par: Ouyang, Zetian, et autres
Publié: (2024)
par: Ouyang, Zetian, et autres
Publié: (2024)
Reasoning Capabilities and Invariability of Large Language Models
par: Raganato, Alessandro, et autres
Publié: (2025)
par: Raganato, Alessandro, et autres
Publié: (2025)
Benchmarking Large Language Models for Cryptanalysis and Side-Channel Vulnerabilities
par: Maskey, Utsav, et autres
Publié: (2025)
par: Maskey, Utsav, et autres
Publié: (2025)
IFEval-Audio: Benchmarking Instruction-Following Capability in Audio-based Large Language Models
par: Gao, Yiming, et autres
Publié: (2025)
par: Gao, Yiming, et autres
Publié: (2025)
CogMem: A Cognitive Memory Architecture for Sustained Multi-Turn Reasoning in Large Language Models
par: Zhang, Yiran, et autres
Publié: (2025)
par: Zhang, Yiran, et autres
Publié: (2025)
BeHonest: Benchmarking Honesty in Large Language Models
par: Chern, Steffi, et autres
Publié: (2024)
par: Chern, Steffi, et autres
Publié: (2024)
TSRBench: A Comprehensive Multi-task Multi-modal Time Series Reasoning Benchmark for Generalist Models
par: Yu, Fangxu, et autres
Publié: (2026)
par: Yu, Fangxu, et autres
Publié: (2026)
Prompt Engineering Large Language Models' Forecasting Capabilities
par: Schoenegger, Philipp, et autres
Publié: (2025)
par: Schoenegger, Philipp, et autres
Publié: (2025)
TurnBench-MS: A Benchmark for Evaluating Multi-Turn, Multi-Step Reasoning in Large Language Models
par: Zhang, Yiran, et autres
Publié: (2025)
par: Zhang, Yiran, et autres
Publié: (2025)
Evaluating Accounting Reasoning Capabilities of Large Language Models
par: Zhou, Jie, et autres
Publié: (2026)
par: Zhou, Jie, et autres
Publié: (2026)
EMO-Reasoning: Benchmarking Emotional Reasoning Capabilities in Spoken Dialogue Systems
par: Liu, Jingwen, et autres
Publié: (2025)
par: Liu, Jingwen, et autres
Publié: (2025)
TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models
par: Li, Ce, et autres
Publié: (2025)
par: Li, Ce, et autres
Publié: (2025)
Enhancing the Code Reasoning Capabilities of LLMs via Consistency-based Reinforcement Learning
par: Qin, Zhanyue, et autres
Publié: (2026)
par: Qin, Zhanyue, et autres
Publié: (2026)
Dynamic Benchmarking of Reasoning Capabilities in Code Large Language Models Under Data Contamination
par: Chen, Simin, et autres
Publié: (2025)
par: Chen, Simin, et autres
Publié: (2025)
MMLU-SR: A Benchmark for Stress-Testing Reasoning Capability of Large Language Models
par: Wang, Wentian, et autres
Publié: (2024)
par: Wang, Wentian, et autres
Publié: (2024)
TextReasoningBench: Does Reasoning Really Improve Text Classification in Large Language Models?
par: Guo, Xinyu, et autres
Publié: (2026)
par: Guo, Xinyu, et autres
Publié: (2026)
PersoBench: Benchmarking Personalized Response Generation in Large Language Models
par: Afzoon, Saleh, et autres
Publié: (2024)
par: Afzoon, Saleh, et autres
Publié: (2024)
AutoMedEval: Harnessing Language Models for Automatic Medical Capability Evaluation
par: Zhang, Xiechi, et autres
Publié: (2025)
par: Zhang, Xiechi, et autres
Publié: (2025)
Trade-offs in Large Reasoning Models: An Empirical Analysis of Deliberative and Adaptive Reasoning over Foundational Capabilities
par: Zhao, Weixiang, et autres
Publié: (2025)
par: Zhao, Weixiang, et autres
Publié: (2025)
OpenToM: A Comprehensive Benchmark for Evaluating Theory-of-Mind Reasoning Capabilities of Large Language Models
par: Xu, Hainiu, et autres
Publié: (2024)
par: Xu, Hainiu, et autres
Publié: (2024)
TransportationGames: Benchmarking Transportation Knowledge of (Multimodal) Large Language Models
par: Zhang, Xue, et autres
Publié: (2024)
par: Zhang, Xue, et autres
Publié: (2024)
Stepwise Self-Consistent Mathematical Reasoning with Large Language Models
par: Zhao, Zilong, et autres
Publié: (2024)
par: Zhao, Zilong, et autres
Publié: (2024)
Reasoning Capabilities of Large Language Models on Dynamic Tasks
par: Wong, Annie, et autres
Publié: (2025)
par: Wong, Annie, et autres
Publié: (2025)
LiteCoOp: Lightweight Multi-LLM Shared-Tree Reasoning for Model-Serving Compiler Optimizations
par: Tang, Annabelle Sujun, et autres
Publié: (2026)
par: Tang, Annabelle Sujun, et autres
Publié: (2026)
Can Pruning Improve Reasoning? Revisiting Long-CoT Compression with Capability in Mind for Better Reasoning
par: Zhao, Shangziqi, et autres
Publié: (2025)
par: Zhao, Shangziqi, et autres
Publié: (2025)
Measuring and Benchmarking Large Language Models' Capabilities to Generate Persuasive Language
par: Pauli, Amalie Brogaard, et autres
Publié: (2024)
par: Pauli, Amalie Brogaard, et autres
Publié: (2024)
Beyond Accuracy: The Role of Calibration in Self-Improving Large Language Models
par: Huang, Liangjie, et autres
Publié: (2025)
par: Huang, Liangjie, et autres
Publié: (2025)
GroundCocoa: A Benchmark for Evaluating Compositional & Conditional Reasoning in Language Models
par: Kohli, Harsh, et autres
Publié: (2024)
par: Kohli, Harsh, et autres
Publié: (2024)
Beyond Self-Consistency: Ensemble Reasoning Boosts Consistency and Accuracy of LLMs in Cancer Staging
par: Chang, Chia-Hsuan, et autres
Publié: (2024)
par: Chang, Chia-Hsuan, et autres
Publié: (2024)
Documents similaires
-
Capabilities of Large Language Models in Control Engineering: A Benchmark Study on GPT-4, Claude 3 Opus, and Gemini 1.0 Ultra
par: Kevian, Darioush, et autres
Publié: (2024) -
ControlAgent: Automating Control System Design via Novel Integration of LLM Agents and Domain Expertise
par: Guo, Xingang, et autres
Publié: (2024) -
COLD-Attack: Jailbreaking LLMs with Stealthiness and Controllability
par: Guo, Xingang, et autres
Publié: (2024) -
DynaMath: A Dynamic Visual Benchmark for Evaluating Mathematical Reasoning Robustness of Vision Language Models
par: Zou, Chengke, et autres
Publié: (2024) -
Structured Chemistry Reasoning with Large Language Models
par: Ouyang, Siru, et autres
Publié: (2023)