A Comparative Benchmark of Large Language Models for Labelling Wind Turbine Maintenance Logs
Fuente:
arXiv
Saved in:
| Main Authors: | Malyi, Max, Shek, Jonathan, McDonald, Alasdair, Biscaya, Andre |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Exploratory Semantic Reliability Analysis of Wind Turbine Maintenance Logs using Large Language Models
by: Malyi, Max, et al.
Published: (2025)
by: Malyi, Max, et al.
Published: (2025)
A Comparative Study on Large Language Models for Log Parsing
by: Astekin, Merve, et al.
Published: (2024)
by: Astekin, Merve, et al.
Published: (2024)
STOP! Benchmarking Large Language Models with Sensitivity Testing on Offensive Progressions
by: Morabito, Robert, et al.
Published: (2024)
by: Morabito, Robert, et al.
Published: (2024)
Analysis and Control of Acoustic Emissions from Marine Energy Converters
by: He, Jiaqin, et al.
Published: (2025)
by: He, Jiaqin, et al.
Published: (2025)
LogEval: A Comprehensive Benchmark Suite for Large Language Models In Log Analysis
by: Cui, Tianyu, et al.
Published: (2024)
by: Cui, Tianyu, et al.
Published: (2024)
SafeLLM: Domain-Specific Safety Monitoring for Large Language Models: A Case Study of Offshore Wind Maintenance
by: Walker, Connor, et al.
Published: (2024)
by: Walker, Connor, et al.
Published: (2024)
Benchmarking the Pedagogical Knowledge of Large Language Models
by: Lelièvre, Maxime, et al.
Published: (2025)
by: Lelièvre, Maxime, et al.
Published: (2025)
Benchmarking Large Language Models for Calculus Problem-Solving: A Comparative Analysis
by: Moon, In Hak
Published: (2025)
by: Moon, In Hak
Published: (2025)
Trace-of-Thought Prompting: Investigating Prompt-Based Knowledge Distillation Through Question Decomposition
by: McDonald, Tyler, et al.
Published: (2025)
by: McDonald, Tyler, et al.
Published: (2025)
Improve Large Language Model Systems with User Logs
by: Wang, Changyue, et al.
Published: (2026)
by: Wang, Changyue, et al.
Published: (2026)
Strategies for Span Labeling with Large Language Models
by: Semin, Danil, et al.
Published: (2026)
by: Semin, Danil, et al.
Published: (2026)
Challenges and opportunities in portraying emotion in generated sign language
by: McDonald, John C., et al.
Published: (2025)
by: McDonald, John C., et al.
Published: (2025)
AdaptiveLog: An Adaptive Log Analysis Framework with the Collaboration of Large and Small Language Model
by: Ma, Lipeng, et al.
Published: (2025)
by: Ma, Lipeng, et al.
Published: (2025)
A Comparative Study of Translation Bias and Accuracy in Multilingual Large Language Models for Cross-Language Claim Verification
by: Singhal, Aryan, et al.
Published: (2024)
by: Singhal, Aryan, et al.
Published: (2024)
Improving Extraction of Clinical Event Contextual Properties from Electronic Health Records: A Comparative Study
by: Agarwal, Shubham, et al.
Published: (2024)
by: Agarwal, Shubham, et al.
Published: (2024)
Mitigating Label Length Bias in Large Language Models
by: Sanz-Guerrero, Mario, et al.
Published: (2025)
by: Sanz-Guerrero, Mario, et al.
Published: (2025)
A Survey on Large Language Model Benchmarks
by: Ni, Shiwen, et al.
Published: (2025)
by: Ni, Shiwen, et al.
Published: (2025)
WinoQueer: A Community-in-the-Loop Benchmark for Anti-LGBTQ+ Bias in Large Language Models
by: Felkner, Virginia K., et al.
Published: (2023)
by: Felkner, Virginia K., et al.
Published: (2023)
Zero-shot and Few-shot Generation Strategies for Artificial Clinical Records
by: Frayling, Erlend, et al.
Published: (2024)
by: Frayling, Erlend, et al.
Published: (2024)
Adapting Large Language Models for Parameter-Efficient Log Anomaly Detection
by: Lim, Ying Fu, et al.
Published: (2025)
by: Lim, Ying Fu, et al.
Published: (2025)
Adapting Large Language Models to Log Analysis with Interpretable Domain Knowledge
by: Ji, Yuhe, et al.
Published: (2024)
by: Ji, Yuhe, et al.
Published: (2024)
Normative Reasoning in Large Language Models: A Comparative Benchmark from Logical and Modal Perspectives
by: Ozeki, Kentaro, et al.
Published: (2025)
by: Ozeki, Kentaro, et al.
Published: (2025)
Can We Afford The Perfect Prompt? Balancing Cost and Accuracy with the Economical Prompting Index
by: McDonald, Tyler, et al.
Published: (2024)
by: McDonald, Tyler, et al.
Published: (2024)
Two Directions for Clinical Data Generation with Large Language Models: Data-to-Label and Label-to-Data
by: Li, Rumeng, et al.
Published: (2023)
by: Li, Rumeng, et al.
Published: (2023)
Large Language Models Do Multi-Label Classification Differently
by: Ma, Marcus, et al.
Published: (2025)
by: Ma, Marcus, et al.
Published: (2025)
Large Language Models for Patient Comments Multi-Label Classification
by: Sakai, Hajar, et al.
Published: (2024)
by: Sakai, Hajar, et al.
Published: (2024)
BenchmarkCards: Standardized Documentation for Large Language Model Benchmarks
by: Sokol, Anna, et al.
Published: (2024)
by: Sokol, Anna, et al.
Published: (2024)
NSMQ Riddles: A Benchmark of Scientific and Mathematical Riddles for Quizzing Large Language Models
by: Boateng, George, et al.
Published: (2026)
by: Boateng, George, et al.
Published: (2026)
Comparative Analysis of Large Language Models in Healthcare
by: Santhosh, Subin, et al.
Published: (2026)
by: Santhosh, Subin, et al.
Published: (2026)
Interpretable Online Log Analysis Using Large Language Models with Prompt Strategies
by: Liu, Yilun, et al.
Published: (2023)
by: Liu, Yilun, et al.
Published: (2023)
When Benchmarks Age: Temporal Misalignment through Large Language Model Factuality Evaluation
by: Jiang, Xunyi, et al.
Published: (2025)
by: Jiang, Xunyi, et al.
Published: (2025)
Estonian Native Large Language Model Benchmark
by: Lillepalu, Helena Grete, et al.
Published: (2025)
by: Lillepalu, Helena Grete, et al.
Published: (2025)
Benchmarking Linguistic Diversity of Large Language Models
by: Guo, Yanzhu, et al.
Published: (2024)
by: Guo, Yanzhu, et al.
Published: (2024)
NYT-Connections: A Deceptively Simple Text Classification Task that Stumps System-1 Thinkers
by: Lopez, Angel Yahir Loredo, et al.
Published: (2024)
by: Lopez, Angel Yahir Loredo, et al.
Published: (2024)
Sparse Rewards Can Self-Train Dialogue Agents
by: Lattimer, Barrett Martin, et al.
Published: (2024)
by: Lattimer, Barrett Martin, et al.
Published: (2024)
Benchmark Data Contamination of Large Language Models: A Survey
by: Xu, Cheng, et al.
Published: (2024)
by: Xu, Cheng, et al.
Published: (2024)
CLIMB: A Benchmark of Clinical Bias in Large Language Models
by: Zhang, Yubo, et al.
Published: (2024)
by: Zhang, Yubo, et al.
Published: (2024)
Searching for Structure: Investigating Emergent Communication with Large Language Models
by: Kouwenhoven, Tom, et al.
Published: (2024)
by: Kouwenhoven, Tom, et al.
Published: (2024)
Progressively Label Enhancement for Large Language Model Alignment
by: Liu, Biao, et al.
Published: (2024)
by: Liu, Biao, et al.
Published: (2024)
Traces of Social Competence in Large Language Models
by: Kouwenhoven, Tom, et al.
Published: (2026)
by: Kouwenhoven, Tom, et al.
Published: (2026)
Similar Items
-
Exploratory Semantic Reliability Analysis of Wind Turbine Maintenance Logs using Large Language Models
by: Malyi, Max, et al.
Published: (2025) -
A Comparative Study on Large Language Models for Log Parsing
by: Astekin, Merve, et al.
Published: (2024) -
STOP! Benchmarking Large Language Models with Sensitivity Testing on Offensive Progressions
by: Morabito, Robert, et al.
Published: (2024) -
Analysis and Control of Acoustic Emissions from Marine Energy Converters
by: He, Jiaqin, et al.
Published: (2025) -
LogEval: A Comprehensive Benchmark Suite for Large Language Models In Log Analysis
by: Cui, Tianyu, et al.
Published: (2024)