A Comparative Benchmark of Large Language Models for Labelling Wind Turbine Maintenance Logs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Malyi, Max, Shek, Jonathan, McDonald, Alasdair, Biscaya, Andre |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Exploratory Semantic Reliability Analysis of Wind Turbine Maintenance Logs using Large Language Models
par: Malyi, Max, et autres
Publié: (2025)
par: Malyi, Max, et autres
Publié: (2025)
A Comparative Study on Large Language Models for Log Parsing
par: Astekin, Merve, et autres
Publié: (2024)
par: Astekin, Merve, et autres
Publié: (2024)
STOP! Benchmarking Large Language Models with Sensitivity Testing on Offensive Progressions
par: Morabito, Robert, et autres
Publié: (2024)
par: Morabito, Robert, et autres
Publié: (2024)
Analysis and Control of Acoustic Emissions from Marine Energy Converters
par: He, Jiaqin, et autres
Publié: (2025)
par: He, Jiaqin, et autres
Publié: (2025)
LogEval: A Comprehensive Benchmark Suite for Large Language Models In Log Analysis
par: Cui, Tianyu, et autres
Publié: (2024)
par: Cui, Tianyu, et autres
Publié: (2024)
SafeLLM: Domain-Specific Safety Monitoring for Large Language Models: A Case Study of Offshore Wind Maintenance
par: Walker, Connor, et autres
Publié: (2024)
par: Walker, Connor, et autres
Publié: (2024)
Benchmarking the Pedagogical Knowledge of Large Language Models
par: Lelièvre, Maxime, et autres
Publié: (2025)
par: Lelièvre, Maxime, et autres
Publié: (2025)
Benchmarking Large Language Models for Calculus Problem-Solving: A Comparative Analysis
par: Moon, In Hak
Publié: (2025)
par: Moon, In Hak
Publié: (2025)
Trace-of-Thought Prompting: Investigating Prompt-Based Knowledge Distillation Through Question Decomposition
par: McDonald, Tyler, et autres
Publié: (2025)
par: McDonald, Tyler, et autres
Publié: (2025)
Improve Large Language Model Systems with User Logs
par: Wang, Changyue, et autres
Publié: (2026)
par: Wang, Changyue, et autres
Publié: (2026)
Strategies for Span Labeling with Large Language Models
par: Semin, Danil, et autres
Publié: (2026)
par: Semin, Danil, et autres
Publié: (2026)
Challenges and opportunities in portraying emotion in generated sign language
par: McDonald, John C., et autres
Publié: (2025)
par: McDonald, John C., et autres
Publié: (2025)
AdaptiveLog: An Adaptive Log Analysis Framework with the Collaboration of Large and Small Language Model
par: Ma, Lipeng, et autres
Publié: (2025)
par: Ma, Lipeng, et autres
Publié: (2025)
A Comparative Study of Translation Bias and Accuracy in Multilingual Large Language Models for Cross-Language Claim Verification
par: Singhal, Aryan, et autres
Publié: (2024)
par: Singhal, Aryan, et autres
Publié: (2024)
Improving Extraction of Clinical Event Contextual Properties from Electronic Health Records: A Comparative Study
par: Agarwal, Shubham, et autres
Publié: (2024)
par: Agarwal, Shubham, et autres
Publié: (2024)
Mitigating Label Length Bias in Large Language Models
par: Sanz-Guerrero, Mario, et autres
Publié: (2025)
par: Sanz-Guerrero, Mario, et autres
Publié: (2025)
A Survey on Large Language Model Benchmarks
par: Ni, Shiwen, et autres
Publié: (2025)
par: Ni, Shiwen, et autres
Publié: (2025)
WinoQueer: A Community-in-the-Loop Benchmark for Anti-LGBTQ+ Bias in Large Language Models
par: Felkner, Virginia K., et autres
Publié: (2023)
par: Felkner, Virginia K., et autres
Publié: (2023)
Zero-shot and Few-shot Generation Strategies for Artificial Clinical Records
par: Frayling, Erlend, et autres
Publié: (2024)
par: Frayling, Erlend, et autres
Publié: (2024)
Adapting Large Language Models for Parameter-Efficient Log Anomaly Detection
par: Lim, Ying Fu, et autres
Publié: (2025)
par: Lim, Ying Fu, et autres
Publié: (2025)
Adapting Large Language Models to Log Analysis with Interpretable Domain Knowledge
par: Ji, Yuhe, et autres
Publié: (2024)
par: Ji, Yuhe, et autres
Publié: (2024)
Normative Reasoning in Large Language Models: A Comparative Benchmark from Logical and Modal Perspectives
par: Ozeki, Kentaro, et autres
Publié: (2025)
par: Ozeki, Kentaro, et autres
Publié: (2025)
Can We Afford The Perfect Prompt? Balancing Cost and Accuracy with the Economical Prompting Index
par: McDonald, Tyler, et autres
Publié: (2024)
par: McDonald, Tyler, et autres
Publié: (2024)
Two Directions for Clinical Data Generation with Large Language Models: Data-to-Label and Label-to-Data
par: Li, Rumeng, et autres
Publié: (2023)
par: Li, Rumeng, et autres
Publié: (2023)
Large Language Models Do Multi-Label Classification Differently
par: Ma, Marcus, et autres
Publié: (2025)
par: Ma, Marcus, et autres
Publié: (2025)
Large Language Models for Patient Comments Multi-Label Classification
par: Sakai, Hajar, et autres
Publié: (2024)
par: Sakai, Hajar, et autres
Publié: (2024)
BenchmarkCards: Standardized Documentation for Large Language Model Benchmarks
par: Sokol, Anna, et autres
Publié: (2024)
par: Sokol, Anna, et autres
Publié: (2024)
NSMQ Riddles: A Benchmark of Scientific and Mathematical Riddles for Quizzing Large Language Models
par: Boateng, George, et autres
Publié: (2026)
par: Boateng, George, et autres
Publié: (2026)
Comparative Analysis of Large Language Models in Healthcare
par: Santhosh, Subin, et autres
Publié: (2026)
par: Santhosh, Subin, et autres
Publié: (2026)
Interpretable Online Log Analysis Using Large Language Models with Prompt Strategies
par: Liu, Yilun, et autres
Publié: (2023)
par: Liu, Yilun, et autres
Publié: (2023)
When Benchmarks Age: Temporal Misalignment through Large Language Model Factuality Evaluation
par: Jiang, Xunyi, et autres
Publié: (2025)
par: Jiang, Xunyi, et autres
Publié: (2025)
Estonian Native Large Language Model Benchmark
par: Lillepalu, Helena Grete, et autres
Publié: (2025)
par: Lillepalu, Helena Grete, et autres
Publié: (2025)
Benchmarking Linguistic Diversity of Large Language Models
par: Guo, Yanzhu, et autres
Publié: (2024)
par: Guo, Yanzhu, et autres
Publié: (2024)
NYT-Connections: A Deceptively Simple Text Classification Task that Stumps System-1 Thinkers
par: Lopez, Angel Yahir Loredo, et autres
Publié: (2024)
par: Lopez, Angel Yahir Loredo, et autres
Publié: (2024)
Sparse Rewards Can Self-Train Dialogue Agents
par: Lattimer, Barrett Martin, et autres
Publié: (2024)
par: Lattimer, Barrett Martin, et autres
Publié: (2024)
Benchmark Data Contamination of Large Language Models: A Survey
par: Xu, Cheng, et autres
Publié: (2024)
par: Xu, Cheng, et autres
Publié: (2024)
CLIMB: A Benchmark of Clinical Bias in Large Language Models
par: Zhang, Yubo, et autres
Publié: (2024)
par: Zhang, Yubo, et autres
Publié: (2024)
Searching for Structure: Investigating Emergent Communication with Large Language Models
par: Kouwenhoven, Tom, et autres
Publié: (2024)
par: Kouwenhoven, Tom, et autres
Publié: (2024)
Progressively Label Enhancement for Large Language Model Alignment
par: Liu, Biao, et autres
Publié: (2024)
par: Liu, Biao, et autres
Publié: (2024)
Traces of Social Competence in Large Language Models
par: Kouwenhoven, Tom, et autres
Publié: (2026)
par: Kouwenhoven, Tom, et autres
Publié: (2026)
Documents similaires
-
Exploratory Semantic Reliability Analysis of Wind Turbine Maintenance Logs using Large Language Models
par: Malyi, Max, et autres
Publié: (2025) -
A Comparative Study on Large Language Models for Log Parsing
par: Astekin, Merve, et autres
Publié: (2024) -
STOP! Benchmarking Large Language Models with Sensitivity Testing on Offensive Progressions
par: Morabito, Robert, et autres
Publié: (2024) -
Analysis and Control of Acoustic Emissions from Marine Energy Converters
par: He, Jiaqin, et autres
Publié: (2025) -
LogEval: A Comprehensive Benchmark Suite for Large Language Models In Log Analysis
par: Cui, Tianyu, et autres
Publié: (2024)