Saved in:
| Main Author: | Herbold, Steffen |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2504.08312 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
GRADIEND: Feature Learning within Neural Networks Exemplified through Biases
by: Drechsel, Jonathan, et al.
Published: (2025)
by: Drechsel, Jonathan, et al.
Published: (2025)
Large Language Models can impersonate politicians and other public figures
by: Herbold, Steffen, et al.
Published: (2024)
by: Herbold, Steffen, et al.
Published: (2024)
Legal Aspects for Software Developers Interested in Generative AI Applications
by: Herbold, Steffen, et al.
Published: (2024)
by: Herbold, Steffen, et al.
Published: (2024)
Utilizing LLMs for Industrial Process Automation: A Case Study on Modifying RAPID Programs
by: Fares, Salim, et al.
Published: (2025)
by: Fares, Salim, et al.
Published: (2025)
CriticBench: Benchmarking LLMs for Critique-Correct Reasoning
by: Lin, Zicheng, et al.
Published: (2024)
by: Lin, Zicheng, et al.
Published: (2024)
DPrivBench: Benchmarking LLMs' Reasoning for Differential Privacy
by: Wang, Erchi, et al.
Published: (2026)
by: Wang, Erchi, et al.
Published: (2026)
SensorBench: Benchmarking LLMs in Coding-Based Sensor Processing
by: Quan, Pengrui, et al.
Published: (2024)
by: Quan, Pengrui, et al.
Published: (2024)
DM-Bench: Benchmarking LLMs for Personalized Decision Making in Diabetes Management
by: Cardei, Maria Ana, et al.
Published: (2025)
by: Cardei, Maria Ana, et al.
Published: (2025)
AssayBench: An Assay-Level Virtual Cell Benchmark for LLMs and Agents
by: De Brouwer, Edward, et al.
Published: (2026)
by: De Brouwer, Edward, et al.
Published: (2026)
AQA-Bench: An Interactive Benchmark for Evaluating LLMs' Sequential Reasoning Ability
by: Yang, Siwei, et al.
Published: (2024)
by: Yang, Siwei, et al.
Published: (2024)
Semantic similarity prediction is better than other semantic similarity measures
by: Herbold, Steffen
Published: (2023)
by: Herbold, Steffen
Published: (2023)
SortedRL: Accelerating RL Training for LLMs through Online Length-Aware Scheduling
by: Zhang, Yiqi, et al.
Published: (2026)
by: Zhang, Yiqi, et al.
Published: (2026)
seqBench: A Tunable Benchmark to Quantify Sequential Reasoning Limits of LLMs
by: Ramezanali, Mohammad, et al.
Published: (2025)
by: Ramezanali, Mohammad, et al.
Published: (2025)
TSI-Bench: Benchmarking Time Series Imputation
by: Du, Wenjie, et al.
Published: (2024)
by: Du, Wenjie, et al.
Published: (2024)
JudgeBench: A Benchmark for Evaluating LLM-based Judges
by: Tan, Sijun, et al.
Published: (2024)
by: Tan, Sijun, et al.
Published: (2024)
RooflineBench: A Benchmarking Framework for On-Device LLMs via Roofline Analysis
by: Bi, Zhen, et al.
Published: (2026)
by: Bi, Zhen, et al.
Published: (2026)
Lexicographic optimization-based approaches to learning a representative model for multi-criteria sorting with non-monotonic criteria
by: Zhang, Zhen, et al.
Published: (2024)
by: Zhang, Zhen, et al.
Published: (2024)
IGL-Bench: Establishing the Comprehensive Benchmark for Imbalanced Graph Learning
by: Qin, Jiawen, et al.
Published: (2024)
by: Qin, Jiawen, et al.
Published: (2024)
MU-Bench: A Multitask Multimodal Benchmark for Machine Unlearning
by: Cheng, Jiali, et al.
Published: (2024)
by: Cheng, Jiali, et al.
Published: (2024)
RouterBench: A Benchmark for Multi-LLM Routing System
by: Hu, Qitian Jason, et al.
Published: (2024)
by: Hu, Qitian Jason, et al.
Published: (2024)
AgentBench: Evaluating LLMs as Agents
by: Liu, Xiao, et al.
Published: (2023)
by: Liu, Xiao, et al.
Published: (2023)
Gradient-Optimized Fuzzy Classifier: A Benchmark Study Against State-of-the-Art Models
by: Sieverding, Magnus, et al.
Published: (2025)
by: Sieverding, Magnus, et al.
Published: (2025)
EEG-Bench: A Benchmark for EEG Foundation Models in Clinical Applications
by: Kastrati, Ard, et al.
Published: (2025)
by: Kastrati, Ard, et al.
Published: (2025)
TabAttackBench: A Benchmark for Adversarial Attacks on Tabular Data
by: He, Zhipeng, et al.
Published: (2025)
by: He, Zhipeng, et al.
Published: (2025)
WARC-Bench: Web Archive Based Benchmark for GUI Subtask Executions
by: Srivastava, Sanjari, et al.
Published: (2025)
by: Srivastava, Sanjari, et al.
Published: (2025)
CHIMERA-Bench: A Benchmark Dataset for Epitope-Specific Antibody Design
by: Ahmed, Mansoor, et al.
Published: (2026)
by: Ahmed, Mansoor, et al.
Published: (2026)
ExtractBench: A Benchmark and Evaluation Methodology for Complex Structured Extraction
by: Ferguson, Nick, et al.
Published: (2026)
by: Ferguson, Nick, et al.
Published: (2026)
HW-GPT-Bench: Hardware-Aware Architecture Benchmark for Language Models
by: Sukthanker, Rhea Sanjay, et al.
Published: (2024)
by: Sukthanker, Rhea Sanjay, et al.
Published: (2024)
PRL-Bench: A Comprehensive Benchmark Evaluating LLMs' Capabilities in Frontier Physics Research
by: Miao, Tingjia, et al.
Published: (2026)
by: Miao, Tingjia, et al.
Published: (2026)
MobileKernelBench: Can LLMs Write Efficient Kernels for Mobile Devices?
by: Zou, Xingze, et al.
Published: (2026)
by: Zou, Xingze, et al.
Published: (2026)
FedRS-Bench: Realistic Federated Learning Datasets and Benchmarks in Remote Sensing
by: Zhao, Haodong, et al.
Published: (2025)
by: Zhao, Haodong, et al.
Published: (2025)
TutorBench: A Benchmark To Assess Tutoring Capabilities Of Large Language Models
by: Srinivasa, Rakshith S, et al.
Published: (2025)
by: Srinivasa, Rakshith S, et al.
Published: (2025)
BetterBench: Assessing AI Benchmarks, Uncovering Issues, and Establishing Best Practices
by: Reuel, Anka, et al.
Published: (2024)
by: Reuel, Anka, et al.
Published: (2024)
RamanBench: A Large-Scale Benchmark for Machine Learning on Raman Spectroscopy
by: Koddenbrock, Mario, et al.
Published: (2026)
by: Koddenbrock, Mario, et al.
Published: (2026)
VertiBench: Advancing Feature Distribution Diversity in Vertical Federated Learning Benchmarks
by: Wu, Zhaomin, et al.
Published: (2023)
by: Wu, Zhaomin, et al.
Published: (2023)
RelBench: A Benchmark for Deep Learning on Relational Databases
by: Robinson, Joshua, et al.
Published: (2024)
by: Robinson, Joshua, et al.
Published: (2024)
SmartBench: Evaluating LLMs in Smart Homes with Anomalous Device States and Behavioral Contexts
by: Zou, Qingsong, et al.
Published: (2026)
by: Zou, Qingsong, et al.
Published: (2026)
CMPhysBench: A Benchmark for Evaluating Large Language Models in Condensed Matter Physics
by: Wang, Weida, et al.
Published: (2025)
by: Wang, Weida, et al.
Published: (2025)
MirrorBench: A Benchmark to Evaluate Conversational User-Proxy Agents for Human-Likeness
by: Hathidara, Ashutosh, et al.
Published: (2026)
by: Hathidara, Ashutosh, et al.
Published: (2026)
SurvHTE-Bench: A Benchmark for Heterogeneous Treatment Effect Estimation in Survival Analysis
by: Noroozizadeh, Shahriar, et al.
Published: (2026)
by: Noroozizadeh, Shahriar, et al.
Published: (2026)
Similar Items
-
GRADIEND: Feature Learning within Neural Networks Exemplified through Biases
by: Drechsel, Jonathan, et al.
Published: (2025) -
Large Language Models can impersonate politicians and other public figures
by: Herbold, Steffen, et al.
Published: (2024) -
Legal Aspects for Software Developers Interested in Generative AI Applications
by: Herbold, Steffen, et al.
Published: (2024) -
Utilizing LLMs for Industrial Process Automation: A Case Study on Modifying RAPID Programs
by: Fares, Salim, et al.
Published: (2025) -
CriticBench: Benchmarking LLMs for Critique-Correct Reasoning
by: Lin, Zicheng, et al.
Published: (2024)