Improving LLM Performance Through Black-Box Online Tuning: A Case for Adding System Specs to Factsheets for Trusted AI
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Atinafu, Yonas, Lin, Henry, Cohen, Robin |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
RewardHackingAgents: Benchmarking Evaluation Integrity for LLM ML-Engineering Agents
par: Atinafu, Yonas, et autres
Publié: (2026)
par: Atinafu, Yonas, et autres
Publié: (2026)
PixLift: Accelerating Web Browsing via AI Upscaling
par: Atinafu, Yonas, et autres
Publié: (2025)
par: Atinafu, Yonas, et autres
Publié: (2025)
TurboSpec: Closed-loop Speculation Control System for Optimizing LLM Serving Goodput
par: Liu, Xiaoxuan, et autres
Publié: (2024)
par: Liu, Xiaoxuan, et autres
Publié: (2024)
SemaTune: Semantic-Aware Online OS Tuning with Large Language Models
par: Liargkovas, Georgios, et autres
Publié: (2026)
par: Liargkovas, Georgios, et autres
Publié: (2026)
LLM Swiss Round: Aggregating Multi-Benchmark Performance via Competitive Swiss-System Dynamics
par: Liu, Jiashuo, et autres
Publié: (2025)
par: Liu, Jiashuo, et autres
Publié: (2025)
Do AI Models Dream of Faster Code? An Empirical Study on LLM-Proposed Performance Improvements in Real-World Software
par: Yi, Lirong, et autres
Publié: (2025)
par: Yi, Lirong, et autres
Publié: (2025)
Empirical Evaluation of Integrated Trust Mechanism to Improve Trust in E-commerce Services
par: Yasir, Siddiqui Muhammad, et autres
Publié: (2024)
par: Yasir, Siddiqui Muhammad, et autres
Publié: (2024)
Performance Characterization of Expert Router for Scalable LLM Inference
par: Pichlmeier, Josef, et autres
Publié: (2024)
par: Pichlmeier, Josef, et autres
Publié: (2024)
Pushing the Envelope of LLM Inference on AI-PC and Intel GPUs
par: Georganas, Evangelos, et autres
Publié: (2025)
par: Georganas, Evangelos, et autres
Publié: (2025)
Profiling LoRA/QLoRA Fine-Tuning Efficiency on Consumer GPUs: An RTX 4060 Case Study
par: Avinash, MSR
Publié: (2025)
par: Avinash, MSR
Publié: (2025)
Silicon Showdown: Performance, Efficiency, and Ecosystem Barriers in Consumer-Grade LLM Inference
par: Javat, Abdurrahman, et autres
Publié: (2026)
par: Javat, Abdurrahman, et autres
Publié: (2026)
A Data-driven ML Approach for Maximizing Performance in LLM-Adapter Serving
par: Agullo, Ferran, et autres
Publié: (2025)
par: Agullo, Ferran, et autres
Publié: (2025)
SweetSpot: An Analytical Model for Predicting Energy Efficiency of LLM Inference
par: Cavagna, Hiari Pizzini, et autres
Publié: (2026)
par: Cavagna, Hiari Pizzini, et autres
Publié: (2026)
Ragged Paged Attention: A High-Performance and Flexible LLM Inference Kernel for TPU
par: Jiang, Jevin, et autres
Publié: (2026)
par: Jiang, Jevin, et autres
Publié: (2026)
FlexQuant: Elastic Quantization Framework for Locally Hosted LLM on Edge Devices
par: Chai, Yuji, et autres
Publié: (2025)
par: Chai, Yuji, et autres
Publié: (2025)
Faster LLM Inference using DBMS-Inspired Preemption and Cache Replacement Policies
par: Kim, Kyoungmin, et autres
Publié: (2024)
par: Kim, Kyoungmin, et autres
Publié: (2024)
Looking Forward: Challenges and Opportunities in Agentic AI Reliability
par: Xing, Liudong, et autres
Publié: (2025)
par: Xing, Liudong, et autres
Publié: (2025)
XTC, A Research Platform for Optimizing AI Workload Operators
par: Hugo, Pompougnac, et autres
Publié: (2025)
par: Hugo, Pompougnac, et autres
Publié: (2025)
Understanding and Benchmarking Artificial Intelligence: OpenAI's o3 Is Not AGI
par: Pfister, Rolf, et autres
Publié: (2025)
par: Pfister, Rolf, et autres
Publié: (2025)
Performance Modeling of Data Storage Systems using Generative Models
par: Al-Maeeni, Abdalaziz Rashid, et autres
Publié: (2023)
par: Al-Maeeni, Abdalaziz Rashid, et autres
Publié: (2023)
Learning, Potential, and Retention: An Approach for Evaluating Adaptive AI-Enabled Medical Devices
par: Burgon, Alexis, et autres
Publié: (2026)
par: Burgon, Alexis, et autres
Publié: (2026)
Revolutionizing System Reliability: The Role of AI in Predictive Maintenance Strategies
par: Bidollahkhani, Michael, et autres
Publié: (2024)
par: Bidollahkhani, Michael, et autres
Publié: (2024)
Personalized Model-Based Design of Human Centric AI enabled CPS for Long term usage
par: Ngabonziza, Bernard, et autres
Publié: (2026)
par: Ngabonziza, Bernard, et autres
Publié: (2026)
Learning Performance-Improving Code Edits
par: Shypula, Alexander, et autres
Publié: (2023)
par: Shypula, Alexander, et autres
Publié: (2023)
Accelerating LLM Inference via Dynamic KV Cache Placement in Heterogeneous Memory System
par: Fang, Yunhua, et autres
Publié: (2025)
par: Fang, Yunhua, et autres
Publié: (2025)
ShadowNPU: System and Algorithm Co-design for NPU-Centric On-Device LLM Inference
par: Yin, Wangsong, et autres
Publié: (2025)
par: Yin, Wangsong, et autres
Publié: (2025)
Impact of Data-Oriented and Object-Oriented Design on Performance and Cache Utilization with Artificial Intelligence Algorithms in Multi-Threaded CPUs
par: Arantes, Gabriel M., et autres
Publié: (2025)
par: Arantes, Gabriel M., et autres
Publié: (2025)
Ensuring Reliability of Curated EHR-Derived Data: The Validation of Accuracy for LLM/ML-Extracted Information and Data (VALID) Framework
par: Estevez, Melissa, et autres
Publié: (2025)
par: Estevez, Melissa, et autres
Publié: (2025)
DeepContext: A Context-aware, Cross-platform, and Cross-framework Tool for Performance Profiling and Analysis of Deep Learning Workloads
par: Zhao, Qidong, et autres
Publié: (2024)
par: Zhao, Qidong, et autres
Publié: (2024)
Reducing Latency of LLM Search Agent via Speculation-based Algorithm-System Co-Design
par: Huang, Zixiao, et autres
Publié: (2025)
par: Huang, Zixiao, et autres
Publié: (2025)
Energy per Successful Goal: Goal-Level Energy Accounting for Agentic AI Systems
par: Panigrahy, Deepak, et autres
Publié: (2026)
par: Panigrahy, Deepak, et autres
Publié: (2026)
Are We Scaling the Right Thing? A System Perspective on Test-Time Scaling
par: Zhao, Youpeng, et autres
Publié: (2025)
par: Zhao, Youpeng, et autres
Publié: (2025)
Reliability by design: quantifying and eliminating fabrication risk in LLMs. From generative to consultative AI: a comparative analysis in the legal domain and lessons for high-stakes knowledge bases
par: Dantart, Alex
Publié: (2026)
par: Dantart, Alex
Publié: (2026)
CipherBank: Exploring the Boundary of LLM Reasoning Capabilities through Cryptography Challenges
par: Li, Yu, et autres
Publié: (2025)
par: Li, Yu, et autres
Publié: (2025)
Throughput Optimization as a Strategic Lever in Large-Scale AI Systems: Evidence from Dataloader and Memory Profiling Innovations
par: Jha, Mayank
Publié: (2026)
par: Jha, Mayank
Publié: (2026)
The Unseen AI Disruptions for Power Grids: LLM-Induced Transients
par: Li, Yuzhuo, et autres
Publié: (2024)
par: Li, Yuzhuo, et autres
Publié: (2024)
Accelerating AI Performance using Anderson Extrapolation on GPUs
par: Dajani, Saleem Abdul Fattah Ahmed Al, et autres
Publié: (2024)
par: Dajani, Saleem Abdul Fattah Ahmed Al, et autres
Publié: (2024)
Towards Generalized Parameter Tuning in Coherent Ising Machines: A Portfolio-Based Approach
par: Hanyu, Tatsuro, et autres
Publié: (2025)
par: Hanyu, Tatsuro, et autres
Publié: (2025)
Forecasting LLM Inference Performance via Hardware-Agnostic Analytical Modeling
par: Patwari, Rajeev, et autres
Publié: (2025)
par: Patwari, Rajeev, et autres
Publié: (2025)
DyLLM: Efficient Diffusion LLM Inference via Saliency-based Token Selection and Partial Attention
par: Lee, Younjoo, et autres
Publié: (2026)
par: Lee, Younjoo, et autres
Publié: (2026)
Documents similaires
-
RewardHackingAgents: Benchmarking Evaluation Integrity for LLM ML-Engineering Agents
par: Atinafu, Yonas, et autres
Publié: (2026) -
PixLift: Accelerating Web Browsing via AI Upscaling
par: Atinafu, Yonas, et autres
Publié: (2025) -
TurboSpec: Closed-loop Speculation Control System for Optimizing LLM Serving Goodput
par: Liu, Xiaoxuan, et autres
Publié: (2024) -
SemaTune: Semantic-Aware Online OS Tuning with Large Language Models
par: Liargkovas, Georgios, et autres
Publié: (2026) -
LLM Swiss Round: Aggregating Multi-Benchmark Performance via Competitive Swiss-System Dynamics
par: Liu, Jiashuo, et autres
Publié: (2025)