Guardado en:
| Autores principales: | Recasens, Pol G., Zhu, Yue, Wang, Chen, Lee, Eun Kyung, Tardieu, Olivier, Youssef, Alaa, Torres, Jordi, Berral, Josep Ll. |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2404.03353 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
A Data-driven ML Approach for Maximizing Performance in LLM-Adapter Serving
por: Agullo, Ferran, et al.
Publicado: (2025)
por: Agullo, Ferran, et al.
Publicado: (2025)
Mind the Memory Gap: Unveiling GPU Bottlenecks in Large-Batch LLM Inference
por: Recasens, Pol G., et al.
Publicado: (2025)
por: Recasens, Pol G., et al.
Publicado: (2025)
Data Driven Optimization of GPU efficiency for Distributed LLM Adapter Serving
por: Agullo, Ferran, et al.
Publicado: (2026)
por: Agullo, Ferran, et al.
Publicado: (2026)
FRIDA: Free-Rider Detection using Privacy Attacks
por: Recasens, Pol G., et al.
Publicado: (2024)
por: Recasens, Pol G., et al.
Publicado: (2024)
In-Context Bias Propagation in LLM-Based Tabular Data Generation
por: Recasens, Pol G., et al.
Publicado: (2025)
por: Recasens, Pol G., et al.
Publicado: (2025)
Enabling an OpenStack-based cloud on top of RISC-V hardware
por: Marrón, Diego, et al.
Publicado: (2024)
por: Marrón, Diego, et al.
Publicado: (2024)
Revisiting Disaggregated Large Language Model Serving for Performance and Energy Implications
por: Li, Jiaxi, et al.
Publicado: (2025)
por: Li, Jiaxi, et al.
Publicado: (2025)
ProST: Progressive Sub-task Training for Pareto-Optimal Multi-agent Systems Using Small Language Models
por: Bijoy, Biddut Sarker, et al.
Publicado: (2025)
por: Bijoy, Biddut Sarker, et al.
Publicado: (2025)
Pareto Optimal Code Generation
por: Orlanski, Gabriel, et al.
Publicado: (2025)
por: Orlanski, Gabriel, et al.
Publicado: (2025)
NanoFlow: Towards Optimal Large Language Model Serving Throughput
por: Zhu, Kan, et al.
Publicado: (2024)
por: Zhu, Kan, et al.
Publicado: (2024)
Pareto Optimal Learning for Estimating Large Language Model Errors
por: Zhao, Theodore, et al.
Publicado: (2023)
por: Zhao, Theodore, et al.
Publicado: (2023)
Self-Improvement Towards Pareto Optimality: Mitigating Preference Conflicts in Multi-Objective Alignment
por: Li, Moxin, et al.
Publicado: (2025)
por: Li, Moxin, et al.
Publicado: (2025)
Could Small Language Models Serve as Recommenders? Towards Data-centric Cold-start Recommendations
por: Wu, Xuansheng, et al.
Publicado: (2023)
por: Wu, Xuansheng, et al.
Publicado: (2023)
AccelGen: Heterogeneous SLO-Guaranteed High-Throughput LLM Inference Serving for Diverse Applications
por: Shen, Haiying, et al.
Publicado: (2025)
por: Shen, Haiying, et al.
Publicado: (2025)
SOMA: Efficient Multi-turn LLM Serving via Small Language Model
por: Cheng, Xueqi, et al.
Publicado: (2026)
por: Cheng, Xueqi, et al.
Publicado: (2026)
Jailbreak-Zero: A Path to Pareto Optimal Red Teaming for Large Language Models
por: Hu, Kai, et al.
Publicado: (2025)
por: Hu, Kai, et al.
Publicado: (2025)
ParetoBandit: Budget-Paced Adaptive Routing for Non-Stationary LLM Serving
por: Taberner-Miller, Annette
Publicado: (2026)
por: Taberner-Miller, Annette
Publicado: (2026)
RULE: Reinforcement UnLEarning Achieves Forget-Retain Pareto Optimality
por: Zhang, Chenlong, et al.
Publicado: (2025)
por: Zhang, Chenlong, et al.
Publicado: (2025)
LegiGPT: Party Politics and Transport Policy with Large Language Model
por: Yun, Hyunsoo, et al.
Publicado: (2025)
por: Yun, Hyunsoo, et al.
Publicado: (2025)
Towards Resiliency in Large Language Model Serving with KevlarFlow
por: Qian, Shangshu, et al.
Publicado: (2026)
por: Qian, Shangshu, et al.
Publicado: (2026)
Demographic and Linguistic Bias Evaluation in Omnimodal Language Models
por: Elobaid, Alaa
Publicado: (2026)
por: Elobaid, Alaa
Publicado: (2026)
UC-MOA: Utility-Conditioned Multi-Objective Alignment for Distributional Pareto-Optimality
por: Cheng, Zelei, et al.
Publicado: (2025)
por: Cheng, Zelei, et al.
Publicado: (2025)
Towards Optimal Statistical Watermarking
por: Huang, Baihe, et al.
Publicado: (2023)
por: Huang, Baihe, et al.
Publicado: (2023)
Small Language Models are Equation Reasoners
por: Kim, Bumjun, et al.
Publicado: (2024)
por: Kim, Bumjun, et al.
Publicado: (2024)
Pareto Multi-Objective Alignment for Language Models
por: He, Qiang, et al.
Publicado: (2025)
por: He, Qiang, et al.
Publicado: (2025)
AugServe: Adaptive Request Scheduling for Augmented Large Language Model Inference Serving
por: Wang, Ying, et al.
Publicado: (2025)
por: Wang, Ying, et al.
Publicado: (2025)
Towards Optimal Learning of Language Models
por: Gu, Yuxian, et al.
Publicado: (2024)
por: Gu, Yuxian, et al.
Publicado: (2024)
ParetoHqD: Fast Offline Multiobjective Alignment of Large Language Models using Pareto High-quality Data
por: Gu, Haoran, et al.
Publicado: (2025)
por: Gu, Haoran, et al.
Publicado: (2025)
RelayAttention for Efficient Large Language Model Serving with Long System Prompts
por: Zhu, Lei, et al.
Publicado: (2024)
por: Zhu, Lei, et al.
Publicado: (2024)
PSYDIAL: Personality-based Synthetic Dialogue Generation using Large Language Models
por: Han, Ji-Eun, et al.
Publicado: (2024)
por: Han, Ji-Eun, et al.
Publicado: (2024)
P/D-Serve: Serving Disaggregated Large Language Model at Scale
por: Jin, Yibo, et al.
Publicado: (2024)
por: Jin, Yibo, et al.
Publicado: (2024)
1+1>2: Can Large Language Models Serve as Cross-Lingual Knowledge Aggregators?
por: Huang, Yue, et al.
Publicado: (2024)
por: Huang, Yue, et al.
Publicado: (2024)
Towards a World-English Language Model for On-Device Virtual Assistants
por: Jalota, Rricha, et al.
Publicado: (2024)
por: Jalota, Rricha, et al.
Publicado: (2024)
Accelerating Retrieval-Augmented Language Model Serving with Speculation
por: Zhang, Zhihao, et al.
Publicado: (2024)
por: Zhang, Zhihao, et al.
Publicado: (2024)
SLaDe: A Portable Small Language Model Decompiler for Optimized Assembly
por: Armengol-Estapé, Jordi, et al.
Publicado: (2023)
por: Armengol-Estapé, Jordi, et al.
Publicado: (2023)
Pareto-optimal Non-uniform Language Generation
por: Charikar, Moses, et al.
Publicado: (2025)
por: Charikar, Moses, et al.
Publicado: (2025)
Exploring Multimodal Perception in Large Language Models Through Perceptual Strength Ratings
por: Lee, Jonghyun, et al.
Publicado: (2025)
por: Lee, Jonghyun, et al.
Publicado: (2025)
Compute-Accuracy Pareto Frontiers for Open-Source Reasoning Large Language Models
por: Prucs, Ákos, et al.
Publicado: (2025)
por: Prucs, Ákos, et al.
Publicado: (2025)
A Psycholinguistic Evaluation of Language Models' Sensitivity to Argument Roles
por: Lee, Eun-Kyoung Rosa, et al.
Publicado: (2024)
por: Lee, Eun-Kyoung Rosa, et al.
Publicado: (2024)
Tending Towards Stability: Convergence Challenges in Small Language Models
por: Martinez, Richard Diehl, et al.
Publicado: (2024)
por: Martinez, Richard Diehl, et al.
Publicado: (2024)
Ejemplares similares
-
A Data-driven ML Approach for Maximizing Performance in LLM-Adapter Serving
por: Agullo, Ferran, et al.
Publicado: (2025) -
Mind the Memory Gap: Unveiling GPU Bottlenecks in Large-Batch LLM Inference
por: Recasens, Pol G., et al.
Publicado: (2025) -
Data Driven Optimization of GPU efficiency for Distributed LLM Adapter Serving
por: Agullo, Ferran, et al.
Publicado: (2026) -
FRIDA: Free-Rider Detection using Privacy Attacks
por: Recasens, Pol G., et al.
Publicado: (2024) -
In-Context Bias Propagation in LLM-Based Tabular Data Generation
por: Recasens, Pol G., et al.
Publicado: (2025)