Enregistré dans:
| Auteurs principaux: | Bian, Song, Yan, Minghao, Jayarajan, Anand, Pekhimenko, Gennady, Venkataraman, Shivaram |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2510.16276 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Scaling Inference-Efficient Language Models
par: Bian, Song, et autres
Publié: (2025)
par: Bian, Song, et autres
Publié: (2025)
Scaling Laws Meet Model Architecture: Toward Inference-Efficient LLMs
par: Bian, Song, et autres
Publié: (2025)
par: Bian, Song, et autres
Publié: (2025)
LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models
par: Chang, Tzu-Tao, et autres
Publié: (2025)
par: Chang, Tzu-Tao, et autres
Publié: (2025)
Decoding Speculative Decoding
par: Yan, Minghao, et autres
Publié: (2024)
par: Yan, Minghao, et autres
Publié: (2024)
PolyThrottle: Energy-efficient Neural Network Inference on Edge Devices
par: Yan, Minghao, et autres
Publié: (2023)
par: Yan, Minghao, et autres
Publié: (2023)
DPQuant: Efficient and Differentially-Private Model Training via Dynamic Quantization Scheduling
par: Gao, Yubo, et autres
Publié: (2025)
par: Gao, Yubo, et autres
Publié: (2025)
Tally: Non-Intrusive Performance Isolation for Concurrent Deep Learning Workloads
par: Zhao, Wei, et autres
Publié: (2024)
par: Zhao, Wei, et autres
Publié: (2024)
LoRAFusion: Efficient LoRA Fine-Tuning for LLMs
par: Zhu, Zhanda, et autres
Publié: (2025)
par: Zhu, Zhanda, et autres
Publié: (2025)
Hexcute: A Compiler Framework for Automating Layout Synthesis in GPU Programs
par: Zhang, Xiao, et autres
Publié: (2025)
par: Zhang, Xiao, et autres
Publié: (2025)
PLoRA: Efficient LoRA Hyperparameter Tuning for Large Models
par: Yan, Minghao, et autres
Publié: (2025)
par: Yan, Minghao, et autres
Publié: (2025)
Tesserae: Scalable Placement Policies for Deep Learning Workloads
par: Bian, Song, et autres
Publié: (2025)
par: Bian, Song, et autres
Publié: (2025)
PGT-I: Scaling Spatiotemporal GNNs with Memory-Efficient Distributed Training
par: Ockerman, Seth, et autres
Publié: (2025)
par: Ockerman, Seth, et autres
Publié: (2025)
Tilus: A Tile-Level GPGPU Programming Language for Low-Precision Computation
par: Ding, Yaoyao, et autres
Publié: (2025)
par: Ding, Yaoyao, et autres
Publié: (2025)
When Do Multi-Agent Systems Outperform? Analysing the Learning Efficiency of Agentic Systems
par: Su, Junwei, et autres
Publié: (2026)
par: Su, Junwei, et autres
Publié: (2026)
On-line Learning in Tree MDPs by Treating Policies as Bandit Arms
par: Shah, Anvay, et autres
Publié: (2026)
par: Shah, Anvay, et autres
Publié: (2026)
Incremental IVF Index Maintenance for Streaming Vector Search
par: Mohoney, Jason, et autres
Publié: (2024)
par: Mohoney, Jason, et autres
Publié: (2024)
An MLCommons Scientific Benchmarks Ontology
par: Hawks, Ben, et autres
Publié: (2025)
par: Hawks, Ben, et autres
Publié: (2025)
APPL: A Prompt Programming Language for Harmonious Integration of Programs and Large Language Model Prompts
par: Dong, Honghua, et autres
Publié: (2024)
par: Dong, Honghua, et autres
Publié: (2024)
On Effectiveness and Efficiency of Agentic Tool-calling and RL Training
par: Liu, Tong, et autres
Publié: (2026)
par: Liu, Tong, et autres
Publié: (2026)
Learning to Construct Practical Agentic Systems
par: Kumar, Aditya, et autres
Publié: (2026)
par: Kumar, Aditya, et autres
Publié: (2026)
Environment Scaling for Interactive Agentic Experience Collection: A Survey
par: Huang, Yuchen, et autres
Publié: (2025)
par: Huang, Yuchen, et autres
Publié: (2025)
AgenticPay: A Multi-Agent LLM Negotiation System for Buyer-Seller Transactions
par: Liu, Xianyang, et autres
Publié: (2026)
par: Liu, Xianyang, et autres
Publié: (2026)
Needles in Needle Stacks: Meaningful Clinical Information Buried in Noisy Waveform Data
par: Nagaraj, Sujay, et autres
Publié: (2024)
par: Nagaraj, Sujay, et autres
Publié: (2024)
Re-ENACT: Reinforcement Learning for Emotional Speech Generation using Actor-Critic Strategy
par: Shankar, Ravi, et autres
Publié: (2024)
par: Shankar, Ravi, et autres
Publié: (2024)
Efficiency Robustness of Dynamic Deep Learning Systems
par: Rathnasuriya, Ravishka, et autres
Publié: (2025)
par: Rathnasuriya, Ravishka, et autres
Publié: (2025)
Fundamental Limits of Prompt Tuning Transformers: Universality, Capacity and Efficiency
par: Hu, Jerry Yao-Chieh, et autres
Publié: (2024)
par: Hu, Jerry Yao-Chieh, et autres
Publié: (2024)
Android Coach: Improve Online Agentic Training Efficiency with Single State Multiple Actions
par: Gan, Guo, et autres
Publié: (2026)
par: Gan, Guo, et autres
Publié: (2026)
On the Limited Representational Power of Value Functions and its Links to Statistical (In)Efficiency
par: Cheikhi, David, et autres
Publié: (2024)
par: Cheikhi, David, et autres
Publié: (2024)
What Do Latent Action Models Actually Learn?
par: Zhang, Chuheng, et autres
Publié: (2025)
par: Zhang, Chuheng, et autres
Publié: (2025)
Harnessing Agentic Evolution
par: Zhang, Jiayi, et autres
Publié: (2026)
par: Zhang, Jiayi, et autres
Publié: (2026)
A Plug-and-Play Fully On-the-Job Real-Time Reinforcement Learning Algorithm for a Direct-Drive Tandem-Wing Experiment Platforms Under Multiple Random Operating Conditions
par: Minghao, Zhang, et autres
Publié: (2024)
par: Minghao, Zhang, et autres
Publié: (2024)
RMA: an Agentic System for Research-Level Mathematical Problems
par: Zhao, Zelin, et autres
Publié: (2026)
par: Zhao, Zelin, et autres
Publié: (2026)
ADR: An Agentic Detection System for Enterprise Agentic AI Security
par: Li, Chenning, et autres
Publié: (2026)
par: Li, Chenning, et autres
Publié: (2026)
Decoupling the "What" and "Where" With Polar Coordinate Positional Embeddings
par: Gopalakrishnan, Anand, et autres
Publié: (2025)
par: Gopalakrishnan, Anand, et autres
Publié: (2025)
Agentic Uncertainty Reveals Agentic Overconfidence
par: Kaddour, Jean, et autres
Publié: (2026)
par: Kaddour, Jean, et autres
Publié: (2026)
Uncertainty Quantification in SVM prediction
par: Anand, Pritam
Publié: (2025)
par: Anand, Pritam
Publié: (2025)
AgentFlux: Decoupled Fine-Tuning & Inference for On-Device Agentic Systems
par: Kadekodi, Rohan, et autres
Publié: (2025)
par: Kadekodi, Rohan, et autres
Publié: (2025)
Verifiable Agentic Infrastructure: Proof-Derived Authorization for Sovereign AI Systems
par: He, Jun, et autres
Publié: (2026)
par: He, Jun, et autres
Publié: (2026)
GSM-Agent: Understanding Agentic Reasoning Using Controllable Environments
par: Zhu, Hanlin, et autres
Publié: (2025)
par: Zhu, Hanlin, et autres
Publié: (2025)
From $O(mn)$ to $O(r^2)$: Two-Sided Low-Rank Communication for Adam in Distributed Training with Memory Efficiency
par: Dang, Sizhe, et autres
Publié: (2026)
par: Dang, Sizhe, et autres
Publié: (2026)
Documents similaires
-
Scaling Inference-Efficient Language Models
par: Bian, Song, et autres
Publié: (2025) -
Scaling Laws Meet Model Architecture: Toward Inference-Efficient LLMs
par: Bian, Song, et autres
Publié: (2025) -
LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models
par: Chang, Tzu-Tao, et autres
Publié: (2025) -
Decoding Speculative Decoding
par: Yan, Minghao, et autres
Publié: (2024) -
PolyThrottle: Energy-efficient Neural Network Inference on Edge Devices
par: Yan, Minghao, et autres
Publié: (2023)