Pyramid MoA: A Probabilistic Framework for Cost-Optimized Anytime Inference
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Khaled, Arindam |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Optimizing Anytime Reasoning via Budget Relative Policy Optimization
par: Qi, Penghui, et autres
Publié: (2025)
par: Qi, Penghui, et autres
Publié: (2025)
Mix- and MoE-DPO: A Variational Inference Approach to Direct Preference Optimization
par: Bohne, Jason, et autres
Publié: (2025)
par: Bohne, Jason, et autres
Publié: (2025)
OptScale: Probabilistic Optimality for Inference-time Scaling
par: Wang, Youkang, et autres
Publié: (2025)
par: Wang, Youkang, et autres
Publié: (2025)
Active Preference Inference using Language Models and Probabilistic Reasoning
par: Piriyakulkij, Wasu Top, et autres
Publié: (2023)
par: Piriyakulkij, Wasu Top, et autres
Publié: (2023)
MoA: Heterogeneous Mixture of Adapters for Parameter-Efficient Fine-Tuning of Large Language Models
par: Cao, Jie, et autres
Publié: (2025)
par: Cao, Jie, et autres
Publié: (2025)
Probabilistic Consensus through Ensemble Validation: A Framework for LLM Reliability
par: Naik, Ninad
Publié: (2024)
par: Naik, Ninad
Publié: (2024)
Probabilistic Inference in Language Models via Twisted Sequential Monte Carlo
par: Zhao, Stephen, et autres
Publié: (2024)
par: Zhao, Stephen, et autres
Publié: (2024)
Reducing the Probability of Undesirable Outputs in Language Models Using Probabilistic Inference
par: Zhao, Stephen, et autres
Publié: (2025)
par: Zhao, Stephen, et autres
Publié: (2025)
Cross-Architecture Transfer Learning for Linear-Cost Inference Transformers
par: Choi, Sehyun
Publié: (2024)
par: Choi, Sehyun
Publié: (2024)
Stabilizing MoE Reinforcement Learning by Aligning Training and Inference Routers
par: Ma, Wenhan, et autres
Publié: (2025)
par: Ma, Wenhan, et autres
Publié: (2025)
Elastic MoE: Unlocking the Inference-Time Scalability of Mixture-of-Experts
par: Gu, Naibin, et autres
Publié: (2025)
par: Gu, Naibin, et autres
Publié: (2025)
MoE-SpAc: Efficient MoE Inference Based on Speculative Activation Utility in Heterogeneous Edge Scenarios
par: Li, Shuhuai, et autres
Publié: (2026)
par: Li, Shuhuai, et autres
Publié: (2026)
A Framework for Inference Inspired by Human Memory Mechanisms
par: Zeng, Xiangyu, et autres
Publié: (2023)
par: Zeng, Xiangyu, et autres
Publié: (2023)
Direct Nash Optimization: Teaching Language Models to Self-Improve with General Preferences
par: Rosset, Corby, et autres
Publié: (2024)
par: Rosset, Corby, et autres
Publié: (2024)
Towards Optimizing the Costs of LLM Usage
par: Shekhar, Shivanshu, et autres
Publié: (2024)
par: Shekhar, Shivanshu, et autres
Publié: (2024)
Green Prompting: Characterizing Prompt-driven Energy Costs of LLM Inference
par: Adamska, Marta, et autres
Publié: (2025)
par: Adamska, Marta, et autres
Publié: (2025)
Vidur: A Large-Scale Simulation Framework For LLM Inference
par: Agrawal, Amey, et autres
Publié: (2024)
par: Agrawal, Amey, et autres
Publié: (2024)
Attention-MoA: Enhancing Mixture-of-Agents via Inter-Agent Semantic Attention and Deep Residual Synthesis
par: Wen, Jianyu, et autres
Publié: (2026)
par: Wen, Jianyu, et autres
Publié: (2026)
PMPO: Probabilistic Metric Prompt Optimization for Small and Large Language Models
par: Zhao, Chenzhuo, et autres
Publié: (2025)
par: Zhao, Chenzhuo, et autres
Publié: (2025)
GATech at AbjadMed: Bidirectional Encoders vs. Causal Decoders: Insights from 82-Class Arabic Medical Classification
par: Khamis, Ahmed Khaled
Publié: (2026)
par: Khamis, Ahmed Khaled
Publié: (2026)
Alloc-MoE: Budget-Aware Expert Activation Allocation for Efficient Mixture-of-Experts Inference
par: Liu, Baihui, et autres
Publié: (2026)
par: Liu, Baihui, et autres
Publié: (2026)
MoEs Are Stronger than You Think: Hyper-Parallel Inference Scaling with RoE
par: Zibakhsh, Soheil, et autres
Publié: (2025)
par: Zibakhsh, Soheil, et autres
Publié: (2025)
Cer-Eval: Certifiable and Cost-Efficient Evaluation Framework for LLMs
par: Wang, Ganghua, et autres
Publié: (2025)
par: Wang, Ganghua, et autres
Publié: (2025)
MoBayes: A Modular Bayesian Framework for Separating Reasoning from Language in Conversational Clinical Decision Support
par: Kesmen, Yusuf, et autres
Publié: (2026)
par: Kesmen, Yusuf, et autres
Publié: (2026)
Optimizing Temperature for Language Models with Multi-Sample Inference
par: Du, Weihua, et autres
Publié: (2025)
par: Du, Weihua, et autres
Publié: (2025)
Archon: An Architecture Search Framework for Inference-Time Techniques
par: Saad-Falcon, Jon, et autres
Publié: (2024)
par: Saad-Falcon, Jon, et autres
Publié: (2024)
LocMoE: A Low-Overhead MoE for Large Language Model Training
par: Li, Jing, et autres
Publié: (2024)
par: Li, Jing, et autres
Publié: (2024)
Towards Specialized Generalists: A Multi-Task MoE-LoRA Framework for Domain-Specific LLM Adaptation
par: Yang, Yuxin, et autres
Publié: (2026)
par: Yang, Yuxin, et autres
Publié: (2026)
PromptIntern: Saving Inference Costs by Internalizing Recurrent Prompt during Large Language Model Fine-tuning
par: Zou, Jiaru, et autres
Publié: (2024)
par: Zou, Jiaru, et autres
Publié: (2024)
FineSteer: A Unified Framework for Fine-Grained Inference-Time Steering in Large Language Models
par: Weng, Zixuan, et autres
Publié: (2026)
par: Weng, Zixuan, et autres
Publié: (2026)
A Unified Virtual Mixture-of-Experts Framework:Enhanced Inference and Hallucination Mitigation in Single-Model System
par: Liu, Mingyan
Publié: (2025)
par: Liu, Mingyan
Publié: (2025)
An Efficient Inference Framework for Early-exit Large Language Models
par: Miao, Ruijie, et autres
Publié: (2024)
par: Miao, Ruijie, et autres
Publié: (2024)
Aioli: A Unified Optimization Framework for Language Model Data Mixing
par: Chen, Mayee F., et autres
Publié: (2024)
par: Chen, Mayee F., et autres
Publié: (2024)
CORM: Cache Optimization with Recent Message for Large Language Model Inference
par: Dai, Jincheng, et autres
Publié: (2024)
par: Dai, Jincheng, et autres
Publié: (2024)
ViCLSR: A Supervised Contrastive Learning Framework with Natural Language Inference for Natural Language Understanding Tasks
par: Van Huynh, Tin, et autres
Publié: (2026)
par: Van Huynh, Tin, et autres
Publié: (2026)
Counting Clues: A Lightweight Probabilistic Baseline Can Match an LLM
par: Jia, Furong, et autres
Publié: (2025)
par: Jia, Furong, et autres
Publié: (2025)
Speaking the Same Language: Leveraging LLMs in Standardizing Clinical Data for AI
par: Sett, Arindam, et autres
Publié: (2024)
par: Sett, Arindam, et autres
Publié: (2024)
Probabilistic Programming with Programmable Variational Inference
par: Becker, McCoy R., et autres
Publié: (2024)
par: Becker, McCoy R., et autres
Publié: (2024)
SwiftKV: Fast Prefill-Optimized Inference with Knowledge-Preserving Model Transformation
par: Qiao, Aurick, et autres
Publié: (2024)
par: Qiao, Aurick, et autres
Publié: (2024)
CHESS: Optimizing LLM Inference via Channel-Wise Thresholding and Selective Sparsification
par: He, Junhui, et autres
Publié: (2024)
par: He, Junhui, et autres
Publié: (2024)
Documents similaires
-
Optimizing Anytime Reasoning via Budget Relative Policy Optimization
par: Qi, Penghui, et autres
Publié: (2025) -
Mix- and MoE-DPO: A Variational Inference Approach to Direct Preference Optimization
par: Bohne, Jason, et autres
Publié: (2025) -
OptScale: Probabilistic Optimality for Inference-time Scaling
par: Wang, Youkang, et autres
Publié: (2025) -
Active Preference Inference using Language Models and Probabilistic Reasoning
par: Piriyakulkij, Wasu Top, et autres
Publié: (2023) -
MoA: Heterogeneous Mixture of Adapters for Parameter-Efficient Fine-Tuning of Large Language Models
par: Cao, Jie, et autres
Publié: (2025)