Efficient Hybrid Inference for LLMs: Reward-Based Token Modelling with Selective Cloud Assistance
Fuente:
arXiv
Guardado en:
| Autores principales: | MS, Adarsh, VG, Jithin, PS, Ditto |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Inference Acceleration for Large Language Models on CPUs
por: PS, Ditto, et al.
Publicado: (2024)
por: PS, Ditto, et al.
Publicado: (2024)
Intellecta Cognitiva: A Comprehensive Dataset for Advancing Academic Knowledge and Machine Reasoning
por: PS, Ajmal, et al.
Publicado: (2024)
por: PS, Ajmal, et al.
Publicado: (2024)
GPU-Virt-Bench: A Comprehensive Benchmarking Framework for Software-Based GPU Virtualization Systems
por: VG, Jithin, et al.
Publicado: (2025)
por: VG, Jithin, et al.
Publicado: (2025)
TokenSelect: Efficient Long-Context Inference and Length Extrapolation for LLMs via Dynamic Token-Level KV Cache Selection
por: Wu, Wei, et al.
Publicado: (2024)
por: Wu, Wei, et al.
Publicado: (2024)
Predicting Rewards Alongside Tokens: Non-disruptive Parameter Insertion for Efficient Inference Intervention in Large Language Model
por: Yuan, Chenhan, et al.
Publicado: (2024)
por: Yuan, Chenhan, et al.
Publicado: (2024)
Token Sparse Attention: Efficient Long-Context Inference with Interleaved Token Selection
por: Jo, Dongwon, et al.
Publicado: (2026)
por: Jo, Dongwon, et al.
Publicado: (2026)
Beyond Component Strength: Synergistic Integration and Adaptive Calibration in Multi-Agent RAG Systems
por: Krishnan, Jithin
Publicado: (2025)
por: Krishnan, Jithin
Publicado: (2025)
PromptDistill: Query-based Selective Token Retention in Intermediate Layers for Efficient Large Language Model Inference
por: Jin, Weisheng, et al.
Publicado: (2025)
por: Jin, Weisheng, et al.
Publicado: (2025)
Discriminative Policy Optimization for Token-Level Reward Models
por: Chen, Hongzhan, et al.
Publicado: (2025)
por: Chen, Hongzhan, et al.
Publicado: (2025)
Flux Attention: Context-Aware Hybrid Attention for Efficient LLMs Inference
por: Qiu, Quantong, et al.
Publicado: (2026)
por: Qiu, Quantong, et al.
Publicado: (2026)
Achieving Tokenizer Flexibility in Language Models through Heuristic Adaptation and Supertoken Learning
por: Sharthak, Shaurya, et al.
Publicado: (2025)
por: Sharthak, Shaurya, et al.
Publicado: (2025)
Small Reward Models via Backward Inference
por: Wang, Yike, et al.
Publicado: (2026)
por: Wang, Yike, et al.
Publicado: (2026)
Reward Auditor: Inference on Reward Modeling Suitability in Real-World Perturbed Scenarios
por: Zang, Jianxiang, et al.
Publicado: (2025)
por: Zang, Jianxiang, et al.
Publicado: (2025)
Skywork-Reward: Bag of Tricks for Reward Modeling in LLMs
por: Liu, Chris Yuhao, et al.
Publicado: (2024)
por: Liu, Chris Yuhao, et al.
Publicado: (2024)
MambaFormer: Token-Level Guided Routing Mixture-of-Experts for Accurate and Efficient Clinical Assistance
por: Khan, Hamad, et al.
Publicado: (2026)
por: Khan, Hamad, et al.
Publicado: (2026)
Selective Preference Optimization via Token-Level Reward Function Estimation
por: Yang, Kailai, et al.
Publicado: (2024)
por: Yang, Kailai, et al.
Publicado: (2024)
DiffAdapt: Difficulty-Adaptive Reasoning for Token-Efficient LLM Inference
por: Liu, Xiang, et al.
Publicado: (2025)
por: Liu, Xiang, et al.
Publicado: (2025)
SlimLM: An Efficient Small Language Model for On-Device Document Assistance
por: Pham, Thang M., et al.
Publicado: (2024)
por: Pham, Thang M., et al.
Publicado: (2024)
Confidence-Driven Multi-Scale Model Selection for Cost-Efficient Inference
por: Chen, Bo-Wei, et al.
Publicado: (2026)
por: Chen, Bo-Wei, et al.
Publicado: (2026)
Informed Routing in LLMs: Smarter Token-Level Computation for Faster Inference
por: Han, Chao, et al.
Publicado: (2025)
por: Han, Chao, et al.
Publicado: (2025)
CAOTE: KV Cache Selection for LLMs via Attention Output Error-Based Token Eviction
por: Goel, Raghavv, et al.
Publicado: (2025)
por: Goel, Raghavv, et al.
Publicado: (2025)
DyLLM: Efficient Diffusion LLM Inference via Saliency-based Token Selection and Partial Attention
por: Lee, Younjoo, et al.
Publicado: (2026)
por: Lee, Younjoo, et al.
Publicado: (2026)
SelecTKD: Selective Token-Weighted Knowledge Distillation for LLMs
por: Huang, Haiduo, et al.
Publicado: (2025)
por: Huang, Haiduo, et al.
Publicado: (2025)
Rejection Mixing: Fast Semantic Propagation of Mask Tokens for Efficient DLLM Inference
por: Ye, Yushi, et al.
Publicado: (2026)
por: Ye, Yushi, et al.
Publicado: (2026)
Rewarding How Models Think Pedagogically: Integrating Pedagogical Reasoning and Thinking Rewards for LLMs in Education
por: Lee, Unggi, et al.
Publicado: (2026)
por: Lee, Unggi, et al.
Publicado: (2026)
Tandem Transformers for Inference Efficient LLMs
por: S, Aishwarya P, et al.
Publicado: (2024)
por: S, Aishwarya P, et al.
Publicado: (2024)
Mask Tokens as Prophet: Fine-Grained Cache Eviction for Efficient dLLM Inference
por: Huang, Jianuo, et al.
Publicado: (2025)
por: Huang, Jianuo, et al.
Publicado: (2025)
InComeS: Integrating Compression and Selection Mechanisms into LLMs for Efficient Model Editing
por: Li, Shuaiyi, et al.
Publicado: (2025)
por: Li, Shuaiyi, et al.
Publicado: (2025)
Reward-Augmented Decoding: Efficient Controlled Text Generation With a Unidirectional Reward Model
por: Deng, Haikang, et al.
Publicado: (2023)
por: Deng, Haikang, et al.
Publicado: (2023)
On the Power of (Approximate) Reward Models for Inference-Time Scaling
por: Zhu, Youheng, et al.
Publicado: (2026)
por: Zhu, Youheng, et al.
Publicado: (2026)
How Context Shapes Truth: Geometric Transformations of Statement-level Truth Representations in LLMs
por: Adarsh, Shivam, et al.
Publicado: (2026)
por: Adarsh, Shivam, et al.
Publicado: (2026)
Dynamic Thinking-Token Selection for Efficient Reasoning in Large Reasoning Models
por: Guo, Zhenyuan, et al.
Publicado: (2026)
por: Guo, Zhenyuan, et al.
Publicado: (2026)
Towards Efficient LLMs Annealing with Principled Sample Selection
por: Xu, Yuanjian, et al.
Publicado: (2026)
por: Xu, Yuanjian, et al.
Publicado: (2026)
StackEval: Benchmarking LLMs in Coding Assistance
por: Shah, Nidhish, et al.
Publicado: (2024)
por: Shah, Nidhish, et al.
Publicado: (2024)
TRIM: Token Reduction and Inference Modeling for Cost-Effective Language Generation
por: Ruiz, Alfredo Garrachón, et al.
Publicado: (2024)
por: Ruiz, Alfredo Garrachón, et al.
Publicado: (2024)
AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning
por: Zhong, Yiwu, et al.
Publicado: (2024)
por: Zhong, Yiwu, et al.
Publicado: (2024)
Memory-Efficient Fine-Tuning of Transformers via Token Selection
por: Simoulin, Antoine, et al.
Publicado: (2025)
por: Simoulin, Antoine, et al.
Publicado: (2025)
HAF-RM: A Hybrid Alignment Framework for Reward Model Training
por: Liu, Shujun, et al.
Publicado: (2024)
por: Liu, Shujun, et al.
Publicado: (2024)
Token-Level Policy Optimization: Linking Group-Level Rewards to Token-Level Aggregation via Markov Likelihood
por: Lin, Xingyu, et al.
Publicado: (2025)
por: Lin, Xingyu, et al.
Publicado: (2025)
RED: Unleashing Token-Level Rewards from Holistic Feedback via Reward Redistribution
por: Li, Jiahui, et al.
Publicado: (2024)
por: Li, Jiahui, et al.
Publicado: (2024)
Ejemplares similares
-
Inference Acceleration for Large Language Models on CPUs
por: PS, Ditto, et al.
Publicado: (2024) -
Intellecta Cognitiva: A Comprehensive Dataset for Advancing Academic Knowledge and Machine Reasoning
por: PS, Ajmal, et al.
Publicado: (2024) -
GPU-Virt-Bench: A Comprehensive Benchmarking Framework for Software-Based GPU Virtualization Systems
por: VG, Jithin, et al.
Publicado: (2025) -
TokenSelect: Efficient Long-Context Inference and Length Extrapolation for LLMs via Dynamic Token-Level KV Cache Selection
por: Wu, Wei, et al.
Publicado: (2024) -
Predicting Rewards Alongside Tokens: Non-disruptive Parameter Insertion for Efficient Inference Intervention in Large Language Model
por: Yuan, Chenhan, et al.
Publicado: (2024)