The Efficiency vs. Accuracy Trade-off: Optimizing RAG-Enhanced LLM Recommender Systems Using Multi-Head Early Exit
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhou, Huixue, Gu, Hengrui, Liu, Xi, Zhou, Kaixiong, Liang, Mingfu, Xiao, Yongkang, Govindan, Srinivas, Chawla, Piyush, Yang, Jiyan, Meng, Xiangfei, Li, Huayu, Zhang, Buyun, Luo, Liang, Chen, Wen-Yen, Han, Yiping, Long, Bo, Zhang, Rui, Chen, Tianlong |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
PPBoost: Progressive Prompt Boosting for Text-Driven Medical Image Segmentation
par: Li, Xuchen, et autres
Publié: (2025)
par: Li, Xuchen, et autres
Publié: (2025)
Cross-Lingual Multi-Hop Knowledge Editing
par: Khandelwal, Aditi, et autres
Publié: (2024)
par: Khandelwal, Aditi, et autres
Publié: (2024)
You Only Debias Once: Towards Flexible Accuracy-Fairness Trade-offs at Inference Time
par: Han, Xiaotian, et autres
Publié: (2025)
par: Han, Xiaotian, et autres
Publié: (2025)
Privacy-preserving Fine-tuning of Large Language Models through Flatness
par: Chen, Tiejin, et autres
Publié: (2024)
par: Chen, Tiejin, et autres
Publié: (2024)
A Replicate-and-Quantize Strategy for Plug-and-Play Load Balancing of Sparse Mixture-of-Experts LLMs
par: Liu, Zijie, et autres
Publié: (2026)
par: Liu, Zijie, et autres
Publié: (2026)
Benchmark on Drug Target Interaction Modeling from a Drug Structure Perspective
par: Zhang, Xinnan, et autres
Publié: (2024)
par: Zhang, Xinnan, et autres
Publié: (2024)
Controllable Pareto Trade-off between Fairness and Accuracy
par: Du, Yongkang, et autres
Publié: (2025)
par: Du, Yongkang, et autres
Publié: (2025)
Layer-Level Self-Exposure and Patch: Affirmative Token Mitigation for Jailbreak Attack Defense
par: Ouyang, Yang, et autres
Publié: (2025)
par: Ouyang, Yang, et autres
Publié: (2025)
Asymmetric Advantage Modulation Calibrates Entropy Dynamics in RLVR
par: Gu, Hengrui, et autres
Publié: (2026)
par: Gu, Hengrui, et autres
Publié: (2026)
Pioneering Reliable Assessment in Text-to-Image Knowledge Editing: Leveraging a Fine-Grained Dataset and an Innovative Criterion
par: Gu, Hengrui, et autres
Publié: (2024)
par: Gu, Hengrui, et autres
Publié: (2024)
DrKGC: Dynamic Subgraph Retrieval-Augmented LLMs for Knowledge Graph Completion across General and Biomedical Domains
par: Xiao, Yongkang, et autres
Publié: (2025)
par: Xiao, Yongkang, et autres
Publié: (2025)
Benchingmaking Large Langage Models in Biomedical Triple Extraction
par: Li, Mingchen, et autres
Publié: (2023)
par: Li, Mingchen, et autres
Publié: (2023)
Self‐Assembly Construction of Biomass Aerogel with Tip‐To‐Based Gradient Porous Structure to Break Trade‐Off Effect for Efficient Water/Oil Separation
par: Zirong Liang, et autres
Publié: (2025)
par: Zirong Liang, et autres
Publié: (2025)
Incremental Object Keypoint Learning
par: Liang, Mingfu, et autres
Publié: (2025)
par: Liang, Mingfu, et autres
Publié: (2025)
PokeMQA: Programmable knowledge editing for Multi-hop Question Answering
par: Gu, Hengrui, et autres
Publié: (2023)
par: Gu, Hengrui, et autres
Publié: (2023)
Integrating Social Determinants of Health into Knowledge Graphs: Evaluating Prediction Bias and Fairness in Healthcare
par: Shang, Tianqi, et autres
Publié: (2024)
par: Shang, Tianqi, et autres
Publié: (2024)
Graph Neural Networks for Efficient AC Power Flow Prediction in Power Grids
par: Talebi, Seyedamirhossein, et autres
Publié: (2025)
par: Talebi, Seyedamirhossein, et autres
Publié: (2025)
Continually Evolved Multimodal Foundation Models for Cancer Prognosis
par: Peng, Jie, et autres
Publié: (2025)
par: Peng, Jie, et autres
Publié: (2025)
A Generic Shared Attention Mechanism for Various Backbone Neural Networks
par: Huang, Zhongzhan, et autres
Publié: (2022)
par: Huang, Zhongzhan, et autres
Publié: (2022)
Racialized Narratives and Structural Exclusion: Exploring Media Discourses and Regulatory Practices on US Asian‐Dominated Nail Salons
par: Weile Zhou, et autres
Publié: (2025)
par: Weile Zhou, et autres
Publié: (2025)
Multifractal level sets and metric mean dimension with potential
par: Zhang, Tianlong, et autres
Publié: (2024)
par: Zhang, Tianlong, et autres
Publié: (2024)
Irregular set and metric mean dimension with potential
par: Zhang, Tianlong, et autres
Publié: (2024)
par: Zhang, Tianlong, et autres
Publié: (2024)
Optimal Reservation Volume of Urban Roads Based on Travel Reservation Strategy
par: Ruiyu Zhou, et autres
Publié: (2024)
par: Ruiyu Zhou, et autres
Publié: (2024)
AttNS: Attention-Inspired Numerical Solving For Limited Data Scenarios
par: Huang, Zhongzhan, et autres
Publié: (2023)
par: Huang, Zhongzhan, et autres
Publié: (2023)
DistDNAS: Search Efficient Feature Interactions within 2 Hours
par: Zhang, Tunhou, et autres
Publié: (2023)
par: Zhang, Tunhou, et autres
Publié: (2023)
EPEE: Towards Efficient and Effective Foundation Models in Biomedicine
par: Zhan, Zaifu, et autres
Publié: (2025)
par: Zhan, Zaifu, et autres
Publié: (2025)
NEAT: Neuron-Based Early Exit for Large Reasoning Models
par: Liu, Kang, et autres
Publié: (2026)
par: Liu, Kang, et autres
Publié: (2026)
Gradient-based Model Shortcut Detection for Time Series Classification
par: Ibarra, Salomon, et autres
Publié: (2025)
par: Ibarra, Salomon, et autres
Publié: (2025)
Implicit Turn-Wise Policy Optimization for Proactive User-LLM Interaction
par: Wang, Haoyu, et autres
Publié: (2026)
par: Wang, Haoyu, et autres
Publié: (2026)
Improving Accuracy-robustness Trade-off via Pixel Reweighted Adversarial Training
par: Zhang, Jiacheng, et autres
Publié: (2024)
par: Zhang, Jiacheng, et autres
Publié: (2024)
Multi-Objective Bilevel Learning
par: Zhang, Zhiyao, et autres
Publié: (2025)
par: Zhang, Zhiyao, et autres
Publié: (2025)
A Replication of “Explaining Why the Computer Says No: Algorithmic Transparency Affects the Perceived Trustworthiness of Automated Decision‐Making”
par: Xuemei Fang, et autres
Publié: (2025)
par: Xuemei Fang, et autres
Publié: (2025)
GraphRAG-IRL: Personalized Recommendation with Graph-Grounded Inverse Reinforcement Learning and LLM Re-ranking
par: Liang, Siqi, et autres
Publié: (2026)
par: Liang, Siqi, et autres
Publié: (2026)
Face4RAG: Factual Consistency Evaluation for Retrieval Augmented Generation in Chinese
par: Xu, Yunqi, et autres
Publié: (2024)
par: Xu, Yunqi, et autres
Publié: (2024)
An Integrative Genomic and Transcriptomic Analysis Reveals the Divergent Molecular Strategies Driving Mutualism and Pathogenesis in a Dinoflagellate Phycosphere
par: Liang Zhang, et autres
Publié: (2026)
par: Liang Zhang, et autres
Publié: (2026)
OpenRAG: Optimizing RAG End-to-End via In-Context Retrieval Learning
par: Zhou, Jiawei, et autres
Publié: (2025)
par: Zhou, Jiawei, et autres
Publié: (2025)
FB-RAG: Improving RAG with Forward and Backward Lookup
par: Chawla, Kushal, et autres
Publié: (2025)
par: Chawla, Kushal, et autres
Publié: (2025)
Projected increases in shoreline erosion and potential flooding risk along China's sandy coasts under a warming climate
par: Xiangfei Li, et autres
Publié: (2026)
par: Xiangfei Li, et autres
Publié: (2026)
A low‐profile four‐degrees of freedom antenna by collocating a ±45°‐polarized dipole and a dual‐polarized microstrip antenna with broadside radiations
par: Buyun Wang, et autres
Publié: (2024)
par: Buyun Wang, et autres
Publié: (2024)
Breaking the Communication-Accuracy Trade-off: A Sparsified Information Diffusion Framework for Multi-Agent Collaborative Perception
par: Zha, Jirong, et autres
Publié: (2026)
par: Zha, Jirong, et autres
Publié: (2026)
Documents similaires
-
PPBoost: Progressive Prompt Boosting for Text-Driven Medical Image Segmentation
par: Li, Xuchen, et autres
Publié: (2025) -
Cross-Lingual Multi-Hop Knowledge Editing
par: Khandelwal, Aditi, et autres
Publié: (2024) -
You Only Debias Once: Towards Flexible Accuracy-Fairness Trade-offs at Inference Time
par: Han, Xiaotian, et autres
Publié: (2025) -
Privacy-preserving Fine-tuning of Large Language Models through Flatness
par: Chen, Tiejin, et autres
Publié: (2024) -
A Replicate-and-Quantize Strategy for Plug-and-Play Load Balancing of Sparse Mixture-of-Experts LLMs
par: Liu, Zijie, et autres
Publié: (2026)