Enabling Flexible Multi-LLM Integration for Scalable Knowledge Aggregation
Fuente:
arXiv
Saved in:
| Main Authors: | Kong, Zhenglun, Zhan, Zheng, Hou, Shiyue, Gong, Yifan, Meng, Xin, Sui, Pengwei, Dong, Peiyan, Shen, Xuan, Wang, Zifeng, Zhao, Pu, Tang, Hao, Ioannidis, Stratis, Wang, Yanzhi |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Exploring Token Pruning in Vision State Space Models
by: Zhan, Zheng, et al.
Published: (2024)
by: Zhan, Zheng, et al.
Published: (2024)
Rethinking Token Reduction for State Space Models
by: Zhan, Zheng, et al.
Published: (2024)
by: Zhan, Zheng, et al.
Published: (2024)
Search for Efficient Large Language Models
by: Shen, Xuan, et al.
Published: (2024)
by: Shen, Xuan, et al.
Published: (2024)
Fast and Memory-Efficient Video Diffusion Using Streamlined Inference
by: Zhan, Zheng, et al.
Published: (2024)
by: Zhan, Zheng, et al.
Published: (2024)
Squat: Quant Small Language Models on the Edge
by: Shen, Xuan, et al.
Published: (2024)
by: Shen, Xuan, et al.
Published: (2024)
Agile-Quant: Activation-Guided Quantization for Faster Inference of LLMs on the Edge
by: Shen, Xuan, et al.
Published: (2023)
by: Shen, Xuan, et al.
Published: (2023)
Pruning Foundation Models for High Accuracy without Retraining
by: Zhao, Pu, et al.
Published: (2024)
by: Zhao, Pu, et al.
Published: (2024)
RoRA: Efficient Fine-Tuning of LLM with Reliability Optimization for Rank Adaptation
by: Liu, Jun, et al.
Published: (2025)
by: Liu, Jun, et al.
Published: (2025)
OmniMem: Scalable and Adaptive Memory Retrieval for Long Video Generation
by: Zhao, Lin, et al.
Published: (2026)
by: Zhao, Lin, et al.
Published: (2026)
Spectral Survival Analysis
by: Shi, Chengzhi, et al.
Published: (2025)
by: Shi, Chengzhi, et al.
Published: (2025)
Submodular Maximization via Taylor Series Approximation
by: Özcan, Gözde, et al.
Published: (2021)
by: Özcan, Gözde, et al.
Published: (2021)
Learning Set Functions with Implicit Differentiation
by: Özcan, Gözde, et al.
Published: (2024)
by: Özcan, Gözde, et al.
Published: (2024)
RCR-Router: Efficient Role-Aware Context Routing for Multi-Agent LLM Systems with Structured Memory
by: Liu, Jun, et al.
Published: (2025)
by: Liu, Jun, et al.
Published: (2025)
Structured Agent Distillation for Large Language Model
by: Liu, Jun, et al.
Published: (2025)
by: Liu, Jun, et al.
Published: (2025)
When Should a Robot Think? Resource-Aware Reasoning via Reinforcement Learning for Embodied Robotic Decision-Making
by: Liu, Jun, et al.
Published: (2026)
by: Liu, Jun, et al.
Published: (2026)
Online Two-Stage Submodular Maximization
by: Nikolaou, Iasonas, et al.
Published: (2025)
by: Nikolaou, Iasonas, et al.
Published: (2025)
BioBridge: Bridging Biomedical Foundation Models via Knowledge Graphs
by: Wang, Zifeng, et al.
Published: (2023)
by: Wang, Zifeng, et al.
Published: (2023)
Lotus: learning-based online thermal and latency variation management for two-stage detectors on edge devices
by: Gong, Yifan, et al.
Published: (2024)
by: Gong, Yifan, et al.
Published: (2024)
TSLA: A Task-Specific Learning Adaptation for Semantic Segmentation on Autonomous Vehicles Platform
by: Liu, Jun, et al.
Published: (2025)
by: Liu, Jun, et al.
Published: (2025)
Toward Adaptive Large Language Models Structured Pruning via Hybrid-grained Weight Importance Assessment
by: Liu, Jun, et al.
Published: (2024)
by: Liu, Jun, et al.
Published: (2024)
ACE: Exploring Activation Cosine Similarity and Variance for Accurate and Calibration-Efficient LLM Pruning
by: Mi, Zhendong, et al.
Published: (2025)
by: Mi, Zhendong, et al.
Published: (2025)
Quasar-ViT: Hardware-Oriented Quantization-Aware Architecture Search for Vision Transformers
by: Li, Zhengang, et al.
Published: (2024)
by: Li, Zhengang, et al.
Published: (2024)
DiffClass: Diffusion-Based Class Incremental Learning
by: Meng, Zichong, et al.
Published: (2024)
by: Meng, Zichong, et al.
Published: (2024)
Dependency-aware Maximum Likelihood Estimation for Active Learning
by: Kalkanli, Beyza, et al.
Published: (2025)
by: Kalkanli, Beyza, et al.
Published: (2025)
DraftAttention: Fast Video Diffusion via Low-Resolution Attention Guidance
by: Shen, Xuan, et al.
Published: (2025)
by: Shen, Xuan, et al.
Published: (2025)
Federated Aggregation of Demand Flexibility
by: Dong, Yifan, et al.
Published: (2025)
by: Dong, Yifan, et al.
Published: (2025)
Distributed Experimental Design Networks
by: Li, Yuanyuan, et al.
Published: (2024)
by: Li, Yuanyuan, et al.
Published: (2024)
Empowering Federated Learning with Implicit Gossiping: Mitigating Connection Unreliability Amidst Unknown and Arbitrary Dynamics
by: Xiang, Ming, et al.
Published: (2024)
by: Xiang, Ming, et al.
Published: (2024)
Online Submodular Maximization via Online Convex Optimization
by: Salem, Tareq Si, et al.
Published: (2023)
by: Salem, Tareq Si, et al.
Published: (2023)
Efficient Federated Learning against Heterogeneous and Non-stationary Client Unavailability
by: Xiang, Ming, et al.
Published: (2024)
by: Xiang, Ming, et al.
Published: (2024)
Pediatric Diffuse Low-Grade Glioma with Oligodendrocyte-Like Features: A Challenging Diagnostic Case Report
by: Hou, Pengwei
Published: (2025)
by: Hou, Pengwei
Published: (2025)
DeepEvidence: Empowering Biomedical Discovery with Deep Knowledge Graph Research
by: Wang, Zifeng, et al.
Published: (2025)
by: Wang, Zifeng, et al.
Published: (2025)
Democratizing AI scientists using ToolUniverse
by: Gao, Shanghua, et al.
Published: (2025)
by: Gao, Shanghua, et al.
Published: (2025)
Distributionally Robust Chance-Constrained Flexibility Planning for Integrated Energy System
by: Zhan, Sen, et al.
Published: (2021)
by: Zhan, Sen, et al.
Published: (2021)
7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement
by: Zhao, Pu, et al.
Published: (2024)
by: Zhao, Pu, et al.
Published: (2024)
Can Knowledge Graphs Make Large Language Models More Trustworthy? An Empirical Study Over Open-ended Question Answering
by: Sui, Yuan, et al.
Published: (2024)
by: Sui, Yuan, et al.
Published: (2024)
SSplain: Sparse and Smooth Explainer for Retinopathy of Prematurity Classification
by: Sunger, Elifnur, et al.
Published: (2025)
by: Sunger, Elifnur, et al.
Published: (2025)
Scalable and Efficient Aggregation of Energy-Constrained Flexible Loads
by: Rousseau, Julie, et al.
Published: (2025)
by: Rousseau, Julie, et al.
Published: (2025)
Multi-Source Unsupervised Domain Adaptation with Prototype Aggregation
by: Huang, Min, et al.
Published: (2024)
by: Huang, Min, et al.
Published: (2024)
Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration
by: Zeng, Fanhu, et al.
Published: (2025)
by: Zeng, Fanhu, et al.
Published: (2025)
Similar Items
-
Exploring Token Pruning in Vision State Space Models
by: Zhan, Zheng, et al.
Published: (2024) -
Rethinking Token Reduction for State Space Models
by: Zhan, Zheng, et al.
Published: (2024) -
Search for Efficient Large Language Models
by: Shen, Xuan, et al.
Published: (2024) -
Fast and Memory-Efficient Video Diffusion Using Streamlined Inference
by: Zhan, Zheng, et al.
Published: (2024) -
Squat: Quant Small Language Models on the Edge
by: Shen, Xuan, et al.
Published: (2024)