Dynamic Optimizations of LLM Ensembles with Two-Stage Reinforcement Learning Agents
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Tekin, Selim Furkan, Ilhan, Fatih, Liu, Gaowen, Kompella, Ramana Rao, Liu, Ling |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
LLM-TOPLA: Efficient LLM Ensemble by Maximising Diversity
von: Tekin, Selim Furkan, et al.
Veröffentlicht: (2024)
von: Tekin, Selim Furkan, et al.
Veröffentlicht: (2024)
A Neurosymbolic Agent System for Compositional Visual Reasoning
von: Xu, Yichang, et al.
Veröffentlicht: (2025)
von: Xu, Yichang, et al.
Veröffentlicht: (2025)
Attention-aware Inference Optimizations for Large Vision-Language Models with Memory-efficient Decoding
von: Ilhan, Fatih, et al.
Veröffentlicht: (2026)
von: Ilhan, Fatih, et al.
Veröffentlicht: (2026)
A Multi-Agent Perception-Action Alliance for Efficient Long Video Reasoning
von: Xu, Yichang, et al.
Veröffentlicht: (2026)
von: Xu, Yichang, et al.
Veröffentlicht: (2026)
Booster: Tackling Harmful Fine-tuning for Large Language Models via Attenuating Harmful Perturbation
von: Huang, Tiansheng, et al.
Veröffentlicht: (2024)
von: Huang, Tiansheng, et al.
Veröffentlicht: (2024)
A Survey on Large Language Model-Based Game Agents
von: Hu, Sihao, et al.
Veröffentlicht: (2024)
von: Hu, Sihao, et al.
Veröffentlicht: (2024)
Vision Verification Enhanced Fusion of VLMs for Efficient Visual Reasoning
von: Tekin, Selim Furkan, et al.
Veröffentlicht: (2026)
von: Tekin, Selim Furkan, et al.
Veröffentlicht: (2026)
Virus: Harmful Fine-tuning Attack for Large Language Models Bypassing Guardrail Moderation
von: Huang, Tiansheng, et al.
Veröffentlicht: (2025)
von: Huang, Tiansheng, et al.
Veröffentlicht: (2025)
FedHFT: Efficient Federated Finetuning with Heterogeneous Edge Clients
von: Ilhan, Fatih, et al.
Veröffentlicht: (2025)
von: Ilhan, Fatih, et al.
Veröffentlicht: (2025)
H3Fusion: Helpful, Harmless, Honest Fusion of Aligned LLMs
von: Tekin, Selim Furkan, et al.
Veröffentlicht: (2024)
von: Tekin, Selim Furkan, et al.
Veröffentlicht: (2024)
Reversing the Forget-Retain Objectives: An Efficient LLM Unlearning Framework from Logit Difference
von: Ji, Jiabao, et al.
Veröffentlicht: (2024)
von: Ji, Jiabao, et al.
Veröffentlicht: (2024)
Robust Few-Shot Ensemble Learning with Focal Diversity-Based Pruning
von: Tekin, Selim Furkan, et al.
Veröffentlicht: (2024)
von: Tekin, Selim Furkan, et al.
Veröffentlicht: (2024)
Lisa: Lazy Safety Alignment for Large Language Models against Harmful Fine-tuning Attack
von: Huang, Tiansheng, et al.
Veröffentlicht: (2024)
von: Huang, Tiansheng, et al.
Veröffentlicht: (2024)
Harmful Fine-tuning Attacks and Defenses for Large Language Models: A Survey
von: Huang, Tiansheng, et al.
Veröffentlicht: (2024)
von: Huang, Tiansheng, et al.
Veröffentlicht: (2024)
Large Language Models Can Learn Temporal Reasoning
von: Xiong, Siheng, et al.
Veröffentlicht: (2024)
von: Xiong, Siheng, et al.
Veröffentlicht: (2024)
Targeted Forgetting of Image Subgroups in CLIP Models
von: Zhang, Zeliang, et al.
Veröffentlicht: (2025)
von: Zhang, Zeliang, et al.
Veröffentlicht: (2025)
Efficient Multitask Dense Predictor via Binarization
von: Shang, Yuzhang, et al.
Veröffentlicht: (2024)
von: Shang, Yuzhang, et al.
Veröffentlicht: (2024)
Adversarial Attention Perturbations for Large Object Detection Transformers
von: Yahn, Zachary, et al.
Veröffentlicht: (2025)
von: Yahn, Zachary, et al.
Veröffentlicht: (2025)
Training-Free Semantic Segmentation via LLM-Supervision
von: Sun, Wenfang, et al.
Veröffentlicht: (2024)
von: Sun, Wenfang, et al.
Veröffentlicht: (2024)
Context Bootstrapped Reinforcement Learning
von: Agashe, Saaket, et al.
Veröffentlicht: (2026)
von: Agashe, Saaket, et al.
Veröffentlicht: (2026)
Towards Hierarchical Multi-Agent Workflows for Zero-Shot Prompt Optimization
von: Liu, Yuchi, et al.
Veröffentlicht: (2024)
von: Liu, Yuchi, et al.
Veröffentlicht: (2024)
Orientation-anchored Hyper-Gaussian for 4D Reconstruction from Casual Videos
von: Wu, Junyi, et al.
Veröffentlicht: (2025)
von: Wu, Junyi, et al.
Veröffentlicht: (2025)
Motion Marionette: Rethinking Rigid Motion Transfer via Prior Guidance
von: Wang, Haoxuan, et al.
Veröffentlicht: (2025)
von: Wang, Haoxuan, et al.
Veröffentlicht: (2025)
Urban Scene Diffusion through Semantic Occupancy Map
von: Zhang, Junge, et al.
Veröffentlicht: (2024)
von: Zhang, Junge, et al.
Veröffentlicht: (2024)
SwiftNDC: Fast Neural Depth Correction for High-Fidelity 3D Reconstruction
von: Han, Kang, et al.
Veröffentlicht: (2026)
von: Han, Kang, et al.
Veröffentlicht: (2026)
Safety Tax: Safety Alignment Makes Your Large Reasoning Models Less Reasonable
von: Huang, Tiansheng, et al.
Veröffentlicht: (2025)
von: Huang, Tiansheng, et al.
Veröffentlicht: (2025)
Towards Vector Optimization on Low-Dimensional Vector Symbolic Architecture
von: Duan, Shijin, et al.
Veröffentlicht: (2025)
von: Duan, Shijin, et al.
Veröffentlicht: (2025)
Rethinking Muon Beyond Pretraining: Spectral Failures and High-Pass Remedies for VLA and RLVR
von: Fan, Chongyu, et al.
Veröffentlicht: (2026)
von: Fan, Chongyu, et al.
Veröffentlicht: (2026)
GIFSplat: Generative Prior-Guided Iterative Feed-Forward 3D Gaussian Splatting from Sparse Views
von: Chen, Tianyu, et al.
Veröffentlicht: (2026)
von: Chen, Tianyu, et al.
Veröffentlicht: (2026)
Personalized Face Privacy Protection From a Single Image
von: Yahn, Zachary, et al.
Veröffentlicht: (2026)
von: Yahn, Zachary, et al.
Veröffentlicht: (2026)
VLA Knows Its Limits
von: Wang, Haoxuan, et al.
Veröffentlicht: (2026)
von: Wang, Haoxuan, et al.
Veröffentlicht: (2026)
StagePilot: A Deep Reinforcement Learning Agent for Stage-Controlled Cybergrooming Simulation
von: An, Heajun, et al.
Veröffentlicht: (2026)
von: An, Heajun, et al.
Veröffentlicht: (2026)
Prompt Diffusion Robustifies Any-Modality Prompt Learning
von: Du, Yingjun, et al.
Veröffentlicht: (2024)
von: Du, Yingjun, et al.
Veröffentlicht: (2024)
Graphene: Infrastructure Security Posture Analysis with AI-generated Attack Graphs
von: Jin, Xin, et al.
Veröffentlicht: (2023)
von: Jin, Xin, et al.
Veröffentlicht: (2023)
Enabling Elastic Model Serving with MultiWorld
von: Lee, Myungjin, et al.
Veröffentlicht: (2024)
von: Lee, Myungjin, et al.
Veröffentlicht: (2024)
Design and Optimization of Reinforcement Learning-Based Agents in Text-Based Games
von: Wang, Haonan, et al.
Veröffentlicht: (2025)
von: Wang, Haonan, et al.
Veröffentlicht: (2025)
Collision- and Reachability-Aware Multi-Robot Control with Grounded LLM Planners
von: Ji, Jiabao, et al.
Veröffentlicht: (2025)
von: Ji, Jiabao, et al.
Veröffentlicht: (2025)
Learning How and What to Memorize: Cognition-Inspired Two-Stage Optimization for Evolving Memory
von: Xu, Derong, et al.
Veröffentlicht: (2026)
von: Xu, Derong, et al.
Veröffentlicht: (2026)
EPO: Entropy-regularized Policy Optimization for LLM Agents Reinforcement Learning
von: Xu, Wujiang, et al.
Veröffentlicht: (2025)
von: Xu, Wujiang, et al.
Veröffentlicht: (2025)
Legal Mathematical Reasoning with LLMs: Procedural Alignment through Two-Stage Reinforcement Learning
von: Zhang, Kepu, et al.
Veröffentlicht: (2025)
von: Zhang, Kepu, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
LLM-TOPLA: Efficient LLM Ensemble by Maximising Diversity
von: Tekin, Selim Furkan, et al.
Veröffentlicht: (2024) -
A Neurosymbolic Agent System for Compositional Visual Reasoning
von: Xu, Yichang, et al.
Veröffentlicht: (2025) -
Attention-aware Inference Optimizations for Large Vision-Language Models with Memory-efficient Decoding
von: Ilhan, Fatih, et al.
Veröffentlicht: (2026) -
A Multi-Agent Perception-Action Alliance for Efficient Long Video Reasoning
von: Xu, Yichang, et al.
Veröffentlicht: (2026) -
Booster: Tackling Harmful Fine-tuning for Large Language Models via Attenuating Harmful Perturbation
von: Huang, Tiansheng, et al.
Veröffentlicht: (2024)