Maestro: Reinforcement Learning to Orchestrate Hierarchical Model-Skill Ensembles
Fuente:
arXiv
Salvato in:
| Autori principali: | Wu, Jinyang, Zhai, Guocheng, Jin, Ruihan, Shen, Yuhao, Lu, Zhengxi, Zhang, Fan, Luo, Haoran, Lian, Zheng, Wen, Zhengqi, Tao, Jianhua |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Atlas: Orchestrating Heterogeneous Models and Tools for Multi-Domain Complex Reasoning
di: Wu, Jinyang, et al.
Pubblicazione: (2026)
di: Wu, Jinyang, et al.
Pubblicazione: (2026)
AStar: Boosting Multimodal Reasoning with Automated Structured Thinking
di: Wu, Jinyang, et al.
Pubblicazione: (2025)
di: Wu, Jinyang, et al.
Pubblicazione: (2025)
RadialRouter: Structured Representation for Efficient and Robust Large Language Models Routing
di: Jin, Ruihan, et al.
Pubblicazione: (2025)
di: Jin, Ruihan, et al.
Pubblicazione: (2025)
Spark: Strategic Policy-Aware Exploration via Dynamic Branching for Long-Horizon Agentic Learning
di: Wu, Jinyang, et al.
Pubblicazione: (2026)
di: Wu, Jinyang, et al.
Pubblicazione: (2026)
DReSS: Data-driven Regularized Structured Streamlining for Large Language Models
di: Feng, Mingkuan, et al.
Pubblicazione: (2025)
di: Feng, Mingkuan, et al.
Pubblicazione: (2025)
TemplateRL: Structured Template-Guided Reinforcement Learning for LLM Reasoning
di: Wu, Jinyang, et al.
Pubblicazione: (2025)
di: Wu, Jinyang, et al.
Pubblicazione: (2025)
Exploring Knowledge Purification in Multi-Teacher Knowledge Distillation for LLMs
di: Jin, Ruihan, et al.
Pubblicazione: (2026)
di: Jin, Ruihan, et al.
Pubblicazione: (2026)
SKILL0: In-Context Agentic Reinforcement Learning for Skill Internalization
di: Lu, Zhengxi, et al.
Pubblicazione: (2026)
di: Lu, Zhengxi, et al.
Pubblicazione: (2026)
Fake News Detection and Manipulation Reasoning via Large Vision-Language Models
di: Jin, Ruihan, et al.
Pubblicazione: (2024)
di: Jin, Ruihan, et al.
Pubblicazione: (2024)
Two-Stage Regularization-Based Structured Pruning for LLMs
di: Feng, Mingkuan, et al.
Pubblicazione: (2025)
di: Feng, Mingkuan, et al.
Pubblicazione: (2025)
SkillFlow: Flow-Driven Recursive Skill Evolution for Agentic Orchestration
di: Zhang, Mingda, et al.
Pubblicazione: (2026)
di: Zhang, Mingda, et al.
Pubblicazione: (2026)
Can large language models understand uncommon meanings of common words?
di: Wu, Jinyang, et al.
Pubblicazione: (2024)
di: Wu, Jinyang, et al.
Pubblicazione: (2024)
DashFusion: Dual-stream Alignment with Hierarchical Bottleneck Fusion for Multimodal Sentiment Analysis
di: Wen, Yuhua, et al.
Pubblicazione: (2025)
di: Wen, Yuhua, et al.
Pubblicazione: (2025)
HiCMAE: Hierarchical Contrastive Masked Autoencoder for Self-Supervised Audio-Visual Emotion Recognition
di: Sun, Licai, et al.
Pubblicazione: (2024)
di: Sun, Licai, et al.
Pubblicazione: (2024)
Skill1: Unified Evolution of Skill-Augmented Agents via Reinforcement Learning
di: Shi, Yaorui, et al.
Pubblicazione: (2026)
di: Shi, Yaorui, et al.
Pubblicazione: (2026)
Edit Content, Preserve Acoustics: Imperceptible Text-Based Speech Editing via Self-Consistency Rewards
di: Ren, Yong, et al.
Pubblicazione: (2026)
di: Ren, Yong, et al.
Pubblicazione: (2026)
Self-Distilled Agentic Reinforcement Learning
di: Lu, Zhengxi, et al.
Pubblicazione: (2026)
di: Lu, Zhengxi, et al.
Pubblicazione: (2026)
AffectGPT-RL: Revealing Roles of Reinforcement Learning in Open-Vocabulary Emotion Recognition
di: Lian, Zheng, et al.
Pubblicazione: (2026)
di: Lian, Zheng, et al.
Pubblicazione: (2026)
RISER: Orchestrating Latent Reasoning Skills for Adaptive Activation Steering
di: Ye, Wencheng, et al.
Pubblicazione: (2026)
di: Ye, Wencheng, et al.
Pubblicazione: (2026)
ALLM4ADD: Unlocking the Capabilities of Audio Large Language Models for Audio Deepfake Detection
di: Gu, Hao, et al.
Pubblicazione: (2025)
di: Gu, Hao, et al.
Pubblicazione: (2025)
P2Mark: Plug-and-play Parameter-level Watermarking for Neural Speech Generation
di: Ren, Yong, et al.
Pubblicazione: (2025)
di: Ren, Yong, et al.
Pubblicazione: (2025)
Dual-Branch Knowledge Distillation for Noise-Robust Synthetic Speech Detection
di: Fan, Cunhang, et al.
Pubblicazione: (2023)
di: Fan, Cunhang, et al.
Pubblicazione: (2023)
Exploring the Origin of Anisotropy in Small Systems: From Symmetric (O+O) to Asymmetric (d+Au) Collisions
di: Yan, Zhengxi
Pubblicazione: (2025)
di: Yan, Zhengxi
Pubblicazione: (2025)
Residual Speaker Representation for One-Shot Voice Conversion
di: Xu, Le, et al.
Pubblicazione: (2023)
di: Xu, Le, et al.
Pubblicazione: (2023)
AffectGPT-R1: Leveraging Reinforcement Learning for Open-Vocabulary Multimodal Emotion Recognition
di: Lian, Zheng, et al.
Pubblicazione: (2025)
di: Lian, Zheng, et al.
Pubblicazione: (2025)
Test-Time Reinforcement Learning for GUI Grounding via Region Consistency
di: Du, Yong, et al.
Pubblicazione: (2025)
di: Du, Yong, et al.
Pubblicazione: (2025)
Maestro: Orchestrating Robotics Modules with Vision-Language Models for Zero-Shot Generalist Robots
di: Shi, Junyao, et al.
Pubblicazione: (2025)
di: Shi, Junyao, et al.
Pubblicazione: (2025)
Skill-Critic: Refining Learned Skills for Hierarchical Reinforcement Learning
di: Hao, Ce, et al.
Pubblicazione: (2023)
di: Hao, Ce, et al.
Pubblicazione: (2023)
ASRRL-TTS: Agile Speaker Representation Reinforcement Learning for Text-to-Speech Speaker Adaptation
di: Fu, Ruibo, et al.
Pubblicazione: (2024)
di: Fu, Ruibo, et al.
Pubblicazione: (2024)
HiDrop: Hierarchical Vision Token Reduction in MLLMs via Late Injection, Concave Pyramid Pruning, and Early Exit
di: Wu, Hao, et al.
Pubblicazione: (2026)
di: Wu, Hao, et al.
Pubblicazione: (2026)
Code-A1: Adversarial Evolving of Code LLM and Test LLM via Reinforcement Learning
di: Wang, Aozhe, et al.
Pubblicazione: (2026)
di: Wang, Aozhe, et al.
Pubblicazione: (2026)
Maestro: Self-Improving Text-to-Image Generation via Agent Orchestration
di: Wan, Xingchen, et al.
Pubblicazione: (2025)
di: Wan, Xingchen, et al.
Pubblicazione: (2025)
Photoinduced Electron Donor–Acceptor Complex‐Enabled Tandem Perfluoroalkylation/Cyclization of Internal Alkenes Toward Ring‐Fused Quinazolinones
di: Sheng Yu, et al.
Pubblicazione: (2026)
di: Sheng Yu, et al.
Pubblicazione: (2026)
Beyond Examples: High-level Automated Reasoning Paradigm in In-Context Learning via MCTS
di: Wu, Jinyang, et al.
Pubblicazione: (2024)
di: Wu, Jinyang, et al.
Pubblicazione: (2024)
Grid-Orch: An LLM-Powered Orchestrator for Distribution Grid Simulation and Analytics
di: Liu, Boming, et al.
Pubblicazione: (2026)
di: Liu, Boming, et al.
Pubblicazione: (2026)
Exploring the Role of Audio in Multimodal Misinformation Detection
di: Liu, Moyang, et al.
Pubblicazione: (2024)
di: Liu, Moyang, et al.
Pubblicazione: (2024)
PSA-MF: Personality-Sentiment Aligned Multi-Level Fusion for Multimodal Sentiment Analysis
di: Xie, Heng, et al.
Pubblicazione: (2025)
di: Xie, Heng, et al.
Pubblicazione: (2025)
Debunk and Infer: Multimodal Fake News Detection via Diffusion-Generated Evidence and LLM Reasoning
di: Yan, Kaiying, et al.
Pubblicazione: (2025)
di: Yan, Kaiying, et al.
Pubblicazione: (2025)
KS-LLM: Knowledge Selection of Large Language Models with Evidence Document for Question Answering
di: Zheng, Xinxin, et al.
Pubblicazione: (2024)
di: Zheng, Xinxin, et al.
Pubblicazione: (2024)
RiskMiner: Discovering Formulaic Alphas via Risk Seeking Monte Carlo Tree Search
di: Ren, Tao, et al.
Pubblicazione: (2024)
di: Ren, Tao, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Atlas: Orchestrating Heterogeneous Models and Tools for Multi-Domain Complex Reasoning
di: Wu, Jinyang, et al.
Pubblicazione: (2026) -
AStar: Boosting Multimodal Reasoning with Automated Structured Thinking
di: Wu, Jinyang, et al.
Pubblicazione: (2025) -
RadialRouter: Structured Representation for Efficient and Robust Large Language Models Routing
di: Jin, Ruihan, et al.
Pubblicazione: (2025) -
Spark: Strategic Policy-Aware Exploration via Dynamic Branching for Long-Horizon Agentic Learning
di: Wu, Jinyang, et al.
Pubblicazione: (2026) -
DReSS: Data-driven Regularized Structured Streamlining for Large Language Models
di: Feng, Mingkuan, et al.
Pubblicazione: (2025)