Salvato in:
| Autori principali: | Wen, Jianyu, Wei, Yang, Yu, Xiongxi, Xiao, Changxuan, Zeng, Ke |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2601.16596 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MoA: Heterogeneous Mixture of Adapters for Parameter-Efficient Fine-Tuning of Large Language Models
di: Cao, Jie, et al.
Pubblicazione: (2025)
di: Cao, Jie, et al.
Pubblicazione: (2025)
MoA: Mixture-of-Attention for Subject-Context Disentanglement in Personalized Image Generation
di: Wang, Kuan-Chieh, et al.
Pubblicazione: (2024)
di: Wang, Kuan-Chieh, et al.
Pubblicazione: (2024)
Mixture-of-Depths Attention
di: Zhu, Lianghui, et al.
Pubblicazione: (2026)
di: Zhu, Lianghui, et al.
Pubblicazione: (2026)
Pyramid MoA: A Probabilistic Framework for Cost-Optimized Anytime Inference
di: Khaled, Arindam
Pubblicazione: (2026)
di: Khaled, Arindam
Pubblicazione: (2026)
MoBA: Mixture of Block Attention for Long-Context LLMs
di: Lu, Enzhe, et al.
Pubblicazione: (2025)
di: Lu, Enzhe, et al.
Pubblicazione: (2025)
Mixture of Attentions For Speculative Decoding
di: Zimmer, Matthieu, et al.
Pubblicazione: (2024)
di: Zimmer, Matthieu, et al.
Pubblicazione: (2024)
Depth-Recurrent Attention Mixtures: Giving Latent Reasoning the Attention it Deserves
di: Knupp, Jonas, et al.
Pubblicazione: (2026)
di: Knupp, Jonas, et al.
Pubblicazione: (2026)
ReachAgent: Enhancing Mobile Agent via Page Reaching and Operation
di: Wu, Qinzhuo, et al.
Pubblicazione: (2025)
di: Wu, Qinzhuo, et al.
Pubblicazione: (2025)
Yuan 2.0-M32: Mixture of Experts with Attention Router
di: Wu, Shaohua, et al.
Pubblicazione: (2024)
di: Wu, Shaohua, et al.
Pubblicazione: (2024)
Skywork-MoE: A Deep Dive into Training Techniques for Mixture-of-Experts Language Models
di: Wei, Tianwen, et al.
Pubblicazione: (2024)
di: Wei, Tianwen, et al.
Pubblicazione: (2024)
HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs
di: Yang, Dongquan, et al.
Pubblicazione: (2025)
di: Yang, Dongquan, et al.
Pubblicazione: (2025)
AgentRefine: Enhancing Agent Generalization through Refinement Tuning
di: Fu, Dayuan, et al.
Pubblicazione: (2025)
di: Fu, Dayuan, et al.
Pubblicazione: (2025)
Multi-granularity Interactive Attention Framework for Residual Hierarchical Pronunciation Assessment
di: Han, Hong, et al.
Pubblicazione: (2026)
di: Han, Hong, et al.
Pubblicazione: (2026)
Interpretable Emergent Language Using Inter-Agent Transformers
di: Bhardwaj, Mannan
Pubblicazione: (2025)
di: Bhardwaj, Mannan
Pubblicazione: (2025)
Mixture-of-Minds: Multi-Agent Reinforcement Learning for Table Understanding
di: Zhou, Yuhang, et al.
Pubblicazione: (2025)
di: Zhou, Yuhang, et al.
Pubblicazione: (2025)
ReportBench: Evaluating Deep Research Agents via Academic Survey Tasks
di: Li, Minghao, et al.
Pubblicazione: (2025)
di: Li, Minghao, et al.
Pubblicazione: (2025)
Semia: Auditing Agent Skills via Constraint-Guided Representation Synthesis
di: Wen, Hongbo, et al.
Pubblicazione: (2026)
di: Wen, Hongbo, et al.
Pubblicazione: (2026)
DeepRefine: Agent-Compiled Knowledge Refinement via Reinforcement Learning
di: Huang, Haoyu, et al.
Pubblicazione: (2026)
di: Huang, Haoyu, et al.
Pubblicazione: (2026)
AgentBank: Towards Generalized LLM Agents via Fine-Tuning on 50000+ Interaction Trajectories
di: Song, Yifan, et al.
Pubblicazione: (2024)
di: Song, Yifan, et al.
Pubblicazione: (2024)
SR-KI: Scalable and Real-Time Knowledge Integration into LLMs via Supervised Attention
di: Yu, Bohan, et al.
Pubblicazione: (2025)
di: Yu, Bohan, et al.
Pubblicazione: (2025)
Native Sparse Attention: Hardware-Aligned and Natively Trainable Sparse Attention
di: Yuan, Jingyang, et al.
Pubblicazione: (2025)
di: Yuan, Jingyang, et al.
Pubblicazione: (2025)
GEM: Graph-Enhanced Mixture-of-Experts with ReAct Agents for Dialogue State Tracking
di: Zhu, Ziqi, et al.
Pubblicazione: (2026)
di: Zhu, Ziqi, et al.
Pubblicazione: (2026)
BacktrackAgent: Enhancing GUI Agent with Error Detection and Backtracking Mechanism
di: Wu, Qinzhuo, et al.
Pubblicazione: (2025)
di: Wu, Qinzhuo, et al.
Pubblicazione: (2025)
HySparse: A Hybrid Sparse Attention Architecture with Oracle Token Selection and KV Cache Sharing
di: Gao, Yizhao, et al.
Pubblicazione: (2026)
di: Gao, Yizhao, et al.
Pubblicazione: (2026)
From Reactive to Proactive: Assessing the Proactivity of Voice Agents via ProVoice-Bench
di: Xu, Ke, et al.
Pubblicazione: (2026)
di: Xu, Ke, et al.
Pubblicazione: (2026)
DeepEra: A Deep Evidence Reranking Agent for Scientific Retrieval-Augmented Generated Question Answering
di: Chen, Haotian, et al.
Pubblicazione: (2026)
di: Chen, Haotian, et al.
Pubblicazione: (2026)
Pre-Attention Expert Prediction and Prefetching for Mixture-of-Experts Large Language Models
di: Zhu, Shien, et al.
Pubblicazione: (2025)
di: Zhu, Shien, et al.
Pubblicazione: (2025)
Enhancing Diagnostic Accuracy through Multi-Agent Conversations: Using Large Language Models to Mitigate Cognitive Bias
di: Ke, Yu He, et al.
Pubblicazione: (2024)
di: Ke, Yu He, et al.
Pubblicazione: (2024)
DeepPlanner: Scaling Planning Capability for Deep Research Agents via Advantage Shaping
di: Fan, Wei, et al.
Pubblicazione: (2025)
di: Fan, Wei, et al.
Pubblicazione: (2025)
Explicit Multi-head Attention for Inter-head Interaction in Large Language Models
di: Peng, Runyu, et al.
Pubblicazione: (2026)
di: Peng, Runyu, et al.
Pubblicazione: (2026)
Agent-World: Scaling Real-World Environment Synthesis for Evolving General Agent Intelligence
di: Dong, Guanting, et al.
Pubblicazione: (2026)
di: Dong, Guanting, et al.
Pubblicazione: (2026)
ChinaTravel: An Open-Ended Travel Planning Benchmark with Compositional Constraint Validation for Language Agents
di: Shao, Jie-Jing, et al.
Pubblicazione: (2024)
di: Shao, Jie-Jing, et al.
Pubblicazione: (2024)
Attention-guided Evidence Grounding for Spoken Question Answering
di: Yang, Ke, et al.
Pubblicazione: (2026)
di: Yang, Ke, et al.
Pubblicazione: (2026)
Positional Encoding via Token-Aware Phase Attention
di: Wang, Yu, et al.
Pubblicazione: (2025)
di: Wang, Yu, et al.
Pubblicazione: (2025)
MoKA: Mixture of Kronecker Adapters
di: Sadeghi, Mohammadreza, et al.
Pubblicazione: (2025)
di: Sadeghi, Mohammadreza, et al.
Pubblicazione: (2025)
The Lighthouse of Language: Enhancing LLM Agents via Critique-Guided Improvement
di: Yang, Ruihan, et al.
Pubblicazione: (2025)
di: Yang, Ruihan, et al.
Pubblicazione: (2025)
Deep Reasoning in General Purpose Agents via Structured Meta-Cognition
di: Light, Dean, et al.
Pubblicazione: (2026)
di: Light, Dean, et al.
Pubblicazione: (2026)
CodeARC: Benchmarking Reasoning Capabilities of LLM Agents for Inductive Program Synthesis
di: Wei, Anjiang, et al.
Pubblicazione: (2025)
di: Wei, Anjiang, et al.
Pubblicazione: (2025)
Attention Editing: A Versatile Framework for Cross-Architecture Attention Conversion
di: Cheng, Zhen, et al.
Pubblicazione: (2026)
di: Cheng, Zhen, et al.
Pubblicazione: (2026)
TRAD: Enhancing LLM Agents with Step-Wise Thought Retrieval and Aligned Decision
di: Zhou, Ruiwen, et al.
Pubblicazione: (2024)
di: Zhou, Ruiwen, et al.
Pubblicazione: (2024)
Documenti analoghi
-
MoA: Heterogeneous Mixture of Adapters for Parameter-Efficient Fine-Tuning of Large Language Models
di: Cao, Jie, et al.
Pubblicazione: (2025) -
MoA: Mixture-of-Attention for Subject-Context Disentanglement in Personalized Image Generation
di: Wang, Kuan-Chieh, et al.
Pubblicazione: (2024) -
Mixture-of-Depths Attention
di: Zhu, Lianghui, et al.
Pubblicazione: (2026) -
Pyramid MoA: A Probabilistic Framework for Cost-Optimized Anytime Inference
di: Khaled, Arindam
Pubblicazione: (2026) -
MoBA: Mixture of Block Attention for Long-Context LLMs
di: Lu, Enzhe, et al.
Pubblicazione: (2025)