Yuan3.0 Ultra: A Trillion-Parameter Enterprise-Oriented MoE LLM
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | ai, YuanLab., :, Wu, Shawn, Luo, Jiangang, Chen, Darcy, Wang, Sean, Li, Louie, Wang, Allen, Zhao, Xudong, Yu, Tong, Li, Bach, Shen, Joseph, Ma, Gawain, Jia, Jasper, Mao, Marcus, Wang, Claire, He, Hunter, Wang, Carol, Zhang, Zera, Wang, Jason, Shen, Chonly, Zhang, Leo, Chen, Logan, Meng, Qasim, Gong, James, Zhao, Daniel, Zheng, Penn, Zhu, Owen |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Yuan3.0 Flash: An Open Multimodal Large Language Model for Enterprise Applications
par: ai, YuanLab., et autres
Publié: (2026)
par: ai, YuanLab., et autres
Publié: (2026)
Yuan 2.0-M32: Mixture of Experts with Attention Router
par: Wu, Shaohua, et autres
Publié: (2024)
par: Wu, Shaohua, et autres
Publié: (2024)
Yuan-TecSwin: A text conditioned Diffusion model with Swin-transformer blocks
par: Wu, Shaohua, et autres
Publié: (2025)
par: Wu, Shaohua, et autres
Publié: (2025)
WangLabCornell/Qian_et_al: Release_1.0
par: WangLabCornell
Publié: (2025)
par: WangLabCornell
Publié: (2025)
WangLabCornell/replication: Nature Communications release
par: WangLabCornell
Publié: (2025)
par: WangLabCornell
Publié: (2025)
Every Step Evolves: Scaling Reinforcement Learning for Trillion-Scale Thinking Model
par: Ling Team, et autres
Publié: (2025)
par: Ling Team, et autres
Publié: (2025)
Hybrid OCR-LLM Framework for Enterprise-Scale Document Information Extraction Under Copy-heavy Task
par: Wang, Zilong, et autres
Publié: (2025)
par: Wang, Zilong, et autres
Publié: (2025)
Trillion-atom molecular dynamics simulations with ab initio accuracy
par: Suo, Pengfei, et autres
Publié: (2026)
par: Suo, Pengfei, et autres
Publié: (2026)
Collaborative Compression for Large-Scale MoE Deployment on Edge
par: Chen, Yixiao, et autres
Publié: (2025)
par: Chen, Yixiao, et autres
Publié: (2025)
Faster MoE LLM Inference for Extremely Large Models
par: Yang, Haoqi, et autres
Publié: (2025)
par: Yang, Haoqi, et autres
Publié: (2025)
Efficient Feature Fusion for UAV Object Detection
par: Wang, Xudong, et autres
Publié: (2025)
par: Wang, Xudong, et autres
Publié: (2025)
What Happens Inside Agent Memory? Circuit Analysis from Emergence to Diagnosis
par: Mao, Xutao, et autres
Publié: (2026)
par: Mao, Xutao, et autres
Publié: (2026)
GW-MoE: Resolving Uncertainty in MoE Router with Global Workspace Theory
par: Wu, Haoze, et autres
Publié: (2024)
par: Wu, Haoze, et autres
Publié: (2024)
AIMER: Calibration-Free Task-Agnostic MoE Pruning
par: Liu, Zongfang, et autres
Publié: (2026)
par: Liu, Zongfang, et autres
Publié: (2026)
Decoding the MITRE Engenuity ATT&CK Enterprise Evaluation: An Analysis of EDR Performance in Real-World Environments
par: Shen, Xiangmin, et autres
Publié: (2024)
par: Shen, Xiangmin, et autres
Publié: (2024)
DIVE into MoE: Diversity-Enhanced Reconstruction of Large Language Models from Dense into Mixture-of-Experts
par: Feng, Yuchen, et autres
Publié: (2025)
par: Feng, Yuchen, et autres
Publié: (2025)
Hydnum pallidomarginatum T. Cao & H. S. Yuan 2021
par: Tuo, Yonglan, et autres
Publié: (2026)
par: Tuo, Yonglan, et autres
Publié: (2026)
On the Scaling of PEFT: Towards Million Personal Models of Trillion Parameters
par: Lab, Mind, et autres
Publié: (2026)
par: Lab, Mind, et autres
Publié: (2026)
Microscopic study on characteristic decorative black and white porcelain produced in Shanxi province, Jin and Yuan dynasties (ad 1115–1368), China
par: Minli Wang, et autres
Publié: (2024)
par: Minli Wang, et autres
Publié: (2024)
Effective MoE-based LLM Compression by Exploiting Heterogeneous Inter-Group Experts Routing Frequency and Information Density
par: Mi, Zhendong, et autres
Publié: (2026)
par: Mi, Zhendong, et autres
Publié: (2026)
Research on the Evaluation Index System of Enterprise Production Efficiency
par: Li, W., et autres
Publié: (2024)
par: Li, W., et autres
Publié: (2024)
Thermal stabilities Landscape of A$_2$BB$^{\prime}$O$_6$ compounds
par: Wang, Yateng, et autres
Publié: (2024)
par: Wang, Yateng, et autres
Publié: (2024)
Network Security Situation Assessment and Prediction Model for Industrial Enterprises
par: Jing Wang, et autres
Publié: (2026)
par: Jing Wang, et autres
Publié: (2026)
Intern-S1-Pro: Scientific Multimodal Foundation Model at Trillion Scale
par: Zou, Yicheng, et autres
Publié: (2026)
par: Zou, Yicheng, et autres
Publié: (2026)
Every Activation Boosted: Scaling General Reasoner to 1 Trillion Open Language Foundation
par: Ling Team, et autres
Publié: (2025)
par: Ling Team, et autres
Publié: (2025)
Assessment Twins: A Protocol for AI-Vulnerable Summative Assessment
par: Roe, Jasper, et autres
Publié: (2025)
par: Roe, Jasper, et autres
Publié: (2025)
Yuan Yang
Publié: (2024)
Publié: (2024)
3D-Consistent Human Avatars with Sparse Inputs via Gaussian Splatting and Contrastive Learning
par: Zhao, Haoyu, et autres
Publié: (2024)
par: Zhao, Haoyu, et autres
Publié: (2024)
Exploration enhances cooperation in the multi-agent communication system
par: Song, Zhao, et autres
Publié: (2026)
par: Song, Zhao, et autres
Publié: (2026)
Trillion Parameter AI Serving Infrastructure for Scientific Discovery: A Survey and Vision
par: Hudson, Nathaniel, et autres
Publié: (2024)
par: Hudson, Nathaniel, et autres
Publié: (2024)
Guiding the Experts: Semantic Priors for Efficient and Focused MoE Routing
par: Min, Chengxi, et autres
Publié: (2025)
par: Min, Chengxi, et autres
Publié: (2025)
Ethnic Polarization and Ownership Decision in Cross‐Border Acquisitions: The Case of Emerging Market Multinational Enterprises
par: Jianhong Zhang, et autres
Publié: (2025)
par: Jianhong Zhang, et autres
Publié: (2025)
Topology-aware Human Avatars with Semantically-guided Gaussian Splatting
par: Zhao, Haoyu, et autres
Publié: (2024)
par: Zhao, Haoyu, et autres
Publié: (2024)
GazeFormer-MoE: Context-Aware Gaze Estimation via CLIP and MoE Transformer
par: Zhao, Xinyuan, et autres
Publié: (2026)
par: Zhao, Xinyuan, et autres
Publié: (2026)
eMoE-Tracker: Environmental MoE-based Transformer for Robust Event-guided Object Tracking
par: Chen, Yucheng, et autres
Publié: (2024)
par: Chen, Yucheng, et autres
Publié: (2024)
The Trillion Dollar Shift
par: Hoek, Marga
Publié: (2019)
par: Hoek, Marga
Publié: (2019)
MeLo: Low-rank Adaptation is Better than Fine-tuning for Medical Image Diagnosis
par: Zhu, Yitao, et autres
Publié: (2023)
par: Zhu, Yitao, et autres
Publié: (2023)
Janus: Disaggregating Attention and Experts for Scalable MoE Inference
par: Zhang, Zhexiang, et autres
Publié: (2025)
par: Zhang, Zhexiang, et autres
Publié: (2025)
LLaDA-MoE: A Sparse MoE Diffusion Language Model
par: Zhu, Fengqi, et autres
Publié: (2025)
par: Zhu, Fengqi, et autres
Publié: (2025)
$λ$-GRPO: Unifying the GRPO Frameworks with Learnable Token Preferences
par: Wang, Yining, et autres
Publié: (2025)
par: Wang, Yining, et autres
Publié: (2025)
Documents similaires
-
Yuan3.0 Flash: An Open Multimodal Large Language Model for Enterprise Applications
par: ai, YuanLab., et autres
Publié: (2026) -
Yuan 2.0-M32: Mixture of Experts with Attention Router
par: Wu, Shaohua, et autres
Publié: (2024) -
Yuan-TecSwin: A text conditioned Diffusion model with Swin-transformer blocks
par: Wu, Shaohua, et autres
Publié: (2025) -
WangLabCornell/Qian_et_al: Release_1.0
par: WangLabCornell
Publié: (2025) -
WangLabCornell/replication: Nature Communications release
par: WangLabCornell
Publié: (2025)