Attention Residuals
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Kimi Team, Chen, Guangyu, Zhang, Yu, Su, Jianlin, Xu, Weixin, Pan, Siyuan, Wang, Yaoyu, Wang, Yucheng, Chen, Guanduo, Yin, Bohong, Chen, Yutian, Yan, Junjie, Wei, Ming, Zhang, Y., Meng, Fanqing, Hong, Chao, Xie, Xiaotong, Liu, Shaowei, Lu, Enzhe, Tai, Yunpeng, Chen, Yanru, Men, Xin, Guo, Haiqing, Charles, Y., Lu, Haoyu, Sui, Lin, Zhu, Jinguo, Zhou, Zaida, He, Weiran, Huang, Weixiao, Xu, Xinran, Wang, Yuzhi, Lai, Guokun, Du, Yulun, Wu, Yuxin, Yang, Zhilin, Zhou, Xinyu |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Muon is Scalable for LLM Training
par: Liu, Jingyuan, et autres
Publié: (2025)
par: Liu, Jingyuan, et autres
Publié: (2025)
MoBA: Mixture of Block Attention for Long-Context LLMs
par: Lu, Enzhe, et autres
Publié: (2025)
par: Lu, Enzhe, et autres
Publié: (2025)
Kimi Linear: An Expressive, Efficient Attention Architecture
par: Kimi Team, et autres
Publié: (2025)
par: Kimi Team, et autres
Publié: (2025)
EvoEmpirBench: Dynamic Spatial Reasoning with Agent-ExpVer
par: Zhao, Pukun, et autres
Publié: (2025)
par: Zhao, Pukun, et autres
Publié: (2025)
STAR: Mitigating Cascading Errors in Spatial Reasoning via Turn-point Alignment and Segment-level DPO
par: Zhao, Pukun, et autres
Publié: (2026)
par: Zhao, Pukun, et autres
Publié: (2026)
On the geometric side of the Jacquet-Rallis relative trace formula
par: Lu, Weixiao
Publié: (2024)
par: Lu, Weixiao
Publié: (2024)
Platform investment and creators' quality choice
par: Limei Chen, et autres
Publié: (2024)
par: Limei Chen, et autres
Publié: (2024)
Poincaré type J-equation
par: Chen, Xiuxiong, et autres
Publié: (2026)
par: Chen, Xiuxiong, et autres
Publié: (2026)
Robust and Efficient Adversarial Defense in SNNs via Image Purification and Joint Detection
par: Chen, Weiran, et autres
Publié: (2024)
par: Chen, Weiran, et autres
Publié: (2024)
Simulating Field Experiments with Large Language Models
par: Chen, Yaoyu, et autres
Publié: (2024)
par: Chen, Yaoyu, et autres
Publié: (2024)
Predicting Field Experiments with Large Language Models
par: Chen, Yaoyu, et autres
Publié: (2025)
par: Chen, Yaoyu, et autres
Publié: (2025)
Kimi-Audio Technical Report
par: KimiTeam, et autres
Publié: (2025)
par: KimiTeam, et autres
Publié: (2025)
GEOCHEMICAL ANALYSES OF EOCENE OILS IN DEEPLY BURIED SANDSTONE RESERVOIRS IN THE DONGYING DEPRESSION, BOHAI BAY BASIN, NE CHINA
par: Xiaoxiao Zhou, et autres
Publié: (2024)
par: Xiaoxiao Zhou, et autres
Publié: (2024)
Memory-Anchored Multimodal Reasoning for Explainable Video Forensics
par: Chen, Chen, et autres
Publié: (2025)
par: Chen, Chen, et autres
Publié: (2025)
DyStream: Streaming Dyadic Talking Heads Generation via Flow Matching-based Autoregressive Model
par: Chen, Bohong, et autres
Publié: (2025)
par: Chen, Bohong, et autres
Publié: (2025)
Option Market Making via Reinforcement Learning
par: Fang, Zhou, et autres
Publié: (2023)
par: Fang, Zhou, et autres
Publié: (2023)
Convergence of the Planewave Approximations for Quantum Incommensurate Systems
par: Wang, Ting, et autres
Publié: (2022)
par: Wang, Ting, et autres
Publié: (2022)
On the relative Langlands duality for $\operatorname{Sp}_{2n} \backslash \operatorname{GL}_{2n+1}$ (with an appendix by Zeyu Wang)
par: Lu, Weixiao, et autres
Publié: (2025)
par: Lu, Weixiao, et autres
Publié: (2025)
Central values of Asai L-functions and twisted Gan--Gross--Prasad conjecture
par: Lu, Weixiao, et autres
Publié: (2025)
par: Lu, Weixiao, et autres
Publié: (2025)
AirIMU: Learning Uncertainty Propagation for Inertial Odometry
par: Qiu, Yuheng, et autres
Publié: (2023)
par: Qiu, Yuheng, et autres
Publié: (2023)
机法二深信与判教智慧——善导"要弘二门"与太虚"大乘三系"的会通及圆觉、极乐、华藏三重境界阐释
par: Chen, Jianlin
Publié: (2026)
par: Chen, Jianlin
Publié: (2026)
LMStyle Benchmark: Evaluating Text Style Transfer for Chatbots
par: Chen, Jianlin
Publié: (2024)
par: Chen, Jianlin
Publié: (2024)
Efficient Video Diffusion with Sparse Information Transmission for Video Compression
par: Zhou, Mingde, et autres
Publié: (2026)
par: Zhou, Mingde, et autres
Publié: (2026)
Penalty-Based First-Order Methods for Bilevel Optimization with Minimax and Constrained Lower-Level Problems
par: Shen, Yiyang, et autres
Publié: (2026)
par: Shen, Yiyang, et autres
Publié: (2026)
Sharp criteria for a degenerate diffusion-aggregation system with the intermediate exponent
par: Zhou, Tiantian, et autres
Publié: (2025)
par: Zhou, Tiantian, et autres
Publié: (2025)
TurboRAG: Accelerating Retrieval-Augmented Generation with Precomputed KV Caches for Chunked Text
par: Lu, Songshuo, et autres
Publié: (2024)
par: Lu, Songshuo, et autres
Publié: (2024)
SCRNet: Spatial-Channel Regulation Network for Medical Ultrasound Image Segmentation
par: Xu, Weixin, et autres
Publié: (2025)
par: Xu, Weixin, et autres
Publié: (2025)
After Admission: The Emotional Suffering of Students Enrolled Through the Rural Students Quota Plan in China's Elite Universities
par: Songdi Wang, et autres
Publié: (2024)
par: Songdi Wang, et autres
Publié: (2024)
Periods detecting Eisenstein series and sums of $L$-values I
par: Lu, Weixiao, et autres
Publié: (2025)
par: Lu, Weixiao, et autres
Publié: (2025)
Enhancing the Outcome Reward-based RL Training of MLLMs with Self-Consistency Sampling
par: Wang, Jiahao, et autres
Publié: (2025)
par: Wang, Jiahao, et autres
Publié: (2025)
Evolutionary Greedy Algorithm for Optimal Sensor Placement Problem in Urban Sewage Surveillance
par: Wang, Sunyu, et autres
Publié: (2024)
par: Wang, Sunyu, et autres
Publié: (2024)
EFRame: Deeper Reasoning via Exploration-Filter-Replay Reinforcement Learning Framework
par: Wang, Chen, et autres
Publié: (2025)
par: Wang, Chen, et autres
Publié: (2025)
CE-LoRA: Computation-Efficient LoRA Fine-Tuning for Language Models
par: Chen, Guanduo, et autres
Publié: (2025)
par: Chen, Guanduo, et autres
Publié: (2025)
Performance assessment of the effective core potentials under the Fermionic neural network: first and second row elements
par: Wang, Mengsa, et autres
Publié: (2024)
par: Wang, Mengsa, et autres
Publié: (2024)
Kimi-VL Technical Report
par: Kimi Team, et autres
Publié: (2025)
par: Kimi Team, et autres
Publié: (2025)
Low‐Dose Golidocitinib for Triple‐Mutant (JAK1/STAT3/TET2) ITLPD‐GI After DLBCL Remission
par: Wenwen Wang, et autres
Publié: (2026)
par: Wenwen Wang, et autres
Publié: (2026)
Canagliflozin Delays Aortic Valve Calcification by Enhancing the AMPK /Nrf2/ HO ‐1 Antioxidant Signaling Pathway in Valvular Interstitial Cells
par: Quangong Zhao, et autres
Publié: (2025)
par: Quangong Zhao, et autres
Publié: (2025)
Reconstruction of multiple strings of constant weight from prefix-suffix compositions
par: Yang, Yaoyu, et autres
Publié: (2024)
par: Yang, Yaoyu, et autres
Publié: (2024)
Arbitrage on Decentralized Exchanges
par: He, Xue Dong, et autres
Publié: (2025)
par: He, Xue Dong, et autres
Publié: (2025)
Optimal Design of Automated Market Makers on Decentralized Exchanges
par: He, Xue Dong, et autres
Publié: (2024)
par: He, Xue Dong, et autres
Publié: (2024)
Documents similaires
-
Muon is Scalable for LLM Training
par: Liu, Jingyuan, et autres
Publié: (2025) -
MoBA: Mixture of Block Attention for Long-Context LLMs
par: Lu, Enzhe, et autres
Publié: (2025) -
Kimi Linear: An Expressive, Efficient Attention Architecture
par: Kimi Team, et autres
Publié: (2025) -
EvoEmpirBench: Dynamic Spatial Reasoning with Agent-ExpVer
par: Zhao, Pukun, et autres
Publié: (2025) -
STAR: Mitigating Cascading Errors in Spatial Reasoning via Turn-point Alignment and Segment-level DPO
par: Zhao, Pukun, et autres
Publié: (2026)