Kimi Linear: An Expressive, Efficient Attention Architecture
Fuente:
arXiv
Saved in:
| Main Authors: | Kimi Team, Zhang, Yu, Lin, Zongyu, Yao, Xingcheng, Hu, Jiaxi, Meng, Fanqing, Liu, Chengyin, Men, Xin, Yang, Songlin, Li, Zhiyuan, Li, Wentao, Lu, Enzhe, Liu, Weizhou, Chen, Yanru, Xu, Weixin, Yu, Longhui, Wang, Yejie, Fan, Yu, Zhong, Longguang, Yuan, Enming, Zhang, Dehao, Zhang, Yizhi, Liu, T. Y., Wang, Haiming, Fang, Shengjun, He, Weiran, Liu, Shaowei, Li, Yiwei, Su, Jianlin, Qiu, Jiezhong, Pang, Bo, Yan, Junjie, Jiang, Zhejun, Huang, Weixiao, Yin, Bohong, You, Jiacheng, Wei, Chu, Wang, Zhengtao, Hong, Chao, Chen, Yutian, Chen, Guanduo, Wang, Yucheng, Zheng, Huabin, Wang, Feng, Liu, Yibo, Dong, Mengnan, Zhang, Zheng, Pan, Siyuan, Wu, Wenhao, Wu, Yuhao, Guan, Longyu, Tao, Jiawen, Fu, Guohong, Xu, Xinran, Wang, Yuzhi, Lai, Guokun, Wu, Yuxin, Zhou, Xinyu, Yang, Zhilin, Du, Yulun |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Kimi-VL Technical Report
by: Kimi Team, et al.
Published: (2025)
by: Kimi Team, et al.
Published: (2025)
Kimi K2: Open Agentic Intelligence
by: Kimi Team, et al.
Published: (2025)
by: Kimi Team, et al.
Published: (2025)
Kimi K2.5: Visual Agentic Intelligence
by: Kimi Team, et al.
Published: (2026)
by: Kimi Team, et al.
Published: (2026)
Kimi-Audio Technical Report
by: KimiTeam, et al.
Published: (2025)
by: KimiTeam, et al.
Published: (2025)
Kimi k1.5: Scaling Reinforcement Learning with LLMs
by: Kimi Team, et al.
Published: (2025)
by: Kimi Team, et al.
Published: (2025)
Kimi-Dev: Agentless Training as Skill Prior for SWE-Agents
by: Yang, Zonghan, et al.
Published: (2025)
by: Yang, Zonghan, et al.
Published: (2025)
Interplay Between the N→C Dative Bond, Intramolecular Chalcogen Bond and π Conjugation in the Complexes Formed by Cyclo[18]carbon and C 14 Polyyne with 1,2,5‐Chalcogenadiazoles
by: Yu Zhang, et al.
Published: (2024)
by: Yu Zhang, et al.
Published: (2024)
Probabilistic QoS Metric Forecasting in Delay-Tolerant Networks Using Conditional Diffusion Models on Latent Dynamics
by: Zhang, Enming, et al.
Published: (2025)
by: Zhang, Enming, et al.
Published: (2025)
Attention Residuals
by: Kimi Team, et al.
Published: (2026)
by: Kimi Team, et al.
Published: (2026)
Exploiting Task Relationships in Continual Learning via Transferability-Aware Task Embeddings
by: Wu, Yanru, et al.
Published: (2025)
by: Wu, Yanru, et al.
Published: (2025)
Copper‐Related Cell Death and the Role of Copper in Head and Neck Squamous Cell Carcinoma and Therapeutic Strategies
by: Zhe Zhang, et al.
Published: (2024)
by: Zhe Zhang, et al.
Published: (2024)
SaMam: Style-aware State Space Model for Arbitrary Image Style Transfer
by: Liu, Hongda, et al.
Published: (2025)
by: Liu, Hongda, et al.
Published: (2025)
MoBA: Mixture of Block Attention for Long-Context LLMs
by: Lu, Enzhe, et al.
Published: (2025)
by: Lu, Enzhe, et al.
Published: (2025)
First Multi-Dimensional Evaluation of Flowchart Comprehension for Multimodal Large Language Models
by: Zhang, Enming, et al.
Published: (2024)
by: Zhang, Enming, et al.
Published: (2024)
UPGS: Unified Pose-aware Gaussian Splatting for Dynamic Scene Deblurring
by: Wu, Zhijing, et al.
Published: (2025)
by: Wu, Zhijing, et al.
Published: (2025)
Evolving Prompt Adaptation for Vision-Language Models
by: Zhang, Enming, et al.
Published: (2026)
by: Zhang, Enming, et al.
Published: (2026)
Muon is Scalable for LLM Training
by: Liu, Jingyuan, et al.
Published: (2025)
by: Liu, Jingyuan, et al.
Published: (2025)
Lightweight Pixel Difference Networks for Efficient Visual Representation Learning
by: Su, Zhuo, et al.
Published: (2024)
by: Su, Zhuo, et al.
Published: (2024)
HumanNeRF-SE: A Simple yet Effective Approach to Animate HumanNeRF with Diverse Poses
by: Ma, Caoyuan, et al.
Published: (2023)
by: Ma, Caoyuan, et al.
Published: (2023)
Research on Autodocking Control Technology of the Propellant Umbilical Connector of Launch Vehicles
by: Penghui Wu, et al.
Published: (2024)
by: Penghui Wu, et al.
Published: (2024)
SubGDiff: A Subgraph Diffusion Model to Improve Molecular Representation Learning
by: Zhang, Jiying, et al.
Published: (2024)
by: Zhang, Jiying, et al.
Published: (2024)
CaDA: Cross-Problem Routing Solver with Constraint-Aware Dual-Attention
by: Li, Han, et al.
Published: (2024)
by: Li, Han, et al.
Published: (2024)
FLIMs: Fault Localization Interference Mutants, Definition, Recognition and Mitigation
by: Liu, Hengyuan, et al.
Published: (2025)
by: Liu, Hengyuan, et al.
Published: (2025)
M$^3$AV: A Multimodal, Multigenre, and Multipurpose Audio-Visual Academic Lecture Dataset
by: Chen, Zhe, et al.
Published: (2024)
by: Chen, Zhe, et al.
Published: (2024)
Denosumab Combined With PARP Inhibitors and Chemoradiotherapy for Treating Triple Negative Breast Cancer With Bone Metastasis: A Case Report
by: Li Liu, et al.
Published: (2026)
by: Li Liu, et al.
Published: (2026)
Cover Image
by: Shuai Li, et al.
Published: (2025)
by: Shuai Li, et al.
Published: (2025)
Knowledge-Level Consistency Reinforcement Learning: Dual-Fact Alignment for Long-Form Factuality
by: Li, Junliang, et al.
Published: (2025)
by: Li, Junliang, et al.
Published: (2025)
DyStream: Streaming Dyadic Talking Heads Generation via Flow Matching-based Autoregressive Model
by: Chen, Bohong, et al.
Published: (2025)
by: Chen, Bohong, et al.
Published: (2025)
TMT: Cross-domain Semantic Segmentation with Region-adaptive Transferability Estimation
by: Zhang, Enming, et al.
Published: (2025)
by: Zhang, Enming, et al.
Published: (2025)
Low‐Dimensional Hetero‐Interlayer Enabling Sub‐Bandgap Photovoltaic Conversion for Perovskite Solar Cells
by: Yutong Wu, et al.
Published: (2025)
by: Yutong Wu, et al.
Published: (2025)
VFArchē: A Dual-Mode Framework for Locating Vulnerable Functions in Open-Source Software
by: Zhang, Lyuye, et al.
Published: (2025)
by: Zhang, Lyuye, et al.
Published: (2025)
Optimizing Graphene Oxide Interlayer Spacing for Zeolitic Imidazolate Framework‐8 Growth Toward Enhanced Shale Oil Separation
by: Hang Wang, et al.
Published: (2025)
by: Hang Wang, et al.
Published: (2025)
AutoTurb: Using Large Language Models for Automatic Algebraic Model Discovery of Turbulence Closure
by: Zhang, Yu, et al.
Published: (2024)
by: Zhang, Yu, et al.
Published: (2024)
Electrophysiological responses and field attractants of Hoplia spectabilis Medvedev ( Coleoptera: Scarabaeidae ) adults to host plant volatiles
by: Guang‐Yu Wang, et al.
Published: (2026)
by: Guang‐Yu Wang, et al.
Published: (2026)
Thermodynamic topological classes of the rotating, accelerating black holes
by: Liu, Wentao, et al.
Published: (2024)
by: Liu, Wentao, et al.
Published: (2024)
SSFMamba: Learning Symmetry-driven Spatial-Frequency Modeling for Physically Consistent 3D Medical Image Segmentation
by: Zhang, Bo, et al.
Published: (2025)
by: Zhang, Bo, et al.
Published: (2025)
Coarse‐To‐Fine 3D Craniofacial Landmark Detection via Heat Kernel Optimization
by: Xingfei Xue, et al.
Published: (2025)
by: Xingfei Xue, et al.
Published: (2025)
Pluggable Style Representation Learning for Multi-Style Transfer
by: Liu, Hongda, et al.
Published: (2025)
by: Liu, Hongda, et al.
Published: (2025)
Engineering mobility in quasiperiodic lattices with exact mobility edges
by: Wang, Zhenbo, et al.
Published: (2023)
by: Wang, Zhenbo, et al.
Published: (2023)
A Spatial-Constraint Model for Manipulating Static Visualizations
by: Liu, Can, et al.
Published: (2023)
by: Liu, Can, et al.
Published: (2023)
Similar Items
-
Kimi-VL Technical Report
by: Kimi Team, et al.
Published: (2025) -
Kimi K2: Open Agentic Intelligence
by: Kimi Team, et al.
Published: (2025) -
Kimi K2.5: Visual Agentic Intelligence
by: Kimi Team, et al.
Published: (2026) -
Kimi-Audio Technical Report
by: KimiTeam, et al.
Published: (2025) -
Kimi k1.5: Scaling Reinforcement Learning with LLMs
by: Kimi Team, et al.
Published: (2025)