Efficient Context Scaling with LongCat ZigZag Attention
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Chen, Bai, Yang, Li, Jiahuan, Gui, Anchun, Wang, Keheng, Liu, Feifan, Wu, Guanyu, Jiang, Yuwei, Bu, Defei, Wei, Li, Jing, Haihang, Tang, Hongyin, Chen, Xin, Huang, Xiangzhou, Li, Fengcun, Weng, Rongxiang, Qian, Yulei, Lu, Yifan, Sun, Yerui, Wang, Jingang, Xie, Yuchen, Cai, Xunliang |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ZigZag: Universal Sampling-free Uncertainty Estimation Through Two-Step Inference
par: Durasov, Nikita, et autres
Publié: (2022)
par: Durasov, Nikita, et autres
Publié: (2022)
LongCat-Flash Technical Report
par: Meituan LongCat Team, et autres
Publié: (2025)
par: Meituan LongCat Team, et autres
Publié: (2025)
LongCat-Flash-Thinking-2601 Technical Report
par: Meituan LongCat Team, et autres
Publié: (2026)
par: Meituan LongCat Team, et autres
Publié: (2026)
Introducing LongCat-Flash-Thinking: A Technical Report
par: Meituan LongCat Team, et autres
Publié: (2025)
par: Meituan LongCat Team, et autres
Publié: (2025)
Representaciones de la otredad en el personaje Mawa de la revista Jungla (editorial ZigZag, 1967-1969)
par: Paola Melina Rapimán Risco
Publié: (2024)
par: Paola Melina Rapimán Risco
Publié: (2024)
LongCat-Video Technical Report
par: Meituan LongCat Team, et autres
Publié: (2025)
par: Meituan LongCat Team, et autres
Publié: (2025)
LongCat-Flash-Omni Technical Report
par: Meituan LongCat Team, et autres
Publié: (2025)
par: Meituan LongCat Team, et autres
Publié: (2025)
LongCat-Next: Lexicalizing Modalities as Discrete Tokens
par: Meituan LongCat Team, et autres
Publié: (2026)
par: Meituan LongCat Team, et autres
Publié: (2026)
LongCat-Video-Avatar 1.5 Technical Report
par: Meituan LongCat Team, et autres
Publié: (2026)
par: Meituan LongCat Team, et autres
Publié: (2026)
LongCat-Image Technical Report
par: Meituan LongCat Team, et autres
Publié: (2025)
par: Meituan LongCat Team, et autres
Publié: (2025)
Unlocking Implicit Experience: Synthesizing Tool-Use Trajectories from Text
par: Xu, Zhihao, et autres
Publié: (2026)
par: Xu, Zhihao, et autres
Publié: (2026)
Zig-Zag Modules: Cosheaves and K-Theory
par: Grady, Ryan E., et autres
Publié: (2021)
par: Grady, Ryan E., et autres
Publié: (2021)
LongCat-Audio-Codec: An Audio Tokenizer and Detokenizer Solution Designed for Speech Large Language Models
par: Zhao, Xiaohan, et autres
Publié: (2025)
par: Zhao, Xiaohan, et autres
Publié: (2025)
LongCat-AudioDiT: High-Fidelity Diffusion Text-to-Speech in the Waveform Latent Space
par: Xin, Detai, et autres
Publié: (2026)
par: Xin, Detai, et autres
Publié: (2026)
Nontrivial topological phases in "Zig-Zag" arrays of polarization transmons
par: Konopleva, Ekaterina, et autres
Publié: (2025)
par: Konopleva, Ekaterina, et autres
Publié: (2025)
One-Step Forward and Backtrack: Overcoming Zig-Zagging in Loss-Aware Quantization Training
par: Ma, Lianbo, et autres
Publié: (2024)
par: Ma, Lianbo, et autres
Publié: (2024)
LongCat-Flash-Prover: Advancing Native Formal Reasoning via Agentic Tool-Integrated Reinforcement Learning
par: Wang, Jianing, et autres
Publié: (2026)
par: Wang, Jianing, et autres
Publié: (2026)
Large sample scaling analysis of the Zig-Zag algorithm for Bayesian inference
par: Agrawal, Sanket, et autres
Publié: (2024)
par: Agrawal, Sanket, et autres
Publié: (2024)
Geometrical Parameters Investigation of a Zig‐Zag Soft Pneumatic Actuators
par: Jingon Yoon, et autres
Publié: (2024)
par: Jingon Yoon, et autres
Publié: (2024)
EPS-MoE: Expert Pipeline Scheduler for Cost-Efficient MoE Inference
par: Qian, Yulei, et autres
Publié: (2024)
par: Qian, Yulei, et autres
Publié: (2024)
ARI, GARI, Zig and Zag: An introduction to Ecalle's theory of multiple zeta values
par: Schneps, Leila
Publié: (2015)
par: Schneps, Leila
Publié: (2015)
Zig-Zag y la irrupción editorial: La ciudad letrada "zigzagueante"
par: Marina d. A. Alvarado Cornejo
Publié: (2011)
par: Marina d. A. Alvarado Cornejo
Publié: (2011)
Data-driven Investigation of Cotton Fabric Behavior Modified by Straight and Zig-Zag Stitches
par: Werth, Harmony, et autres
Publié: (2023)
par: Werth, Harmony, et autres
Publié: (2023)
Making Mathematical Reasoning Adaptive
par: Lai, Zhejian, et autres
Publié: (2025)
par: Lai, Zhejian, et autres
Publié: (2025)
LLMs Know What They Need: Leveraging a Missing Information Guided Framework to Empower Retrieval-Augmented Generation
par: Wang, Keheng, et autres
Publié: (2024)
par: Wang, Keheng, et autres
Publié: (2024)
La crisis los 30' desde el magazine. Una década través de Zig-Zag
par: Joaquín Ramos Toma
Publié: (2020)
par: Joaquín Ramos Toma
Publié: (2020)
Momentum-Space Entanglement Signatures and Spinon Breakdown in the $J_1$-$J_2$ Zig-Zag Heisenberg Chain
par: Oeffner, Tom, et autres
Publié: (2026)
par: Oeffner, Tom, et autres
Publié: (2026)
Ltri-LLM: Streaming Long Context Inference for LLMs with Training-Free Dynamic Triangular Attention Pattern
par: Tang, Hongyin, et autres
Publié: (2024)
par: Tang, Hongyin, et autres
Publié: (2024)
Scaling Embeddings Outperforms Scaling Experts in Language Models
par: Liu, Hong, et autres
Publié: (2026)
par: Liu, Hong, et autres
Publié: (2026)
A Survey on LLM Mid-Training
par: Tu, Chengying, et autres
Publié: (2025)
par: Tu, Chengying, et autres
Publié: (2025)
Libra: Assessing and Improving Reward Model by Learning to Think
par: Zhou, Meng, et autres
Publié: (2025)
par: Zhou, Meng, et autres
Publié: (2025)
Multi-Objective and Mixed-Reward Reinforcement Learning via Reward-Decorrelated Policy Optimization
par: Bai, Yang, et autres
Publié: (2026)
par: Bai, Yang, et autres
Publié: (2026)
FIRE: Flexible Integration of Data Quality Ratings for Effective Pre-Training
par: Xu, Liangyu, et autres
Publié: (2025)
par: Xu, Liangyu, et autres
Publié: (2025)
LinkQA: Synthesizing Diverse QA from Multiple Seeds Strongly Linked by Knowledge Points
par: Zhang, Xuemiao, et autres
Publié: (2025)
par: Zhang, Xuemiao, et autres
Publié: (2025)
Large-Scale Diverse Synthesis for Mid-Training
par: Zhang, Xuemiao, et autres
Publié: (2025)
par: Zhang, Xuemiao, et autres
Publié: (2025)
Modernidad y antimodernidad en el Santiago de los años treinta. Postales urbanas en la revista Zig-Zag
par: Hugo Mondragón-López
Publié: (2012)
par: Hugo Mondragón-López
Publié: (2012)
A Preliminary Study on the Promises and Challenges of Native Top-$k$ Sparse Attention
par: Xiu, Di, et autres
Publié: (2025)
par: Xiu, Di, et autres
Publié: (2025)
OneCAT: Decoder-Only Auto-Regressive Model for Unified Understanding and Generation
par: Li, Han, et autres
Publié: (2025)
par: Li, Han, et autres
Publié: (2025)
ATLAS: All-round Testing of Long-context Abilities across Scales
par: Huang, Deli, et autres
Publié: (2026)
par: Huang, Deli, et autres
Publié: (2026)
Preference Curriculum: LLMs Should Always Be Pretrained on Their Preferred Data
par: Zhang, Xuemiao, et autres
Publié: (2025)
par: Zhang, Xuemiao, et autres
Publié: (2025)
Documents similaires
-
ZigZag: Universal Sampling-free Uncertainty Estimation Through Two-Step Inference
par: Durasov, Nikita, et autres
Publié: (2022) -
LongCat-Flash Technical Report
par: Meituan LongCat Team, et autres
Publié: (2025) -
LongCat-Flash-Thinking-2601 Technical Report
par: Meituan LongCat Team, et autres
Publié: (2026) -
Introducing LongCat-Flash-Thinking: A Technical Report
par: Meituan LongCat Team, et autres
Publié: (2025) -
Representaciones de la otredad en el personaje Mawa de la revista Jungla (editorial ZigZag, 1967-1969)
par: Paola Melina Rapimán Risco
Publié: (2024)