TransNormerLLM: A Faster and Better Large Language Model with Improved TransNormer
Fuente:
arXiv
Saved in:
| Main Authors: | Qin, Zhen, Li, Dong, Sun, Weigao, Sun, Weixuan, Shen, Xuyang, Han, Xiaodong, Wei, Yunshen, Lv, Baohong, Luo, Xiao, Qiao, Yu, Zhong, Yiran |
|---|---|
| Format: | Preprint |
| Published: |
2023
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Various Lengths, Constant Speed: Efficient Language Modeling with Lightning Attention
by: Qin, Zhen, et al.
Published: (2024)
by: Qin, Zhen, et al.
Published: (2024)
Lightning Attention-2: A Free Lunch for Handling Unlimited Sequence Lengths in Large Language Models
by: Qin, Zhen, et al.
Published: (2024)
by: Qin, Zhen, et al.
Published: (2024)
HGRN2: Gated Linear RNNs with State Expansion
by: Qin, Zhen, et al.
Published: (2024)
by: Qin, Zhen, et al.
Published: (2024)
CO2: Efficient Distributed Training with Full Communication-Computation Overlap
by: Sun, Weigao, et al.
Published: (2024)
by: Sun, Weigao, et al.
Published: (2024)
FredNormer: Frequency Domain Normalization for Non-stationary Time Series Forecasting
by: Piao, Xihao, et al.
Published: (2024)
by: Piao, Xihao, et al.
Published: (2024)
Linear Attention Sequence Parallelism
by: Sun, Weigao, et al.
Published: (2024)
by: Sun, Weigao, et al.
Published: (2024)
Scaling Laws for Linear Complexity Language Models
by: Shen, Xuyang, et al.
Published: (2024)
by: Shen, Xuyang, et al.
Published: (2024)
Unlocking the Secrets of Linear Complexity Sequence Model from A Unified Perspective
by: Qin, Zhen, et al.
Published: (2024)
by: Qin, Zhen, et al.
Published: (2024)
TransNormal: Dense Visual Semantics for Diffusion-based Transparent Object Normal Estimation
by: Li, Mingwei, et al.
Published: (2026)
by: Li, Mingwei, et al.
Published: (2026)
Elucidating the Design Space of Decay in Linear Attention
by: Qin, Zhen, et al.
Published: (2025)
by: Qin, Zhen, et al.
Published: (2025)
GramTrans: A Better Code Representation Approach in Code Generation
by: Zhang, Zhao, et al.
Published: (2025)
by: Zhang, Zhao, et al.
Published: (2025)
LASP-2: Rethinking Sequence Parallelism for Linear Attention and Its Hybrid
by: Sun, Weigao, et al.
Published: (2025)
by: Sun, Weigao, et al.
Published: (2025)
You Only Scan Once: Efficient Multi-dimension Sequential Modeling with LightNet
by: Qin, Zhen, et al.
Published: (2024)
by: Qin, Zhen, et al.
Published: (2024)
FlashSampling: Fast and Memory-Efficient Exact Sampling
by: Ruiz, Tomas, et al.
Published: (2026)
by: Ruiz, Tomas, et al.
Published: (2026)
TransForce: Transferable Force Prediction for Vision-based Tactile Sensors with Sequential Image Translation
by: Chen, Zhuo, et al.
Published: (2024)
by: Chen, Zhuo, et al.
Published: (2024)
ParaTransCNN: Parallelized TransCNN Encoder for Medical Image Segmentation
by: Sun, Hongkun, et al.
Published: (2024)
by: Sun, Hongkun, et al.
Published: (2024)
LLaMA-MoE v2: Exploring Sparsity of LLaMA from Perspective of Mixture-of-Experts with Post-Training
by: Qu, Xiaoye, et al.
Published: (2024)
by: Qu, Xiaoye, et al.
Published: (2024)
PolyBench: Benchmarking LLM Forecasting and Trading Capabilities on Live Prediction Market Data
by: Cheng, Pu, et al.
Published: (2026)
by: Cheng, Pu, et al.
Published: (2026)
TransRUPNet for Improved Polyp Segmentation
by: Jha, Debesh, et al.
Published: (2023)
by: Jha, Debesh, et al.
Published: (2023)
ExpeTrans: LLMs Are Experiential Transfer Learners
by: Gao, Jinglong, et al.
Published: (2025)
by: Gao, Jinglong, et al.
Published: (2025)
Dormancy and Recurrence in Breast Cancer Bone Metastasis: From Mechanisms to Clinical Translation
by: Ziqi Sun, et al.
Published: (2026)
by: Ziqi Sun, et al.
Published: (2026)
WPN: An Unlearning Method Based on N-pair Contrastive Learning in Language Models
by: Chen, Guitao, et al.
Published: (2024)
by: Chen, Guitao, et al.
Published: (2024)
Trans
Published: (2022)
Published: (2022)
TAVGBench: Benchmarking Text to Audible-Video Generation
by: Mao, Yuxin, et al.
Published: (2024)
by: Mao, Yuxin, et al.
Published: (2024)
TransTARec: Time-Adaptive Translating Embedding Model for Next POI Recommendation
by: Sun, Yiping
Published: (2024)
by: Sun, Yiping
Published: (2024)
LexPath: A domain-oriented multi-path framework for legal article retrieval
by: Liu, Weixuan, et al.
Published: (2026)
by: Liu, Weixuan, et al.
Published: (2026)
Agentic Meta-Orchestrator for Multi-task Copilots
by: Zhu, Xiaofeng, et al.
Published: (2025)
by: Zhu, Xiaofeng, et al.
Published: (2025)
TransFace++: Rethinking the Face Recognition Paradigm with a Focus on Accuracy, Efficiency, and Security
by: Dan, Jun, et al.
Published: (2023)
by: Dan, Jun, et al.
Published: (2023)
Making of Trans Body: A Study of Trans Narratives
by: Parimala Kamatar
Published: (2017)
by: Parimala Kamatar
Published: (2017)
Delay-Oriented Distributed Scheduling with TransGNN
by: Wen, Boxuan, et al.
Published: (2025)
by: Wen, Boxuan, et al.
Published: (2025)
Train Faster, Perform Better: Modular Adaptive Training in Over-Parameterized Models
by: Shi, Yubin, et al.
Published: (2024)
by: Shi, Yubin, et al.
Published: (2024)
TransPCA for Large-dimensional Factor Analysis with Weak Factors: Power Enhancement via Knowledge Transfer
by: He, Yong, et al.
Published: (2025)
by: He, Yong, et al.
Published: (2025)
Rethinking RL Scaling for Vision Language Models: A Transparent, From-Scratch Framework and Comprehensive Evaluation Scheme
by: Ma, Yan, et al.
Published: (2025)
by: Ma, Yan, et al.
Published: (2025)
Improving the spatial resolution and signal‐to‐noise ratio of ultrasound switchable fluorescence imaging
by: Shuai Yu, et al.
Published: (2024)
by: Shuai Yu, et al.
Published: (2024)
TranScript
Published: (2024)
Published: (2024)
TransNav
Published: (2026)
Published: (2026)
Similar Items
-
Various Lengths, Constant Speed: Efficient Language Modeling with Lightning Attention
by: Qin, Zhen, et al.
Published: (2024) -
Lightning Attention-2: A Free Lunch for Handling Unlimited Sequence Lengths in Large Language Models
by: Qin, Zhen, et al.
Published: (2024) -
HGRN2: Gated Linear RNNs with State Expansion
by: Qin, Zhen, et al.
Published: (2024) -
CO2: Efficient Distributed Training with Full Communication-Computation Overlap
by: Sun, Weigao, et al.
Published: (2024) -
FredNormer: Frequency Domain Normalization for Non-stationary Time Series Forecasting
by: Piao, Xihao, et al.
Published: (2024)