Enregistré dans:
| Auteurs principaux: | Xiao, Chaojun, Zhang, Zhengyan, Song, Chenyang, Jiang, Dazhi, Yao, Feng, Han, Xu, Wang, Xiaozhi, Wang, Shuo, Huang, Yufei, Lin, Guanyu, Chen, Yingfa, Zhao, Weilin, Tu, Yuge, Zhong, Zexuan, Zhang, Ao, Si, Chenglei, Moo, Khai Hao, Zhao, Chenyang, Chen, Huimin, Lin, Yankai, Liu, Zhiyuan, Shang, Jingbo, Sun, Maosong |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2409.02877 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
BlockFFN: Towards End-Side Acceleration-Friendly Mixture-of-Experts with Chunk-Level Activation Sparsity
par: Song, Chenyang, et autres
Publié: (2025)
par: Song, Chenyang, et autres
Publié: (2025)
DECO: Sparse Mixture-of-Experts with Dense-Comparable Performance on End-Side Devices
par: Song, Chenyang, et autres
Publié: (2026)
par: Song, Chenyang, et autres
Publié: (2026)
ReLU$^2$ Wins: Discovering Efficient Activation Functions for Sparse LLMs
par: Zhang, Zhengyan, et autres
Publié: (2024)
par: Zhang, Zhengyan, et autres
Publié: (2024)
Robust and Scalable Model Editing for Large Language Models
par: Chen, Yingfa, et autres
Publié: (2024)
par: Chen, Yingfa, et autres
Publié: (2024)
InfLLM: Training-Free Long-Context Extrapolation for LLMs with an Efficient Context Memory
par: Xiao, Chaojun, et autres
Publié: (2024)
par: Xiao, Chaojun, et autres
Publié: (2024)
Sparsing Law: Towards Large Language Models with Greater Activation Sparsity
par: Luo, Yuqi, et autres
Publié: (2024)
par: Luo, Yuqi, et autres
Publié: (2024)
Exploring the Benefit of Activation Sparsity in Pre-training
par: Zhang, Zhengyan, et autres
Publié: (2024)
par: Zhang, Zhengyan, et autres
Publié: (2024)
Multi-Modal Multi-Granularity Tokenizer for Chu Bamboo Slip Scripts
par: Chen, Yingfa, et autres
Publié: (2024)
par: Chen, Yingfa, et autres
Publié: (2024)
Variator: Accelerating Pre-trained Models with Plug-and-Play Compression Modules
par: Xiao, Chaojun, et autres
Publié: (2023)
par: Xiao, Chaojun, et autres
Publié: (2023)
$\infty$Bench: Extending Long Context Evaluation Beyond 100K Tokens
par: Zhang, Xinrong, et autres
Publié: (2024)
par: Zhang, Xinrong, et autres
Publié: (2024)
Beyond the Turn-Based Game: Enabling Real-Time Conversations with Duplex Models
par: Zhang, Xinrong, et autres
Publié: (2024)
par: Zhang, Xinrong, et autres
Publié: (2024)
Cost-Optimal Grouped-Query Attention for Long-Context Modeling
par: Chen, Yingfa, et autres
Publié: (2025)
par: Chen, Yingfa, et autres
Publié: (2025)
H-Neurons: On the Existence, Impact, and Origin of Hallucination-Associated Neurons in LLMs
par: Gao, Cheng, et autres
Publié: (2025)
par: Gao, Cheng, et autres
Publié: (2025)
CA-LoRA: Adapting Existing LoRA for Compressed LLMs to Enable Efficient Multi-Tasking on Personal Devices
par: Zhao, Weilin, et autres
Publié: (2023)
par: Zhao, Weilin, et autres
Publié: (2023)
Representation Learning for Natural Language Processing
par: Liu, Zhiyuan, et autres
Publié: (2020)
par: Liu, Zhiyuan, et autres
Publié: (2020)
Student-in-the-Loop Chain-of-Thought Distillation via Generation-Time Selection
par: He, Chaoqun, et autres
Publié: (2026)
par: He, Chaoqun, et autres
Publié: (2026)
Enhancing Legal Case Retrieval via Scaling High-quality Synthetic Query-Candidate Pairs
par: Gao, Cheng, et autres
Publié: (2024)
par: Gao, Cheng, et autres
Publié: (2024)
Stuffed Mamba: Oversized States Lead to the Inability to Forget
par: Chen, Yingfa, et autres
Publié: (2024)
par: Chen, Yingfa, et autres
Publié: (2024)
Correlation and Navigation in the Vocabulary Key Representation Space of Language Models
par: Peng, Letian, et autres
Publié: (2024)
par: Peng, Letian, et autres
Publié: (2024)
APB: Accelerating Distributed Long-Context Inference by Passing Compressed Context Blocks across GPUs
par: Huang, Yuxiang, et autres
Publié: (2025)
par: Huang, Yuxiang, et autres
Publié: (2025)
Densing Law of LLMs
par: Xiao, Chaojun, et autres
Publié: (2024)
par: Xiao, Chaojun, et autres
Publié: (2024)
ProSparse: Introducing and Enhancing Intrinsic Activation Sparsity within Large Language Models
par: Song, Chenyang, et autres
Publié: (2024)
par: Song, Chenyang, et autres
Publié: (2024)
Ouroboros: Generating Longer Drafts Phrase by Phrase for Faster Speculative Decoding
par: Zhao, Weilin, et autres
Publié: (2024)
par: Zhao, Weilin, et autres
Publié: (2024)
Point-to-Region Loss for Semi-Supervised Point-Based Crowd Counting
par: Lin, Wei, et autres
Publié: (2025)
par: Lin, Wei, et autres
Publié: (2025)
Modular PE-Structured Learning for Cross-Task Wireless Communications
par: Duan, Yuxuan, et autres
Publié: (2025)
par: Duan, Yuxuan, et autres
Publié: (2025)
HiHPQ: Hierarchical Hyperbolic Product Quantization for Unsupervised Image Retrieval
par: Qiu, Zexuan, et autres
Publié: (2024)
par: Qiu, Zexuan, et autres
Publié: (2024)
Effects of cold joints on concrete mechanical properties and tunnel service performance
par: Chenyang Zhao, et autres
Publié: (2025)
par: Chenyang Zhao, et autres
Publié: (2025)
Gradient-Driven Graph Neural Networks for Learning Digital and Hybrid Precoder
par: Zhang, Lin, et autres
Publié: (2025)
par: Zhang, Lin, et autres
Publié: (2025)
Win in Chinese Courts
par: Zhang, Chenyang
Publié: (2023)
par: Zhang, Chenyang
Publié: (2023)
A Distributed Gradient-based Algorithm for Optimization Problems with Coupled Equality Constraints
par: Qiu, Chenyang, et autres
Publié: (2025)
par: Qiu, Chenyang, et autres
Publié: (2025)
Non-Ergodic Convergence Algorithms for Distributed Consensus and Coupling-Constrained Optimization
par: Qiu, Chenyang, et autres
Publié: (2025)
par: Qiu, Chenyang, et autres
Publié: (2025)
CFDBench: A Large-Scale Benchmark for Machine Learning Methods in Fluid Dynamics
par: Luo, Yining, et autres
Publié: (2023)
par: Luo, Yining, et autres
Publié: (2023)
Seq1F1B: Efficient Sequence-Level Pipeline Parallelism for Large Language Model Training
par: Sun, Ao, et autres
Publié: (2024)
par: Sun, Ao, et autres
Publié: (2024)
BurstAttention: An Efficient Distributed Attention Framework for Extremely Long Sequences
par: Sun, Ao, et autres
Publié: (2024)
par: Sun, Ao, et autres
Publié: (2024)
BurstEngine: an Efficient Distributed Framework for Training Transformers on Extremely Long Sequences of over 1M Tokens
par: Sun, Ao, et autres
Publié: (2025)
par: Sun, Ao, et autres
Publié: (2025)
Safety assessment of shield tunnels with initially mechanically damaged concrete in water‐rich strata
par: Chenyang Zhao, et autres
Publié: (2025)
par: Chenyang Zhao, et autres
Publié: (2025)
StateX: Enhancing RNN Recall via Post-training State Expansion
par: Shen, Xingyu, et autres
Publié: (2025)
par: Shen, Xingyu, et autres
Publié: (2025)
Can We Hear from Events? Generating Speech from Event Camera
par: Fang, Jingping, et autres
Publié: (2026)
par: Fang, Jingping, et autres
Publié: (2026)
KARL: Mitigating Hallucinations in LLMs via Knowledge-Boundary-Aware Reinforcement Learning
par: Gao, Cheng, et autres
Publié: (2026)
par: Gao, Cheng, et autres
Publié: (2026)
Predicting Emergent Abilities with Infinite Resolution Evaluation
par: Hu, Shengding, et autres
Publié: (2023)
par: Hu, Shengding, et autres
Publié: (2023)
Documents similaires
-
BlockFFN: Towards End-Side Acceleration-Friendly Mixture-of-Experts with Chunk-Level Activation Sparsity
par: Song, Chenyang, et autres
Publié: (2025) -
DECO: Sparse Mixture-of-Experts with Dense-Comparable Performance on End-Side Devices
par: Song, Chenyang, et autres
Publié: (2026) -
ReLU$^2$ Wins: Discovering Efficient Activation Functions for Sparse LLMs
par: Zhang, Zhengyan, et autres
Publié: (2024) -
Robust and Scalable Model Editing for Large Language Models
par: Chen, Yingfa, et autres
Publié: (2024) -
InfLLM: Training-Free Long-Context Extrapolation for LLMs with an Efficient Context Memory
par: Xiao, Chaojun, et autres
Publié: (2024)