Salvato in:
| Autori principali: | Wu, Bohong, Yan, Shen, Zhang, Sijun, Lu, Jianqiao, Zeng, Yutao, Wang, Ya, Zhou, Xun |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2504.14992 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
HybridNorm: Towards Stable and Efficient Transformer Training via Hybrid Normalization
di: Zhuo, Zhijian, et al.
Pubblicazione: (2025)
di: Zhuo, Zhijian, et al.
Pubblicazione: (2025)
Scale-Distribution Decoupling: Enabling Stable and Effective Training of Large Language Models
di: Wang, Ya, et al.
Pubblicazione: (2025)
di: Wang, Ya, et al.
Pubblicazione: (2025)
Over-Tokenized Transformer: Vocabulary is Generally Worth Scaling
di: Huang, Hongzhi, et al.
Pubblicazione: (2025)
di: Huang, Hongzhi, et al.
Pubblicazione: (2025)
Parallel Loop Transformer for Efficient Test-Time Computation Scaling
di: Wu, Bohong, et al.
Pubblicazione: (2025)
di: Wu, Bohong, et al.
Pubblicazione: (2025)
FlexPrefill: A Context-Aware Sparse Attention Mechanism for Efficient Long-Sequence Inference
di: Lai, Xunhao, et al.
Pubblicazione: (2025)
di: Lai, Xunhao, et al.
Pubblicazione: (2025)
Polynomial Composition Activations: Unleashing the Dynamics of Large Language Models
di: Zhuo, Zhijian, et al.
Pubblicazione: (2024)
di: Zhuo, Zhijian, et al.
Pubblicazione: (2024)
HRM-Text: Efficient Pretraining Beyond Scaling
di: Wang, Guan, et al.
Pubblicazione: (2026)
di: Wang, Guan, et al.
Pubblicazione: (2026)
Seeing the Image: Prioritizing Visual Correlation by Contrastive Alignment
di: Xiao, Xin, et al.
Pubblicazione: (2024)
di: Xiao, Xin, et al.
Pubblicazione: (2024)
Megalodon: Efficient LLM Pretraining and Inference with Unlimited Context Length
di: Ma, Xuezhe, et al.
Pubblicazione: (2024)
di: Ma, Xuezhe, et al.
Pubblicazione: (2024)
Length Value Model: Scalable Value Pretraining for Token-Level Length Modeling
di: Zhang, Zhen, et al.
Pubblicazione: (2026)
di: Zhang, Zhen, et al.
Pubblicazione: (2026)
Scaling Law for Quantization-Aware Training
di: Chen, Mengzhao, et al.
Pubblicazione: (2025)
di: Chen, Mengzhao, et al.
Pubblicazione: (2025)
Universal YOCO for Efficient Depth Scaling
di: Sun, Yutao, et al.
Pubblicazione: (2026)
di: Sun, Yutao, et al.
Pubblicazione: (2026)
Clustering Algorithms and RAG Enhancing Semi-Supervised Text Classification with Large LLMs
di: Zhong, Shan, et al.
Pubblicazione: (2024)
di: Zhong, Shan, et al.
Pubblicazione: (2024)
MachineLearningLM: Scaling Many-shot In-context Learning via Continued Pretraining
di: Dong, Haoyu, et al.
Pubblicazione: (2025)
di: Dong, Haoyu, et al.
Pubblicazione: (2025)
Anti-Length Shift: Dynamic Outlier Truncation for Training Efficient Reasoning Models
di: Wu, Wei, et al.
Pubblicazione: (2026)
di: Wu, Wei, et al.
Pubblicazione: (2026)
Frac-Connections: Fractional Extension of Hyper-Connections
di: Zhu, Defa, et al.
Pubblicazione: (2025)
di: Zhu, Defa, et al.
Pubblicazione: (2025)
Scaling Laws For Mixed Quantization
di: Cao, Zeyu, et al.
Pubblicazione: (2024)
di: Cao, Zeyu, et al.
Pubblicazione: (2024)
Hyper-Connections
di: Zhu, Defa, et al.
Pubblicazione: (2024)
di: Zhu, Defa, et al.
Pubblicazione: (2024)
An Integrated Data Processing Framework for Pretraining Foundation Models
di: Sun, Yiding, et al.
Pubblicazione: (2024)
di: Sun, Yiding, et al.
Pubblicazione: (2024)
PhenoLIP: Integrating Phenotype Ontology Knowledge into Medical Vision-Language Pretraining
di: Liang, Cheng, et al.
Pubblicazione: (2026)
di: Liang, Cheng, et al.
Pubblicazione: (2026)
QuaDMix: Quality-Diversity Balanced Data Selection for Efficient LLM Pretraining
di: Liu, Fengze, et al.
Pubblicazione: (2025)
di: Liu, Fengze, et al.
Pubblicazione: (2025)
Accurate Scene Text Recognition with Efficient Model Scaling and Cloze Self-Distillation
di: Maracani, Andrea, et al.
Pubblicazione: (2025)
di: Maracani, Andrea, et al.
Pubblicazione: (2025)
Budget-aware Test-time Scaling via Discriminative Verification
di: Montgomery, Kyle, et al.
Pubblicazione: (2025)
di: Montgomery, Kyle, et al.
Pubblicazione: (2025)
Decoupling Safety into Orthogonal Subspace: Cost-Efficient and Performance-Preserving Alignment for Large Language Models
di: Mou, Yutao, et al.
Pubblicazione: (2025)
di: Mou, Yutao, et al.
Pubblicazione: (2025)
Language Models and Cycle Consistency for Self-Reflective Machine Translation
di: Wangni, Jianqiao
Pubblicazione: (2024)
di: Wangni, Jianqiao
Pubblicazione: (2024)
LongSkywork: A Training Recipe for Efficiently Extending Context Length in Large Language Models
di: Zhao, Liang, et al.
Pubblicazione: (2024)
di: Zhao, Liang, et al.
Pubblicazione: (2024)
BIDER: Bridging Knowledge Inconsistency for Efficient Retrieval-Augmented LLMs via Key Supporting Evidence
di: Jin, Jiajie, et al.
Pubblicazione: (2024)
di: Jin, Jiajie, et al.
Pubblicazione: (2024)
WRAP++: Web discoveRy Amplified Pretraining
di: Zhou, Jiang, et al.
Pubblicazione: (2026)
di: Zhou, Jiang, et al.
Pubblicazione: (2026)
Beyond Transcription: Unified Audio Schema for Perception-Aware AudioLLMs
di: Zhang, Linhao, et al.
Pubblicazione: (2026)
di: Zhang, Linhao, et al.
Pubblicazione: (2026)
AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection
di: Hua, Kai, et al.
Pubblicazione: (2025)
di: Hua, Kai, et al.
Pubblicazione: (2025)
LAPO: Internalizing Reasoning Efficiency via Length-Adaptive Policy Optimization
di: Wu, Xingyu, et al.
Pubblicazione: (2025)
di: Wu, Xingyu, et al.
Pubblicazione: (2025)
UNComp: Can Matrix Entropy Uncover Sparsity? -- A Compressor Design from an Uncertainty-Aware Perspective
di: Xiong, Jing, et al.
Pubblicazione: (2024)
di: Xiong, Jing, et al.
Pubblicazione: (2024)
Reformulation for Pretraining Data Augmentation
di: Hao, Xintong, et al.
Pubblicazione: (2025)
di: Hao, Xintong, et al.
Pubblicazione: (2025)
SimReg: Achieving Higher Performance in the Pretraining via Embedding Similarity Regularization
di: Sun, Yan, et al.
Pubblicazione: (2026)
di: Sun, Yan, et al.
Pubblicazione: (2026)
Length Generalization of Causal Transformers without Position Encoding
di: Wang, Jie, et al.
Pubblicazione: (2024)
di: Wang, Jie, et al.
Pubblicazione: (2024)
Flora: Effortless Context Construction to Arbitrary Length and Scale
di: Chen, Tianxiang, et al.
Pubblicazione: (2025)
di: Chen, Tianxiang, et al.
Pubblicazione: (2025)
Beyond Length: Quantifying Long-Range Information for Long-Context LLM Pretraining Data
di: Deng, Haoran, et al.
Pubblicazione: (2025)
di: Deng, Haoran, et al.
Pubblicazione: (2025)
WeDLM: Reconciling Diffusion Language Models with Standard Causal Attention for Fast Inference
di: Liu, Aiwei, et al.
Pubblicazione: (2025)
di: Liu, Aiwei, et al.
Pubblicazione: (2025)
Maximum Score Routing For Mixture-of-Experts
di: Dong, Bowen, et al.
Pubblicazione: (2025)
di: Dong, Bowen, et al.
Pubblicazione: (2025)
DCIS: Efficient Length Extrapolation of LLMs via Divide-and-Conquer Scaling Factor Search
di: Yang, Lei, et al.
Pubblicazione: (2024)
di: Yang, Lei, et al.
Pubblicazione: (2024)
Documenti analoghi
-
HybridNorm: Towards Stable and Efficient Transformer Training via Hybrid Normalization
di: Zhuo, Zhijian, et al.
Pubblicazione: (2025) -
Scale-Distribution Decoupling: Enabling Stable and Effective Training of Large Language Models
di: Wang, Ya, et al.
Pubblicazione: (2025) -
Over-Tokenized Transformer: Vocabulary is Generally Worth Scaling
di: Huang, Hongzhi, et al.
Pubblicazione: (2025) -
Parallel Loop Transformer for Efficient Test-Time Computation Scaling
di: Wu, Bohong, et al.
Pubblicazione: (2025) -
FlexPrefill: A Context-Aware Sparse Attention Mechanism for Efficient Long-Sequence Inference
di: Lai, Xunhao, et al.
Pubblicazione: (2025)