Salvato in:
| Autori principali: | Wang, Ya, Zhuo, Zhijian, Zeng, Yutao, Zhou, Xun, Yang, Jian, Li, Xiaoqing |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2502.15499 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Polynomial Composition Activations: Unleashing the Dynamics of Large Language Models
di: Zhuo, Zhijian, et al.
Pubblicazione: (2024)
di: Zhuo, Zhijian, et al.
Pubblicazione: (2024)
HybridNorm: Towards Stable and Efficient Transformer Training via Hybrid Normalization
di: Zhuo, Zhijian, et al.
Pubblicazione: (2025)
di: Zhuo, Zhijian, et al.
Pubblicazione: (2025)
Efficient Pretraining Length Scaling
di: Wu, Bohong, et al.
Pubblicazione: (2025)
di: Wu, Bohong, et al.
Pubblicazione: (2025)
Over-Tokenized Transformer: Vocabulary is Generally Worth Scaling
di: Huang, Hongzhi, et al.
Pubblicazione: (2025)
di: Huang, Hongzhi, et al.
Pubblicazione: (2025)
Decoupling Safety into Orthogonal Subspace: Cost-Efficient and Performance-Preserving Alignment for Large Language Models
di: Mou, Yutao, et al.
Pubblicazione: (2025)
di: Mou, Yutao, et al.
Pubblicazione: (2025)
Scaling Law for Quantization-Aware Training
di: Chen, Mengzhao, et al.
Pubblicazione: (2025)
di: Chen, Mengzhao, et al.
Pubblicazione: (2025)
DemoRank: Selecting Effective Demonstrations for Large Language Models in Ranking Task
di: Liu, Wenhan, et al.
Pubblicazione: (2024)
di: Liu, Wenhan, et al.
Pubblicazione: (2024)
StableToolBench: Towards Stable Large-Scale Benchmarking on Tool Learning of Large Language Models
di: Guo, Zhicheng, et al.
Pubblicazione: (2024)
di: Guo, Zhicheng, et al.
Pubblicazione: (2024)
Tokenization, Fusion and Decoupling: Bridging the Granularity Mismatch Between Large Language Models and Knowledge Graphs
di: Su, Siyue, et al.
Pubblicazione: (2026)
di: Su, Siyue, et al.
Pubblicazione: (2026)
On the Effectiveness of Incremental Training of Large Language Models
di: Li, Miles Q., et al.
Pubblicazione: (2024)
di: Li, Miles Q., et al.
Pubblicazione: (2024)
TAIA: Large Language Models are Out-of-Distribution Data Learners
di: Jiang, Shuyang, et al.
Pubblicazione: (2024)
di: Jiang, Shuyang, et al.
Pubblicazione: (2024)
Training-Free Long-Context Scaling of Large Language Models
di: An, Chenxin, et al.
Pubblicazione: (2024)
di: An, Chenxin, et al.
Pubblicazione: (2024)
Discovering Decoupled Functional Modules in Large Language Models
di: Yu, Yanke, et al.
Pubblicazione: (2026)
di: Yu, Yanke, et al.
Pubblicazione: (2026)
pQuant: Towards Effective Low-Bit Language Models via Decoupled Linear Quantization-Aware Training
di: Zhang, Wenzheng, et al.
Pubblicazione: (2026)
di: Zhang, Wenzheng, et al.
Pubblicazione: (2026)
Mid-Training of Large Language Models: A Survey
di: Mo, Kaixiang, et al.
Pubblicazione: (2025)
di: Mo, Kaixiang, et al.
Pubblicazione: (2025)
SimpleVQA: Multimodal Factuality Evaluation for Multimodal Large Language Models
di: Cheng, Xianfu, et al.
Pubblicazione: (2025)
di: Cheng, Xianfu, et al.
Pubblicazione: (2025)
SEAP: Training-free Sparse Expert Activation Pruning Unlock the Brainpower of Large Language Models
di: Liang, Xun, et al.
Pubblicazione: (2025)
di: Liang, Xun, et al.
Pubblicazione: (2025)
On the (In)Effectiveness of Large Language Models for Chinese Text Correction
di: Li, Yinghui, et al.
Pubblicazione: (2023)
di: Li, Yinghui, et al.
Pubblicazione: (2023)
CodeSimpleQA: Scaling Factuality in Code Large Language Models
di: Yang, Jian, et al.
Pubblicazione: (2025)
di: Yang, Jian, et al.
Pubblicazione: (2025)
UniCoder: Scaling Code Large Language Model via Universal Code
di: Sun, Tao, et al.
Pubblicazione: (2024)
di: Sun, Tao, et al.
Pubblicazione: (2024)
Hybrid Alignment Training for Large Language Models
di: Wang, Chenglong, et al.
Pubblicazione: (2024)
di: Wang, Chenglong, et al.
Pubblicazione: (2024)
Decouple Searching from Training: Scaling Data Mixing via Model Merging for Large Language Model Pre-training
di: Li, Shengrui, et al.
Pubblicazione: (2026)
di: Li, Shengrui, et al.
Pubblicazione: (2026)
MindVL: Towards Efficient and Effective Training of Multimodal Large Language Models on Ascend NPUs
di: Chen, Feilong, et al.
Pubblicazione: (2025)
di: Chen, Feilong, et al.
Pubblicazione: (2025)
Two Directions for Clinical Data Generation with Large Language Models: Data-to-Label and Label-to-Data
di: Li, Rumeng, et al.
Pubblicazione: (2023)
di: Li, Rumeng, et al.
Pubblicazione: (2023)
Learning Dynamics in Continual Pre-Training for Large Language Models
di: Wang, Xingjin, et al.
Pubblicazione: (2025)
di: Wang, Xingjin, et al.
Pubblicazione: (2025)
Scaling Laws for Post Training Quantized Large Language Models
di: Xu, Zifei, et al.
Pubblicazione: (2024)
di: Xu, Zifei, et al.
Pubblicazione: (2024)
Breaking Training Bottlenecks: Effective and Stable Reinforcement Learning for Coding Models
di: Li, Zongqian, et al.
Pubblicazione: (2026)
di: Li, Zongqian, et al.
Pubblicazione: (2026)
Self-Improvement Programming for Temporal Knowledge Graph Question Answering
di: Chen, Zhuo, et al.
Pubblicazione: (2024)
di: Chen, Zhuo, et al.
Pubblicazione: (2024)
From Pixels to Tokens: Revisiting Object Hallucinations in Large Vision-Language Models
di: Shang, Yuying, et al.
Pubblicazione: (2024)
di: Shang, Yuying, et al.
Pubblicazione: (2024)
HelloBench: Evaluating Long Text Generation Capabilities of Large Language Models
di: Que, Haoran, et al.
Pubblicazione: (2024)
di: Que, Haoran, et al.
Pubblicazione: (2024)
What Affects the Effective Depth of Large Language Models?
di: Hu, Yi, et al.
Pubblicazione: (2025)
di: Hu, Yi, et al.
Pubblicazione: (2025)
A Simple yet Effective Training-free Prompt-free Approach to Chinese Spelling Correction Based on Large Language Models
di: Zhou, Houquan, et al.
Pubblicazione: (2024)
di: Zhou, Houquan, et al.
Pubblicazione: (2024)
XPERT: Expert Knowledge Transfer for Effective Training of Language Models
di: Liu, Chang, et al.
Pubblicazione: (2026)
di: Liu, Chang, et al.
Pubblicazione: (2026)
GeneSUM: Large Language Model-based Gene Summary Extraction
di: Chen, Zhijian, et al.
Pubblicazione: (2024)
di: Chen, Zhijian, et al.
Pubblicazione: (2024)
CliMedBench: A Large-Scale Chinese Benchmark for Evaluating Medical Large Language Models in Clinical Scenarios
di: Ouyang, Zetian, et al.
Pubblicazione: (2024)
di: Ouyang, Zetian, et al.
Pubblicazione: (2024)
Evaluating the Factuality of Large Language Models using Large-Scale Knowledge Graphs
di: Liu, Xiaoze, et al.
Pubblicazione: (2024)
di: Liu, Xiaoze, et al.
Pubblicazione: (2024)
Investigating and Scaling up Code-Switching for Multilingual Language Model Pre-Training
di: Wang, Zhijun, et al.
Pubblicazione: (2025)
di: Wang, Zhijun, et al.
Pubblicazione: (2025)
SEPTQ: A Simple and Effective Post-Training Quantization Paradigm for Large Language Models
di: Liu, Han, et al.
Pubblicazione: (2026)
di: Liu, Han, et al.
Pubblicazione: (2026)
Multi-Bit Distortion-Free Watermarking for Large Language Models
di: Boroujeny, Massieh Kordi, et al.
Pubblicazione: (2024)
di: Boroujeny, Massieh Kordi, et al.
Pubblicazione: (2024)
Efficient Attention Mechanisms for Large Language Models: A Survey
di: Sun, Yutao, et al.
Pubblicazione: (2025)
di: Sun, Yutao, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Polynomial Composition Activations: Unleashing the Dynamics of Large Language Models
di: Zhuo, Zhijian, et al.
Pubblicazione: (2024) -
HybridNorm: Towards Stable and Efficient Transformer Training via Hybrid Normalization
di: Zhuo, Zhijian, et al.
Pubblicazione: (2025) -
Efficient Pretraining Length Scaling
di: Wu, Bohong, et al.
Pubblicazione: (2025) -
Over-Tokenized Transformer: Vocabulary is Generally Worth Scaling
di: Huang, Hongzhi, et al.
Pubblicazione: (2025) -
Decoupling Safety into Orthogonal Subspace: Cost-Efficient and Performance-Preserving Alignment for Large Language Models
di: Mou, Yutao, et al.
Pubblicazione: (2025)