Temporal Scaling Law for Large Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Xiong, Yizhe, Chen, Xiansheng, Ye, Xin, Chen, Hui, Lin, Zijia, Lian, Haoran, Su, Zhenpeng, Huang, Wei, Niu, Jianwei, Han, Jungong, Ding, Guiguang |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Scaffold-BPE: Enhancing Byte Pair Encoding for Large Language Models with Simple and Effective Scaffold Token Removal
von: Lian, Haoran, et al.
Veröffentlicht: (2024)
von: Lian, Haoran, et al.
Veröffentlicht: (2024)
UniAttn: Reducing Inference Costs via Softmax Unification for Post-Training LLMs
von: Xiong, Yizhe, et al.
Veröffentlicht: (2025)
von: Xiong, Yizhe, et al.
Veröffentlicht: (2025)
LBPE: Long-token-first Tokenization to Improve Large Language Models
von: Lian, Haoran, et al.
Veröffentlicht: (2024)
von: Lian, Haoran, et al.
Veröffentlicht: (2024)
LSNet: See Large, Focus Small
von: Wang, Ao, et al.
Veröffentlicht: (2025)
von: Wang, Ao, et al.
Veröffentlicht: (2025)
Breaking the Stage Barrier: A Novel Single-Stage Approach to Long Context Extension for Large Language Models
von: Lian, Haoran, et al.
Veröffentlicht: (2024)
von: Lian, Haoran, et al.
Veröffentlicht: (2024)
RepViT-SAM: Towards Real-Time Segmenting Anything
von: Wang, Ao, et al.
Veröffentlicht: (2023)
von: Wang, Ao, et al.
Veröffentlicht: (2023)
RepViT: Revisiting Mobile CNN From ViT Perspective
von: Wang, Ao, et al.
Veröffentlicht: (2023)
von: Wang, Ao, et al.
Veröffentlicht: (2023)
Advancing Reliable Test-Time Adaptation of Vision-Language Models under Visual Variations
von: Liang, Yiwen, et al.
Veröffentlicht: (2025)
von: Liang, Yiwen, et al.
Veröffentlicht: (2025)
Fast Quiet-STaR: Thinking Without Thought Tokens
von: Huang, Wei, et al.
Veröffentlicht: (2025)
von: Huang, Wei, et al.
Veröffentlicht: (2025)
MaskMoE: Boosting Token-Level Learning via Routing Mask in Mixture-of-Experts
von: Su, Zhenpeng, et al.
Veröffentlicht: (2024)
von: Su, Zhenpeng, et al.
Veröffentlicht: (2024)
CAIT: Triple-Win Compression towards High Accuracy, Fast Inference, and Favorable Transferability For ViTs
von: Wang, Ao, et al.
Veröffentlicht: (2023)
von: Wang, Ao, et al.
Veröffentlicht: (2023)
[CLS] Token Tells Everything Needed for Training-free Efficient MLLMs
von: Wang, Ao, et al.
Veröffentlicht: (2024)
von: Wang, Ao, et al.
Veröffentlicht: (2024)
YOLOE: Real-Time Seeing Anything
von: Wang, Ao, et al.
Veröffentlicht: (2025)
von: Wang, Ao, et al.
Veröffentlicht: (2025)
PYRA: Parallel Yielding Re-Activation for Training-Inference Efficient Task Adaptation
von: Xiong, Yizhe, et al.
Veröffentlicht: (2024)
von: Xiong, Yizhe, et al.
Veröffentlicht: (2024)
Neutralizing Token Aggregation via Information Augmentation for Efficient Test-Time Adaptation
von: Xiong, Yizhe, et al.
Veröffentlicht: (2025)
von: Xiong, Yizhe, et al.
Veröffentlicht: (2025)
CartesianMoE: Boosting Knowledge Sharing among Experts via Cartesian Product Routing in Mixture-of-Experts
von: Su, Zhenpeng, et al.
Veröffentlicht: (2024)
von: Su, Zhenpeng, et al.
Veröffentlicht: (2024)
Finedeep: Mitigating Sparse Activation in Dense LLMs via Multi-Layer Fine-Grained Experts
von: Pan, Leiyu, et al.
Veröffentlicht: (2025)
von: Pan, Leiyu, et al.
Veröffentlicht: (2025)
MiLe Loss: a New Entropy-Weighed Loss for Mitigating the Bias of Learning Difficulties in Large Language Models
von: Su, Zhenpeng, et al.
Veröffentlicht: (2023)
von: Su, Zhenpeng, et al.
Veröffentlicht: (2023)
DSMoE: Matrix-Partitioned Experts with Dynamic Routing for Computation-Efficient Dense LLMs
von: Lv, Minxuan, et al.
Veröffentlicht: (2025)
von: Lv, Minxuan, et al.
Veröffentlicht: (2025)
YOLOv10: Real-Time End-to-End Object Detection
von: Wang, Ao, et al.
Veröffentlicht: (2024)
von: Wang, Ao, et al.
Veröffentlicht: (2024)
Learn from the Learnt: Source-Free Active Domain Adaptation via Contrastive Sampling and Visual Persistence
von: Lyu, Mengyao, et al.
Veröffentlicht: (2024)
von: Lyu, Mengyao, et al.
Veröffentlicht: (2024)
AdaTP: Attention-Debiased Token Pruning for Video Large Language Models
von: Sun, Fengyuan, et al.
Veröffentlicht: (2025)
von: Sun, Fengyuan, et al.
Veröffentlicht: (2025)
Context Enhancement with Reconstruction as Sequence for Unified Unsupervised Anomaly Detection
von: Yang, Hui-Yue, et al.
Veröffentlicht: (2024)
von: Yang, Hui-Yue, et al.
Veröffentlicht: (2024)
PrefixKV: Adaptive Prefix KV Cache is What Vision Instruction-Following Models Need for Efficient Generation
von: Wang, Ao, et al.
Veröffentlicht: (2024)
von: Wang, Ao, et al.
Veröffentlicht: (2024)
Towards Efficient Vision-Language Tuning: More Information Density, More Generalizability
von: Hao, Tianxiang, et al.
Veröffentlicht: (2023)
von: Hao, Tianxiang, et al.
Veröffentlicht: (2023)
PruneHal: Reducing Hallucinations in Multi-modal Large Language Models through Adaptive KV Cache Pruning
von: Sun, Fengyuan, et al.
Veröffentlicht: (2025)
von: Sun, Fengyuan, et al.
Veröffentlicht: (2025)
Promptable Anomaly Segmentation with SAM Through Self-Perception Tuning
von: Yang, Hui-Yue, et al.
Veröffentlicht: (2024)
von: Yang, Hui-Yue, et al.
Veröffentlicht: (2024)
Tracking and Segmenting Anything in Any Modality
von: Zhang, Tianlu, et al.
Veröffentlicht: (2025)
von: Zhang, Tianlu, et al.
Veröffentlicht: (2025)
YOLO-UniOW: Efficient Universal Open-World Object Detection
von: Liu, Lihao, et al.
Veröffentlicht: (2024)
von: Liu, Lihao, et al.
Veröffentlicht: (2024)
LLMI3D: MLLM-based 3D Perception from a Single 2D Image
von: Yang, Fan, et al.
Veröffentlicht: (2024)
von: Yang, Fan, et al.
Veröffentlicht: (2024)
Cream of the Crop: Harvesting Rich, Scalable and Transferable Multi-Modal Data for Instruction Fine-Tuning
von: Lyu, Mengyao, et al.
Veröffentlicht: (2025)
von: Lyu, Mengyao, et al.
Veröffentlicht: (2025)
One-Dimensional Adapter to Rule Them All: Concepts, Diffusion Models and Erasing Applications
von: Lyu, Mengyao, et al.
Veröffentlicht: (2023)
von: Lyu, Mengyao, et al.
Veröffentlicht: (2023)
Point Linguist Model: Segment Any Object via Bridged Large 3D-Language Model
von: Huang, Zhuoxu, et al.
Veröffentlicht: (2025)
von: Huang, Zhuoxu, et al.
Veröffentlicht: (2025)
QuoVLA: Quotient Space for Vision-Language-Action Models
von: Wang, Xuan, et al.
Veröffentlicht: (2026)
von: Wang, Xuan, et al.
Veröffentlicht: (2026)
Quantized Prompt for Efficient Generalization of Vision-Language Models
von: Hao, Tianxiang, et al.
Veröffentlicht: (2024)
von: Hao, Tianxiang, et al.
Veröffentlicht: (2024)
DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval
von: Shen, Leqi, et al.
Veröffentlicht: (2025)
von: Shen, Leqi, et al.
Veröffentlicht: (2025)
More is Better: Deep Domain Adaptation with Multiple Sources
von: Zhao, Sicheng, et al.
Veröffentlicht: (2024)
von: Zhao, Sicheng, et al.
Veröffentlicht: (2024)
Selecting Large Language Model to Fine-tune via Rectified Scaling Law
von: Lin, Haowei, et al.
Veröffentlicht: (2024)
von: Lin, Haowei, et al.
Veröffentlicht: (2024)
Scaling Laws for Fact Memorization of Large Language Models
von: Lu, Xingyu, et al.
Veröffentlicht: (2024)
von: Lu, Xingyu, et al.
Veröffentlicht: (2024)
Mostly Text, Smart Visuals: Asymmetric Text-Visual Pruning for Large Vision-Language Models
von: Li, Sijie, et al.
Veröffentlicht: (2026)
von: Li, Sijie, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
Scaffold-BPE: Enhancing Byte Pair Encoding for Large Language Models with Simple and Effective Scaffold Token Removal
von: Lian, Haoran, et al.
Veröffentlicht: (2024) -
UniAttn: Reducing Inference Costs via Softmax Unification for Post-Training LLMs
von: Xiong, Yizhe, et al.
Veröffentlicht: (2025) -
LBPE: Long-token-first Tokenization to Improve Large Language Models
von: Lian, Haoran, et al.
Veröffentlicht: (2024) -
LSNet: See Large, Focus Small
von: Wang, Ao, et al.
Veröffentlicht: (2025) -
Breaking the Stage Barrier: A Novel Single-Stage Approach to Long Context Extension for Large Language Models
von: Lian, Haoran, et al.
Veröffentlicht: (2024)