Scaling Probabilistic Transformer via Efficient Cross-Scale Hyperparameter Transfer
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Kuang, Penghao, Wu, Haoyi, Tu, Kewei |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
A Systematic Study of Cross-Layer KV Sharing for Efficient LLM Inference
par: Wu, You, et autres
Publié: (2024)
par: Wu, You, et autres
Publié: (2024)
Layer-Condensed KV Cache for Efficient Inference of Large Language Models
par: Wu, Haoyi, et autres
Publié: (2024)
par: Wu, Haoyi, et autres
Publié: (2024)
Parallel Continuous Chain-of-Thought with Jacobi Iteration
par: Wu, Haoyi, et autres
Publié: (2025)
par: Wu, Haoyi, et autres
Publié: (2025)
Generative Pretrained Structured Transformers: Unsupervised Syntactic Language Models at Scale
par: Hu, Xiang, et autres
Publié: (2024)
par: Hu, Xiang, et autres
Publié: (2024)
YOCO++: Enhancing YOCO with KV Residual Connections for Efficient LLM Inference
par: Wu, You, et autres
Publié: (2026)
par: Wu, You, et autres
Publié: (2026)
GRKV: Global Regression for Training-Free KV Cache Compression in Long-Context LLMs
par: Peng, Junjie, et autres
Publié: (2026)
par: Peng, Junjie, et autres
Publié: (2026)
Dependency Transformer Grammars: Integrating Dependency Structures into Transformer Language Models
par: Zhao, Yida, et autres
Publié: (2024)
par: Zhao, Yida, et autres
Publié: (2024)
Sparser is Faster and Less is More: Efficient Sparse Attention for Long-Range Transformers
par: Lou, Chao, et autres
Publié: (2024)
par: Lou, Chao, et autres
Publié: (2024)
Augmenting Transformers with Recursively Composed Multi-grained Representations
par: Hu, Xiang, et autres
Publié: (2023)
par: Hu, Xiang, et autres
Publié: (2023)
Efficient Length-Generalizable Attention via Causal Retrieval for Long-Context Language Modeling
par: Hu, Xiang, et autres
Publié: (2024)
par: Hu, Xiang, et autres
Publié: (2024)
GiLT: Augmenting Transformer Language Models with Dependency Graphs
par: Huang, Tianyu, et autres
Publié: (2026)
par: Huang, Tianyu, et autres
Publié: (2026)
RoT: Enhancing Large Language Models with Reflection on Search Trees
par: Hui, Wenyang, et autres
Publié: (2024)
par: Hui, Wenyang, et autres
Publié: (2024)
A Systematic Study of Compositional Syntactic Transformer Language Models
par: Zhao, Yida, et autres
Publié: (2025)
par: Zhao, Yida, et autres
Publié: (2025)
Efficient Scaling of Diffusion Transformers for Text-to-Image Generation
par: Li, Hao, et autres
Publié: (2024)
par: Li, Hao, et autres
Publié: (2024)
Hardware-aligned Hierarchical Sparse Attention for Efficient Long-term Memory Access
par: Hu, Xiang, et autres
Publié: (2025)
par: Hu, Xiang, et autres
Publié: (2025)
Parallel Loop Transformer for Efficient Test-Time Computation Scaling
par: Wu, Bohong, et autres
Publié: (2025)
par: Wu, Bohong, et autres
Publié: (2025)
Using Interpretation Methods for Model Enhancement
par: Chen, Zhuo, et autres
Publié: (2024)
par: Chen, Zhuo, et autres
Publié: (2024)
Optimal Aggregation of LLM and PRM Signals for Efficient Test-Time Scaling
par: Kuang, Peng, et autres
Publié: (2025)
par: Kuang, Peng, et autres
Publié: (2025)
Multilingual Test-Time Scaling via Initial Thought Transfer
par: Bajpai, Prasoon, et autres
Publié: (2025)
par: Bajpai, Prasoon, et autres
Publié: (2025)
OptScale: Probabilistic Optimality for Inference-time Scaling
par: Wang, Youkang, et autres
Publié: (2025)
par: Wang, Youkang, et autres
Publié: (2025)
Efficient Pretraining Length Scaling
par: Wu, Bohong, et autres
Publié: (2025)
par: Wu, Bohong, et autres
Publié: (2025)
A Probabilistic Inference Scaling Theory for LLM Self-Correction
par: Yang, Zhe, et autres
Publié: (2025)
par: Yang, Zhe, et autres
Publié: (2025)
Efficient Multimodal Planning Agent for Visual Question-Answering
par: Chen, Zhuo, et autres
Publié: (2026)
par: Chen, Zhuo, et autres
Publié: (2026)
LoPA: Scaling dLLM Inference via Lookahead Parallel Decoding
par: Xu, Chenkai, et autres
Publié: (2025)
par: Xu, Chenkai, et autres
Publié: (2025)
GUI-KV: Efficient GUI Agents via KV Cache with Spatio-Temporal Awareness
par: Huang, Kung-Hsiang, et autres
Publié: (2025)
par: Huang, Kung-Hsiang, et autres
Publié: (2025)
Inv-Entropy: A Fully Probabilistic Framework for Uncertainty Quantification in Language Models
par: Song, Haoyi, et autres
Publié: (2025)
par: Song, Haoyi, et autres
Publié: (2025)
Zero-Shot Performance Prediction for Probabilistic Scaling Laws
par: Schram, Viktoria, et autres
Publié: (2025)
par: Schram, Viktoria, et autres
Publié: (2025)
Efficiently Aligned Cross-Lingual Transfer Learning for Conversational Tasks using Prompt-Tuning
par: Tu, Lifu, et autres
Publié: (2023)
par: Tu, Lifu, et autres
Publié: (2023)
HRM-Text: Efficient Pretraining Beyond Scaling
par: Wang, Guan, et autres
Publié: (2026)
par: Wang, Guan, et autres
Publié: (2026)
Z1: Efficient Test-time Scaling with Code
par: Yu, Zhaojian, et autres
Publié: (2025)
par: Yu, Zhaojian, et autres
Publié: (2025)
Unsupervised Morphological Tree Tokenizer
par: Zhu, Qingyang, et autres
Publié: (2024)
par: Zhu, Qingyang, et autres
Publié: (2024)
Neural Incompatibility: The Unbridgeable Gap of Cross-Scale Parametric Knowledge Transfer in Large Language Models
par: Tan, Yuqiao, et autres
Publié: (2025)
par: Tan, Yuqiao, et autres
Publié: (2025)
What Scales in Cross-Entropy Scaling Law?
par: Yan, Junxi, et autres
Publié: (2025)
par: Yan, Junxi, et autres
Publié: (2025)
Exploring the Potential of Probabilistic Transformer for Time Series Modeling: A Report on the ST-PT Framework
par: Xiong, Zhangzhi, et autres
Publié: (2026)
par: Xiong, Zhangzhi, et autres
Publié: (2026)
Scaling Down to Scale Up: A Guide to Parameter-Efficient Fine-Tuning
par: Lialin, Vladislav, et autres
Publié: (2023)
par: Lialin, Vladislav, et autres
Publié: (2023)
Scaling Reasoning Efficiently via Relaxed On-Policy Distillation
par: Ko, Jongwoo, et autres
Publié: (2026)
par: Ko, Jongwoo, et autres
Publié: (2026)
Efficient Data Selection at Scale via Influence Distillation
par: Nikdan, Mahdi, et autres
Publié: (2025)
par: Nikdan, Mahdi, et autres
Publié: (2025)
Language Fusion for Parameter-Efficient Cross-lingual Transfer
par: Borchert, Philipp, et autres
Publié: (2025)
par: Borchert, Philipp, et autres
Publié: (2025)
DeepDiver: Adaptive Search Intensity Scaling via Open-Web Reinforcement Learning
par: Shi, Wenxuan, et autres
Publié: (2025)
par: Shi, Wenxuan, et autres
Publié: (2025)
Scaling Efficient LLMs
par: Kausik, B. N.
Publié: (2024)
par: Kausik, B. N.
Publié: (2024)
Documents similaires
-
A Systematic Study of Cross-Layer KV Sharing for Efficient LLM Inference
par: Wu, You, et autres
Publié: (2024) -
Layer-Condensed KV Cache for Efficient Inference of Large Language Models
par: Wu, Haoyi, et autres
Publié: (2024) -
Parallel Continuous Chain-of-Thought with Jacobi Iteration
par: Wu, Haoyi, et autres
Publié: (2025) -
Generative Pretrained Structured Transformers: Unsupervised Syntactic Language Models at Scale
par: Hu, Xiang, et autres
Publié: (2024) -
YOCO++: Enhancing YOCO with KV Residual Connections for Efficient LLM Inference
par: Wu, You, et autres
Publié: (2026)