Predictor-Corrector Enhanced Transformers with Exponential Moving Average Coefficient Learning
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Li, Bei, Zheng, Tong, Wang, Rui, Liu, Jiahao, Guo, Qingyan, Guo, Junliang, Tan, Xu, Xiao, Tong, Zhu, Jingbo, Wang, Jingang, Cai, Xunliang |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
EIT: Enhanced Interactive Transformer
von: Zheng, Tong, et al.
Veröffentlicht: (2022)
von: Zheng, Tong, et al.
Veröffentlicht: (2022)
IIET: Efficient Numerical Transformer via Implicit Iterative Euler Method
von: Liu, Xinyu, et al.
Veröffentlicht: (2025)
von: Liu, Xinyu, et al.
Veröffentlicht: (2025)
Speculative Decoding via Early-exiting for Faster LLM Inference with Thompson Sampling Control Mechanism
von: Liu, Jiahao, et al.
Veröffentlicht: (2024)
von: Liu, Jiahao, et al.
Veröffentlicht: (2024)
Mitigating Reversal Curse in Large Language Models via Semantic-aware Permutation Training
von: Guo, Qingyan, et al.
Veröffentlicht: (2024)
von: Guo, Qingyan, et al.
Veröffentlicht: (2024)
MTR-Suite: A Framework for Evaluating and Synthesizing Conversational Retrieval Benchmarks
von: Ruan, Junhao, et al.
Veröffentlicht: (2026)
von: Ruan, Junhao, et al.
Veröffentlicht: (2026)
EvoPrompt: Connecting LLMs with Evolutionary Algorithms Yields Powerful Prompt Optimizers
von: Guo, Qingyan, et al.
Veröffentlicht: (2023)
von: Guo, Qingyan, et al.
Veröffentlicht: (2023)
SpanNorm: Reconciling Training Stability and Performance in Deep Transformers
von: Wang, Chao, et al.
Veröffentlicht: (2026)
von: Wang, Chao, et al.
Veröffentlicht: (2026)
LANG: Reinforcement Learning for Multilingual Reasoning with Language-Adaptive Hint Guidance
von: Fan, Yuchun, et al.
Veröffentlicht: (2026)
von: Fan, Yuchun, et al.
Veröffentlicht: (2026)
ReMamba: Equip Mamba with Effective Long-Sequence Modeling
von: Yuan, Danlong, et al.
Veröffentlicht: (2024)
von: Yuan, Danlong, et al.
Veröffentlicht: (2024)
Forgetting Curve: A Reliable Method for Evaluating Memorization Capability for Long-context Models
von: Liu, Xinyu, et al.
Veröffentlicht: (2024)
von: Liu, Xinyu, et al.
Veröffentlicht: (2024)
What Makes Quantization for Large Language Models Hard? An Empirical Study from the Lens of Perturbation
von: Gong, Zhuocheng, et al.
Veröffentlicht: (2024)
von: Gong, Zhuocheng, et al.
Veröffentlicht: (2024)
Early Exit Is a Natural Capability in Transformer-based Models: An Empirical Study on Early Exit without Joint Optimization
von: Shan, Weiqiao, et al.
Veröffentlicht: (2024)
von: Shan, Weiqiao, et al.
Veröffentlicht: (2024)
Causal Autoregressive Diffusion Language Model
von: Ruan, Junhao, et al.
Veröffentlicht: (2026)
von: Ruan, Junhao, et al.
Veröffentlicht: (2026)
Monitoring the Coefficient of Variation Using a Synthetic Exponentially Weighted Moving Average Chart
von: Bryan Chek Hui Thien, et al.
Veröffentlicht: (2025)
von: Bryan Chek Hui Thien, et al.
Veröffentlicht: (2025)
PartialFormer: Modeling Part Instead of Whole for Machine Translation
von: Zheng, Tong, et al.
Veröffentlicht: (2023)
von: Zheng, Tong, et al.
Veröffentlicht: (2023)
Dynamic Fisher-weighted Model Merging via Bayesian Optimization
von: Lee, Sanwoo, et al.
Veröffentlicht: (2025)
von: Lee, Sanwoo, et al.
Veröffentlicht: (2025)
Libra: Assessing and Improving Reward Model by Learning to Think
von: Zhou, Meng, et al.
Veröffentlicht: (2025)
von: Zhou, Meng, et al.
Veröffentlicht: (2025)
Foundations of Large Language Models
von: Xiao, Tong, et al.
Veröffentlicht: (2025)
von: Xiao, Tong, et al.
Veröffentlicht: (2025)
Graph-Structured Speculative Decoding
von: Gong, Zhuocheng, et al.
Veröffentlicht: (2024)
von: Gong, Zhuocheng, et al.
Veröffentlicht: (2024)
Comparisons of Optimal Generally Weighted Moving Average and Exponentially Weighted Moving Average Charts
von: Steven E. Rigdon
Veröffentlicht: (2025)
von: Steven E. Rigdon
Veröffentlicht: (2025)
Break a Lag: Triple Exponential Moving Average for Enhanced Optimization
von: Peleg, Roi, et al.
Veröffentlicht: (2023)
von: Peleg, Roi, et al.
Veröffentlicht: (2023)
FedEMA: Federated Exponential Moving Averaging with Negative Entropy Regularizer in Autonomous Driving
von: Kou, Wei-Bin, et al.
Veröffentlicht: (2025)
von: Kou, Wei-Bin, et al.
Veröffentlicht: (2025)
Classifier-Free Guidance is a Predictor-Corrector
von: Bradley, Arwen, et al.
Veröffentlicht: (2024)
von: Bradley, Arwen, et al.
Veröffentlicht: (2024)
Parallel Decoding via Hidden Transfer for Lossless Large Language Model Acceleration
von: Wu, Pengfei, et al.
Veröffentlicht: (2024)
von: Wu, Pengfei, et al.
Veröffentlicht: (2024)
FIRP: Faster LLM inference via future intermediate representation prediction
von: Wu, Pengfei, et al.
Veröffentlicht: (2024)
von: Wu, Pengfei, et al.
Veröffentlicht: (2024)
TEAM-SimHRA: A Team-Based Simulation Framework for Human Reliability Analysis Using Multi-Agent Large Language Models
von: Xiao, Xingyu, et al.
Veröffentlicht: (2026)
von: Xiao, Xingyu, et al.
Veröffentlicht: (2026)
Exponential Moving Average of Weights in Deep Learning: Dynamics and Benefits
von: Morales-Brotons, Daniel, et al.
Veröffentlicht: (2024)
von: Morales-Brotons, Daniel, et al.
Veröffentlicht: (2024)
A Comprehensive Review of Human Error in Risk-Informed Decision Making: Integrating Human Reliability Assessment, Artificial Intelligence, and Human Performance Models
von: Xiao, Xingyu, et al.
Veröffentlicht: (2025)
von: Xiao, Xingyu, et al.
Veröffentlicht: (2025)
Earlier Tokens Contribute More: Learning Direct Preference Optimization From Temporal Decay Perspective
von: Shao, Ruichen, et al.
Veröffentlicht: (2025)
von: Shao, Ruichen, et al.
Veröffentlicht: (2025)
A Predictor‐Corrector Linearized High‐Order FEM for Nonlinear Time‐Fractional Parabolic Equations With Distributed Delay and Variable Coefficients
von: Ujwal Warbhe
Veröffentlicht: (2026)
von: Ujwal Warbhe
Veröffentlicht: (2026)
Rethinking the Sampling Criteria in Reinforcement Learning for LLM Reasoning: A Competence-Difficulty Alignment Perspective
von: Kong, Deyang, et al.
Veröffentlicht: (2025)
von: Kong, Deyang, et al.
Veröffentlicht: (2025)
DC-Solver: Improving Predictor-Corrector Diffusion Sampler via Dynamic Compensation
von: Zhao, Wenliang, et al.
Veröffentlicht: (2024)
von: Zhao, Wenliang, et al.
Veröffentlicht: (2024)
One Size Does Not Fit All: A Distribution-Aware Sparsification for More Precise Model Merging
von: Luo, Yingfeng, et al.
Veröffentlicht: (2025)
von: Luo, Yingfeng, et al.
Veröffentlicht: (2025)
The Prevalence of Misreporting and Misinterpreting Correlation Coefficients in Biomedical Literature
von: Xu, Jiayang, et al.
Veröffentlicht: (2025)
von: Xu, Jiayang, et al.
Veröffentlicht: (2025)
NeedleInATable: Exploring Long-Context Capability of Large Language Models towards Long-Structured Tables
von: Wang, Lanrui, et al.
Veröffentlicht: (2025)
von: Wang, Lanrui, et al.
Veröffentlicht: (2025)
DemaFormer: Damped Exponential Moving Average Transformer with Energy-Based Modeling for Temporal Language Grounding
von: Nguyen, Thong, et al.
Veröffentlicht: (2023)
von: Nguyen, Thong, et al.
Veröffentlicht: (2023)
Hybrid Explicit-Implicit Predictor-Corrector Exponential Time-Differencing Multistep Padé Schemes for Semilinear Parabolic Equations with Time-Delay
von: Dai, Haishen, et al.
Veröffentlicht: (2025)
von: Dai, Haishen, et al.
Veröffentlicht: (2025)
Higher-Dimensional Moving Averages and Submanifold Genericity
von: Cheng, Jiajun, et al.
Veröffentlicht: (2025)
von: Cheng, Jiajun, et al.
Veröffentlicht: (2025)
Ltri-LLM: Streaming Long Context Inference for LLMs with Training-Free Dynamic Triangular Attention Pattern
von: Tang, Hongyin, et al.
Veröffentlicht: (2024)
von: Tang, Hongyin, et al.
Veröffentlicht: (2024)
EMAG: Self-Rectifying Diffusion Sampling with Exponential Moving Average Guidance
von: Yadav, Ankit, et al.
Veröffentlicht: (2025)
von: Yadav, Ankit, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
EIT: Enhanced Interactive Transformer
von: Zheng, Tong, et al.
Veröffentlicht: (2022) -
IIET: Efficient Numerical Transformer via Implicit Iterative Euler Method
von: Liu, Xinyu, et al.
Veröffentlicht: (2025) -
Speculative Decoding via Early-exiting for Faster LLM Inference with Thompson Sampling Control Mechanism
von: Liu, Jiahao, et al.
Veröffentlicht: (2024) -
Mitigating Reversal Curse in Large Language Models via Semantic-aware Permutation Training
von: Guo, Qingyan, et al.
Veröffentlicht: (2024) -
MTR-Suite: A Framework for Evaluating and Synthesizing Conversational Retrieval Benchmarks
von: Ruan, Junhao, et al.
Veröffentlicht: (2026)