Understanding Transformer Architecture through Continuous Dynamics: A Partial Differential Equation Perspective
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Yukun, Zhou, Xueqing |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Continuous-Time Attention: PDE-Guided Mechanisms for Long-Sequence Transformers
par: Zhang, Yukun, et autres
Publié: (2025)
par: Zhang, Yukun, et autres
Publié: (2025)
Where to Add PDE Diffusion in Transformers
par: Zhang, Yukun, et autres
Publié: (2025)
par: Zhang, Yukun, et autres
Publié: (2025)
Partial Information Decomposition for Data Interpretability and Feature Selection
par: Westphal, Charles, et autres
Publié: (2024)
par: Westphal, Charles, et autres
Publié: (2024)
Broadcast Channel Cooperative Gain: An Operational Interpretation of Partial Information Decomposition
par: Tian, Chao, et autres
Publié: (2025)
par: Tian, Chao, et autres
Publié: (2025)
LLMs as Noisy Channels: A Shannon Perspective on Model Capacity and Scaling Laws
par: Ouyang, Xu, et autres
Publié: (2026)
par: Ouyang, Xu, et autres
Publié: (2026)
Continual Learning-Aided Super-Resolution Scheme for Channel Reconstruction and Generalization in OFDM Systems
par: Chen, Jianqiao, et autres
Publié: (2025)
par: Chen, Jianqiao, et autres
Publié: (2025)
A Deep Latent Factor Graph Clustering with Fairness-Utility Trade-off Perspective
par: Ghodsi, Siamak, et autres
Publié: (2025)
par: Ghodsi, Siamak, et autres
Publié: (2025)
Fairness Overfitting in Machine Learning: An Information-Theoretic Perspective
par: Laakom, Firas, et autres
Publié: (2025)
par: Laakom, Firas, et autres
Publié: (2025)
Accelerating Error Correction Code Transformers
par: Levy, Matan, et autres
Publié: (2024)
par: Levy, Matan, et autres
Publié: (2024)
Uncertainty Quantification and Data Efficiency in AI: An Information-Theoretic Perspective
par: Simeone, Osvaldo, et autres
Publié: (2025)
par: Simeone, Osvaldo, et autres
Publié: (2025)
Context Channel Capacity: An Information-Theoretic Framework for Understanding Catastrophic Forgetting
par: Cheng, Ran
Publié: (2026)
par: Cheng, Ran
Publié: (2026)
Compression via Pre-trained Transformers: A Study on Byte-Level Multimodal Data
par: Heurtel-Depeiges, David, et autres
Publié: (2024)
par: Heurtel-Depeiges, David, et autres
Publié: (2024)
Understanding Action Effects through Instrumental Empowerment in Multi-Agent Reinforcement Learning
par: Selmonaj, Ardian, et autres
Publié: (2025)
par: Selmonaj, Ardian, et autres
Publié: (2025)
Fixed-Budget Differentially Private Best Arm Identification
par: Chen, Zhirui, et autres
Publié: (2024)
par: Chen, Zhirui, et autres
Publié: (2024)
Simple Convergence Proof of Adam From a Sign-like Descent Perspective
par: Peng, Hanyang, et autres
Publié: (2025)
par: Peng, Hanyang, et autres
Publié: (2025)
Hybrid Mamba-Transformer Decoder for Error-Correcting Codes
par: Cohen, Shy-el, et autres
Publié: (2025)
par: Cohen, Shy-el, et autres
Publié: (2025)
Understanding LLM Behaviors via Compression: Data Generation, Knowledge Acquisition and Scaling Laws
par: Pan, Zhixuan, et autres
Publié: (2025)
par: Pan, Zhixuan, et autres
Publié: (2025)
Bottlenecked Transformers: Periodic KV Cache Consolidation for Generalised Reasoning
par: Oomerjee, Adnan, et autres
Publié: (2025)
par: Oomerjee, Adnan, et autres
Publié: (2025)
Learning During Detection: Continual Learning for Neural OFDM Receivers via DMRS
par: Obeed, Mohanad, et autres
Publié: (2026)
par: Obeed, Mohanad, et autres
Publié: (2026)
In-Context Learning for MIMO Equalization Using Transformer-Based Sequence Models
par: Zecchin, Matteo, et autres
Publié: (2023)
par: Zecchin, Matteo, et autres
Publié: (2023)
Unraveling Text Generation in LLMs: A Stochastic Differential Equation Approach
par: Zhang, Yukun
Publié: (2024)
par: Zhang, Yukun
Publié: (2024)
Generative Model-Aided Continual Learning for CSI Feedback in FDD mMIMO-OFDM Systems
par: Liu, Guijun, et autres
Publié: (2025)
par: Liu, Guijun, et autres
Publié: (2025)
Decision Making in Changing Environments: Robustness, Query-Based Learning, and Differential Privacy
par: Chen, Fan, et autres
Publié: (2025)
par: Chen, Fan, et autres
Publié: (2025)
Fast Fourier Transform-Based Spectral and Temporal Gradient Filtering for Differential Privacy
par: Shin, Hyeju, et autres
Publié: (2025)
par: Shin, Hyeju, et autres
Publié: (2025)
Generalization Bounds: Perspectives from Information Theory and PAC-Bayes
par: Hellström, Fredrik, et autres
Publié: (2023)
par: Hellström, Fredrik, et autres
Publié: (2023)
Dynamic Multi-Network Mining of Tensor Time Series
par: Obata, Kohei, et autres
Publié: (2024)
par: Obata, Kohei, et autres
Publié: (2024)
Knowledge Graph-Based Explainable and Generalized Zero-Shot Semantic Communications
par: Zhang, Zhaoyu, et autres
Publié: (2025)
par: Zhang, Zhaoyu, et autres
Publié: (2025)
Intent-Aware DRL-Based NOMA Uplink Dynamic Scheduler for IIoT
par: Mostafa, Salwa, et autres
Publié: (2024)
par: Mostafa, Salwa, et autres
Publié: (2024)
Dynamic Quality-Latency Aware Routing for LLM Inference in Wireless Edge-Device Networks
par: Bao, Rui, et autres
Publié: (2025)
par: Bao, Rui, et autres
Publié: (2025)
A Wireless Foundation Model for Multi-Task Prediction
par: Sheng, Yucheng, et autres
Publié: (2025)
par: Sheng, Yucheng, et autres
Publié: (2025)
A General Error-Theoretical Analysis Framework for Constructing Compression Strategies
par: Zhang, Boyang, et autres
Publié: (2025)
par: Zhang, Boyang, et autres
Publié: (2025)
Physically Parameterized Differentiable MUSIC for DoA Estimation with Uncalibrated Arrays
par: Chatelier, Baptiste, et autres
Publié: (2024)
par: Chatelier, Baptiste, et autres
Publié: (2024)
A General Deep Learning Framework for Wireless Resource Allocation under Discrete Constraints
par: Wang, Yikun, et autres
Publié: (2026)
par: Wang, Yikun, et autres
Publié: (2026)
Capacity-Constrained Continual Learning
par: Wen, Zheng, et autres
Publié: (2025)
par: Wen, Zheng, et autres
Publié: (2025)
Integrated Sensing-Communication-Computation for Edge Artificial Intelligence
par: Wen, Dingzhu, et autres
Publié: (2023)
par: Wen, Dingzhu, et autres
Publié: (2023)
Optimality of Staircase Mechanisms for Vector Queries under Differential Privacy
par: Melbourne, James, et autres
Publié: (2026)
par: Melbourne, James, et autres
Publié: (2026)
An Information Theoretic Perspective on Agentic System Design
par: He, Shizhe, et autres
Publié: (2025)
par: He, Shizhe, et autres
Publié: (2025)
Estimating Mutual Information between Time Series and Temporal Event Sequences Across Diverse Analysis Tasks
par: Hu, Haoji, et autres
Publié: (2026)
par: Hu, Haoji, et autres
Publié: (2026)
MambaJSCC: Adaptive Deep Joint Source-Channel Coding with Generalized State Space Model
par: Wu, Tong, et autres
Publié: (2024)
par: Wu, Tong, et autres
Publié: (2024)
On the Non-decoupling of Supervised Fine-tuning and Reinforcement Learning in Post-training
par: Niu, Xueyan, et autres
Publié: (2026)
par: Niu, Xueyan, et autres
Publié: (2026)
Documents similaires
-
Continuous-Time Attention: PDE-Guided Mechanisms for Long-Sequence Transformers
par: Zhang, Yukun, et autres
Publié: (2025) -
Where to Add PDE Diffusion in Transformers
par: Zhang, Yukun, et autres
Publié: (2025) -
Partial Information Decomposition for Data Interpretability and Feature Selection
par: Westphal, Charles, et autres
Publié: (2024) -
Broadcast Channel Cooperative Gain: An Operational Interpretation of Partial Information Decomposition
par: Tian, Chao, et autres
Publié: (2025) -
LLMs as Noisy Channels: A Shannon Perspective on Model Capacity and Scaling Laws
par: Ouyang, Xu, et autres
Publié: (2026)