Union of Experts: Adapting Hierarchical Routing to Equivalently Decomposed Transformer
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yang, Yujiao, Lian, Jing, Li, Linhui |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Deceptive Diffusion: Generating Synthetic Adversarial Examples
par: Beerens, Lucas, et autres
Publié: (2024)
par: Beerens, Lucas, et autres
Publié: (2024)
The First MPDD Challenge: Multimodal Personality-aware Depression Detection
par: Fu, Changzeng, et autres
Publié: (2025)
par: Fu, Changzeng, et autres
Publié: (2025)
DecompKAN: Decomposed Patch-KAN for Long-Term Time Series Forecasting
par: Mysore, Naveen
Publié: (2026)
par: Mysore, Naveen
Publié: (2026)
JacNet: Learning Functions with Structured Jacobians
par: Lorraine, Jonathan, et autres
Publié: (2024)
par: Lorraine, Jonathan, et autres
Publié: (2024)
Closing the Theory-Practice Gap in Spiking Transformers via Effective Dimension
par: Guo, Dongxin, et autres
Publié: (2026)
par: Guo, Dongxin, et autres
Publié: (2026)
PolyGLU: State-Conditional Activation Routing in Transformer Feed-Forward Networks
par: Medeiros, Daniel Nobrega
Publié: (2026)
par: Medeiros, Daniel Nobrega
Publié: (2026)
Which Transformer to Favor: A Comparative Analysis of Efficiency in Vision Transformers
par: Nauen, Tobias Christian, et autres
Publié: (2023)
par: Nauen, Tobias Christian, et autres
Publié: (2023)
A Hybrid Inductive-Transductive Network for Traffic Flow Imputation on Unsampled Locations
par: Rahimiasl, Mohammadmahdi, et autres
Publié: (2025)
par: Rahimiasl, Mohammadmahdi, et autres
Publié: (2025)
multivariateGPT: a decoder-only transformer for multivariate categorical and numeric data
par: Loza, Andrew J., et autres
Publié: (2025)
par: Loza, Andrew J., et autres
Publié: (2025)
Scaling Laws in the Tiny Regime: How Small Models Change Their Mistakes
par: Alnemari, Mohammed, et autres
Publié: (2026)
par: Alnemari, Mohammed, et autres
Publié: (2026)
A Boltzmann-machine-enhanced Transformer For DNA Sequence Classification
par: Cao, Zhixuan, et autres
Publié: (2026)
par: Cao, Zhixuan, et autres
Publié: (2026)
CVCM Track Circuits Pre-emptive Failure Diagnostics for Predictive Maintenance Using Deep Neural Networks
par: Mukherjee, Debdeep, et autres
Publié: (2025)
par: Mukherjee, Debdeep, et autres
Publié: (2025)
CellARC: Measuring Intelligence with Cellular Automata
par: Lžičař, Miroslav
Publié: (2025)
par: Lžičař, Miroslav
Publié: (2025)
AssistedDS: Benchmarking How External Domain Knowledge Assists LLMs in Automated Data Science
par: Luo, An, et autres
Publié: (2025)
par: Luo, An, et autres
Publié: (2025)
GradES: Significantly Faster Training in Transformers with Gradient-Based Early Stopping
par: Wen, Qifu, et autres
Publié: (2025)
par: Wen, Qifu, et autres
Publié: (2025)
Explicit Dropout: Deterministic Regularization for Transformer Architectures
par: Agrawal, Vidhi, et autres
Publié: (2026)
par: Agrawal, Vidhi, et autres
Publié: (2026)
Efficient Morphology-Control Co-Design via Stackelberg Proximal Policy Optimization
par: Dai, Yanning, et autres
Publié: (2026)
par: Dai, Yanning, et autres
Publié: (2026)
GRALIS: A Unified Canonical Framework for Linear Attribution Methods via Riesz Representation
par: Fanale, Raimondo
Publié: (2026)
par: Fanale, Raimondo
Publié: (2026)
Can Agentic AI Match the Performance of Human Data Scientists?
par: Luo, An, et autres
Publié: (2025)
par: Luo, An, et autres
Publié: (2025)
AgentDS Technical Report: Benchmarking the Future of Human-AI Collaboration in Domain-Specific Data Science
par: Luo, An, et autres
Publié: (2026)
par: Luo, An, et autres
Publié: (2026)
Optimizing Inference in Transformer-Based Models: A Multi-Method Benchmark
par: Ho, Siu Hang, et autres
Publié: (2025)
par: Ho, Siu Hang, et autres
Publié: (2025)
Neural Conditional Transport Maps
par: Rodriguez-Pardo, Carlos, et autres
Publié: (2025)
par: Rodriguez-Pardo, Carlos, et autres
Publié: (2025)
TaylorShift: Shifting the Complexity of Self-Attention from Squared to Linear (and Back) using Taylor-Softmax
par: Nauen, Tobias Christian, et autres
Publié: (2024)
par: Nauen, Tobias Christian, et autres
Publié: (2024)
KAN vs LSTM Performance in Time Series Forecasting
par: Rather, Tabish Ali, et autres
Publié: (2025)
par: Rather, Tabish Ali, et autres
Publié: (2025)
H-Model: Dynamic Neural Architectures for Adaptive Processing
par: Hospodarchuk, Dmytro
Publié: (2025)
par: Hospodarchuk, Dmytro
Publié: (2025)
Scalable, Technology-Agnostic Diagnosis and Predictive Maintenance for Point Machine using Deep Learning
par: Di Santi, Eduardo, et autres
Publié: (2025)
par: Di Santi, Eduardo, et autres
Publié: (2025)
DeepDRK: Deep Dependency Regularized Knockoff for Feature Selection
par: Shen, Hongyu, et autres
Publié: (2024)
par: Shen, Hongyu, et autres
Publié: (2024)
InhibiDistilbert: Knowledge Distillation for a ReLU and Addition-based Transformer
par: Zhang, Tony, et autres
Publié: (2025)
par: Zhang, Tony, et autres
Publié: (2025)
Revisiting GAN with Bayes-Optimal Discrimination
par: Naeini, Mohammadreza Tavasoli, et autres
Publié: (2025)
par: Naeini, Mohammadreza Tavasoli, et autres
Publié: (2025)
Complex-Valued Phase-Coherent Transformer
par: Hioki, Leona
Publié: (2026)
par: Hioki, Leona
Publié: (2026)
PH-VAE: A Polynomial Hierarchical Variational Autoencoder Towards Disentangled Representation Learning
par: Chen, Xi, et autres
Publié: (2025)
par: Chen, Xi, et autres
Publié: (2025)
Revisiting Non-separable Binary Classification and its Applications in Anomaly Detection
par: Lau, Matthew, et autres
Publié: (2023)
par: Lau, Matthew, et autres
Publié: (2023)
Few-Class Arena: A Benchmark for Efficient Selection of Vision Models and Dataset Difficulty Measurement
par: Cao, Bryan Bo, et autres
Publié: (2024)
par: Cao, Bryan Bo, et autres
Publié: (2024)
mlx-snn: Spiking Neural Networks on Apple Silicon via MLX
par: Qin, Jiahao
Publié: (2026)
par: Qin, Jiahao
Publié: (2026)
Massive Redundancy in Gradient Transport Enables Sparse Online Learning
par: Merin, Aur Shalev
Publié: (2026)
par: Merin, Aur Shalev
Publié: (2026)
SigGate-GT: Taming Over-Smoothing in Graph Transformers via Sigmoid-Gated Attention
par: Guo, Dongxin, et autres
Publié: (2026)
par: Guo, Dongxin, et autres
Publié: (2026)
Transfer learning with generative models for object detection on limited datasets
par: Paiano, Matteo, et autres
Publié: (2024)
par: Paiano, Matteo, et autres
Publié: (2024)
Pulse-Driven Neural Architecture: Learnable Oscillatory Dynamics for Robust Continuous-Time Sequence Processing
par: Sharma, Paras
Publié: (2026)
par: Sharma, Paras
Publié: (2026)
GraphNNK -- Graph Classification and Interpretability
par: Bolevic, Zeljko, et autres
Publié: (2026)
par: Bolevic, Zeljko, et autres
Publié: (2026)
Temporal Functional Circuits: From Spline Plots to Faithful Explanations in KAN Forecasting
par: Mysore, Naveen
Publié: (2026)
par: Mysore, Naveen
Publié: (2026)
Documents similaires
-
Deceptive Diffusion: Generating Synthetic Adversarial Examples
par: Beerens, Lucas, et autres
Publié: (2024) -
The First MPDD Challenge: Multimodal Personality-aware Depression Detection
par: Fu, Changzeng, et autres
Publié: (2025) -
DecompKAN: Decomposed Patch-KAN for Long-Term Time Series Forecasting
par: Mysore, Naveen
Publié: (2026) -
JacNet: Learning Functions with Structured Jacobians
par: Lorraine, Jonathan, et autres
Publié: (2024) -
Closing the Theory-Practice Gap in Spiking Transformers via Effective Dimension
par: Guo, Dongxin, et autres
Publié: (2026)