Saved in:
| Main Authors: | Yang, Kai, Huang, Yuqi, Tao, Junheng, Wang, Wanyu, Wu, Qitian |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2510.04233 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
SGFormer: Single-Layer Graph Transformers with Approximation-Free Linear Complexity
by: Wu, Qitian, et al.
Published: (2024)
by: Wu, Qitian, et al.
Published: (2024)
Transformers from Diffusion: A Unified Framework for Neural Message Passing
by: Wu, Qitian, et al.
Published: (2024)
by: Wu, Qitian, et al.
Published: (2024)
Supercharging Graph Transformers with Advective Diffusion
by: Wu, Qitian, et al.
Published: (2023)
by: Wu, Qitian, et al.
Published: (2023)
Learning Divergence Fields for Shift-Robust Graph Representations
by: Wu, Qitian, et al.
Published: (2024)
by: Wu, Qitian, et al.
Published: (2024)
Dynamic Model Merging Made Slim
by: Du, Guodong, et al.
Published: (2026)
by: Du, Guodong, et al.
Published: (2026)
Handling Distribution Shifts on Graphs: An Invariance Perspective
by: Wu, Qitian, et al.
Published: (2022)
by: Wu, Qitian, et al.
Published: (2022)
SGFormer: Simplifying and Empowering Transformers for Large-Graph Representations
by: Wu, Qitian, et al.
Published: (2023)
by: Wu, Qitian, et al.
Published: (2023)
Dynamic Mixture of Experts: An Auto-Tuning Approach for Efficient Transformer Models
by: Guo, Yongxin, et al.
Published: (2024)
by: Guo, Yongxin, et al.
Published: (2024)
The Compositional Architecture of Regret in Large Language Models
by: Cui, Xiangxiang, et al.
Published: (2025)
by: Cui, Xiangxiang, et al.
Published: (2025)
Learning Spatio-Temporal Dynamics for Trajectory Recovery via Time-Aware Transformer
by: Sun, Tian, et al.
Published: (2025)
by: Sun, Tian, et al.
Published: (2025)
Principled Understanding of Generalization for Generative Transformer Models in Arithmetic Reasoning Tasks
by: Xu, Xingcheng, et al.
Published: (2024)
by: Xu, Xingcheng, et al.
Published: (2024)
The Sharpness Disparity Principle in Transformers for Accelerating Language Model Pre-Training
by: Wang, Jinbo, et al.
Published: (2025)
by: Wang, Jinbo, et al.
Published: (2025)
Distilling Time Series Foundation Models for Efficient Forecasting
by: Li, Yuqi, et al.
Published: (2026)
by: Li, Yuqi, et al.
Published: (2026)
Explainable Molecular Property Prediction: Aligning Chemical Concepts with Predictions via Language Models
by: Wang, Zhenzhong, et al.
Published: (2024)
by: Wang, Zhenzhong, et al.
Published: (2024)
Efficient UAV Swarm-Based Multi-Task Federated Learning with Dynamic Task Knowledge Sharing
by: Yang, Yubo, et al.
Published: (2025)
by: Yang, Yubo, et al.
Published: (2025)
ContiFormer: Continuous-Time Transformer for Irregular Time Series Modeling
by: Chen, Yuqi, et al.
Published: (2024)
by: Chen, Yuqi, et al.
Published: (2024)
Spatial-temporal Graph Convolutional Networks with Diversified Transformation for Dynamic Graph Representation Learning
by: Wang, Ling, et al.
Published: (2024)
by: Wang, Ling, et al.
Published: (2024)
LLM Data Selection and Utilization via Dynamic Bi-level Optimization
by: Yu, Yang, et al.
Published: (2025)
by: Yu, Yang, et al.
Published: (2025)
Attention Dispersion in Dynamic Graph Transformers: Diagnosis and a Transferable Fix
by: Zhang, Jinhao, et al.
Published: (2026)
by: Zhang, Jinhao, et al.
Published: (2026)
Towards Principled Graph Transformers
by: Müller, Luis, et al.
Published: (2024)
by: Müller, Luis, et al.
Published: (2024)
Faithful Interpretation for Graph Neural Networks
by: Hu, Lijie, et al.
Published: (2024)
by: Hu, Lijie, et al.
Published: (2024)
The Lifecycle Principle: Stabilizing Dynamic Neural Networks with State Memory
by: Yang, Zichuan
Published: (2025)
by: Yang, Zichuan
Published: (2025)
Bi-LoRA: Efficient Sharpness-Aware Minimization for Fine-Tuning Large-Scale Models
by: Liu, Yuhang, et al.
Published: (2025)
by: Liu, Yuhang, et al.
Published: (2025)
Global-Lens Transformers: Adaptive Token Mixing for Dynamic Link Prediction
by: Zou, Tao, et al.
Published: (2025)
by: Zou, Tao, et al.
Published: (2025)
Design Principles for Sequence Models via Coefficient Dynamics
by: Sieber, Jerome, et al.
Published: (2025)
by: Sieber, Jerome, et al.
Published: (2025)
When to Stop Reusing: Dynamic Gradient Gating for Sample-Efficient RLVR
by: Miao, Yuchun, et al.
Published: (2026)
by: Miao, Yuchun, et al.
Published: (2026)
From Efficient Multimodal Models to World Models: A Survey
by: Mai, Xinji, et al.
Published: (2024)
by: Mai, Xinji, et al.
Published: (2024)
UniTabE: A Universal Pretraining Protocol for Tabular Foundation Model in Data Science
by: Yang, Yazheng, et al.
Published: (2023)
by: Yang, Yazheng, et al.
Published: (2023)
Streaming 4D Visual Geometry Transformer
by: Zhuo, Dong, et al.
Published: (2025)
by: Zhuo, Dong, et al.
Published: (2025)
Dynamic Layer Tying for Parameter-Efficient Transformers
by: Hay, Tamir David, et al.
Published: (2024)
by: Hay, Tamir David, et al.
Published: (2024)
Curriculum Learning for Efficient Chain-of-Thought Distillation via Structure-Aware Masking and GRPO
by: Yu, Bowen, et al.
Published: (2026)
by: Yu, Bowen, et al.
Published: (2026)
Hybrid Dynamic Pruning: A Pathway to Efficient Transformer Inference
by: Jaradat, Ghadeer, et al.
Published: (2024)
by: Jaradat, Ghadeer, et al.
Published: (2024)
PENGUIN: Enhancing Transformer with Periodic-Nested Group Attention for Long-term Time Series Forecasting
by: Sun, Tian, et al.
Published: (2025)
by: Sun, Tian, et al.
Published: (2025)
Exploiting Latent Linearity in LLMs Improves Explainable Molecular Representation Learning
by: Li, Zhuoran, et al.
Published: (2024)
by: Li, Zhuoran, et al.
Published: (2024)
RouterBench: A Benchmark for Multi-LLM Routing System
by: Hu, Qitian Jason, et al.
Published: (2024)
by: Hu, Qitian Jason, et al.
Published: (2024)
The Principles of Diffusion Models
by: Lai, Chieh-Hsin, et al.
Published: (2025)
by: Lai, Chieh-Hsin, et al.
Published: (2025)
Physics-Guided Multimodal Transformers are the Necessary Foundation for the Next Generation of Meteorological Science
by: Han, Jing, et al.
Published: (2025)
by: Han, Jing, et al.
Published: (2025)
SIG: Efficient Self-Interpretable Graph Neural Network for Continuous-time Dynamic Graphs
by: Fang, Lanting, et al.
Published: (2024)
by: Fang, Lanting, et al.
Published: (2024)
Multi-View Subgraph Neural Networks: Self-Supervised Learning with Scarce Labeled Data
by: Wang, Zhenzhong, et al.
Published: (2024)
by: Wang, Zhenzhong, et al.
Published: (2024)
Learning More with Less: A Dynamic Dual-Level Down-Sampling Framework for Efficient Policy Optimization
by: Wang, Chao, et al.
Published: (2025)
by: Wang, Chao, et al.
Published: (2025)
Similar Items
-
SGFormer: Single-Layer Graph Transformers with Approximation-Free Linear Complexity
by: Wu, Qitian, et al.
Published: (2024) -
Transformers from Diffusion: A Unified Framework for Neural Message Passing
by: Wu, Qitian, et al.
Published: (2024) -
Supercharging Graph Transformers with Advective Diffusion
by: Wu, Qitian, et al.
Published: (2023) -
Learning Divergence Fields for Shift-Robust Graph Representations
by: Wu, Qitian, et al.
Published: (2024) -
Dynamic Model Merging Made Slim
by: Du, Guodong, et al.
Published: (2026)