Stronger Graph Transformer with Regularized Attention Scores
Fuente:
arXiv
Salvato in:
| Autore principale: | Ku, Eugene |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
FlyKD: Graph Knowledge Distillation on the Fly with Curriculum Learning
di: Ku, Eugene
Pubblicazione: (2024)
di: Ku, Eugene
Pubblicazione: (2024)
Regularizing Attention Scores with Bootstrapping
di: Chung, Neo Christopher, et al.
Pubblicazione: (2026)
di: Chung, Neo Christopher, et al.
Pubblicazione: (2026)
Graph-Based Financial Fraud Detection with Calibrated Risk Scoring and Structural Regularization
di: Nie, Yunfei, et al.
Pubblicazione: (2026)
di: Nie, Yunfei, et al.
Pubblicazione: (2026)
Graph External Attention Enhanced Transformer
di: Liang, Jianqing, et al.
Pubblicazione: (2024)
di: Liang, Jianqing, et al.
Pubblicazione: (2024)
Efficient Attention via Pre-Scoring: Prioritizing Informative Keys in Transformers
di: Li, Zhexiang, et al.
Pubblicazione: (2025)
di: Li, Zhexiang, et al.
Pubblicazione: (2025)
Stronger Normalization-Free Transformers
di: Chen, Mingzhi, et al.
Pubblicazione: (2025)
di: Chen, Mingzhi, et al.
Pubblicazione: (2025)
Spatially Regularized Graph Attention Autoencoder Framework for Detecting Rainfall Extremes
di: Agarwal, Mihir, et al.
Pubblicazione: (2024)
di: Agarwal, Mihir, et al.
Pubblicazione: (2024)
Cluster-wise Graph Transformer with Dual-granularity Kernelized Attention
di: Huang, Siyuan, et al.
Pubblicazione: (2024)
di: Huang, Siyuan, et al.
Pubblicazione: (2024)
SFi-Former: Sparse Flow Induced Attention for Graph Transformer
di: Li, Zhonghao, et al.
Pubblicazione: (2025)
di: Li, Zhonghao, et al.
Pubblicazione: (2025)
Towards Mechanistic Interpretability of Graph Transformers via Attention Graphs
di: El, Batu, et al.
Pubblicazione: (2025)
di: El, Batu, et al.
Pubblicazione: (2025)
Graph Convolutions Enrich the Self-Attention in Transformers!
di: Choi, Jeongwhan, et al.
Pubblicazione: (2023)
di: Choi, Jeongwhan, et al.
Pubblicazione: (2023)
Score Regularized Policy Optimization through Diffusion Behavior
di: Chen, Huayu, et al.
Pubblicazione: (2023)
di: Chen, Huayu, et al.
Pubblicazione: (2023)
Multi-Label Learning with Stronger Consistency Guarantees
di: Mao, Anqi, et al.
Pubblicazione: (2024)
di: Mao, Anqi, et al.
Pubblicazione: (2024)
Graph Regularized PCA
di: Briola, Antonio, et al.
Pubblicazione: (2026)
di: Briola, Antonio, et al.
Pubblicazione: (2026)
AnchorGT: Efficient and Flexible Attention Architecture for Scalable Graph Transformers
di: Zhu, Wenhao, et al.
Pubblicazione: (2024)
di: Zhu, Wenhao, et al.
Pubblicazione: (2024)
When Attention Collapses: How Degenerate Layers in LLMs Enable Smaller, Stronger Models
di: Sanyal, Sunny, et al.
Pubblicazione: (2024)
di: Sanyal, Sunny, et al.
Pubblicazione: (2024)
Likelihood-guided Regularization in Attention Based Models
di: Salem, Mohamed, et al.
Pubblicazione: (2025)
di: Salem, Mohamed, et al.
Pubblicazione: (2025)
VecFormer: Towards Efficient and Generalizable Graph Transformer with Graph Token Attention
di: Zhou, Jingbo, et al.
Pubblicazione: (2026)
di: Zhou, Jingbo, et al.
Pubblicazione: (2026)
A2SF: Accumulative Attention Scoring with Forgetting Factor for Token Pruning in Transformer Decoder
di: Jo, Hyun-rae, et al.
Pubblicazione: (2024)
di: Jo, Hyun-rae, et al.
Pubblicazione: (2024)
Stronger Random Baselines for In-Context Learning
di: Yauney, Gregory, et al.
Pubblicazione: (2024)
di: Yauney, Gregory, et al.
Pubblicazione: (2024)
AttentionDrop: A Novel Regularization Method for Transformer Models
di: Baig, Mirza Samad Ahmed, et al.
Pubblicazione: (2025)
di: Baig, Mirza Samad Ahmed, et al.
Pubblicazione: (2025)
Optimal Denoising in Score-Based Generative Models: The Role of Data Regularity
di: Beyler, Eliot, et al.
Pubblicazione: (2025)
di: Beyler, Eliot, et al.
Pubblicazione: (2025)
Hybrid Focal and Full-Range Attention Based Graph Transformers
di: Zhu, Minhong, et al.
Pubblicazione: (2023)
di: Zhu, Minhong, et al.
Pubblicazione: (2023)
Neighbourhood Transformer: Switchable Attention for Monophily-Aware Graph Learning
di: Luo, Yi, et al.
Pubblicazione: (2026)
di: Luo, Yi, et al.
Pubblicazione: (2026)
Quaternion Self-Attention with Shared Scores
di: Yamauchi, Shogo, et al.
Pubblicazione: (2026)
di: Yamauchi, Shogo, et al.
Pubblicazione: (2026)
Beyond Log-Concavity and Score Regularity: Improved Convergence Bounds for Score-Based Generative Models in W2-distance
di: Gentiloni-Silveri, Marta, et al.
Pubblicazione: (2025)
di: Gentiloni-Silveri, Marta, et al.
Pubblicazione: (2025)
k-Maximum Inner Product Attention for Graph Transformers and the Expressive Power of GraphGPS
di: De Schouwer, Jonas, et al.
Pubblicazione: (2026)
di: De Schouwer, Jonas, et al.
Pubblicazione: (2026)
PACT: Peak-Aware Cross-Attention Graph Transformers for Efficient Storm-Surge Emulation
di: Liu, Zesheng, et al.
Pubblicazione: (2026)
di: Liu, Zesheng, et al.
Pubblicazione: (2026)
Time-aware Heterogeneous Graph Transformer with Adaptive Attention Merging for Health Event Prediction
di: Li, Shibo, et al.
Pubblicazione: (2024)
di: Li, Shibo, et al.
Pubblicazione: (2024)
SALSA: Soup-based Alignment Learning for Stronger Adaptation in RLHF
di: Chegini, Atoosa, et al.
Pubblicazione: (2024)
di: Chegini, Atoosa, et al.
Pubblicazione: (2024)
SpikeGraphormer: A High-Performance Graph Transformer with Spiking Graph Attention
di: Sun, Yundong, et al.
Pubblicazione: (2024)
di: Sun, Yundong, et al.
Pubblicazione: (2024)
Learning Regularization for Graph Inverse Problems
di: Eliasof, Moshe, et al.
Pubblicazione: (2024)
di: Eliasof, Moshe, et al.
Pubblicazione: (2024)
Spacetime $E(n)$-Transformer: Equivariant Attention for Spatio-temporal Graphs
di: Charles, Sergio G.
Pubblicazione: (2024)
di: Charles, Sergio G.
Pubblicazione: (2024)
Attention Dispersion in Dynamic Graph Transformers: Diagnosis and a Transferable Fix
di: Zhang, Jinhao, et al.
Pubblicazione: (2026)
di: Zhang, Jinhao, et al.
Pubblicazione: (2026)
Cardinality-Preserving Attention Channels for Graph Transformers in Molecular Property Prediction
di: Gupta, Abhijit
Pubblicazione: (2026)
di: Gupta, Abhijit
Pubblicazione: (2026)
Scaling Graph Transformers: A Comparative Study of Sparse and Dense Attention
di: Dimitrov, Leon
Pubblicazione: (2025)
di: Dimitrov, Leon
Pubblicazione: (2025)
Exploring the Global-to-Local Attention Scheme in Graph Transformers: An Empirical Study
di: Wu, Gang, et al.
Pubblicazione: (2025)
di: Wu, Gang, et al.
Pubblicazione: (2025)
DAM-GT: Dual Positional Encoding-Based Attention Masking Graph Transformer for Node Classification
di: Li, Chenyang, et al.
Pubblicazione: (2025)
di: Li, Chenyang, et al.
Pubblicazione: (2025)
Beyond Invisibility: Learning Robust Visible Watermarks for Stronger Copyright Protection
di: Liu, Tianci, et al.
Pubblicazione: (2025)
di: Liu, Tianci, et al.
Pubblicazione: (2025)
Stronger Than You Think: Benchmarking Weak Supervision on Realistic Tasks
di: Zhang, Tianyi, et al.
Pubblicazione: (2025)
di: Zhang, Tianyi, et al.
Pubblicazione: (2025)
Documenti analoghi
-
FlyKD: Graph Knowledge Distillation on the Fly with Curriculum Learning
di: Ku, Eugene
Pubblicazione: (2024) -
Regularizing Attention Scores with Bootstrapping
di: Chung, Neo Christopher, et al.
Pubblicazione: (2026) -
Graph-Based Financial Fraud Detection with Calibrated Risk Scoring and Structural Regularization
di: Nie, Yunfei, et al.
Pubblicazione: (2026) -
Graph External Attention Enhanced Transformer
di: Liang, Jianqing, et al.
Pubblicazione: (2024) -
Efficient Attention via Pre-Scoring: Prioritizing Informative Keys in Transformers
di: Li, Zhexiang, et al.
Pubblicazione: (2025)