Sample-based Dynamic Hierarchical Transformer with Layer and Head Flexibility via Contextual Bandit
Fuente:
arXiv
Salvato in:
| Autori principali: | Meng, Fanfei, Zhang, Lele, Chen, Yu, Wang, Yuxin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Evolution and Efficiency in Neural Architecture Search: Bridging the Gap Between Expert Design and Automated Optimization
di: Meng, Fanfei, et al.
Pubblicazione: (2024)
di: Meng, Fanfei, et al.
Pubblicazione: (2024)
EvoSampling: A Granular Ball-based Evolutionary Hybrid Sampling with Knowledge Transfer for Imbalanced Learning
di: Pei, Wenbin, et al.
Pubblicazione: (2024)
di: Pei, Wenbin, et al.
Pubblicazione: (2024)
Investigating Recurrent Transformers with Dynamic Halt
di: Chowdhury, Jishnu Ray, et al.
Pubblicazione: (2024)
di: Chowdhury, Jishnu Ray, et al.
Pubblicazione: (2024)
Why "classic" Transformers are shallow and how to make them go deep
di: Yu, Yueyao, et al.
Pubblicazione: (2023)
di: Yu, Yueyao, et al.
Pubblicazione: (2023)
Understanding Transformer Optimization via Gradient Heterogeneity
di: Tomihari, Akiyoshi, et al.
Pubblicazione: (2025)
di: Tomihari, Akiyoshi, et al.
Pubblicazione: (2025)
SGHormer: An Energy-Saving Graph Transformer Driven by Spikes
di: Zhang, Huizhe, et al.
Pubblicazione: (2024)
di: Zhang, Huizhe, et al.
Pubblicazione: (2024)
Hebbian Learning based Orthogonal Projection for Continual Learning of Spiking Neural Networks
di: Xiao, Mingqing, et al.
Pubblicazione: (2024)
di: Xiao, Mingqing, et al.
Pubblicazione: (2024)
CogDPM: Diffusion Probabilistic Models via Cognitive Predictive Coding
di: Chen, Kaiyuan, et al.
Pubblicazione: (2024)
di: Chen, Kaiyuan, et al.
Pubblicazione: (2024)
MID-L: Matrix-Interpolated Dropout Layer with Layer-wise Neuron Selection
di: Shaeri, Pouya, et al.
Pubblicazione: (2025)
di: Shaeri, Pouya, et al.
Pubblicazione: (2025)
JPC: Flexible Inference for Predictive Coding Networks in JAX
di: Innocenti, Francesco, et al.
Pubblicazione: (2024)
di: Innocenti, Francesco, et al.
Pubblicazione: (2024)
Hierarchical Residuals Exploit Brain-Inspired Compositionality
di: López, Francisco M., et al.
Pubblicazione: (2025)
di: López, Francisco M., et al.
Pubblicazione: (2025)
Dynamic Design of Machine Learning Pipelines via Metalearning
di: Alcobaça, Edesio, et al.
Pubblicazione: (2025)
di: Alcobaça, Edesio, et al.
Pubblicazione: (2025)
Structurally Flexible Neural Networks: Evolving the Building Blocks for General Agents
di: Pedersen, Joachim Winther, et al.
Pubblicazione: (2024)
di: Pedersen, Joachim Winther, et al.
Pubblicazione: (2024)
Deep ARTMAP: Generalized Hierarchical Learning with Adaptive Resonance Theory
di: Melton, Niklas M., et al.
Pubblicazione: (2025)
di: Melton, Niklas M., et al.
Pubblicazione: (2025)
Flexible Prefrontal Control over Hippocampal Episodic Memory for Goal-Directed Generalization
di: Zheng, Yicong, et al.
Pubblicazione: (2025)
di: Zheng, Yicong, et al.
Pubblicazione: (2025)
Spiking Point Transformer for Point Cloud Classification
di: Wu, Peixi, et al.
Pubblicazione: (2025)
di: Wu, Peixi, et al.
Pubblicazione: (2025)
CosineGate: Semantic Dynamic Routing via Cosine Incompatibility in Residual Networks
di: Thota, Yogeswar Reddy
Pubblicazione: (2025)
di: Thota, Yogeswar Reddy
Pubblicazione: (2025)
GOAL: Graph-based Objective-Aligned Diffusion Solvers for Dynamic Multi-Objective Optimization
di: Li, Xingyu
Pubblicazione: (2026)
di: Li, Xingyu
Pubblicazione: (2026)
No One-Size-Fits-All Neurons: Task-based Neurons for Artificial Neural Networks
di: Fan, Feng-Lei, et al.
Pubblicazione: (2024)
di: Fan, Feng-Lei, et al.
Pubblicazione: (2024)
Attending to Graph Transformers
di: Müller, Luis, et al.
Pubblicazione: (2023)
di: Müller, Luis, et al.
Pubblicazione: (2023)
Hierarchical Self-Attention: Generalizing Neural Attention Mechanics to Multi-Scale Problems
di: Amizadeh, Saeed, et al.
Pubblicazione: (2025)
di: Amizadeh, Saeed, et al.
Pubblicazione: (2025)
Agent-GWO: Collaborative Agents for Dynamic Prompt Optimization in Large Language Models
di: Wang, Xudong, et al.
Pubblicazione: (2026)
di: Wang, Xudong, et al.
Pubblicazione: (2026)
PReLU: Yet Another Single-Layer Solution to the XOR Problem
di: Pinto, Rafael C., et al.
Pubblicazione: (2024)
di: Pinto, Rafael C., et al.
Pubblicazione: (2024)
Training Green AI Models Using Elite Samples
di: Alswaitti, Mohammed, et al.
Pubblicazione: (2024)
di: Alswaitti, Mohammed, et al.
Pubblicazione: (2024)
Dynamic Spiking Framework for Graph Neural Networks
di: Yin, Nan, et al.
Pubblicazione: (2023)
di: Yin, Nan, et al.
Pubblicazione: (2023)
Rethinking LLM-Driven Heuristic Design: Generating Efficient and Specialized Solvers via Dynamics-Aware Optimization
di: Wang, Rongzheng, et al.
Pubblicazione: (2026)
di: Wang, Rongzheng, et al.
Pubblicazione: (2026)
Structure Development in List-Sorting Transformers
di: Urdshals, Einar, et al.
Pubblicazione: (2025)
di: Urdshals, Einar, et al.
Pubblicazione: (2025)
Evolved Sample Weights for Bias Mitigation: Effectiveness Depends on the Fairness Objective
di: Saini, Anil K., et al.
Pubblicazione: (2025)
di: Saini, Anil K., et al.
Pubblicazione: (2025)
MoEUT: Mixture-of-Experts Universal Transformers
di: Csordás, Róbert, et al.
Pubblicazione: (2024)
di: Csordás, Róbert, et al.
Pubblicazione: (2024)
A Graph is Worth 1-bit Spikes: When Graph Contrastive Learning Meets Spiking Neural Networks
di: Li, Jintang, et al.
Pubblicazione: (2023)
di: Li, Jintang, et al.
Pubblicazione: (2023)
Online Pseudo-Zeroth-Order Training of Neuromorphic Spiking Neural Networks
di: Xiao, Mingqing, et al.
Pubblicazione: (2024)
di: Xiao, Mingqing, et al.
Pubblicazione: (2024)
General-Purpose In-Context Learning by Meta-Learning Transformers
di: Kirsch, Louis, et al.
Pubblicazione: (2022)
di: Kirsch, Louis, et al.
Pubblicazione: (2022)
QSViT: A Methodology for Quantizing Spiking Vision Transformers
di: Putra, Rachmad Vidya Wicaksana, et al.
Pubblicazione: (2025)
di: Putra, Rachmad Vidya Wicaksana, et al.
Pubblicazione: (2025)
SiGNN: A Spike-induced Graph Neural Network for Dynamic Graph Representation Learning
di: Chen, Dong, et al.
Pubblicazione: (2024)
di: Chen, Dong, et al.
Pubblicazione: (2024)
BiSpikCLM: A Spiking Language Model integrating Softmax-Free Spiking Attention and Spike-Aware Alignment Distillation
di: Guo, Sihang, et al.
Pubblicazione: (2026)
di: Guo, Sihang, et al.
Pubblicazione: (2026)
Decision SpikeFormer: Spike-Driven Transformer for Decision Making
di: Huang, Wei, et al.
Pubblicazione: (2025)
di: Huang, Wei, et al.
Pubblicazione: (2025)
The Dragon Hatchling: The Missing Link between the Transformer and Models of the Brain
di: Kosowski, Adrian, et al.
Pubblicazione: (2025)
di: Kosowski, Adrian, et al.
Pubblicazione: (2025)
Weight Decay Regimes in Grokking Transformers: Cheap Online Diagnostics
di: Verma, Lucky
Pubblicazione: (2026)
di: Verma, Lucky
Pubblicazione: (2026)
Feedback Favors the Generalization of Neural ODEs
di: Jia, Jindou, et al.
Pubblicazione: (2024)
di: Jia, Jindou, et al.
Pubblicazione: (2024)
A Bandit Approach with Evolutionary Operators for Model Selection
di: Brégère, Margaux, et al.
Pubblicazione: (2024)
di: Brégère, Margaux, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Evolution and Efficiency in Neural Architecture Search: Bridging the Gap Between Expert Design and Automated Optimization
di: Meng, Fanfei, et al.
Pubblicazione: (2024) -
EvoSampling: A Granular Ball-based Evolutionary Hybrid Sampling with Knowledge Transfer for Imbalanced Learning
di: Pei, Wenbin, et al.
Pubblicazione: (2024) -
Investigating Recurrent Transformers with Dynamic Halt
di: Chowdhury, Jishnu Ray, et al.
Pubblicazione: (2024) -
Why "classic" Transformers are shallow and how to make them go deep
di: Yu, Yueyao, et al.
Pubblicazione: (2023) -
Understanding Transformer Optimization via Gradient Heterogeneity
di: Tomihari, Akiyoshi, et al.
Pubblicazione: (2025)