A Transformer-based Neural Architecture Search Method
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Shang, Tang, Huanrong, Ouyang, Jianquan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
A Neural Architecture Search Method using Auxiliary Evaluation Metric based on ResNet Architecture
di: Wang, Shang, et al.
Pubblicazione: (2025)
di: Wang, Shang, et al.
Pubblicazione: (2025)
Elastic Architecture Search for Efficient Language Models
di: Wang, Shang
Pubblicazione: (2025)
di: Wang, Shang
Pubblicazione: (2025)
W-PCA Based Gradient-Free Proxy for Efficient Search of Lightweight Language Models
di: Wang, Shang
Pubblicazione: (2025)
di: Wang, Shang
Pubblicazione: (2025)
SEval-NAS: A Search-Agnostic Evaluation for Neural Architecture Search
di: Mih, Atah Nuh, et al.
Pubblicazione: (2026)
di: Mih, Atah Nuh, et al.
Pubblicazione: (2026)
Knowledge-aware Evolutionary Graph Neural Architecture Search
di: Wang, Chao, et al.
Pubblicazione: (2024)
di: Wang, Chao, et al.
Pubblicazione: (2024)
MAR: Efficient Large Language Models via Module-aware Architecture Refinement
di: Cai, Junhong, et al.
Pubblicazione: (2026)
di: Cai, Junhong, et al.
Pubblicazione: (2026)
SpikeNAS: A Fast Memory-Aware Neural Architecture Search Framework for Spiking Neural Network-based Embedded AI Systems
di: Putra, Rachmad Vidya Wicaksana, et al.
Pubblicazione: (2024)
di: Putra, Rachmad Vidya Wicaksana, et al.
Pubblicazione: (2024)
Analysis of Error Sources in LLM-based Hypothesis Search for Few-Shot Rule Induction
di: Parab, Aishni, et al.
Pubblicazione: (2025)
di: Parab, Aishni, et al.
Pubblicazione: (2025)
GLU Attention Improve Transformer
di: Wang, Zehao
Pubblicazione: (2025)
di: Wang, Zehao
Pubblicazione: (2025)
Neural Architecture Search using Particle Swarm and Ant Colony Optimization
di: Lankford, Séamus, et al.
Pubblicazione: (2024)
di: Lankford, Séamus, et al.
Pubblicazione: (2024)
Evolution Meets Diffusion: Efficient Neural Architecture Generation
di: Zhou, Bingye, et al.
Pubblicazione: (2025)
di: Zhou, Bingye, et al.
Pubblicazione: (2025)
Recent Advances in Federated Learning Driven Large Language Models: A Survey on Architecture, Performance, and Security
di: Qu, Youyang, et al.
Pubblicazione: (2024)
di: Qu, Youyang, et al.
Pubblicazione: (2024)
Vector Policy Optimization: Training for Diversity Improves Test-Time Search
di: Bahlous-Boldi, Ryan, et al.
Pubblicazione: (2026)
di: Bahlous-Boldi, Ryan, et al.
Pubblicazione: (2026)
Compute Allocation in Evolutionary Search: From Depth-Breadth to Multi-Armed Bandits
di: Xing, Sixue, et al.
Pubblicazione: (2026)
di: Xing, Sixue, et al.
Pubblicazione: (2026)
NOBLE: Accelerating Transformers with Nonlinear Low-Rank Branches
di: Smith, Ethan
Pubblicazione: (2026)
di: Smith, Ethan
Pubblicazione: (2026)
Encodings for Prediction-based Neural Architecture Search
di: Akhauri, Yash, et al.
Pubblicazione: (2024)
di: Akhauri, Yash, et al.
Pubblicazione: (2024)
A Gauge Theory of Superposition: Toward a Sheaf-Theoretic Atlas of Neural Representations
di: Javidnia, Hossein
Pubblicazione: (2026)
di: Javidnia, Hossein
Pubblicazione: (2026)
Thoughtbubbles: an Unsupervised Method for Parallel Thinking in Latent Space
di: Liu, Houjun, et al.
Pubblicazione: (2025)
di: Liu, Houjun, et al.
Pubblicazione: (2025)
Leave No Context Behind: Efficient Infinite Context Transformers with Infini-attention
di: Munkhdalai, Tsendsuren, et al.
Pubblicazione: (2024)
di: Munkhdalai, Tsendsuren, et al.
Pubblicazione: (2024)
MIDAS: Mosaic Input-Specific Differentiable Architecture Search
di: Subbotko, Konstanty
Pubblicazione: (2026)
di: Subbotko, Konstanty
Pubblicazione: (2026)
Neural Architecture Search for Quantum Autoencoders
di: Agha, Hibah, et al.
Pubblicazione: (2025)
di: Agha, Hibah, et al.
Pubblicazione: (2025)
Position as Probability: Self-Supervised Transformers that Think Past Their Training for Length Extrapolation
di: Lee, Philip Heejun
Pubblicazione: (2025)
di: Lee, Philip Heejun
Pubblicazione: (2025)
LLMatic: Neural Architecture Search via Large Language Models and Quality Diversity Optimization
di: Nasir, Muhammad U., et al.
Pubblicazione: (2023)
di: Nasir, Muhammad U., et al.
Pubblicazione: (2023)
Evolutionary Architecture Search through Grammar-Based Sequence Alignment
di: Martín, Adri Gómez, et al.
Pubblicazione: (2025)
di: Martín, Adri Gómez, et al.
Pubblicazione: (2025)
Learning to Reduce Search Space for Generalizable Neural Routing Solver
di: Zhou, Changliang, et al.
Pubblicazione: (2025)
di: Zhou, Changliang, et al.
Pubblicazione: (2025)
Meta knowledge assisted Evolutionary Neural Architecture Search
di: Li, Yangyang, et al.
Pubblicazione: (2025)
di: Li, Yangyang, et al.
Pubblicazione: (2025)
Interlocking-free Selective Rationalization Through Genetic-based Learning
di: Ruggeri, Federico, et al.
Pubblicazione: (2024)
di: Ruggeri, Federico, et al.
Pubblicazione: (2024)
AgenticGEO: A Self-Evolving Agentic System for Generative Engine Optimization
di: Yuan, Jiaqi, et al.
Pubblicazione: (2026)
di: Yuan, Jiaqi, et al.
Pubblicazione: (2026)
Enriching language models with graph-based context information to better understand textual data
di: Roethel, Albert, et al.
Pubblicazione: (2023)
di: Roethel, Albert, et al.
Pubblicazione: (2023)
Beyond Uniform Scaling: Exploring Depth Heterogeneity in Neural Architectures
di: T, Akash Guna R., et al.
Pubblicazione: (2024)
di: T, Akash Guna R., et al.
Pubblicazione: (2024)
DGPO: RL-Steered Graph Diffusion for Neural Architecture Generation
di: Liuliakov, Aleksei, et al.
Pubblicazione: (2026)
di: Liuliakov, Aleksei, et al.
Pubblicazione: (2026)
Evolutionary Neural Architecture Search for 3D Point Cloud Analysis
di: Yang, Yisheng, et al.
Pubblicazione: (2024)
di: Yang, Yisheng, et al.
Pubblicazione: (2024)
Sparsity Moves Computation: How FFN Architecture Reshapes Attention in Small Transformers
di: Smithline, Gabriel, et al.
Pubblicazione: (2026)
di: Smithline, Gabriel, et al.
Pubblicazione: (2026)
Why Flow Matching is Particle Swarm Optimization?
di: Ouyang, Kaichen
Pubblicazione: (2025)
di: Ouyang, Kaichen
Pubblicazione: (2025)
A Neural Network Training Method Based on Distributed PID Control
di: Kun, Jiang
Pubblicazione: (2024)
di: Kun, Jiang
Pubblicazione: (2024)
H-Node Attack and Defense in Large Language Models
di: Yocam, Eric, et al.
Pubblicazione: (2026)
di: Yocam, Eric, et al.
Pubblicazione: (2026)
On the Markov Property of Neural Algorithmic Reasoning: Analyses and Methods
di: Bohde, Montgomery, et al.
Pubblicazione: (2024)
di: Bohde, Montgomery, et al.
Pubblicazione: (2024)
When Large Language Models Meet Evolutionary Algorithms: Potential Enhancements and Challenges
di: Wang, Chao, et al.
Pubblicazione: (2024)
di: Wang, Chao, et al.
Pubblicazione: (2024)
Large Language Models and Emergence: A Complex Systems Perspective
di: Krakauer, David C., et al.
Pubblicazione: (2025)
di: Krakauer, David C., et al.
Pubblicazione: (2025)
What's the Magic Word? A Control Theory of LLM Prompting
di: Bhargava, Aman, et al.
Pubblicazione: (2023)
di: Bhargava, Aman, et al.
Pubblicazione: (2023)
Documenti analoghi
-
A Neural Architecture Search Method using Auxiliary Evaluation Metric based on ResNet Architecture
di: Wang, Shang, et al.
Pubblicazione: (2025) -
Elastic Architecture Search for Efficient Language Models
di: Wang, Shang
Pubblicazione: (2025) -
W-PCA Based Gradient-Free Proxy for Efficient Search of Lightweight Language Models
di: Wang, Shang
Pubblicazione: (2025) -
SEval-NAS: A Search-Agnostic Evaluation for Neural Architecture Search
di: Mih, Atah Nuh, et al.
Pubblicazione: (2026) -
Knowledge-aware Evolutionary Graph Neural Architecture Search
di: Wang, Chao, et al.
Pubblicazione: (2024)