Do Language Models Use Their Depth Efficiently?
Fuente:
arXiv
Guardado en:
| Autores principales: | Csordás, Róbert, Manning, Christopher D., Potts, Christopher |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Recurrent Neural Networks Learn to Store and Generate Sequences using Non-Linear Representations
por: Csordás, Róbert, et al.
Publicado: (2024)
por: Csordás, Róbert, et al.
Publicado: (2024)
MoEUT: Mixture-of-Experts Universal Transformers
por: Csordás, Róbert, et al.
Publicado: (2024)
por: Csordás, Róbert, et al.
Publicado: (2024)
Thoughtbubbles: an Unsupervised Method for Parallel Thinking in Latent Space
por: Liu, Houjun, et al.
Publicado: (2025)
por: Liu, Houjun, et al.
Publicado: (2025)
Towards graph neural networks for provably solving convex optimization problems
por: Qian, Chendi, et al.
Publicado: (2025)
por: Qian, Chendi, et al.
Publicado: (2025)
Large Language Models As Evolution Strategies
por: Lange, Robert Tjarko, et al.
Publicado: (2024)
por: Lange, Robert Tjarko, et al.
Publicado: (2024)
Attending to Graph Transformers
por: Müller, Luis, et al.
Publicado: (2023)
por: Müller, Luis, et al.
Publicado: (2023)
Beyond Uniform Scaling: Exploring Depth Heterogeneity in Neural Architectures
por: T, Akash Guna R., et al.
Publicado: (2024)
por: T, Akash Guna R., et al.
Publicado: (2024)
MERGE$^3$: Efficient Evolutionary Merging on Consumer-grade GPUs
por: Mencattini, Tommaso, et al.
Publicado: (2025)
por: Mencattini, Tommaso, et al.
Publicado: (2025)
Elastic Architecture Search for Efficient Language Models
por: Wang, Shang
Publicado: (2025)
por: Wang, Shang
Publicado: (2025)
Discovering Effective Policies for Land-Use Planning with Neuroevolution
por: Young, Daniel, et al.
Publicado: (2023)
por: Young, Daniel, et al.
Publicado: (2023)
EOE: Evolutionary Optimization of Experts for Training Language Models
por: Chen, Yingshi
Publicado: (2025)
por: Chen, Yingshi
Publicado: (2025)
NNGPT: Rethinking AutoML with Large Language Models
por: Kochnev, Roman, et al.
Publicado: (2025)
por: Kochnev, Roman, et al.
Publicado: (2025)
QL-LSTM: A Parameter-Efficient LSTM for Stable Long-Sequence Modeling
por: Nti, Isaac Kofi
Publicado: (2025)
por: Nti, Isaac Kofi
Publicado: (2025)
JPC: Flexible Inference for Predictive Coding Networks in JAX
por: Innocenti, Francesco, et al.
Publicado: (2024)
por: Innocenti, Francesco, et al.
Publicado: (2024)
Large Language Models as In-context AI Generators for Quality-Diversity
por: Lim, Bryan, et al.
Publicado: (2024)
por: Lim, Bryan, et al.
Publicado: (2024)
Weight Sparsity Complements Activity Sparsity in Neuromorphic Language Models
por: Mukherji, Rishav, et al.
Publicado: (2024)
por: Mukherji, Rishav, et al.
Publicado: (2024)
Mamba-PTQ: Outlier Channels in Recurrent Large Language Models
por: Pierro, Alessandro, et al.
Publicado: (2024)
por: Pierro, Alessandro, et al.
Publicado: (2024)
Parallelization of Non-linear State-Space Models: Scaling Up Liquid-Resistance Liquid-Capacitance Networks for Efficient Sequence Modeling
por: Farsang, Mónika, et al.
Publicado: (2025)
por: Farsang, Mónika, et al.
Publicado: (2025)
SpikySpace: A Spiking State Space Model for Energy-Efficient Time Series Forecasting
por: Tang, Kaiwen, et al.
Publicado: (2026)
por: Tang, Kaiwen, et al.
Publicado: (2026)
Brain-inspired Computational Intelligence via Predictive Coding
por: Salvatori, Tommaso, et al.
Publicado: (2023)
por: Salvatori, Tommaso, et al.
Publicado: (2023)
CoEvo: Continual Evolution of Symbolic Solutions Using Large Language Models
por: Guo, Ping, et al.
Publicado: (2024)
por: Guo, Ping, et al.
Publicado: (2024)
Agent-GWO: Collaborative Agents for Dynamic Prompt Optimization in Large Language Models
por: Wang, Xudong, et al.
Publicado: (2026)
por: Wang, Xudong, et al.
Publicado: (2026)
EvoJail: Evolutionary Diverse Jailbreak Prompt Generation for Large Language Models
por: Tang, Rui, et al.
Publicado: (2026)
por: Tang, Rui, et al.
Publicado: (2026)
Towards Universal Offline Black-Box Optimization via Learning Language Model Embeddings
por: Tan, Rong-Xi, et al.
Publicado: (2025)
por: Tan, Rong-Xi, et al.
Publicado: (2025)
Mergenetic: a Simple Evolutionary Model Merging Library
por: Minut, Adrian Robert, et al.
Publicado: (2025)
por: Minut, Adrian Robert, et al.
Publicado: (2025)
SAN: Hypothesizing Long-Term Synaptic Development and Neural Engram Mechanism in Scalable Model's Parameter-Efficient Fine-Tuning
por: Dai, Gaole, et al.
Publicado: (2024)
por: Dai, Gaole, et al.
Publicado: (2024)
Self-Improving Language Models for Evolutionary Program Synthesis: A Case Study on ARC-AGI
por: Pourcel, Julien, et al.
Publicado: (2025)
por: Pourcel, Julien, et al.
Publicado: (2025)
Position: Leverage Foundational Models for Black-Box Optimization
por: Song, Xingyou, et al.
Publicado: (2024)
por: Song, Xingyou, et al.
Publicado: (2024)
MAR: Efficient Large Language Models via Module-aware Architecture Refinement
por: Cai, Junhong, et al.
Publicado: (2026)
por: Cai, Junhong, et al.
Publicado: (2026)
Physics-Guided Foundation Model for Scientific Discovery: An Application to Aquatic Science
por: Yu, Runlong, et al.
Publicado: (2025)
por: Yu, Runlong, et al.
Publicado: (2025)
Quality-Diversity Red-Teaming: Automated Generation of High-Quality and Diverse Attackers for Large Language Models
por: Wang, Ren-Jian, et al.
Publicado: (2025)
por: Wang, Ren-Jian, et al.
Publicado: (2025)
Large Language Model as Meta-Surrogate for Data-Driven Many-Task Optimization: A Proof-of-Principle Study
por: Zhang, Xian-Rong, et al.
Publicado: (2025)
por: Zhang, Xian-Rong, et al.
Publicado: (2025)
QSLM: A Performance- and Memory-aware Quantization Framework with Tiered Search Strategy for Spike-driven Language Models
por: Putra, Rachmad Vidya Wicaksana, et al.
Publicado: (2026)
por: Putra, Rachmad Vidya Wicaksana, et al.
Publicado: (2026)
W-PCA Based Gradient-Free Proxy for Efficient Search of Lightweight Language Models
por: Wang, Shang
Publicado: (2025)
por: Wang, Shang
Publicado: (2025)
FedAvgen: Metadata for Model Aggregation In Communication Systems
por: Kiggundu, Anthony, et al.
Publicado: (2025)
por: Kiggundu, Anthony, et al.
Publicado: (2025)
BiSpikCLM: A Spiking Language Model integrating Softmax-Free Spiking Attention and Spike-Aware Alignment Distillation
por: Guo, Sihang, et al.
Publicado: (2026)
por: Guo, Sihang, et al.
Publicado: (2026)
Efficient ANN-SNN Conversion with Error Compensation Learning
por: Liu, Chang, et al.
Publicado: (2025)
por: Liu, Chang, et al.
Publicado: (2025)
Evolution Meets Diffusion: Efficient Neural Architecture Generation
por: Zhou, Bingye, et al.
Publicado: (2025)
por: Zhou, Bingye, et al.
Publicado: (2025)
A Simple and Efficient Approach to Batch Bayesian Optimization
por: Zhan, Dawei, et al.
Publicado: (2024)
por: Zhan, Dawei, et al.
Publicado: (2024)
A Hybrid Swarm Intelligence Approach for Optimizing Multimodal Large Language Models Deployment in Edge-Cloud-based Federated Learning Environments
por: Rjouba, Gaith, et al.
Publicado: (2025)
por: Rjouba, Gaith, et al.
Publicado: (2025)
Ejemplares similares
-
Recurrent Neural Networks Learn to Store and Generate Sequences using Non-Linear Representations
por: Csordás, Róbert, et al.
Publicado: (2024) -
MoEUT: Mixture-of-Experts Universal Transformers
por: Csordás, Róbert, et al.
Publicado: (2024) -
Thoughtbubbles: an Unsupervised Method for Parallel Thinking in Latent Space
por: Liu, Houjun, et al.
Publicado: (2025) -
Towards graph neural networks for provably solving convex optimization problems
por: Qian, Chendi, et al.
Publicado: (2025) -
Large Language Models As Evolution Strategies
por: Lange, Robert Tjarko, et al.
Publicado: (2024)