The Free Transformer
Fuente:
arXiv
Guardado en:
| Autor principal: | Fleuret, François |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Solvation Free Energies from Neural Thermodynamic Integration
por: Máté, Bálint, et al.
Publicado: (2024)
por: Máté, Bálint, et al.
Publicado: (2024)
Neural Thermodynamic Integration: Free Energies from Energy-based Diffusion Models
por: Máté, Bálint, et al.
Publicado: (2024)
por: Máté, Bálint, et al.
Publicado: (2024)
AA-SVD : Anchored and Adaptive SVD for Large Language Model Compression
por: Sinha, Atul Kumar, et al.
Publicado: (2026)
por: Sinha, Atul Kumar, et al.
Publicado: (2026)
DenseFormer: Enhancing Information Flow in Transformers via Depth Weighted Averaging
por: Pagliardini, Matteo, et al.
Publicado: (2024)
por: Pagliardini, Matteo, et al.
Publicado: (2024)
Pareto Low-Rank Adapters: Efficient Multi-Task Learning with Preferences
por: Dimitriadis, Nikolaos, et al.
Publicado: (2024)
por: Dimitriadis, Nikolaos, et al.
Publicado: (2024)
Multi-Lattice Sampling of Quantum Field Theories via Neural Operator-based Flows
por: Máté, Bálint, et al.
Publicado: (2024)
por: Máté, Bálint, et al.
Publicado: (2024)
σ-GPTs: A New Approach to Autoregressive Models
por: Pannatier, Arnaud, et al.
Publicado: (2024)
por: Pannatier, Arnaud, et al.
Publicado: (2024)
Inference from Real-World Sparse Measurements
por: Pannatier, Arnaud, et al.
Publicado: (2022)
por: Pannatier, Arnaud, et al.
Publicado: (2022)
Efficient World Models with Context-Aware Tokenization
por: Micheli, Vincent, et al.
Publicado: (2024)
por: Micheli, Vincent, et al.
Publicado: (2024)
Leveraging the true depth of LLMs
por: González, Ramón Calvo, et al.
Publicado: (2025)
por: González, Ramón Calvo, et al.
Publicado: (2025)
Localizing Task Information for Improved Model Merging and Compression
por: Wang, Ke, et al.
Publicado: (2024)
por: Wang, Ke, et al.
Publicado: (2024)
The Quantization Benefits of Residual-Free Transformers
por: Ji, Yiping, et al.
Publicado: (2026)
por: Ji, Yiping, et al.
Publicado: (2026)
Transformers know more than they can tell -- Learning the Collatz sequence
por: Charton, François, et al.
Publicado: (2025)
por: Charton, François, et al.
Publicado: (2025)
Cutting the Skip: Training Residual-Free Transformers
por: Ji, Yiping, et al.
Publicado: (2025)
por: Ji, Yiping, et al.
Publicado: (2025)
Quantization-Free Autoregressive Action Transformer
por: Sheebaelhamd, Ziyad, et al.
Publicado: (2025)
por: Sheebaelhamd, Ziyad, et al.
Publicado: (2025)
End-to-End Optimal Detector Design with Mutual Information Surrogates
por: Wozniak, Kinga Anna, et al.
Publicado: (2025)
por: Wozniak, Kinga Anna, et al.
Publicado: (2025)
Training-Free Looped Transformers
por: Chen, Lizhang, et al.
Publicado: (2026)
por: Chen, Lizhang, et al.
Publicado: (2026)
LiNeS: Post-training Layer Scaling Prevents Forgetting and Enhances Model Merging
por: Wang, Ke, et al.
Publicado: (2024)
por: Wang, Ke, et al.
Publicado: (2024)
Template-Free Retrosynthesis with Graph-Prior Augmented Transformers
por: Zhao, Youjun
Publicado: (2025)
por: Zhao, Youjun
Publicado: (2025)
Subcritical Signal Propagation at Initialization in Normalization-Free Transformers
por: Alekseev, Sergey
Publicado: (2026)
por: Alekseev, Sergey
Publicado: (2026)
Projection-Free Transformers via Gaussian Kernel Attention
por: Kundu, Debarshi, et al.
Publicado: (2026)
por: Kundu, Debarshi, et al.
Publicado: (2026)
A Free Probabilistic Framework for Analyzing the Transformer-based Language Models
por: Das, Swagatam
Publicado: (2025)
por: Das, Swagatam
Publicado: (2025)
Training-Free Adaptation of Diffusion Models via Doob's $h$-Transform
por: Zhu, Qijie, et al.
Publicado: (2026)
por: Zhu, Qijie, et al.
Publicado: (2026)
Training-Free Data Assimilation with GenCast
por: Savary, Thomas, et al.
Publicado: (2025)
por: Savary, Thomas, et al.
Publicado: (2025)
Training-Free Bayesian Filtering with Generative Emulators
por: Savary, Thomas, et al.
Publicado: (2026)
por: Savary, Thomas, et al.
Publicado: (2026)
Hadamax Encoding: Elevating Performance in Model-Free Atari
por: Kooi, Jacob E., et al.
Publicado: (2025)
por: Kooi, Jacob E., et al.
Publicado: (2025)
Pruning and Malicious Injection: A Retraining-Free Backdoor Attack on Transformer Models
por: Zhao, Taibiao, et al.
Publicado: (2025)
por: Zhao, Taibiao, et al.
Publicado: (2025)
DyTTP: Trajectory Prediction with Normalization-Free Transformers
por: Zhu, JianLin, et al.
Publicado: (2025)
por: Zhu, JianLin, et al.
Publicado: (2025)
Diffusion for World Modeling: Visual Details Matter in Atari
por: Alonso, Eloi, et al.
Publicado: (2024)
por: Alonso, Eloi, et al.
Publicado: (2024)
InfoMamba: An Attention-Free Hybrid Mamba-Transformer Model
por: Wang, Youjin, et al.
Publicado: (2026)
por: Wang, Youjin, et al.
Publicado: (2026)
Robust Dequantization of the Quantum Singular value Transformation and Quantum Machine Learning Algorithms
por: Gall, François Le
Publicado: (2023)
por: Gall, François Le
Publicado: (2023)
Collapse-Free Prototype Readout Layer for Transformer Encoders
por: Cirrincione, Giansalvo, et al.
Publicado: (2026)
por: Cirrincione, Giansalvo, et al.
Publicado: (2026)
On Dimension-Free Transformer: An Application of STP to AI
por: Cheng, Daizhan
Publicado: (2025)
por: Cheng, Daizhan
Publicado: (2025)
Training-Free ANN-to-SNN Conversion for High-Performance Spiking Transformer
por: Wang, Jingya, et al.
Publicado: (2025)
por: Wang, Jingya, et al.
Publicado: (2025)
SGFormer: Single-Layer Graph Transformers with Approximation-Free Linear Complexity
por: Wu, Qitian, et al.
Publicado: (2024)
por: Wu, Qitian, et al.
Publicado: (2024)
FLUID: Continuous-Time Hyperconnected Sparse Transformer for Sink-Free Learning
por: Razzaq, Waleed, et al.
Publicado: (2026)
por: Razzaq, Waleed, et al.
Publicado: (2026)
Calibration and Transformation-Free Weight-Only LLMs Quantization via Dynamic Grouping
por: Zheng, Xinzhe, et al.
Publicado: (2025)
por: Zheng, Xinzhe, et al.
Publicado: (2025)
ART: Artifact Removal Transformer for Reconstructing Noise-Free Multichannel Electroencephalographic Signals
por: Chuang, Chun-Hsiang, et al.
Publicado: (2024)
por: Chuang, Chun-Hsiang, et al.
Publicado: (2024)
Training-Free Spectral Fingerprints of Voice Processing in Transformers
por: Noël, Valentin
Publicado: (2025)
por: Noël, Valentin
Publicado: (2025)
Learning Diffusion Priors from Observations by Expectation Maximization
por: Rozet, François, et al.
Publicado: (2024)
por: Rozet, François, et al.
Publicado: (2024)
Ejemplares similares
-
Solvation Free Energies from Neural Thermodynamic Integration
por: Máté, Bálint, et al.
Publicado: (2024) -
Neural Thermodynamic Integration: Free Energies from Energy-based Diffusion Models
por: Máté, Bálint, et al.
Publicado: (2024) -
AA-SVD : Anchored and Adaptive SVD for Large Language Model Compression
por: Sinha, Atul Kumar, et al.
Publicado: (2026) -
DenseFormer: Enhancing Information Flow in Transformers via Depth Weighted Averaging
por: Pagliardini, Matteo, et al.
Publicado: (2024) -
Pareto Low-Rank Adapters: Efficient Multi-Task Learning with Preferences
por: Dimitriadis, Nikolaos, et al.
Publicado: (2024)