Salvato in:
| Autore principale: | Choi, Sehyun |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2404.02684 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Decoupling Knowledge and Reasoning in Transformers: A Modular Architecture with Generalized Cross-Attention
di: Guo, Zhenyu, et al.
Pubblicazione: (2025)
di: Guo, Zhenyu, et al.
Pubblicazione: (2025)
Your Transformer is Secretly Linear
di: Razzhigaev, Anton, et al.
Pubblicazione: (2024)
di: Razzhigaev, Anton, et al.
Pubblicazione: (2024)
The Markovian Thinker: Architecture-Agnostic Linear Scaling of Reasoning
di: Aghajohari, Milad, et al.
Pubblicazione: (2025)
di: Aghajohari, Milad, et al.
Pubblicazione: (2025)
Archon: An Architecture Search Framework for Inference-Time Techniques
di: Saad-Falcon, Jon, et al.
Pubblicazione: (2024)
di: Saad-Falcon, Jon, et al.
Pubblicazione: (2024)
Transformers Learn to Achieve Second-Order Convergence Rates for In-Context Linear Regression
di: Fu, Deqing, et al.
Pubblicazione: (2023)
di: Fu, Deqing, et al.
Pubblicazione: (2023)
Green Prompting: Characterizing Prompt-driven Energy Costs of LLM Inference
di: Adamska, Marta, et al.
Pubblicazione: (2025)
di: Adamska, Marta, et al.
Pubblicazione: (2025)
Does Transformer Interpretability Transfer to RNNs?
di: Paulo, Gonçalo, et al.
Pubblicazione: (2024)
di: Paulo, Gonçalo, et al.
Pubblicazione: (2024)
Supernova: Achieving More with Less in Transformer Architectures
di: Tanase, Andrei-Valentin, et al.
Pubblicazione: (2025)
di: Tanase, Andrei-Valentin, et al.
Pubblicazione: (2025)
Residual Stream Duality in Modern Transformer Architectures
di: Zhang, Yifan
Pubblicazione: (2026)
di: Zhang, Yifan
Pubblicazione: (2026)
Pyramid MoA: A Probabilistic Framework for Cost-Optimized Anytime Inference
di: Khaled, Arindam
Pubblicazione: (2026)
di: Khaled, Arindam
Pubblicazione: (2026)
Peri-LN: Revisiting Normalization Layer in the Transformer Architecture
di: Kim, Jeonghoon, et al.
Pubblicazione: (2025)
di: Kim, Jeonghoon, et al.
Pubblicazione: (2025)
On the Robustness of Transformers against Context Hijacking for Linear Classification
di: Li, Tianle, et al.
Pubblicazione: (2025)
di: Li, Tianle, et al.
Pubblicazione: (2025)
HARP: Hesitation-Aware Reframing in Transformer Inference Pass
di: Storaï, Romain, et al.
Pubblicazione: (2024)
di: Storaï, Romain, et al.
Pubblicazione: (2024)
Accelerating Transformer Inference for Translation via Parallel Decoding
di: Santilli, Andrea, et al.
Pubblicazione: (2023)
di: Santilli, Andrea, et al.
Pubblicazione: (2023)
Language-specific Neurons Do Not Facilitate Cross-Lingual Transfer
di: Mondal, Soumen Kumar, et al.
Pubblicazione: (2025)
di: Mondal, Soumen Kumar, et al.
Pubblicazione: (2025)
The Dual-Stream Transformer: Channelized Architecture for Interpretable Language Modeling
di: Kerce, J. Clayton, et al.
Pubblicazione: (2026)
di: Kerce, J. Clayton, et al.
Pubblicazione: (2026)
Linear Representation Transferability Hypothesis: Leveraging Small Models to Steer Large Models
di: Bello, Femi, et al.
Pubblicazione: (2025)
di: Bello, Femi, et al.
Pubblicazione: (2025)
Block Transformer: Global-to-Local Language Modeling for Fast Inference
di: Ho, Namgyu, et al.
Pubblicazione: (2024)
di: Ho, Namgyu, et al.
Pubblicazione: (2024)
KV Cache Transform Coding for Compact Storage in LLM Inference
di: Staniszewski, Konrad, et al.
Pubblicazione: (2025)
di: Staniszewski, Konrad, et al.
Pubblicazione: (2025)
Analyzing the Evaluation of Cross-Lingual Knowledge Transfer in Multilingual Language Models
di: Rajaee, Sara, et al.
Pubblicazione: (2024)
di: Rajaee, Sara, et al.
Pubblicazione: (2024)
A Differentiable Integer Linear Programming Solver for Explanation-Based Natural Language Inference
di: Thayaparan, Mokanarangan, et al.
Pubblicazione: (2024)
di: Thayaparan, Mokanarangan, et al.
Pubblicazione: (2024)
Efficient Systematic Reviews: Literature Filtering with Transformers & Transfer Learning
di: Hawkins, John, et al.
Pubblicazione: (2024)
di: Hawkins, John, et al.
Pubblicazione: (2024)
ORPO-Distill: Mixed-Policy Preference Optimization for Cross-Architecture LLM Distillation
di: Singh, Aasheesh, et al.
Pubblicazione: (2025)
di: Singh, Aasheesh, et al.
Pubblicazione: (2025)
Hybrid Linear Attention Done Right: Efficient Distillation and Effective Architectures for Extremely Long Contexts
di: Chen, Yingfa, et al.
Pubblicazione: (2026)
di: Chen, Yingfa, et al.
Pubblicazione: (2026)
Multi-Layer Transformers Gradient Can be Approximated in Almost Linear Time
di: Liang, Yingyu, et al.
Pubblicazione: (2024)
di: Liang, Yingyu, et al.
Pubblicazione: (2024)
LEAP: Layer-wise Exit-Aware Pretraining for Efficient Transformer Inference
di: Kapadia, Shashank, et al.
Pubblicazione: (2026)
di: Kapadia, Shashank, et al.
Pubblicazione: (2026)
PromptIntern: Saving Inference Costs by Internalizing Recurrent Prompt during Large Language Model Fine-tuning
di: Zou, Jiaru, et al.
Pubblicazione: (2024)
di: Zou, Jiaru, et al.
Pubblicazione: (2024)
Layer Swapping for Zero-Shot Cross-Lingual Transfer in Large Language Models
di: Bandarkar, Lucas, et al.
Pubblicazione: (2024)
di: Bandarkar, Lucas, et al.
Pubblicazione: (2024)
Culinary Class Wars: Evaluating LLMs using ASH in Cuisine Transfer Task
di: Lee, Hoonick, et al.
Pubblicazione: (2024)
di: Lee, Hoonick, et al.
Pubblicazione: (2024)
mini-vec2vec: Scaling Universal Geometry Alignment with Linear Transformations
di: Dar, Guy
Pubblicazione: (2025)
di: Dar, Guy
Pubblicazione: (2025)
ReplaceMe: Network Simplification via Depth Pruning and Transformer Block Linearization
di: Shopkhoev, Dmitriy, et al.
Pubblicazione: (2025)
di: Shopkhoev, Dmitriy, et al.
Pubblicazione: (2025)
SwiftKV: Fast Prefill-Optimized Inference with Knowledge-Preserving Model Transformation
di: Qiao, Aurick, et al.
Pubblicazione: (2024)
di: Qiao, Aurick, et al.
Pubblicazione: (2024)
Grouped Sequency-arranged Rotation: Optimizing Rotation Transformation for Quantization for Free
di: Choi, Euntae, et al.
Pubblicazione: (2025)
di: Choi, Euntae, et al.
Pubblicazione: (2025)
What Is the Minimum Architecture for Prolepsis? Early Irrevocable Commitment Across Tasks in Small Transformers
di: Jacopin, Éric
Pubblicazione: (2026)
di: Jacopin, Éric
Pubblicazione: (2026)
Linear Chain Transformation: Expanding Optimization Dynamics for Fine-Tuning Large Language Models
di: Wang, Yulong, et al.
Pubblicazione: (2024)
di: Wang, Yulong, et al.
Pubblicazione: (2024)
Circuit Complexity Bounds for RoPE-based Transformer Architecture
di: Chen, Bo, et al.
Pubblicazione: (2024)
di: Chen, Bo, et al.
Pubblicazione: (2024)
M2R2: Mixture of Multi-Rate Residuals for Efficient Transformer Inference
di: Bhendawade, Nikhil, et al.
Pubblicazione: (2025)
di: Bhendawade, Nikhil, et al.
Pubblicazione: (2025)
LEIA: Facilitating Cross-lingual Knowledge Transfer in Language Models with Entity-based Data Augmentation
di: Yamada, Ikuya, et al.
Pubblicazione: (2024)
di: Yamada, Ikuya, et al.
Pubblicazione: (2024)
Few-Shot Cross-Lingual Transfer for Prompting Large Language Models in Low-Resource Languages
di: Toukmaji, Christopher
Pubblicazione: (2024)
di: Toukmaji, Christopher
Pubblicazione: (2024)
Identifying the Correlation Between Language Distance and Cross-Lingual Transfer in a Multilingual Representation Space
di: Philippy, Fred, et al.
Pubblicazione: (2023)
di: Philippy, Fred, et al.
Pubblicazione: (2023)
Documenti analoghi
-
Decoupling Knowledge and Reasoning in Transformers: A Modular Architecture with Generalized Cross-Attention
di: Guo, Zhenyu, et al.
Pubblicazione: (2025) -
Your Transformer is Secretly Linear
di: Razzhigaev, Anton, et al.
Pubblicazione: (2024) -
The Markovian Thinker: Architecture-Agnostic Linear Scaling of Reasoning
di: Aghajohari, Milad, et al.
Pubblicazione: (2025) -
Archon: An Architecture Search Framework for Inference-Time Techniques
di: Saad-Falcon, Jon, et al.
Pubblicazione: (2024) -
Transformers Learn to Achieve Second-Order Convergence Rates for In-Context Linear Regression
di: Fu, Deqing, et al.
Pubblicazione: (2023)