Enregistré dans:
| Auteurs principaux: | Jantsch, Lasse Marten, Koh, Dong-Jae, Lee, Seonghyeon, Suh, Young-Kyoon |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2603.19742 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Depth Registers Unlock W4A4 on SwiGLU: A Reader/Generator Decomposition
par: Liu, Ziyang
Publié: (2026)
par: Liu, Ziyang
Publié: (2026)
AudioMAE++: learning better masked audio representations with SwiGLU FFNs
par: Yadav, Sarthak, et autres
Publié: (2025)
par: Yadav, Sarthak, et autres
Publié: (2025)
LoLA-SpecViT: Local Attention SwiGLU Vision Transformer with LoRA for Hyperspectral Imaging
par: Zidi, Fadi Abdeladhim, et autres
Publié: (2025)
par: Zidi, Fadi Abdeladhim, et autres
Publié: (2025)
Symmetry-Compatible Principle for Optimizer Design: Embeddings, LM Heads, SwiGLU MLPs, and MoE Routers
par: Lau, Tim Tsz-Kit, et autres
Publié: (2026)
par: Lau, Tim Tsz-Kit, et autres
Publié: (2026)
Hidden Heroes and Gradient Bloats: Layer-Wise Redundancy Inverts Attribution in Transformers
par: Ye, Donald
Publié: (2026)
par: Ye, Donald
Publié: (2026)
GLU Attention Improve Transformer
par: Wang, Zehao
Publié: (2025)
par: Wang, Zehao
Publié: (2025)
AttnLRP: Attention-Aware Layer-Wise Relevance Propagation for Transformers
par: Achtibat, Reduan, et autres
Publié: (2024)
par: Achtibat, Reduan, et autres
Publié: (2024)
Table Transformers for Imputing Textual Attributes
par: Wei, Ting-Ruen, et autres
Publié: (2024)
par: Wei, Ting-Ruen, et autres
Publié: (2024)
GLUScope: A Tool for Analyzing GLU Neurons in Transformer Language Models
par: Gerstner, Sebastian, et autres
Publié: (2026)
par: Gerstner, Sebastian, et autres
Publié: (2026)
Explanation Regularisation through the Lens of Attributions
par: Ferreira, Pedro, et autres
Publié: (2024)
par: Ferreira, Pedro, et autres
Publié: (2024)
Reliable, Adaptable, and Attributable Language Models with Retrieval
par: Asai, Akari, et autres
Publié: (2024)
par: Asai, Akari, et autres
Publié: (2024)
SwiReasoning: Switch-Thinking in Latent and Explicit for Pareto-Superior Reasoning LLMs
par: Shi, Dachuan, et autres
Publié: (2025)
par: Shi, Dachuan, et autres
Publié: (2025)
Approximate Attributions for Off-the-Shelf Siamese Transformers
par: Möller, Lucas, et autres
Publié: (2024)
par: Möller, Lucas, et autres
Publié: (2024)
Dual Perspectives in Emotion Attribution: A Generator-Interpreter Framework for Cross-Cultural Analysis of Emotion in LLMs
par: Turdubaeva, Aizirek, et autres
Publié: (2026)
par: Turdubaeva, Aizirek, et autres
Publié: (2026)
Attribution functionalism
par: Mark Phelan
Publié: (2025)
par: Mark Phelan
Publié: (2025)
Efficient Text-Attributed Graph Learning through Selective Annotation and Graph Alignment
par: Xie, Huanyi, et autres
Publié: (2025)
par: Xie, Huanyi, et autres
Publié: (2025)
SwiLTra-Bench: The Swiss Legal Translation Benchmark
par: Niklaus, Joel, et autres
Publié: (2025)
par: Niklaus, Joel, et autres
Publié: (2025)
Adaptive Layer Selection for Layer-Wise Token Pruning in LLM Inference
par: Taniguchi, Rei, et autres
Publié: (2026)
par: Taniguchi, Rei, et autres
Publié: (2026)
Multi-Attribute Steering of Language Models via Targeted Intervention
par: Nguyen, Duy, et autres
Publié: (2025)
par: Nguyen, Duy, et autres
Publié: (2025)
AttributionBench: How Hard is Automatic Attribution Evaluation?
par: Li, Yifei, et autres
Publié: (2024)
par: Li, Yifei, et autres
Publié: (2024)
LLMCache: Layer-Wise Caching Strategies for Accelerated Reuse in Transformer Inference
par: Bansal, Harsh Vardhan
Publié: (2025)
par: Bansal, Harsh Vardhan
Publié: (2025)
Advancing Attribution-Based Neural Network Explainability through Relative Absolute Magnitude Layer-Wise Relevance Propagation and Multi-Component Evaluation
par: Vukadin, Davor, et autres
Publié: (2024)
par: Vukadin, Davor, et autres
Publié: (2024)
Prune, Interpret, Evaluate: A Cross-Layer Transcoder-Native Framework for Efficient Circuit Discovery via Feature Attribution
par: Chen, Qinhao, et autres
Publié: (2026)
par: Chen, Qinhao, et autres
Publié: (2026)
VISTA: Visualization of Token Attribution via Efficient Analysis
par: Ahmed, Syed, et autres
Publié: (2026)
par: Ahmed, Syed, et autres
Publié: (2026)
KoDialogBench: Evaluating Conversational Understanding of Language Models with Korean Dialogue Benchmark
par: Jang, Seongbo, et autres
Publié: (2024)
par: Jang, Seongbo, et autres
Publié: (2024)
CLT-Forge: A Scalable Library for Cross-Layer Transcoders and Attribution Graphs
par: Draye, Florent, et autres
Publié: (2026)
par: Draye, Florent, et autres
Publié: (2026)
Learning to Attribute with Attention
par: Cohen-Wang, Benjamin, et autres
Publié: (2025)
par: Cohen-Wang, Benjamin, et autres
Publié: (2025)
Advancing Large Language Model Attribution through Self-Improving
par: Huang, Lei, et autres
Publié: (2024)
par: Huang, Lei, et autres
Publié: (2024)
Bias Analysis and Mitigation through Protected Attribute Detection and Regard Classification
par: Udagawa, Takuma, et autres
Publié: (2025)
par: Udagawa, Takuma, et autres
Publié: (2025)
Fine-grained Analysis of Brain-LLM Alignment through Input Attribution
par: Proietti, Michela, et autres
Publié: (2025)
par: Proietti, Michela, et autres
Publié: (2025)
One Arrow, Many Targets: Probing LLMs for Multi-Attribute Controllable Text Summarization
par: Roy, Tathagato, et autres
Publié: (2024)
par: Roy, Tathagato, et autres
Publié: (2024)
Efficient Estimation of Kernel Surrogate Models for Task Attribution
par: Zhang, Zhenshuo, et autres
Publié: (2026)
par: Zhang, Zhenshuo, et autres
Publié: (2026)
Evaluating the Smooth Control of Attribute Intensity in Text Generation with LLMs
par: Zhou, Shang, et autres
Publié: (2024)
par: Zhou, Shang, et autres
Publié: (2024)
Learning to Explain: Supervised Token Attribution from Transformer Attention Patterns
par: Mihaila, George
Publié: (2026)
par: Mihaila, George
Publié: (2026)
Mitigating Quantization Errors Due to Activation Spikes in GLU-Based LLMs
par: Yang, Jaewoo, et autres
Publié: (2024)
par: Yang, Jaewoo, et autres
Publié: (2024)
On the Effectiveness of Integration Methods for Multimodal Dialogue Response Retrieval
par: Jang, Seongbo, et autres
Publié: (2025)
par: Jang, Seongbo, et autres
Publié: (2025)
Improving Attributed Long-form Question Answering with Intent Awareness
par: Zhao, Xinran, et autres
Publié: (2026)
par: Zhao, Xinran, et autres
Publié: (2026)
Measuring and Enhancing Trustworthiness of LLMs in RAG through Grounded Attributions and Learning to Refuse
par: Song, Maojia, et autres
Publié: (2024)
par: Song, Maojia, et autres
Publié: (2024)
MentalAgora: A Gateway to Advanced Personalized Care in Mental Health through Multi-Agent Debating and Attribute Control
par: Lee, Yeonji, et autres
Publié: (2024)
par: Lee, Yeonji, et autres
Publié: (2024)
ExpertQA: Expert-Curated Questions and Attributed Answers
par: Malaviya, Chaitanya, et autres
Publié: (2023)
par: Malaviya, Chaitanya, et autres
Publié: (2023)
Documents similaires
-
Depth Registers Unlock W4A4 on SwiGLU: A Reader/Generator Decomposition
par: Liu, Ziyang
Publié: (2026) -
AudioMAE++: learning better masked audio representations with SwiGLU FFNs
par: Yadav, Sarthak, et autres
Publié: (2025) -
LoLA-SpecViT: Local Attention SwiGLU Vision Transformer with LoRA for Hyperspectral Imaging
par: Zidi, Fadi Abdeladhim, et autres
Publié: (2025) -
Symmetry-Compatible Principle for Optimizer Design: Embeddings, LM Heads, SwiGLU MLPs, and MoE Routers
par: Lau, Tim Tsz-Kit, et autres
Publié: (2026) -
Hidden Heroes and Gradient Bloats: Layer-Wise Redundancy Inverts Attribution in Transformers
par: Ye, Donald
Publié: (2026)