Salvato in:
| Autori principali: | He, Zhengfu, Shu, Wentao, Ge, Xuyang, Chen, Lingjie, Wang, Junxuan, Zhou, Yunhua, Liu, Frances, Guo, Qipeng, Huang, Xuanjing, Wu, Zuxuan, Jiang, Yu-Gang, Qiu, Xipeng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2410.20526 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Dimensional Collapse in Transformer Attention Outputs: A Challenge for Sparse Dictionary Learning
di: Wang, Junxuan, et al.
Pubblicazione: (2025)
di: Wang, Junxuan, et al.
Pubblicazione: (2025)
Towards Universality: Studying Mechanistic Similarity Across Language Model Architectures
di: Wang, Junxuan, et al.
Pubblicazione: (2024)
di: Wang, Junxuan, et al.
Pubblicazione: (2024)
Automatically Identifying Local and Global Circuits with Linear Computation Graphs
di: Ge, Xuyang, et al.
Pubblicazione: (2024)
di: Ge, Xuyang, et al.
Pubblicazione: (2024)
Evolution of Concepts in Language Model Pre-Training
di: Ge, Xuyang, et al.
Pubblicazione: (2025)
di: Ge, Xuyang, et al.
Pubblicazione: (2025)
Towards Understanding the Nature of Attention with Low-Rank Sparse Decomposition
di: He, Zhengfu, et al.
Pubblicazione: (2025)
di: He, Zhengfu, et al.
Pubblicazione: (2025)
Tracing the Thought of a Grandmaster-level Chess-Playing Transformer
di: Lin, Rui, et al.
Pubblicazione: (2026)
di: Lin, Rui, et al.
Pubblicazione: (2026)
A Distributional View for Visual Mechanistic Interpretability: KL-Minimal Soft-Constraint Principle
di: Zhou, Guancheng, et al.
Pubblicazione: (2026)
di: Zhou, Guancheng, et al.
Pubblicazione: (2026)
Dictionary Learning Improves Patch-Free Circuit Discovery in Mechanistic Interpretability: A Case Study on Othello-GPT
di: He, Zhengfu, et al.
Pubblicazione: (2024)
di: He, Zhengfu, et al.
Pubblicazione: (2024)
MGH Radiology Llama: A Llama 3 70B Model for Radiology
di: Shi, Yucheng, et al.
Pubblicazione: (2024)
di: Shi, Yucheng, et al.
Pubblicazione: (2024)
How to Set the Learning Rate for Large-Scale Pre-training?
di: Zhou, Yunhua, et al.
Pubblicazione: (2026)
di: Zhou, Yunhua, et al.
Pubblicazione: (2026)
ChocoLlama: Lessons Learned From Teaching Llamas Dutch
di: Meeus, Matthieu, et al.
Pubblicazione: (2024)
di: Meeus, Matthieu, et al.
Pubblicazione: (2024)
Llama-Mob: Instruction-Tuning Llama-3-8B Excels in City-Scale Mobility Prediction
di: Tang, Peizhi, et al.
Pubblicazione: (2024)
di: Tang, Peizhi, et al.
Pubblicazione: (2024)
Scaling of Search and Learning: A Roadmap to Reproduce o1 from Reinforcement Learning Perspective
di: Zeng, Zhiyuan, et al.
Pubblicazione: (2024)
di: Zeng, Zhiyuan, et al.
Pubblicazione: (2024)
LlamaF: An Efficient Llama2 Architecture Accelerator on Embedded FPGAs
di: Xu, Han, et al.
Pubblicazione: (2024)
di: Xu, Han, et al.
Pubblicazione: (2024)
How Attention Sinks Emerge in Large Language Models: An Interpretability Perspective
di: Peng, Runyu, et al.
Pubblicazione: (2026)
di: Peng, Runyu, et al.
Pubblicazione: (2026)
Llama-3.1-FoundationAI-SecurityLLM-8B-Instruct Technical Report
di: Weerawardhena, Sajana, et al.
Pubblicazione: (2025)
di: Weerawardhena, Sajana, et al.
Pubblicazione: (2025)
CaTok: Taming Mean Flows for One-Dimensional Causal Image Tokenization
di: Chen, Yitong, et al.
Pubblicazione: (2026)
di: Chen, Yitong, et al.
Pubblicazione: (2026)
Llama See, Llama Do: A Mechanistic Perspective on Contextual Entrainment and Distraction in LLMs
di: Niu, Jingcheng, et al.
Pubblicazione: (2025)
di: Niu, Jingcheng, et al.
Pubblicazione: (2025)
Llama-3.1-FoundationAI-SecurityLLM-Reasoning-8B Technical Report
di: Yang, Zhuoran, et al.
Pubblicazione: (2026)
di: Yang, Zhuoran, et al.
Pubblicazione: (2026)
The Llama 3 Herd of Models
di: Grattafiori, Aaron, et al.
Pubblicazione: (2024)
di: Grattafiori, Aaron, et al.
Pubblicazione: (2024)
Llama-3.1-FoundationAI-SecurityLLM-Base-8B Technical Report
di: Kassianik, Paul, et al.
Pubblicazione: (2025)
di: Kassianik, Paul, et al.
Pubblicazione: (2025)
BadLlama: cheaply removing safety fine-tuning from Llama 2-Chat 13B
di: Gade, Pranav, et al.
Pubblicazione: (2023)
di: Gade, Pranav, et al.
Pubblicazione: (2023)
Explicit Multi-head Attention for Inter-head Interaction in Large Language Models
di: Peng, Runyu, et al.
Pubblicazione: (2026)
di: Peng, Runyu, et al.
Pubblicazione: (2026)
Data-free Weight Compress and Denoise for Large Language Models
di: Peng, Runyu, et al.
Pubblicazione: (2024)
di: Peng, Runyu, et al.
Pubblicazione: (2024)
Llama-Nemotron: Efficient Reasoning Models
di: Bercovich, Akhiad, et al.
Pubblicazione: (2025)
di: Bercovich, Akhiad, et al.
Pubblicazione: (2025)
Llama olímpica ilumina el Qomolangma
Pubblicazione: (2008)
Pubblicazione: (2008)
Llama olímpica ilumina el Qomolangma
Pubblicazione: (2008)
Pubblicazione: (2008)
a¿Que Se Llama Que?
di: Biol. Mar. Moreno Salas, G
Pubblicazione: (1994)
di: Biol. Mar. Moreno Salas, G
Pubblicazione: (1994)
Llamas: diagnóstico eficaz del Rotavirus
di: Camila Pía Gandía
Pubblicazione: (2016)
di: Camila Pía Gandía
Pubblicazione: (2016)
Llanimation: Llama Driven Gesture Animation
di: J. Windle, et al.
Pubblicazione: (2024)
di: J. Windle, et al.
Pubblicazione: (2024)
Model Inversion Attacks on Llama 3: Extracting PII from Large Language Models
di: Sivashanmugam, Sathesh P.
Pubblicazione: (2025)
di: Sivashanmugam, Sathesh P.
Pubblicazione: (2025)
ARISE: An Adaptive Resolution-Aware Metric for Test-Time Scaling Evaluation in Large Reasoning Models
di: Yin, Zhangyue, et al.
Pubblicazione: (2025)
di: Yin, Zhangyue, et al.
Pubblicazione: (2025)
Llama 3 Meets MoE: Efficient Upcycling
di: Vavre, Aditya, et al.
Pubblicazione: (2024)
di: Vavre, Aditya, et al.
Pubblicazione: (2024)
Applying Refusal-Vector Ablation to Llama 3.1 70B Agents
di: Lermen, Simon, et al.
Pubblicazione: (2024)
di: Lermen, Simon, et al.
Pubblicazione: (2024)
Constitution or Collapse? Exploring Constitutional AI with Llama 3-8B
di: Zhang, Xue
Pubblicazione: (2025)
di: Zhang, Xue
Pubblicazione: (2025)
Llama-Affinity: A Predictive Antibody Antigen Binding Model Integrating Antibody Sequences with Llama3 Backbone Architecture
di: Hossain, Delower, et al.
Pubblicazione: (2025)
di: Hossain, Delower, et al.
Pubblicazione: (2025)
To Err Is Human, but Llamas Can Learn It Too
di: Luhtaru, Agnes, et al.
Pubblicazione: (2024)
di: Luhtaru, Agnes, et al.
Pubblicazione: (2024)
The Mamba in the Llama: Distilling and Accelerating Hybrid Models
di: Wang, Junxiong, et al.
Pubblicazione: (2024)
di: Wang, Junxiong, et al.
Pubblicazione: (2024)
Code Llama: Open Foundation Models for Code
di: Rozière, Baptiste, et al.
Pubblicazione: (2023)
di: Rozière, Baptiste, et al.
Pubblicazione: (2023)
BanglaLlama: LLaMA for Bangla Language
di: Zehady, Abdullah Khan, et al.
Pubblicazione: (2024)
di: Zehady, Abdullah Khan, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Dimensional Collapse in Transformer Attention Outputs: A Challenge for Sparse Dictionary Learning
di: Wang, Junxuan, et al.
Pubblicazione: (2025) -
Towards Universality: Studying Mechanistic Similarity Across Language Model Architectures
di: Wang, Junxuan, et al.
Pubblicazione: (2024) -
Automatically Identifying Local and Global Circuits with Linear Computation Graphs
di: Ge, Xuyang, et al.
Pubblicazione: (2024) -
Evolution of Concepts in Language Model Pre-Training
di: Ge, Xuyang, et al.
Pubblicazione: (2025) -
Towards Understanding the Nature of Attention with Low-Rank Sparse Decomposition
di: He, Zhengfu, et al.
Pubblicazione: (2025)