Llama SLayer 8B: Shallow Layers Hold the Key to Knowledge Injection
Fuente:
arXiv
Guardado en:
| Autores principales: | Chen, Tianxiang, Tan, Zhentao, Gong, Tao, Wu, Yue, Chu, Qi, Liu, Bin, Ye, Jieping, Yu, Nenghai |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Flora: Effortless Context Construction to Arbitrary Length and Scale
por: Chen, Tianxiang, et al.
Publicado: (2025)
por: Chen, Tianxiang, et al.
Publicado: (2025)
MiM-ISTD: Mamba-in-Mamba for Efficient Infrared Small Target Detection
por: Chen, Tianxiang, et al.
Publicado: (2024)
por: Chen, Tianxiang, et al.
Publicado: (2024)
Bootstrapping Audio-Visual Segmentation by Strengthening Audio Cues
por: Chen, Tianxiang, et al.
Publicado: (2024)
por: Chen, Tianxiang, et al.
Publicado: (2024)
TCI-Former: Thermal Conduction-Inspired Transformer for Infrared Small Target Detection
por: Chen, Tianxiang, et al.
Publicado: (2024)
por: Chen, Tianxiang, et al.
Publicado: (2024)
Learning to Focus and Precise Cropping: A Reinforcement Learning Framework with Information Gaps and Grounding Loss for MLLMs
por: Zhao, Xuanpu, et al.
Publicado: (2026)
por: Zhao, Xuanpu, et al.
Publicado: (2026)
Structure-aware Domain Knowledge Injection for Large Language Models
por: Liu, Kai, et al.
Publicado: (2024)
por: Liu, Kai, et al.
Publicado: (2024)
When Agents Look the Same: Quantifying Distillation-Induced Similarity in Tool-Use Behaviors
por: Yang, Chenghao, et al.
Publicado: (2026)
por: Yang, Chenghao, et al.
Publicado: (2026)
Llama Scope: Extracting Millions of Features from Llama-3.1-8B with Sparse Autoencoders
por: He, Zhengfu, et al.
Publicado: (2024)
por: He, Zhengfu, et al.
Publicado: (2024)
Multi-spectral Class Center Network for Face Manipulation Detection and Localization
por: Miao, Changtao, et al.
Publicado: (2023)
por: Miao, Changtao, et al.
Publicado: (2023)
Llama-Mob: Instruction-Tuning Llama-3-8B Excels in City-Scale Mobility Prediction
por: Tang, Peizhi, et al.
Publicado: (2024)
por: Tang, Peizhi, et al.
Publicado: (2024)
MGH Radiology Llama: A Llama 3 70B Model for Radiology
por: Shi, Yucheng, et al.
Publicado: (2024)
por: Shi, Yucheng, et al.
Publicado: (2024)
Context-Aware Weakly Supervised Image Manipulation Localization with SAM Refinement
por: Wang, Xinghao, et al.
Publicado: (2025)
por: Wang, Xinghao, et al.
Publicado: (2025)
Freeze Deep, Train Shallow: Interpretable Layer Allocation for Continued Pre-Training
por: Wu, Yu-Hang, et al.
Publicado: (2026)
por: Wu, Yu-Hang, et al.
Publicado: (2026)
Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data?
por: Qi, Xuan, et al.
Publicado: (2025)
por: Qi, Xuan, et al.
Publicado: (2025)
Towards More Unified In-context Visual Understanding
por: Sheng, Dianmo, et al.
Publicado: (2023)
por: Sheng, Dianmo, et al.
Publicado: (2023)
INSIDE: LLMs' Internal States Retain the Power of Hallucination Detection
por: Chen, Chao, et al.
Publicado: (2024)
por: Chen, Chao, et al.
Publicado: (2024)
BadLlama: cheaply removing safety fine-tuning from Llama 2-Chat 13B
por: Gade, Pranav, et al.
Publicado: (2023)
por: Gade, Pranav, et al.
Publicado: (2023)
Latent Paraphrasing: Perturbation on Layers Improves Knowledge Injection in Language Models
por: Kang, Minki, et al.
Publicado: (2024)
por: Kang, Minki, et al.
Publicado: (2024)
ChocoLlama: Lessons Learned From Teaching Llamas Dutch
por: Meeus, Matthieu, et al.
Publicado: (2024)
por: Meeus, Matthieu, et al.
Publicado: (2024)
Mixture-of-Noises Enhanced Forgery-Aware Predictor for Multi-Face Manipulation Detection and Localization
por: Miao, Changtao, et al.
Publicado: (2024)
por: Miao, Changtao, et al.
Publicado: (2024)
MARS-Bench: A Multi-turn Athletic Real-world Scenario Benchmark for Dialogue Evaluation
por: Yang, Chenghao, et al.
Publicado: (2025)
por: Yang, Chenghao, et al.
Publicado: (2025)
Targeted Lexical Injection: Unlocking Latent Cross-Lingual Alignment in Lugha-Llama via Early-Layer LoRA Fine-Tuning
por: Ngugi, Stanley
Publicado: (2025)
por: Ngugi, Stanley
Publicado: (2025)
SLayerGen: a Crystal Generative Model for all Space and Layer Groups
por: Chang, Rees, et al.
Publicado: (2026)
por: Chang, Rees, et al.
Publicado: (2026)
Teaching Llama a New Language Through Cross-Lingual Knowledge Transfer
por: Kuulmets, Hele-Andra, et al.
Publicado: (2024)
por: Kuulmets, Hele-Andra, et al.
Publicado: (2024)
Extending Llama-3's Context Ten-Fold Overnight
por: Zhang, Peitian, et al.
Publicado: (2024)
por: Zhang, Peitian, et al.
Publicado: (2024)
SpindleKV: A Novel KV Cache Reduction Method Balancing Both Shallow and Deep Layers
por: Tang, Zicong, et al.
Publicado: (2025)
por: Tang, Zicong, et al.
Publicado: (2025)
DR.EHR: Dense Retrieval for Electronic Health Record with Knowledge Injection and Synthetic Data
por: Zhao, Zhengyun, et al.
Publicado: (2025)
por: Zhao, Zhengyun, et al.
Publicado: (2025)
Llama See, Llama Do: A Mechanistic Perspective on Contextual Entrainment and Distraction in LLMs
por: Niu, Jingcheng, et al.
Publicado: (2025)
por: Niu, Jingcheng, et al.
Publicado: (2025)
KORE: Enhancing Knowledge Injection for Large Multimodal Models via Knowledge-Oriented Controls
por: Jiang, Kailin, et al.
Publicado: (2025)
por: Jiang, Kailin, et al.
Publicado: (2025)
Provably Secure Disambiguating Neural Linguistic Steganography
por: Qi, Yuang, et al.
Publicado: (2024)
por: Qi, Yuang, et al.
Publicado: (2024)
TableLlama: Towards Open Large Generalist Models for Tables
por: Zhang, Tianshu, et al.
Publicado: (2023)
por: Zhang, Tianshu, et al.
Publicado: (2023)
Zebra-Llama: A Context-Aware Large Language Model for Democratizing Rare Disease Knowledge
por: Soman, Karthik, et al.
Publicado: (2024)
por: Soman, Karthik, et al.
Publicado: (2024)
Code Llama: Open Foundation Models for Code
por: Rozière, Baptiste, et al.
Publicado: (2023)
por: Rozière, Baptiste, et al.
Publicado: (2023)
Llama-Embed-Nemotron-8B: A Universal Text Embedding Model for Multilingual and Cross-Lingual Tasks
por: Babakhin, Yauhen, et al.
Publicado: (2025)
por: Babakhin, Yauhen, et al.
Publicado: (2025)
SAC-KG: Exploiting Large Language Models as Skilled Automatic Constructors for Domain Knowledge Graphs
por: Chen, Hanzhu, et al.
Publicado: (2024)
por: Chen, Hanzhu, et al.
Publicado: (2024)
Question-guided Knowledge Graph Re-scoring and Injection for Knowledge Graph Question Answering
por: Zhang, Yu, et al.
Publicado: (2024)
por: Zhang, Yu, et al.
Publicado: (2024)
Efficient Speculative Decoding for Llama at Scale: Challenges and Solutions
por: Tang, Bangsheng, et al.
Publicado: (2025)
por: Tang, Bangsheng, et al.
Publicado: (2025)
LlamaCare: A Large Medical Language Model for Enhancing Healthcare Knowledge Sharing
por: Sun, Maojun
Publicado: (2024)
por: Sun, Maojun
Publicado: (2024)
Understanding Parametric Knowledge Injection in Retrieval-Augmented Generation
por: Tang, Minghao, et al.
Publicado: (2025)
por: Tang, Minghao, et al.
Publicado: (2025)
Bidirectional LMs are Better Knowledge Memorizers? A Benchmark for Real-world Knowledge Injection
por: Zhang, Yuwei, et al.
Publicado: (2025)
por: Zhang, Yuwei, et al.
Publicado: (2025)
Ejemplares similares
-
Flora: Effortless Context Construction to Arbitrary Length and Scale
por: Chen, Tianxiang, et al.
Publicado: (2025) -
MiM-ISTD: Mamba-in-Mamba for Efficient Infrared Small Target Detection
por: Chen, Tianxiang, et al.
Publicado: (2024) -
Bootstrapping Audio-Visual Segmentation by Strengthening Audio Cues
por: Chen, Tianxiang, et al.
Publicado: (2024) -
TCI-Former: Thermal Conduction-Inspired Transformer for Infrared Small Target Detection
por: Chen, Tianxiang, et al.
Publicado: (2024) -
Learning to Focus and Precise Cropping: A Reinforcement Learning Framework with Information Gaps and Grounding Loss for MLLMs
por: Zhao, Xuanpu, et al.
Publicado: (2026)