Attention Heads of Large Language Models: A Survey
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Zheng, Zifan, Wang, Yezhaohui, Huang, Yuxin, Song, Shichao, Yang, Mingchuan, Tang, Bo, Xiong, Feiyu, Li, Zhiyu |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
SurveyX: Academic Survey Automation via Large Language Models
von: Liang, Xun, et al.
Veröffentlicht: (2025)
von: Liang, Xun, et al.
Veröffentlicht: (2025)
xFinder: Large Language Models as Automated Evaluators for Reliable Evaluation
von: Yu, Qingchen, et al.
Veröffentlicht: (2024)
von: Yu, Qingchen, et al.
Veröffentlicht: (2024)
Controllable Text Generation for Large Language Models: A Survey
von: Liang, Xun, et al.
Veröffentlicht: (2024)
von: Liang, Xun, et al.
Veröffentlicht: (2024)
UHGEval: Benchmarking the Hallucination of Chinese Large Language Models via Unconstrained Generation
von: Liang, Xun, et al.
Veröffentlicht: (2023)
von: Liang, Xun, et al.
Veröffentlicht: (2023)
Internal Consistency and Self-Feedback in Large Language Models: A Survey
von: Liang, Xun, et al.
Veröffentlicht: (2024)
von: Liang, Xun, et al.
Veröffentlicht: (2024)
Grimoire is All You Need for Enhancing Large Language Models
von: Chen, Ding, et al.
Veröffentlicht: (2024)
von: Chen, Ding, et al.
Veröffentlicht: (2024)
Controlled Text Generation for Large Language Model with Dynamic Attribute Graphs
von: Liang, Xun, et al.
Veröffentlicht: (2024)
von: Liang, Xun, et al.
Veröffentlicht: (2024)
HRDE: Retrieval-Augmented Large Language Models for Chinese Health Rumor Detection and Explainability
von: Chen, Yanfang, et al.
Veröffentlicht: (2024)
von: Chen, Yanfang, et al.
Veröffentlicht: (2024)
SEAP: Training-free Sparse Expert Activation Pruning Unlock the Brainpower of Large Language Models
von: Liang, Xun, et al.
Veröffentlicht: (2025)
von: Liang, Xun, et al.
Veröffentlicht: (2025)
Fake Artificial Intelligence Generated Contents (FAIGC): A Survey of Theories, Detection Methods, and Opportunities
von: Yu, Xiaomin, et al.
Veröffentlicht: (2024)
von: Yu, Xiaomin, et al.
Veröffentlicht: (2024)
Empowering Large Language Models to Set up a Knowledge Retrieval Indexer via Self-Learning
von: Liang, Xun, et al.
Veröffentlicht: (2024)
von: Liang, Xun, et al.
Veröffentlicht: (2024)
GuessArena: Guess Who I Am? A Self-Adaptive Framework for Evaluating LLMs in Domain-Specific Knowledge and Reasoning
von: Yu, Qingchen, et al.
Veröffentlicht: (2025)
von: Yu, Qingchen, et al.
Veröffentlicht: (2025)
Proxy-RLHF: Decoupling Generation and Alignment in Large Language Model with Proxy
von: Zhu, Yu, et al.
Veröffentlicht: (2024)
von: Zhu, Yu, et al.
Veröffentlicht: (2024)
MemOS: An Operating System for Memory-Augmented Generation (MAG) in Large Language Models
von: Li, Zhiyu, et al.
Veröffentlicht: (2025)
von: Li, Zhiyu, et al.
Veröffentlicht: (2025)
TurtleBench: Evaluating Top Language Models via Real-World Yes/No Puzzles
von: Yu, Qingchen, et al.
Veröffentlicht: (2024)
von: Yu, Qingchen, et al.
Veröffentlicht: (2024)
CRUD-RAG: A Comprehensive Chinese Benchmark for Retrieval-Augmented Generation of Large Language Models
von: Lyu, Yuanjie, et al.
Veröffentlicht: (2024)
von: Lyu, Yuanjie, et al.
Veröffentlicht: (2024)
Text2Mem: A Unified Memory Operation Language for Memory Operating System
von: Wang, Yi, et al.
Veröffentlicht: (2025)
von: Wang, Yi, et al.
Veröffentlicht: (2025)
MemFactory: Unified Inference & Training Framework for Agent Memory
von: Guo, Ziliang, et al.
Veröffentlicht: (2026)
von: Guo, Ziliang, et al.
Veröffentlicht: (2026)
Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models
von: Zhang, Yang, et al.
Veröffentlicht: (2025)
von: Zhang, Yang, et al.
Veröffentlicht: (2025)
MemReader: From Passive to Active Extraction for Long-Term Agent Memory
von: Kang, Jingyi, et al.
Veröffentlicht: (2026)
von: Kang, Jingyi, et al.
Veröffentlicht: (2026)
FastMem: Fast Memorization of Prompt Improves Context Awareness of Large Language Models
von: Zhu, Junyi, et al.
Veröffentlicht: (2024)
von: Zhu, Junyi, et al.
Veröffentlicht: (2024)
SkillsVote: Lifecycle Governance of Agent Skills from Collection, Recommendation to Evolution
von: Liu, Hongyi, et al.
Veröffentlicht: (2026)
von: Liu, Hongyi, et al.
Veröffentlicht: (2026)
GRAPHMOE: Amplifying Cognitive Depth of Mixture-of-Experts Network via Introducing Self-Rethinking Mechanism
von: Lv, Bo, et al.
Veröffentlicht: (2025)
von: Lv, Bo, et al.
Veröffentlicht: (2025)
Head-wise Shareable Attention for Large Language Models
von: Cao, Zouying, et al.
Veröffentlicht: (2024)
von: Cao, Zouying, et al.
Veröffentlicht: (2024)
NewsBench: A Systematic Evaluation Framework for Assessing Editorial Capabilities of Large Language Models in Chinese Journalism
von: Li, Miao, et al.
Veröffentlicht: (2024)
von: Li, Miao, et al.
Veröffentlicht: (2024)
On the Role of Attention Heads in Large Language Model Safety
von: Zhou, Zhenhong, et al.
Veröffentlicht: (2024)
von: Zhou, Zhenhong, et al.
Veröffentlicht: (2024)
A Survey of Query Optimization in Large Language Models
von: Song, Mingyang, et al.
Veröffentlicht: (2024)
von: Song, Mingyang, et al.
Veröffentlicht: (2024)
$\text{Memory}^3$: Language Modeling with Explicit Memory
von: Yang, Hongkang, et al.
Veröffentlicht: (2024)
von: Yang, Hongkang, et al.
Veröffentlicht: (2024)
HaluMem: Evaluating Hallucinations in Memory Systems of Agents
von: Chen, Ding, et al.
Veröffentlicht: (2025)
von: Chen, Ding, et al.
Veröffentlicht: (2025)
MemPrivacy: Privacy-Preserving Personalized Memory Management for Edge-Cloud Agents
von: Chen, Yining, et al.
Veröffentlicht: (2026)
von: Chen, Yining, et al.
Veröffentlicht: (2026)
Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free
von: Qiu, Zihan, et al.
Veröffentlicht: (2025)
von: Qiu, Zihan, et al.
Veröffentlicht: (2025)
MoC: Mixtures of Text Chunking Learners for Retrieval-Augmented Generation System
von: Zhao, Jihao, et al.
Veröffentlicht: (2025)
von: Zhao, Jihao, et al.
Veröffentlicht: (2025)
A Survey of On-Policy Distillation for Large Language Models
von: Song, Mingyang, et al.
Veröffentlicht: (2026)
von: Song, Mingyang, et al.
Veröffentlicht: (2026)
Focusing on Language: Revealing and Exploiting Language Attention Heads in Multilingual Large Language Models
von: Liu, Xin, et al.
Veröffentlicht: (2025)
von: Liu, Xin, et al.
Veröffentlicht: (2025)
Jigsaw-R1: A Study of Rule-based Visual Reinforcement Learning with Jigsaw Puzzles
von: Wang, Zifu, et al.
Veröffentlicht: (2025)
von: Wang, Zifu, et al.
Veröffentlicht: (2025)
xVerify: Efficient Answer Verifier for Reasoning Model Evaluations
von: Chen, Ding, et al.
Veröffentlicht: (2025)
von: Chen, Ding, et al.
Veröffentlicht: (2025)
Knowledge Editing for Large Language Models: A Survey
von: Wang, Song, et al.
Veröffentlicht: (2023)
von: Wang, Song, et al.
Veröffentlicht: (2023)
Meta-Chunking: Learning Text Segmentation and Semantic Completion via Logical Perception
von: Zhao, Jihao, et al.
Veröffentlicht: (2024)
von: Zhao, Jihao, et al.
Veröffentlicht: (2024)
Inside Out: Evolving User-Centric Core Memory Trees for Long-Term Personalized Dialogue Systems
von: Zhao, Jihao, et al.
Veröffentlicht: (2026)
von: Zhao, Jihao, et al.
Veröffentlicht: (2026)
Efficient Attention Mechanisms for Large Language Models: A Survey
von: Sun, Yutao, et al.
Veröffentlicht: (2025)
von: Sun, Yutao, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
SurveyX: Academic Survey Automation via Large Language Models
von: Liang, Xun, et al.
Veröffentlicht: (2025) -
xFinder: Large Language Models as Automated Evaluators for Reliable Evaluation
von: Yu, Qingchen, et al.
Veröffentlicht: (2024) -
Controllable Text Generation for Large Language Models: A Survey
von: Liang, Xun, et al.
Veröffentlicht: (2024) -
UHGEval: Benchmarking the Hallucination of Chinese Large Language Models via Unconstrained Generation
von: Liang, Xun, et al.
Veröffentlicht: (2023) -
Internal Consistency and Self-Feedback in Large Language Models: A Survey
von: Liang, Xun, et al.
Veröffentlicht: (2024)