Memory Layers at Scale
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Berges, Vincent-Pierre, Oğuz, Barlas, Haziza, Daniel, Yih, Wen-tau, Zettlemoyer, Luke, Ghosh, Gargi |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Continual Learning via Sparse Memory Finetuning
von: Lin, Jessy, et al.
Veröffentlicht: (2025)
von: Lin, Jessy, et al.
Veröffentlicht: (2025)
Learning Facts at Scale with Active Reading
von: Lin, Jessy, et al.
Veröffentlicht: (2025)
von: Lin, Jessy, et al.
Veröffentlicht: (2025)
Learning to Reason for Factuality
von: Chen, Xilun, et al.
Veröffentlicht: (2025)
von: Chen, Xilun, et al.
Veröffentlicht: (2025)
FLAME: Factuality-Aware Alignment for Large Language Models
von: Lin, Sheng-Chieh, et al.
Veröffentlicht: (2024)
von: Lin, Sheng-Chieh, et al.
Veröffentlicht: (2024)
Improving Factuality with Explicit Working Memory
von: Chen, Mingda, et al.
Veröffentlicht: (2024)
von: Chen, Mingda, et al.
Veröffentlicht: (2024)
Reliable, Adaptable, and Attributable Language Models with Retrieval
von: Asai, Akari, et al.
Veröffentlicht: (2024)
von: Asai, Akari, et al.
Veröffentlicht: (2024)
FACTORY: A Challenging Human-Verified Prompt Set for Long-Form Factuality
von: Chen, Mingda, et al.
Veröffentlicht: (2025)
von: Chen, Mingda, et al.
Veröffentlicht: (2025)
Fast Byte Latent Transformer
von: Kallini, Julie, et al.
Veröffentlicht: (2026)
von: Kallini, Julie, et al.
Veröffentlicht: (2026)
DRAMA: Diverse Augmentation from Large Language Models to Smaller Dense Retrievers
von: Ma, Xueguang, et al.
Veröffentlicht: (2025)
von: Ma, Xueguang, et al.
Veröffentlicht: (2025)
(Mis)Fitting: A Survey of Scaling Laws
von: Li, Margaret, et al.
Veröffentlicht: (2025)
von: Li, Margaret, et al.
Veröffentlicht: (2025)
Comparing Hallucination Detection Metrics for Multilingual Generation
von: Kang, Haoqiang, et al.
Veröffentlicht: (2024)
von: Kang, Haoqiang, et al.
Veröffentlicht: (2024)
ReasonIR: Training Retrievers for Reasoning Tasks
von: Shao, Rulin, et al.
Veröffentlicht: (2025)
von: Shao, Rulin, et al.
Veröffentlicht: (2025)
Anchored Decoding: Provably Reducing Copyright Risk for Any Language Model
von: He, Jacqueline, et al.
Veröffentlicht: (2026)
von: He, Jacqueline, et al.
Veröffentlicht: (2026)
Post-training an LLM for RAG? Train on Self-Generated Demonstrations
von: Finlayson, Matthew, et al.
Veröffentlicht: (2025)
von: Finlayson, Matthew, et al.
Veröffentlicht: (2025)
Text Quality-Based Pruning for Efficient Training of Language Models
von: Sharma, Vasu, et al.
Veröffentlicht: (2024)
von: Sharma, Vasu, et al.
Veröffentlicht: (2024)
Infini-gram: Scaling Unbounded n-gram Language Models to a Trillion Tokens
von: Liu, Jiacheng, et al.
Veröffentlicht: (2024)
von: Liu, Jiacheng, et al.
Veröffentlicht: (2024)
Branch-Train-MiX: Mixing Expert LLMs into a Mixture-of-Experts LLM
von: Sukhbaatar, Sainbayar, et al.
Veröffentlicht: (2024)
von: Sukhbaatar, Sainbayar, et al.
Veröffentlicht: (2024)
Mixture-of-Transformers: A Sparse and Scalable Architecture for Multi-Modal Foundation Models
von: Liang, Weixin, et al.
Veröffentlicht: (2024)
von: Liang, Weixin, et al.
Veröffentlicht: (2024)
MoDE: CLIP Data Experts via Clustering
von: Ma, Jiawei, et al.
Veröffentlicht: (2024)
von: Ma, Jiawei, et al.
Veröffentlicht: (2024)
Instruction-tuned Language Models are Better Knowledge Learners
von: Jiang, Zhengbao, et al.
Veröffentlicht: (2024)
von: Jiang, Zhengbao, et al.
Veröffentlicht: (2024)
Improving Faithfulness of Abstractive Summarization by Controlling Confounding Effect of Irrelevant Sentences
von: Ghoshal, Asish, et al.
Veröffentlicht: (2022)
von: Ghoshal, Asish, et al.
Veröffentlicht: (2022)
RA-DIT: Retrieval-Augmented Dual Instruction Tuning
von: Lin, Xi Victoria, et al.
Veröffentlicht: (2023)
von: Lin, Xi Victoria, et al.
Veröffentlicht: (2023)
FlexOlmo: Open Language Models for Flexible Data Use
von: Shi, Weijia, et al.
Veröffentlicht: (2025)
von: Shi, Weijia, et al.
Veröffentlicht: (2025)
SelfCite: Self-Supervised Alignment for Context Attribution in Large Language Models
von: Chuang, Yung-Sung, et al.
Veröffentlicht: (2025)
von: Chuang, Yung-Sung, et al.
Veröffentlicht: (2025)
Procedural Knowledge at Scale Improves Reasoning
von: Wu, Di, et al.
Veröffentlicht: (2026)
von: Wu, Di, et al.
Veröffentlicht: (2026)
Can generative AI figure out figurative language? The influence of idioms on essay scoring by ChatGPT, Gemini, and Deepseek
von: Oğuz, Enis
Veröffentlicht: (2025)
von: Oğuz, Enis
Veröffentlicht: (2025)
MYTE: Morphology-Driven Byte Encoding for Better and Fairer Multilingual Language Modeling
von: Limisiewicz, Tomasz, et al.
Veröffentlicht: (2024)
von: Limisiewicz, Tomasz, et al.
Veröffentlicht: (2024)
Few-Shot Data Synthesis for Open Domain Multi-Hop Question Answering
von: Chen, Mingda, et al.
Veröffentlicht: (2023)
von: Chen, Mingda, et al.
Veröffentlicht: (2023)
Latent Speech-Text Transformer
von: Lu, Yen-Ju, et al.
Veröffentlicht: (2025)
von: Lu, Yen-Ju, et al.
Veröffentlicht: (2025)
DR Tulu: Reinforcement Learning with Evolving Rubrics for Deep Research
von: Shao, Rulin, et al.
Veröffentlicht: (2025)
von: Shao, Rulin, et al.
Veröffentlicht: (2025)
In-context Pretraining: Language Modeling Beyond Document Boundaries
von: Shi, Weijia, et al.
Veröffentlicht: (2023)
von: Shi, Weijia, et al.
Veröffentlicht: (2023)
TernaryLM: Memory-Efficient Language Modeling via Native 1.5-Bit Quantization with Adaptive Layer-wise Scaling
von: Nargund, Nisharg, et al.
Veröffentlicht: (2026)
von: Nargund, Nisharg, et al.
Veröffentlicht: (2026)
PrismRAG: Boosting RAG Factuality with Distractor Resilience and Strategized Reasoning
von: Kachuee, Mohammad, et al.
Veröffentlicht: (2025)
von: Kachuee, Mohammad, et al.
Veröffentlicht: (2025)
Scaling Retrieval-Based Language Models with a Trillion-Token Datastore
von: Shao, Rulin, et al.
Veröffentlicht: (2024)
von: Shao, Rulin, et al.
Veröffentlicht: (2024)
High Accuracy, Less Talk (HALT): Reliable LLMs through Capability-Aligned Finetuning
von: Franzmeyer, Tim, et al.
Veröffentlicht: (2025)
von: Franzmeyer, Tim, et al.
Veröffentlicht: (2025)
Better Alignment with Instruction Back-and-Forth Translation
von: Nguyen, Thao, et al.
Veröffentlicht: (2024)
von: Nguyen, Thao, et al.
Veröffentlicht: (2024)
Recycling the Web: A Method to Enhance Pre-training Data Quality and Quantity for Language Models
von: Nguyen, Thao, et al.
Veröffentlicht: (2025)
von: Nguyen, Thao, et al.
Veröffentlicht: (2025)
Altogether: Image Captioning via Re-aligning Alt-text
von: Xu, Hu, et al.
Veröffentlicht: (2024)
von: Xu, Hu, et al.
Veröffentlicht: (2024)
OCR or Not? Rethinking Document Information Extraction in the MLLMs Era with Real-World Large-Scale Datasets
von: Shen, Jiyuan, et al.
Veröffentlicht: (2026)
von: Shen, Jiyuan, et al.
Veröffentlicht: (2026)
MUSE: Machine Unlearning Six-Way Evaluation for Language Models
von: Shi, Weijia, et al.
Veröffentlicht: (2024)
von: Shi, Weijia, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Continual Learning via Sparse Memory Finetuning
von: Lin, Jessy, et al.
Veröffentlicht: (2025) -
Learning Facts at Scale with Active Reading
von: Lin, Jessy, et al.
Veröffentlicht: (2025) -
Learning to Reason for Factuality
von: Chen, Xilun, et al.
Veröffentlicht: (2025) -
FLAME: Factuality-Aware Alignment for Large Language Models
von: Lin, Sheng-Chieh, et al.
Veröffentlicht: (2024) -
Improving Factuality with Explicit Working Memory
von: Chen, Mingda, et al.
Veröffentlicht: (2024)