Unforgettable Generalization in Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Eric, Chosen, Leshem, Andreas, Jacob |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Can Gradient Descent Simulate Prompting?
di: Zhang, Eric, et al.
Pubblicazione: (2025)
di: Zhang, Eric, et al.
Pubblicazione: (2025)
A Hitchhiker's Guide to Scaling Law Estimation
di: Choshen, Leshem, et al.
Pubblicazione: (2024)
di: Choshen, Leshem, et al.
Pubblicazione: (2024)
LLM Hypnosis: Exploiting User Feedback for Unauthorized Knowledge Injection to All Users
di: Hilel, Almog, et al.
Pubblicazione: (2025)
di: Hilel, Almog, et al.
Pubblicazione: (2025)
Label-Efficient Model Selection for Text Generation
di: Ashury-Tahan, Shir, et al.
Pubblicazione: (2024)
di: Ashury-Tahan, Shir, et al.
Pubblicazione: (2024)
Fuse to Forget: Bias Reduction and Selective Memorization through Model Fusion
di: Zaman, Kerem, et al.
Pubblicazione: (2023)
di: Zaman, Kerem, et al.
Pubblicazione: (2023)
Beyond Binary Rewards: Training LMs to Reason About Their Uncertainty
di: Damani, Mehul, et al.
Pubblicazione: (2025)
di: Damani, Mehul, et al.
Pubblicazione: (2025)
Lexicon-Level Contrastive Visual-Grounding Improves Language Modeling
di: Zhuang, Chengxu, et al.
Pubblicazione: (2024)
di: Zhuang, Chengxu, et al.
Pubblicazione: (2024)
Training Language Models to Explain Their Own Computations
di: Li, Belinda Z., et al.
Pubblicazione: (2025)
di: Li, Belinda Z., et al.
Pubblicazione: (2025)
In-Context Language Learning: Architectures and Algorithms
di: Akyürek, Ekin, et al.
Pubblicazione: (2024)
di: Akyürek, Ekin, et al.
Pubblicazione: (2024)
(How) Do Language Models Track State?
di: Li, Belinda Z., et al.
Pubblicazione: (2025)
di: Li, Belinda Z., et al.
Pubblicazione: (2025)
FourierNAT: A Fourier-Mixing-Based Non-Autoregressive Transformer for Parallel Sequence Generation
di: Kiruluta, Andrew, et al.
Pubblicazione: (2025)
di: Kiruluta, Andrew, et al.
Pubblicazione: (2025)
Monitoring Latent World States in Language Models with Propositional Probes
di: Feng, Jiahai, et al.
Pubblicazione: (2024)
di: Feng, Jiahai, et al.
Pubblicazione: (2024)
State Fourier Diffusion Language Model (SFDLM): A Scalable, Novel Iterative Approach to Language Modeling
di: Kiruluta, Andrew, et al.
Pubblicazione: (2025)
di: Kiruluta, Andrew, et al.
Pubblicazione: (2025)
Understanding Catastrophic Forgetting in Language Models via Implicit Inference
di: Kotha, Suhas, et al.
Pubblicazione: (2023)
di: Kotha, Suhas, et al.
Pubblicazione: (2023)
ComPEFT: Compression for Communicating Parameter Efficient Updates via Sparsification and Quantization
di: Yadav, Prateek, et al.
Pubblicazione: (2023)
di: Yadav, Prateek, et al.
Pubblicazione: (2023)
Repetition Improves Language Model Embeddings
di: Springer, Jacob Mitchell, et al.
Pubblicazione: (2024)
di: Springer, Jacob Mitchell, et al.
Pubblicazione: (2024)
Sparse Layers are Critical to Scaling Looped Language Models
di: Lee, Ryan, et al.
Pubblicazione: (2026)
di: Lee, Ryan, et al.
Pubblicazione: (2026)
Faithfulness Measurable Masked Language Models
di: Madsen, Andreas, et al.
Pubblicazione: (2023)
di: Madsen, Andreas, et al.
Pubblicazione: (2023)
Beyond Chinchilla-Optimal: Accounting for Inference in Language Model Scaling Laws
di: Sardana, Nikhil, et al.
Pubblicazione: (2023)
di: Sardana, Nikhil, et al.
Pubblicazione: (2023)
Long Context RAG Performance of Large Language Models
di: Leng, Quinn, et al.
Pubblicazione: (2024)
di: Leng, Quinn, et al.
Pubblicazione: (2024)
What Evidence Do Language Models Find Convincing?
di: Wan, Alexander, et al.
Pubblicazione: (2024)
di: Wan, Alexander, et al.
Pubblicazione: (2024)
Reaching Beyond the Mode: RL for Distributional Reasoning in Language Models
di: Puri, Isha, et al.
Pubblicazione: (2026)
di: Puri, Isha, et al.
Pubblicazione: (2026)
Generalization in Healthcare AI: Evaluation of a Clinical Large Language Model
di: Rahman, Salman, et al.
Pubblicazione: (2024)
di: Rahman, Salman, et al.
Pubblicazione: (2024)
Generative Frontiers: Why Evaluation Matters for Diffusion Language Models
di: Pynadath, Patrick, et al.
Pubblicazione: (2026)
di: Pynadath, Patrick, et al.
Pubblicazione: (2026)
Policy Learning with a Language Bottleneck
di: Srivastava, Megha, et al.
Pubblicazione: (2024)
di: Srivastava, Megha, et al.
Pubblicazione: (2024)
Speculative Diffusion Decoding: Accelerating Language Generation through Diffusion
di: Christopher, Jacob K, et al.
Pubblicazione: (2024)
di: Christopher, Jacob K, et al.
Pubblicazione: (2024)
Resolving Interference (RI): Disentangling Models for Improved Model Merging
di: Ramesh, Pratik, et al.
Pubblicazione: (2026)
di: Ramesh, Pratik, et al.
Pubblicazione: (2026)
Jointly Reinforcing Diversity and Quality in Language Model Generations
di: Li, Tianjian, et al.
Pubblicazione: (2025)
di: Li, Tianjian, et al.
Pubblicazione: (2025)
Merge to Learn: Efficiently Adding Skills to Language Models with Model Merging
di: Morrison, Jacob, et al.
Pubblicazione: (2024)
di: Morrison, Jacob, et al.
Pubblicazione: (2024)
Active Model Selection for Large Language Models
di: Durmazkeser, Yavuz, et al.
Pubblicazione: (2025)
di: Durmazkeser, Yavuz, et al.
Pubblicazione: (2025)
Genie: Achieving Human Parity in Content-Grounded Datasets Generation
di: Yehudai, Asaf, et al.
Pubblicazione: (2024)
di: Yehudai, Asaf, et al.
Pubblicazione: (2024)
DLM-One: Diffusion Language Models for One-Step Sequence Generation
di: Chen, Tianqi, et al.
Pubblicazione: (2025)
di: Chen, Tianqi, et al.
Pubblicazione: (2025)
How do Language Models Bind Entities in Context?
di: Feng, Jiahai, et al.
Pubblicazione: (2023)
di: Feng, Jiahai, et al.
Pubblicazione: (2023)
GOFA: A Generative One-For-All Model for Joint Graph Language Modeling
di: Kong, Lecheng, et al.
Pubblicazione: (2024)
di: Kong, Lecheng, et al.
Pubblicazione: (2024)
Efficient Benchmarking of Language Models
di: Perlitz, Yotam, et al.
Pubblicazione: (2023)
di: Perlitz, Yotam, et al.
Pubblicazione: (2023)
Selective Generation for Controllable Language Models
di: Lee, Minjae, et al.
Pubblicazione: (2023)
di: Lee, Minjae, et al.
Pubblicazione: (2023)
Elements of World Knowledge (EWoK): A Cognition-Inspired Framework for Evaluating Basic World Knowledge in Language Models
di: Ivanova, Anna A., et al.
Pubblicazione: (2024)
di: Ivanova, Anna A., et al.
Pubblicazione: (2024)
Automating Evaluation of Diffusion Model Unlearning with (Vision-) Language Model World Knowledge
di: Yeats, Eric, et al.
Pubblicazione: (2025)
di: Yeats, Eric, et al.
Pubblicazione: (2025)
Unlocking the Potentials of Retrieval-Augmented Generation for Diffusion Language Models
di: Yu, Chuanyue, et al.
Pubblicazione: (2026)
di: Yu, Chuanyue, et al.
Pubblicazione: (2026)
BWArea Model: Learning World Model, Inverse Dynamics, and Policy for Controllable Language Generation
di: Jia, Chengxing, et al.
Pubblicazione: (2024)
di: Jia, Chengxing, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Can Gradient Descent Simulate Prompting?
di: Zhang, Eric, et al.
Pubblicazione: (2025) -
A Hitchhiker's Guide to Scaling Law Estimation
di: Choshen, Leshem, et al.
Pubblicazione: (2024) -
LLM Hypnosis: Exploiting User Feedback for Unauthorized Knowledge Injection to All Users
di: Hilel, Almog, et al.
Pubblicazione: (2025) -
Label-Efficient Model Selection for Text Generation
di: Ashury-Tahan, Shir, et al.
Pubblicazione: (2024) -
Fuse to Forget: Bias Reduction and Selective Memorization through Model Fusion
di: Zaman, Kerem, et al.
Pubblicazione: (2023)