Discovering Knowledge-Critical Subnetworks in Pretrained Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Bayazit, Deniz, Foroutan, Negar, Chen, Zeming, Weiss, Gail, Bosselut, Antoine |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Crosscoding Through Time: Tracking Emergence & Consolidation Of Linguistic Representations Throughout LLM Pretraining
di: Bayazit, Deniz, et al.
Pubblicazione: (2025)
di: Bayazit, Deniz, et al.
Pubblicazione: (2025)
Revisiting Multilingual Data Mixtures in Language Model Pretraining
di: Foroutan, Negar, et al.
Pubblicazione: (2025)
di: Foroutan, Negar, et al.
Pubblicazione: (2025)
ConLID: Supervised Contrastive Learning for Low-Resource Language Identification
di: Foroutan, Negar, et al.
Pubblicazione: (2025)
di: Foroutan, Negar, et al.
Pubblicazione: (2025)
Reliable Evaluation and Benchmarks for Statement Autoformalization
di: Poiroux, Auguste, et al.
Pubblicazione: (2024)
di: Poiroux, Auguste, et al.
Pubblicazione: (2024)
Parity-Aware Byte-Pair Encoding: Improving Cross-lingual Fairness in Tokenization
di: Foroutan, Negar, et al.
Pubblicazione: (2025)
di: Foroutan, Negar, et al.
Pubblicazione: (2025)
PERK: Long-Context Reasoning as Parameter-Efficient Test-Time Learning
di: Chen, Zeming, et al.
Pubblicazione: (2025)
di: Chen, Zeming, et al.
Pubblicazione: (2025)
Complex Reasoning over Logical Queries on Commonsense Knowledge Graphs
di: Fang, Tianqing, et al.
Pubblicazione: (2024)
di: Fang, Tianqing, et al.
Pubblicazione: (2024)
Tracking the Limits of Knowledge Propagation: How LLMs Fail at Multi-Step Reasoning with Conflicting Knowledge
di: Feng, Yiyang, et al.
Pubblicazione: (2026)
di: Feng, Yiyang, et al.
Pubblicazione: (2026)
Discovering Latent Knowledge in Language Models Without Supervision
di: Burns, Collin, et al.
Pubblicazione: (2022)
di: Burns, Collin, et al.
Pubblicazione: (2022)
Rational Metareasoning for Large Language Models
di: De Sabbata, C. Nicolò, et al.
Pubblicazione: (2024)
di: De Sabbata, C. Nicolò, et al.
Pubblicazione: (2024)
Evaluating Language Model Agency through Negotiations
di: Davidson, Tim R., et al.
Pubblicazione: (2024)
di: Davidson, Tim R., et al.
Pubblicazione: (2024)
LLMs Are In-Context Bandit Reinforcement Learners
di: Monea, Giovanni, et al.
Pubblicazione: (2024)
di: Monea, Giovanni, et al.
Pubblicazione: (2024)
Cite Pretrain: Retrieval-Free Knowledge Attribution for Large Language Models
di: Huang, Yukun, et al.
Pubblicazione: (2025)
di: Huang, Yukun, et al.
Pubblicazione: (2025)
WikiMixQA: A Multimodal Benchmark for Question Answering over Tables and Charts
di: Foroutan, Negar, et al.
Pubblicazione: (2025)
di: Foroutan, Negar, et al.
Pubblicazione: (2025)
HMI: Hierarchical Knowledge Management for Efficient Multi-Tenant Inference in Pretrained Language Models
di: Zhang, Jun, et al.
Pubblicazione: (2025)
di: Zhang, Jun, et al.
Pubblicazione: (2025)
Injecting Structured Biomedical Knowledge into Language Models: Continual Pretraining vs. GraphRAG
di: Klila, Jaafer, et al.
Pubblicazione: (2026)
di: Klila, Jaafer, et al.
Pubblicazione: (2026)
Discovering Forbidden Topics in Language Models
di: Rager, Can, et al.
Pubblicazione: (2025)
di: Rager, Can, et al.
Pubblicazione: (2025)
BioMistral: A Collection of Open-Source Pretrained Large Language Models for Medical Domains
di: Labrak, Yanis, et al.
Pubblicazione: (2024)
di: Labrak, Yanis, et al.
Pubblicazione: (2024)
The Heuristic Core: Understanding Subnetwork Generalization in Pretrained Language Models
di: Bhaskar, Adithya, et al.
Pubblicazione: (2024)
di: Bhaskar, Adithya, et al.
Pubblicazione: (2024)
A Logical Fallacy-Informed Framework for Argument Generation
di: Mouchel, Luca, et al.
Pubblicazione: (2024)
di: Mouchel, Luca, et al.
Pubblicazione: (2024)
Can Language Models Discover Scaling Laws?
di: Lin, Haowei, et al.
Pubblicazione: (2025)
di: Lin, Haowei, et al.
Pubblicazione: (2025)
Neurocache: Efficient Vector Retrieval for Long-range Language Modeling
di: Safaya, Ali, et al.
Pubblicazione: (2024)
di: Safaya, Ali, et al.
Pubblicazione: (2024)
Pretraining Large Language Models with NVFP4
di: NVIDIA, et al.
Pubblicazione: (2025)
di: NVIDIA, et al.
Pubblicazione: (2025)
Patent Language Model Pretraining with ModernBERT
di: Yousefiramandi, Amirhossein, et al.
Pubblicazione: (2025)
di: Yousefiramandi, Amirhossein, et al.
Pubblicazione: (2025)
In-context Pretraining: Language Modeling Beyond Document Boundaries
di: Shi, Weijia, et al.
Pubblicazione: (2023)
di: Shi, Weijia, et al.
Pubblicazione: (2023)
BiMix: A Bivariate Data Mixing Law for Language Model Pretraining
di: Ge, Ce, et al.
Pubblicazione: (2024)
di: Ge, Ce, et al.
Pubblicazione: (2024)
The Depth Ceiling: On the Limits of Large Language Models in Discovering Latent Planning
di: Xu, Yi, et al.
Pubblicazione: (2026)
di: Xu, Yi, et al.
Pubblicazione: (2026)
CriticAL: Critic Automation with Language Models
di: Li, Michael Y., et al.
Pubblicazione: (2024)
di: Li, Michael Y., et al.
Pubblicazione: (2024)
Teaching Pretrained Language Models to Think Deeper with Retrofitted Recurrence
di: McLeish, Sean, et al.
Pubblicazione: (2025)
di: McLeish, Sean, et al.
Pubblicazione: (2025)
Bridging the Bosphorus: Advancing Turkish Large Language Models through Strategies for Low-Resource Language Adaptation and Benchmarking
di: Acikgoz, Emre Can, et al.
Pubblicazione: (2024)
di: Acikgoz, Emre Can, et al.
Pubblicazione: (2024)
Sparse Feature Circuits: Discovering and Editing Interpretable Causal Graphs in Language Models
di: Marks, Samuel, et al.
Pubblicazione: (2024)
di: Marks, Samuel, et al.
Pubblicazione: (2024)
Discovering Hierarchical Latent Capabilities of Language Models via Causal Representation Learning
di: Jin, Jikai, et al.
Pubblicazione: (2025)
di: Jin, Jikai, et al.
Pubblicazione: (2025)
Generalizable and Stable Finetuning of Pretrained Language Models on Low-Resource Texts
di: Somayajula, Sai Ashish, et al.
Pubblicazione: (2024)
di: Somayajula, Sai Ashish, et al.
Pubblicazione: (2024)
Tracing the Representation Geometry of Language Models from Pretraining to Post-training
di: Li, Melody Zixuan, et al.
Pubblicazione: (2025)
di: Li, Melody Zixuan, et al.
Pubblicazione: (2025)
DeepCritic: Deliberate Critique with Large Language Models
di: Yang, Wenkai, et al.
Pubblicazione: (2025)
di: Yang, Wenkai, et al.
Pubblicazione: (2025)
MiMo: Unlocking the Reasoning Potential of Language Model -- From Pretraining to Posttraining
di: Xiaomi, LLM-Core, et al.
Pubblicazione: (2025)
di: Xiaomi, LLM-Core, et al.
Pubblicazione: (2025)
Judging Quality Across Languages: A Multilingual Approach to Pretraining Data Filtering with Language Models
di: Ali, Mehdi, et al.
Pubblicazione: (2025)
di: Ali, Mehdi, et al.
Pubblicazione: (2025)
IDEA Prune: An Integrated Enlarge-and-Prune Pipeline in Generative Language Model Pretraining
di: Li, Yixiao, et al.
Pubblicazione: (2025)
di: Li, Yixiao, et al.
Pubblicazione: (2025)
Pretrained Generative Language Models as General Learning Frameworks for Sequence-Based Tasks
di: Fauber, Ben
Pubblicazione: (2024)
di: Fauber, Ben
Pubblicazione: (2024)
Generalization v.s. Memorization: Tracing Language Models' Capabilities Back to Pretraining Data
di: Wang, Xinyi, et al.
Pubblicazione: (2024)
di: Wang, Xinyi, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Crosscoding Through Time: Tracking Emergence & Consolidation Of Linguistic Representations Throughout LLM Pretraining
di: Bayazit, Deniz, et al.
Pubblicazione: (2025) -
Revisiting Multilingual Data Mixtures in Language Model Pretraining
di: Foroutan, Negar, et al.
Pubblicazione: (2025) -
ConLID: Supervised Contrastive Learning for Low-Resource Language Identification
di: Foroutan, Negar, et al.
Pubblicazione: (2025) -
Reliable Evaluation and Benchmarks for Statement Autoformalization
di: Poiroux, Auguste, et al.
Pubblicazione: (2024) -
Parity-Aware Byte-Pair Encoding: Improving Cross-lingual Fairness in Tokenization
di: Foroutan, Negar, et al.
Pubblicazione: (2025)