A Survey on Data Selection for Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Albalak, Alon, Elazar, Yanai, Xie, Sang Michael, Longpre, Shayne, Lambert, Nathan, Wang, Xinyi, Muennighoff, Niklas, Hou, Bairu, Pan, Liangming, Jeong, Haewon, Raffel, Colin, Chang, Shiyu, Hashimoto, Tatsunori, Wang, William Yang |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Generalization v.s. Memorization: Tracing Language Models' Capabilities Back to Pretraining Data
von: Wang, Xinyi, et al.
Veröffentlicht: (2024)
von: Wang, Xinyi, et al.
Veröffentlicht: (2024)
Future and AI-Ready Data Strategies: Response to DOC RFI on AI and Open Government Data Assets
von: Oderinwale, Hamidah, et al.
Veröffentlicht: (2024)
von: Oderinwale, Hamidah, et al.
Veröffentlicht: (2024)
LLM-Generated or Human-Written? Comparing Review and Non-Review Papers on ArXiv
von: Elazar, Yanai, et al.
Veröffentlicht: (2026)
von: Elazar, Yanai, et al.
Veröffentlicht: (2026)
Ares: Adaptive Reasoning Effort Selection for Efficient LLM Agents
von: Yang, Jingbo, et al.
Veröffentlicht: (2026)
von: Yang, Jingbo, et al.
Veröffentlicht: (2026)
ATLAS: Adaptive Transfer Scaling Laws for Multilingual Pretraining, Finetuning, and Decoding the Curse of Multilinguality
von: Longpre, Shayne, et al.
Veröffentlicht: (2025)
von: Longpre, Shayne, et al.
Veröffentlicht: (2025)
A Probabilistic Framework for LLM Hallucination Detection via Belief Tree Propagation
von: Hou, Bairu, et al.
Veröffentlicht: (2024)
von: Hou, Bairu, et al.
Veröffentlicht: (2024)
Evaluating $n$-Gram Novelty of Language Models Using Rusty-DAWG
von: Merrill, William, et al.
Veröffentlicht: (2024)
von: Merrill, William, et al.
Veröffentlicht: (2024)
A Systematic Review of NeurIPS Dataset Management Practices
von: Wu, Yiwei, et al.
Veröffentlicht: (2024)
von: Wu, Yiwei, et al.
Veröffentlicht: (2024)
OctoPack: Instruction Tuning Code Large Language Models
von: Muennighoff, Niklas, et al.
Veröffentlicht: (2023)
von: Muennighoff, Niklas, et al.
Veröffentlicht: (2023)
Applying Intrinsic Debiasing on Downstream Tasks: Challenges and Considerations for Machine Translation
von: Iluz, Bar, et al.
Veröffentlicht: (2024)
von: Iluz, Bar, et al.
Veröffentlicht: (2024)
MAGPIE: A dataset for Multi-AGent contextual PrIvacy Evaluation
von: Juneja, Gurusha, et al.
Veröffentlicht: (2025)
von: Juneja, Gurusha, et al.
Veröffentlicht: (2025)
Better Aligned with Survey Respondents or Training Data? Unveiling Political Leanings of LLMs on U.S. Supreme Court Cases
von: Xu, Shanshan, et al.
Veröffentlicht: (2025)
von: Xu, Shanshan, et al.
Veröffentlicht: (2025)
AI-Powered Autonomous Weapons Risk Geopolitical Instability and Threaten AI Research
von: Simmons-Edler, Riley, et al.
Veröffentlicht: (2024)
von: Simmons-Edler, Riley, et al.
Veröffentlicht: (2024)
KVLink: Accelerating Large Language Models via Efficient KV Cache Reuse
von: Yang, Jingbo, et al.
Veröffentlicht: (2025)
von: Yang, Jingbo, et al.
Veröffentlicht: (2025)
WebDART: Dynamic Decomposition and Re-planning for Complex Web Tasks
von: Yang, Jingbo, et al.
Veröffentlicht: (2025)
von: Yang, Jingbo, et al.
Veröffentlicht: (2025)
On Linear Representations and Pretraining Data Frequency in Language Models
von: Merullo, Jack, et al.
Veröffentlicht: (2025)
von: Merullo, Jack, et al.
Veröffentlicht: (2025)
Rewriting History: A Recipe for Interventional Analyses to Study Data Effects on Model Behavior
von: Nadkarni, Rahul, et al.
Veröffentlicht: (2025)
von: Nadkarni, Rahul, et al.
Veröffentlicht: (2025)
Uncovering Model Processing Strategies with Non-Negative Per-Example Fisher Factorization
von: Matena, Michael, et al.
Veröffentlicht: (2023)
von: Matena, Michael, et al.
Veröffentlicht: (2023)
Position: The Most Expensive Part of an LLM should be its Training Data
von: Kandpal, Nikhil, et al.
Veröffentlicht: (2025)
von: Kandpal, Nikhil, et al.
Veröffentlicht: (2025)
Reward-Augmented Decoding: Efficient Controlled Text Generation With a Unidirectional Reward Model
von: Deng, Haikang, et al.
Veröffentlicht: (2023)
von: Deng, Haikang, et al.
Veröffentlicht: (2023)
Language Models with Conformal Factuality Guarantees
von: Mohri, Christopher, et al.
Veröffentlicht: (2024)
von: Mohri, Christopher, et al.
Veröffentlicht: (2024)
Scaling Data-Constrained Language Models
von: Muennighoff, Niklas, et al.
Veröffentlicht: (2023)
von: Muennighoff, Niklas, et al.
Veröffentlicht: (2023)
GRADE: Quantifying Sample Diversity in Text-to-Image Models
von: Rassin, Royi, et al.
Veröffentlicht: (2024)
von: Rassin, Royi, et al.
Veröffentlicht: (2024)
Detection and Measurement of Syntactic Templates in Generated Text
von: Shaib, Chantal, et al.
Veröffentlicht: (2024)
von: Shaib, Chantal, et al.
Veröffentlicht: (2024)
Decomposing Uncertainty for Large Language Models through Input Clarification Ensembling
von: Hou, Bairu, et al.
Veröffentlicht: (2023)
von: Hou, Bairu, et al.
Veröffentlicht: (2023)
Efficiently Estimating Data Efficiency for Language Model Fine-tuning
von: Je, Gyung Hyun, et al.
Veröffentlicht: (2025)
von: Je, Gyung Hyun, et al.
Veröffentlicht: (2025)
Estimating the Causal Effect of Early ArXiving on Paper Acceptance
von: Elazar, Yanai, et al.
Veröffentlicht: (2023)
von: Elazar, Yanai, et al.
Veröffentlicht: (2023)
s1: Simple test-time scaling
von: Muennighoff, Niklas, et al.
Veröffentlicht: (2025)
von: Muennighoff, Niklas, et al.
Veröffentlicht: (2025)
Humanline: Online Alignment as Perceptual Loss
von: Liu, Sijia, et al.
Veröffentlicht: (2025)
von: Liu, Sijia, et al.
Veröffentlicht: (2025)
MAGPIE: A benchmark for Multi-AGent contextual PrIvacy Evaluation
von: Juneja, Gurusha, et al.
Veröffentlicht: (2025)
von: Juneja, Gurusha, et al.
Veröffentlicht: (2025)
Do You Know About My Nation? Investigating Multilingual Language Models' Cultural Literacy Through Factual Knowledge
von: Tanwar, Eshaan, et al.
Veröffentlicht: (2025)
von: Tanwar, Eshaan, et al.
Veröffentlicht: (2025)
AttriBoT: A Bag of Tricks for Efficiently Approximating Leave-One-Out Context Attribution
von: Liu, Fengyuan, et al.
Veröffentlicht: (2024)
von: Liu, Fengyuan, et al.
Veröffentlicht: (2024)
Merging by Matching Models in Task Parameter Subspaces
von: Tam, Derek, et al.
Veröffentlicht: (2023)
von: Tam, Derek, et al.
Veröffentlicht: (2023)
Soft Merging of Experts with Adaptive Routing
von: Muqeeth, Mohammed, et al.
Veröffentlicht: (2023)
von: Muqeeth, Mohammed, et al.
Veröffentlicht: (2023)
Can LLMs Generate Novel Research Ideas? A Large-Scale Human Study with 100+ NLP Researchers
von: Si, Chenglei, et al.
Veröffentlicht: (2024)
von: Si, Chenglei, et al.
Veröffentlicht: (2024)
Benchmarking Distributional Alignment of Large Language Models
von: Meister, Nicole, et al.
Veröffentlicht: (2024)
von: Meister, Nicole, et al.
Veröffentlicht: (2024)
Understanding Finetuning for Factual Knowledge Extraction
von: Ghosal, Gaurav, et al.
Veröffentlicht: (2024)
von: Ghosal, Gaurav, et al.
Veröffentlicht: (2024)
The Extractive-Abstractive Spectrum: Uncovering Verifiability Trade-offs in LLM Generations
von: Worledge, Theodora, et al.
Veröffentlicht: (2024)
von: Worledge, Theodora, et al.
Veröffentlicht: (2024)
Improving Pretraining Data Using Perplexity Correlations
von: Thrush, Tristan, et al.
Veröffentlicht: (2024)
von: Thrush, Tristan, et al.
Veröffentlicht: (2024)
The Ideation-Execution Gap: Execution Outcomes of LLM-Generated versus Human Research Ideas
von: Si, Chenglei, et al.
Veröffentlicht: (2025)
von: Si, Chenglei, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Generalization v.s. Memorization: Tracing Language Models' Capabilities Back to Pretraining Data
von: Wang, Xinyi, et al.
Veröffentlicht: (2024) -
Future and AI-Ready Data Strategies: Response to DOC RFI on AI and Open Government Data Assets
von: Oderinwale, Hamidah, et al.
Veröffentlicht: (2024) -
LLM-Generated or Human-Written? Comparing Review and Non-Review Papers on ArXiv
von: Elazar, Yanai, et al.
Veröffentlicht: (2026) -
Ares: Adaptive Reasoning Effort Selection for Efficient LLM Agents
von: Yang, Jingbo, et al.
Veröffentlicht: (2026) -
ATLAS: Adaptive Transfer Scaling Laws for Multilingual Pretraining, Finetuning, and Decoding the Curse of Multilinguality
von: Longpre, Shayne, et al.
Veröffentlicht: (2025)