FlexOlmo: Open Language Models for Flexible Data Use
Fuente:
arXiv
Salvato in:
| Autori principali: | Shi, Weijia, Bhagia, Akshita, Farhat, Kevin, Muennighoff, Niklas, Walsh, Pete, Morrison, Jacob, Schwenk, Dustin, Longpre, Shayne, Poznanski, Jake, Ettinger, Allyson, Liu, Daogao, Li, Margaret, Groeneveld, Dirk, Lewis, Mike, Yih, Wen-tau, Soldaini, Luca, Lo, Kyle, Smith, Noah A., Zettlemoyer, Luke, Koh, Pang Wei, Hajishirzi, Hannaneh, Farhadi, Ali, Min, Sewon |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
EMO: Pretraining Mixture of Experts for Emergent Modularity
di: Wang, Ryan, et al.
Pubblicazione: (2026)
di: Wang, Ryan, et al.
Pubblicazione: (2026)
Infini-gram: Scaling Unbounded n-gram Language Models to a Trillion Tokens
di: Liu, Jiacheng, et al.
Pubblicazione: (2024)
di: Liu, Jiacheng, et al.
Pubblicazione: (2024)
OLMoE: Open Mixture-of-Experts Language Models
di: Muennighoff, Niklas, et al.
Pubblicazione: (2024)
di: Muennighoff, Niklas, et al.
Pubblicazione: (2024)
Olmo 3
di: Olmo, Team, et al.
Pubblicazione: (2025)
di: Olmo, Team, et al.
Pubblicazione: (2025)
Reliable, Adaptable, and Attributable Language Models with Retrieval
di: Asai, Akari, et al.
Pubblicazione: (2024)
di: Asai, Akari, et al.
Pubblicazione: (2024)
Organize the Web: Constructing Domains Enhances Pre-Training Data Curation
di: Wettig, Alexander, et al.
Pubblicazione: (2025)
di: Wettig, Alexander, et al.
Pubblicazione: (2025)
SILO Language Models: Isolating Legal Risk In a Nonparametric Datastore
di: Min, Sewon, et al.
Pubblicazione: (2023)
di: Min, Sewon, et al.
Pubblicazione: (2023)
What's In My Big Data?
di: Elazar, Yanai, et al.
Pubblicazione: (2023)
di: Elazar, Yanai, et al.
Pubblicazione: (2023)
Paloma: A Benchmark for Evaluating Language Model Fit
di: Magnusson, Ian, et al.
Pubblicazione: (2023)
di: Magnusson, Ian, et al.
Pubblicazione: (2023)
Olmo Hybrid: From Theory to Practice and Back
di: Merrill, William, et al.
Pubblicazione: (2026)
di: Merrill, William, et al.
Pubblicazione: (2026)
Establishing Task Scaling Laws via Compute-Efficient Model Ladders
di: Bhagia, Akshita, et al.
Pubblicazione: (2024)
di: Bhagia, Akshita, et al.
Pubblicazione: (2024)
BTR: Binary Token Representations for Efficient Retrieval Augmented Language Models
di: Cao, Qingqing, et al.
Pubblicazione: (2023)
di: Cao, Qingqing, et al.
Pubblicazione: (2023)
Do Membership Inference Attacks Work on Large Language Models?
di: Duan, Michael, et al.
Pubblicazione: (2024)
di: Duan, Michael, et al.
Pubblicazione: (2024)
olmOCR 2: Unit Test Rewards for Document OCR
di: Poznanski, Jake, et al.
Pubblicazione: (2025)
di: Poznanski, Jake, et al.
Pubblicazione: (2025)
Critical Batch Size Revisited: A Simple Empirical Approach to Large-Batch Language Model Training
di: Merrill, William, et al.
Pubblicazione: (2025)
di: Merrill, William, et al.
Pubblicazione: (2025)
Future and AI-Ready Data Strategies: Response to DOC RFI on AI and Open Government Data Assets
di: Oderinwale, Hamidah, et al.
Pubblicazione: (2024)
di: Oderinwale, Hamidah, et al.
Pubblicazione: (2024)
s1: Simple test-time scaling
di: Muennighoff, Niklas, et al.
Pubblicazione: (2025)
di: Muennighoff, Niklas, et al.
Pubblicazione: (2025)
Train Separately, Merge Together: Modular Post-Training with Mixture-of-Experts
di: Morrison, Jacob, et al.
Pubblicazione: (2026)
di: Morrison, Jacob, et al.
Pubblicazione: (2026)
Train for Truth, Keep the Skills: Binary Retrieval-Augmented Reward Mitigates Hallucinations
di: Chen, Tong, et al.
Pubblicazione: (2025)
di: Chen, Tong, et al.
Pubblicazione: (2025)
ReasonIR: Training Retrievers for Reasoning Tasks
di: Shao, Rulin, et al.
Pubblicazione: (2025)
di: Shao, Rulin, et al.
Pubblicazione: (2025)
CopyBench: Measuring Literal and Non-Literal Reproduction of Copyright-Protected Text in Language Model Generation
di: Chen, Tong, et al.
Pubblicazione: (2024)
di: Chen, Tong, et al.
Pubblicazione: (2024)
Learning to Detect Language Model Training Data via Active Reconstruction
di: Yin, Junjie Oscar, et al.
Pubblicazione: (2026)
di: Yin, Junjie Oscar, et al.
Pubblicazione: (2026)
ParaPO: Aligning Language Models to Reduce Verbatim Reproduction of Pre-training Data
di: Chen, Tong, et al.
Pubblicazione: (2025)
di: Chen, Tong, et al.
Pubblicazione: (2025)
2 OLMo 2 Furious
di: OLMo, Team, et al.
Pubblicazione: (2024)
di: OLMo, Team, et al.
Pubblicazione: (2024)
DR Tulu: Reinforcement Learning with Evolving Rubrics for Deep Research
di: Shao, Rulin, et al.
Pubblicazione: (2025)
di: Shao, Rulin, et al.
Pubblicazione: (2025)
Anchored Decoding: Provably Reducing Copyright Risk for Any Language Model
di: He, Jacqueline, et al.
Pubblicazione: (2026)
di: He, Jacqueline, et al.
Pubblicazione: (2026)
Memory Layers at Scale
di: Berges, Vincent-Pierre, et al.
Pubblicazione: (2024)
di: Berges, Vincent-Pierre, et al.
Pubblicazione: (2024)
APT: Adaptive Pruning and Tuning Pretrained Language Models for Efficient Training and Inference
di: Zhao, Bowen, et al.
Pubblicazione: (2024)
di: Zhao, Bowen, et al.
Pubblicazione: (2024)
Dolma: an Open Corpus of Three Trillion Tokens for Language Model Pretraining Research
di: Soldaini, Luca, et al.
Pubblicazione: (2024)
di: Soldaini, Luca, et al.
Pubblicazione: (2024)
A Systematic Review of NeurIPS Dataset Management Practices
di: Wu, Yiwei, et al.
Pubblicazione: (2024)
di: Wu, Yiwei, et al.
Pubblicazione: (2024)
Few-Shot Data Synthesis for Open Domain Multi-Hop Question Answering
di: Chen, Mingda, et al.
Pubblicazione: (2023)
di: Chen, Mingda, et al.
Pubblicazione: (2023)
Olmix: A Framework for Data Mixing Throughout LM Development
di: Chen, Mayee F., et al.
Pubblicazione: (2026)
di: Chen, Mayee F., et al.
Pubblicazione: (2026)
Experimental Contexts Can Facilitate Robust Semantic Property Inference in Language Models, but Inconsistently
di: Misra, Kanishka, et al.
Pubblicazione: (2024)
di: Misra, Kanishka, et al.
Pubblicazione: (2024)
When Hindsight is Not 20/20: Testing Limits on Reflective Thinking in Large Language Models
di: Li, Yanhong, et al.
Pubblicazione: (2024)
di: Li, Yanhong, et al.
Pubblicazione: (2024)
AI-Powered Autonomous Weapons Risk Geopolitical Instability and Threaten AI Research
di: Simmons-Edler, Riley, et al.
Pubblicazione: (2024)
di: Simmons-Edler, Riley, et al.
Pubblicazione: (2024)
To Err is AI : A Case Study Informing LLM Flaw Reporting Practices
di: McGregor, Sean, et al.
Pubblicazione: (2024)
di: McGregor, Sean, et al.
Pubblicazione: (2024)
Detecting Pretraining Data from Large Language Models
di: Shi, Weijia, et al.
Pubblicazione: (2023)
di: Shi, Weijia, et al.
Pubblicazione: (2023)
A useful representation of TESS light curves
di: Poznanski, Dovi
Pubblicazione: (2026)
di: Poznanski, Dovi
Pubblicazione: (2026)
Improving Factuality with Explicit Working Memory
di: Chen, Mingda, et al.
Pubblicazione: (2024)
di: Chen, Mingda, et al.
Pubblicazione: (2024)
Husky: A Unified, Open-Source Language Agent for Multi-Step Reasoning
di: Kim, Joongwon, et al.
Pubblicazione: (2024)
di: Kim, Joongwon, et al.
Pubblicazione: (2024)
Documenti analoghi
-
EMO: Pretraining Mixture of Experts for Emergent Modularity
di: Wang, Ryan, et al.
Pubblicazione: (2026) -
Infini-gram: Scaling Unbounded n-gram Language Models to a Trillion Tokens
di: Liu, Jiacheng, et al.
Pubblicazione: (2024) -
OLMoE: Open Mixture-of-Experts Language Models
di: Muennighoff, Niklas, et al.
Pubblicazione: (2024) -
Olmo 3
di: Olmo, Team, et al.
Pubblicazione: (2025) -
Reliable, Adaptable, and Attributable Language Models with Retrieval
di: Asai, Akari, et al.
Pubblicazione: (2024)