Treasure Hunt: Real-time Targeting of the Long Tail using Training-Time Markers
Fuente:
arXiv
Salvato in:
| Autori principali: | D'souza, Daniel, Kreutzer, Julia, Morisot, Adrien, Üstün, Ahmet, Hooker, Sara |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
When Life Gives You Samples: The Benefits of Scaling up Inference Compute for Multilingual LLMs
di: Khairi, Ammar, et al.
Pubblicazione: (2025)
di: Khairi, Ammar, et al.
Pubblicazione: (2025)
RLHF Can Speak Many Languages: Unlocking Multilingual Preference Optimization for LLMs
di: Dang, John, et al.
Pubblicazione: (2024)
di: Dang, John, et al.
Pubblicazione: (2024)
Making, not Taking, the Best of N
di: Khairi, Ammar, et al.
Pubblicazione: (2025)
di: Khairi, Ammar, et al.
Pubblicazione: (2025)
Nexus: Specialization meets Adaptability for Efficiently Training Mixture of Experts
di: Gritsch, Nikolas, et al.
Pubblicazione: (2024)
di: Gritsch, Nikolas, et al.
Pubblicazione: (2024)
To Code, or Not To Code? Exploring Impact of Code in Pre-training
di: Aryabumi, Viraat, et al.
Pubblicazione: (2024)
di: Aryabumi, Viraat, et al.
Pubblicazione: (2024)
Multilingual Arbitrage: Optimizing Data Pools to Accelerate Multilingual Progress
di: Odumakinde, Ayomide, et al.
Pubblicazione: (2024)
di: Odumakinde, Ayomide, et al.
Pubblicazione: (2024)
LLM See, LLM Do: Guiding Data Generation to Target Non-Differentiable Objectives
di: Shimabucoro, Luísa, et al.
Pubblicazione: (2024)
di: Shimabucoro, Luísa, et al.
Pubblicazione: (2024)
How Does Quantization Affect Multilingual LLMs?
di: Marchisio, Kelly, et al.
Pubblicazione: (2024)
di: Marchisio, Kelly, et al.
Pubblicazione: (2024)
Aya Model: An Instruction Finetuned Open-Access Multilingual Language Model
di: Üstün, Ahmet, et al.
Pubblicazione: (2024)
di: Üstün, Ahmet, et al.
Pubblicazione: (2024)
Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs
di: Ahmadian, Arash, et al.
Pubblicazione: (2024)
di: Ahmadian, Arash, et al.
Pubblicazione: (2024)
The Disparate Impacts of Speculative Decoding
di: Sandler, Jameson, et al.
Pubblicazione: (2025)
di: Sandler, Jameson, et al.
Pubblicazione: (2025)
The Multilingual Alignment Prism: Aligning Global and Local Preferences to Reduce Harm
di: Aakanksha, et al.
Pubblicazione: (2024)
di: Aakanksha, et al.
Pubblicazione: (2024)
Synthetic Tabular Data Generation for Imbalanced Classification: The Surprising Effectiveness of an Overlap Class
di: D'souza, Annie, et al.
Pubblicazione: (2024)
di: D'souza, Annie, et al.
Pubblicazione: (2024)
Critical Learning Periods: Leveraging Early Training Dynamics for Efficient Data Pruning
di: Chimoto, Everlyn Asiko, et al.
Pubblicazione: (2024)
di: Chimoto, Everlyn Asiko, et al.
Pubblicazione: (2024)
On the Limitations of Compute Thresholds as a Governance Strategy
di: Hooker, Sara
Pubblicazione: (2024)
di: Hooker, Sara
Pubblicazione: (2024)
Agents Explore but Agents Ignore: LLMs Lack Environmental Curiosity
di: Engländer, Leon, et al.
Pubblicazione: (2026)
di: Engländer, Leon, et al.
Pubblicazione: (2026)
Tiny Aya: Bridging Scale and Multilingual Depth
di: Salamanca, Alejandro R., et al.
Pubblicazione: (2026)
di: Salamanca, Alejandro R., et al.
Pubblicazione: (2026)
The Art of Asking: Multilingual Prompt Optimization for Synthetic Data
di: Mora, David, et al.
Pubblicazione: (2025)
di: Mora, David, et al.
Pubblicazione: (2025)
The Leaderboard Illusion
di: Singh, Shivalika, et al.
Pubblicazione: (2025)
di: Singh, Shivalika, et al.
Pubblicazione: (2025)
A Post-trainer's Guide to Multilingual Training Data: Uncovering Cross-lingual Transfer Dynamics
di: Shimabucoro, Luisa, et al.
Pubblicazione: (2025)
di: Shimabucoro, Luisa, et al.
Pubblicazione: (2025)
MURI: High-Quality Instruction Tuning Datasets for Low-Resource Languages via Reverse Instructions
di: Köksal, Abdullatif, et al.
Pubblicazione: (2024)
di: Köksal, Abdullatif, et al.
Pubblicazione: (2024)
Preserving Long-Tailed Expert Information in Mixture-of-Experts Tuning
di: He, Haoze, et al.
Pubblicazione: (2026)
di: He, Haoze, et al.
Pubblicazione: (2026)
Node-private community estimation in stochastic block models: Tractable algorithms and lower bounds
di: Marchis, Laurentiu, et al.
Pubblicazione: (2026)
di: Marchis, Laurentiu, et al.
Pubblicazione: (2026)
Impacts of Racial Bias in Historical Training Data for News AI
di: Bhargava, Rahul, et al.
Pubblicazione: (2025)
di: Bhargava, Rahul, et al.
Pubblicazione: (2025)
One Tokenizer To Rule Them All: Emergent Language Plasticity via Multilingual Tokenizers
di: Abagyan, Diana, et al.
Pubblicazione: (2025)
di: Abagyan, Diana, et al.
Pubblicazione: (2025)
Mix Data or Merge Models? Optimizing for Diverse Multi-Task Learning
di: Aakanksha, et al.
Pubblicazione: (2024)
di: Aakanksha, et al.
Pubblicazione: (2024)
The Multilingual Divide and Its Impact on Global AI Safety
di: Peppin, Aidan, et al.
Pubblicazione: (2025)
di: Peppin, Aidan, et al.
Pubblicazione: (2025)
Turning Trash into Treasure: Accelerating Inference of Large Language Models with Token Recycling
di: Luo, Xianzhen, et al.
Pubblicazione: (2024)
di: Luo, Xianzhen, et al.
Pubblicazione: (2024)
Real-Time Detection of Hallucinated Entities in Long-Form Generation
di: Obeso, Oscar, et al.
Pubblicazione: (2025)
di: Obeso, Oscar, et al.
Pubblicazione: (2025)
Exploring Contrastive Learning for Long-Tailed Multi-Label Text Classification
di: Audibert, Alexandre, et al.
Pubblicazione: (2024)
di: Audibert, Alexandre, et al.
Pubblicazione: (2024)
What Makes CLIP More Robust to Long-Tailed Pre-Training Data? A Controlled Study for Transferable Insights
di: Wen, Xin, et al.
Pubblicazione: (2024)
di: Wen, Xin, et al.
Pubblicazione: (2024)
Let's (not) just put things in Context: Test-Time Training for Long-Context LLMs
di: Bansal, Rachit, et al.
Pubblicazione: (2025)
di: Bansal, Rachit, et al.
Pubblicazione: (2025)
Novel Pathogenic Variant in Exon 31 of the TSC2 Gene Associated With a Severe Phenotype of Tuberous Sclerosis
di: Tabitha D'souza, et al.
Pubblicazione: (2025)
di: Tabitha D'souza, et al.
Pubblicazione: (2025)
Concept Bottleneck Large Language Models
di: Sun, Chung-En, et al.
Pubblicazione: (2024)
di: Sun, Chung-En, et al.
Pubblicazione: (2024)
Crosslingual Reasoning through Test-Time Scaling
di: Yong, Zheng-Xin, et al.
Pubblicazione: (2025)
di: Yong, Zheng-Xin, et al.
Pubblicazione: (2025)
A Tale of Tails: Model Collapse as a Change of Scaling Laws
di: Dohmatob, Elvis, et al.
Pubblicazione: (2024)
di: Dohmatob, Elvis, et al.
Pubblicazione: (2024)
Training Bilingual LMs with Data Constraints in the Targeted Language
di: Seto, Skyler, et al.
Pubblicazione: (2024)
di: Seto, Skyler, et al.
Pubblicazione: (2024)
Enhancing Rare Codes via Probability-Biased Directed Graph Attention for Long-Tail ICD Coding
di: Chen, Tianlei, et al.
Pubblicazione: (2025)
di: Chen, Tianlei, et al.
Pubblicazione: (2025)
How to Train Long-Context Language Models (Effectively)
di: Gao, Tianyu, et al.
Pubblicazione: (2024)
di: Gao, Tianyu, et al.
Pubblicazione: (2024)
Modeling Real-Time Interactive Conversations as Timed Diarized Transcripts
di: Tanzer, Garrett, et al.
Pubblicazione: (2024)
di: Tanzer, Garrett, et al.
Pubblicazione: (2024)
Documenti analoghi
-
When Life Gives You Samples: The Benefits of Scaling up Inference Compute for Multilingual LLMs
di: Khairi, Ammar, et al.
Pubblicazione: (2025) -
RLHF Can Speak Many Languages: Unlocking Multilingual Preference Optimization for LLMs
di: Dang, John, et al.
Pubblicazione: (2024) -
Making, not Taking, the Best of N
di: Khairi, Ammar, et al.
Pubblicazione: (2025) -
Nexus: Specialization meets Adaptability for Efficiently Training Mixture of Experts
di: Gritsch, Nikolas, et al.
Pubblicazione: (2024) -
To Code, or Not To Code? Exploring Impact of Code in Pre-training
di: Aryabumi, Viraat, et al.
Pubblicazione: (2024)