Goldfish: Monolingual Language Models for 350 Languages
Fuente:
arXiv
Guardado en:
| Autores principales: | Chang, Tyler A., Arnett, Catherine, Tu, Zhuowen, Bergen, Benjamin K. |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Characterizing Learning Curves During Language Model Pre-Training: Learning, Forgetting, and Stability
por: Chang, Tyler A., et al.
Publicado: (2023)
por: Chang, Tyler A., et al.
Publicado: (2023)
A Bit of a Problem: Measurement Disparities in Dataset Sizes Across Languages
por: Arnett, Catherine, et al.
Publicado: (2024)
por: Arnett, Catherine, et al.
Publicado: (2024)
On the Acquisition of Shared Grammatical Representations in Bilingual Language Models
por: Arnett, Catherine, et al.
Publicado: (2025)
por: Arnett, Catherine, et al.
Publicado: (2025)
Revenge of the Fallen? Recurrent Models Match Transformers at Predicting Human Language Comprehension Metrics
por: Michaelov, James A., et al.
Publicado: (2024)
por: Michaelov, James A., et al.
Publicado: (2024)
Explaining and Mitigating Crosslingual Tokenizer Inequities
por: Arnett, Catherine, et al.
Publicado: (2025)
por: Arnett, Catherine, et al.
Publicado: (2025)
Why do language models perform worse for morphologically complex languages?
por: Arnett, Catherine, et al.
Publicado: (2024)
por: Arnett, Catherine, et al.
Publicado: (2024)
Bigram Subnetworks: Mapping to Next Tokens in Transformer Language Models
por: Chang, Tyler A., et al.
Publicado: (2025)
por: Chang, Tyler A., et al.
Publicado: (2025)
How Open Must Language Models be to Enable Reliable Scientific Inference?
por: Michaelov, James A., et al.
Publicado: (2026)
por: Michaelov, James A., et al.
Publicado: (2026)
Large Language Models Pass the Turing Test
por: Jones, Cameron R., et al.
Publicado: (2025)
por: Jones, Cameron R., et al.
Publicado: (2025)
Do Large Language Models Exhibit Spontaneous Rational Deception?
por: Taylor, Samuel M., et al.
Publicado: (2025)
por: Taylor, Samuel M., et al.
Publicado: (2025)
Different Tokenization Schemes Lead to Comparable Performance in Spanish Number Agreement
por: Arnett, Catherine, et al.
Publicado: (2024)
por: Arnett, Catherine, et al.
Publicado: (2024)
Language Model Behavioral Phases are Consistent Across Architecture, Training Data, and Scale
por: Michaelov, James A., et al.
Publicado: (2025)
por: Michaelov, James A., et al.
Publicado: (2025)
Evaluating Morphological Alignment of Tokenizers in 70 Languages
por: Arnett, Catherine, et al.
Publicado: (2025)
por: Arnett, Catherine, et al.
Publicado: (2025)
From Monolingual to Bilingual: Investigating Language Conditioning in Large Language Models for Psycholinguistic Tasks
por: Yuan, Shuzhou, et al.
Publicado: (2025)
por: Yuan, Shuzhou, et al.
Publicado: (2025)
Lies, Damned Lies, and Distributional Language Statistics: Persuasion and Deception with Large Language Models
por: Jones, Cameron R., et al.
Publicado: (2024)
por: Jones, Cameron R., et al.
Publicado: (2024)
Introducing cosmosGPT: Monolingual Training for Turkish Language Models
por: Kesgin, H. Toprak, et al.
Publicado: (2024)
por: Kesgin, H. Toprak, et al.
Publicado: (2024)
Towards Better Monolingual Japanese Retrievers with Multi-Vector Models
por: Clavié, Benjamin
Publicado: (2023)
por: Clavié, Benjamin
Publicado: (2023)
UrduLM: A Resource-Efficient Monolingual Urdu Language Model
por: Ali, Syed Muhammad, et al.
Publicado: (2026)
por: Ali, Syed Muhammad, et al.
Publicado: (2026)
Disaggregation Reveals Hidden Training Dynamics: The Case of Agreement Attraction
por: Michaelov, James A., et al.
Publicado: (2025)
por: Michaelov, James A., et al.
Publicado: (2025)
BPE Stays on SCRIPT: Structured Encoding for Robust Multilingual Pretokenization
por: Land, Sander, et al.
Publicado: (2025)
por: Land, Sander, et al.
Publicado: (2025)
Paramanu: Compact and Competitive Monolingual Language Models for Low-Resource Morphologically Rich Indian Languages
por: Niyogi, Mitodru, et al.
Publicado: (2024)
por: Niyogi, Mitodru, et al.
Publicado: (2024)
Comparing Explanation Faithfulness between Multilingual and Monolingual Fine-tuned Language Models
por: Zhao, Zhixue, et al.
Publicado: (2024)
por: Zhao, Zhixue, et al.
Publicado: (2024)
Monolingual and Multilingual Misinformation Detection for Low-Resource Languages: A Comprehensive Survey
por: Wang, Xinyu, et al.
Publicado: (2024)
por: Wang, Xinyu, et al.
Publicado: (2024)
Emergent inabilities? Inverse scaling over the course of pretraining
por: Michaelov, James A., et al.
Publicado: (2023)
por: Michaelov, James A., et al.
Publicado: (2023)
Not quite Sherlock Holmes: Language model predictions do not reliably differentiate impossible from improbable events
por: Michaelov, James A., et al.
Publicado: (2025)
por: Michaelov, James A., et al.
Publicado: (2025)
Exploring Linguistic Properties of Monolingual BERTs with Typological Classification among Languages
por: Ruzzetti, Elena Sofia, et al.
Publicado: (2023)
por: Ruzzetti, Elena Sofia, et al.
Publicado: (2023)
LangFIR: Discovering Sparse Language-Specific Features from Monolingual Data for Language Steering
por: Wong, Sing Hieng, et al.
Publicado: (2026)
por: Wong, Sing Hieng, et al.
Publicado: (2026)
Beyond Monolingual Assumptions: A Survey of Code-Switched NLP in the Era of Large Language Models across Modalities
por: Sheth, Rajvee, et al.
Publicado: (2025)
por: Sheth, Rajvee, et al.
Publicado: (2025)
Evaluating Monolingual and Multilingual Large Language Models for Greek Question Answering: The DemosQA Benchmark
por: Mastrokostas, Charalampos, et al.
Publicado: (2026)
por: Mastrokostas, Charalampos, et al.
Publicado: (2026)
Bilingual Adaptation of Monolingual Foundation Models
por: Gosal, Gurpreet, et al.
Publicado: (2024)
por: Gosal, Gurpreet, et al.
Publicado: (2024)
Yankari: A Monolingual Yoruba Dataset
por: Akpobi, Maro
Publicado: (2024)
por: Akpobi, Maro
Publicado: (2024)
Scalable Influence and Fact Tracing for Large Language Model Pretraining
por: Chang, Tyler A., et al.
Publicado: (2024)
por: Chang, Tyler A., et al.
Publicado: (2024)
EVOKE: Emotion Vocabulary Of Korean and English
por: Jung, Yoonwon, et al.
Publicado: (2026)
por: Jung, Yoonwon, et al.
Publicado: (2026)
FOCUS: Effective Embedding Initialization for Monolingual Specialization of Multilingual Models
por: Dobler, Konstantin, et al.
Publicado: (2023)
por: Dobler, Konstantin, et al.
Publicado: (2023)
Does GPT-4 pass the Turing test?
por: Jones, Cameron R., et al.
Publicado: (2023)
por: Jones, Cameron R., et al.
Publicado: (2023)
Enhancing Code-switched Text-to-Speech Synthesis Capability in Large Language Models with only Monolingual Corpora
por: Xu, Jing, et al.
Publicado: (2024)
por: Xu, Jing, et al.
Publicado: (2024)
Be like a Goldfish, Don't Memorize! Mitigating Memorization in Generative LLMs
por: Hans, Abhimanyu, et al.
Publicado: (2024)
por: Hans, Abhimanyu, et al.
Publicado: (2024)
Weight Tying Biases Token Embeddings Towards the Output Space
por: Lopardo, Antonio, et al.
Publicado: (2026)
por: Lopardo, Antonio, et al.
Publicado: (2026)
Evaluating Cross-Lingual Unlearning in Multilingual Language Models
por: Lizzo, Tyler, et al.
Publicado: (2026)
por: Lizzo, Tyler, et al.
Publicado: (2026)
Musketeer: Joint Training for Multi-task Vision Language Model with Task Explanation Prompts
por: Zhang, Zhaoyang, et al.
Publicado: (2023)
por: Zhang, Zhaoyang, et al.
Publicado: (2023)
Ejemplares similares
-
Characterizing Learning Curves During Language Model Pre-Training: Learning, Forgetting, and Stability
por: Chang, Tyler A., et al.
Publicado: (2023) -
A Bit of a Problem: Measurement Disparities in Dataset Sizes Across Languages
por: Arnett, Catherine, et al.
Publicado: (2024) -
On the Acquisition of Shared Grammatical Representations in Bilingual Language Models
por: Arnett, Catherine, et al.
Publicado: (2025) -
Revenge of the Fallen? Recurrent Models Match Transformers at Predicting Human Language Comprehension Metrics
por: Michaelov, James A., et al.
Publicado: (2024) -
Explaining and Mitigating Crosslingual Tokenizer Inequities
por: Arnett, Catherine, et al.
Publicado: (2025)